一条提示词破解五十年难题:大模型正在重写科研边界
理论物理圈近日流传一则重磅消息:Anthropic旗下Fable 5.1模型在几乎没有人类干预的情况下,自主求解了粒子物理领域公认的前沿难题——N=4超杨-米尔斯理论中九圈散射振幅的完整计算。验证者Lance Dixon是斯坦福大学教授,也是该领域此前世界纪录的保持者。他在仔细核查后确认:结果完全正确。这距离上一次人类团队创下八圈纪录,不过三年。而这次,人类只给模型发了一句初始提示词,然后就让AI自行运算、自己去睡觉了。整个过程的算力成本约100美元,加上API调用费用,总计一两千美元——这是普通大学研究生都能负担的数额。
从公开挑战到算力奇迹
这场突破的起点,是一个来自科普作家Matt von Hippel的公开挑战。他在博客中写道:如果AI公司真想证明自己在智力上超越人类,就别拿小学生的数学题刷榜,去解决粒子物理领域真正的前沿未解难题。他给出的具体目标,正是将N=4超杨-米尔斯理论的散射振幅算到第九圈。散射振幅是计算粒子相互作用概率的核心公式,而“圈数”代表计算的精确度——每增加一圈,计算量和复杂度呈指数级增长。现实中大部分物理计算只能停留在两到三圈,粒子物理领域最精密的预测用到了五圈,学术圈此前将玩具模型的极限定在八圈,由Dixon团队在2023年创下。九圈被普遍认为超出了普通学术团队的预算上限。
AI自主完成精密科研任务
Anthropic两位物理学家看到挑战后,立即行动。他们使用Claude Science科研平台,底层搭载Fable 5.1模型,输入的提示词仅有一句话:计算平面N=4 SYM在九圈下的六粒子振幅。随后人类研究员留下指令:我先睡了,几个小时内不在,请一直算下去,每4到6小时汇报一次进度。Claude从零写出了全部Python代码,调用SymPy库进行符号计算。它甚至用了两种完全不同的数学路径,独立完成了九圈求解。这两种路径相互印证,大幅提升了结果的可信度。整场运算消耗的算力成本约等于96核CPU运行一周,API费用则控制在一两千美元以内。完成后,团队将数据发送给Dixon,他花了整整两周验证,最终确认计算完全正确。
科研突破的成败,不在模型的参数规模里、不在算力的堆砌里,而在对人类知识与流程的深度理解里。
“行业观察”积墨 AI 智能体开发平台
快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。
验证者的震撼与反思
Dixon作为纪录保持者和验证者,对这次经历有着深刻洞察。他坦言,当Anthropic告知结果时,自己并未感到沮丧,原因有二:其一,团队早已具备验证机器候选结果的工具,这本就在计划之内;其二,Claude用来解题的方法全部来自Dixon团队多年积累的工作成果,计算甚至以他们设定的格式呈现。换言之,Claude在验证答案的同时,也在验证Dixon团队所有前期工作的正确性。Dixon评价道:Claude对2019年和2023年那两篇论文的理解,比任何人类读者都深,除了论文的共同作者。但他也指出,真正让人从灵魂深处感到震动的时刻还没到来——那将是大语言模型开始在人类之前提出新的物理原理和洞见。值得注意的是,就在Anthropic完成计算几天后,中国科学院何颂团队也独立算出了九圈振幅的symbol部分,使用GPT-6辅助部分约束条件,两个结果在两周内先后出现。Dixon笑称,他在两周内被机器和人机协作两方同时超越了。
科研计算的本质瓶颈被重新定义
回顾整个事件,Claude并没有发明全新的物理学定律,它使用的是人类已经写在论文里的方法。但它证明了:顶尖科学研究中的很大一部分计算天花板,并非人类以前认为的“算力不够”,而是人类自己写代码、排查错误、统筹复杂流程的效率不够高。以前需要顶级学者团队耗时数年、反复调试纠错的项目,现在一个大语言模型在没有人类实时指导的情况下,几天之内跑完了全部流程,而且一遍通过。这一成果给整个科学界提供了清晰的参考坐标:AI已经能够独立承担极度精密、长流程的真实科研任务。对于产业界而言,这也带来深刻启示——当AI在科研领域展现出如此精密的自动化能力时,企业知识管理、文档处理、代码开发等场景的智能化升级路径,其实已经非常清晰。关键在于如何设计有效的提示词、如何构建可靠的自动化流程、如何让人机协作真正发挥乘数效应。
AI用一条提示词破解了人类物理学家卡了多年的难题,这不仅是技术突破,更是对科研边界的重新定义。当计算的天花板从算力转向人类流程效率,每一个渴望借助AI实现突破的组织都需要思考:你的业务流程,是否也存在类似的“隐性瓶颈”?
