Shetland Geology
首页 > 科技 > 正文

Claude取得理论物理突破,只用了一句话+几千美元

更新于 2026-09-26 23:13

编辑|Panda

理论物理中一项保持了三年的计算纪录,被 AI 刷新了。

几个小时前,Anthropic 宣布:Claude 在科研平台 。

这是理论物理「散射振幅」领域公认的前沿难题,此前在该模型中的最高纪录停留在八圈,由 SLAC 国家加速器实验室的 与合作者于 2023 年创下。

这次突破由八圈纪录的创造者亲自把关。Dixon 独立验证了 Claude 的结果,并评价称,一个大语言模型能执行完这套复杂配方中的每一步、并把算力组织起来,在他看来「是一场相当了不起的胜利」。他甚至直言,除了他的合作者之外,Claude 比任何人都更懂他们团队 2019 年和 2023 年的那两篇论文。

更令人意外的是过程和成本。研究者交给 Claude 的只有一句任务描述,此后的「指导」几乎只剩下「继续」;整个计算折合到普通用户身上约一两千美元,其中真正用于数值计算的部分只有约 100 美元,相当于 96 个 CPU 跑一周。而 Dixon 原本认为,直接计算九圈振幅太难,他的团队为此已经筹备了好几年。

这项突破的起点,是一封公开的「战书」。

8 月 7 日,前理论物理学家、科普博主 在自己的博客 4gravitons 上发了一篇带点挑衅意味的文章,标题叫「只有 AI 进入我的领域才算数」。他在文中点名向 AI 公司下战书:用一名学者能负担得起的算力,去解决散射振幅领域的一个悬而未决的大问题。

https://4gravitons.com/2026/08/07/it-only-counts-when-ai-gets-to-my-field/

他给出了两个选项:要么把 N=8 超引力算到七圈,要么把 N=4 超对称杨-米尔斯理论的六粒子振幅算到九圈。

一个月后,AI 完成调整。Anthropic 刚刚刊出的,正是 von Hippel 本人撰写的客座文章,标题就是:「是的,Claude 能算九圈」。

https://www.anthropic.com/research/yes-claude-can-do-nine-loops

九圈,难在哪里?

要理解这件事的分量,得先说清楚物理学家在算什么。

粒子物理学家预测粒子行为,靠的是一类叫「散射振幅」的公式:给定参与碰撞的粒子的能量和动量,散射振幅能告诉你它们以某种方式发生反应的概率。

预测算得越精确,就越能和大型强子对撞机(LHC)这类实验的结果做细致比对。一旦出现偏差,就可能是新物理的线索,比如暗物质的本质,或者宇宙中物质与反物质为何不对称。

问题在于,散射振幅极难精确计算,物理学家几乎只能做近似。他们把计算按「圈」(loop)来分层,圈数大致衡量了粒子之间的相互作用被允许复杂到什么程度。每多加一圈,答案就更接近真实值,但计算量也随之急剧膨胀。von Hippel 在挑战原文中写道,这类计算的复杂度通常随圈数呈指数级甚至阶乘级增长。

所以现实中,绝大多数散射振幅只算到两圈,少数能到三圈。粒子物理中最精确的那个预测,电子反常磁矩,用到了五圈。

N=4 超对称杨-米尔斯理论则是这个领域专门的玩具模型。「杨-米尔斯」是描述电磁力、强核力、弱核力这三种基本相互作用的理论框架;「N=4 超对称」则意味着每个粒子都配有四个超对称伙伴。粒子多到不现实,这个理论并不描述真实世界。但恰恰是这种高度对称,让许多变量组合相互抵消,计算反而变得相对可控。研究者在这里打磨新方法,看它们能走多远。

值得一提的是,von Hippel 本人正是这一研究路线的老兵。他曾与 Dixon 等人合作,把六粒子振幅推进到六圈和七圈。换句话说,他挑的是自己亲手啃过的骨头。

一句 prompt,然后不断「继续」

8 月底,Anthropic 的两位物理学家 Liam Fitzpatrick 和 Siddharth Mishra-Sharma 联系上了 von Hippel,告诉他挑战已经被攻克。

他们使用的是 模型,运行在 Claude Science 平台上。von Hippel 在文中解释,Claude Science 是一种「harness」,即在大模型外面套上结构化规则和提示,让它在科研任务中表现得更稳健。

据文章描述,两人先问 Claude 哪一个挑战它最有把握,然后只给了一句非常简短的任务描述:计算平面 N=4 SYM 中九圈的六粒子(六边形)振幅。

此后的「科研指导」基本就是让它接着干。文中披露的一条典型指令大意是:我要去睡觉了,接下来几个小时不在,继续做,直到我叫停为止,每四到六小时汇报一次进度。

最终,Claude 用两种方式各算了一遍:一是直接的自举法,二是 Dixon 团队那条经由形状因子的间接路线。据文章介绍,任选其一,终端用户的花费大约都在一两千美元,大头是长时间运行模型本身的费用。其中自举计算部分用 Python 和符号计算库 完成,只占约 100 美元,相当于 96 个 CPU 跑一周。

von Hippel 感慨,十年前他做这类研究时,96 个 CPU 跑一周算是不小的投入,如今只要理由充分,这点资源相当平价。

验证者的感受:像一个塌掉的舒芙蕾

文章末尾附有 Dixon 亲自撰写的一段附言,题目就叫「被机器抢先是什么感觉」。

他写道,9 月 1 日,Anthropic 的两位研究者告诉他 Claude 算出了九圈振幅,并请他验证结果。对他而言,那一刻是大语言模型改变物理学这件事「真正落到自己身上」的时刻。

让 Dixon 印象深刻的,与其说是计算规模,不如说是整套流程的脆弱性。按他的描述,这套计算配方只要有任何一处出错,整个结果就会像失败的舒芙蕾一样塌掉,研究者只能回头苦苦排查。而且其中大量构造细节繁琐到不会被完整写进论文,这意味着 Claude 必须从零开始把所有代码搭建起来。

由于从九圈振幅倒推九圈形状因子相对容易,Dixon 主要是沿这条路做的验证。这也带来一个略显微妙的局面:他花了两周验证的,正是自己团队已经追了好几年的目标。

他坦言并不感到沮丧,理由有两个。

不过在称赞之余,Dixon 也表示,在他看来,真正让人辗转反侧的时刻,会出现在模型抢在人类之前提出新的物理原理和洞见的时候。

中国团队几乎同时抵达

这个故事还有一条平行线索,且与中国有关。

在 Anthropic 联系 von Hippel 之后没几天,中国科学院理论物理研究所的(Song He)也找上门来:他的课题组已经拿到了九圈结果的大部分。9 月 17 日,何颂与 Jirong Jing、Xiang Li 在 Zenodo 上公开了一份数据集,题为《六胶子 MHV 振幅直至九圈的符号》,涵盖二圈至九圈的符号(symbol)数据。

https://zenodo.org/records/22800071

据 von Hippel 和 Dixon 的描述,何颂团队也借助了基于 GPT-6 的 AI 辅助,但只用于计算部分约束条件,整体框架仍由人来搭建,这与 Anthropic 那种「一句 prompt 加反复继续」的近乎全自动路线截然不同。

Dixon 在附言里自嘲,两周之内他先后被「一台机器」以及「人类加机器」抢了先。

von Hippel 特别提到,各方之间的氛围相当友好。接下来,Dixon、何颂及其合作者会发表这些结果,并为后来的研究者做详细解释和分析。

挑战者的复盘:低垂的果实比想象的多

回到 von Hippel 本人。他当初立下挑战,是想借自己熟悉的领域回答这个问题:AI 到底能不能绕过那些人人都以为无法逾越的算力瓶颈?

他在挑战原文里的逻辑是这样的:外界都在争论 AI 能否产生真正的新想法,但想法有多难找,只有找到之后才知道;计算的难度则更「实在」。许多关于超级智能的末日设想,从模拟人类心智以操纵人心,到从第一性原理设计纳米机器,批评者的标准反驳都是算力不够。如果 AI 能用学术圈级别的资源解决一个被公认为算力受限的问题,那才真正值得担心。

结果呢?von Hippel 的结论很坦诚:这次并没有出现他期待的那种「以意想不到的方式突破算力壁垒」。

Claude 用的是已知方法,只是比人类此前愿意投入的算力多了一些。它可能受益于用 Python 而不是物理学家惯用的 Maple 或 Mathematica,软件工程实践可能也比人类研究者更规范,但并没有到「超级智能」的程度。何颂团队几乎同步抵达,也从侧面说明这个目标对人类而言并非遥不可及。

他由此得出的最大体会是:哪怕目标简单明确,专家眼中遥不可及的事情,实际上可能并没有那么难,低垂的果实比预想的多。 多年来一直有计算机背景的朋友对他说,振幅研究者只要多雇几个程序员就能大幅推进,von Hippel 承认,这些人现在可以觉得自己说对了。

但他同样强调了另一面。这类计算琐碎而混乱,他自己如果用 96 个 CPU 跑一周,几乎必然会因为第一次出错而拖成两周。Claude Science 却在几乎没有科学监督的情况下一次跑通,没有依赖任何外部合作者的输入。他给仍然认为 AI 错误百出、不堪大用的人的建议是:这类工作,它现在已经能可靠地完成了。

他还做了一个纵向对比。今年 3 月,Anthropic 发布的「vibe physics」实验里,AI 做物理项目还像个学生,任务规模小,需要大量手把手指导,错误频出。半年后,它完成的已是振幅领域顶尖专家才会去碰的前沿计算。他不排除这恰好是一个特别适合 AI 的问题,但他判断,技术本身确实变强了。

至于能否推而广之,von Hippel 保持谨慎。N=4 这类玩具模型通常只属于很小的研究圈子,而面向真实世界的振幅计算竞争激烈得多,那里的低垂果实可能更少。但他也提醒,做这些计算的研究者如果还没试过让 AI 科研平台一次性冲击前沿计算,就该试试了,同时要准备好验证结果的方案。他不会太意外,有人能在合理预算内再多挤出一圈。

写在最后

把这件事放回 9 月的背景里看,会更有意思。

就在本月 8 日,OpenAI 宣布其未公开模型调动上万个 AI 智能体,给出了纳维-斯托克斯方程存在性与光滑性问题的一个反例,也就是千禧年大奖难题之一,该结果目前仍在接受数学界审视。与那种动用海量算力的「大兵团作战」相比,九圈振幅的故事显得朴素得多:一个商用科研平台,一句任务描述,几千美元,几天时间。

也正因为朴素,它可能更值得学术界关注。von Hippel 最终坦承,他原本希望借这次挑战一窥未来,看到某种前所未见的计算新方法,从而在超级智能的争论中获得有依据的判断。但他得到的答案是,自己此前对极限在哪里的认识过于天真了。

而 Dixon 留下的那个问题仍然悬着:当大模型不再只是执行人类写好的配方,而是开始先于人类提出新的物理原理时,物理学家又该如何自处?