編輯|Panda
理論物理中一項保持了三年嘅計算紀錄,被 AI 刷新咗。
幾個鐘前,Anthropic 宣布:Claude 喺科研平台 Claude Science 中基本上無人監督咁連續運行幾日,計出咗平面 N=4 超對稱楊-米爾斯理論(planar N=4 super-Yang-Mills)中嘅九圈六粒子散射振幅。
呢個係理論物理「散射振幅」領域公認嘅前沿難題,此前喺該模型中嘅最高紀錄停留喺八圈,由 SLAC 國家加速器實驗室嘅 Lance Dixon 與合作者於 2023 年創下。
呢次突破由八圈紀錄嘅創造者親自把關。Dixon 獨立驗證咗 Claude 嘅結果,並評價稱,一個大語言模型能夠執行完呢套複雜配方中嘅每一步、並將算力組織起來,喺佢睇嚟「係一場相當了不起嘅勝利」。佢甚至直言,除咗佢嘅合作者之外,Claude 比任何人都更懂佢哋團隊 2019 年和 2023 年嘅嗰兩篇論文。
更令人意外嘅係過程同成本。研究者交給 Claude 嘅只有一句任務描述,此後嘅「指導」幾乎只剩下「繼續」;整個計算折合到普通用戶身上約一兩千美元,其中真正用於數值計算嘅部分只有約 100 美元,相當於 96 個 CPU 跑一週。而 Dixon 原本認為,直接計算九圈振幅太難,佢嘅團隊為此已經籌備咗好幾年。
呢項突破嘅起點,係一封公開嘅「戰書」。
8 月 7 日,前理論物理學家、科普博主 Matt von Hippel 喺自己嘅博客 4gravitons 上發咗一篇帶點挑釁意味嘅文章,標題叫「只有 AI 進入我嘅領域才算數」。佢喺文中點名向 AI 公司下戰書:用一名學者能負擔得起嘅算力,去解決散射振幅領域嘅一個懸而未決嘅大問題。
佢給出咗兩個選項:要麼將 N=8 超引力算到七圈,要麼將 N=4 超對稱楊-米爾斯理論嘅六粒子振幅算到九圈。
一個月後,AI 完成調整。Anthropic 剛剛刊出嘅,正係 von Hippel 本人撰寫嘅客座文章,標題就係:「是的,Claude 能算九圈」。
https://www.anthropic.com/research/yes-claude-can-do-nine-loops
九圈,難喺邊?
要理解呢件事嘅分量,得先講清楚物理學家喺計緊乜。
粒子物理學家預測粒子行為,靠嘅係一類叫「散射振幅」嘅公式:給定參與碰撞嘅粒子嘅能量同動量,散射振幅能告訴你佢哋以某種方式發生反應嘅概率。
預測計得越精確,就越能同大型強子對撞機(LHC)呢類實驗嘅結果做細緻比對。一旦出現偏差,就可能係新物理嘅線索,比如暗物質嘅本質,或者宇宙中物質與反物質為何不對稱。
問題在於,散射振幅極難精確計算,物理學家幾乎只能做近似。佢哋將計算按「圈」(loop)來分層,圈數大致衡量咗粒子之間嘅相互作用被允許複雜到乜嘢程度。每多加一圈,答案就更接近真實值,但計算量亦隨之急劇膨脹。von Hippel 喺挑戰原文中寫道,呢類計算嘅複雜度通常隨圈數呈指數級甚至階乘級增長。
所以現實中,絕大多數散射振幅只算到兩圈,少數能到三圈。粒子物理中最精確嘅嗰個預測,電子反常磁矩,用到咗五圈。
N=4 超對稱楊-米爾斯理論則係呢個領域專門嘅玩具模型。「楊-米爾斯」係描述電磁力、強核力、弱核力呢三種基本相互作用嘅理論框架;「N=4 超對稱」則意味住每個粒子都配有四個超對稱夥伴。粒子多到唔現實,呢個理論並不描述真實世界。但恰恰係呢種高度對稱,讓好多變量組合相互抵消,計算反而變得相對可控。研究者喺呢度打磨新方法,睇佢哋能走幾遠。
呢次用到嘅方法叫「自舉」(bootstrap)。von Hippel 將佢比作數獨:先寫出答案可能嘅全部形式,用一套專門嘅「字母表」記喺計算機文件裡,然後拿所有已知約束去逐一排除,包括其他方法給出嘅預測、答案必須遵守嘅規則、以及相關問題中已知嘅結果。理想情況下,最後只剩一個候選能通過所有檢查,而且仲有富餘嘅檢查條件用來確認冇計錯。
八圈嘅紀錄,Dixon 係繞住走拿到嘅。2023 年,佢同 Yu-Ting Liu 借助一種被稱為「對蹠對偶」(antipodal duality)嘅奇特對稱性,先算出相對更容易嘅「形狀因子」(form factor),再由此換算出八圈振幅。此後幾年,佢嘅團隊一直盯住九圈,計劃沿用同樣嘅間接路線。喺佢睇嚟,直接去算九圈振幅太難了。
值得一提的是,von Hippel 本人正是這條研究路線的老兵。他曾與 Dixon 等人合作,把六粒子振幅推進到六圈和七圈。換句話說,他挑的是自己親手啃過的骨頭。
一句 prompt,然後不斷「繼續」
8 月底,Anthropic 的兩位物理學家 Liam Fitzpatrick 和 Siddharth Mishra-Sharma 聯繫上了 von Hippel,告訴他挑戰已經被攻克。
他們使用的是Fable 5.1模型,運行在 Claude Science 平台上。von Hippel 在文中解釋,Claude Science 是一種「harness」,即在大模型外面套上結構化規則和提示,讓它在科研任務中表現得更穩健。
據文章描述,兩人先問 Claude 哪一個挑戰它最有把握,然後只給了一句非常簡短的任務描述:計算平面 N=4 SYM 中九圈的六粒子(六邊形)振幅。
此後的「科研指導」基本就是讓它接著幹。文中披露的一條典型指令大意是:我要去睡覺了,接下來幾個小時不在,繼續做,直到我叫停為止,每四到六小時匯報一次進度。
最終,Claude 用兩種方式各算了一遍:一是直接的自舉法,二是 Dixon 團隊那條經由形狀因子的間接路線。據文章介紹,任選其一,終端用戶的花費大約都在一兩千美元,大頭是長時間運行模型本身的費用。其中自舉計算部分用 Python 和符號計算庫 SymPy 完成,只佔約 100 美元,相當於 96 個 CPU 跑一週。
von Hippel 感慨,十年前他做這類研究時,96 個 CPU 跑一週算是不小的投入,如今只要理由充分,這點資源相當平價。
驗證者的感受:像一個塌掉的舒芙蕾
文章末尾附有 Dixon 親自撰寫的一段附言,題目就叫「被機器搶先是什麼感覺」。
他寫道,9 月 1 日,Anthropic 的兩位研究者告訴他 Claude 算出了九圈振幅,並請他驗證結果。對他而言,那一刻是大語言模型改變物理學這件事「真正落到自己身上」的時刻。
讓 Dixon 印象深刻的,與其說是計算規模,不如說是整套流程的脆弱性。按他的描述,這套計算配方只要有任何一處出錯,整個結果就會像失敗的舒芙蕾一樣塌掉,研究者只能回頭苦苦排查。而且其中大量構造細節繁瑣到不會被完整寫進論文,這意味著 Claude 必須從零開始把所有代碼搭建起來。
由於從九圈振幅倒推九圈形狀因子相對容易,Dixon 主要是沿這條路做的驗證。這也帶來一個略顯微妙的局面:他花了兩週驗證的,正是自己團隊已經追了好幾年的目標。
他坦言並不感到沮喪,理由有兩個。
他的團隊本來就在用定制的 Transformer 模型預測更高圈數的結果,還提出過一句口號,大意是只要機器給出候選答案,他們就有全套工具去驗證。
Claude 解題時用的正是 Dixon 與合作者多年來發展出的方法,連結果的呈現格式都沿用了他們既有的規範。在他看來,他在驗證 Claude 的同時,Claude 也在驗證他們過去所有的工作。這也是他那句「Claude 比任何人都更懂我們的論文」的由來。
不過在稱讚之餘,Dixon 也表示,在他看來,真正讓人輾轉反側的時刻,會出現在模型搶在人類之前提出新的物理原理和洞見的時候。
中國團隊幾乎同時抵達
這個故事還有一條平行線索,且與中國有關。
在 Anthropic 聯繫 von Hippel 之後沒幾天,中國科學院理論物理研究所的何頌(Song He)也找上門來:他的課題組已經拿到了九圈結果的大部分。9 月 17 日,何頌與 Jirong Jing、Xiang Li 在 Zenodo 上公開了一份數據集,題為《六膠子 MHV 振幅直至九圈的符號》,涵蓋二圈至九圈的符號(symbol)數據。
https://zenodo.org/records/22800071
據 von Hippel 和 Dixon 的描述,何頌團隊也借助了基於 GPT-6 的 AI 輔助,但只用於計算部分約束條件,整體框架仍由人來搭建,這與 Anthropic 那種「一句 prompt 加反覆繼續」的近幾乎全自動路線截然不同。
Dixon 在附言裡自嘲,兩週之內他先後被「一台機器」以及「人類加機器」搶了先。
von Hippel 特別提到,各方之間的氛圍相當友好。接下來,Dixon、何頌及其合作者會發表這些結果,並為後來的研究者做詳細解釋和分析。
挑戰者的復盤:低垂的果實比想像的多
回到 von Hippel 本人。他當初立下挑戰,是想借自己熟悉的領域回答這個問題:AI 到底能不能繞過那些人人都以為無法逾越的算力瓶頸?
他在挑戰原文裡的邏輯是這樣的:外界都在爭論 AI 能否產生真正的新想法,但想法有多難找,只有找到之後才知道;計算的難度則更「實在」。許多關於超級智能的末日設想,從模擬人類心智以操縱人心,到從第一性原理設計納米機器,批評者的標準反駁都是算力不夠。如果 AI 能用學術圈級別的資源解決一個被公認為算力受限的問題,那才真正值得擔心。
結果呢?von Hippel 的結論很坦誠:這次並沒有出現他期待的那種「以意想不到的方式突破算力壁壘」。
Claude 用的是已知方法,只是比人類此前願意投入的算力多了一些。它可能受益於用 Python 而不是物理學家慣用的 Maple 或 Mathematica,軟件工程實踐可能也比人類研究者更規範,但並沒有到「超級智能」的程度。何頌團隊幾乎同步抵達,也從側面說明這個目標對人類而言並非遙不可及。
他由此得出的最大體會是:哪怕目標簡單明確,專家眼中遙不可及的事情,實際上可能並沒有那麼難,低垂的果實比預想的多。 多年來一直有計算機背景的朋友對他說,振幅研究者只要多僱幾個程序員就能大幅推進,von Hippel 承認,這些人現在可以覺得自己說對了。
但他同樣強調了另一面。這類計算瑣碎而混亂,他自己如果用 96 個 CPU 跑一週,幾乎必然會因為第一次出錯而拖成兩週。Claude Science 卻在幾乎沒有科學監督的情況下一次跑通,沒有依賴任何外部合作者的輸入。他給仍然認為 AI 錯誤百出、不堪大用的人的建議是:這類工作,它現在已經能可靠地完成了。
他還做了一個縱向對比。今年 3 月,Anthropic 發布的「vibe physics」實驗裡,AI 做物理項目還像個學生,任務規模小,需要大量手把手指導,錯誤頻出。半年後,它完成的已是振幅領域頂尖專家才會去碰的前沿計算。他不排除這恰好是一個特別適合 AI 的問題,但他判斷,技術本身確實變強了。
至於能否推而廣之,von Hippel 保持謹慎。N=4 這類玩具模型通常只屬於很小的研究圈子,而面向真實世界的振幅計算競爭激烈得多,那裡的低垂果實可能更少。但他也提醒,做這些計算的研究者如果還沒試過讓 AI 科研平台一次性衝擊前沿計算,就該試試了,同時要準備好驗證結果的方案。他不會太意外,有人能在合理預算內再多擠出一圈。
寫在最後
把這件事放回 9 月的背景裡看,會更有意思。
就在本月 8 日,OpenAI 宣布其未公開模型調動上萬個 AI 智能體,給出了納維-斯托克斯方程存在性與光滑性問題的一個反例,也就是千禧年大獎難題之一,該結果目前仍在接受數學界審視。與那種動用海量算力的「大兵團作戰」相比,九圈振幅的故事顯得樸素得多:一個商用科研平台,一句任務描述,幾千美元,幾天時間。
也正因為樸素,它可能更值得學術界關注。von Hippel 最終坦承,他原本希望藉這次挑戰一窺未來,看到某種前所未見的計算新方法,從而在超級智能的爭論中獲得有依據的判斷。但他得到的答案是,自己此前對極限在哪裡的認識過於天真了。
而 Dixon 留下的那個問題仍然懸著:當大模型不再只是執行人類寫好的配方,而是開始先於人類提出新的物理原理時,物理學家又該如何自處?
© THE END
本文來自微信公眾號「機器之心」(ID:almosthuman2014),作者:機器之心












