AI 找出數學反例推翻論文,作者親自確認,453 篇手稿曝光,AI 開始自己出題了

AI for Math多 Agent 系統數學研究自動化AI 猜想生成科研閉環人機協作
1 小時前來源: blockweeks.com
AI 找出數學反例推翻論文,作者親自確認,453 篇手稿曝光,AI 開始自己出題了

AI數學,正在越過一個很微妙的分界線。

過去我們問的是:大模型能不能做出一道難題?能不能寫出嚴謹證明?能不能找到人類幾十年沒發現的反例?

而現在,一個更像「科研本身」的問題冒了出來:當一條證明路線失敗之後,AI知不知道下一步該幹什麼?是繼續算,換路線,縮小命題,還是乾脆提出一個新的、可證偽的數學猜想?

思特雅大學的研究人員曾仔健搭建的AI Has Taste,正在試圖把這個問題做成一套可持續運行的研究系統。

項目公開倉庫目前記錄了453份數學研究手稿、2312頁內容,其中6篇被明確歸類為「AI-Proposed Conjectures」。

倉庫首頁給出的定位更直接:From Answer Generation to Research-Agenda Generation——從生成答案,走向生成研究議程。

數學研究

AI把論文裡的猜想推翻了,原作者回信確認

AI Has Taste並不是從「AI一定擅長數學」的信念出發。曾仔健回憶,項目最開始時,他對大模型能否真正推進數學研究並不確信。一次偶然的測試成為轉折點:他把一篇論文中的猜想直接交給AI,本來只是想看看模型究竟能走多遠。結果AI沒有順著論文繼續「證明」,而是構造出了一個反例,直接把這個猜想推翻。

他的第一反應不是興奮,而是不信。於是,他把反例和推導整理後寫信給原論文作者核實。隨後收到的回覆確認:這個反例成立。對應研究後來也被收錄進目前450餘份數學手稿中。

「最開始我还不相信AI在數學上的力量。直到輸入一篇論文的猜想,AI直接給出反例推翻;我立刻寫信問原作者,對方回覆確認是對的。那之後,我才真正放開手腳幹。」——曾仔健

數學研究

數學研究

這封郵件改變的不是一個猜想,而是項目的尺度。如果AI不僅能複述已知知識、生成看起來像證明的文本,還能主動攻擊論文中的新猜想,並找到一個經過原作者確認的反例,那麼它就有機會真正進入「研究循環」。此後,曾仔健才開始把選題、證明、反例搜索、失敗管理、獨立審查和寫作逐步Agent化,並讓不同機器長期並行推進。

真正的變化,不是「寫了多少篇」

單看數量,453份手稿已經足夠吸睛。但如果只把這個項目理解成「AI批量寫數學論文」,反而錯過了最值得注意的部分。

項目自己反覆強調:453是「research manuscripts」的數量,不等於453個原始開放問題全部被解決。產物包括完整證明、反例、局部結果、有限計算證書、結構化約化,以及提出新猜想的論文。AI內部審查也不等於外部同行評審。

真正的變化發生在研究鏈條上。傳統AI benchmark往往從「題目已經給定」開始:人類負責選題,AI負責求解,最後得到成功或失敗。AI Has Taste則把流程向前和向後都拉長——AI可以篩選候選問題、比較路線、主動找反例;一條路線失敗後,還可以分析失敗結構、修改命題,並把新的數學對象交給另一個獨立Agent繼續攻擊。

數學研究

AI Has Taste的關鍵不是「更多Prompt」,而是把失敗也變成下一輪研究輸入。

選題、證明、挑錯、寫作Agent

這套系統並不是「一個模型在一個對話框裡自問自答」。公開README把Agent角色拆成了四層:

Supervisor / Screener負責選擇候選、比較附近結果並找最便宜的決定性實驗;

Researcher負責證明、反例和精確計算;

Fresh-context Reviewer在新的上下文裡專門攻擊凍結後的命題、關鍵引理和證書;

Writer / Release Checker負責把最終接受的範圍寫清楚,並檢查引用、構建和發布材料。

曾仔健進一步把工作流部署成多機協作:不同機器可以分別推進證明、搜索反例、跑精確計算、做獨立審稿。共享的是凍結命題、實驗記錄、失敗原因、代碼和證據,而不是讓一個Agent一邊生成結果、一邊給自己蓋章。

數學研究

多Agent的核心設計:角色分離 + 共享證據 + fresh-context審查。

倉庫裡有一句話很能概括這種設計:Criticism is part of the engine, not an afterword。批評不是論文寫完之後才補的一道手續,而是研究發動機的一部分。

數學家、機器人學者和自動化學者進入驗證鏈

當研究手稿從幾十份增長到數百份,另一個問題隨之變得尖銳:誰來判斷這些Agent產物不是系統性幻覺?

AI Has Taste內部用fresh-context Reviewer把「研究」和「挑錯」拆開,但項目並沒有把AI自審當作終點。

隨著工作推進,曾仔健也開始邀請不同領域的真實學者參與部分結果的驗證、複核和學術討論。

據項目方介紹,參與部分工作的合作者與審核者包括:馬來西亞科學院院士、馬來亞大學數學科學研究所榮譽教授Ong Seng Huat;馬來西亞科學院院士、馬來亞大學數學科學研究所榮譽教授Kurunathan Ratnavelu;以及中國地質大學(武漢)人工智能與自動化學院熊永華教授。

這裡需要區分「參與驗證」與「為全部結果背書」:上述學者並非對453份手稿逐篇簽字認證,而是對其中部分問題、證明、計算結果或研究方向進行過驗證、審核或討論。

對一個高度自動化的科研系統而言,這種「機器內部紅隊 + 人類專家抽檢/複核」的組合,反而比把所有審查都交給同一套Agent更關鍵。

AI負責把研究速度推到極限;人類專家負責在關鍵節點把「看起來成立」重新拉回到「值得相信」。

失敗以後,換了一個更好的問題

項目最能體現「研究品味」的案例,恰恰不是一次漂亮的成功,而是一次失敗。

在 fractional Gaussian trace 問題上,系統最初嘗試單調性和單側配對路線,但精確反例不斷出現。普通benchmark到這裡通常只會留下一個標籤:FAILED。

但這套工作流沒有停。Agent繼續追問:反例到底破壞了什麼?失敗有沒有穩定結構?最後研究把注意力轉向一個固定的負向缺陷,構造出十項修正結構,並提出一個新的統一有界性猜想。更關鍵的是,新猜想隨後又被另一輪精確計算和獨立審查反過來攻擊。公開歸檔掃描到index 1004;這個統一界至今仍未證明。

這件事的意義並不是「AI又證明了一個大定理」——事實上它沒有。意義在於:原問題沒有解決,但失敗路線被壓縮成了一個更清楚、更可證偽、而且一旦成立就能重新連接原問題的新命題。研究沒有在失敗處終止,而是在失敗裡長出了下一道題。

過去:人類出題,AI答題。現在:AI答題,也開始參與決定「下一道題是什麼」。

6篇AI新猜想

截至當前公開快照,倉庫把6篇論文單獨歸入「AI-Proposed Conjectures」。這些工作橫跨組合、圖論、數論與分析型問題,包括A182510三個子序列的無限binary-kernel矩陣非奇異性、Young圖形的CDS-colorability、最大度不超過6的無三角圖分解、18-colored generalized Frobenius partitions的unary-theta同餘公式、reciprocal-subsum denominators在dyadic stages上的Newton係數非負性,以及前述fractional Gaussian trace固定缺陷猜想。

真正值得關注的不是AI能不能「腦洞一個猜想」。隨口猜一句並不難。難的是把猜想寫成精確定義,說明它從哪裡來、什麼證據支持、什麼反例能推翻、如果成立會導向什麼結果,並把計算和源碼一起留給後續複核。

這也是為什麼項目把「提出猜想」看作比「生成答案」更高一級的研究動作:證明回答的是已有問題,猜想則會改變之後的研究資源投向。

453份手稿背後,是一種「Agent規模化科研」的雛形

AI Has Taste目前公開了453份research manuscripts,總計2312頁;其中BigWIN2一套工作流就對應223份手稿,並為這223份工作提供配對的LaTeX/復現材料包。

這類規模最反直覺的地方,不是「AI打字快」。數學研究真正昂貴的是上下文切換:這一題需要圖論,下一題要數論,再下一題可能要SAT、窮舉、精確有理數運算或者矩陣計算。一個人類研究者不可能同時維持幾百條完全不同的思路,但Agent系統可以把它們拆成獨立任務,把失敗路線、局部定理和可復現實驗都保存下來。

於是,個人研究者的角色正在發生變化:不是每一步都親自推,而更像一個PI——設定研究邊界、選擇問題池、決定哪些結果值得繼續投入、什麼時候應該停止,以及哪些結論有資格被公開。

為什麼叫「AI Has Taste」?

「AI有品味」聽起來很擬人化,但項目README特意給出了邊界:這裡的taste不是意識或主觀體驗,而是「通過研究決策表現出來的數學判斷」。

比如:兩個問題都能做,先做哪個?一條路線已經有局部進展,但邊際收益越來越低,要不要停?一個反例是把命題判死刑,還是說明真正的定理應該換一種表述?一個小結果夠不夠獨立成篇?這些決定過去通常隱含在研究者經驗裡,很難被標準benchmark測量。

AI Has Taste試圖把這些決定留下可檢查的軌跡:選了哪個問題、為什麼換路線、失敗留下了什麼結構、下一步命題從哪裡來,以及新結論如何被獨立上下文再次攻擊。

離「自主數學家」還有多遠?

這個項目最容易被誇大的地方,同樣需要說清楚。453份手稿不是453篇經過正式同行評審的期刊論文;Agent內部review不等於數學共同體的獨立審稿;有限計算覆蓋的範圍也不能自動推廣到無限情形。倉庫本身明確寫出了這些限制。

但如果只因為這些結果尚未全部完成外部驗證,就忽略它的研究組織方式,也會錯過另一個變化:AI的能力邊界正從「執行一個給定任務」,移動到「參與設計下一個任務」。

數學研究真正稀缺的資源,從來不只有算力和推理長度,還包括:什麼問題值得花時間,什麼失敗值得保留,什麼時候應該換題。

當AI開始進入這些環節,「AI for Math」的競爭就不再只是「誰更會證明」,而會逐漸變成:誰擁有更好的研究閉環,誰能在大量失敗中提煉出更值得繼續追的方向。

One More Thing

過去的AI科研敘事,很像一個超級學生:老師出題,它負責解。

而AI Has Taste想做的,更像一個研究組:人類給出邊界和價值判斷,Agent去找題、試題、做錯、推翻自己、留下局部結果,再提出下一題。

如果這條路線繼續成立,未來基礎研究裡最重要的人機分工,也許會從「人類負責想,AI負責算」變成更複雜的結構:人類負責目標、價值與最終責任;AI承擔大規模搜索、驗證、失敗管理和候選研究方向生成;形式化工具與公開證據負責讓結果可複核。

AI會做題之後,下一關,可能真的是:AI會不會選題。

本文來自微信公眾號「新智元」,作者:新智元