Redaktor|Panda
Rekord obliczeniowy w fizyce teoretycznej, który utrzymywał się przez trzy lata, został pobity przez AI.
Kilka godzin temu Anthropic ogłosił: Claude, na platformie badawczej Claude Science, działał nieprzerwanie przez kilka dni w zasadzie bez nadzoru i obliczył dziewięciopętlową amplitudę rozpraszania sześciu cząstek w planarnej teorii N=4 super-Yang-Millsa.
Jest to uznany problem graniczny w dziedzinie fizyki teoretycznej znany jako „amplitudy rozpraszania”. Wcześniej najwyższy rekord w tym modelu wynosił osiem pętli, ustanowiony w 2023 roku przez Lance'a Dixona z SLAC National Accelerator Laboratory i współpracowników.
To przełomowe osiągnięcie zostało osobiście zweryfikowane przez twórcę rekordu ośmiu pętli. Dixon niezależnie zweryfikował wynik Claude'a i skomentował, że dużym modelom językowym udaje się wykonać każdy krok tego złożonego przepisu i zorganizować obliczenia, co jego zdaniem jest „dość niezwykłym zwycięstwem”. Powiedział nawet wprost, że poza jego współpracownikami Claude rozumie ich dwa artykuły z 2019 i 2023 roku lepiej niż ktokolwiek inny.
Jeszcze bardziej zaskakujący jest proces i koszt. Badacze dali Claude'owi tylko jednozdaniowy opis zadania, a potem „wskazówki” sprowadzały się niemal wyłącznie do „kontynuuj”; całe obliczenie, przeliczone na koszty zwykłego użytkownika, wyniosło około tysiąca do dwóch tysięcy dolarów, z czego część faktycznie wykorzystana do obliczeń numerycznych to tylko około 100 dolarów, co odpowiada 96 procesorom pracującym przez tydzień. A jednak Dixon początkowo uważał, że bezpośrednie obliczenie amplitudy dziewięciu pętli jest zbyt trudne, a jego zespół przygotowywał się do tego od kilku lat.
Punktem wyjścia tego przełomu było publiczne „wyzwanie”.
7 sierpnia były fizyk teoretyczny i popularyzator nauki Matt von Hippel opublikował na swoim blogu 4gravitons nieco prowokacyjny artykuł zatytułowany „Tylko AI wkraczające w moją dziedzinę się liczy”. W nim wyraźnie rzucił wyzwanie firmom zajmującym się AI: użyjcie mocy obliczeniowej, na którą stać naukowca, aby rozwiązać nierozwiązany ważny problem w dziedzinie amplitud rozpraszania.
Podal dwie opcje: albo obliczyć N=8 supergrawitację do siedmiu pętli, albo obliczyć amplitudę sześciu cząstek w teorii N=4 super-Yang-Millsa do dziewięciu pętli.
Miesiąc później AI dokonało korekty. To, co właśnie opublikował Anthropic, to dokładnie artykuł gościnny napisany przez samego von Hippela, zatytułowany: „Tak, Claude potrafi dziewięć pętli”.
https://www.anthropic.com/research/yes-claude-can-do-nine-loops
Dziewięć pętli, gdzie tkwi trudność?
Aby zrozumieć wagę tej sprawy, trzeba najpierw wyjaśnić, co obliczają fizycy.
Fizycy cząstek elementarnych przewidują zachowanie cząstek za pomocą pewnej klasy wzorów zwanych „amplitudami rozpraszania”: mając energię i pęd cząstek biorących udział w zderzeniu, amplituda rozpraszania może powiedzieć, jakie jest prawdopodobieństwo, że zareagują w określony sposób.
Im dokładniejsze przewidywanie, tym bardziej szczegółowe porównanie można przeprowadzić z wynikami eksperymentów, takich jak Wielki Zderzacz Hadronów (LHC). Gdy pojawi się odchylenie, może to być wskazówka nowej fizyki, na przykład natury ciemnej materii albo tego, dlaczego materia i antymateria we wszechświecie są asymetryczne.
Problem polega na tym, że amplitudy rozpraszania są niezwykle trudne do dokładnego obliczenia, a fizycy niemal wyłącznie mogą dokonywać przybliżeń. Warstwują obliczenia według „pętli”; liczba pętli w przybliżeniu mierzy, jak złożone mogą być oddziaływania między cząstkami. Każda dodatkowa pętla przybliża odpowiedź do wartości prawdziwej, ale ilość obliczeń również gwałtownie rośnie. W oryginalnym tekście wyzwania von Hippel napisał, że złożoność takich obliczeń zwykle rośnie wykładniczo, a nawet silniowo, wraz z liczbą pętli.
Tak więc w rzeczywistości zdecydowana większość amplitud rozpraszania jest obliczana tylko do dwóch pętli, a nieliczne mogą osiągnąć trzy pętle. Najdokładniejsza prognoza w fizyce cząstek elementarnych, anomalny moment magnetyczny elektronu, wykorzystywała pięć pętli.
Teoria N=4 super-Yang-Millsa to szczególny model zabawkowy w tej dziedzinie. „Yang-Mills” to ramy teoretyczne opisujące trzy fundamentalne oddziaływania: elektromagnetyzm, silne oddziaływanie jądrowe i słabe oddziaływanie jądrowe; „N=4 supersymetria” oznacza, że każdej cząstce towarzyszy czterech supersymetrycznych partnerów. Cząstek jest tak wiele, że jest to nierealistyczne; ta teoria nie opisuje rzeczywistego świata. Ale właśnie ta wysoka symetria powoduje, że wiele kombinacji zmiennych wzajemnie się znosi, co sprawia, że obliczenia są stosunkowo łatwe do opanowania. Badacze szlifują tutaj nowe metody, aby zobaczyć, jak daleko mogą zajść.
Metoda użyta tym razem nazywa się „bootstrap”. von Hippel porównał ją do sudoku: najpierw wypisz wszystkie możliwe formy odpowiedzi, zapisz je w plikach komputerowych za pomocą specjalnego „alfabetu”, a następnie użyj wszystkich znanych ograniczeń, aby eliminować je jedno po drugim, w tym przewidywań z innych metod, reguł, którym odpowiedź musi podlegać, oraz znanych wyników z powiązanych problemów. W idealnym przypadku na końcu tylko jeden kandydat przechodzi wszystkie sprawdzenia, a pozostają dodatkowe sprawdzenia, aby potwierdzić, że nie popełniono błędu.
Rekord ośmiu pętli został uzyskany przez Dixona okrężną drogą. W 2023 roku on i Yu-Ting Liu użyli osobliwej symetrii zwanej „dualnością antypodalną”, aby najpierw obliczyć stosunkowo łatwiejszy „czynnik kształtu”, a następnie przekształcić go w amplitudę ośmiu pętli. Przez kilka następnych lat jego zespół stale spoglądał w stronę dziewięciu pętli, planując podążać tą samą pośrednią drogą. Jego zdaniem bezpośrednie obliczenie amplitudy dziewięciu pętli było zbyt trudne.
Warto wspomnieć, że sam von Hippel jest weteranem tej linii badań. Wcześniej współpracował z Dixonem i innymi, aby popchnąć amplitudę sześciu cząstek do sześciu pętli i siedmiu pętli. Innymi słowy, wybrał kość, którą sam już ogryzał.
Jedno polecenie, potem ciągłe mówienie „kontynuuj”
Pod koniec sierpnia dwóch fizyków z Anthropic, Liam Fitzpatrick i Siddharth Mishra-Sharma, skontaktowało się z von Hippelem i powiedziało mu, że wyzwanie zostało pokonane.
Użyli modelu Fable 5.1, działającego na platformie Claude Science. W artykule von Hippel wyjaśnił, że Claude Science to rodzaj „uprzęży”, to znaczy owijania wokół dużego modelu ustrukturyzowanych reguł i podpowiedzi, aby działał on bardziej niezawodnie w zadaniach badawczych.
Według artykułu, obaj najpierw zapytali Claude’a, które wyzwanie jest najbardziej pewny, że podejmie, a następnie podali tylko bardzo krótki opis zadania: oblicz amplitudę sześciu cząstek (heksagonu) w dziewięciu pętlach w planarnej N=4 SYM.
Potem „wskazówki badawcze” polegały w zasadzie tylko na pozwalaniu mu działać dalej. Typowa instrukcja ujawniona w artykule brzmiała mniej więcej tak: idę spać, będę nieobecny przez kilka następnych godzin, pracuj dalej, aż powiem ci, żebyś przestał, i raportuj postępy co cztery do sześciu godzin.
Ostatecznie Claude obliczył to raz na dwa sposoby: po pierwsze, bezpośrednią metodą bootstrap, a po drugie, pośrednią drogą poprzez czynniki postaci stosowane przez zespół Dixona. Według artykułu każdy z nich kosztował użytkownika końcowego około od tysiąca do dwóch tysięcy dolarów, przy czym większość stanowił koszt długotrwałego uruchamiania samego modelu. Część obliczeń bootstrap wykonano w Pythonie z użyciem biblioteki obliczeń symbolicznych SymPy, co stanowiło tylko około 100 dolarów, co odpowiada 96 procesorom pracującym przez tydzień.
von Hippel ubolewał, że gdy dziesięć lat temu prowadził tego rodzaju badania, 96 procesorów pracujących przez tydzień było znaczącą inwestycją, podczas gdy teraz, o ile istnieje wystarczający powód, taka ilość zasobów jest całkiem przystępna.
Odczucie weryfikatora: jak zapadnięte suflet
Na końcu artykułu znajduje się postscriptum napisane przez samego Dixona, zatytułowane „Jak to jest zostać wyprzedzonym przez maszynę”.
Napisał, że 1 września dwaj badacze z Anthropic powiedzieli mu, że Claude obliczył amplitudę dziewięciopętlową i poprosili go o zweryfikowanie wyniku. Dla niego ten moment był chwilą, w której idea, że duże modele językowe zmieniają fizykę, „naprawdę do niego dotarła”.
To, co zrobiło na Dixonie wrażenie, to nie tyle skala obliczeń, ile kruchość całego procesu. Według jego opisu, gdyby jakakolwiek część tego przepisu obliczeniowego poszła źle, cały wynik zawaliłby się jak nieudany suflet, a badacz musiałby wrócić i żmudnie szukać błędów. Co więcej, wiele szczegółów konstrukcji było tak nużących, że nie zostałyby w pełni zapisane w artykule, co oznaczało, że Claude musiał zbudować cały kod od zera.
Ponieważ stosunkowo łatwo jest wywnioskować czynnik postaci dziewięciopętlowej z amplitudy dziewięciopętlowej, Dixon przeprowadził weryfikację głównie tą drogą. Doprowadziło to również do nieco delikatnej sytuacji: to, co weryfikował przez dwa tygodnie, było dokładnie celem, do którego jego własny zespół dążył od kilku lat.
Przyznał, że nie czuł frustracji, z dwóch powodów.
Jego zespół już wcześniej używał niestandardowych modeli Transformer do przewidywania wyników przy wyższych rzędach pętli, a nawet wysunął slogan o treści, że o ile maszyna poda kandydacką odpowiedź, mają pełny zestaw narzędzi do jej weryfikacji.
Podczas rozwiązywania problemu Claude użył dokładnie metod, które Dixon i jego współpracownicy opracowali przez wiele lat, a nawet format prezentacji wyników był zgodny z ich istniejącymi konwencjami. Jego zdaniem podczas gdy on weryfikował Claude'a, Claude weryfikował również całą ich dotychczasową pracę. Stąd też pochodzi jego uwaga, że „Claude rozumie nasze artykuły lepiej niż ktokolwiek inny”.
Jednak wśród pochwał Dixon powiedział również, że jego zdaniem moment, który naprawdę nie pozwoli ludziom spać, nadejdzie, gdy model zaproponuje nowe zasady i spostrzeżenia fizyczne przed ludźmi.
Chiński zespół dotarł niemal jednocześnie
Ta historia ma również równoległy wątek, związany z Chinami.
Zaledwie kilka dni po tym, jak Anthropic skontaktował się z von Hippelem, Song He z Instytutu Fizyki Teoretycznej Chińskiej Akademii Nauk również się odezwał: jego grupa badawcza uzyskała już większość wyniku dziewięciopętlowego. 17 września Song He, Jirong Jing i Xiang Li publicznie udostępnili zbiór danych na Zenodo zatytułowany „Symbol amplitud MHV sześciu gluonów do dziewięciu pętli”, obejmujący dane symboliczne od dwóch do dziewięciu pętli.
https://zenodo.org/records/22800071
Według opisów von Hippela i Dixona zespół Song He również korzystał z pomocy AI opartej na GPT-6, ale tylko do obliczania niektórych ograniczeń, podczas gdy ogólne ramy wciąż zostały zbudowane przez ludzi. Jest to całkowicie odmienne od niemal w pełni zautomatyzowanej drogi Anthropic „jedno polecenie plus powtarzane kontynuuj”.
W postscriptum Dixon zakpił z siebie: w ciągu dwóch tygodni został wyprzedzony najpierw przez „maszynę”, a potem przez „ludzi plus maszyny”.
von Hippel szczególnie wspomniał, że atmosfera wśród stron była całkiem przyjazna. Następnie Dixon, Song He i ich współpracownicy opublikują te wyniki i przedstawią szczegółowe wyjaśnienia oraz analizy dla późniejszych badaczy.
Retrospekcja challengera: nisko wiszących owoców jest więcej, niż sobie wyobrażano
Wróćmy do samego von Hippela. Kiedy pierwotnie ogłaszał wyzwanie, chciał użyć dziedziny, którą dobrze znał, aby odpowiedzieć na to pytanie: czy AI rzeczywiście może ominąć te wąskie gardła obliczeniowe, które wszyscy uważają za nie do pokonania?
Logika w jego pierwotnym tekście wyzwania była następująca: wszyscy na zewnątrz debatują, czy AI może tworzyć naprawdę nowe idee, ale jak trudno jest znaleźć idee, wiadomo dopiero po ich znalezieniu; trudność obliczeń jest bardziej „konkretna”. Wiele scenariuszy zagłady dotyczących superinteligencji, od symulowania ludzkich umysłów w celu manipulowania ludzkimi sercami po projektowanie nanomaszyn od podstaw, spotyka się ze standardową ripostą krytyków, że brakuje mocy obliczeniowej. Jeśli AI może użyć zasobów na poziomie akademickim, aby rozwiązać problem powszechnie uznawany za ograniczony obliczeniowo, to byłby naprawdę powód do zmartwienia.
A wynik? Wniosek von Hippela jest bardzo szczery: tym razem nie pojawił się ten rodzaj „przełamania bariery obliczeniowej w nieoczekiwany sposób”, na który liczył.
Claude użył znanych metod, tylko z nieco większą mocą obliczeniową, niż ludzie byli wcześniej skłonni zainwestować. Być może skorzystał z używania Pythona zamiast Maple lub Mathematica, do których przywykli fizycy, a jego praktyki inżynierii oprogramowania mogły być również bardziej znormalizowane niż u ludzkich badaczy, ale nie osiągnął poziomu „superinteligencji”. Fakt, że zespół Song He dotarł niemal jednocześnie, również pokazuje z innej perspektywy, że ten cel nie jest poza zasięgiem ludzi.
Jego największym wnioskiem z tego jest: nawet jeśli cel jest prosty i jasny, rzeczy, które w oczach ekspertów wydają się nieosiągalne, mogą w rzeczywistości nie być takie trudne, a nisko wiszących owoców jest więcej, niż oczekiwano. Przez lata przyjaciele z wykształceniem informatycznym mówili mu, że badacze amplitud mogliby poczynić wielkie postępy, po prostu zatrudniając kilku dodatkowych programistów, a von Hippel przyznał, że ci ludzie mogą teraz czuć, że mieli rację.
Ale podkreślił także drugą stronę. Ten rodzaj obliczeń jest żmudny i chaotyczny, a gdyby on sam użył 96 CPU do uruchomienia przez tydzień, prawie na pewno przeciągnąłby to do dwóch tygodni z powodu pierwszego błędu. Claude Science jednak przeprowadził to za jednym razem, niemal bez nadzoru naukowego, nie polegając na wkładzie żadnych zewnętrznych współpracowników. Jego rada dla tych, którzy nadal uważają, że AI jest pełne błędów i nie podoła zadaniu, jest następująca: ten rodzaj pracy może teraz niezawodnie wykonać.
Dokonał także porównania w czasie. W marcu tego roku, w eksperymencie „vibe physics” Anthropic, AI wykonujące projekty fizyczne było jeszcze jak student, z małą skalą zadań, wymagające dużo prowadzenia za rękę i częstych błędów. Pół roku później to, co ukończyło, było już frontierowymi obliczeniami, których dotknęliby tylko najlepsi eksperci w dziedzinie amplitud. Nie wykluczył, że był to przypadkowo problem szczególnie odpowiedni dla AI, ale ocenił, że sama technologia rzeczywiście stała się silniejsza.
Co do tego, czy można to uogólnić, von Hippel pozostaje ostrożny. Modele zabawkowe takie jak N=4 zwykle należą do bardzo małego kręgu badawczego, podczas gdy obliczenia amplitud dla rzeczywistego świata są znacznie bardziej konkurencyjne, gdzie nisko wiszące owoce mogą być jeszcze rzadsze. Ale przypomina także badaczom wykonującym te obliczenia, że jeśli nie próbowali jeszcze, aby platforma badawcza AI podjęła jednorazową próbę frontierowych obliczeń, powinni spróbować, a jednocześnie być przygotowani z planem weryfikacji wyników. Nie zdziwiłby się zbytnio, gdyby ktoś mógł wycisnąć jeszcze jedną pętlę w rozsądnym budżecie.
Końcowe przemyślenia
Umieszczenie tej sprawy z powrotem w kontekście września czyni ją jeszcze bardziej interesującą.
Ósmego dnia tego miesiąca OpenAI ogłosiło, że jego nieujawniony model zmobilizował dziesiątki tysięcy agentów AI i wyprodukował kontrprzykład dla problemu istnienia i gładkości równań Naviera-Stokesa, który jest jednym z problemów milenijnych; wynik jest nadal poddawany przeglądowi przez społeczność matematyczną. W porównaniu z tego rodzaju „operacją wielkiej armii” wykorzystującą ogromną moc obliczeniową, historia amplitudy dziewięciu pętli wydaje się znacznie skromniejsza: komercyjna platforma badawcza, pojedynczy opis zadania, kilka tysięcy dolarów i kilka dni.
I właśnie dlatego, że jest skromny, może zasługiwać na większą uwagę ze strony środowiska akademickiego. von Hippel ostatecznie przyznał, że początkowo miał nadzieję wykorzystać to wyzwanie, by zajrzeć w przyszłość, zobaczyć jakąś bezprecedensową nową metodę obliczeniową i tym samym uzyskać opartą na dowodach ocenę w debacie o superinteligencji. Ale odpowiedź, którą otrzymał, była taka, że jego wcześniejsze rozumienie tego, gdzie leżą granice, było zbyt naiwne.
A pytanie, które pozostawił Dixon, wciąż wisi w powietrzu: kiedy duże modele nie będą już tylko wykonywać przepisów napisanych przez ludzi, ale zaczną proponować nowe zasady fizyczne zanim zrobią to ludzie, jak powinni pozycjonować się fizycy?
© THE END
Ten artykuł pochodzi z publicznego konta WeChat „Machine Heart” (ID: almosthuman2014), autor: Machine Heart












