Redakteur|Panda
Ein Rekord in der theoretischen Physik, der drei Jahre lang Bestand hatte, wurde von KI gebrochen.
Vor einigen Stunden kündigte Anthropic an: Claude lief auf der Forschungsplattform Claude Science mehrere Tage lang kontinuierlich im Wesentlichen unbeaufsichtigt und berechnete die Neun-Schleifen-Sechs-Teilchen-Streuamplitude in der planaren N=4 super-Yang-Mills-Theorie.
Dies ist ein anerkanntes Grenzproblem auf dem Gebiet der theoretischen Physik, bekannt als „Streuamplituden“. Zuvor lag der höchste Rekord in diesem Modell bei acht Schleifen, aufgestellt im Jahr 2023 von Lance Dixon vom SLAC National Accelerator Laboratory und Mitarbeitern.
Dieser Durchbruch wurde persönlich vom Schöpfer des Acht-Schleifen-Rekords geprüft. Dixon verifizierte Claudes Ergebnis unabhängig und kommentierte, dass ein großes Sprachmodell in der Lage sei, jeden Schritt dieses komplexen Rezepts auszuführen und die Berechnung zu organisieren, sei seiner Ansicht nach „ein ziemlich bemerkenswerter Sieg“. Er sagte sogar unverblümt, dass Claude, abgesehen von seinen Mitarbeitern, die beiden Arbeiten seines Teams aus den Jahren 2019 und 2023 besser versteht als jeder andere.
Noch überraschender sind der Prozess und die Kosten. Die Forscher gaben Claude nur eine einzeilige Aufgabenbeschreibung, und danach war die „Anleitung“ kaum mehr als „weiter“; die gesamte Berechnung kostete, umgerechnet auf die Kosten eines normalen Nutzers, etwa ein- bis zweitausend Dollar, wovon der tatsächlich für numerische Berechnungen verwendete Teil nur etwa 100 Dollar betrug, was 96 CPUs entspricht, die eine Woche lang laufen. Dixon hatte jedoch ursprünglich gedacht, dass die direkte Berechnung der Neun-Schleifen-Amplitude zu schwierig sei, und sein Team hatte sich mehrere Jahre darauf vorbereitet.
Der Ausgangspunkt dieses Durchbruchs war eine öffentliche „Herausforderung“.
Am 7. August veröffentlichte der ehemalige theoretische Physiker und Wissenschaftskommunikator Matt von Hippel einen etwas provokativen Artikel in seinem Blog 4gravitons mit dem Titel „Only AI Entering My Field Counts“. Darin richtete er ausdrücklich eine Herausforderung an KI-Unternehmen: Verwenden Sie Rechenleistung, die sich ein Wissenschaftler leisten kann, um ein ungelöstes großes Problem auf dem Gebiet der Streuamplituden zu lösen.
Er gab zwei Optionen: entweder N=8 Supergravitation bis zur siebten Schleife zu berechnen oder die Sechs-Teilchen-Amplitude in der N=4 super-Yang-Mills-Theorie bis zur neunten Schleife zu berechnen.
Einen Monat später hatte die KI die Anpassung abgeschlossen. Was Anthropic gerade veröffentlicht hat, ist genau ein Gastartikel, geschrieben von von Hippel selbst, mit dem Titel: „Ja, Claude kann neun Schleifen“.
https://www.anthropic.com/research/yes-claude-can-do-nine-loops
Neun Schleifen, wo liegt die Schwierigkeit?
Um die Tragweite dieser Angelegenheit zu verstehen, muss man zunächst klären, was Physiker berechnen.
Teilchenphysiker sagen das Verhalten von Teilchen mit einer Klasse von Formeln voraus, die „Streuamplituden“ genannt werden: Wenn man die Energie und den Impuls der an einer Kollision beteiligten Teilchen kennt, kann die Streuamplitude angeben, mit welcher Wahrscheinlichkeit sie in einer bestimmten Weise reagieren werden.
Je präziser die Vorhersage, desto detaillierter kann der Vergleich mit Ergebnissen von Experimenten wie dem Large Hadron Collider (LHC) sein. Sobald eine Abweichung auftritt, könnte sie ein Hinweis auf neue Physik sein, etwa auf die Natur der Dunklen Materie oder darauf, warum Materie und Antimaterie im Universum asymmetrisch sind.
Das Problem ist, dass Streuamplituden extrem schwer präzise zu berechnen sind und Physiker fast nur Näherungen machen können. Sie schichten die Berechnungen nach „Schleifen“; die Anzahl der Schleifen misst grob, wie komplex die Wechselwirkungen zwischen Teilchen sein dürfen. Jede zusätzliche Schleife bringt die Antwort näher an den wahren Wert, aber der Rechenaufwand wächst auch dramatisch. Im ursprünglichen Herausforderungstext schrieb von Hippel, dass die Komplexität solcher Berechnungen normalerweise exponentiell oder sogar faktoriell mit der Anzahl der Schleifen wächst.
In der Realität werden daher die allermeisten Streuamplituden nur bis zu zwei Schleifen berechnet, und einige wenige können drei Schleifen erreichen. Die präziseste Vorhersage in der Teilchenphysik, das anomale magnetische Moment des Elektrons, verwendete fünf Schleifen.
Die N=4-Super-Yang-Mills-Theorie ist ein spezielles Spielzeugmodell in diesem Bereich. „Yang-Mills“ ist der theoretische Rahmen, der die drei fundamentalen Wechselwirkungen beschreibt: Elektromagnetismus, die starke Kernkraft und die schwache Kernkraft; „N=4-Supersymmetrie“ bedeutet, dass jedes Teilchen mit vier supersymmetrischen Partnern gepaart ist. Es gibt so viele Teilchen, dass es unrealistisch ist; diese Theorie beschreibt nicht die reale Welt. Aber gerade diese hohe Symmetrie führt dazu, dass sich viele Kombinationen von Variablen gegenseitig aufheben, was die Berechnungen relativ handhabbar macht. Forscher schärfen hier neue Methoden, um zu sehen, wie weit sie gehen können.
Die diesmal verwendete Methode heißt „Bootstrap“. von Hippel verglich sie mit Sudoku: Zuerst schreibt man alle möglichen Formen der Antwort auf, trägt sie mit einem speziellen „Alphabet“ in Computerdateien ein und eliminiert sie dann nacheinander mit allen bekannten Einschränkungen, einschließlich Vorhersagen aus anderen Methoden, Regeln, denen die Antwort gehorchen muss, und bekannten Ergebnissen verwandter Probleme. Im Idealfall besteht am Ende nur ein Kandidat alle Prüfungen, und es bleiben zusätzliche Prüfungen übrig, um zu bestätigen, dass keine Fehler gemacht wurden.
Der Acht-Schleifen-Rekord wurde erzielt, indem Dixon einen Umweg nahm. Im Jahr 2023 nutzten er und Yu-Ting Liu eine eigentümliche Symmetrie namens „antipodale Dualität“, um zuerst den relativ einfacheren „Formfaktor“ zu berechnen und ihn dann in die Acht-Schleifen-Amplitude umzuwandeln. In den folgenden Jahren behielt sein Team die neun Schleifen im Auge und plante, denselben indirekten Weg zu verfolgen. Seiner Ansicht nach war die direkte Berechnung der Neun-Schleifen-Amplitude zu schwierig.
Erwähnenswert ist, dass von Hippel selbst ein Veteran dieser Forschungslinie ist. Er hatte zuvor mit Dixon und anderen zusammengearbeitet, um die Sechs-Teilchen-Amplitude auf sechs Schleifen und sieben Schleifen zu treiben. Mit anderen Worten, er nahm sich einen Knochen vor, an dem er selbst schon gekaut hatte.
Ein Prompt, dann immer wieder „weiter“ sagen
Ende August kontaktierten zwei Physiker bei Anthropic, Liam Fitzpatrick und Siddharth Mishra-Sharma, von Hippel und teilten ihm mit, dass die Herausforderung gemeistert worden sei.
Sie verwendeten das Modell Fable 5.1, das auf der Claude Science Plattform lief. Im Artikel erklärte von Hippel, dass Claude Science eine Art „Harness“ sei, das heißt, es legt strukturierte Regeln und Prompts um ein großes Modell, damit es bei wissenschaftlichen Forschungsaufgaben robuster funktioniert.
Laut dem Artikel fragten die beiden zuerst Claude, welche Herausforderung es am zuversichtlichsten bewältigen könne, und gaben dann nur eine sehr kurze Aufgabenbeschreibung: Berechne die Neun-Schleifen-Sechs-Teilchen-(Hexagon-)Amplitude in planarem N=4 SYM.
Danach bestand die „Forschungsanleitung“ im Grunde nur darin, es einfach weitermachen zu lassen. Eine typische im Artikel offengelegte Anweisung lautete ungefähr so: Ich gehe jetzt schlafen, ich werde für die nächsten paar Stunden weg sein, arbeite weiter, bis ich dir sage, dass du aufhören sollst, und berichte alle vier bis sechs Stunden über den Fortschritt.
Letztendlich berechnete Claude es einmal auf jede von zwei Arten: erstens die direkte Bootstrap-Methode und zweitens den indirekten Weg über Formfaktoren, die von Dixons Team verwendet wurden. Laut dem Artikel kostete jede der beiden den Endnutzer ungefähr ein- bis zweitausend Dollar, wobei der Großteil die Kosten für den langen Betrieb des Modells selbst waren. Der Bootstrap-Berechnungsteil wurde mit Python und der symbolischen Berechnungsbibliothek SymPy durchgeführt und machte nur etwa 100 Dollar aus, was 96 CPUs entspricht, die eine Woche lang liefen.
von Hippel beklagte, dass, als er diese Art von Forschung vor zehn Jahren betrieb, 96 CPUs, die eine Woche lang liefen, eine beträchtliche Investition waren, während jetzt, solange es ausreichenden Grund gibt, diese Menge an Ressourcen recht erschwinglich ist.
Das Gefühl des Verifizierers: wie ein zusammengefallenes Soufflé
Am Ende des Artikels steht ein von Dixon selbst verfasstes Nachwort mit dem Titel „Wie es sich anfühlt, von einer Maschine überholt zu werden.“
Er schrieb, dass am 1. September die beiden Anthropic-Forscher ihm mitteilten, dass Claude die Neun-Schleifen-Amplitude berechnet habe, und ihn baten, das Ergebnis zu verifizieren. Für ihn war dieser Moment derjenige, in dem die Vorstellung, dass große Sprachmodelle die Physik verändern, „wirklich bei ihm ankam“.
Was Dixon beeindruckte, war weniger der Umfang der Berechnung als vielmehr die Zerbrechlichkeit des gesamten Prozesses. Seiner Beschreibung zufolge würde, wenn auch nur ein Teil dieses Berechnungsrezepts schiefginge, das gesamte Ergebnis wie ein misslungenes Soufflé zusammenfallen, und der Forscher müsste zurückgehen und mühsam Fehlersuche betreiben. Darüber hinaus waren viele der Konstruktionsdetails so mühsam, dass sie nicht vollständig in eine Arbeit geschrieben würden, was bedeutete, dass Claude den gesamten Code von Grund auf neu erstellen musste.
Da es relativ einfach ist, den Neun-Schleifen-Formfaktor aus der Neun-Schleifen-Amplitude abzuleiten, führte Dixon die Verifizierung hauptsächlich entlang dieses Weges durch. Dies führte auch zu einer etwas heiklen Situation: Was er zwei Wochen lang verifizierte, war genau das Ziel, das sein eigenes Team seit mehreren Jahren verfolgte.
Er gab zu, dass er sich nicht frustriert fühlte, aus zwei Gründen.
Sein Team hatte bereits benutzerdefinierte Transformer-Modelle verwendet, um Ergebnisse bei höheren Schleifenordnungen vorherzusagen, und hatte sogar einen Slogan aufgestellt, der besagte, dass solange die Maschine eine Kandidatenantwort liefert, sie über ein vollständiges Instrumentarium verfügen, um sie zu verifizieren.
Bei der Lösung des Problems verwendete Claude genau die Methoden, die Dixon und seine Mitarbeiter über viele Jahre entwickelt hatten, und selbst das Präsentationsformat der Ergebnisse folgte ihren bestehenden Konventionen. Seiner Ansicht nach verifizierte Claude, während er Claude verifizierte, auch all ihre vergangene Arbeit. Dies ist auch der Ursprung seiner Bemerkung, dass „Claude unsere Arbeiten besser versteht als jeder andere.“
Doch inmitten des Lobes sagte Dixon auch, dass seiner Ansicht nach der Moment, der die Menschen wirklich schlaflos halten wird, kommen wird, wenn ein Modell neue physikalische Prinzipien und Erkenntnisse vor den Menschen vorschlägt.
Ein chinesisches Team kam fast gleichzeitig an
Es gibt auch einen parallelen Handlungsstrang zu dieser Geschichte, und er hat mit China zu tun.
Nur wenige Tage, nachdem Anthropic von Hippel kontaktiert hatte, meldete sich auch Song He vom Institut für Theoretische Physik der Chinesischen Akademie der Wissenschaften: Seine Forschungsgruppe hatte bereits den Großteil des Neun-Schleifen-Ergebnisses erhalten. Am 17. September veröffentlichten Song He, Jirong Jing und Xiang Li öffentlich einen Datensatz auf Zenodo mit dem Titel „Das Symbol von Sechs-Gluon-MHV-Amplituden bis zu neun Schleifen“, der Symboldaten von zwei bis neun Schleifen abdeckt.
https://zenodo.org/records/22800071
Den Beschreibungen von von Hippel und Dixon zufolge nutzte Song Hes Team ebenfalls KI-Unterstützung auf Basis von GPT-6, jedoch nur zur Berechnung einiger der Einschränkungen, während das Gesamtframework noch von Menschen erstellt wurde. Dies unterscheidet sich völlig von Anthropics nahezu vollautomatisiertem Weg „ein Prompt plus wiederholtes Continue“.
Im Nachwort spottete Dixon über sich selbst: innerhalb von zwei Wochen war er zuerst von „einer Maschine“ und dann von „Menschen plus Maschinen“ überholt worden.
von Hippel erwähnte ausdrücklich, dass die Atmosphäre unter den Parteien recht freundlich war. Als Nächstes werden Dixon, Song He und ihre Mitarbeiter diese Ergebnisse veröffentlichen und detaillierte Erklärungen und Analysen für spätere Forscher bereitstellen.
Der Rückblick des Herausforderers: Es gibt mehr niedrig hängende Früchte als gedacht
Zurück zu von Hippel selbst. Als er ursprünglich die Herausforderung ausrief, wollte er ein ihm vertrautes Feld nutzen, um diese Frage zu beantworten: Kann KI tatsächlich jene Rechenengpässe umgehen, die alle für unüberwindbar halten?
Die Logik in seinem ursprünglichen Herausforderungstext war folgende: Draußen diskutieren alle, ob KI wirklich neue Ideen hervorbringen kann, aber wie schwer Ideen zu finden sind, weiß man erst, nachdem sie gefunden wurden; die Schwierigkeit der Berechnung ist „konkreter“. Vielen Weltuntergangsszenarien über Superintelligenz, von der Simulation menschlicher Geister über die Manipulation von Herzen bis hin zur Konstruktion von Nanomaschinen aus ersten Prinzipien, begegnen Kritiker mit dem Standardeinwand, dass nicht genügend Rechenleistung vorhanden sei. Wenn KI mit Ressourcen auf akademischem Niveau ein Problem lösen kann, das allgemein als rechenbegrenzt anerkannt ist, wäre das wahrlich Anlass zur Sorge.
Und das Ergebnis? von Hippels Fazit ist sehr offen: Diesmal trat nicht die Art von „Durchbrechen der Rechenbarriere auf unerwartete Weise“ auf, die er sich erhofft hatte.
Claude verwendete bekannte Methoden, nur mit etwas mehr Rechenleistung, als Menschen zuvor bereit gewesen waren zu investieren. Es mag davon profitiert haben, Python statt Maple oder Mathematica zu verwenden, die Physiker gewohnt sind, und seine Software-Engineering-Praktiken mögen auch standardisierter gewesen sein als die menschlicher Forscher, aber es erreichte nicht das Niveau von „Superintelligenz“. Die Tatsache, dass Song Hes Team fast gleichzeitig ankam, zeigt aus einem anderen Blickwinkel, dass dieses Ziel nicht außerhalb menschlicher Reichweite liegt.
Sein größtes Fazit daraus ist: Selbst wenn das Ziel einfach und klar ist, mögen Dinge, die in den Augen von Experten unerreichbar erscheinen, tatsächlich nicht so schwer sein, und es gibt mehr niedrig hängende Früchte als erwartet. Jahrelang hatten ihm Freunde mit Informatikhintergrund gesagt, dass Amplitudenforscher große Fortschritte machen könnten, indem sie einfach ein paar mehr Programmierer einstellen, und von Hippel gab zu, dass diese Leute jetzt das Gefühl haben können, recht gehabt zu haben.
Aber er betonte auch die andere Seite. Diese Art von Berechnung ist mühsam und chaotisch, und wenn er selbst 96 CPUs eine Woche lang hätte laufen lassen, hätte er es fast sicher wegen eines ersten Fehlers auf zwei Wochen ausgedehnt. Claude Science hingegen führte es in einem Durchgang durch, fast ohne wissenschaftliche Aufsicht, ohne auf Input von externen Mitarbeitern angewiesen zu sein. Sein Rat an diejenigen, die immer noch denken, KI sei voller Fehler und der Aufgabe nicht gewachsen, ist: Diese Art von Arbeit kann sie jetzt zuverlässig erledigen.
Er stellte auch einen Längsvergleich an. Im März dieses Jahres, in Anthropics „Vibe Physics“-Experiment, war KI bei Physikprojekten noch wie ein Student, mit kleinen Aufgabenumfängen, viel Anleitung erforderlich und häufigen Fehlern. Ein halbes Jahr später war das, was sie abschloss, bereits Frontier-Berechnung, die nur Top-Experten im Amplitudenbereich anfassen würden. Er schloss nicht aus, dass dies zufällig ein besonders für KI geeignetes Problem war, aber er urteilte, dass die Technologie selbst tatsächlich stärker geworden war.
Was die Verallgemeinerbarkeit betrifft, bleibt von Hippel vorsichtig. Spielzeugmodelle wie N=4 gehören normalerweise zu einem sehr kleinen Forschungszirkel, während Amplitudenberechnungen für die reale Welt weitaus wettbewerbsintensiver sind, wo die niedrig hängenden Früchte noch spärlicher sein mögen. Aber er erinnert Forscher, die diese Berechnungen durchführen, auch daran, dass sie, wenn sie noch nicht versucht haben, eine KI-Forschungsplattform einen Ein-Schuss-Versuch bei Frontier-Berechnungen machen zu lassen, es versuchen sollten und gleichzeitig einen Plan zur Überprüfung der Ergebnisse vorbereitet haben sollten. Er wäre nicht allzu überrascht, wenn jemand innerhalb eines vernünftigen Budgets eine weitere Schleife herausholen könnte.
Abschließende Gedanken
Diese Angelegenheit in den Kontext des Septembers zu stellen, macht sie noch interessanter.
Am 8. dieses Monats kündigte OpenAI an, dass sein nicht offengelegtes Modell Zehntausende KI-Agenten mobilisierte und ein Gegenbeispiel zum Existenz- und Glattheitsproblem der Navier-Stokes-Gleichungen produzierte, das zu den Millennium-Preis-Problemen gehört; das Ergebnis wird noch von der Mathematikgemeinschaft geprüft. Verglichen mit dieser Art von „Großarmeen-Operation“ unter Einsatz massiver Rechenleistung wirkt die Geschichte der Neun-Schleifen-Amplitude viel bescheidener: eine kommerzielle Forschungsplattform, eine einzige Aufgabenbeschreibung, ein paar tausend Dollar und ein paar Tage.
Und gerade weil es bescheiden ist, verdient es vielleicht mehr Aufmerksamkeit von der Wissenschaft. von Hippel gab schließlich zu, dass er ursprünglich gehofft hatte, diese Herausforderung zu nutzen, um einen Blick in die Zukunft zu werfen, um eine noch nie dagewesene neue Berechnungsmethode zu sehen und dadurch ein evidenzbasiertes Urteil in der Debatte über Superintelligenz zu gewinnen. Aber die Antwort, die er erhielt, war, dass sein früheres Verständnis davon, wo die Grenzen liegen, zu naiv gewesen war.
Und die Frage, die Dixon hinterließ, hängt noch immer in der Luft: Wenn große Modelle nicht mehr nur von Menschen geschriebene Rezepte ausführen, sondern beginnen, neue physikalische Prinzipien vor den Menschen vorzuschlagen, wie sollten sich Physiker dann positionieren?
© THE END
Dieser Artikel stammt vom WeChat-öffentlichen Konto „Machine Heart“ (ID: almosthuman2014), Autor: Machine Heart












