Редактор|Panda
Обчислювальний рекорд у теоретичній фізиці, який протримався три роки, було побито ШІ.
Кілька годин тому Anthropic оголосила: Claude на дослідницькій платформі Claude Science працював безперервно протягом кількох днів практично без нагляду і обчислив дев'ятипетльову амплітуду розсіювання шести частинок у планарній N=4 супер-Янга-Міллса теорії.
Це визнана передова проблема в галузі теоретичної фізики, відома як «амплітуди розсіювання». Раніше найвищий рекорд у цій моделі становив вісім петель, встановлений у 2023 році Ленсом Діксоном з Національної прискорювальної лабораторії SLAC та його співробітниками.
Цей прорив був особисто перевірений творцем рекорду восьми петель. Діксон незалежно підтвердив результат Claude і зазначив, що велика мовна модель, здатна виконати кожен крок цього складного рецепту та організувати обчислення, на його думку, є «досить визначною перемогою». Він навіть прямо сказав, що, окрім його співробітників, Claude розуміє дві їхні статті 2019 та 2023 років краще, ніж будь-хто інший.
Ще більше вражає процес і вартість. Дослідники дали Claude лише однореченнєвий опис завдання, і після цього «керівництво» було майже нічим іншим, як «продовжуй»; усе обчислення, переведене у витрати звичайного користувача, становило близько однієї-двох тисяч доларів, з яких частина, фактично використана для чисельних обчислень, становила лише близько 100 доларів, що еквівалентно роботі 96 процесорів протягом тижня. Однак Діксон спочатку вважав, що безпосереднє обчислення дев'ятипетльової амплітуди є занадто складним, і його команда готувалася до цього кілька років.
Відправною точкою цього прориву став публічний «виклик».
7 серпня колишній теоретичний фізик і популяризатор науки Метт фон Гіппель опублікував у своєму блозі 4gravitons дещо провокаційну статтю під назвою «Тільки ШІ, що входить у мою галузь, має значення». У ній він чітко кинув виклик компаніям, що займаються ШІ: використати обчислювальні потужності, які може дозволити собі науковець, щоб розв'язати невирішену важливу проблему в галузі амплітуд розсіювання.
Він запропонував два варіанти: або обчислити N=8 супергравітацію до семи петель, або обчислити амплітуду шести частинок у N=4 супер-Янга-Міллса теорії до дев'яти петель.
Через місяць ШІ виконав завдання. Те, що щойно опублікувала Anthropic, є саме гостьовою статтею, написаною самим фон Гіппелем, під назвою: «Так, Claude може виконувати дев'ять петель».
https://www.anthropic.com/research/yes-claude-can-do-nine-loops
Дев'ять петель, у чому ж складність?
Щоб зрозуміти вагу цієї справи, спершу треба з'ясувати, що саме обчислюють фізики.
Фізики-частинковики передбачають поведінку частинок за допомогою класу формул, які називаються «амплітудами розсіювання»: знаючи енергію та імпульс частинок, що беруть участь у зіткненні, амплітуда розсіювання може сказати вам імовірність того, що вони відреагують певним чином.
Чим точніше передбачення, тим детальніше його можна порівняти з результатами експериментів, таких як Великий адронний колайдер (LHC). Щойно з'являється відхилення, воно може бути підказкою про нову фізику, наприклад, про природу темної матерії або про те, чому матерія та антиматерія у Всесвіті асиметричні.
Проблема в тому, що амплітуди розсіювання надзвичайно важко обчислити точно, і фізики майже можуть робити лише наближення. Вони нашаровують обчислення за «петлями»; кількість петель приблизно вимірює, наскільки складними можуть бути взаємодії між частинками. Кожна додаткова петля наближає відповідь до істинного значення, але обсяг обчислень також різко зростає. У початковому тексті завдання фон Гіппель писав, що складність таких обчислень зазвичай зростає експоненційно або навіть факторіально з кількістю петель.
Тож насправді переважна більшість амплітуд розсіювання обчислюється лише до двох петель, а деякі можуть сягати трьох петель. Найточніше передбачення у фізиці частинок — аномальний магнітний момент електрона — використовувало п'ять петель.
Теорія N=4 супер-Янга-Міллса — це особлива іграшкова модель у цій галузі. «Янга-Міллса» — це теоретична основа, що описує три фундаментальні взаємодії: електромагнетизм, сильну ядерну силу та слабку ядерну силу; «N=4 суперсиметрія» означає, що кожна частинка має чотири суперсиметричні партнери. Частинок так багато, що це нереалістично; ця теорія не описує реальний світ. Але саме цей високий ступінь симетрії змушує багато комбінацій змінних взаємно скорочуватися, роблячи обчислення відносно керованими. Дослідники відточують тут нові методи, щоб побачити, як далеко вони можуть зайти.
Метод, використаний цього разу, називається «бутстрап». фон Гіппель порівняв його з судоку: спочатку виписуються всі можливі форми відповіді, записуються у комп'ютерні файли за допомогою спеціального «алфавіту», потім за допомогою всіх відомих обмежень їх виключають одну за одною, включаючи передбачення з інших методів, правила, яким відповідь має підкорятися, та відомі результати зі споріднених задач. В ідеалі врешті-решт лише один кандидат проходить усі перевірки, і залишаються додаткові перевірки, щоб підтвердити, що не було зроблено помилок.
Рекорд у вісім петель було отримано Діксоном в обхід. У 2023 році він та Ю-Тін Лю використали своєрідну симетрію під назвою «антиподальна дуальність», щоб спочатку обчислити відносно легший «формфактор», а потім перетворити його на амплітуду з вісьмома петлями. Протягом кількох наступних років його команда не зводила очей з дев'яти петель, плануючи йти тим самим непрямим шляхом. На його думку, безпосереднє обчислення амплітуди з дев'ятьма петлями було надто складним.
Варто зазначити, що сам фон Гіппель є ветераном цієї лінії досліджень. Раніше він співпрацював з Діксоном та іншими, щоб просунути шестичастинкову амплітуду до шести та семи петель. Іншими словами, він обрав кістку, яку сам гриз.
Один запит, а потім просто повторюй «продовжуй»
Наприкінці серпня двоє фізиків з Anthropic, Ліам Фіцпатрік і Сіддгарт Мішра-Шарма, зв'язалися з фон Гіппелем і повідомили йому, що завдання було подолано.
Вони використали модель Fable 5.1, що працює на платформі Claude Science. У статті фон Гіппель пояснив, що Claude Science — це свого роду «упряж», тобто обгортання структурованих правил і підказок навколо великої моделі, щоб змусити її працювати надійніше над науково-дослідницькими завданнями.
Згідно зі статтею, двоє спочатку запитали Claude, у якому завданні він найбільш впевнений, а потім дали лише дуже короткий опис завдання: обчислити шестичастинкову (гексагональну) амплітуду з дев'ятьма петлями в планарній N=4 SYM.
Після цього «керівництво дослідженням» здебільшого полягало в тому, щоб просто дозволити йому продовжувати. Типова інструкція, розкрита у статті, звучала приблизно так: я йду спати, мене не буде наступні кілька годин, продовжуй працювати, поки я не скажу тобі зупинитися, і звітуй про прогрес кожні чотири-шість годин.
Зрештою, Claude обчислив це двічі, кожного разу в інший спосіб: спочатку прямим бутстрап-методом, а потім непрямим шляхом через формфактори, які використовувала команда Діксона. Згідно зі статтею, кожен із цих способів коштував кінцевому користувачеві приблизно від однієї до двох тисяч доларів, причому більшу частину становила вартість тривалого запуску самої моделі. Частина з бутстрап-обчисленнями була виконана за допомогою Python та бібліотеки символьних обчислень SymPy, що склало лише близько 100 доларів, що еквівалентно роботі 96 процесорів протягом тижня.
фон Гіппель пошкодував, що коли він займався такого роду дослідженнями десять років тому, робота 96 процесорів протягом тижня була значним вкладенням, тоді як тепер, за наявності достатніх підстав, такий обсяг ресурсів цілком доступний.
Відчуття перевіряючого: наче суфле, що опало
Наприкінці статті є післямова, написана самим Діксоном, під назвою «Як це — коли тебе випередила машина».
Він написав, що 1 вересня двоє дослідників з Anthropic повідомили йому, що Claude обчислив дев'ятипетльову амплітуду, і попросили його перевірити результат. Для нього той момент став тим, коли ідея про те, що великі мовні моделі змінюють фізику, «по-справжньому дійшла до нього».
Діксона вразила не стільки масштабність обчислення, скільки крихкість усього процесу. За його описом, якби якась одна частина цього рецепту обчислення пішла не так, весь результат розвалився б, наче невдале суфле, і дослідникові довелося б повертатися назад і ретельно шукати помилку. Більше того, багато деталей побудови були настільки нудними, що їх не стали б повністю записувати в статтю, а це означало, що Claude мав створити весь код з нуля.
Оскільки досить легко вивести дев'ятипетльовий формфактор з дев'ятипетльової амплітуди, Діксон переважно здійснював перевірку саме цим шляхом. Це також призвело до дещо делікатної ситуації: те, що він перевіряв два тижні, було саме тією метою, до якої його власна команда прагнула протягом кількох років.
Він визнав, що не відчував розчарування, з двох причин.
Його команда вже використовувала спеціальні моделі Transformer для передбачення результатів на вищих порядках петель і навіть висунула гасло, суть якого зводилася до того, що якщо машина дає ймовірну відповідь, у них є повний набір інструментів для її перевірки.
Під час розв'язування задачі Claude використав саме ті методи, які Діксон та його співробітники розробляли протягом багатьох років, і навіть формат представлення результатів відповідав їхнім усталеним домовленостям. На його думку, поки він перевіряв Claude, Claude також перевіряв усю їхню попередню роботу. Це також є джерелом його зауваження, що «Claude розуміє наші статті краще, ніж будь-хто інший».
Але серед похвал Діксон також сказав, що, на його думку, момент, який справді змусить людей не спати ночами, настане тоді, коли модель запропонує нові фізичні принципи та ідеї раніше за людей.
Китайська команда прийшла майже одночасно
У цієї історії є також паралельна лінія, і вона пов'язана з Китаєм.
Лише через кілька днів після того, як Anthropic зв'язалася з фон Гіппелем, Сун Хе з Інституту теоретичної фізики Китайської академії наук також вийшов на зв'язок: його дослідницька група вже отримала більшу частину дев'ятипетльового результату. 17 вересня Сун Хе, Цзіжун Цзін і Сян Лі публічно оприлюднили на Zenodo набір даних під назвою «Символ шестиглюонних MHV-амплітуд аж до дев'яти петель», що охоплює символьні дані від двох до дев'яти петель.
https://zenodo.org/records/22800071
Згідно з описами фон Гіппеля та Діксона, команда Сун Хе також використовувала допомогу ШІ на основі GPT-6, але лише для обчислення деяких обмежень, тоді як загальну структуру все ще будували люди. Це цілком відрізняється від майже повністю автоматизованого підходу Anthropic «один запит плюс повторюване continue».
У постскриптумі Діксон пожартував із себе: протягом двох тижнів його обійшли спочатку «машина», а потім «люди плюс машини».
фон Гіппель окремо зазначив, що атмосфера між сторонами була досить дружньою. Далі Діксон, Сун Хе та їхні співавтори опублікують ці результати та нададуть докладні пояснення й аналіз для майбутніх дослідників.
Ретроспектива претендента: низько висячих плодів більше, ніж здавалося
Повернімося до самого фон Гіппеля. Коли він спочатку ставив завдання, він хотів використати знайому йому галузь, щоб відповісти на це питання: чи може ШІ насправді обійти ті обчислювальні вузькі місця, які всі вважають непереборними?
Логіка в його початковому тексті завдання була такою: всі зовні сперечаються, чи може ШІ продукувати справді нові ідеї, але наскільки важко знайти ідеї, стає відомо лише після того, як їх знайдено; складність обчислень є більш «конкретною». Багато апокаліптичних сценаріїв щодо надінтелекту — від симуляції людських розумів, щоб маніпулювати серцями людей, до проєктування наномашин із перших принципів — критики зустрічають стандартним запереченням, що обчислювальної потужності недостатньо. Якщо ШІ може використати ресурси академічного рівня, щоб розв’язати проблему, яку загалом визнають обчислювально обмеженою, це справді було б приводом для занепокоєння.
А результат? Висновок фон Гіппеля дуже відвертий: цього разу не з’явилося того «прориву обчислювального бар’єра несподіваним способом», на який він сподівався.
Claude використав відомі методи, лише з дещо більшою обчислювальною потужністю, ніж люди раніше були готові вкласти. Можливо, йому допомогло використання Python, а не Maple чи Mathematica, до яких звикли фізики, а його практики програмної інженерії також могли бути більш стандартизованими, ніж у людських дослідників, але він не досяг рівня «надінтелекту». Те, що команда Сун Хе прийшла майже одночасно, також з іншого кута показує, що ця мета не є недосяжною для людей.
Його найбільший висновок із цього такий: навіть якщо мета проста й зрозуміла, речі, які в очах експертів здаються недосяжними, насправді можуть бути не такими вже й складними, і низько висячих плодів більше, ніж очікувалося. Роками друзі з комп’ютерним бекграундом казали йому, що дослідники амплітуд могли б досягти великого прогресу, просто найнявши кількох програмістів, і фон Гіппель визнав, що ці люди тепер можуть відчувати, що були праві.
Але він також наголосив на іншому боці. Такі обчислення нудні й безладні, і якби він сам використав 96 процесорів для тижневого запуску, він майже напевно затягнув би це до двох тижнів через першу ж помилку. Claude Science, однак, пройшов це за один раз майже без наукового нагляду, не покладаючись на внесок жодних зовнішніх співавторів. Його порада тим, хто досі вважає, що ШІ повний помилок і не здатен упоратися із завданням, така: таку роботу він тепер може надійно виконувати.
Він також зробив поздовжнє порівняння. У березні цього року в експерименті Anthropic «vibe physics» ШІ, виконуючи фізичні проєкти, ще був як студент: малі масштаби завдань, потреба в багаторазовому керівництві та часті помилки. Пів року потому те, що він завершив, уже було передовими обчисленнями, до яких торкаються лише найкращі експерти в галузі амплітуд. Він не виключав, що це випадково виявилася проблема, особливо придатна для ШІ, але він оцінив, що сама технологія справді стала сильнішою.
Щодо того, чи можна це узагальнити, фон Гіппель залишається обережним. Іграшкові моделі на кшталт N=4 зазвичай належать дуже вузькому дослідницькому колу, тоді як обчислення амплітуд для реального світу є набагато більш конкурентними, де низько висячих плодів може бути ще менше. Але він також нагадує дослідникам, які виконують ці обчислення, що якщо вони ще не пробували дати платформі досліджень ШІ одноразово взятися за передові обчислення, їм варто спробувати, і водночас бути готовими до плану перевірки результатів. Він не надто здивувався б, якби хтось зміг вичавити ще одну петлю в межах розумного бюджету.
Останні думки
Якщо повернути цю справу в контекст вересня, вона стає ще цікавішою.
8-го числа цього місяця OpenAI оголосила, що її нерозкрита модель мобілізувала десятки тисяч ШІ-агентів і створила контрприклад до проблеми існування та гладкості рівнянь Нав’є — Стокса, яка є однією з проблем тисячоліття; результат досі перебуває на розгляді математичної спільноти. Порівняно з тією «масштабною армійською операцією» з використанням величезної обчислювальної потужності, історія амплітуди з дев’ятьма петлями виглядає набагато скромніше: комерційна дослідницька платформа, один опис завдання, кілька тисяч доларів і кілька днів.
І саме тому, що вона скромна, вона може заслуговувати на більшу увагу з боку академічних кіл. фон Гіппель зрештою визнав, що спочатку сподівався використати цей виклик, щоб зазирнути в майбутнє, побачити якийсь безпрецедентно новий метод обчислення і тим самим отримати засноване на доказах судження в дискусії про надінтелект. Але відповідь, яку він отримав, полягала в тому, що його попереднє розуміння того, де лежать межі, було надто наївним.
А питання, яке залишив Діксон, досі висить у повітрі: коли великі моделі вже не просто виконують рецепти, написані людьми, а починають пропонувати нові фізичні принципи раніше за людей, як мають позиціонувати себе фізики?
© THE END
Ця стаття походить із публічного акаунта WeChat «Machine Heart» (ID: almosthuman2014), автор: Machine Heart












