Кратко

  • OpenAI опубликовала 722 математических рукописи в 372 семействах результатов на GitHub, созданных с помощью невыпущенной внутренней модели.
  • Только 162 из 722 статей имеют основной результат, формализованный в Lean, и OpenAI предупреждает, что некоторые неформализованные результаты могут содержать ошибки.
  • Эндрю Сазерленд из MIT говорит, что утверждение об одном запросе и одном агенте не подтверждено до выпуска модели, а в релизе отсутствуют запросы, которые рекомендовала раскрыть консультативная группа Института перспективных исследований.

Во вторник OpenAI опубликовала 722 математических рукописи на GitHub, все они были созданы внутренней моделью, которую компания не выпустила. Представитель OpenAI сказал, что почти всё было получено с помощью одного запроса, переданного одному ИИ-агенту, хотя в некоторых случаях могло потребоваться несколько попыток.

Это смелое заявление и потенциально значительный прорыв в области математики. Но не все в восторге и не все верят в этот ажиотаж.

Myriad: Как высоко поднимется Nvidia? Нажмите, чтобы сделать свой прогноз.
Myriad: Как высоко поднимется Nvidia? Нажмите, чтобы сделать свой прогноз.

«До тех пор, пока они не выпустят модель и люди не смогут воспроизвести их результаты, я считаю, что любые заявления о решении проблем одним агентом с первого раза следует рассматривать как непроверенные», — заявил Эндрю Сазерленд, математик из MIT, в интервью Scientific American. «Мы должны требовать доказательств», — сказал он.

Работы сгруппированы в 372 «семейства» связанных результатов, и семейство может объединять основную теорему с сопутствующими аргументами, следствиями или альтернативными доказательствами. Таким образом, 722 — это количество рукописей, а не решённых задач. OpenAI утверждает, что предложила модели примерно 4000 задач и сохранила те результаты, которые сочла достаточно значимыми для публикации.

Средний результат потребовал вычислительных затрат, эквивалентных примерно трём часам работы ChatGPT Pro, по данным OpenAI. Заявление о Навье-Стоксе в прошлом месяце выглядело совсем иначе: 10 000 координирующих агентов работали в течение 88 часов.

OpenAI опубликовала сокращённые резюме рассуждений для 10 из результатов. При этом, согласно каталогу формализации в репозитории, только 162 из 722 работ сопровождаются проверенным компьютером основным результатом. Это около 22% коллекции, переведённых на Lean — программное обеспечение, которое механически проверяет каждый логический шаг.

Сама OpenAI говорит, что не все рукописи имеют формализации на Lean и что «некоторые неформализованные результаты могут иметь проблемы». Иными словами, многое из того, что они опубликовали, может быть ошибочным.

Успешная проверка в Lean подтверждает лишь то, что доказательство следует из утверждения, записанного на Lean. Она не показывает, что утверждение соответствует исходной задаче или что результат является новым или важным, — именно это математикам теперь и предстоит оценивать.

И вот здесь исследователи поднимают брови.

«Сейчас сложилась ситуация, когда ИИ может выдавать математические аргументы в случаях, когда человек, задавший ему запрос, не способен понять эти аргументы, проверить их или нести за них ответственность», — заявил в своём заявлении Институт перспективных исследований в Принстоне, штат Нью-Джерси. «Мы считаем, что человеческое понимание математики остаётся первостепенно важным. Как в эту новую эпоху мы можем двигаться к новой парадигме, которая включает человеческое понимание математики как часть ответственного научного результата?»

Другие, однако, как профессор Абхишек Саха, весьма воодушевлены. «Это очень большой день для математики», — написал он, но отметил, что большинство задач относятся к категориям «исключительных достижений в рамках существующей программы» или «неожиданных прорывов».

Это означает, что большинство задач в наборе интересны, но не невозможны и не меняют правила игры, как проблемы тысячелетия. Это место зарезервировано ровно для одной задачи из 722: квази-гипотезы Римана.

Релиз также не соответствует тому, что консультативная группа в Институте перспективных исследований рекомендовала 29 сентября: название модели, промпты, обобщённую цепочку рассуждений, затраченное время и вычислительную стоимость для каждого результата. OpenAI опубликовала средние показатели вычислений и 10 резюме рассуждений, но не промпты, и заявляет, что всё ещё работает над ответственным выпуском модели.

Дэниел Литт, математик из Университета Торонто, придерживался противоположной точки зрения, утверждая, что нет причин просить компанию держать ответы на эти математические вопросы в секрете.

Anthropic пошла другим путём со своим проверенным в Lean доказательством Великой теоремы Ферма в прошлом месяце, опубликовав все 13 миллионов строк публично на GitHub. Это доказательство формализовало теорему, опубликованную Эндрю Уайлсом в 1995 году, а не заявляло о новых результатах.

OpenAI заявляет, что будет добавлять формализации в Lean по мере их получения; на данный момент они есть у 162 из 722 рукописей.