Editor|Panda
Un récord computacional en física teórica que se había mantenido durante tres años ha sido roto por la IA.
Hace unas horas, Anthropic anunció: Claude, en la plataforma de investigación Claude Science, se ejecutó de forma continua durante varios días esencialmente sin supervisión y calculó la amplitud de dispersión de seis partículas a nueve bucles en la teoría de super-Yang-Mills N=4 planar.
Este es un problema fronterizo reconocido en el campo de la física teórica conocido como "amplitudes de dispersión". Anteriormente, el récord más alto en este modelo se situaba en ocho bucles, establecido en 2023 por Lance Dixon del Laboratorio Nacional de Aceleradores SLAC y sus colaboradores.
Este avance fue verificado personalmente por el creador del récord de ocho bucles. Dixon verificó de forma independiente el resultado de Claude y comentó que el hecho de que un modelo de lenguaje grande pudiera ejecutar cada paso de esta compleja receta y organizar el cálculo era, en su opinión, "una victoria bastante notable". Incluso dijo abiertamente que, aparte de sus colaboradores, Claude entiende los dos artículos de su equipo de 2019 y 2023 mejor que nadie.
Aún más sorprendente es el proceso y el costo. Los investigadores le dieron a Claude solo una descripción de tarea de una frase, y después de eso la "orientación" no fue casi nada más que "continúa"; todo el cálculo, convertido a los costos de un usuario común, fue de aproximadamente mil a dos mil dólares, de los cuales la parte realmente utilizada para el cálculo numérico fue de solo unos 100 dólares, equivalente a 96 CPU funcionando durante una semana. Sin embargo, Dixon había pensado originalmente que calcular directamente la amplitud de nueve bucles era demasiado difícil, y su equipo había estado preparándose para ello durante varios años.
El punto de partida de este avance fue un "desafío" público.
El 7 de agosto, el ex físico teórico y comunicador científico Matt von Hippel publicó un artículo algo provocador en su blog 4gravitons, titulado "Solo la IA que entra en mi campo cuenta". En él, lanzó explícitamente un desafío a las empresas de IA: usar potencia de cálculo que un académico pueda permitirse para resolver un problema importante no resuelto en el campo de las amplitudes de dispersión.
Dio dos opciones: o calcular la supergravedad N=8 a siete bucles, o calcular la amplitud de seis partículas en la teoría de super-Yang-Mills N=4 a nueve bucles.
Un mes después, la IA completó el ajuste. Lo que Anthropic acaba de publicar es precisamente un artículo invitado escrito por el propio von Hippel, titulado: "Sí, Claude puede hacer nueve bucles".
https://www.anthropic.com/research/yes-claude-can-do-nine-loops
Nueve bucles, ¿dónde está la dificultad?
Para comprender el peso de este asunto, primero hay que aclarar qué están calculando los físicos.
Los físicos de partículas predicen el comportamiento de las partículas utilizando una clase de fórmulas llamadas "amplitudes de dispersión": dada la energía y el momento de las partículas involucradas en una colisión, la amplitud de dispersión puede decirte la probabilidad de que reaccionen de cierta manera.
Cuanto más precisa sea la predicción, más detallada podrá ser la comparación con los resultados de experimentos como el Gran Colisionador de Hadrones (LHC). Una vez que aparece una desviación, podría ser una pista de nueva física, como la naturaleza de la materia oscura, o por qué la materia y la antimateria en el universo son asimétricas.
El problema es que las amplitudes de dispersión son extremadamente difíciles de calcular con precisión, y los físicos casi solo pueden hacer aproximaciones. Estratifican los cálculos por "bucles"; el número de bucles mide aproximadamente cuán complejas se permite que sean las interacciones entre partículas. Cada bucle adicional acerca la respuesta al valor verdadero, pero la cantidad de cálculo también se expande drásticamente. En el texto original del desafío, von Hippel escribió que la complejidad de tales cálculos generalmente crece exponencialmente o incluso factorialmente con el número de bucles.
Así que, en realidad, la gran mayoría de las amplitudes de dispersión solo se calculan hasta dos bucles, y unas pocas pueden alcanzar tres bucles. La predicción más precisa en física de partículas, el momento magnético anómalo del electrón, utilizó cinco bucles.
La teoría N=4 super-Yang-Mills es un modelo de juguete especial en este campo. "Yang-Mills" es el marco teórico que describe las tres interacciones fundamentales: el electromagnetismo, la fuerza nuclear fuerte y la fuerza nuclear débil; "N=4 supersimetría" significa que cada partícula está emparejada con cuatro compañeras supersimétricas. Hay tantas partículas que no es realista; esta teoría no describe el mundo real. Pero es precisamente este alto grado de simetría lo que hace que muchas combinaciones de variables se cancelen entre sí, haciendo que los cálculos sean relativamente manejables. Los investigadores perfeccionan nuevos métodos aquí para ver hasta dónde pueden llegar.
El método utilizado esta vez se llama "bootstrap". von Hippel lo comparó con el Sudoku: primero escribe todas las formas posibles de la respuesta, las registra en archivos de computadora usando un "alfabeto" especial, luego usa todas las restricciones conocidas para eliminarlas una por una, incluyendo predicciones de otros métodos, reglas que la respuesta debe obedecer y resultados conocidos de problemas relacionados. Idealmente, al final solo un candidato pasa todas las verificaciones, y quedan verificaciones adicionales para confirmar que no se cometieron errores.
El récord de ocho bucles se obtuvo tomando un desvío. En 2023, él y Yu-Ting Liu utilizaron una simetría peculiar llamada "dualidad antípoda" para calcular primero el "factor de forma" relativamente más fácil, y luego convertirlo en la amplitud de ocho bucles. Durante varios años después, su equipo mantuvo la vista en nueve bucles, planeando seguir la misma ruta indirecta. En su opinión, calcular directamente la amplitud de nueve bucles era demasiado difícil.
Vale la pena mencionar que von Hippel mismo es un veterano de esta línea de investigación. Anteriormente había colaborado con Dixon y otros para llevar la amplitud de seis partículas a seis bucles y siete bucles. En otras palabras, eligió un hueso que él mismo había roído.
Un prompt, luego seguir diciendo "continuar"
A finales de agosto, dos físicos de Anthropic, Liam Fitzpatrick y Siddharth Mishra-Sharma, contactaron a von Hippel y le dijeron que el desafío había sido conquistado.
Utilizaron el modelo Fable 5.1, ejecutándose en la plataforma Claude Science. En el artículo, von Hippel explicó que Claude Science es una especie de "arnés", es decir, envolver reglas estructuradas y prompts alrededor de un modelo grande para que funcione de manera más robusta en tareas de investigación científica.
Según el artículo, los dos primero preguntaron a Claude en qué desafío tenía más confianza, y luego dieron solo una descripción de tarea muy breve: calcular la amplitud de seis partículas (hexágono) a nueve bucles en N=4 SYM planar.
Después de eso, la "guía de investigación" básicamente consistió en dejarlo seguir adelante. Una instrucción típica revelada en el artículo decía más o menos así: me voy a dormir, estaré fuera durante las próximas horas, sigue trabajando hasta que te diga que pares, e informa del progreso cada cuatro a seis horas.
Al final, Claude lo calculó una vez de cada una de dos maneras: primero, el método bootstrap directo, y segundo, la ruta indirecta a través de factores de forma utilizada por el equipo de Dixon. Según el artículo, cualquiera de las dos costó al usuario final aproximadamente entre mil y dos mil dólares, siendo la mayor parte el costo de ejecutar el modelo en sí durante mucho tiempo. La parte del cálculo bootstrap se realizó con Python y la biblioteca de computación simbólica SymPy, representando solo unos 100 dólares, equivalente a 96 CPU funcionando durante una semana.
von Hippel lamentó que cuando hizo este tipo de investigación hace diez años, 96 CPU funcionando durante una semana era una inversión considerable, mientras que ahora, siempre que haya suficiente razón, esta cantidad de recursos es bastante asequible.
La sensación del verificador: como un suflé colapsado
Al final del artículo hay un epílogo escrito por el propio Dixon, titulado "Qué se siente al ser superado por una máquina".
Escribió que el 1 de septiembre, los dos investigadores de Anthropic le dijeron que Claude había calculado la amplitud de nueve bucles y le pidieron que verificara el resultado. Para él, ese momento fue cuando la idea de que los grandes modelos de lenguaje cambian la física "realmente aterrizó en él".
Lo que impresionó a Dixon no fue tanto la escala del cálculo como la fragilidad de todo el proceso. Según su descripción, si alguna parte de esta receta de cálculo salía mal, todo el resultado colapsaría como un suflé fallido, y el investigador tendría que volver atrás y solucionar problemas laboriosamente. Además, muchos de los detalles de construcción eran tan tediosos que no se escribirían completamente en un artículo, lo que significaba que Claude tenía que construir todo el código desde cero.
Dado que es relativamente fácil inferir el factor de forma de nueve bucles a partir de la amplitud de nueve bucles, Dixon realizó principalmente la verificación por esta ruta. Esto también condujo a una situación un poco delicada: lo que pasó dos semanas verificando era precisamente el objetivo que su propio equipo había estado persiguiendo durante varios años.
Admitió que no se sintió frustrado, por dos razones.
Su equipo ya había estado utilizando modelos Transformer personalizados para predecir resultados en órdenes de bucle más altos, e incluso habían presentado un eslogan que decía algo así como que siempre que la máquina dé una respuesta candidata, tienen un conjunto completo de herramientas para verificarla.
Al resolver el problema, Claude utilizó exactamente los métodos que Dixon y sus colaboradores habían desarrollado durante muchos años, e incluso el formato de presentación de los resultados siguió sus convenciones existentes. En su opinión, mientras él verificaba a Claude, Claude también verificaba todo su trabajo pasado. Este es también el origen de su comentario de que "Claude entiende nuestros artículos mejor que nadie"
Pero en medio de los elogios, Dixon también dijo que, en su opinión, el momento que realmente hará que la gente se dé vueltas en la cama llegará cuando un modelo proponga nuevos principios e ideas físicas antes que los humanos.
Un equipo chino llegó casi simultáneamente
También hay un hilo paralelo en esta historia, y está relacionado con China.
Solo unos días después de que Anthropic contactara a von Hippel, Song He del Instituto de Física Teórica de la Academia de Ciencias de China también se puso en contacto: su grupo de investigación ya había obtenido la mayor parte del resultado de nueve bucles. El 17 de septiembre, Song He, Jirong Jing y Xiang Li publicaron públicamente un conjunto de datos en Zenodo titulado "El símbolo de amplitudes MHV de seis gluones hasta nueve bucles", que cubre datos de símbolos desde dos bucles hasta nueve bucles.
https://zenodo.org/records/22800071
Según las descripciones de von Hippel y Dixon, el equipo de Song He también utilizó asistencia de IA basada en GPT-6, pero solo para calcular algunas de las restricciones, mientras que el marco general todavía fue construido por humanos. Esto es completamente diferente de la ruta casi totalmente automatizada de Anthropic de "un prompt más continue repetido".
En el epílogo, Dixon se burló de sí mismo: en dos semanas había sido superado primero por "una máquina" y luego por "humanos más máquinas".
von Hippel mencionó específicamente que el ambiente entre las partes era bastante amistoso. A continuación, Dixon, Song He y sus colaboradores publicarán estos resultados y proporcionarán explicaciones y análisis detallados para investigadores posteriores.
La retrospectiva del desafiante: hay más frutos al alcance de la mano de lo que se imaginaba
Volviendo a von Hippel. Cuando originalmente planteó el desafío, quería usar un campo que conocía bien para responder a esta pregunta: ¿puede la IA realmente eludir esos cuellos de botella computacionales que todos asumen que son insuperables?
La lógica en su texto de desafío original era la siguiente: todos afuera debaten si la IA puede producir ideas genuinamente nuevas, pero cuán difíciles de encontrar son las ideas solo se sabe después de encontrarlas; la dificultad de la computación es más "concreta". Muchos escenarios apocalípticos sobre la superinteligencia, desde simular mentes humanas para manipular los corazones de las personas hasta diseñar nanomáquinas desde primeros principios, son recibidos por los críticos con la refutación estándar de que no hay suficiente potencia de cómputo. Si la IA puede usar recursos de nivel académico para resolver un problema reconocido generalmente como limitado por la computación, eso sería realmente motivo de preocupación.
¿Y el resultado? La conclusión de von Hippel es muy franca: esta vez no apareció ese tipo de "superación de la barrera computacional de manera inesperada" que él esperaba.
Claude utilizó métodos conocidos, solo que con algo más de potencia de cómputo de la que los humanos habían estado dispuestos a invertir previamente. Puede haberse beneficiado de usar Python en lugar de Maple o Mathematica, que los físicos están acostumbrados a usar, y sus prácticas de ingeniería de software también pueden haber sido más estandarizadas que las de los investigadores humanos, pero no alcanzó el nivel de "superinteligencia". El hecho de que el equipo de Song He llegara casi simultáneamente también muestra desde otro ángulo que este objetivo no está fuera del alcance humano.
Su mayor conclusión de esto es: incluso si el objetivo es simple y claro, las cosas que parecen fuera de alcance a los ojos de los expertos pueden en realidad no ser tan difíciles, y hay más frutos al alcance de la mano de lo esperado. Durante años, amigos con formación en informática le habían dicho que los investigadores de amplitudes podrían lograr grandes avances simplemente contratando a unos pocos programadores más, y von Hippel admitió que estas personas ahora pueden sentir que tenían razón.
Pero también enfatizó el otro lado. Este tipo de computación es tediosa y desordenada, y si él mismo hubiera usado 96 CPU para ejecutar durante una semana, casi con certeza lo habría arrastrado a dos semanas debido a un primer error. Claude Science, sin embargo, lo ejecutó de una sola vez con casi ninguna supervisión científica, sin depender de aportes de ningún colaborador externo. Su consejo para aquellos que todavía piensan que la IA está llena de errores y no está a la altura de la tarea es: este tipo de trabajo, ahora puede completarlo de manera confiable.
También hizo una comparación longitudinal. En marzo de este año, en el experimento de "vibe physics" de Anthropic, la IA haciendo proyectos de física todavía era como un estudiante, con escalas de tareas pequeñas, requiriendo mucha orientación y cometiendo errores con frecuencia. Medio año después, lo que completó ya era computación de frontera que solo los mejores expertos en el campo de amplitudes tocarían. No descartó que esto haya sido casualmente un problema especialmente adecuado para la IA, pero juzgó que la tecnología en sí misma ciertamente se había vuelto más fuerte.
En cuanto a si puede generalizarse, von Hippel se mantiene cauteloso. Los modelos de juguete como N=4 generalmente pertenecen a un círculo de investigación muy pequeño, mientras que los cálculos de amplitudes para el mundo real son mucho más competitivos, donde los frutos al alcance de la mano pueden ser aún más escasos. Pero también les recuerda a los investigadores que hacen estos cálculos que si aún no han intentado que una plataforma de investigación de IA haga un intento único en cálculos de frontera, deberían probarlo, y al mismo tiempo estar preparados con un plan para verificar los resultados. No se sorprendería demasiado si alguien pudiera exprimir un bucle más dentro de un presupuesto razonable.
Reflexiones finales
Poner este asunto de nuevo en el contexto de septiembre lo hace aún más interesante.
El día 8 de este mes, OpenAI anunció que su modelo no divulgado movilizó decenas de miles de agentes de IA y produjo un contraejemplo al problema de existencia y suavidad de las ecuaciones de Navier-Stokes, que es uno de los Problemas del Milenio; el resultado aún está bajo revisión por la comunidad matemática. En comparación con ese tipo de "operación militar a gran escala" que utiliza una potencia de cómputo masiva, la historia de la amplitud de nueve bucles parece mucho más modesta: una plataforma de investigación comercial, una única descripción de tarea, unos pocos miles de dólares y unos pocos días.
Y precisamente porque es modesto, puede merecer más atención por parte del mundo académico. von Hippel finalmente admitió que originalmente había esperado utilizar este desafío para vislumbrar el futuro, para ver algún método de computación nuevo sin precedentes, y así obtener un juicio basado en evidencia en el debate sobre la superinteligencia. Pero la respuesta que obtuvo fue que su comprensión previa de dónde estaban los límites había sido demasiado ingenua.
Y la pregunta que Dixon dejó atrás todavía queda en el aire: cuando los grandes modelos ya no se limitan a ejecutar recetas escritas por humanos, sino que comienzan a proponer nuevos principios físicos antes que los humanos, ¿cómo deberían posicionarse los físicos?
© THE END
Este artículo proviene de la cuenta pública de WeChat "Machine Heart" (ID: almosthuman2014), autor: Machine Heart












