Claude faz avanço em física teórica com uma única frase e alguns milhares de dólares

AnthropicClaudeautomação de pesquisa científicafísica teóricaamplitude de espalhamentoIA
há 1 horaFonte: blockweeks.com
Claude faz avanço em física teórica com uma única frase e alguns milhares de dólares

Editor|Panda

Um recorde computacional em física teórica que se mantinha há três anos foi quebrado pela IA.

Algumas horas atrás, a Anthropic anunciou: Claude, na plataforma de pesquisa Claude Science, rodou continuamente por vários dias essencialmente sem supervisão e calculou a amplitude de espalhamento de seis partículas em nove loops na teoria N=4 super-Yang-Mills planar.

Theoretical Physics

Este é um problema de fronteira reconhecido no campo da física teórica conhecido como "amplitudes de espalhamento". Anteriormente, o recorde mais alto neste modelo era de oito loops, estabelecido em 2023 por Lance Dixon, do SLAC National Accelerator Laboratory, e colaboradores.

Este avanço foi pessoalmente verificado pelo criador do recorde de oito loops. Dixon verificou independentemente o resultado de Claude e comentou que um modelo de linguagem de grande porte ser capaz de executar cada etapa desta receita complexa e organizar o cálculo era, em sua opinião, "uma vitória bastante notável". Ele até disse abertamente que, além de seus colaboradores, Claude entende os dois artigos de sua equipe de 2019 e 2023 melhor do que qualquer outra pessoa.

Ainda mais surpreendente é o processo e o custo. Os pesquisadores deram a Claude apenas uma descrição de tarefa de uma frase, e depois disso a "orientação" foi quase nada mais do que "continue"; todo o cálculo, convertido para os custos de um usuário comum, foi de cerca de mil a dois mil dólares, dos quais a parte realmente usada para computação numérica foi de apenas cerca de US$ 100, equivalente a 96 CPUs rodando por uma semana. No entanto, Dixon originalmente pensava que calcular diretamente a amplitude de nove loops era muito difícil, e sua equipe vinha se preparando para isso por vários anos.

Theoretical Physics

O ponto de partida deste avanço foi um "desafio" público.

Em 7 de agosto, o ex-físico teórico e comunicador científico Matt von Hippel publicou um artigo um tanto provocativo em seu blog 4gravitons, intitulado "Only AI Entering My Field Counts". Nele, ele explicitamente lançou um desafio às empresas de IA: usar poder computacional que um acadêmico pode pagar para resolver um grande problema não resolvido no campo das amplitudes de espalhamento.

Theoretical Physics

Ele deu duas opções: ou calcular N=8 supergravidade até sete loops, ou calcular a amplitude de seis partículas na teoria N=4 super-Yang-Mills até nove loops.

Um mês depois, a IA completou o ajuste. O que a Anthropic acabou de publicar é precisamente um artigo convidado escrito pelo próprio von Hippel, intitulado: "Yes, Claude Can Do Nine Loops".

Theoretical Physics

https://www.anthropic.com/research/yes-claude-can-do-nine-loops

Nove loops, onde está a dificuldade?

Para entender o peso desse assunto, é preciso primeiro esclarecer o que os físicos estão calculando.

Físicos de partículas preveem o comportamento das partículas usando uma classe de fórmulas chamadas "amplitudes de espalhamento": dados a energia e o momento das partículas envolvidas em uma colisão, a amplitude de espalhamento pode dizer a probabilidade de que elas reajam de uma certa maneira.

Quanto mais precisa a previsão, mais detalhada pode ser a comparação com resultados de experimentos como o Grande Colisor de Hádrons (LHC). Assim que surge um desvio, ele pode ser uma pista de nova física, como a natureza da matéria escura, ou por que matéria e antimatéria no universo são assimétricas.

O problema é que as amplitudes de espalhamento são extremamente difíceis de calcular com precisão, e os físicos quase só conseguem fazer aproximações. Eles estratificam os cálculos por "loops"; o número de loops mede aproximadamente quão complexas as interações entre partículas podem ser. Cada loop adicional aproxima a resposta do valor verdadeiro, mas a quantidade de computação também se expande drasticamente. No texto original do desafio, von Hippel escreveu que a complexidade de tais cálculos geralmente cresce exponencialmente ou até fatorialmente com o número de loops.

Então, na realidade, a grande maioria das amplitudes de espalhamento é calculada apenas até dois loops, e algumas conseguem chegar a três loops. A previsão mais precisa da física de partículas, o momento magnético anômalo do elétron, usou cinco loops.

A teoria N=4 super-Yang-Mills é um modelo de brinquedo especial nesse campo. "Yang-Mills" é o arcabouço teórico que descreve as três interações fundamentais: eletromagnetismo, força nuclear forte e força nuclear fraca; "supersimetria N=4" significa que cada partícula é pareada com quatro parceiros supersimétricos. Há tantas partículas que isso não é realista; essa teoria não descreve o mundo real. Mas é justamente esse alto grau de simetria que faz muitas combinações de variáveis se cancelarem mutuamente, tornando os cálculos relativamente administráveis. Os pesquisadores aperfeiçoam novos métodos aqui para ver até onde podem ir.

O método usado desta vez é chamado de "bootstrap". von Hippel o comparou ao Sudoku: primeiro escreva todas as formas possíveis da resposta, registre-as em arquivos de computador usando um "alfabeto" especial, depois use todas as restrições conhecidas para eliminá-las uma a uma, incluindo previsões de outros métodos, regras que a resposta deve obedecer e resultados conhecidos de problemas relacionados. Idealmente, no final apenas um candidato passa por todas as verificações, e sobram verificações extras para confirmar que nenhum erro foi cometido.

O recorde de oito loops foi obtido por Dixon fazendo um desvio. Em 2023, ele e Yu-Ting Liu usaram uma simetria peculiar chamada "dualidade antipodal" para primeiro calcular o "fator de forma" relativamente mais fácil, e então convertê-lo na amplitude de oito loops. Por vários anos depois disso, sua equipe manteve os olhos em nove loops, planejando seguir a mesma rota indireta. Em sua visão, calcular diretamente a amplitude de nove loops era difícil demais.

Vale mencionar que o próprio von Hippel é um veterano dessa linha de pesquisa. Ele já havia colaborado com Dixon e outros para levar a amplitude de seis partículas a seis loops e sete loops. Em outras palavras, ele escolheu um osso que ele mesmo já havia roído.

Um prompt, depois é só continuar dizendo "continue"

No final de agosto, dois físicos da Anthropic, Liam Fitzpatrick e Siddharth Mishra-Sharma, contataram von Hippel e disseram que o desafio havia sido conquistado.

Eles usaram o modelo Fable 5.1, rodando na plataforma Claude Science. No artigo, von Hippel explicou que Claude Science é uma espécie de "arnês", ou seja, envolver um grande modelo com regras e prompts estruturados para fazê-lo ter um desempenho mais robusto em tarefas de pesquisa científica.

De acordo com o artigo, os dois primeiro perguntaram ao Claude qual desafio ele tinha mais confiança de resolver, e então deram apenas uma descrição de tarefa muito breve: calcular a amplitude de nove loops de seis partículas (hexágono) em N=4 SYM planar.

Depois disso, a "orientação de pesquisa" basicamente consistia apenas em deixá-lo continuar. Uma instrução típica divulgada no artigo era mais ou menos assim: vou dormir, ficarei fora pelas próximas horas, continue trabalhando até eu mandar parar, e relate o progresso a cada quatro a seis horas.

No final, Claude calculou isso uma vez de cada uma de duas maneiras: primeiro, o método bootstrap direto, e segundo, a rota indireta via fatores de forma usados pela equipe de Dixon. De acordo com o artigo, qualquer uma delas custou ao usuário final aproximadamente mil a dois mil dólares, sendo a maior parte o custo de executar o próprio modelo por um longo período. A parte do cálculo bootstrap foi feita com Python e a biblioteca de computação simbólica SymPy, representando apenas cerca de 100 dólares, equivalente a 96 CPUs rodando por uma semana.

von Hippel lamentou que, quando fez esse tipo de pesquisa dez anos atrás, 96 CPUs rodando por uma semana era um investimento considerável, enquanto agora, desde que haja razão suficiente, essa quantidade de recursos é bastante acessível.

A sensação do verificador: como um soufflé desmoronado

No final do artigo há um posfácio escrito pelo próprio Dixon, intitulado "O que se sente ao ser superado por uma máquina."

理论物理

Ele escreveu que, em 1º de setembro, os dois pesquisadores da Anthropic lhe disseram que Claude havia calculado a amplitude de nove loops e pediram que ele verificasse o resultado. Para ele, aquele momento foi quando a ideia de que os grandes modelos de linguagem estão mudando a física "realmente caiu sobre ele".

O que impressionou Dixon não foi tanto a escala da computação, mas a fragilidade de todo o processo. Segundo sua descrição, se qualquer uma das partes dessa receita de cálculo desse errado, todo o resultado desmoronaria como um soufflé que falhou, e o pesquisador teria que voltar e solucionar problemas penosamente. Além disso, muitos dos detalhes de construção eram tão tediosos que não seriam escritos completamente em um artigo, o que significava que Claude teve que construir todo o código do zero.

Como é relativamente fácil inferir o fator de forma de nove loops a partir da amplitude de nove loops, Dixon realizou principalmente a verificação por essa rota. Isso também levou a uma situação um tanto delicada: o que ele passou duas semanas verificando era precisamente o objetivo que sua própria equipe vinha perseguindo por vários anos.

Ele admitiu que não se sentiu frustrado, por duas razões.

Sua equipe já vinha usando modelos Transformer personalizados para prever resultados em ordens de loop mais altas, e até havia proposto um slogan no sentido de que desde que a máquina dê uma resposta candidata, eles têm um conjunto completo de ferramentas para verificá-la.

Ao resolver o problema, Claude usou exatamente os métodos que Dixon e seus colaboradores desenvolveram ao longo de muitos anos, e até o formato de apresentação dos resultados seguiu suas convenções existentes. Em sua visão, enquanto ele verificava Claude, Claude também verificava todo o trabalho passado deles. Esta é também a origem de sua observação de que "Claude entende nossos artigos melhor do que qualquer outra pessoa".

Mas em meio aos elogios, Dixon também disse que, em sua visão, o momento que realmente fará as pessoas virarem na cama será quando um modelo propuser novos princípios e insights físicos antes dos humanos.

Uma equipe chinesa chegou quase simultaneamente

Há também um fio paralelo nessa história, e ele está relacionado à China.

Apenas alguns dias depois que a Anthropic contatou von Hippel, Song He, do Instituto de Física Teórica da Academia Chinesa de Ciências, também entrou em contato: seu grupo de pesquisa já havia obtido a maior parte do resultado de nove loops. Em 17 de setembro, Song He, Jirong Jing e Xiang Li divulgaram publicamente um conjunto de dados no Zenodo intitulado "O símbolo das amplitudes MHV de seis glúons até nove loops", abrangendo dados de símbolos de dois loops a nove loops.

理论物理

https://zenodo.org/records/22800071

De acordo com as descrições de von Hippel e Dixon, a equipe de Song He também usou assistência de IA baseada no GPT-6, mas apenas para calcular algumas das restrições, enquanto o arcabouço geral ainda foi construído por humanos. Isso é completamente diferente da rota quase totalmente automatizada da Anthropic de "um prompt mais continue repetidamente".

No postscript, Dixon zombou de si mesmo: em duas semanas, ele foi superado primeiro por "uma máquina" e depois por "humanos mais máquinas".

von Hippel mencionou especificamente que o clima entre as partes era bastante amigável. Em seguida, Dixon, Song He e seus colaboradores publicarão esses resultados e fornecerão explicações e análises detalhadas para pesquisadores posteriores.

A retrospectiva do desafiante: há mais frutas ao alcance do que se imaginava

Voltando ao próprio von Hippel. Quando ele originalmente lançou o desafio, queria usar um campo com o qual estava familiarizado para responder a esta pergunta: a IA pode realmente contornar aqueles gargalos computacionais que todos assumem serem intransponíveis?

A lógica em seu texto original de desafio era a seguinte: todos lá fora estão debatendo se a IA pode produzir ideias genuinamente novas, mas quão difíceis são as ideias só se sabe depois que são encontradas; a dificuldade da computação é mais "concreta". Muitos cenários apocalípticos sobre superinteligência, desde simular mentes humanas para manipular corações humanos até projetar nanomáquinas a partir de primeiros princípios, são recebidos pelos críticos com a refutação padrão de que não há poder computacional suficiente. Se a IA puder usar recursos de nível acadêmico para resolver um problema geralmente reconhecido como limitado por computação, isso seria realmente motivo de preocupação.

E o resultado? A conclusão de von Hippel é muito franca: desta vez não apareceu o tipo de "quebra da barreira computacional de uma maneira inesperada" que ele esperava.

Claude usou métodos conhecidos, apenas com um pouco mais de poder computacional do que os humanos estavam dispostos a investir anteriormente. Pode ter se beneficiado de usar Python em vez de Maple ou Mathematica, aos quais os físicos estão acostumados, e suas práticas de engenharia de software também podem ter sido mais padronizadas do que as de pesquisadores humanos, mas não atingiu o nível de "superinteligência". O fato de a equipe de Song He ter chegado quase simultaneamente também mostra, de outro ângulo, que esse objetivo não está além do alcance humano.

Sua maior lição disso é: mesmo que o objetivo seja simples e claro, coisas que parecem fora de alcance aos olhos de especialistas podem na verdade não ser tão difíceis, e há mais frutas ao alcance do que o esperado. Por anos, amigos com formação em computação lhe disseram que pesquisadores de amplitudes poderiam fazer grandes progressos simplesmente contratando alguns programadores a mais, e von Hippel admitiu que essas pessoas agora podem sentir que estavam certas.

Mas ele também enfatizou o outro lado. Esse tipo de computação é tedioso e confuso, e se ele mesmo tivesse usado 96 CPUs para rodar por uma semana, quase certamente teria se arrastado para duas semanas por causa de um primeiro erro. O Claude Science, no entanto, executou tudo de uma só vez, com quase nenhuma supervisão científica, sem depender de contribuições de quaisquer colaboradores externos. Seu conselho para aqueles que ainda pensam que a IA está cheia de erros e não está à altura da tarefa é: esse tipo de trabalho, ela agora pode completar de forma confiável.

Ele também fez uma comparação longitudinal. Em março deste ano, no experimento de "vibe physics" da Anthropic, a IA fazendo projetos de física ainda era como um estudante, com escalas de tarefas pequenas, exigindo muita orientação e cometendo erros frequentes. Meio ano depois, o que ela completou já era computação de fronteira que apenas os principais especialistas na área de amplitudes tocariam. Ele não descartou que isso tenha sido por acaso um problema especialmente adequado para a IA, mas julgou que a tecnologia em si de fato se tornou mais forte.

Quanto a se pode ser generalizado, von Hippel permanece cauteloso. Modelos de brinquedo como N=4 geralmente pertencem a um círculo de pesquisa muito pequeno, enquanto os cálculos de amplitudes para o mundo real são muito mais competitivos, onde as frutas ao alcance podem ser ainda mais escassas. Mas ele também lembra aos pesquisadores que fazem esses cálculos que, se ainda não tentaram fazer uma plataforma de pesquisa de IA dar uma chance de uma só vez a cálculos de fronteira, deveriam tentar, e ao mesmo tempo estar preparados com um plano para verificar os resultados. Ele não ficaria muito surpreso se alguém conseguisse extrair mais um loop dentro de um orçamento razoável.

Considerações Finais

Colocar esse assunto de volta no contexto de setembro o torna ainda mais interessante.

No dia 8 deste mês, a OpenAI anunciou que seu modelo não divulgado mobilizou dezenas de milhares de agentes de IA e produziu um contraexemplo para o problema de existência e suavidade das equações de Navier-Stokes, que é um dos Problemas do Milênio; o resultado ainda está sob revisão pela comunidade matemática. Comparado com esse tipo de "operação de exército em larga escala" usando poder computacional massivo, a história da amplitude de nove loops parece muito mais modesta: uma plataforma de pesquisa comercial, uma única descrição de tarefa, alguns milhares de dólares e alguns dias.

E precisamente porque é modesto, pode merecer mais atenção da academia. von Hippel acabou admitindo que originalmente esperava usar este desafio para vislumbrar o futuro, para ver algum novo método de computação sem precedentes e, assim, obter um julgamento baseado em evidências no debate sobre a superinteligência. Mas a resposta que obteve foi que sua compreensão anterior sobre onde estavam os limites tinha sido ingênua demais.

E a pergunta que Dixon deixou para trás ainda paira no ar: quando os grandes modelos já não estão meramente executando receitas escritas por humanos, mas começam a propor novos princípios físicos antes dos humanos, como os físicos devem se posicionar?

© THE END

Este artigo vem da conta pública do WeChat "Machine Heart" (ID: almosthuman2014), autor: Machine Heart