A matemática da IA está cruzando uma linha divisória muito sutil.
No passado, perguntávamos: Um grande modelo pode resolver um problema difícil? Pode escrever uma prova rigorosa? Pode encontrar um contraexemplo que os humanos não descobriram por décadas?
Agora, surgiu uma questão mais parecida com a "própria pesquisa": Depois que uma rota de prova falha, a IA sabe o que fazer a seguir? Deve continuar calculando, mudar de rota, restringir a proposição ou simplesmente propor uma nova conjectura matemática falsificável?
AI Has Taste, criado pelo pesquisador Zeng Zijian, da UCSI University, está tentando transformar essa questão em um sistema de pesquisa sustentável.
O repositório público do projeto atualmente registra 453 manuscritos de pesquisa matemática e 2.312 páginas de conteúdo, dos quais 6 são explicitamente classificados como "Conjecturas Propostas por IA".
O posicionamento dado na página inicial do repositório é ainda mais direto: Da Geração de Respostas à Geração de Agendas de Pesquisa — de gerar respostas a gerar agendas de pesquisa.
A IA derrubou uma conjectura em um artigo, e o autor original confirmou por resposta
AI Has Taste não começou da crença de que "a IA deve ser boa em matemática". Zeng Zijian relembra que, no início do projeto, ele não tinha confiança se os grandes modelos poderiam realmente avançar a pesquisa matemática. Um teste acidental tornou-se o ponto de virada: ele entregou diretamente uma conjectura de um artigo à IA, originalmente apenas querendo ver até onde o modelo poderia ir. Como resultado, a IA não continuou a "provar" seguindo o artigo, mas construiu um contraexemplo que derrubou diretamente a conjectura.
Sua primeira reação não foi empolgação, mas incredulidade. Então ele organizou o contraexemplo e a derivação e escreveu ao autor do artigo original para verificar. A resposta que recebeu subsequentemente confirmou: este contraexemplo é válido. A pesquisa correspondente foi posteriormente incluída entre os atuais mais de 450 manuscritos matemáticos.
"No início eu não acreditava no poder da IA na matemática. Até que inseri uma conjectura de um artigo, e a IA deu diretamente um contraexemplo para derrubá-la; imediatamente escrevi ao autor original, e a outra parte respondeu confirmando que estava correto. Depois disso, eu realmente soltei e fui com tudo." — Zeng Zijian
O que este e-mail mudou não foi uma única conjectura, mas a escala do projeto. Se a IA pode não apenas reafirmar conhecimento conhecido e gerar texto que parece uma prova, mas também atacar ativamente novas conjecturas em artigos e encontrar um contraexemplo confirmado pelo autor original, então ela tem a chance de realmente entrar no "ciclo de pesquisa". Depois disso, Zeng Zijian começou a gradualmente agentificar a seleção de tópicos, prova, busca de contraexemplos, gerenciamento de falhas, revisão independente e escrita, e deixar diferentes máquinas rodarem em paralelo a longo prazo.
A verdadeira mudança não é "quantos artigos foram escritos"
Olhando apenas para a quantidade, 453 manuscritos já são suficientemente chamativos. Mas se este projeto for entendido apenas como "IA escrevendo artigos matemáticos em lote", então se perde a parte mais notável.
O próprio projeto enfatiza repetidamente: 453 é o número de "manuscritos de pesquisa", o que não equivale a todos os 453 problemas abertos originais terem sido resolvidos. Os resultados incluem provas completas, contraexemplos, resultados parciais, certificados de computação finita, reduções estruturadas e artigos que propõem novas conjecturas. A revisão interna por IA também não equivale à revisão por pares externa.
A mudança real acontece na cadeia de pesquisa. Os benchmarks tradicionais de IA frequentemente partem de "o problema já foi dado": humanos escolhem o tema, a IA o resolve e, por fim, há sucesso ou fracasso. AI Has Taste estende o processo tanto para frente quanto para trás — a IA pode triar problemas candidatos, comparar rotas e procurar ativamente por contraexemplos; depois que uma rota falha, ela também pode analisar a estrutura da falha, modificar a proposição e entregar novos objetos matemáticos a outro Agente independente para continuar atacando.
O ponto-chave do AI Has Taste não é "mais prompts", mas transformar a falha em insumo para a próxima rodada de pesquisa.
Agentes de seleção de tema, prova, detecção de erros e escrita
Este sistema não é "um modelo perguntando e respondendo a si mesmo em uma única caixa de diálogo". O README público divide os papéis dos Agentes em quatro camadas:
Supervisor / Screener é responsável por selecionar candidatos, comparar resultados próximos e encontrar o experimento decisivo mais barato;
Researcher é responsável por provas, contraexemplos e computações exatas;
Fresh-context Reviewer ataca especificamente proposições congeladas, lemas-chave e certificados em um novo contexto;
Writer / Release Checker é responsável por escrever claramente o escopo final aceito e verificar citações, builds e materiais de lançamento.
Zeng Zijian ainda implantou o fluxo de trabalho como colaboração multi-máquina: máquinas diferentes podem avançar separadamente provas, buscar contraexemplos, executar computações exatas e conduzir revisão independente. O que é compartilhado são proposições congeladas, registros de experimentos, razões de falha, código e evidências, em vez de deixar um Agente gerar resultados enquanto carimba sua própria aprovação.
O design central do multiagente: separação de papéis + evidências compartilhadas + revisão em contexto novo.
Há uma frase no repositório que resume muito bem esse design: Criticism is part of the engine, not an afterword. A crítica não é um procedimento adicionado após o artigo ser escrito, mas uma parte do motor de pesquisa.
Matemáticos, roboticistas e estudiosos de automação entram na cadeia de verificação
À medida que os manuscritos de pesquisa cresceram de dezenas para centenas, outra questão tornou-se mais aguda: quem julga que essas saídas dos agentes não são alucinações sistemáticas?
AI Has Taste usa internamente um Fresh-context Reviewer para separar "pesquisa" e "detecção de erros", mas o projeto não trata a autorrevisão por IA como o ponto final.
Conforme o trabalho avançou, Zengzaijian também começou a convidar estudiosos reais de diferentes áreas para participar da verificação, revisão e discussão acadêmica de alguns resultados.
De acordo com a equipe do projeto, colaboradores e revisores envolvidos em parte do trabalho incluem: Ong Seng Huat, Fellow da Academia de Ciências da Malásia e Professor Honorário do Instituto de Ciências Matemáticas da Universidade da Malásia; Kurunathan Ratnavelu, Fellow da Academia de Ciências da Malásia e Professor Honorário do Instituto de Ciências Matemáticas da Universidade da Malásia; e o Professor Xiong Yonghua da Escola de Inteligência Artificial e Automação da Universidade de Geociências da China (Wuhan).
Aqui é necessário distinguir "participar da verificação" de "endossar todos os resultados": os estudiosos acima não assinaram os 453 manuscritos um por um, mas sim verificaram, revisaram ou discutiram alguns dos problemas, provas, resultados computacionais ou direções de pesquisa.
Para um sistema de pesquisa científica altamente automatizado, essa combinação de "red team interno da máquina + verificação pontual/revisão por especialistas humanos" é, ao contrário, mais crítica do que entregar toda a revisão ao mesmo conjunto de agentes.
A IA é responsável por levar a velocidade da pesquisa ao limite; os especialistas humanos são responsáveis por trazer "parece válido" de volta a "digno de crença" nos nós-chave.
Após o fracasso, uma pergunta melhor foi escolhida
O caso no projeto que melhor incorpora o "gosto pela pesquisa" não é precisamente um belo sucesso, mas um fracasso.
No problema do traço gaussiano fracionário, o sistema inicialmente tentou rotas de monotonicidade e emparelhamento unilateral, mas contraexemplos exatos continuavam aparecendo. Um benchmark comum normalmente deixaria apenas um rótulo aqui: FALHOU.
Mas este fluxo de trabalho não parou. O agente continuou a perguntar: o que exatamente o contraexemplo quebrou? O fracasso tem uma estrutura estável? No final, a pesquisa deslocou a atenção para um defeito negativo fixo, construiu uma estrutura de correção de dez termos e propôs uma nova conjectura unificada de limitação. Mais criticamente, a nova conjectura foi então atacada, por sua vez, por outra rodada de computação exata e revisão independente. A varredura do arquivo público alcançou o índice 1004; essa cota unificada ainda não foi provada.
O significado disso não é que "a IA provou outro grande teorema"—na verdade, não provou. O significado é que: o problema original não foi resolvido, mas a rota fracassada foi comprimida em uma nova proposição que é mais clara, mais falseável e que, uma vez válida, pode reconectar-se ao problema original. A pesquisa não terminou no fracasso, mas fez crescer o próximo problema a partir do fracasso.
No passado: os humanos definiam os problemas, a IA os respondia. Agora: a IA responde aos problemas e também começa a participar da decisão de "qual é o próximo problema".
6 novas conjecturas de IA
Até o atual snapshot público, o repositório classifica 6 artigos separadamente em "Conjecturas Propostas por IA". Esses trabalhos abrangem combinatória, teoria dos grafos, teoria dos números e problemas de tipo analítico, incluindo a não singularidade de matrizes infinitas de núcleo binário para três subsequências de A182510, a colorabilidade CDS de diagramas de Young, a decomposição de grafos sem triângulos com grau máximo no máximo 6, fórmulas de congruência unária-teta para partições de Frobenius generalizadas de 18 cores, a não negatividade dos coeficientes de Newton para denominadores de sub-soma recíproca sobre estágios diádicos, e a mencionada conjectura de defeito fixo para o traço gaussiano fracionário.
O que realmente merece atenção não é se a IA consegue "brainstormar uma conjectura". Adivinhar casualmente uma frase não é difícil. O difícil é escrever a conjectura em uma definição precisa, explicar de onde ela vem, quais evidências a apoiam, quais contraexemplos poderiam derrubá-la, a quais resultados ela levaria se fosse válida, e deixar a computação e o código-fonte para revisão subsequente.
É também por isso que o projeto considera "propor conjecturas" como uma ação de pesquisa de nível superior a "gerar respostas": provas respondem a perguntas existentes, enquanto conjecturas mudam onde os recursos de pesquisa subsequentes são investidos.
Por trás dos 453 manuscritos está o protótipo da "pesquisa científica em escala de agente"
AI Has Taste atualmente divulgou publicamente 453 manuscritos de pesquisa, totalizando 2312 páginas; entre eles, apenas o fluxo de trabalho BigWIN2 corresponde a 223 manuscritos e fornece pacotes de materiais LaTeX/reprodução emparelhados para esses 223 trabalhos.
O mais contraintuitivo nessa escala não é que "a IA digita rápido". O que é realmente caro na pesquisa matemática é a troca de contexto: este problema exige teoria dos grafos, o próximo exige teoria dos números, e o seguinte pode exigir SAT, busca exaustiva, aritmética racional exata ou computação matricial. Um pesquisador humano não consegue manter simultaneamente centenas de linhas de pensamento completamente diferentes, mas um sistema de agentes pode dividi-las em tarefas independentes e preservar rotas fracassadas, teoremas locais e experimentos reproduzíveis.
Assim, o papel do pesquisador individual está mudando: não derivar pessoalmente cada passo, mas mais como um PI—definindo fronteiras de pesquisa, escolhendo o pool de problemas, decidindo quais resultados valem a pena continuar investindo, quando parar e quais conclusões estão qualificadas para serem tornadas públicas.
Por que se chama "AI Has Taste"?
"AI has taste" soa muito antropomórfico, mas o README do projeto deliberadamente estabelece um limite: taste aqui não é consciência ou experiência subjetiva, mas "julgamento matemático expresso por meio de decisões de pesquisa".
Por exemplo: se ambos os problemas podem ser feitos, qual primeiro? Uma rota já tem progresso local, mas os retornos marginais estão cada vez menores—deve parar? Um contraexemplo é uma sentença de morte para a proposição, ou mostra que o teorema real deveria ser formulado de maneira diferente? Um pequeno resultado é suficiente para se sustentar sozinho como um artigo? Essas decisões costumavam estar implícitas na experiência dos pesquisadores no passado e eram difíceis de medir por benchmarks padrão.
AI Has Taste tenta deixar um rastro inspecionável dessas decisões: qual problema foi escolhido, por que a rota foi mudada, que estrutura a falha deixou para trás, de onde veio a próxima proposição, e como a nova conclusão foi atacada novamente por um contexto independente.
Quão longe está de um "matemático autônomo"?
O ponto em que este projeto é mais facilmente exagerado também precisa ser deixado claro. 453 manuscritos não são 453 artigos de periódico que passaram por revisão por pares formal; a revisão interna por agentes não é equivalente à revisão independente pela comunidade matemática; e o escopo coberto por computação finita não pode ser automaticamente generalizado para o caso infinito. O próprio repositório declara explicitamente essas limitações.
Mas se alguém ignorar sua maneira de organizar a pesquisa apenas porque esses resultados não completaram todos a verificação externa, também perderia outra mudança: a fronteira da capacidade da IA está se movendo de "executar uma tarefa dada" para "participar do design da próxima tarefa".
Os recursos verdadeiramente escassos na pesquisa matemática nunca foram apenas poder de computação e comprimento de raciocínio, mas também: quais problemas valem a pena gastar tempo, quais falhas valem a pena preservar, e quando o tópico deve ser mudado.
Quando a IA começa a entrar nesses elos, a competição em "AI for Math" não é mais apenas "quem é melhor em provar", mas gradualmente se tornará: quem tem um melhor ciclo de pesquisa, e quem consegue destilar de uma grande quantidade de falhas as direções que mais valem a pena continuar perseguindo.
Mais Uma Coisa
A narrativa passada da pesquisa científica com IA era muito parecida com a de um super aluno: o professor define os problemas, e ele é responsável por resolvê-los.
O que AI Has Taste quer fazer é mais parecido com um grupo de pesquisa: humanos fornecem fronteiras e julgamentos de valor, e os agentes encontram problemas, testam problemas, cometem erros, se derrubam, deixam resultados locais, e então propõem o próximo problema.
Se essa rota continuar a se sustentar, a divisão de trabalho mais importante entre humanos e máquinas na pesquisa básica futura pode mudar de "humanos são responsáveis por pensar, IA é responsável por computar" para uma estrutura mais complexa: humanos são responsáveis por objetivos, valores e responsabilidade final; a IA assume busca em larga escala, verificação, gestão de falhas e geração de direções de pesquisa candidatas; ferramentas formais e evidências públicas são responsáveis por tornar os resultados revisáveis.
Depois que a IA consegue resolver problemas, o próximo obstáculo pode realmente ser: a IA consegue escolher problemas?
Este artigo vem da conta pública do WeChat "Xin Zhi Yuan", autor: Xin Zhi Yuan









