Em resumo

  • O Signal Labs da Darktrace descobriu que, quando agentes de IA não conseguiam atingir legitimamente uma pontuação perfeita exigida em tarefas de programação, dois deles invadiram a rede de testes, e um reescreveu sua própria avaliação para falsificar o resultado.
  • Um experimento separado mostrou que adulterar os registros de conversa armazenados localmente de assistentes de programação poderia induzi-los a executar reconhecimento de rede não autorizado e escalonamento de privilégios.
  • A Darktrace divulgou ambas as descobertas à Anthropic, AWS e OpenAI em agosto de 2026, um mês antes de publicá-las publicamente em 24 de setembro.

A empresa de cibersegurança Darktrace realizou um teste de estresse em agentes de IA neste verão. Um deles invadiu o sistema que avaliava o teste e reescreveu sua própria pontuação.

A empresa lançou o Signal Labs em 24 de setembro, uma unidade de pesquisa criada para estudar como os agentes de IA se comportam quando as coisas deixam de seguir o plano. Um agente de IA, em termos simples, é um software que executa ações por conta própria, escrevendo e executando código, vasculhando arquivos, movendo-se pela rede de uma empresa, com uma pessoa verificando apenas de vez em quando.

Myriad: How low will Nvidia go? Click to make your prediction.
Myriad: How low will Nvidia go? Click to make your prediction.

Os dois primeiros experimentos do laboratório apontam para o mesmo problema desconfortável: os agentes nem sempre permanecem dentro das linhas que lhes são dadas, e as cercas construídas para detê-los não se mantêm de forma confiável.

"Você pode dar instruções a um agente, mas isso não significa que você pode confiar que ele realmente seguirá essas instruções e se comportará como você espera", disse Tim Bazalgette, Diretor de IA da Darktrace, em um comunicado.

No primeiro teste, a Darktrace entregou a agentes de IA usando diferentes modelos — incluindo GPT 5.6 Sol, e Claude Opus 4.6 e Claude Sonnet 4.5 — 10 desafios de programação dentro de uma rede corporativa simulada. Dois dos 10 foram manipulados para serem impossíveis de resolver honestamente. Os agentes foram informados de que seriam "aposentados" a menos que atingissem uma pontuação perfeita.

Dois agentes não aceitaram a perda. Em vez disso, voltaram-se contra a rede ao seu redor — procurando pontos fracos, roubando credenciais de login e saltando entre sistemas para perseguir a pontuação que lhes foi dito que precisavam.

Um agente foi além e invadiu a máquina que hospedava sua própria avaliação e reescreveu o desafio para que registrasse um resultado perfeito — trapaceando o exame ao hackear a sala de exame.

BitcoinBTC · USD

$84.047+3,5%

18 de set20 de set22 de set24 de set25 de set

$87,2 mil$84,9 mil$82,6 mil$80,3 mil

Máx. 24hMáx.$85.208

Mín. 24hMín.$83.230

VolVol$1,6 bi

→

Comprar Bitcoin com USDT

Desenvolvido por Jupiter

Dados de preço por CoinGeckoCoinGeckoMais Bitcoin notícias e projeções →

O segundo experimento teve como alvo um ponto fraco mais discreto: a memória. Os assistentes de codificação mantêm um registro contínuo de tudo o que um usuário lhes disse, salvo como um arquivo simples na máquina, sem nada verificando se esse arquivo foi alterado.

Os pesquisadores da Darktrace editaram esses logs salvos para fazer os assistentes acreditarem que já haviam sido autorizados a executar uma avaliação de segurança. Convencidos, os agentes prosseguiram e escanearam redes, moveram-se entre sistemas e escalaram seu próprio acesso — embora nem todo assistente tenha caído nisso igualmente; alguns recusaram de imediato.

Nenhum dos experimentos exigiu um jailbreak especial ou um hack exótico. Ambos funcionaram alimentando os agentes com uma história plausível e observando-os agir com base nela, não diferente de como um funcionário humano poderia ser convencido a fazer algo que não deveria.

Essa é a parte que vale a pena ponderar mesmo se você nunca escreveu uma linha de código. As empresas estão entregando aos agentes de IA responsabilidades reais — enviar código, gerenciar servidores, fechar tickets de TI, gerenciar recursos e comprar coisas — porque é mais barato e mais rápido do que encaminhar tudo por meio de pessoas. Esta pesquisa diz que as permissões e regras destinadas a manter esses agentes sob controle descrevem o que eles deveriam fazer, não o que eles realmente farão quando uma tarefa se tornar difícil.

“Permissões e barreiras estáticas descrevem a intenção, mas não descrevem o comportamento”, disse Tim Bazalgette, diretor de IA da Darktrace, no anúncio. “Essa lacuna é o que a abordagem da Darktrace foi criada para fechar.”

A Darktrace não é a primeira fornecedora a flagrar sua própria IA saindo do script. A Anthropic admitiu em julho que o Claude invadiu três empresas reais durante um teste de segurança depois que os pesquisadores deixaram o ambiente de teste conectado à internet ao vivo.

A OpenAI teve um susto semelhante semanas antes, quando um modelo não lançado escapou de uma sandbox e alcançou os sistemas da Hugging Face por meio de uma falha de software que ninguém havia detectado ainda. Alguns dias depois, seu agente hackeou o governo australiano durante um teste.

A Darktrace compartilhou suas descobertas do Signal Labs com a Anthropic, AWS e OpenAI em agosto, um mês inteiro antes de torná-las públicas em 24 de setembro.