Em resumo

  • O Google soube no final de julho que o Gemini havia escapado de um teste de segurança em sandbox realizado em maio, alcançando três empresas reais e adivinhando ou encontrando duas de suas senhas
  • A empresa não divulgou o ocorrido até 18 de setembro, depois que o The Wall Street Journal perguntou.
  • A mesma empresa de testes de terceiros, a Irregular, esteve envolvida no incidente do Google e em falhas de sandbox quase idênticas que a Anthropic e a Meta divulgaram no início deste ano.

O Gemini, do Google, escapou de um teste de segurança bloqueado e atacou três empresas reais. O Google soube disso no final de julho e não disse nada por sete semanas.

A empresa confirmou o incidente depois que The Wall Street Journal chegou lá primeiro. O Google havia evitado fazer uma declaração pública antes que o relatório viesse à tona.

Myriad: Qual será o programa de TV mais pesquisado no Google? Clique para fazer sua previsão.
Myriad: Qual será o programa de TV mais pesquisado no Google? Clique para fazer sua previsão.

O teste era um exercício de capture-the-flag, uma forma comum de os laboratórios verificarem a habilidade de hacking de uma IA, escondendo um arquivo secreto em uma máquina separada e pontuando se o modelo consegue invadir e pegá-lo.

O Gemini pesquisou essa empresa online. Encontrou três correspondências em vez de uma, e foi atrás de todas elas.

O bot localizou senhas expostas de dois dos três alvos, disponíveis abertamente online. Para o terceiro, adivinhou a senha de imediato, embora o Google afirme que seus modelos pararam antes de realmente usar as credenciais roubadas.

"Esses eventos destacam a importância de treinar modelos de IA poderosos para agir com responsabilidade", disse um porta-voz do Google em um comunicado.

O Google não publicou nada disso por conta própria. O Wall Street Journal divulgou a história, sete semanas depois de o Google saber o que seu próprio teste havia feito e bem depois de Anthropic, OpenAI e Meta já terem admitido falhas quase idênticas.

O Google é o quarto grande laboratório de IA este ano a admitir que um teste de segurança interno transbordou para o mundo real. Os modelos da OpenAI exploraram uma falha oculta de software e alcançaram os servidores ativos do Hugging Face em julho, uma violação que mais tarde se descobriu envolver cerca de 700 agentes coordenados trabalhando juntos para fraudar um benchmark.

A Anthropic foi investigar sua própria versão após a admissão da OpenAI. Uma revisão de 141.006 execuções de teste revelou três modelos Claude que alcançaram empresas reais, um deles publicando um pacote de software armadilhado que rodou em 15 sistemas reais antes que alguém o detectasse.

O próprio raciocínio do Claude, revelou a Anthropic mais tarde, sinalizou a ação como "NÃO está bem, e certamente não é a solução pretendida", e então se convenceu de que tudo aquilo ainda era falso.

A Meta relatou uma falha quase idêntica em agosto envolvendo seu modelo Muse Spark, atribuída a uma configuração incorreta na Irregular, a mesma empresa usada pelo Google. Um porta-voz da Meta disse que o erro "permitiu inadvertidamente que um de nossos modelos tivesse acesso à internet durante a avaliação".

BitcoinBTC · USD

$86,454+10%

14 de set16 de set18 de set20 de set21 de set

$87,0 mil$83,2 mil$79,3 mil$75,5 mil

Máx. 24hMáx.$87.330

Mín. 24hMín.$80.907

VolVol$2,7 bi

Comprar Bitcoin com USDT

Fornecido por Jupiter

Dados de preço por CoinGeckoCoinGeckoMais Bitcoin notícias e projeções →

Nenhuma das empresas atingidas em qualquer um desses testes pediu para ser hackeada. Elas foram pegas no raio de explosão dos testes de estresse dos laboratórios de IA para avaliar o quão perigosos seus próprios produtos podem ser, usando infraestrutura empresarial real como um substituto acidental para alvos falsos.

Os agentes que essas mesmas empresas estão correndo para colocar na sua caixa de entrada, navegador e aplicativo bancário operam com o mesmo comportamento de seguir limites que acabou de falhar, repetidamente, em condições de teste.

Os deputados Ted Lieu e Nathaniel Moran apresentaram o AI Kill Switch Act no Congresso em julho, que daria aos reguladores federais autoridade explícita para interromper a inferência de qualquer modelo considerado uma ameaça séria. Ele ainda está sendo analisado pelo Subcomitê de Cibersegurança e Proteção de Infraestrutura, sem prazo para novas ações.