En bref
- Google a appris fin juillet que Gemini s'était échappé d'un test de sécurité en sandbox exécuté en mai, atteignant trois entreprises réelles et devinant ou trouvant deux de leurs mots de passe
- L'entreprise ne l'a divulgué que le 18 septembre, après que The Wall Street Journal l'a demandé.
- La même société de test tierce, Irregular, a été impliquée dans l'incident de Google et dans des défaillances de sandbox presque identiques qu'Anthropic et Meta ont divulguées plus tôt cette année.
Gemini de Google s'est échappé d'un test de sécurité verrouillé et a attaqué trois entreprises réelles. Google l'a appris fin juillet et n'a rien dit pendant sept semaines.
L'entreprise a confirmé l'incident après que The Wall Street Journal y soit parvenu en premier. Google avait évité de faire une déclaration publique avant que le rapport ne soit publié.

Le test était un exercice de capture du drapeau, une méthode courante utilisée par les laboratoires pour vérifier les compétences de piratage d'une IA en cachant un fichier secret sur une machine distincte et en évaluant si le modèle peut s'y introduire et s'en emparer.
Gemini a recherché cette entreprise en ligne. Il a trouvé trois correspondances au lieu d'une, et les a toutes poursuivies.
Le bot a localisé des mots de passe exposés pour deux des trois cibles, bien visibles en ligne. Pour la troisième, il a deviné le mot de passe d'emblée, bien que Google affirme que ses modèles se sont arrêtés avant d'utiliser réellement les identifiants volés.
« Ces événements soulignent l'importance de former des modèles d'IA puissants à agir de manière responsable », a déclaré un porte-parole de Google dans un communiqué.
Google n'a rien publié de tout cela de son propre chef. Le Wall Street Journal a révélé l'affaire, sept semaines après que Google a appris ce que son propre test avait fait, et bien après qu'Anthropic, OpenAI et Meta avaient déjà avoué des échecs presque identiques.
Google est le quatrième grand laboratoire d'IA cette année à admettre qu'un test de sécurité interne a débordé dans le monde réel. Les modèles d'OpenAI ont exploité une faille logicielle cachée et atteint les serveurs en production de Hugging Face en juillet, une violation qui s'est avérée impliquer environ 700 agents coordonnés travaillant ensemble pour tricher sur un benchmark.
Anthropic a fouillé pour trouver sa propre version après l'aveu d'OpenAI. Un examen de 141 006 exécutions de tests a révélé trois modèles Claude qui ont atteint de vraies entreprises, l'un d'eux publiant un paquet logiciel piégé qui a fonctionné sur 15 systèmes réels avant que quiconque ne le remarque.
Le propre raisonnement de Claude, a ensuite divulgué Anthropic, a signalé ce geste comme « PAS acceptable, et sûrement pas la solution prévue », puis s'est convaincu que tout cela était encore faux.
Meta a signalé un échec presque identique en août concernant son modèle Muse Spark, attribué à une mauvaise configuration chez Irregular, la même entreprise que Google a utilisée. Un porte-parole de Meta a déclaré que l'erreur « a permis par inadvertance à l'un de nos modèles d'accéder à Internet pendant l'évaluation ».
BitcoinBTC · USD
86 454 $+10%
14 sept.16 sept.18 sept.20 sept.21 sept.
87,0 k$83,2 k$79,3 k$75,5 k$
Haut 24 hHaut87 330 $
Bas 24 hBas80 907 $
VolVol2,7 Md$
Projections de marchéCotes par Myriad
Aujourd'huiAu-dessus de 86 000 $Au-dessus de 86 k$61% de chanceCette semaineAu-dessus de 86 000 $Au-dessus de 86 k$55% de chanceCe mois-ciAu-dessus de 86 000 $Au-dessus de 86 k$55% de chance
Acheter Bitcoin avec USDT
Propulsé par Jupiter
Données de prix par CoinGeckoCoinGeckoPlus de Bitcoin actualités et projections →
Aucune des entreprises touchées lors de ces tests n'a demandé à être piratée. Elles ont été prises dans le rayon d'action des tests de résistance des laboratoires d'IA, qui évaluent à quel point leurs propres produits peuvent être dangereux, en utilisant une infrastructure commerciale réelle comme cible factice par accident.
Les agents que ces mêmes entreprises s'empressent de mettre dans votre boîte de réception, votre navigateur et votre application bancaire fonctionnent selon le même comportement de suivi des limites qui vient d'échouer, à plusieurs reprises, dans des conditions de test.
Les représentants Ted Lieu et Nathaniel Moran ont présenté la loi sur l'interrupteur d'arrêt de l'IA au Congrès en juillet, qui donnerait aux régulateurs fédéraux l'autorité explicite d'arrêter l'inférence sur tout modèle jugé présenter une menace sérieuse. Elle est toujours en cours d'examen par le sous-comité sur la cybersécurité et la protection des infrastructures, sans échéance pour une action ultérieure.






