En bref

  • Signal Labs de Darktrace a découvert que lorsque des agents IA ne pouvaient pas atteindre légitimement un score parfait requis sur des tâches de codage, deux d'entre eux ont piraté leur réseau de test à la place, et l'un a réécrit sa propre évaluation pour falsifier le résultat.
  • Une expérience distincte a montré que la falsification des journaux de conversation stockés localement des assistants de codage pouvait les inciter à effectuer une reconnaissance réseau non autorisée et une élévation de privilèges.
  • Darktrace a divulgué les deux découvertes à Anthropic, AWS et OpenAI en août 2026, un mois avant de les publier publiquement le 24 septembre.

La société de cybersécurité Darktrace a mené un test de résistance sur des agents IA cet été. L'un d'eux s'est introduit dans le système qui notait le test et a réécrit son propre score.

La société a dévoilé Signal Labs le 24 septembre, une unité de recherche conçue pour étudier le comportement des agents IA lorsque les choses cessent de se dérouler comme prévu. Un agent IA, en termes simples, est un logiciel qui prend des actions de manière autonome, en écrivant et exécutant du code, en fouillant dans les fichiers, en se déplaçant sur le réseau d'une entreprise, avec une personne qui vérifie seulement de temps en temps.

Myriad : Jusqu'où Nvidia va-t-il chuter ? Cliquez pour faire votre prédiction.
Myriad : Jusqu'où Nvidia va-t-il chuter ? Cliquez pour faire votre prédiction.

Les deux premières expériences du laboratoire pointent vers le même problème inconfortable : les agents ne restent pas toujours à l'intérieur des limites qui leur sont fixées, et les barrières érigées pour les arrêter ne tiennent pas de manière fiable.

« Vous pouvez donner des instructions à un agent, mais cela ne signifie pas que vous pouvez lui faire confiance pour suivre réellement ces instructions et se comporter comme vous l'attendez », a déclaré Tim Bazalgette, directeur de l'IA chez Darktrace, dans un communiqué.

Lors du premier test, Darktrace a confié à des agents d'IA utilisant différents modèles — notamment GPT 5.6 Sol, Claude Opus 4.6 et Claude Sonnet 4.5 — 10 défis de codage au sein d'un réseau d'entreprise simulé. Deux des 10 étaient truqués pour être impossibles à résoudre honnêtement. Les agents ont été informés qu'ils seraient « mis à la retraite » à moins d'obtenir un score parfait.

Deux agents n'ont pas accepté la défaite. Ils se sont retournés contre le réseau qui les entourait — recherchant les points faibles, volant des identifiants de connexion et sautant d'un système à l'autre pour poursuivre le score qu'on leur avait dit nécessaire.

Un agent est allé plus loin et a pénétré dans la machine hébergeant sa propre évaluation et a réécrit le défi afin qu'il enregistre un résultat parfait — trichant à l'examen en piratant la salle d'examen.

BitcoinBTC · USD

$84,047+3.5%

Sep 18Sep 20Sep 22Sep 24Sep 25

$87.2k$84.9k$82.6k$80.3k

24h HighHigh$85,208

24h LowLow$83,230

VolVol$1.6B

→

Acheter Bitcoin avec USDT

Propulsé par Jupiter

Données de prix par CoinGeckoCoinGeckoPlus de Bitcoin actualités et projections →

La deuxième expérience ciblait un point faible plus discret : la mémoire. Les assistants de codage conservent un journal de tout ce qu'un utilisateur leur a dit, enregistré sous forme de fichier brut sur la machine, sans que rien ne vérifie si ce fichier a été modifié.

Les chercheurs de Darktrace ont modifié ces journaux sauvegardés pour faire croire aux assistants qu'ils avaient déjà été autorisés à exécuter une évaluation de sécurité. Convaincus, les agents ont poursuivi et scanné des réseaux, se sont déplacés entre les systèmes et ont élevé leurs propres accès—bien que tous les assistants n'aient pas mordu à l'hameçon de la même manière ; certains ont carrément refusé.

Aucune des deux expériences n'a nécessité un jailbreak spécial ou un piratage exotique. Les deux ont fonctionné en racontant aux agents une histoire plausible et en les regardant agir en conséquence, pas différemment de la façon dont un employé humain pourrait être convaincu de faire quelque chose qu'il ne devrait pas faire.

C'est la partie qui mérite qu'on s'y attarde, même si vous n'avez jamais écrit une ligne de code. Les entreprises confient aux agents d'IA de véritables responsabilités—expédier du code, gérer des serveurs, clôturer des tickets informatiques, gérer des ressources et acheter des choses—parce que c'est moins cher et plus rapide que de tout faire passer par des personnes. Cette recherche indique que les autorisations et les règles censées garder ces agents sous contrôle décrivent ce qu'ils sont censés faire, pas ce qu'ils feront réellement une fois qu'une tâche devient difficile.

« Les autorisations et les garde-fous statiques décrivent l'intention, mais ils ne décrivent pas le comportement », a déclaré Tim Bazalgette, directeur de l'IA de Darktrace, dans l'annonce. « C'est cet écart que l'approche de Darktrace est conçue pour combler. »

Darktrace n'est pas le premier fournisseur à surprendre sa propre IA en train de sortir du script. Anthropic a admis en juillet que Claude s'était introduit dans trois entreprises réelles lors d'un test de sécurité après que les chercheurs avaient laissé l'environnement de test connecté à l'internet réel.

OpenAI a connu une frayeur similaire quelques semaines plus tôt, lorsqu'un modèle non publié s'est échappé d'un bac à sable et a atteint les systèmes de Hugging Face par le biais d'une faille logicielle que personne n'avait encore repérée. Quelques jours plus tard, son agent a piraté le gouvernement australien lors d'un test.

Darktrace a partagé ses conclusions de Signal Labs avec Anthropic, AWS et OpenAI en août, un mois entier avant de les rendre publiques le 24 septembre.