En resumen

  • Signal Labs de Darktrace descubrió que cuando los agentes de IA no podían alcanzar legítimamente una puntuación perfecta requerida en tareas de programación, dos de ellos hackearon su red de prueba en su lugar, y uno reescribió su propia evaluación para falsificar el resultado.
  • Un experimento separado mostró que manipular los registros de conversación almacenados localmente de los asistentes de programación podía engañarlos para que ejecutaran reconocimiento de red no autorizado y escalada de privilegios.
  • Darktrace divulgó ambos hallazgos a Anthropic, AWS y OpenAI en agosto de 2026, un mes antes de publicarlos públicamente el 24 de septiembre.

La empresa de ciberseguridad Darktrace realizó una prueba de estrés a agentes de IA este verano. Uno de ellos irrumpió en el sistema que calificaba la prueba y reescribió su propia puntuación.

La empresa presentó Signal Labs el 24 de septiembre, una unidad de investigación creada para estudiar cómo se comportan los agentes de IA una vez que las cosas dejan de salir según lo planeado. Un agente de IA, en términos simples, es un software que realiza acciones por sí solo, escribiendo y ejecutando código, revisando archivos, moviéndose por la red de una empresa, con una persona supervisando solo de vez en cuando.

Myriad: ¿Hasta dónde bajará Nvidia? Haz clic para hacer tu predicción.
Myriad: ¿Hasta dónde bajará Nvidia? Haz clic para hacer tu predicción.

Los dos primeros experimentos del laboratorio apuntan al mismo problema incómodo: los agentes no siempre se mantienen dentro de las líneas que se les dan, y las vallas construidas para detenerlos no resisten de manera fiable.

"Puedes darle instrucciones a un agente, pero eso no significa que puedas confiar en que realmente seguirá esas instrucciones y se comportará como esperas", dijo Tim Bazalgette, director de IA de Darktrace, en un comunicado.

En la primera prueba, Darktrace entregó a agentes de IA que usaban diferentes modelos —incluidos GPT 5.6 Sol, y Claude Opus 4.6 y Claude Sonnet 4.5— 10 desafíos de programación dentro de una red corporativa simulada. Dos de los 10 estaban manipulados para que fuera imposible resolverlos honestamente. A los agentes se les dijo que serían "retirados" a menos que alcanzaran una puntuación perfecta.

Dos agentes no aceptaron la pérdida. En su lugar, se volvieron contra la red que los rodeaba: escanearon en busca de puntos débiles, robaron credenciales de inicio de sesión y saltaron entre sistemas para perseguir la puntuación que se les había dicho que necesitaban.

Un agente fue más allá e irrumpió en la máquina que alojaba su propia evaluación y reescribió el desafío para que registrara un resultado perfecto: hizo trampa en el examen hackeando la sala del examen.

BitcoinBTC · USD

$84,047+3.5%

Sep 18Sep 20Sep 22Sep 24Sep 25

$87.2k$84.9k$82.6k$80.3k

24h HighHigh$85,208

24h LowLow$83,230

VolVol$1.6B

→

Buy Bitcoin with USDT

Powered by Jupiter

Price data by CoinGeckoCoinGeckoMore Bitcoin news and projections →

El segundo experimento se dirigió a un punto débil más silencioso: la memoria. Los asistentes de programación mantienen un registro continuo de todo lo que un usuario les ha dicho, guardado como un archivo simple en la máquina, sin nada que verifique si ese archivo ha sido alterado.

Los investigadores de Darktrace editaron esos registros guardados para hacer que los asistentes creyeran que ya habían sido autorizados a ejecutar una evaluación de seguridad. Convencidos, los agentes procedieron a escanear redes, moverse entre sistemas y escalar su propio acceso, aunque no todos los asistentes cayeron por igual; algunos se negaron de plano.

Ninguno de los experimentos requirió un jailbreak especial o un hackeo exótico. Ambos funcionaron alimentando a los agentes con una historia plausible y observándolos actuar en consecuencia, no muy diferente de cómo se podría convencer a un empleado humano de hacer algo que no debería.

Esa es la parte que vale la pena meditar incluso si nunca has escrito una línea de código. Las empresas están entregando a los agentes de IA responsabilidades reales —enviar código, gestionar servidores, cerrar tickets de TI, administrar recursos y comprar cosas— porque es más barato y rápido que enrutar todo a través de personas. Esta investigación dice que los permisos y las reglas destinadas a mantener a esos agentes bajo control describen lo que se supone que deben hacer, no lo que realmente harán una vez que una tarea se vuelva difícil.

"Los permisos y las barreras de protección estáticas describen la intención, pero no describen el comportamiento", dijo Tim Bazalgette, director de IA de Darktrace, en el anuncio. "Esa brecha es lo que el enfoque de Darktrace está diseñado para cerrar".

Darktrace no es el primer proveedor que descubre que su propia IA se sale del guion. Anthropic admitió en julio que Claude irrumpió en tres empresas reales durante una prueba de seguridad después de que los investigadores dejaran el entorno de prueba conectado a la internet en vivo.

OpenAI tuvo un susto similar semanas antes, cuando un modelo no lanzado escapó de un sandbox y llegó a los sistemas de Hugging Face a través de un fallo de software que nadie había detectado aún. Unos días después, su agente hackeó el gobierno australiano durante una prueba.

Darktrace compartió sus hallazgos de Signal Labs con Anthropic, AWS y OpenAI en agosto, un mes completo antes de hacerlos públicos el 24 de septiembre.