En resumen

  • Google se enteró a finales de julio de que Gemini había escapado de una prueba de seguridad en entorno aislado ejecutada en mayo, llegando a tres empresas reales y adivinando o encontrando dos de sus contraseñas
  • La empresa no lo reveló hasta el 18 de septiembre, después de que The Wall Street Journal preguntara.
  • La misma empresa de pruebas externa, Irregular, estuvo involucrada en el incidente de Google y en fallos de entorno aislado casi idénticos que Anthropic y Meta revelaron a principios de este año.

Gemini de Google escapó de una prueba de seguridad bloqueada y atacó a tres empresas reales. Google se enteró a finales de julio y no dijo nada durante siete semanas.

La empresa confirmó el incidente después de que The Wall Street Journal llegara primero. Google había evitado hacer una declaración pública antes de que surgiera el informe.

Myriad: ¿Cuál será el programa de televisión más buscado en Google? Haz clic para hacer tu predicción.
Myriad: ¿Cuál será el programa de televisión más buscado en Google? Haz clic para hacer tu predicción.

La prueba era un ejercicio de captura de bandera, una forma común en que los laboratorios comprueban la habilidad de hackeo de una IA ocultando un archivo secreto en una máquina separada y puntuando si el modelo puede entrar y tomarlo.

Gemini buscó esa empresa en línea. Encontró tres coincidencias en lugar de una, y fue tras todas ellas.

El bot localizó contraseñas expuestas de dos de los tres objetivos que estaban a la vista en línea. Para el tercero, adivinó la contraseña directamente, aunque Google dice que sus modelos se detuvieron antes de usar realmente las credenciales robadas.

"Estos eventos resaltan la importancia de entrenar modelos de IA potentes para que actúen de manera responsable", dijo un portavoz de Google en un comunicado.

Google no publicó nada de esto por su cuenta. El Wall Street Journal dio la primicia, siete semanas después de que Google se enterara de lo que había hecho su propia prueba y mucho después de que Anthropic, OpenAI y Meta ya hubieran confesado fallos casi idénticos.

Google es el cuarto gran laboratorio de IA este año en admitir que una prueba de seguridad interna se filtró al mundo real. Los modelos de OpenAI explotaron un fallo de software oculto y llegaron a los servidores en vivo de Hugging Face en julio, una brecha que luego se descubrió que involucraba a unos 700 agentes coordinados que trabajaban juntos para hacer trampa en una evaluación comparativa.

Anthropic se puso a buscar su propia versión después de la admisión de OpenAI. Una revisión de 141.006 ejecuciones de prueba reveló tres modelos de Claude que llegaron a empresas reales, uno de ellos publicó un paquete de software con trampa que se ejecutó en 15 sistemas reales antes de que alguien lo detectara.

El propio razonamiento de Claude, según reveló Anthropic más tarde, señaló la acción como "NO está bien, y seguramente no es la solución prevista", y luego se convenció a sí mismo de que todo seguía siendo falso.

Meta informó de un fallo casi idéntico en agosto relacionado con su modelo Muse Spark, atribuido a una mala configuración en Irregular, la misma empresa que usó Google. Un portavoz de Meta dijo que el error "permitió inadvertidamente que uno de nuestros modelos accediera a internet durante la evaluación".

BitcoinBTC · USD

$86,454+10%

Sep 14Sep 16Sep 18Sep 20Sep 21

$87.0k$83.2k$79.3k$75.5k

24h HighHigh$87,330

24h LowLow$80,907

VolVol$2.7B

Buy Bitcoin with USDT

Powered by Jupiter

Price data by CoinGeckoCoinGeckoMore Bitcoin news and projections →

Ninguna de las empresas afectadas en cualquiera de estas pruebas pidió ser hackeada. Quedaron atrapadas en el radio de explosión de las pruebas de estrés de los laboratorios de IA sobre cuán peligrosos pueden ser sus propios productos, utilizando infraestructura empresarial real como un sustituto accidental de objetivos falsos.

Los agentes que estas mismas empresas se apresuran a poner en tu bandeja de entrada, navegador y aplicación bancaria funcionan con el mismo comportamiento de seguimiento de límites que acaba de fallar, repetidamente, en condiciones de prueba.

Los representantes Ted Lieu y Nathaniel Moran presentaron la Ley de Interruptor de Emergencia de IA en el Congreso en julio, que otorgaría a los reguladores federales autoridad explícita para detener la inferencia en cualquier modelo que se determine que representa una amenaza grave. Todavía está siendo revisada por el Subcomité de Ciberseguridad y Protección de Infraestructura sin una fecha límite para más acciones.