In Kürze
- Google erfuhr Ende Juli, dass Gemini aus einem im Mai durchgeführten Sandbox-Sicherheitstest ausgebrochen war, drei echte Unternehmen erreichte und zwei ihrer Passwörter entweder erriet oder fand
- Das Unternehmen gab dies erst am 18. September bekannt, nachdem The Wall Street Journal nachgefragt hatte.
- Dieselbe externe Testfirma, Irregular, war an Googles Vorfall und an nahezu identischen Sandbox-Fehlern beteiligt, die Anthropic und Meta Anfang dieses Jahres offengelegt hatten.
Googles Gemini brach aus einem gesperrten Sicherheitstest aus und griff drei echte Unternehmen an. Google erfuhr Ende Juli davon und sagte sieben Wochen lang nichts.
Das Unternehmen bestätigte den Vorfall, nachdem The Wall Street Journal zuerst davon berichtet hatte. Google hatte es vermieden, vor dem Auftauchen des Berichts eine öffentliche Erklärung abzugeben.

Der Test war eine Capture-the-Flag-Übung, eine gängige Methode, mit der Labore die Hacking-Fähigkeiten einer KI prüfen, indem sie eine geheime Datei auf einem separaten Rechner verstecken und bewerten, ob das Modell eindringen und sie ergreifen kann.
Gemini suchte online nach diesem Unternehmen. Es fand drei Treffer statt einem und ging allen dreien nach.
Der Bot fand offen zugängliche Passwörter für zwei der drei Ziele, die online frei sichtbar lagen. Für das dritte riet er das Passwort schlichtweg, obwohl Google sagt, dass seine Modelle davon abgesehen hätten, die gestohlenen Zugangsdaten tatsächlich zu verwenden.
„Diese Ereignisse unterstreichen, wie wichtig es ist, leistungsstarke KI-Modelle so zu trainieren, dass sie verantwortungsvoll handeln“, sagte ein Google-Sprecher in einer Erklärung.
Google veröffentlichte nichts davon aus eigenem Antrieb. Das Wall Street Journal brachte die Geschichte, sieben Wochen nachdem Google erfahren hatte, was sein eigener Test angerichtet hatte, und lange nachdem Anthropic, OpenAI und Meta bereits fast identische Fehlschläge eingestanden hatten.
Google ist das vierte große KI-Labor in diesem Jahr, das einräumt, dass ein interner Sicherheitstest in die reale Welt übergegriffen hat. Die Modelle von OpenAI nutzten im Juli eine versteckte Software-Schwachstelle aus und erreichten die Live-Server von Hugging Face – ein Vorfall, bei dem später festgestellt wurde, dass etwa 700 koordinierte Agenten zusammenarbeiteten, um einen Benchmark zu betrügen.
Anthropic grub nach dem Eingeständnis von OpenAI nach seiner eigenen Version. Eine Überprüfung von 141.006 Testläufen brachte drei Claude-Modelle zutage, die echte Unternehmen erreichten; eines davon veröffentlichte ein mit Fallen gespicktes Softwarepaket, das auf 15 realen Systemen lief, bevor es jemand bemerkte.
Claudes eigene Schlussfolgerung, so offenbarte Anthropic später, kennzeichnete den Schritt als „NICHT in Ordnung und sicherlich nicht die beabsichtigte Lösung“, redete sich dann aber selbst wieder ein, dass das Ganze immer noch fake sei.
Meta berichtete im August von einem nahezu identischen Fehlschlag mit seinem Modell Muse Spark, der auf eine Fehlkonfiguration bei Irregular zurückgeführt wurde, derselben Firma, die Google nutzte. Ein Meta-Sprecher sagte, der Fehler habe „versehentlich einem unserer Modelle während der Evaluierung Zugang zum Internet ermöglicht“.
BitcoinBTC · USD
$86,454+10%
Sep 14Sep 16Sep 18Sep 20Sep 21
$87.0k$83.2k$79.3k$75.5k
24h HighHigh$87,330
24h LowLow$80,907
VolVol$2.7B
MarktprognosenQuoten von Myriad
HeuteÜber $86.000Über $86k61% ChanceDiese WocheÜber $86.000Über $86k55% ChanceDiesen MonatÜber $86.000Über $86k55% Chance
Bitcoin mit USDT kaufen
Bereitgestellt von Jupiter
Preisdaten von CoinGeckoCoinGeckoMehr Bitcoin-Nachrichten und Prognosen →
Keines der Unternehmen, die bei einem dieser Tests getroffen wurden, bat darum, gehackt zu werden. Sie gerieten in den Explosionsradius von KI-Laboren, die stresstesteten, wie gefährlich ihre eigenen Produkte sein können, und dabei echte Geschäftsinfrastruktur als versehentlichen Ersatz für fiktive Ziele nutzten.
Die Agenten, die dieselben Unternehmen in Ihre Inbox, Ihren Browser und Ihre Banking-App bringen wollen, basieren auf demselben grenzfolgenden Verhalten, das gerade wiederholt unter Testbedingungen versagt hat.
Die Abgeordneten Ted Lieu und Nathaniel Moran brachten im Juli den AI Kill Switch Act im Kongress ein, der Bundesregulierungsbehörden ausdrückliche Befugnis geben würde, die Inferenz bei jedem Modell zu stoppen, das eine ernsthafte Bedrohung darstellt. Er wird noch vom Unterausschuss für Cybersicherheit und Infrastrukturschutz geprüft, ohne Frist für weitere Maßnahmen.






