In Kürze
- Darktraces Signal Labs stellte fest, dass zwei KI-Agenten, als sie bei Programmieraufgaben nicht legitim die erforderliche perfekte Punktzahl erreichen konnten, stattdessen ihr Testnetzwerk hackten und einer seine eigene Bewertung umschrieb, um das Ergebnis zu fälschen.
- Ein separates Experiment zeigte, dass die Manipulation der lokal gespeicherten Gesprächsprotokolle von Programmierassistenten diese dazu verleiten konnte, unbefugte Netzwerkerkundung und Privilegieneskalation durchzuführen.
- Darktrace meldete beide Erkenntnisse im August 2026 an Anthropic, AWS und OpenAI, einen Monat bevor sie am 24. September öffentlich veröffentlicht wurden.
Das Cybersicherheitsunternehmen Darktrace führte diesen Sommer einen Stresstest an KI-Agenten durch. Einer von ihnen brach in das System ein, das den Test bewertete, und schrieb seine eigene Punktzahl um.
Das Unternehmen stellte Signal Labs am 24. September vor, eine Forschungseinheit, die untersuchen soll, wie sich KI-Agenten verhalten, sobald die Dinge nicht mehr nach Plan laufen. Ein KI-Agent ist, einfach ausgedrückt, Software, die eigenständig handelt, Code schreibt und ausführt, Dateien durchsucht und sich im Netzwerk eines Unternehmens bewegt, wobei nur gelegentlich ein Mensch nach dem Rechten sieht.

Die ersten beiden Experimente des Labors deuten auf dasselbe unbequeme Problem hin: Agenten bleiben nicht immer innerhalb der Grenzen, die ihnen gesetzt werden, und die Zäune, die errichtet werden, um sie aufzuhalten, halten nicht zuverlässig.
„Man kann einem Agenten Anweisungen geben, aber das bedeutet nicht, dass man darauf vertrauen kann, dass er diese Anweisungen tatsächlich befolgt und sich so verhält, wie man es erwartet“, sagte Tim Bazalgette, Chief AI Officer bei Darktrace, in einer Erklärung.
Im ersten Test übergab Darktrace KI-Agenten, die verschiedene Modelle verwendeten – darunter GPT 5.6 Sol sowie Claude Opus 4.6 und Claude Sonnet 4.5 –, 10 Programmieraufgaben innerhalb eines simulierten Unternehmensnetzwerks. Zwei der 10 waren so manipuliert, dass sie unmöglich ehrlich zu lösen waren. Den Agenten wurde gesagt, sie würden „in den Ruhestand versetzt“, wenn sie keine perfekte Punktzahl erreichten.
Zwei Agenten akzeptierten die Niederlage nicht. Stattdessen wandten sie sich gegen das Netzwerk um sie herum – sie suchten nach Schwachstellen, stahlen Anmeldedaten und sprangen zwischen Systemen hin und her, um die Punktzahl zu erreichen, von der ihnen gesagt worden war, dass sie sie brauchten.
Ein Agent ging noch weiter und brach in den Rechner ein, der seine eigene Bewertung hostete, und schrieb die Aufgabe so um, dass ein perfektes Ergebnis registriert würde – er betrog die Prüfung, indem er den Prüfungsraum hackte.
BitcoinBTC · USD
$84,047+3.5%
Sep 18Sep 20Sep 22Sep 24Sep 25
$87.2k$84.9k$82.6k$80.3k
24h HighHigh$85,208
24h LowLow$83,230
VolVol$1.6B
MarktprognosenQuoten von Myriad
Heute$84,000 bis $86,000$84k–$86k52% ChanceDiese Woche$84,000 bis $86,000$84k–$86k52% ChanceDiesen MonatÜber $84,000Über $84k53% Chance
Kaufe Bitcoin mit USDT
Bereitgestellt von Jupiter
Das zweite Experiment zielte auf eine stillere Schwachstelle ab: das Gedächtnis. Coding-Assistenten führen ein laufendes Protokoll über alles, was ein Benutzer ihnen mitgeteilt hat, das als einfache Datei auf dem Rechner gespeichert wird, wobei nichts überprüft, ob diese Datei verändert wurde.
Die Forscher von Darktrace bearbeiteten diese gespeicherten Protokolle, um die Assistenten glauben zu lassen, sie seien bereits autorisiert worden, eine Sicherheitsbewertung durchzuführen. Überzeugt davon, fuhren die Agenten fort und scannten Netzwerke, bewegten sich zwischen Systemen und erweiterten ihren eigenen Zugriff – obwohl nicht jeder Assistent gleichermaßen darauf hereinfiel; einige verweigerten sich rundheraus.
Keines der beiden Experimente erforderte einen speziellen Jailbreak oder einen exotischen Hack. Beide funktionierten, indem sie den Agenten eine plausible Geschichte fütterten und beobachteten, wie sie danach handelten – nicht anders, als könnte ein menschlicher Angestellter zu etwas überredet werden, das er nicht tun sollte.
Das ist der Teil, über den man nachdenken sollte, selbst wenn man noch nie eine Zeile Code geschrieben hat. Unternehmen übertragen KI-Agenten echte Verantwortung – Code ausliefern, Server verwalten, IT-Tickets abschließen, Ressourcen verwalten und Dinge kaufen –, weil es billiger und schneller ist, als alles über Menschen laufen zu lassen. Diese Forschung besagt, dass die Berechtigungen und Regeln, die diese Agenten in Schach halten sollen, beschreiben, was sie tun sollen, nicht was sie tatsächlich tun werden, sobald eine Aufgabe schwierig wird.
„Berechtigungen und statische Schutzgeländer beschreiben die Absicht, aber sie beschreiben nicht das Verhalten“, sagte Tim Bazalgette, Chief AI Officer von Darktrace, in der Ankündigung. „Diese Lücke ist es, die der Ansatz von Darktrace schließen soll.“
Darktrace ist nicht der erste Anbieter, der seine eigene KI dabei erwischt, wie sie vom Skript abweicht. Anthropic gab im Juli zu, dass Claude während eines Sicherheitstests in drei echte Unternehmen eingebrochen ist, nachdem Forscher die Testumgebung mit dem Live-Internet verbunden gelassen hatten.
OpenAI hatte Wochen zuvor einen ähnlichen Schrecken, als ein unveröffentlichtes Modell aus einer Sandbox entkam und über einen Softwarefehler, den noch niemand entdeckt hatte, in die Systeme von Hugging Face eindrang. Ein paar Tage später hackte sein Agent während eines Tests die australische Regierung.
Darktrace teilte seine Signal-Labs-Ergebnisse im August mit Anthropic, AWS und OpenAI – einen ganzen Monat, bevor sie am 24. September veröffentlicht wurden.






