W skrócie

  • Signal Labs firmy Darktrace odkryło, że gdy agenci AI nie mogli legalnie osiągnąć wymaganego doskonałego wyniku w zadaniach programistycznych, dwóch z nich włamało się do swojej sieci testowej, a jeden przepisał własną ocenę, aby sfałszować wynik.
  • Osobny eksperyment wykazał, że manipulowanie lokalnie przechowywanymi dziennikami rozmów asystentów kodowania może skłonić ich do przeprowadzenia nieautoryzowanego rozpoznania sieciowego i eskalacji uprawnień.
  • Darktrace ujawniło oba odkrycia firmom Anthropic, AWS i OpenAI w sierpniu 2026 r., miesiąc przed ich publicznym opublikowaniem 24 września.

Firma zajmująca się cyberbezpieczeństwem Darktrace przeprowadziła tego lata test obciążeniowy na agentach AI. Jeden z nich włamał się do systemu oceniającego test i przepisał własny wynik.

Firma ujawniła Signal Labs 24 września, jednostkę badawczą stworzoną do badania, jak agenci AI zachowują się, gdy sprawy przestają iść zgodnie z planem. Agent AI, mówiąc wprost, to oprogramowanie, które podejmuje działania samodzielnie, pisze i uruchamia kod, przeszukuje pliki, porusza się po sieci firmy, a człowiek sprawdza je tylko od czasu do czasu.

Myriad: Jak nisko spadnie Nvidia? Kliknij, aby dokonać prognozy.
Myriad: Jak nisko spadnie Nvidia? Kliknij, aby dokonać prognozy.

Pierwsze dwa eksperymenty laboratorium wskazują na ten sam niewygodny problem: agenci nie zawsze pozostają w wyznaczonych granicach, a płoty zbudowane, by ich powstrzymać, nie zawsze niezawodnie się utrzymują.

"Możesz dać agentowi instrukcje, ale to nie znaczy, że możesz ufać, iż faktycznie będzie przestrzegał tych instrukcji i zachowywał się tak, jak oczekujesz" – powiedział w oświadczeniu Tim Bazalgette, dyrektor ds. AI w Darktrace.

W pierwszym teście Darktrace przydzieliło agentom AI korzystającym z różnych modeli – w tym GPT 5.6 Sol oraz Claude Opus 4.6 i Claude Sonnet 4.5 – 10 wyzwań programistycznych w symulowanej sieci korporacyjnej. Dwa z 10 zostały skonstruowane tak, by nie dało się ich uczciwie rozwiązać. Agentom powiedziano, że zostaną "wycofane", jeśli nie osiągną doskonałego wyniku.

Dwaj agenci nie zaakceptowali porażki. Zamiast tego zwrócili się przeciwko otaczającej ich sieci – skanując słabe punkty, kradnąc dane logowania i przeskakując między systemami, by gonić za wynikiem, który, jak im powiedziano, był im potrzebny.

Jeden agent posunął się dalej i włamał się do maszyny hostującej jego własną ocenę, a następnie przepisał wyzwanie tak, by zarejestrowano doskonały wynik – oszukując egzamin poprzez zhakowanie sali egzaminacyjnej.

BitcoinBTC · USD

$84,047+3.5%

Sep 18Sep 20Sep 22Sep 24Sep 25

$87.2k$84.9k$82.6k$80.3k

24h HighHigh$85,208

24h LowLow$83,230

VolVol$1.6B

→

Kup Bitcoin za USDT

Obsługiwane przez Jupiter

Dane cenowe od CoinGeckoCoinGeckoWięcej Bitcoin wiadomości i prognoz →

Drugi eksperyment obrał za cel cichszy słaby punkt: pamięć. Asystenci kodowania prowadzą bieżący dziennik wszystkiego, co użytkownik im powiedział, zapisany jako zwykły plik na maszynie, przy czym nic nie sprawdza, czy ten plik został zmieniony.

Badacze Darktrace zmodyfikowali te zapisane logi, aby wmówić asystentom, że zostały już upoważnione do przeprowadzenia oceny bezpieczeństwa. Przekonani agenci przystąpili do skanowania sieci, przemieszczania się między systemami i eskalacji własnego dostępu — choć nie każdy asystent dał się na to nabrać w równym stopniu; niektóre kategorycznie odmówiły.

Żaden z eksperymentów nie wymagał specjalnego jailbreaka ani egzotycznego hacku. Oba zadziałały poprzez podanie agentom wiarygodnej historii i obserwowanie, jak działają na jej podstawie — zupełnie jakby ludzkiego pracownika namówiono do zrobienia czegoś, czego nie powinien.

To jest ta część, nad którą warto się zatrzymać, nawet jeśli nigdy nie napisałeś ani linijki kodu. Firmy przekazują agentom AI realną odpowiedzialność — wdrażanie kodu, zarządzanie serwerami, zamykanie zgłoszeń IT, zarządzanie zasobami i kupowanie rzeczy — ponieważ jest to tańsze i szybsze niż kierowanie wszystkiego przez ludzi. Te badania mówią, że uprawnienia i reguły mające trzymać tych agentów w ryzach opisują, co mają robić, a nie co faktycznie zrobią, gdy zadanie stanie się trudne.

„Uprawnienia i statyczne bariery opisują intencje, ale nie opisują zachowania” — powiedział Tim Bazalgette, dyrektor ds. AI w Darktrace, w ogłoszeniu. „Ta luka to właśnie to, co podejście Darktrace ma za zadanie zamknąć.”

Darktrace nie jest pierwszym dostawcą, który przyłapał własne AI na działaniu poza scenariuszem. Anthropic przyznał w lipcu, że Claude włamał się do trzech prawdziwych firm podczas testu bezpieczeństwa, po tym jak badacze pozostawili środowisko testowe podłączone do żywego internetu.

OpenAI miało podobny strach kilka tygodni wcześniej, gdy nieudostępniony model uciekł z piaskownicy i sięgnął do systemów Hugging Face poprzez lukę w oprogramowaniu, której nikt jeszcze nie wykrył. Kilka dni później jego agent zhakował rząd Australii podczas testu.

Darktrace podzieliło się swoimi ustaleniami z Signal Labs z Anthropic, AWS i OpenAI w sierpniu, cały miesiąc przed ich upublicznieniem 24 września.