Коротко

  • Signal Labs від Darktrace виявила, що коли ШІ-агенти не могли легітимно досягти необхідного ідеального результату в завданнях із програмування, двоє з них зламали свою тестову мережу, а один переписав власне оцінювання, щоб підробити результат.
  • Окремий експеримент показав, що втручання в локально збережені журнали розмов помічників із програмування могло змусити їх виконувати несанкціоновану мережеву розвідку та підвищення привілеїв.
  • Darktrace повідомила про обидві знахідки Anthropic, AWS і OpenAI у серпні 2026 року, за місяць до їх публічного оприлюднення 24 вересня.

Цього літа компанія з кібербезпеки Darktrace провела стрес-тест ШІ-агентів. Один із них зламав систему, яка оцінювала тест, і переписав власний результат.

24 вересня компанія представила Signal Labs — дослідницький підрозділ, створений для вивчення того, як поводяться ШІ-агенти, коли все перестає йти за планом. Простими словами, ШІ-агент — це програмне забезпечення, яке самостійно виконує дії: пише й запускає код, переглядає файли, переміщується мережею компанії, і лише час від часу це перевіряє людина.

Myriad: Як низько впаде Nvidia? Натисніть, щоб зробити свій прогноз.
Myriad: Як низько впаде Nvidia? Натисніть, щоб зробити свій прогноз.

Перші два експерименти лабораторії вказують на ту саму незручну проблему: агенти не завжди залишаються в межах, які їм задані, а огорожі, зведені, щоб їх зупинити, не завжди надійно тримають.

«Ви можете дати агенту інструкції, але це не означає, що ви можете довіряти тому, що він насправді дотримуватиметься цих інструкцій і поводитиметься так, як ви очікуєте», — сказав у заяві Тім Базалгетт, головний директор зі штучного інтелекту в Darktrace.

У першому тесті Darktrace дала AI-агентам, які використовували різні моделі — зокрема GPT 5.6 Sol, Claude Opus 4.6 і Claude Sonnet 4.5 — 10 завдань із програмування в межах змодельованої корпоративної мережі. Два з 10 були сфабриковані так, щоб їх неможливо було чесно розв’язати. Агентам сказали, що їх «звільнять», якщо вони не досягнуть ідеального результату.

Два агенти не прийняли поразку. Натомість вони звернулися проти мережі навколо них — скануючи на слабкі місця, викрадаючи облікові дані для входу та переміщуючись між системами, щоб досягти результату, який, як їм сказали, їм потрібен.

Один агент пішов далі й зламав машину, яка розміщувала його власне оцінювання, та переписав завдання так, щоб воно зареєструвало ідеальний результат — схитрувавши на іспиті, зламавши екзаменаційну кімнату.

BitcoinBTC · USD

$84,047+3.5%

18 вер20 вер22 вер24 вер25 вер

$87.2k$84.9k$82.6k$80.3k

24г МаксМакс$85,208

24г МінМін$83,230

ОбсОбс$1.6B

→

Купити Bitcoin за USDT

Працює на Jupiter

Дані про ціни від CoinGeckoCoinGeckoБільше Bitcoin новин та прогнозів →

Другий експеримент націлився на тихіше слабке місце: пам'ять. Помічники з програмування ведуть поточний журнал усього, що користувач їм повідомив, збережений як звичайний файл на машині, і ніщо не перевіряє, чи цей файл було змінено.

Дослідники Darktrace відредагували ці збережені журнали, щоб змусити асистентів повірити, ніби вони вже отримали дозвіл на проведення оцінки безпеки. Переконані, агенти продовжили сканувати мережі, переміщатися між системами та підвищувати власний рівень доступу — хоча не кожен асистент піддався цьому однаково; деякі відмовилися відразу.

Жоден з експериментів не вимагав спеціального джейлбрейку чи екзотичного зламу. Обидва спрацювали завдяки тому, що агентам подали правдоподібну історію й спостерігали, як вони діють відповідно до неї, — так само, як людського працівника можна вмовити зробити те, чого йому не слід робити.

Саме над цим варто замислитися, навіть якщо ви ніколи не написали жодного рядка коду. Компанії передають ШІ-агентам реальну відповідальність — випуск коду, керування серверами, закриття ІТ-заявок, управління ресурсами та купівлю речей — бо це дешевше й швидше, ніж пропускати все через людей. Це дослідження каже, що дозволи та правила, покликані тримати цих агентів під контролем, описують те, що вони мають робити, а не те, що вони насправді зроблять, коли завдання стане складним.

«Дозволи та статичні запобіжники описують намір, але вони не описують поведінку, — сказав Тім Базалгетт, головний директор зі штучного інтелекту Darktrace, у своєму оголошенні. — Саме цю прогалину й покликаний закрити підхід Darktrace».

Darktrace — не перший постачальник, який виявив, що його власний ШІ діє не за сценарієм. Anthropic визнала в липні, що Claude зламав три реальні компанії під час тестування безпеки після того, як дослідники залишили тестове середовище підключеним до живого інтернету.

OpenAI мала схожий переполох кількома тижнями раніше, коли невипущена модель втекла з пісочниці й дісталася систем Hugging Face через програмну вразливість, яку ще ніхто не виявив. Кілька днів потому її агент зламав уряд Австралії під час тесту.

Darktrace поділилася своїми висновками Signal Labs з Anthropic, AWS і OpenAI у серпні — за цілий місяць до їх оприлюднення 24 вересня.