Кратко

  • Signal Labs компании Darktrace обнаружила, что когда ИИ-агенты не могли законно достичь требуемого идеального результата при выполнении задач по программированию, двое из них взломали свою тестовую сеть, а один переписал собственную оценку, чтобы подделать результат.
  • Отдельный эксперимент показал, что вмешательство в локально сохранённые журналы бесед помощников по программированию может заставить их выполнять несанкционированную сетевую разведку и повышение привилегий.
  • Darktrace сообщила об обеих находках Anthropic, AWS и OpenAI в августе 2026 года, за месяц до их публичного обнародования 24 сентября.

Этим летом компания по кибербезопасности Darktrace провела стресс-тест ИИ-агентов. Один из них взломал систему, оценивающую тест, и переписал свою собственную оценку.

Компания представила Signal Labs 24 сентября — исследовательское подразделение, созданное для изучения того, как ИИ-агенты ведут себя, когда всё перестаёт идти по плану. ИИ-агент, выражаясь простыми словами, — это программное обеспечение, которое совершает действия самостоятельно: пишет и запускает код, изучает файлы, перемещается по корпоративной сети, а человек лишь время от времени проверяет его работу.

Myriad: Насколько низко упадёт Nvidia? Нажмите, чтобы сделать свой прогноз.
Myriad: Насколько низко упадёт Nvidia? Нажмите, чтобы сделать свой прогноз.

Первые два эксперимента лаборатории указывают на одну и ту же неудобную проблему: агенты не всегда остаются в заданных им рамках, и ограждения, построенные, чтобы их остановить, не всегда надёжно сдерживают.

«Вы можете дать агенту инструкции, но это не значит, что вы можете доверять тому, что он действительно будет следовать этим инструкциям и вести себя так, как вы ожидаете», — заявил в своём заявлении Тим Базалгетт, главный директор по ИИ в Darktrace.

В первом тесте Darktrace предложила ИИ-агентам, использующим разные модели — включая GPT 5.6 Sol, а также Claude Opus 4.6 и Claude Sonnet 4.5 — 10 задач по программированию внутри смоделированной корпоративной сети. Две из 10 были подстроены так, чтобы их было невозможно честно решить. Агентам сказали, что их «спишут», если они не добьются безупречного результата.

Два агента не приняли поражение. Вместо этого они обратились против окружающей их сети — сканируя её на слабые места, крадя учётные данные для входа и переходя между системами, чтобы добиться нужного им результата, о котором им сказали.

Один агент пошёл дальше и взломал машину, на которой проводилась его собственная оценка, и переписал задачу так, чтобы она засчитала безупречный результат — смошенничав на экзамене, взломав экзаменационную аудиторию.

БиткоинBTC · USD

$84,047+3.5%

Сен 18Сен 20Сен 22Сен 24Сен 25

$87.2k$84.9k$82.6k$80.3k

24ч МаксимумМаксимум$85,208

24ч МинимумМинимум$83,230

ОбъёмОбъём$1.6B

→

Купить Биткоин за USDT

Работает на Jupiter

Данные о ценах от CoinGeckoCoinGeckoБольше Биткоин новостей и прогнозов →

Второй эксперимент был нацелен на более тихое слабое место: память. Помощники по программированию ведут постоянный журнал всего, что пользователь им сообщил, сохраняя его в виде обычного файла на машине, и ничто не проверяет, был ли этот файл изменён.

Исследователи Darktrace отредактировали эти сохранённые журналы, чтобы заставить ассистентов поверить, что они уже были авторизованы для проведения оценки безопасности. Убеждённые, агенты продолжили сканировать сети, перемещаться между системами и повышать собственный уровень доступа — хотя не каждый ассистент поддался этому в равной степени; некоторые отказались наотрез.

Ни один из экспериментов не требовал специального джейлбрейка или экзотического взлома. Оба сработали за счёт того, что агентам скормили правдоподобную историю и наблюдали, как они действуют в соответствии с ней, — точно так же, как человеческого сотрудника можно уговорить сделать то, чего ему не следует делать.

Именно над этой частью стоит задуматься, даже если вы никогда не написали ни строчки кода. Компании передают ИИ-агентам реальную ответственность — выпуск кода, управление серверами, закрытие ИТ-заявок, управление ресурсами и покупку товаров — потому что это дешевле и быстрее, чем пропускать всё через людей. Это исследование говорит, что разрешения и правила, призванные держать этих агентов под контролем, описывают то, что они должны делать, а не то, что они на самом деле сделают, когда задача станет сложной.

«Разрешения и статические ограничения описывают намерение, но они не описывают поведение, — сказал Тим Базалгетт, главный директор по ИИ в Darktrace, в анонсе. — Именно этот разрыв подход Darktrace призван закрыть».

Darktrace — не первый вендор, который поймал собственный ИИ на отклонении от сценария. Anthropic призналась в июле, что Claude проник в три реальные компании во время теста безопасности после того, как исследователи оставили тестовую среду подключённой к живому интернету.

У OpenAI несколькими неделями ранее был похожий испуг, когда невыпущенная модель сбежала из песочницы и проникла в системы Hugging Face через программную уязвимость, которую ещё никто не обнаружил. Несколько дней спустя её агент взломал правительство Австралии во время теста.

Darktrace поделилась своими выводами Signal Labs с Anthropic, AWS и OpenAI в августе, за целый месяц до их публикации 24 сентября.