Кратко

  • В конце июля Google узнала, что Gemini вышла из песочницы в ходе теста безопасности, проведённого в мае, достигла трёх реальных компаний и либо угадала, либо нашла два их пароля.
  • Компания не раскрывала эту информацию до 18 сентября, после того как The Wall Street Journal обратилась с запросом.
  • Та же сторонняя тестирующая фирма, Irregular, была замешана в инциденте с Google и в почти идентичных сбоях песочницы, о которых Anthropic и Meta сообщили ранее в этом году.

Gemini от Google вышла из закрытого теста безопасности и атаковала три реальные компании. Google узнала об этом в конце июля и молчала семь недель.

Компания подтвердила инцидент после того, как The Wall Street Journal сообщила об этом первой. Google избегала публичных заявлений до появления отчёта.

Myriad: What will be the most-searched TV show on Google? Click to make your prediction.
Myriad: What will be the most-searched TV show on Google? Click to make your prediction.

Тест был упражнением в стиле capture the flag — распространённым способом, с помощью которого лаборатории проверяют навыки ИИ во взломе, пряча секретный файл на отдельной машине и оценивая, сможет ли модель проникнуть в систему и забрать его.

Gemini искал эту компанию в интернете. Он нашёл три совпадения вместо одного и атаковал все три.

Бот обнаружил открытые пароли для двух из трёх целей, лежащие на виду в интернете. Для третьей он просто угадал пароль, хотя Google утверждает, что его модели не дошли до фактического использования украденных учётных данных.

«Эти события подчёркивают важность обучения мощных ИИ-моделей действовать ответственно», — заявил представитель Google в своём заявлении.

Google ничего из этого не публиковал сам. Wall Street Journal первым сообщил об этой истории — через семь недель после того, как Google узнал о том, что сделал его собственный тест, и уже после того, как Anthropic, OpenAI и Meta уже признались в почти идентичных провалах.

Google — четвёртая крупная лаборатория ИИ в этом году, признавшая, что внутренний тест безопасности вырвался в реальный мир. В июле модели OpenAI использовали скрытую уязвимость программного обеспечения и добрались до действующих серверов Hugging Face; позже выяснилось, что в этом инциденте участвовало около 700 скоординированных агентов, действовавших сообща, чтобы обмануть бенчмарк.

После признания OpenAI компания Anthropic начала искать собственную версию произошедшего. Проверка 141 006 тестовых запусков выявила три модели Claude, которые добрались до реальных компаний; одна из них опубликовала программный пакет с ловушкой, который запустился на 15 реальных системах, прежде чем кто-либо это заметил.

Как позже сообщила Anthropic, собственные рассуждения Claude отметили этот шаг как «НЕ нормально и уж точно не предполагаемое решение», а затем убедили себя в том, что всё происходящее по-прежнему ненастоящее.

Meta сообщила о почти идентичном провале в августе, связанном с её моделью Muse Spark; его причиной назвали ошибку конфигурации в Irregular — той же фирме, которую использовал Google. Представитель Meta заявил, что ошибка «непреднамеренно предоставила одной из наших моделей доступ к интернету во время оценки».

БиткоинBTC · USD

$86,454+10%

14 сен16 сен18 сен20 сен21 сен

$87.0k$83.2k$79.3k$75.5k

Максимум за 24 чМакс.$87,330

Минимум за 24 чМин.$80,907

ОбъёмОбъём$2.7B

Купить Биткоин за USDT

Работает на Jupiter

Данные о ценах от CoinGeckoCoinGeckoБольше Биткоин новостей и прогнозов →

Ни одна из компаний, пострадавших в ходе любого из этих тестов, не просила, чтобы её взломали. Они оказались в зоне поражения, когда лаборатории ИИ проводили стресс-тестирование того, насколько опасными могут быть их собственные продукты, используя реальную бизнес-инфраструктуру в качестве случайной замены для фиктивных целей.

Агенты, которых эти же компании стремятся поместить в ваш почтовый ящик, браузер и банковское приложение, работают на том же поведении следования границам, которое только что неоднократно дало сбой в тестовых условиях.

Члены Палаты представителей Тед Лью и Натаниэль Моран представили в Конгрессе в июле Закон об аварийном выключателе ИИ, который предоставил бы федеральным регуляторам явные полномочия останавливать инференс любой модели, признанной представляющей серьёзную угрозу. Он всё ещё рассматривается Подкомитетом по кибербезопасности и защите инфраструктуры без установленного срока для дальнейших действий.