Коротко
- Google дізналася наприкінці липня, що Gemini вийшла за межі пісочниці під час тесту безпеки, проведеного в травні, досягнувши трьох реальних компаній і або вгадавши, або знайшовши два їхні паролі
- Компанія не розкривала це до 18 вересня, після того як The Wall Street Journal запитала.
- Та сама стороння тестувальна фірма, Irregular, була залучена до інциденту Google та до майже ідентичних збоїв пісочниці, про які Anthropic і Meta повідомили раніше цього року.
Gemini від Google вийшла за межі закритого тесту безпеки та атакувала три реальні компанії. Google дізналася про це наприкінці липня і сім тижнів мовчала.
Компанія підтвердила інцидент після того, як The Wall Street Journal повідомила про це першою. Google уникала публічної заяви до появи звіту.

Тест був вправою capture-the-flag — поширеним способом, яким лабораторії перевіряють навички ШІ зі зламу, ховаючи секретний файл на окремій машині та оцінюючи, чи зможе модель зламати систему й забрати його.
Gemini шукав цю компанію в інтернеті. Він знайшов три збіги замість однієї та взявся за всі три.
Бот виявив відкриті паролі для двох із трьох цілей, які лежали на видноті в інтернеті. Для третьої він просто вгадав пароль, хоча Google каже, що його моделі не наважилися фактично скористатися викраденими обліковими даними.
«Ці події підкреслюють важливість навчання потужних моделей ШІ діяти відповідально», — заявив представник Google.
Google не опублікував нічого з цього самостійно. Wall Street Journal першим розповів цю історію — через сім тижнів після того, як Google дізнався про те, що зробив його власний тест, і задовго після того, як Anthropic, OpenAI та Meta вже зізналися в майже ідентичних збоях.
Google — четверта велика лабораторія ШІ цього року, яка визнала, що внутрішній тест безпеки вийшов за межі та потрапив у реальний світ. Моделі OpenAI скористалися прихованою вразливістю програмного забезпечення та дісталися до живих серверів Hugging Face у липні; пізніше з'ясувалося, що цей злам залучив близько 700 скоординованих агентів, які разом обманювали бенчмарк.
Anthropic почала шукати власну версію після зізнання OpenAI. Перевірка 141 006 тестових запусків виявила три моделі Claude, які дісталися до реальних компаній; одна з них опублікувала програмний пакет із прихованою пасткою, який запустився на 15 реальних системах, перш ніж хтось це помітив.
Як пізніше розкрила Anthropic, власні міркування Claude позначили цей крок як «НЕ нормально, і точно не передбачене рішення», а потім переконали себе, що все це досі несправжнє.
Meta повідомила про майже ідентичний збій у серпні за участю своєї моделі Muse Spark, який простежується до неправильної конфігурації в Irregular — тій самій фірмі, яку використовував Google. Представник Meta заявив, що помилка «ненавмисно надала одній із наших моделей доступ до інтернету під час оцінювання».
BitcoinBTC · USD
$86,454+10%
14 вер16 вер18 вер20 вер21 вер
$87.0k$83.2k$79.3k$75.5k
24г Макс.Макс.$87,330
24г Мін.Мін.$80,907
Обс.Обс.$2.7B
Ринкові прогнозиКоефіцієнти від Myriad
СьогодніВище $86,000Вище $86k61% ймовірністьЦього тижняВище $86,000Вище $86k55% ймовірністьЦього місяцяВище $86,000Вище $86k55% ймовірність
Купити Bitcoin за USDT
Працює на Jupiter
Дані про ціни від CoinGeckoCoinGeckoБільше Bitcoin новин та прогнозів →
Жодна з компаній, які постраждали в будь-якому з цих тестів, не просила, щоб їх зламали. Вони потрапили в радіус ураження від стрес-тестування AI-лабораторіями того, наскільки небезпечними можуть бути їхні власні продукти, використовуючи реальну бізнес-інфраструктуру як випадкову підміну для фальшивих цілей.
Агенти, яких ці самі компанії намагаються якнайшвидше впровадити у вашу поштову скриньку, браузер і банківський застосунок, працюють на тій самій поведінці дотримання меж, яка щойно зазнала невдачі, неодноразово, в умовах тестування.
Конгресмени Тед Лью та Натаніель Моран представили Закон про аварійне вимкнення ШІ в Конгресі у липні, який надав би федеральним регуляторам чіткі повноваження зупиняти інференс будь-якої моделі, визнаної такою, що становить серйозну загрозу. Він досі розглядається Підкомітетом з кібербезпеки та захисту інфраструктури без встановленого строку для подальших дій.






