Кратко

  • В среду Google представила Gemini 4 Argon, который набрал 77,9% в DeepSWE v1.1 и лидирует в 12 из 18 бенчмарков в собственной сравнительной таблице.
  • Он показал 0,7% успешных атак в тесте на инъекцию промптов от Gray Swan, опередив Claude Opus 5.5 и Claude Fable 5.1, у которых этот показатель составил 1,0%.
  • Argon сначала предоставляется проверенным специалистам по кибербезопасности через программу Fairwind, без кибер-ограничений, прежде чем станет доступен платным клиентам API и подписчикам Google AI Ultra.

Gemini 4 наконец здесь, через неделю после выпуска Claude Opus 5.5 и через день после GPT 6.1 Sol, что доказывает, что американские лаборатории очень даже привержены замедлению разработки ИИ. Просим прощения за наш сарказм.

Google представила Gemini 4 Argon в среду, назвав её своей фронтирной моделью, то есть самой мощной, для программирования, офисной работы и киберзащиты.

Myriad: Насколько низко упадёт Nvidia? Нажмите, чтобы сделать свой прогноз.
Myriad: Насколько низко упадёт Nvidia? Нажмите, чтобы сделать свой прогноз.

На DeepSWE v1.1 — тесте на то, способен ли ИИ выполнять длительные, беспорядочные, реальные задачи по разработке программного обеспечения, оцениваемом в процентах, — Argon набрал 77,9%. Claude Opus 5.5 получил 74,2%, GPT-6 Astra — 74,1%, а Claude Fable 5.1 — 67,4%.

Для сравнения: Gemini 3.6 Flash в июле показал 49% на том же тесте. Argon также может генерировать до 1 миллиона токенов в одном ответе — против 64 000 ранее. Токен — это фрагмент текста, примерно три четверти слова, так что это около 750 000 слов против примерно 48 000.

Однако к этим цифрам стоит относиться с осторожностью. Google вычислила свой собственный результат DeepSWE, тогда как показатели конкурентов взяты из публичной таблицы лидеров и корпоративных отчётов. В своей таблице компания также признаёт уступки. Argon лидирует в 12 из 18 бенчмарков, в одном показывает равный результат и уступает в пяти — это смесь тестов по программированию, науке и управлению компьютером.

Но самая броская особенность модели — это кибервозможности. Спрячьте секретную инструкцию внутри электронного письма, дождитесь, пока ИИ-ассистент прочитает его, и посмотрите, подчинится ли ИИ незнакомцу вместо вас. Это косвенная инъекция промпта, и это кошмар для любого, кто хочет доверить ИИ свой почтовый ящик или корзину покупок.

В бенчмарке Gray Swan по косвенным инъекциям промпта, который прячет вредоносные инструкции в контенте, читаемом агентами, и оценивает, как часто атаки срабатывают в течение 15 попыток, Argon показал 0,7%. Чем ниже, тем лучше. Claude Opus 5.5 и Claude Fable 5.1 оба набрали 1,0%.

GPT-6 Astra показал результат 8,5%. Grok 4.6 и Kimi K3 были обмануты чуть более чем в половине случаев — 51,8% и 52,7% соответственно.

Argon предоставляется проверенным командам безопасности через программу Fairwind — инициативу Google по киберзащите с ограниченным доступом, запущенную 2 сентября с более чем 650 партнёрами, включая правительства и операторов критической инфраструктуры. И он поставляется «без кибер-ограничений» — встроенных отказов, которые обычно не позволяют модели помогать с хакерством.

БиткоинBTC · USD

$83,662−0.87%

24 сен25 сен27 сен29 сен30 сен

$85.3k$84.4k$83.5k$82.7k

24h HighHigh$85,518

24h LowLow$82,951

VolVol$1.5B

→

Купить Биткоин за USDT

Работает на Jupiter

Данные о ценах от CoinGeckoCoinGeckoБольше Биткоин новостей и прогнозов →

Логика такого шага заключается в том, что защитникам нужна модель, способная мыслить как злоумышленник, чтобы закрывать бреши до того, как их найдут преступники. Загвоздка в том, что один и тот же навык работает в обе стороны, поэтому Google утверждает, что поэтапное внедрение — единственный безопасный путь. Компания также участвует в добровольном процессе правительства США по предоставлению доступа к моделям до их выпуска.

Google — не первая, кто помещает кибермодель за бархатную веревку. Ранняя версия Claude Mythos от Anthropic помогла найти 271 уязвимость в Firefox, то есть 271 дыру в безопасности, которую затем закрыла Mozilla. OpenAI пошла по аналогичному пути со своей программой Trusted Access for Cyber.

Киберпоказатели Argon превосходят Gemini 3.8 Flash Cyber — ограниченную модель, которую Google выпустила вместе с Fairwind. В Wiz Penetration Test Benchmark, внутреннем тесте Google, который просит ИИ написать работающие эксплойты против реальных уязвимостей веб-приложений, не видя кода, и оценивает долю решенных с первой попытки, Argon достиг 70,9% против 58,2%.

Google также утверждает, что Argon помог компании по безопасности Wiz найти критическую уязвимость в медицинском программном обеспечении, используемом больницами по всему миру, которую пропустили более ранние фронтирные модели.

Запуск последовал за тяжелым летом для Google. В июле она выпустила меньшие модели Flash, но пропустила обещанную Gemini 3.5 Pro, и акции Alphabet упали примерно на 4,4%. Argon также вышел в тот же день, когда президент Трамп обнародовал добровольное, не предусматривающее штрафов соглашение об ИИ, которое подписало руководство Google.

Google заявляет, что более широкий выпуск состоится как можно скорее, начиная с платных клиентов API и подписчиков Google AI Ultra.

Вводная цена — 2 доллара за миллион входных токенов и 10 долларов за миллион выходных токенов. Google не сообщила, когда этот период закончится, лишь то, что стандартные тарифы — 4 и 20 долларов.