En bref
- Google a dévoilé Gemini 4 Argon mercredi, obtenant 77,9 % sur DeepSWE v1.1 et se classant en tête de 12 des 18 benchmarks dans son propre tableau comparatif.
- Il a affiché un taux de réussite d'attaque de 0,7 % au test d'injection de prompt de Gray Swan, devant Claude Opus 5.5 et Claude Fable 5.1, qui ont tous deux obtenu 1,0 %.
- Argon est d'abord proposé aux cyberdéfenseurs vérifiés via le programme Fairwind, sans garde-fous cyber, avant d'atteindre les clients payants de l'API et les abonnés Google AI Ultra.
Gemini 4 est enfin là, une semaine après la sortie de Claude Opus 5.5 et un jour après GPT 6.1 Sol, prouvant que les laboratoires américains sont très attachés à ralentir le développement de l'IA. Veuillez excuser notre sarcasme.
Google a dévoilé Gemini 4 Argon mercredi, le qualifiant de son modèle de pointe, c'est-à-dire son plus performant, pour le codage, le travail de bureau et la cyberdéfense.

Sur DeepSWE v1.1, un test visant à déterminer si une IA peut mener à bien des tâches d'ingénierie logicielle longues, désordonnées et du monde réel, noté en pourcentage, Argon a atteint 77,9 %. Claude Opus 5.5 a obtenu 74,2 %, GPT-6 Astra 74,1 % et Claude Fable 5.1 67,4 %.
Pour donner une échelle, Gemini 3.6 Flash a réussi 49 % sur le même test en juillet. Argon peut également écrire jusqu'à 1 million de tokens en une seule réponse, contre 64 000 auparavant. Un token est un morceau de texte, environ les trois quarts d'un mot, ce qui représente donc environ 750 000 mots contre environ 48 000.
Prenez toutefois ces chiffres avec des pincettes. Google a calculé son propre score DeepSWE, tandis que les chiffres de ses rivaux proviennent d'un classement public et de rapports d'entreprises. Son tableau concède également du terrain. Argon est en tête sur 12 des 18 benchmarks, est à égalité sur un et est en retard sur cinq, un mélange de tests de codage, de science et de contrôle informatique.
Mais la caractéristique la plus tape-à-l'œil du modèle réside dans ses capacités cyber. Cachez une instruction secrète dans un e-mail, attendez qu'un assistant IA la lise, et voyez si l'IA obéit à l'inconnu plutôt qu'à vous. C'est l'injection indirecte de prompt, et c'est le cauchemar de quiconque souhaite confier à une IA sa boîte de réception ou son panier d'achat.
Sur le benchmark d'injection indirecte de prompt de Gray Swan, qui cache des instructions malveillantes dans le contenu que lisent les agents et évalue la fréquence à laquelle les attaques réussissent en 15 tentatives, Argon a atteint 0,7 %. Plus bas, c'est mieux. Claude Opus 5.5 et Claude Fable 5.1 ont tous deux obtenu 1,0 %.
GPT-6 Astra a atteint 8,5 %. Grok 4.6 et Kimi K3 se sont fait piéger un peu plus d'une fois sur deux, à 51,8 % et 52,7 %.
Argon est distribué à des équipes de sécurité vérifiées via le programme Fairwind, l'initiative de cyberdéfense à accès limité de Google, lancée le 2 septembre avec plus de 650 partenaires, dont des gouvernements et des opérateurs d'infrastructures critiques. Et il est livré « sans garde-fous cybernétiques », les refus intégrés qui empêchent normalement un modèle d'aider au piratage.
BitcoinBTC · USD
83 662 $−0,87%
24 sept.25 sept.27 sept.29 sept.30 sept.
85,3 k$84,4 k$83,5 k$82,7 k$
Haut 24 hHaut85 518 $
Bas 24 hBas82 951 $
VolVol1,5 Md$
Projections du marchéCotes par Myriad
Aujourd'hui82 000 $ à 84 000 $82 k$–84 k$55% de chanceCette semaineSous 84 000 $Sous 84 k$56% de chanceCe mois-ci82 000 $ à 84 000 $82 k$–84 k$55% de chance
Acheter Bitcoin avec USDT
Propulsé par Jupiter
La logique derrière une telle mesure est que les défenseurs ont besoin d'un modèle capable de penser comme un attaquant pour colmater les failles avant que les criminels ne les trouvent. Le hic, c'est que la même compétence joue dans les deux sens, c'est pourquoi Google affirme qu'un déploiement progressif est la seule voie sûre. L'entreprise participe également au processus volontaire du gouvernement américain pour l'accès aux modèles avant leur publication.
Google n'est pas le premier à placer un modèle cyber derrière une corde de velours. Une première version de Claude Mythos d'Anthropic a aidé à trouver 271 vulnérabilités dans Firefox, soit 271 failles de sécurité que Mozilla a ensuite corrigées. OpenAI a emprunté une voie similaire avec son programme Trusted Access for Cyber.
Les scores cyber d'Argon dépassent ceux de Gemini 3.8 Flash Cyber, le modèle restreint que Google a lancé avec Fairwind. Sur le Wiz Penetration Test Benchmark, un test interne de Google qui demande à une IA d'écrire des exploits fonctionnels contre de véritables failles d'applications web sans voir le code, et qui évalue la proportion résolue du premier coup, Argon a atteint 70,9 % contre 58,2 %.
Google affirme également qu'Argon a aidé la société de sécurité Wiz à trouver une faille critique dans un logiciel de santé utilisé par des hôpitaux du monde entier, une faille que les modèles de frontière précédents avaient manquée.
Le lancement fait suite à un été difficile pour Google. En juillet, il a livré des modèles Flash plus petits mais a sauté le Gemini 3.5 Pro promis, et l'action Alphabet a chuté d'environ 4,4 %. Argon est également arrivé le jour même où le président Trump a dévoilé un accord volontaire sur l'IA, sans pénalité, que la direction de Google a signé.
Google indique qu'une diffusion plus large interviendra dès que possible, en commençant par les clients payants de l'API et les abonnés à Google AI Ultra.
Le tarif d'introduction est de 2 $ par million de jetons d'entrée et de 10 $ par million de jetons de sortie. Google n'a pas précisé quand cette période se termine, seulement que les tarifs standard sont de 4 $ et 20 $.






