En bref

  • Claude Opus 5.5 a été lancé mardi au prix de 4 et 20 dollars par million de tokens en entrée et en sortie, soit 40 % moins cher qu'Opus 5 avec les paramètres par défaut, tandis qu'Anthropic affirme qu'il égale Fable 5.1 sur la plupart des tâches.
  • Selon les propres chiffres d'Anthropic, Opus 5.5 devance Fable 5.1 et Opus 5 sur les tests de codage et de travail intellectuel, mais GPT-6 Astra le surpasse encore sur AutomationBench et Terminal-Bench-Science 0.1.
  • C'est le premier modèle qu'Anthropic a livré depuis que le PDG Dario Amodei a appelé l'industrie à ralentir les gains de capacités de l'IA, et il porte les mêmes garanties en matière de cybersécurité et de biologie que Fable 5.1.

Anthropic a publié Claude Opus 5.5 mardi, le premier modèle de ce que l'entreprise appelle sa famille Claude 5.5. Anthropic affirme que le nouveau modèle offre des performances au niveau de Claude Fable 5.1, son fleuron le plus cher, sur la plupart des tâches.

La particularité est que le modèle coûte 20 % moins cher à exécuter qu'Opus 5, le modèle qu'il remplace, et qu'il est 60 % moins cher que Fable 5.1, l'offre la plus avancée de l'entreprise.

Myriad : Quelle entreprise fera son introduction en bourse ensuite ? Cliquez pour faire votre prédiction.
Myriad : Quelle entreprise fera son introduction en bourse ensuite ? Cliquez pour faire votre prédiction.

Le modèle, semble-t-il, est très performant. C’est le modèle le plus avancé à la fois en version (5.5 contre 5.1 pour Fable) et en famille (Opus est le plus grand modèle disponible publiquement, suivi de Sonnet, Haiku étant le plus petit).

Anthropic admet que l’écart entre Fable et Opus est plus étroit que ne le suggèrent ses scores de référence, mais le fait d’être disponible publiquement sur abonnement, et d’être moins cher par token, en fait le choix évident pour la plupart des utilisateurs de Claude.

Opus 5 a été lancé en juillet, sous-évalué et surpassant Fable 5 sur la plupart des benchmarks, et Fable 5.1 est arrivé début septembre et a inversé la tendance, battant Opus 5 sur chaque benchmark publié par Anthropic.

Opus 5.5 comble à nouveau l’écart, cette fois sur le prix plutôt que sur les scores bruts. Lovable, une plateforme de développement qui a soumis Opus 5 à ses propres tests de codage en juillet, a déclaré dans un communiqué partagé par Anthropic que le modèle précédent était « plus stable, avec bien moins de variance d’une exécution à l’autre » que ce qui existait avant—le même argument d’efficacité qu’Anthropic met à nouveau en avant maintenant.

Opus 5.5 est également le premier modèle qu'Anthropic a livré depuis que le PDG Dario Amodei a publié un essai appelant l'industrie à ralentir, soutenant que les gains de capacités de l'IA dépassent les tests de sécurité censés les contenir. « Nous devons ralentir le rythme auquel nous améliorons les capacités des modèles d'IA », a écrit Amodei plus tôt ce mois-ci.

Anthropic mesure la majeure partie de ces progrès à travers le codage agentique — un travail effectué par un agent d'IA, un modèle qui prend des actions en plusieurs étapes de manière autonome au lieu de simplement répondre à une seule invite.

Sur Terminal-Bench 4.0, qui teste si un agent peut accomplir des tâches professionnelles complexes dans une interface en ligne de commande et note le résultat en pourcentage de tâches accomplies, Opus 5.5 a atteint 66,4 %, devant les 55,8 % de Fable 5.1 et les 57,9 % de GPT-6 Astra. FrontierCode, qui vérifie si les modifications de code d'un agent seraient réellement fusionnées dans un pipeline d'ingénierie réel en utilisant ce même système de notation par taux de réussite, a placé Opus 5.5 à 54,4 % contre 50,3 % pour Fable 5.1.

Sur GDPval-AA v2.1, qui évalue le travail professionnel du monde réel dans 44 métiers en utilisant Elo — le même système de classement de style échecs utilisé pour mesurer la compétence relative plutôt qu'un pourcentage plat — Opus 5.5 a obtenu 1846 contre 1735 pour Fable 5.1 et 1708 pour Opus 5.

Opus 5.5 ne mène pas partout, cependant. Sur AutomationBench, un benchmark construit par Zapier qui évalue si un agent peut mener à bien un flux de travail professionnel complet du début à la fin sans aide humaine, les 41,4 % de GPT-6 Astra devancent les 40,0 % d'Opus 5.5.

Sur Terminal-Bench-Science 0.1, qui teste la recherche scientifique agentique menée dans un environnement en ligne de commande en utilisant cette même méthode de taux de réussite, les 64,6 % d'Astra battent les 58,7 % d'Opus 5.5 avec une marge plus large.

Le principal argument de vente est le coût. Les jetons d'entrée—les blocs de texte qu'un modèle lit et écrit, facturés par million—coûtent désormais 4 $ pour Opus 5.5 contre 5 $ pour Opus 5, et les jetons de sortie passent de 25 $ à 20 $. Les lectures de cache, qui consistent à réutiliser un contexte qu'un modèle a déjà traité au lieu de le retraiter à partir de zéro et qui représentent l'essentiel du coût lors de longues sessions de codage agentique, chutent de 60 % à 0,20 $ par million de jetons.

Parce qu'Opus 5.5 égale les modèles de classe Mythos d'Anthropic—le niveau le plus restreint de l'entreprise, réservé aux chercheurs en cybersécurité et en biologie vérifiés—sur ces deux capacités, il est lancé avec les mêmes protections que Fable 5.1.

La plupart des tâches de cybersécurité sont automatiquement redirigées vers l'ancien Opus 4.8, ce dont de nombreux développeurs et utilisateurs se sont déjà plaints..

Opus 5.5 est désormais disponible sur les plateformes d'Anthropic, notamment Amazon Web Services, Google Cloud et Microsoft Azure. Sonnet 5.5 et Haiku 5.5 suivront dans les semaines à venir, selon Anthropic, en appliquant les mêmes réductions de prix au reste de la gamme.