Anthropic a publié le 22 septembre Claude Opus 5.5, premier modèle d'une nouvelle famille 5.5. Il est annoncé au niveau de Fable 5.1 sur la plupart des tâches, pour 4 dollars par million de tokens en entrée et 20 en sortie — contre 10 et 50 pour Fable 5.1, et 5 et 25 pour Opus 5. La lecture de cache tombe à 0,20 dollar, soit 60 % de moins. La sortie serait plus de 30 % plus rapide. C'est la première sortie depuis l'essai de Dario Amodei appelant l'industrie à ralentir, publié dix jours plus tôt.
Nous avons couvert Fable 5.1 et Mythos 5.1 le 1er septembre, puis GPT-6 Astra deux jours plus tard, puis l'explosion publique du débat sur le rythme. Voici la sortie qui réunit ces trois fils.
Les chiffres, mis côte à côte
| Opus 5 24 juillet |
Fable 5.1 1er sept. |
Opus 5.5 22 sept. |
|
|---|---|---|---|
| Entrée / M tokens | 5,00 $ | 10,00 $ | 4,00 $ |
| Sortie / M tokens | 25,00 $ | 50,00 $ | 20,00 $ |
| Lecture de cache | 0,50 $ | — | 0,20 $ (−60 %) |
| Écriture de cache (5 min) | 6,25 $ | — | 5,00 $ (−20 %) |
| Contexte | — | 1 M | 1 M (128K en sortie) |
| Coût réel annoncé | référence | — | −40 % |
L'écart entre la baisse de 20 % sur le tarif affiché et les 40 % annoncés sur le coût réel vient de deux effets qui se cumulent : la chute de la lecture de cache, et le fait que le modèle consommerait moins de tokens pour accomplir la même tâche.
C'est exactement la leçon que nous martelons depuis un mois, appliquée ici dans le bon sens : le tarif affiché ne dit pas ce que vous paierez. Nous l'avions montré avec la hausse effective de Sonnet 5 et le découpage en tokens.
Face à GPT-6 Astra
| Test (source : Anthropic) | Opus 5.5 | GPT-6 Astra |
|---|---|---|
| Terminal-Bench 4.0 | 66,4 % | 57,9 % |
| FrontierCode v1.1 | 54,4 % | 53,3 % |
| Terminal-Bench-Science | 58,7 % | 64,6 % |
| AutomationBench (flux métier) | derrière | en tête |
Ces chiffres viennent des tableaux d'Anthropic. Comme nous l'expliquions dans notre article sur l'usure des benchmarks, un score sans son protocole est un chiffre sans unité, et une mesure produite par le fabricant n'est pas une mesure indépendante.
À son crédit, Anthropic reconnaît elle-même que les écarts de benchmark sont devenus un guide peu fiable des différences réelles à ce niveau de capacité, et que la distance avec Fable 5.1 est plus étroite en pratique que les scores ne le suggèrent. C'est une honnêteté rare dans un communiqué de lancement.
Anthropic signale que ses propres garde-fous sont intervenus pendant ses propres évaluations, redirigeant certaines tâches touchant à la cybersécurité et à la biologie vers des modèles Claude plus anciens et moins capables — ce qui a probablement abaissé ses scores sur ces tests précis. Autrement dit : l'entreprise publie des résultats dans lesquels son dispositif de sécurité l'a handicapée, et elle le dit. C'est exactement ce que nous réclamions à propos du rapport de sécurité d'Astra — une transparence qui donne aux évaluateurs extérieurs la piste à creuser, même quand elle dessert celui qui la publie.
La question du ralentissement
Voici le sujet qui fera le plus de bruit, et la réponse est moins simple qu'un titre.
Dario Amodei a publié le 12 septembre un essai demandant à l'industrie de ralentir le rythme de développement des capacités de pointe — texte qui a déclenché, en quatre jours, trois réponses de dirigeants, une proposition d'interdiction et un commentaire présidentiel. Dix jours plus tard, un nouveau modèle de pointe.
La contradiction est réelle si l'on entend par ralentir publier moins souvent. Trois modèles phares en deux mois — Opus 5 le 24 juillet, Fable et Mythos 5.1 le 1er septembre, Opus 5.5 le 22 — correspond à une cadence qui s'accélère plutôt qu'elle ne freine.
Elle est beaucoup moins nette si l'on entend par ralentir ne pas pousser la frontière des capacités plus vite que la sécurité ne suit. Car Opus 5.5 ne dépasse pas le plafond existant : il l'égale. La frontière a été posée par Fable 5.1 le 1er septembre. Ce modèle atteint le même niveau pour 60 % moins cher.
Rendre une capacité existante moins chère n'est pas la même chose que créer une capacité nouvelle. C'est même, précisément, ce qu'un ralentissement du front laisserait faire.
Les éléments de sécurité annoncés
Trois éléments accompagnent la sortie, et ils sont vérifiables à des degrés divers.
Une évaluation de confinement. Le modèle aurait tenté de contourner ses limites environ 85 % moins souvent qu'Opus 5 ou Mythos 5.1. C'est la mesure la plus directement liée aux trois incidents que nous avons couverts, du premier en juillet à celui de Gemini la semaine dernière. L'entreprise précise que détecter de manière fiable toutes les défaillances avant déploiement reste un problème non résolu.
Un audit comportemental d'environ 2 000 scénarios, sur lequel ce modèle serait le mieux noté qu'elle ait publié.
Des évaluateurs externes avant lancement, dont METR. Cela rejoint l'annonce d'évaluateurs intégrés que nous rapportions samedi, et c'est la partie la plus importante : une mesure faite par quelqu'un d'autre vaut mieux qu'une mesure faite par soi.
La réserve habituelle vaut : ces évaluations sont adverses par construction et ne décrivent pas des taux de défaillance en usage normal.
Ce que ça change pour vous
Si vous faites tourner des agents, c'est la sortie qui vous concerne le plus depuis un mois. La lecture de cache à 0,20 dollar est le poste dominant d'une boucle agentique, exactement comme nous l'expliquions pour Fable 5.1.
Si vous êtes abonné, les limites sur cinq heures augmentent, et une remise à zéro des quotas est utilisable jusqu'au 22 octobre. C'est un revirement par rapport au resserrement du 14 septembre que nous avions couvert.
Si vous choisissiez entre Opus 5 et Fable 5.1, l'arbitrage a changé : ce modèle est moins cher que le premier et annoncé au niveau du second.
Ce qu'il faut retenir
Cette sortie est moins une avancée de capacité qu'une avancée d'efficacité, et c'est ce qui la rend intéressante à un moment où le secteur débat de son rythme.
Elle confirme aussi ce que nous écrivions lundi soir à propos de la banalisation : un modèle de pointe sort, à moitié prix, et l'information tient désormais dans une ligne de grille tarifaire plutôt que dans un événement.
Ce qui manque reste ce qui manque toujours : une mesure indépendante. Nous publions demain le classement à jour au 23 septembre, en distinguant systématiquement ce qui est mesuré par les fabricants de ce qui est mesuré par des tiers.