Aller au contenu

Claude Sonnet 5.5 : presque Opus, pour moitié prix

Anthropic sort le modèle intermédiaire de sa nouvelle famille. Sur le travail de bureau, il fait jeu égal avec le haut de gamme sorti six jours plus tôt, au prix de l'ancien.

Espace publicitaire

Finale du 100 mètres. Au couloir 5, le champion, celui qu'on paie cher pour venir courir. Au couloir 4, le coureur que tout le monde connaît, celui des meetings du quotidien.

Pendant des années, l'écart se voyait à l'œil nu. Et puis un soir, les deux franchissent la ligne ensemble, et il faut attendre la photo-finish pour les départager.

C'est à peu près ce qu'Anthropic vient d'annoncer avec Claude Sonnet 5.5, sorti le lundi 28 septembre.

Six jours après le grand frère

Chez Anthropic, les modèles vont par familles de trois tailles. Opus est le haut de gamme, le plus capable et le plus cher. Sonnet est l'intermédiaire, celui que la plupart des gens utilisent au quotidien. Haiku est le plus léger.

La famille 5.5 a commencé le 22 septembre avec Claude Opus 5.5, que nous avions analysé le soir même. Sonnet 5.5 arrive six jours plus tard. Haiku 5.5 est promis « dans les prochaines semaines ».

Le prix, lui, ne bouge pas : 2 dollars pour un million de tokens lus, 10 dollars pour un million de tokens écrits, exactement comme Sonnet 5. Un token, c'est un morceau de mot, l'unité avec laquelle les modèles sont facturés. Opus 5.5 coûte le double : 4 et 20 dollars.

Anthropic annonce aussi un modèle plus de 30 % plus rapide que Sonnet 5, et jusqu'à 30 % moins cher par tâche. Ce dernier chiffre ne vient pas d'une baisse de tarif, mais d'un modèle qui fait le même travail en moins d'étapes.

Le test des 44 métiers

Le chiffre le plus parlant de l'annonce vient d'un test appelé GDPval-AA. Il ne pose pas d'énigmes de mathématiques : il donne aux modèles de vraies tâches de travail, tirées de 44 métiers et de neuf grands secteurs. Rédiger une note, préparer un tableau, monter une présentation.

Le résultat est un score en points. Sonnet 5 obtenait 1 449. Sonnet 5.5 obtient 1 844. Opus 5.5, le haut de gamme, obtient 1 846.

Deux points d'écart. L'épaisseur d'une photo-finish.

Même tendance sur un test où le modèle doit se servir d'un ordinateur comme vous le feriez, en cliquant dans des logiciels : 80,1 % de réussite pour Sonnet 5.5, 81,8 % pour Opus 5.5, contre 57 % pour Sonnet 5.

Ces scores sont ceux publiés par Anthropic. Ils ne remplacent pas une mesure indépendante, et nous y revenons plus bas.

Ce que ça change pour vous

Si vous utilisez Claude dans l'application, vous ne verrez pas de facture changer. Vous verrez surtout des réponses qui arrivent plus vite, et moins d'allers-retours sur les tâches longues. Dans les applications, le modèle fonctionne par défaut en effort « moyen » : il ne réfléchit pas des heures quand ce n'est pas nécessaire.

Les entreprises qui l'ont essayé avant sa sortie donnent des chiffres concrets. Chez Box, qui stocke les documents de millions d'entreprises, le modèle a été 2,4 fois plus rapide et a consommé 12 % de tokens en moins. Chez Zendesk, spécialiste du service client, les demandes ont été traitées 20 % plus vite.

Le plus frappant vient de Base44, une plateforme qui fabrique des applications à partir d'une simple description. Sur 118 applications réelles, il a fallu en moyenne 3,6 essais à Sonnet 5.5 pour arriver au résultat. Il en fallait 7,7 à Opus 5, le haut de gamme de juillet.

Si vous payez l'IA à l'usage, dans une entreprise ou via un outil, c'est ce genre de chiffre qui compte. Le prix affiché ne dit pas ce que vous paierez : ce qui compte, c'est le nombre d'étapes pour arriver au bout. C'est la même logique que celle qui explique pourquoi ChatGPT peut être gratuit alors qu'il coûte une fortune.

Le détail qui passera inaperçu : un antivol 🔒
Sonnet 5.5 est le premier Sonnet livré avec des filtres qui empêchent d'extraire son raisonnement. La technique visée s'appelle la distillation : on pose des millions de questions à un modèle, on récolte ses réponses détaillées, et on s'en sert pour entraîner un concurrent à moindre coût. C'est un peu comme filmer tous les entraînements d'un champion pour copier sa technique. Anthropic en a accusé Alibaba et DeepSeek cette année. Et le jour même de la sortie, deux Américains s'opposaient publiquement : pour Scott Bessent, secrétaire au Trésor, c'est « du vol » ; pour Jensen Huang, patron de Nvidia, « ça s'appelle la concurrence ».

Là où le champion garde l'avantage

Anthropic écrit elle-même la limite, et c'est à mettre à son crédit : Opus 5.5 reste « nettement plus fort » sur le travail complexe et ouvert, celui qui demande du jugement sur la durée. Sonnet 5.5 est présenté comme le meilleur choix pour les tâches « bien délimitées » : corriger un bug, produire un document soigné, remplir un tableur.

Autrement dit, sur un sprint bien balisé, Sonnet suffit. Sur un marathon plein d'imprévus, où il faut décider seul pendant des heures, Opus garde de l'avance.

Il faut aussi regarder un chiffre avec prudence. Sur un test de programmation en ligne de commande, Sonnet 5 était noté 10,3 % et Sonnet 5.5 atteint 70,6 %, plus qu'Opus 5.5. Un tel bond, d'une version à l'autre, dit sans doute autant de choses sur le test que sur le modèle. Nous avons déjà vu des classements qui se retournent quand un tiers refait les mesures.

Les prochains jours diront si les évaluateurs indépendants confirment les deux points d'écart avec Opus.

Le peloton qui accélère

Il y a deux ans, choisir un modèle d'IA ressemblait à un choix de voiture : plus vous payiez, mieux c'était. Cette sortie raconte autre chose.

Pour l'immense majorité de ce que vous demandez à une IA, écrire, résumer, organiser, le modèle intermédiaire a rattrapé le haut de gamme. L'écart ne se joue plus sur ce que le modèle sait faire, mais sur le type de problème que vous lui confiez.

Le jour où le coureur du quotidien finit dans la même photo que le champion, ce n'est pas le champion qui a ralenti. C'est tout le peloton qui a accéléré.

Espace publicitaire