Aller au contenu

Grok 4.6 égale le meilleur modèle d'OpenAI, avec un piège tarifaire dans le contexte long

Même score, même prix affiché, 500 000 tokens de contexte. Mais la grille change au-delà d'un seuil, et beaucoup ne le verront qu'à la facture.

Espace publicitaire
L'essentiel en 30 secondes ⚡
xAI a lancé Grok 4.6 le 12 août. Le modèle atteindrait un score de 61 sur l'indice d'intelligence d'Artificial Analysis, à égalité avec GPT-5.6 Sol Max, tout en conservant le tarif de la version précédente, autour de 2 dollars en entrée et 6 en sortie par million de tokens, avec une fenêtre de 500 000 tokens. Le point qui mérite attention n'est pas la performance : c'est la manière dont le prix évolue avec la longueur du contexte.

Une sortie de modèle de plus, avec un détail tarifaire qui concerne bien au-delà de ce cas précis.

Ce qui est annoncé

Atteindre le niveau du meilleur modèle d'un concurrent tout en maintenant un tarif inchangé est une bonne performance commerciale. L'indice cité agrège plusieurs évaluations et fournit un repère indépendant du fabricant, ce qui est préférable aux chiffres maison, comme nous le rappelions dans notre article sur les benchmarks.

La fenêtre de 500 000 tokens place le modèle dans la catégorie des contextes longs, ce qui intéresse ceux qui traitent de gros documents ou font tourner des agents sur des sessions étendues.

Le piège du contexte long

Voici le mécanisme qu'il faut comprendre, parce qu'il ne concerne pas que ce modèle.

Plusieurs fournisseurs pratiquent une tarification par palier : le prix au token change au-delà d'un certain volume de contexte. Un modèle affiché à 2 dollars en entrée peut passer à 4 dollars au-delà d'un seuil, avec une hausse comparable en sortie.

La raison technique est réelle : traiter un contexte très long coûte davantage que proportionnellement, parce que le mécanisme d'attention compare les éléments entre eux. Doubler la longueur ne double pas le coût, il l'augmente davantage.

Le problème est que ce seuil se franchit souvent sans qu'on le remarque. Un agent qui accumule un historique dépasse progressivement la limite. Un traitement documentaire qui reçoit des fichiers de taille variable bascule pour certains d'entre eux. Vous découvrez à la facture qu'une partie de vos requêtes était facturée au tarif supérieur.

Les trois réflexes qui protègent 💡
Connaissez votre seuil. Il figure dans la documentation tarifaire, rarement dans les annonces. Notez-le.
Mesurez votre distribution. Combien de vos requêtes dépassent réellement ce seuil ? Souvent une minorité, mais qui pèse lourd.
Taillez le contexte. Beaucoup d'applications envoient tout l'historique par confort. Résumer les échanges anciens plutôt que de les retransmettre réduit le coût et améliore souvent la qualité, le modèle se perdant moins.

Ce que ça dit du marché

Cette sortie confirme deux tendances que nous suivons.

Les écarts de performance se réduisent. Quand un modèle égale le meilleur d'un concurrent sur un indice indépendant, la question du choix cesse d'être une question de capacité pour devenir une question de prix, de fiabilité et d'écosystème.

La complexité tarifaire augmente. Paliers de contexte, tarifs de cache différenciés, modes d'effort variables, traitement par lots : comparer deux fournisseurs sur leur prix affiché n'a plus grand sens. C'est précisément pourquoi nous répétons qu'il faut mesurer le coût par tâche accomplie sur ses propres cas.

Ce qu'il faut retenir

Le vrai enseignement dépasse ce modèle. Nous entrons dans une phase où les grilles tarifaires deviennent aussi complexes que celles des opérateurs télécoms, avec des seuils, des options et des paliers.

Cette complexité n'est pas nécessairement malveillante : elle reflète des coûts réels qui varient selon l'usage. Mais elle a le même effet que dans les télécoms : celui qui ne lit pas les conditions paie plus que celui qui les lit. La seule parade est de mesurer sa propre consommation plutôt que de comparer des prix affichés.

Espace publicitaire