Quel modèle d'IA, pour quoi faire ?
Le classement vivant d'Alyriaz : ce que vaut chaque grand modèle, ce qu'il coûte, et lequel choisir selon ce que vous voulez en faire. Une édition par mois, et les nouveaux modèles y entrent chaque semaine.
Que voulez-vous faire ?
Il n'y a pas de meilleur modèle en général : il y a le bon modèle pour une tâche. Choisissez la vôtre.
Chargement du radar…
La carte des prix
Chaque point est un modèle, placé selon son prix pour un million de tokens lus (l'échelle est logarithmique : chaque graduation coûte dix fois plus que la précédente). Survolez ou touchez un point.
Combien ça vous coûterait ?
Mode avancé : régler chaque paramètre soi-même
Tous les modèles
Prix en dollars pour un million de tokens, lus (entrée) et écrits (sortie). Cliquez sur un titre de colonne pour trier.
| Modèle | Prix entrée / sortie ($ par million de tokens) | Pour quoi |
|---|---|---|
| Claude Opus 5.5 (Anthropic) | 4 $ / 20 $ | Le niveau de Fable 5.1, 60 % moins cher. Codage agentique : 66,4 % sur Terminal-Bench 4.0 selon Anthropic, devant Astra. Lecture de cache à 0,20 $. |
| GPT-6 Astra (OpenAI) | 10 $ / 50 $ | Le sommet d'OpenAI. Mathématiques de recherche (97,6 % revendiqués sur FrontierMath niveau 4) et science en terminal. Premier modèle classé « critique » en cybersécurité. |
| Claude Fable 5.1 (Anthropic) | 10 $ / 50 $ | Le sommet d'Anthropic. En tête de l'indice indépendant généraliste lors de notre dernier relevé, mais le plus cher par tâche. |
| Claude Mythos 5.1 (Anthropic) | 10 $ / 50 $ | Accès restreint : cybersécurité et sciences du vivant. Accès restreint, en raison de ses capacités en cybersécurité et en sciences du vivant. Même tarif que Fable 5.1. |
| Gemini 4 Argon (Google) | Accès restreint : réservé aux défenseurs en cybersécurité. Le modèle le plus puissant de Google, qui revendique dépasser Anthropic et OpenAI sur plusieurs tests. Réponses jusqu'à un million de tokens ; distribué d'abord via le programme Fairwind. | |
| Claude Sonnet 5.5 (Anthropic) | 2 $ / 10 $ | Presque Opus 5.5, pour moitié prix. Sur 44 métiers testés par Anthropic, il égale presque Opus 5.5. Le modèle de tous les jours. |
| GPT-6.1 Sol (OpenAI) | 2 $ / 10 $ | Presque Astra pour le code, au cinquième du prix. Égale presque Astra pour écrire du code et utiliser un ordinateur, selon OpenAI. Classé « critique » en cybersécurité, comme Astra. |
| Gemini 3.6 Flash (Google) | 1,5 $ / 7,5 $ | Le modèle de tous les jours de Google. Meilleur et moins cher que 3.5 Flash qu'il remplace : 17 % de tokens de sortie en moins sur l'indice Artificial Analysis, et la sortie passe de 9 à 7,50 $. |
| Claude Haiku 5.5 (Anthropic) | 0,10 $ / 0,50 $ | Le petit modèle d'Anthropic, au prix de GPT-6 Luna. Dix fois moins cher que Haiku 4.5 sous 100 000 tokens par demande (0,50 / 2,50 $ au-delà). Niveau d'effort réglable ; devant Luna sur les tests choisis par Anthropic. |
| GPT-6 Luna (OpenAI) | 0,10 $ / 0,50 $ | Le volume et les tâches simples. À 0,10 $ le million de tokens, il change l'économie du tri, de l'extraction et du filtrage de masses de données. |
| Kimi K3 (Moonshot AI) | 3 $ / 15 $ | Le plus gros modèle ouvert jamais publié. 2 800 milliards de paramètres et un million de tokens de contexte. À sa sortie, juste derrière les meilleurs modèles fermés sur plusieurs classements indépendants ; il réfléchit toujours au maximum, donc moins cher au token, pas forcément à la tâche. |
| Qwen 3.8-Max (Alibaba (Qwen)) | 2 400 milliards de paramètres, poids ouverts. Selon Alibaba, il progresse en programmation, en travail de bureau et en recherche documentaire. En pratique, réservé aux organisations capables de l'héberger. | |
| DeepSeek V4 Flash (DeepSeek) | Un modèle chinois ouvert à quelques centimes. Son tarif est passé d'environ 0,14 à 0,27 $ le million de tokens le 14 août. Encore très bas, mais un prix de conquête peut doubler en une annonce : vous pouvez aussi l'héberger vous-même. | |
| Mistral Large 4 (Mistral AI) | Le géant européen, poids promis fin octobre. Environ 1 000 milliards de paramètres dont 49 actifs, entraîné et hébergé en Europe. 38 points sur l'indice d'Artificial Analysis, contre 9 pour Large 3 et 58 pour Claude Opus 5.5. | |
| Step 5 Preview (StepFun) | 1 $ / 2,7 $ | 600 milliards de paramètres à 1 $ le million. Mélange d'experts (27 milliards de paramètres actifs), un million de tokens de contexte, accès ouvert le jour même. |
| LongCat-2.0 (Meituan) | 0,75 $ / 2,95 $ | Le modèle mystère « Owl Alpha », signé Meituan. Spécialiste du code agentique, 1 600 milliards de paramètres dont environ 48 actifs. Relire le cache ne coûte rien, un atout pour les agents qui tournent en boucle ; poids promis sous licence MIT. |
| Gemini 3.5 Flash-Lite (Google) | 0,30 $ / 2,5 $ | L'ultra économique de Google. 350 tokens par seconde en sortie et une réflexion réglable, pour la traduction, l'analyse de documents et les gros volumes. |
| GLM-5.3-Flash (Z.ai) | Ouvert, licence MIT, servi à grande échelle. 320 milliards de paramètres dont 18 actifs, un million de tokens de contexte. Tourne sur plus de 100 000 accélérateurs chinois. | |
| Qwen 3.8 27B (Alibaba (Qwen)) | Le modèle ouvert qui tient sur une seule carte graphique. 27 milliards de paramètres sous licence Apache 2.0, vision intégrée, 262 000 tokens de contexte. De quoi analyser des documents confidentiels sans qu'ils quittent vos machines. | |
| K2 Horizon (Institute of Foundation Models) | Une gamme complète de six modèles ouverts. De 0,9 à 375 milliards de paramètres, tous sous licence Apache 2.0 : de quoi choisir la taille qui tient sur votre matériel. | |
| Qwen3.8-Omni-Flash (Alibaba (Qwen)) | Un seul modèle pour le texte, l'image, le son et la vidéo. Traite nativement quatre modalités, là où il fallait jusqu'ici assembler plusieurs modèles. | |
| GPT-6 Sol (OpenAI), remplacé | 2 $ / 10 $ | Remplacé une semaine plus tard par GPT-6.1 Sol. Meilleur rapport score-coût sur l'automatisation : 33,2 % pour 27 centimes par tâche. |
| Claude Opus 5 (Anthropic), remplacé | 5 $ / 25 $ | Remplacé par Opus 5.5. Opus 5.5 revendique 40 % de coût réel en moins par rapport à lui. |
| Grok 4.6 (xAI), remplacé | 2 $ / 6 $ | Remplacé par Grok 4.7 en septembre. À sa sortie, au niveau de GPT-5.6 Sol sur l'indice d'Artificial Analysis, avec 500 000 tokens de contexte. Attention aux paliers : le prix par token change au-delà d'un seuil de contexte. |
Les dernières sorties
Avant de croire un classement
Les scores sont devenus difficiles à comparer. Cinq raisons de garder la tête froide, y compris devant celui-ci.
Le niveau d'effort
Le même modèle peut gagner ou perdre des dizaines de points selon le temps de réflexion qu'on lui accorde, et coûter cinq à dix fois plus. Comprendre
Le harnais
Les classements comparent un modèle et le logiciel qui l'entoure, jamais le modèle seul. Comprendre
L'usure des tests
Un test ancien finit par mesurer surtout que le modèle l'a déjà vu pendant son entraînement. Comprendre
La source
Un tableau publié par un fabricant choisit ses tests. Nous séparons toujours ce qu'il affirme de ce que mesurent des tiers.
Plus récent ne veut pas dire meilleur
Un nouveau modèle peut faire moins bien que celui qu'il remplace sur votre tâche précise. Comprendre