Construire un pont coûte des centaines de millions, une seule fois. L'entretenir et le faire fonctionner coûte beaucoup moins, mais tous les jours, pendant cinquante ans. Au bout du compte, personne ne sait dire lequel des deux postes a le plus pesé. L'IA vit exactement cette situation, et la confusion entre ces deux coûts explique beaucoup de malentendus sur son économie.
C'est une distinction élémentaire, et pourtant elle manque dans la plupart des discussions. Elle éclaire les baisses de prix, les investissements en centres de données, et même les projets de calcul en orbite. Posons-la clairement.
Les deux phases
L'entraînement est la fabrication du modèle. On lui fait absorber des quantités colossales de données, on ajuste ses milliards de paramètres, et cela dure des semaines ou des mois sur des dizaines de milliers de puces. C'est le processus que nous avons décrit dans notre article dédié. Le coût est gigantesque et concentré : une facture unique, avant que quiconque n'utilise le produit.
L'inférence, c'est l'utilisation. Chaque fois que vous posez une question, le modèle effectue des calculs pour produire sa réponse. Le coût unitaire est minuscule, souvent une fraction de centime. Mais il se répète à chaque requête, de chaque utilisateur, chaque jour.
Une image simple : l'entraînement, c'est écrire l'encyclopédie. L'inférence, c'est la consulter. Écrire coûte une fortune une fois. Consulter coûte trois fois rien, mais un milliard de fois par jour.
Pourquoi l'inférence a pris le dessus
Aux débuts, l'entraînement dominait les discussions parce que peu de gens utilisaient ces modèles. Avec des centaines de millions d'utilisateurs quotidiens, le rapport s'est inversé : pour les acteurs les plus établis, le coût cumulé de l'inférence dépasse désormais largement celui de l'entraînement.
Cette bascule explique une bonne partie de l'actualité que nous couvrons.
Elle explique pourquoi optimiser l'exécution permet de baisser les prix de 80 % : quand vous servez des milliards de requêtes, gagner quelques pourcents par requête représente des sommes énormes.
Elle explique l'intérêt pour les architectures à mélange d'experts, qui n'activent qu'une fraction du modèle à chaque requête : c'est une optimisation d'inférence avant tout.
Elle explique enfin pourquoi les géants conçoivent leurs propres puces, souvent dédiées spécifiquement à l'inférence : à ce volume, une puce sur mesure devient rentable.
Si vous construisez un produit sur une API, votre coût est entièrement de l'inférence. Ce qui compte n'est donc pas la puissance du modèle mais votre consommation par tâche accomplie. C'est pourquoi nous insistons tant sur des leviers comme la mise en cache, le routage vers des modèles plus légers, et la maîtrise des tokens de raisonnement. Aucun de ces leviers ne touche à l'entraînement : ils portent tous sur la seconde facture, celle qui revient chaque jour.
Un détail technique qui a des conséquences
Les deux phases n'ont pas les mêmes exigences, et cela structure toute l'industrie.
L'entraînement demande une puissance de calcul brute énorme, mais tolère la latence : que le résultat arrive dans six semaines ou six semaines et deux jours ne change rien. Il peut donc s'exécuter n'importe où, y compris dans des lieux isolés, tant que l'électricité est disponible.
L'inférence, à l'inverse, exige de la rapidité de réponse. Personne n'accepte d'attendre trois secondes de plus parce que la requête a fait un détour. Elle doit donc s'exécuter près des utilisateurs.
Cette différence explique un point que nous soulignions dans notre article sur les data centers spatiaux : l'entraînement en orbite est concevable, l'inférence conversationnelle beaucoup moins, à cause du temps de trajet du signal. Ce n'est pas un détail d'ingénieur, c'est ce qui décide de ce qui peut être délocalisé et de ce qui doit rester près de vous.
Ce qu'il faut retenir
Retenez la formule : l'entraînement est un investissement, l'inférence est une charge d'exploitation. Le premier fait les gros titres, le second fait les factures.
Cette distinction vous donne une grille de lecture immédiate. Quand vous lisez qu'un modèle a coûté des centaines de millions à entraîner, c'est impressionnant mais ce n'est pas ce qui décide de sa viabilité. Ce qui décide, c'est combien coûte chaque réponse, multiplié par le nombre de réponses. C'est pour cette raison que la course actuelle porte moins sur les modèles les plus puissants que sur les modèles les plus efficaces à servir. Et c'est plutôt une bonne nouvelle : cette course-là profite directement à ceux qui les utilisent.