Nvidia a annoncé l'entrée en production complète de son accélérateur dédié à l'inférence, issu de son acquisition de Groq pour environ 20 milliards de dollars. La puce s'intègre à la plateforme Vera Rubin, avec jusqu'à 256 accélérateurs par baie. Ce n'est pas une puce conçue pour entraîner des modèles : c'est une puce conçue pour les faire répondre vite.
Nous avons expliqué dans notre article sur les deux coûts de l'IA que l'inférence, la phase d'utilisation, dépasse désormais l'entraînement dans les budgets. Voici la traduction matérielle de ce basculement.
Pourquoi une puce différente
Entraîner et servir un modèle ne demandent pas les mêmes qualités, et cette différence structure toute l'industrie.
L'entraînement exige une puissance de calcul brute énorme et tolère parfaitement la lenteur. Que le résultat arrive dans six semaines ou six semaines et deux jours ne change rien. On peut donc empiler des calculs en parallèle sans se soucier du délai de chacun.
L'inférence exige l'inverse : produire chaque token rapidement, l'un après l'autre, parce qu'un modèle génère mot après mot et que chacun dépend du précédent. Ce processus est séquentiel, donc peu parallélisable, et il se heurte surtout à la vitesse à laquelle on peut faire circuler les données entre la mémoire et le processeur.
Une puce optimisée pour l'entraînement passe une partie de son temps à attendre la mémoire quand elle sert un modèle. Une puce conçue pour l'inférence organise ce flux différemment.
Pourquoi maintenant
Trois évolutions rendent cette spécialisation rentable, et nous les avons toutes documentées.
Le volume a explosé. Avec des offres gratuites illimitées et des centaines de millions d'utilisateurs quotidiens, le nombre de tokens servis dépasse de très loin le nombre de tokens d'entraînement.
Les agents consomment énormément. Un agent qui enchaîne des étapes en boucle produit et relit des tokens en permanence, comme nous l'avons décrit à propos de leur passage en production. Des données de plateformes montrent que ces charges sont nettement plus gourmandes que la conversation classique.
La latence est devenue un critère produit. Nous l'avons vu hier avec un modèle vocal annoncé sous les 300 millisecondes. Ce seuil ne s'atteint pas seulement par du logiciel : il faut du matériel capable de produire les tokens assez vite.
Un glissement de langage mérite d'être noté. On ne parle plus de performance brute mais de tokens par seconde, tokens par watt et coût par token. Ce sont des indicateurs d'usine plutôt que de laboratoire : rendement, consommation, prix de revient unitaire. C'est le vocabulaire d'une industrie qui produit en continu, et il confirme ce que nous écrivions il y a deux semaines sur l'IA devenue une industrie comme les autres.
Ce que ça change pour vous
Indirectement mais réellement, deux choses.
Les prix continuent de baisser. Un matériel plus efficace à l'inférence réduit le coût par requête, et cette baisse finit par se répercuter, comme nous l'avons vu avec la vague de baisses de cette semaine.
Les usages temps réel deviennent viables. Beaucoup d'applications intéressantes étaient impossibles non par manque d'intelligence du modèle mais parce que la réponse arrivait trop tard : traduction simultanée, assistance en conduite, interaction avec un robot.
La réserve
Une puce spécialisée est excellente sur sa tâche et rigide par nature. Si les architectures de modèles évoluent significativement, un matériel optimisé pour la génération séquentielle actuelle pourrait vieillir plus vite qu'un matériel généraliste.
C'est un pari raisonnable à court terme, la génération token par token étant le mécanisme commun à tous les modèles de langage actuels. C'est un pari tout de même.
Ce qu'il faut retenir
Cette annonce est le genre d'actualité qu'on saute et qui compte plus que la sortie d'un modèle de plus.
Elle signale que l'industrie a cessé de considérer l'inférence comme une conséquence de l'entraînement pour la traiter comme un métier distinct, avec son matériel dédié. C'est ce qui arrive à toute technologie qui se déploie massivement : à un moment, on cesse d'adapter des outils généraux et on construit l'outil exact.
Pour un observateur, c'est probablement le meilleur indicateur de maturité disponible. On ne conçoit pas une puce à vingt milliards pour un usage dont on doute qu'il dure.