Un fichier audio sans perte reproduit chaque nuance d'un enregistrement et pèse très lourd. Un MP3 supprime des informations que l'oreille humaine ne perçoit pratiquement pas, et divise la taille par dix. La quantization fait la même chose avec un modèle d'IA : elle réduit la précision de chaque paramètre pour gagner énormément de place, en pariant que la perte sera imperceptible sur le résultat.
C'est la technique qui explique comment un modèle conçu pour tourner sur des serveurs peut fonctionner sur un ordinateur personnel, et pourquoi les poids de Kimi K3 pèsent 1,4 téraoctet plutôt que bien davantage. Expliquons-la.
Le principe
Un modèle est constitué de milliards de paramètres, qui sont des nombres. Chacun doit être stocké, et la question est : avec quelle précision ?
À l'entraînement, on utilise généralement une précision élevée, où chaque paramètre occupe 16 ou 32 bits. Cela permet des ajustements très fins, indispensables pendant l'apprentissage.
Mais une fois le modèle entraîné, cette précision devient largement superflue pour l'utiliser. La quantization consiste à réécrire chaque paramètre avec moins de bits : 8, 4, parfois moins. Passer de 16 à 4 bits divise mécaniquement la taille par quatre.
Une image : au lieu de noter une mesure comme 3,14159265, vous notez 3,14. Vous perdez de la précision, vous gagnez beaucoup de place, et pour la plupart des usages ça ne change rien.
Pourquoi ça fonctionne aussi bien
La question légitime est : comment un modèle peut-il rester performant en perdant de la précision sur chacun de ses paramètres ?
La réponse tient à la redondance. Un modèle ne dépend pas de la valeur exacte d'un paramètre isolé : ses connaissances sont réparties sur d'innombrables valeurs, comme nous l'expliquions à propos de l'interprétabilité. Une petite erreur sur un paramètre est absorbée par les milliards d'autres. Le système est robuste au bruit, parce qu'il a été entraîné dans le bruit.
8 bits : la perte est généralement négligeable, y compris sur des tâches exigeantes. C'est devenu un standard de déploiement.
4 bits : la dégradation reste faible sur les usages courants, et c'est le format qui rend l'IA locale réellement accessible. C'est le meilleur compromis pour la plupart des gens.
En dessous : les effets deviennent perceptibles, surtout sur le raisonnement complexe et les tâches longues. Le modèle reste utilisable pour des usages simples, mais commence à perdre en cohérence.
Un point important : la dégradation n'est pas uniforme. Un modèle quantifié agressivement conserve souvent ses capacités de conversation courante tout en perdant sur les tâches où il faut tenir une chaîne de raisonnement.
Ce que ça permet concrètement
Trois usages en découlent directement.
L'IA locale. C'est le plus visible pour les particuliers. Sans quantization, faire tourner un modèle correct sur un ordinateur personnel serait hors de portée. Avec, comme nous le détaillions dans notre guide, un modèle de 7 à 9 milliards de paramètres tient dans quelques gigaoctets de mémoire vidéo.
Le coût de service. Pour un fournisseur, un modèle plus petit consomme moins de mémoire et de calcul par requête. À l'échelle de milliards de requêtes, c'est un levier économique majeur, qui participe aux baisses de prix que nous observons.
L'embarqué. Téléphones, voitures, objets connectés : la quantization est la condition pour qu'un modèle fonctionne sur un appareil aux ressources limitées. C'est l'un des ingrédients de l'approche d'Apple sur l'IA embarquée.
Ce qu'il faut retenir
La quantization est l'une de ces optimisations discrètes qui font davantage pour la diffusion réelle d'une technologie que bien des annonces spectaculaires. Elle ne rend aucun modèle plus intelligent : elle rend les modèles existants accessibles à des machines et à des budgets qui en étaient exclus.
Le réflexe utile, si vous téléchargez un modèle ouvert, est de regarder le format proposé. Un même modèle existe généralement en plusieurs versions quantifiées, et choisir la bonne revient à arbitrer entre ce que votre matériel peut charger et la qualité que votre usage exige. Pour la plupart des gens, la version en 4 bits est le point d'équilibre, et il n'y a aucune honte à l'utiliser : c'est ce que font aussi, dans une large mesure, les services que vous payez.