Imaginez un hôpital avec 900 spécialistes. Quand vous arrivez aux urgences avec une cheville douloureuse, on ne convoque pas les 900 médecins autour de votre lit. Un agent d'accueil évalue votre cas et vous envoie vers le radiologue et l'orthopédiste. Vous bénéficiez de l'expertise d'un immense établissement, mais seuls deux praticiens travaillent sur votre dossier. Voilà, en une image, ce qu'est un Mixture of Experts.
Si vous suivez l'actualité des modèles d'IA, un chiffre étrange revient sans cesse. Kimi K3 : 2 800 milliards de paramètres, dont 48 actifs. LongCat-2.0 : 1 600 milliards au total, 48 milliards actifs. AFM 3 Core Advanced d'Apple : 20 milliards, dont 1 à 4 activés. Pourquoi ce double chiffre systématique ? Parce que presque tous les modèles récents reposent sur une architecture dite Mixture of Experts, en français mélange d'experts. Voici comment ça marche.
Le problème que ça résout
Reprenons depuis la base. Comme nous l'expliquions dans notre article sur les paramètres, ces derniers sont les réglages internes d'un modèle. Plus il en a, plus il peut en principe emmagasiner de connaissances et de nuances.
Le souci, c'est que dans un modèle classique, dit dense, tous les paramètres participent au calcul pour chaque mot généré. Un modèle de mille milliards de paramètres devrait donc faire travailler ses mille milliards de réglages à chaque token produit. C'est astronomiquement coûteux en calcul, en électricité et en temps. Cette contrainte a longtemps plafonné la taille des modèles : grossir signifiait devenir insupportablement lent et cher.
La solution : découper le modèle en spécialistes
L'idée du mélange d'experts est de découper une partie du réseau en de nombreux sous-réseaux, appelés experts, et de n'en activer que quelques-uns pour chaque token traité.
Le mécanisme repose sur deux pièces. Les experts d'abord, qui sont des blocs de paramètres spécialisés. Ils ne correspondent pas à des domaines humains bien nets, ce serait trop beau : ce ne sont pas des experts en droit ou en cuisine, mais des blocs qui se sont différenciés pendant l'entraînement en se spécialisant sur des motifs statistiques dont la logique n'est pas toujours interprétable.
Puis le routeur (gating network), une petite couche dont le seul rôle est de décider, pour chaque token, quels experts convoquer. C'est l'agent d'accueil de notre hôpital. Il regarde l'information qui arrive, choisit les deux, quatre ou huit experts les plus pertinents, et leur transmet le travail. Les autres restent inactifs et ne consomment aucun calcul.
Pour Kimi K3, les chiffres sont éloquents : le modèle n'active que 16 de ses 896 experts internes par token, soit environ 1,8% de sa capacité totale à chaque instant.
Un modèle MoE offre les connaissances d'un modèle géant pour le coût de calcul d'un modèle moyen. C'est ce compromis qui a débloqué la course aux modèles de plusieurs milliers de milliards de paramètres. Sans cette architecture, un modèle de 2 800 milliards de paramètres serait probablement inexploitable commercialement. Le MoE est la raison technique pour laquelle les modèles ont pu grossir aussi vite depuis deux ans sans que les prix explosent proportionnellement.
Les contreparties, car il y en a
Cette élégance a un prix, et il est utile de le connaître.
La mémoire reste un problème. Voici le piège que beaucoup ratent : même si seuls 2% des paramètres travaillent, tous doivent généralement être disponibles, puisqu'on ne sait pas à l'avance lesquels le routeur va appeler. Le calcul est économisé, pas la place occupée. C'est exactement pourquoi un modèle ouvert de 2 800 milliards de paramètres reste hors de portée d'un ordinateur personnel, comme nous le soulignions dans notre guide de l'IA locale. L'innovation d'Apple consistant à stocker le modèle dans la mémoire flash vise précisément à contourner cette limite.
Le routeur peut se tromper. Si l'agent d'accueil envoie votre cheville chez le cardiologue, la réponse sera médiocre. Un mauvais routage produit des résultats incohérents, et l'équilibrage de la charge entre experts est un problème d'entraînement délicat : certains experts risquent d'être sur-sollicités et d'autres de ne jamais rien apprendre.
L'entraînement est plus complexe. Il faut apprendre simultanément aux experts à se spécialiser et au routeur à bien orienter, ce qui est plus instable qu'entraîner un modèle dense classique.
Le réflexe à adopter en lisant une fiche technique
La conclusion pratique est simple. Quand vous lisez qu'un modèle compte des milliers de milliards de paramètres, cherchez immédiatement le second chiffre : combien sont actifs. C'est celui-là qui vous renseigne sur le coût de calcul et la vitesse, tandis que le total vous renseigne sur l'ampleur des connaissances stockées et sur les besoins en mémoire.
Les communiqués marketing mettent naturellement en avant le chiffre le plus flatteur, celui du total. Savoir que ces deux nombres racontent deux histoires différentes suffit à lire une annonce de modèle avec un oeil nettement plus juste. Et la prochaine fois qu'on vous vantera un modèle de trois mille milliards de paramètres, vous saurez que la vraie question n'est pas la taille de l'hôpital, mais combien de médecins se penchent réellement sur votre cas.