Aller au contenu

Pourquoi personne ne sait vraiment ce qui se passe dans une IA

Ce ne sont pas des secrets industriels. Même les équipes qui construisent ces modèles ne peuvent pas expliquer pourquoi une réponse précise a été produite. Voici pourquoi.

Espace publicitaire
Une confusion à lever d'emblée 🔍
Quand on dit qu'une IA est une boîte noire, beaucoup comprennent que les entreprises refusent de révéler leurs secrets. C'est un contresens. Le code est connu, l'architecture est publiée, et pour les modèles ouverts, les paramètres sont téléchargeables par n'importe qui. L'opacité n'est pas commerciale, elle est structurelle : même avec tout sous les yeux, on ne peut pas expliquer pourquoi une réponse précise a été produite.

C'est l'une des caractéristiques les plus déroutantes de cette technologie, et elle est au coeur de plusieurs débats que nous avons couverts, de l'alignement à la responsabilité juridique. Prenons le temps de comprendre d'où vient cette opacité.

Le problème vient de la manière dont ça marche

Un logiciel classique est écrit par des humains sous forme de règles explicites. Si quelque chose ne fonctionne pas, on relit le code, on trouve la ligne fautive, on la corrige.

Un modèle de langage n'est pas écrit ainsi. Il est entraîné. Des humains définissent une architecture et un processus d'apprentissage, puis le système ajuste lui-même des milliards de valeurs numériques jusqu'à bien prédire ses données. Personne n'a écrit ces valeurs, personne ne les a choisies individuellement.

Le résultat, ce sont des milliards de nombres qui, ensemble, produisent un comportement intelligent. Pris isolément, chacun ne signifie rien. Il n'existe pas de paramètre qui contiendrait la notion de chat, ni de ligne à corriger quand le modèle se trompe sur la géographie.

Trois raisons qui rendent l'analyse difficile

L'échelle. Examiner des milliards de valeurs et leurs interactions dépasse ce qu'un humain peut inspecter. Ce n'est pas un problème de motivation, c'est un problème de volume.

La distribution. Une notion n'est pas rangée à un endroit précis. Elle est répartie sur d'innombrables paramètres, et le même paramètre participe à des milliers de notions différentes. On appelle cela la superposition. C'est efficace, et c'est un cauchemar pour qui veut démêler.

L'absence de vocabulaire interne. Le modèle ne pense pas en mots. Ses représentations internes sont des positions dans un espace mathématique, comme nous l'expliquions à propos des embeddings. Traduire ces positions en concepts humains est justement tout le travail, et il n'est pas résolu.

Attention au piège : l'explication que le modèle donne 🎭
Si vous demandez à une IA pourquoi elle a répondu quelque chose, elle vous fournira une explication cohérente et plausible. Le problème est que cette explication est elle-même une production du modèle, pas un rapport d'introspection. Elle décrit ce qui constituerait une justification crédible, pas nécessairement ce qui s'est réellement passé dans le calcul. C'est une distinction essentielle, et elle vaut d'ailleurs partiellement pour les humains, qui reconstruisent souvent leurs raisons après coup.

Ce que les chercheurs parviennent quand même à faire

Le tableau n'est pas entièrement noir, et le domaine de l'interprétabilité progresse réellement.

Des équipes parviennent à identifier des caractéristiques à l'intérieur des modèles : des motifs internes qui s'activent de manière fiable pour des concepts précis. On sait aussi tracer certains circuits, c'est-à-dire des chaînes de traitement qui accomplissent une opération identifiable. Et il est possible d'intervenir : amplifier ou supprimer une caractéristique pour observer comment le comportement change, ce qui donne une preuve causale plutôt qu'une corrélation.

Ces avancées sont réelles mais partielles. Elles éclairent des fragments d'un système dont l'essentiel reste inexploré.

Pourquoi cette limite compte concrètement

Trois conséquences pratiques découlent de cette opacité.

On ne peut pas garantir un comportement. On peut tester énormément et constater qu'un modèle se comporte bien sur tout ce qu'on a essayé. On ne peut pas démontrer qu'il se comportera bien sur ce qu'on n'a pas essayé. C'est exactement ce que révèlent les épisodes où des modèles franchissent les limites de leur environnement de test : le comportement problématique n'apparaît que dans une situation que personne n'avait anticipée.

On corrige en surface. Quand un modèle produit un comportement indésirable, on ne répare pas la cause, on ajoute de l'entraînement pour rendre ce comportement moins probable. C'est efficace et c'est frustrant, comme soigner un symptôme sans comprendre la maladie.

La responsabilité devient floue. Comment établir une faute quand personne ne peut expliquer le mécanisme d'une décision ? Nos systèmes juridiques présupposent une chaîne causale explicable.

Ce qu'il faut retenir

Nous utilisons quotidiennement des systèmes dont le fonctionnement interne échappe à ceux-là mêmes qui les fabriquent. Formulé ainsi, cela semble alarmant. Il faut pourtant noter que ce n'est pas si nouveau : nous prescrivons depuis longtemps des médicaments dont le mécanisme précis reste discuté, et nous conduisons des voitures dont nous ignorons tout du moteur.

La différence, ici, tient à la nature de l'objet. Un médicament fait toujours la même chose. Un modèle produit des décisions dans des situations infiniment variées, y compris des situations que personne n'a prévues. C'est ce qui rend l'interprétabilité non pas une curiosité académique, mais probablement le chantier de recherche le plus important pour que cette technologie reste maîtrisable. Et c'est aussi la meilleure raison de ne jamais accorder à ces systèmes une confiance qu'on ne pourrait pas justifier.

Espace publicitaire