On dit souvent qu'une IA est biaisée, comme si la neutralité était son état naturel dont elle se serait écartée par accident. Cet article prend le problème dans l'autre sens : une IA neutre est-elle même concevable ? Pour y répondre, il faut regarder où, exactement, des choix humains s'introduisent dans la fabrication d'un modèle. La réponse est : partout.
Le reproche est devenu un classique. Selon les sensibilités, on accusera un modèle d'être trop prudent ou trop permissif, trop américain, trop progressiste ou trop conservateur. Ces critiques ont souvent un fond réel. Mais elles reposent presque toujours sur une hypothèse implicite qui mérite d'être examinée : celle qu'une IA pourrait être neutre. Voyons ce que ça impliquerait.
Premier point d'entrée : les données
Un modèle apprend en absorbant d'immenses quantités de texte, comme nous l'avons décrit dans notre article sur l'entraînement. Ce corpus n'est pas le monde : c'est ce que des humains ont écrit et mis en ligne.
Il est donc structurellement déséquilibré. Massivement anglophone, comme nous l'avons vu jusque dans la manière de découper les mots. Surreprésentant les pays connectés et les populations qui écrivent en ligne. Contenant les préjugés de leurs époques, puisque des siècles de textes véhiculent les conceptions de leur temps.
Un modèle qui refléterait fidèlement ce corpus ne serait pas neutre, il serait le miroir d'un échantillon particulier de l'humanité. Et un modèle qu'on corrigerait pour compenser ces déséquilibres ne serait pas neutre non plus : quelqu'un aurait décidé quoi compenser, et dans quelle direction.
Deuxième point d'entrée : les préférences humaines
Vient ensuite l'étape où des évaluateurs humains classent les réponses du modèle de la meilleure à la pire, pour lui apprendre à produire ce que les gens préfèrent. C'est ce qui lui donne son caractère.
Or que signifie "meilleure réponse" ? Sur une question factuelle, on peut trancher. Sur une question politique, économique, morale, la notion de meilleure réponse suppose déjà un point de vue. Faut-il présenter tous les arguments à égalité, y compris ceux que la science considère comme réfutés ? Faut-il refuser certains sujets ? Où placer le curseur entre prudence et utilité ? Chaque réponse à ces questions est un choix de valeurs, pas un réglage technique.
Supposons qu'on veuille rendre un modèle parfaitement équilibré sur les sujets contestés. Il faudrait décider quelles positions méritent d'être représentées, avec quel poids, et lesquelles relèvent de la marge. Mais ce découpage entre le débat légitime et la marge est lui-même une position. La neutralité exige un arbitre, et l'arbitre a nécessairement un point de vue. C'est un problème logique, pas un défaut d'ingénierie : il ne se résout pas avec plus de calcul.
Troisième point d'entrée : les refus
Chaque modèle refuse certaines demandes. Ces refus sont installés délibérément, et leur périmètre traduit une hiérarchie de valeurs : ce qui est jugé dangereux, ce qui est jugé acceptable, ce qui mérite un avertissement.
Ces frontières ne sont pas universelles. Un sujet banal dans un pays est sensible dans un autre. Une plaisanterie anodine ici est offensante ailleurs. Un modèle qui refuse tout serait inutile, un modèle qui accepte tout serait dangereux, et entre les deux se trouve un curseur que quelqu'un a positionné selon ses propres critères. C'est le problème que nous avons abordé sous l'angle technique dans notre article sur l'alignement, mais il est aussi profondément politique.
Ce que ça ne veut pas dire
Attention à un contresens. Dire que la neutralité parfaite est impossible ne signifie pas que tous les modèles se valent, ni qu'il faut renoncer à réduire les biais.
Il existe une différence considérable entre un modèle qui reproduit sans filtre les stéréotypes de son corpus et un modèle sur lequel on a travaillé sérieusement pour les atténuer. Entre un modèle dont les critères sont documentés publiquement et un modèle dont personne ne sait comment il a été façonné. Entre une entreprise qui reconnaît faire des choix et une entreprise qui prétend n'en faire aucun.
Le progrès existe, il est mesurable, et il est important. Ce qui n'existe pas, c'est le point d'arrivée : un modèle enfin dépourvu de toute perspective.
La transparence plutôt que la neutralité
Si la neutralité est inatteignable, quel objectif viser ? La réponse la plus solide semble être la transparence des choix.
Un modèle qui explique ses critères, qui publie ses principes, qui reconnaît ses domaines d'incertitude et qui vous laisse voir où il place ses limites est plus honnête qu'un modèle qui se présente comme un oracle sans point de vue. Vous pouvez alors tenir compte de sa perspective, comme vous tenez compte de la ligne éditoriale d'un journal que vous lisez.
C'est d'ailleurs pour cette raison qu'un usage éclairé consiste à ne pas s'en tenir à un seul modèle sur les sujets qui comptent. Interroger deux systèmes entraînés différemment sur une question sensible révèle souvent, par leurs écarts, les choix que chacun a faits. C'est exactement le réflexe de recoupement que nous recommandions dans notre méthode de vérification.
Ce qu'il faut retenir
Une IA est un artefact humain, construit à partir de textes humains, façonné par des jugements humains, pour des usages humains. À chacune de ces étapes, quelqu'un a choisi. Attendre d'elle une neutralité que ni un livre, ni un journal, ni un professeur, ni aucune institution humaine n'atteint est probablement une exigence mal formulée.
Ce qu'on peut légitimement exiger, en revanche, est plus concret : que les choix soient assumés, documentés et discutables. Que les biais les plus grossiers soient corrigés. Et qu'on cesse de vendre ces systèmes comme des sources d'autorité objective, ce qu'ils ne sont pas. Le vrai risque n'est pas qu'une IA ait un point de vue, c'est qu'on l'utilise en croyant qu'elle n'en a pas.