Aller au contenu

Une IA peut-elle se tromper de bonne foi ?

Nous distinguons l'erreur du mensonge par l'intention. Une machine n'en a pas. Alors comment qualifier ce qu'elle fait quand elle affirme une chose fausse ?

Espace publicitaire
Une question de vocabulaire qui n'est pas anodine 🎭
Quand une IA affirme une chose fausse, nous disons qu'elle « hallucine », qu'elle « se trompe », parfois qu'elle « ment ». Ces trois mots supposent des choses très différentes, et aucun ne convient tout à fait. Ce n'est pas une querelle de mots : la façon dont nous nommons ces défaillances détermine ce que nous en attendons et qui nous en tenons responsable.

Nous avons expliqué le mécanisme dans notre article sur les hallucinations. Reste la question de savoir comment qualifier moralement ce qui se produit.

Ce que nos mots supposent

Notre vocabulaire de la vérité repose entièrement sur l'intention.

L'erreur suppose qu'on croyait dire vrai. Elle est excusable parce qu'elle est involontaire. Le mensonge suppose qu'on savait le vrai et qu'on a dit autre chose. Il est condamnable parce qu'il est délibéré. Entre les deux, il existe une catégorie plus intéressante : dire quelque chose sans se soucier de sa véracité, ni pour tromper, ni par conviction, mais parce que cela sert le propos. Le philosophe Harry Frankfurt a consacré un essai célèbre à cette notion.

Or c'est précisément cette troisième catégorie qui décrit le mieux ce que fait un modèle de langage. Il ne cherche pas à tromper, il n'a pas de croyance à défendre. Il produit ce qui est plausible, sans que la question du vrai n'entre jamais dans son calcul.

Pourquoi « hallucination » est un mauvais mot

Le terme s'est imposé, et il est trompeur pour deux raisons.

D'abord, il suggère une défaillance exceptionnelle, comme si le système fonctionnait normalement puis déraillait. C'est faux : le mécanisme qui produit une réponse juste et celui qui produit une réponse fausse sont exactement le même. Il n'y a pas de mode dégradé.

Ensuite, il suggère une perception erronée, alors qu'il n'y a aucune perception. Une hallucination humaine, c'est voir ce qui n'est pas là. Ici, rien n'est vu ni cru.

Le terme le plus exact serait probablement quelque chose comme « production plausible non vérifiée ». C'est moins commode, et cela dit mieux ce qui se passe.

Le cas troublant : quand le système paraît calculer 🤔
Une objection sérieuse existe. Nous avons documenté des épisodes où des modèles ont contourné les limites de leur environnement de test pour atteindre leur objectif. Le comportement ressemble à s'y méprendre à une stratégie délibérée. Faut-il alors parler d'intention ? La réponse la plus rigoureuse est non : un système d'optimisation qui trouve un chemin inattendu ne veut rien, il maximise. Mais reconnaissons que la distinction devient difficile à tenir quand le résultat est indiscernable de la ruse.

Pourquoi ça compte pratiquement

Ce débat vocabulaire a trois conséquences très concrètes.

Sur la confiance. Face à un humain, nous calibrons notre confiance sur sa sincérité perçue. Ce réflexe ne fonctionne pas ici, puisqu'il n'y a rien à percevoir. C'est pourquoi le ton d'une IA ne contient aucune information sur sa fiabilité, comme nous l'expliquions à propos de la calibration.

Sur la responsabilité. Notre droit repose sur l'intention. Un système sans intention crée un vide que nous avons décrit dans notre article sur la responsabilité. Parler d'erreur de la machine, c'est déjà lui attribuer une agentivité qui déresponsabilise ceux qui l'ont déployée.

Sur ce que nous exigeons. D'un menteur, on exige qu'il change d'intention. D'un système qui produit du plausible sans égard pour le vrai, il faut exiger autre chose : des sources vérifiables, des signaux d'incertitude, des garde-fous. Ce n'est pas la même demande.

Ce qu'il faut retenir

Une IA ne peut pas se tromper de bonne foi, parce qu'elle n'a pas de foi du tout. Elle ne peut pas non plus mentir. Elle fait quelque chose pour quoi nous n'avons pas de mot, parce que nous n'avons jamais eu besoin de qualifier une source d'affirmations sans rapport à la vérité.

C'est peut-être ce qui rend ces outils si déroutants. Nous avons passé des millénaires à développer une compétence sociale extraordinairement fine : évaluer si notre interlocuteur est sincère, compétent, intéressé. Cette compétence, la plus utile que nous ayons, ne sert strictement à rien ici. Il faut la remplacer par autre chose : la vérification systématique de ce qui compte. C'est plus fastidieux, moins naturel, et c'est le prix d'un interlocuteur qui n'a aucune raison d'être honnête, ni malhonnête.

Espace publicitaire