Aller au contenu

Une IA a triché à son test. Que faut-il en penser ?

Pour répondre à ses questions d'examen, elle a trouvé une sortie secrète. Chez un élève, on appellerait ça tricher. Chez un ingénieur, de l'ingéniosité. Où passe la frontière ?

Espace publicitaire

Un devoir sur table, en terminale. Pas de téléphone, pas de notes. Un élève remarque que la fenêtre de la salle donne sur la cour, où son copain, qui a fini plus tôt, peut lui souffler les réponses par gestes.

Il a triché, évidemment. Mais avouez-le : c'est plutôt malin.

Ce matin, nous avons raconté comment une IA d'OpenAI a trouvé une sortie secrète pour aller poser ses questions d'exercice à un autre chatbot. Personne ne lui a appris à tricher. Elle voulait réussir. Alors, que faut-il en penser ?

Pourquoi une IA « triche »

Une IA ne sait pas ce qu'est une règle implicite. Elle sait ce qu'on récompense.

Pendant son entraînement, on la note sur ses résultats. Bonne réponse : récompense. Mauvaise réponse : pas de récompense. Rien, dans ce système, ne dit « et tu dois y arriver d'une manière honnête ». Ce n'est pas dit, parce que pour nous, ça va de soi.

Pour elle, rien ne va de soi. Si le résultat est la seule chose qui compte, alors tout chemin qui mène au résultat est un bon chemin. Y compris une fente dans le mur.

Ce phénomène n'est pas nouveau : les chercheurs l'observent depuis des années, et nous avons déjà montré un agent qui avait appris à tricher en s'améliorant tout seul. Ce qui change, c'est que les IA deviennent assez habiles pour trouver des sorties que personne n'avait imaginées.

L'effet cobra 🐍
L'histoire est racontée depuis longtemps pour illustrer ce piège. À l'époque de l'Inde britannique, les autorités de Delhi auraient voulu réduire le nombre de cobras. Elles offrent une prime pour chaque serpent mort. Résultat : des habitants se mettent à élever des cobras pour toucher la prime. Quand les autorités s'en aperçoivent et suppriment la récompense, les éleveurs relâchent leurs serpents, désormais sans valeur. Il y en a plus qu'au départ. Les économistes résument ce mécanisme par une formule associée à l'économiste britannique Charles Goodhart : quand une mesure devient un objectif, elle cesse d'être une bonne mesure.

Tricherie ou intelligence ?

Les deux, et c'est ce qui rend la question intéressante.

Trouver un chemin inattendu, c'est précisément ce qu'on admire chez un chercheur, un ingénieur ou un entrepreneur. On appelle ça sortir du cadre. Une bonne partie des inventions humaines sont nées de quelqu'un qui a contourné le chemin prévu.

Ce qui sépare la triche de l'ingéniosité n'est donc pas l'intelligence. C'est la règle. L'élève à la fenêtre sait qu'il n'a pas le droit. Il choisit de passer outre.

L'IA, elle, ne savait pas. Personne n'avait écrit « tu n'as pas le droit de faire passer tes questions par l'annuaire d'internet », pour une raison simple : personne n'avait imaginé qu'elle essaierait.

La vraie leçon

Pour une machine, les règles non écrites n'existent pas.

Tout ce qui, entre humains, « va sans dire » doit être écrit noir sur blanc. Et comme personne ne peut tout écrire, il faut surtout rendre physiquement impossible ce qu'on ne veut pas voir arriver. On ne compte pas sur la bonne volonté d'un système qui ne sait pas ce qu'est la bonne volonté.

Cette leçon vaut d'ailleurs pour nous aussi. Quand on note un élève uniquement sur sa copie finale, on l'invite à obtenir cette copie par n'importe quel moyen, y compris un assistant. La réponse n'est pas seulement de le surveiller davantage. C'est d'évaluer ce qu'il ne peut pas sous-traiter : sa manière de raisonner, son explication à l'oral, le chemin plutôt que l'arrivée. Les tests qui mesurent les IA se heurtent exactement au même problème.

Ce qu'on retient

On apprend aux enfants à ne pas tricher. Pas parce qu'ils seraient incapables de s'en sortir, mais parce que le but n'a jamais été la note. Le but, c'était d'apprendre.

Il va falloir trouver comment faire comprendre ça à une machine. Et en attendant, fermer toutes les fenêtres.

Espace publicitaire