Aller au contenu

C'est quoi l'empoisonnement de données ? Quand quelques centaines de textes suffisent à piéger un modèle

Des artistes et des auteurs glissent dans leurs oeuvres des éléments invisibles à l'oeil mais toxiques pour une IA. La technique fonctionne, et elle inquiète autant qu'elle intéresse.

Espace publicitaire
L'idée en une image 🧪
Imaginez que vous distribuiez gratuitement un livre de recettes, mais qu'un concurrent le photocopie sans autorisation pour le revendre. Vous ne pouvez pas l'en empêcher juridiquement, alors vous glissez dans vos recettes des indications qu'un cuisinier humain corrigera d'instinct, mais qu'une machine reproduira bêtement. L'empoisonnement de données, c'est exactement cela, appliqué aux corpus d'entraînement.

Nous évoquions ce matin la ruée des laboratoires sur les livres imprimés avant 2022, et l'un des arguments de vente était que ces ouvrages échappent à cette technique. Elle mérite d'être expliquée, parce qu'elle est devenue un vrai enjeu.

Le principe

L'empoisonnement de données (data poisoning) consiste à introduire dans un ensemble de données des éléments spécifiquement conçus pour dégrader le comportement d'un modèle qui s'entraînerait dessus.

Le point essentiel, et celui qui rend la technique redoutable, est l'asymétrie de perception. Ces éléments sont conçus pour être imperceptibles à un humain et significatifs pour une machine. Un lecteur ne remarque rien, un modèle absorbe une information trompeuse.

Pour les images, des outils développés en milieu universitaire permettent à des artistes de modifier imperceptiblement leurs oeuvres avant publication, de sorte qu'un modèle entraîné dessus apprenne des associations erronées. Pour le texte, le principe est comparable, en jouant sur des caractères ou des structures que l'oeil corrige automatiquement.

Pourquoi de si petites quantités suffisent

C'est le résultat le plus surprenant, et il va à l'encontre de l'intuition. On imagine qu'il faudrait empoisonner une fraction importante d'un corpus pour avoir un effet. Des travaux de recherche suggèrent qu'un très petit nombre de documents soigneusement construits, de l'ordre de quelques centaines, peut suffire à installer un comportement indésirable dans un corpus comptant des milliers de milliards de mots.

La raison tient au fonctionnement même de l'apprentissage. Un modèle ne fait pas que moyenner : il cherche des motifs. Un motif rare mais très cohérent, répété à l'identique dans un petit nombre de documents, peut être appris comme une règle, précisément parce qu'il ne ressemble à rien d'autre. C'est un peu comme un mot de passe : sa force ne vient pas de sa longueur relative au dictionnaire, mais de sa singularité.

La porte dérobée, cas le plus préoccupant 🚪
La forme la plus étudiée est la backdoor, ou porte dérobée. Le modèle se comporte normalement en toutes circonstances, sauf quand un déclencheur précis apparaît dans la requête. Ce déclencheur peut être une séquence de caractères anodine que personne ne taperait par hasard. Le danger est évident : le comportement problématique reste invisible pendant toutes les phases de test, puisqu'il ne se manifeste qu'en présence d'une clé que seul l'auteur connaît.

Deux usages, deux jugements très différents

C'est ici que le sujet devient intéressant, parce que la même technique sert deux causes opposées.

Comme outil de défense. Des artistes et des auteurs l'utilisent pour protéger des oeuvres qu'ils publient nécessairement en ligne. L'argument est celui de la légitime défense : le droit d'auteur existe mais s'avère difficile à faire respecter face à des aspirations massives, alors on rend la marchandise moins appétissante. C'est une réponse technique à un échec juridique, et beaucoup y voient une forme de rapport de force retrouvé.

Comme arme d'attaque. La même méthode permet à un acteur malveillant de placer une porte dérobée dans un modèle qui sera ensuite déployé en production. Cela rejoint les préoccupations de sécurité que nous avons documentées, notamment autour de l'agentjacking : dans les deux cas, on exploite le fait qu'un système ne distingue pas nativement ce qu'il doit croire de ce qu'il doit exécuter.

Juger la technique dans l'absolu n'a donc pas beaucoup de sens. Un couteau n'est ni bon ni mauvais ; ce qui compte est qui s'en sert et contre quoi.

Les limites, côté défenseurs

Il faut être honnête avec les créateurs tentés par cette voie : l'efficacité n'est pas garantie dans la durée.

Les laboratoires développent des filtres de détection, et un empoisonnement identifié est simplement écarté du corpus. Certaines transformations d'image, comme une compression agressive, peuvent atténuer l'effet. Et surtout, la course est asymétrique : quelques équipes bien financées travaillent à détecter, face à des créateurs isolés utilisant des outils publics dont les signatures finissent par être connues.

La stratégie la plus solide reste donc la combinaison : protection technique, mention explicite d'interdiction de l'usage pour l'entraînement, et action collective par la voie juridique ou la négociation de licences.

Ce qu'il faut retenir

L'empoisonnement de données est un symptôme, plus qu'une solution. Il apparaît là où le rapport de force est déséquilibré : des créateurs qui ne peuvent pas empêcher l'usage de leurs oeuvres se dotent d'un moyen de pression technique, faute de moyen de pression légal effectif.

Son existence produit d'ailleurs un effet secondaire qu'on n'avait pas anticipé, et que nous avons vu à l'oeuvre ce matin : elle rend les données antérieures à son invention plus précieuses. Un livre imprimé avant que ces outils n'existent est propre par construction. La défense des uns crée la valeur de ce que d'autres cherchent à acheter, et parfois à détruire.

C'est peut-être la meilleure illustration de l'état actuel du sujet des données : chacun bricole ses armes en attendant que le droit tranche, et personne ne sait combien de temps cette période durera.

Espace publicitaire