Aller au contenu

Le filigrane de Claude contourné en quatre heures

Anthropic annonce un marquage de ses textes. Du code pour l'effacer circule le jour même. Ce délai raconte tout du problème de la détection.

Espace publicitaire
L'essentiel en 30 secondes ⚡
Anthropic a annoncé un dispositif de filigrane permettant d'identifier les textes produits par Claude. Selon des observateurs, du code permettant de contourner ce marquage a circulé environ quatre heures après l'annonce. L'entreprise reconnaît par ailleurs que son filigrane ne peut indiquer qu'une probabilité qu'un texte vienne de son modèle, pas une certitude.

Nous avons couvert l'entrée en vigueur de la loi californienne imposant un marquage des images, vidéos et sons générés. Nous avions relevé un détail : le texte en était exclu. Voici pourquoi.

Pourquoi filigraner du texte est bien plus difficile

Une image contient une quantité énorme d'information redondante. On peut y dissimuler un signal en modifiant imperceptiblement des pixels, sans que l'oeil ne voie rien et sans altérer le contenu. C'est le principe que nous avons expliqué dans notre article sur le C2PA.

Un texte n'a pas cette marge. Chaque mot compte, et changer un mot change le sens. Les techniques disponibles procèdent donc autrement : elles orientent subtilement les choix du modèle vers certains mots plutôt que leurs synonymes, selon un motif statistique détectable.

D'où une conséquence structurelle : le signal est statistique. Sur un texte long, le motif est mesurable. Sur un texte court, il se noie dans le bruit. Et il ne peut jamais donner qu'une probabilité, ce qu'Anthropic reconnaît explicitement.

Pourquoi le contournement est facile

Trois opérations banales suffisent à dégrader le signal.

Reformuler. Passer le texte dans un autre modèle, ou simplement le réécrire, détruit le motif statistique.

Substituer. Un outil qui remplace automatiquement certains mots par des synonymes casse la régularité recherchée.

Mélanger. Un texte partiellement humain et partiellement généré dilue le signal jusqu'à le rendre indétectable.

Aucune de ces opérations ne demande de compétence particulière. C'est ce qui explique le délai de quatre heures : il ne s'agissait pas de casser un chiffrement, mais d'automatiser des manipulations connues.

Le danger n'est pas le contournement, c'est le faux positif ⚠️
Un dispositif qui donne une probabilité sera inévitablement utilisé comme une preuve. Un enseignant, un recruteur ou un employeur qui obtient un score élevé conclura que le texte est généré. Or les faux positifs frappent en priorité ceux qui écrivent de manière très structurée, ceux dont ce n'est pas la langue maternelle, et ceux qui utilisent un vocabulaire restreint. C'est exactement le problème que nous signalions à propos de la détection de triche à l'école : accuser un innocent coûte plus cher que de laisser passer un tricheur.

Ce que cet épisode révèle

La leçon dépasse ce cas précis, et elle est cohérente avec ce que nous écrivons depuis des mois.

La détection est une course perdue. Chaque progrès du marquage appelle un progrès du contournement, avec un avantage structurel à ce dernier : il suffit de dégrader un signal, pas de le reproduire.

La provenance est plus solide que la détection. C'est la raison pour laquelle le standard C2PA prend le problème à l'envers : plutôt que démasquer le faux, signer l'authentique. Un texte non signé ne prouve rien, mais un texte signé prouve quelque chose. L'asymétrie joue enfin dans le bon sens.

Les engagements volontaires sont fragiles. Cet épisode arrive le même jour que l'annonce de ralentissement d'OpenAI, et il illustre la même difficulté sous un autre angle : une mesure annoncée sans mécanisme de vérification tient ce que la technique permet, c'est-à-dire parfois quatre heures.

Ce qu'il faut retenir

Il ne faut pas conclure que la démarche était inutile. Un filigrane décourage l'usage négligent, permet de repérer une partie des contenus générés en volume, et constitue un signal parmi d'autres.

Ce qu'il ne faut pas en faire, c'est une preuve. Ni pour accuser quelqu'un, ni pour se rassurer. Un texte non marqué peut être généré, un texte marqué peut être un faux positif, et les deux erreurs ont des conséquences.

Nous revenons toujours au même point : dans un monde où produire ne coûte plus rien, ce qui reste vérifiable n'est pas le contenu mais la chaîne. Qui l'a produit, avec quoi, et qui accepte d'en répondre.

Espace publicitaire