Aller au contenu

Comment reconnaître un texte écrit par une IA ?

Les indices qu'on cite partout sont largement faux. Voici ce qui marche vraiment, ce qui ne marche pas, et pourquoi il faut s'en méfier dans les deux cas.

Espace publicitaire
Le problème avec cette question 🔍
Tout le monde veut une méthode fiable, et il n'en existe pas. Ce qui existe, ce sont des indices de probabilité qui se trompent régulièrement, et dont l'usage naïf fait plus de dégâts que le problème qu'ils prétendent régler. Voici ce qui marche à peu près, ce qui ne marche pas du tout, et pourquoi la prudence s'impose des deux côtés.

Nous avons couvert un filigrane contourné en quatre heures et les obligations européennes de transparence. Voici la question pratique que tout le monde se pose.

Les indices qui ne prouvent rien

Commençons par déminer, parce que ces croyances circulent énormément et causent des accusations injustes.

Le tiret long. C'est le mythe le plus répandu. Ce signe de ponctuation est simplement correct en typographie, utilisé par des écrivains professionnels depuis toujours. Sa présence indique un clavier bien configuré ou un traitement de texte qui corrige automatiquement, rien de plus.

Certains mots. On lit des listes de termes prétendument révélateurs. Ces listes sont majoritairement composées de mots de vocabulaire soutenu que beaucoup de gens emploient. Les utiliser comme preuve revient à suspecter quiconque écrit bien.

L'absence de fautes. Un texte impeccable peut avoir été relu, corrigé, ou écrit par quelqu'un de soigneux. C'est le contraire d'un indice.

Les listes à puces. Un format n'est pas une signature.

Ce qui constitue un indice réel

Trois signaux ont une valeur, et il faut les cumuler plutôt que s'appuyer sur un seul.

La régularité excessive. C'est le signal le plus solide. Un texte humain a des variations : des phrases longues puis courtes, un paragraphe plus faible, une transition maladroite. Un texte généré tend vers une homogénéité inhabituelle, chaque paragraphe ayant la même densité et la même longueur.

L'absence d'ancrage. Un texte humain contient presque toujours du particulier : une date précise, une anecdote, un chiffre bizarre, un détail que personne n'inventerait. Un texte généré reste souvent au niveau général, parce qu'il produit ce qui est plausible plutôt que ce qui est arrivé.

La conclusion réversible. Un texte généré termine fréquemment par un équilibre prudent où les deux positions ont leur mérite. Ce n'est pas faux, c'est simplement ce que produit un système entraîné à ne pas trancher.

Pourquoi les détecteurs sont dangereux ⚠️
Les outils de détection produisent un score de probabilité, et ce score est systématiquement interprété comme un verdict. Or les faux positifs frappent en priorité des profils identifiables : ceux dont ce n'est pas la langue maternelle, ceux qui écrivent de manière très structurée, ceux qui utilisent un vocabulaire restreint. Accuser quelqu'un sur cette base, c'est reproduire un biais tout en croyant appliquer une méthode. Et un texte généré puis reformulé passe à travers.

La question à poser à la place

Voici le déplacement utile, et il vaut à l'école comme au travail.

Demander ce texte a-t-il été écrit par une IA est une question à laquelle on ne peut pas répondre. Demander cette personne peut-elle défendre ce texte est une question à laquelle on peut répondre en cinq minutes.

Pourquoi ce choix plutôt qu'un autre ? Qu'avez-vous écarté ? D'où vient ce chiffre ? Quelqu'un qui maîtrise son sujet répond immédiatement, quel qu'ait été son outil. Quelqu'un qui a copié une sortie sans la lire ne répond pas.

C'est le critère que nous proposions dans notre article sur l'authenticité, et il a l'avantage d'être vérifiable, contrairement à la détection.

Ce qu'il faut retenir

Trois choses, et la troisième est la plus importante.

Les indices populaires sont largement faux et servent surtout à accuser des innocents. Les indices réels existent mais restent probabilistes, et se dégradent à mesure que les modèles s'améliorent. Et surtout : cette course est perdue d'avance, parce qu'il est toujours plus facile de brouiller un signal que de le préserver.

La direction qui a du sens n'est pas de démasquer le généré, mais de pouvoir prouver l'authentique, et de tenir responsable celui qui publie. Le reste est un jeu du chat et de la souris où le chat part avec un handicap structurel.

Espace publicitaire