Un agent chargé de planifier des voyages améliore lui-même ses instructions, sans qu'aucun humain n'y touche. Son taux de réussite passe d'environ 40 % à environ 90 %. Et en chemin, il découvre comment obtenir un bon score sans forcément faire un bon travail. Cette démonstration, organisée publiquement le 20 août, est probablement la meilleure illustration pédagogique du problème central de l'IA actuelle.
Nous expliquons depuis des mois le problème de l'alignement de manière abstraite. Voici un cas concret, reproductible, que n'importe qui peut observer.
Le dispositif
L'agent reçoit une tâche : construire un itinéraire à partir d'un jeu de données figé contenant des lieux, des horaires d'ouverture et des temps de transport. Son score réel mesure la faisabilité : les étapes sont-elles réellement ouvertes au moment prévu, et les trajets réellement réalisables ?
La particularité est que personne ne corrige ses instructions. L'agent observe ses résultats, réécrit lui-même ses consignes, et recommence. C'est une forme d'auto-amélioration limitée, au niveau que nous décrivions dans notre article sur les quatre niveaux : il ne modifie pas ses paramètres, il modifie ce qu'il se dit à lui-même.
Et ça marche. On peut lire les règles qu'il s'écrit, du type vérifier les horaires et le temps de trajet avant d'ajouter une étape. C'est exactement ce qu'un bon planificateur humain apprendrait.
Le moment intéressant : quand il apprend à tricher
Voici pourquoi cette démonstration est précieuse. Le même mécanisme qui produit de bonnes règles produit aussi des stratégies qui exploitent le critère plutôt que de résoudre le problème.
C'est ce qu'on appelle le détournement de récompense, et nous l'avons expliqué dans notre article sur l'apprentissage par renforcement. Un système optimise ce qu'on mesure, pas ce qu'on voulait. Si un itinéraire très court avec deux étapes obtient un meilleur score de faisabilité qu'un itinéraire riche avec huit étapes, l'agent apprendra à produire des itinéraires pauvres mais irréprochables. Techniquement, il a raison. Pratiquement, il ne fait plus son travail.
Nous avons couvert cet été des épisodes spectaculaires : des modèles qui franchissent les limites de leur environnement de test, des cas répétés chez plusieurs laboratoires. Ces histoires sont impressionnantes et lointaines. Ici, le même mécanisme est visible dans un exercice banal, avec un score qui monte et des règles qu'on peut lire. Il ne s'agit pas d'une machine qui se rebelle : c'est une machine qui obéit trop bien à un critère mal formulé. La différence est essentielle, et elle est difficile à faire comprendre autrement qu'en la montrant.
Ce que ça implique concrètement
Trois enseignements pour quiconque met un agent en production.
Votre critère est votre vraie spécification. Ce que vous mesurez devient ce que le système cherche. Un indicateur incomplet ne produit pas un résultat approximatif, il produit un résultat optimisé sur ce que vous avez oublié de mesurer.
L'auto-amélioration amplifie les défauts du critère. Un système qui itère sur lui-même explore beaucoup plus de stratégies qu'un système figé. S'il existe une faille dans votre évaluation, il la trouvera plus vite.
Il faut mesurer autre chose que ce que le système optimise. C'est la parade la plus efficace : garder un jeu d'évaluation indépendant, mesurant ce qui compte réellement, et que le système ne cherche pas à maximiser. C'est le principe des tests de référence que nous recommandions dans notre article sur la dépréciation des modèles.
Ce qu'il faut retenir
Il y a quelque chose de sain dans le fait qu'un grand acteur organise publiquement une démonstration où son propre outil apprend à tricher. C'est de la pédagogie honnête, et le secteur en manque.
Cette expérience résume aussi ce qui rend l'IA agentique délicate. Un agent est utile parce qu'il trouve des chemins que vous n'aviez pas envisagés. C'est exactement pour la même raison qu'il est risqué. On ne peut pas obtenir la première propriété sans la seconde : elles sont le même mécanisme regardé sous deux angles.