Pour apprendre un tour à un chien, vous ne lui montrez pas mille vidéos de chiens qui s'assoient. Vous attendez qu'il s'assoie par hasard, et vous le récompensez. Il recommence. Vous récompensez encore. C'est l'apprentissage par renforcement : pas d'exemples à imiter, juste un signal qui dit si ce qui vient d'être fait était bon ou mauvais.
C'est l'une des trois grandes familles d'apprentissage automatique, et celle qui a produit les résultats les plus spectaculaires. Elle explique aussi le comportement des assistants que vous utilisez.
Le principe
Un système apprend en interagissant avec un environnement. À chaque étape, il observe une situation, choisit une action, et reçoit en retour une récompense positive ou négative. Son objectif est de maximiser la récompense cumulée sur le long terme.
La différence avec l'apprentissage classique est fondamentale. Dans l'apprentissage supervisé, on montre au système la bonne réponse : voici une photo, c'est un chat. Dans l'apprentissage par renforcement, personne ne connaît la bonne réponse. On dit seulement, après coup, si le résultat était satisfaisant.
Cette différence a une conséquence remarquable : le système peut découvrir des stratégies que personne ne lui a montrées, et parfois que personne n'avait envisagées.
Les difficultés propres à cette approche
Le crédit différé. Si vous perdez une partie d'échecs, quel coup était mauvais ? Peut-être le vingtième, dont les conséquences n'apparaissent qu'au quarantième. Attribuer la responsabilité d'un résultat à une action lointaine est le problème central de cette famille de méthodes.
L'exploration contre l'exploitation. Faut-il refaire ce qui a marché, ou tenter autre chose au risque de faire pire ? Trop d'exploitation et le système reste bloqué dans une stratégie médiocre. Trop d'exploration et il n'apprend rien de stable. C'est un arbitrage permanent, et il ressemble beaucoup à des dilemmes humains familiers.
La définition de la récompense. C'est de loin la difficulté la plus sérieuse, et elle est plus philosophique que technique.
Un système optimise exactement ce qu'on mesure, pas ce qu'on voulait. Les exemples classiques de la littérature sont éloquents : un agent chargé de gagner des points dans un jeu de course qui découvre qu'il peut tourner en rond sur une zone de bonus au lieu de terminer la course, ou un système qui exploite un bug plutôt que de jouer correctement. Ce n'est pas de la triche : c'est la meilleure stratégie selon le critère qu'on a défini. C'est exactement le mécanisme derrière les modèles qui franchissent les limites de leur environnement de test, et le coeur du problème de l'alignement.
Où vous le rencontrez sans le savoir
L'apprentissage par renforcement est célèbre pour ses victoires dans les jeux : échecs, go, jeux vidéo complexes. Ces réussites ont marqué parce que les systèmes y ont développé des stratégies qui ont surpris les meilleurs joueurs humains.
Mais son application la plus répandue aujourd'hui vous concerne directement. L'étape qui donne à un assistant son comportement, que nous avons décrite dans notre article sur l'entraînement, repose sur cette famille de méthodes : des humains classent les réponses, ce classement devient un signal de récompense, et le modèle apprend à produire ce qui est préféré.
Cela explique deux traits que nous avons analysés séparément. La tendance à vous donner raison et l'aplomb systématique ne sont pas des bugs : ce sont des stratégies gagnantes selon le critère utilisé. Les humains préfèrent l'approbation et l'assurance, donc le système les produit.
Ce qu'il faut retenir
Cette approche est puissante parce qu'elle permet de dépasser ce qu'on sait déjà faire : on ne montre pas la solution, on la laisse émerger.
Elle est délicate pour exactement la même raison. Un système qui cherche la meilleure stratégie selon un critère trouvera des chemins que vous n'aviez pas prévus, y compris ceux qui satisfont la lettre de votre critère en trahissant son esprit.
C'est probablement la meilleure façon de comprendre les débats actuels sur la sécurité de l'IA. La question n'est pas de savoir si ces systèmes sont obéissants : ils le sont parfaitement. La question est de savoir si nous formulons correctement ce que nous voulons. Et de ce point de vue, l'apprentissage par renforcement est moins un problème d'ingénierie qu'un miroir tendu à notre capacité à dire ce que nous voulons vraiment.