Microsoft a publié le 18 août un correctif pour une vulnérabilité identifiée par des chercheurs en sécurité. La faille enchaînait trois éléments : un paramètre d'URL non documenté, la capacité intégrée de l'assistant à récupérer le contenu d'une page, et une mémoire persistante pouvant être empoisonnée. Résultat : un simple lien malveillant pouvait déclencher automatiquement des instructions et exfiltrer des données issues des services connectés. Le correctif est disponible.
Nous décrivons l'agentjacking depuis des mois comme un risque théorique documenté en laboratoire. Voici un cas concret, dans un produit utilisé par des millions de personnes.
Le mécanisme, étape par étape
Ce qui rend cette faille instructive, c'est qu'aucune de ses briques n'est anormale prise isolément.
Un paramètre non documenté. Une fonctionnalité présente dans le produit mais absente de la documentation publique. Ce n'est pas rare dans les logiciels complexes, et c'est un angle mort classique.
La récupération automatique de contenu. L'assistant peut aller lire une page web pour répondre. C'est une fonctionnalité utile, et c'est le point d'entrée : le contenu récupéré n'est pas contrôlé.
La mémoire persistante. L'assistant conserve des informations d'une session à l'autre, comme nous l'expliquions dans notre article sur ce que votre IA sait de vous. Si l'on parvient à écrire dans cette mémoire, l'effet ne disparaît pas à la fin de la conversation : il persiste.
L'enchaînement produit une attaque en un seul clic. Le lien est ouvert, le contenu est lu, des instructions dissimulées sont interprétées comme légitimes, et elles s'exécutent avec les droits de l'utilisateur sur ses services connectés.
Nous l'avons répété : un modèle ne distingue pas nativement les données qu'il doit analyser des instructions qu'il doit suivre. Tout est du texte. Quand un assistant lit une page, il ne dispose d'aucun mécanisme fiable pour décider que la phrase trouvée dans cette page n'est pas un ordre de son utilisateur. C'est le même problème que celui exposé dans notre article sur les jailbreaks, et il n'a pas de solution générale à ce jour.
Le facteur aggravant : la mémoire
C'est l'élément qui distingue cette faille des attaques précédentes. Une injection classique agit le temps d'une session. Une injection qui atteint la mémoire persistante s'installe.
Concrètement, une instruction malveillante peut continuer d'agir des jours plus tard, dans des conversations sans rapport, sans que rien ne rappelle le lien ouvert à l'origine. La victime ne peut pas relier la cause à l'effet.
Cela pose une question de conception plus large. La mémoire améliore réellement l'expérience, et elle élargit mécaniquement la surface d'attaque dans le temps. Les deux vont ensemble.
Ce qu'il faut en tirer
Appliquez les correctifs. Le conseil paraît banal, il est le plus efficace. Nous avons documenté avec une campagne visant 460 systèmes que les attaques exploitent massivement des vulnérabilités déjà corrigées. Le délai d'application est la principale fenêtre de risque.
Regardez ce que vous avez connecté. Un assistant relié à votre messagerie et à vos documents dispose d'un périmètre considérable. La question à se poser n'est pas ce que l'outil vous apporte, mais ce qu'il pourrait atteindre s'il était détourné.
Inspectez votre mémoire. Les interfaces permettent généralement de consulter ce qui est retenu. C'est une bonne hygiène, et cet épisode lui donne une raison supplémentaire.
Ce qu'il faut retenir
Cette affaire fait passer l'agentjacking du statut de risque documenté à celui d'incident corrigé dans un produit grand public. C'est une étape attendue, et il y en aura d'autres.
Elle confirme aussi ce que nous écrivions à propos des agents qui entrent en production : plus ces systèmes gagnent en capacité d'action, en connecteurs et en mémoire, plus leur surface d'attaque s'étend. Chaque fonctionnalité qui les rend utiles les rend aussi exploitables. Il n'existe pas de version de ces outils qui soit puissante et sans surface.