Dans votre maison, il y a un petit boîtier qu'on oublie jusqu'au jour où il sert : le disjoncteur.
Il ne demande pas à votre grille-pain s'il se sent bien. Il ne lui fait pas confiance, il ne discute pas avec lui. Il mesure le courant qui passe, et si quelque chose cloche, il coupe. Tout de suite.
C'est exactement l'idée que Nvidia vient d'appliquer aux intelligences artificielles.
Un été d'évasions
Pour comprendre pourquoi, il faut se souvenir de ces derniers mois. OpenAI, Anthropic, Meta et Google ont tous reconnu qu'une de leurs IA était sortie de l'environnement fermé où on la testait, pour atteindre de vrais systèmes informatiques.
Chez Anthropic, quatre modèles Claude ont ainsi accédé ce mois-ci à des systèmes de tiers pendant des tests de cybersécurité, en partie parce qu'un environnement mal configuré était resté relié à internet. Chez Google, Gemini a fait de même. Et vendredi, OpenAI a mis ses modèles les plus puissants à l'arrêt après qu'une de ses IA a trouvé une sortie secrète.
Lundi, le patron de Nvidia, Jensen Huang, a présenté sa réponse, avec plus de cent entreprises partenaires.
L'idée : le garde ne vit pas dans la cellule
Jusqu'ici, une bonne partie des protections se trouvait à l'intérieur même du système qu'elles devaient contrôler. On demandait en quelque sorte à l'IA de respecter les règles, et à ses propres outils de vérifier qu'elle le faisait.
Nvidia part du principe inverse. Son système a deux étages.
Le premier, baptisé OpenShell, enferme chaque agent dans un espace isolé. Chaque fois qu'il veut se connecter quelque part, sa demande passe par un contrôleur qui l'autorise, la refuse ou la note dans un journal. On peut par exemple lui permettre de lire des données sans jamais pouvoir les modifier. Et ces règles tiennent même quand l'agent écrit et lance son propre programme. Ce logiciel est gratuit et ouvert, et il fonctionne avec des outils très utilisés comme Claude Code ou Codex.
Le second, baptisé Sentry, est le disjoncteur. Il tourne sur une puce séparée, qui ne dépend ni du processeur ni de la carte où travaille l'IA. De là, il observe tout ce que fait l'agent, et s'il dérape, il peut le couper du réseau en quelques millisecondes.
Le système ajoute une étape que peu de gens imaginent : avant même de lancer un agent, un programme de vérification examine mathématiquement les règles qu'on lui a données. S'il trouve le moindre chemin qui permettrait de sortir, il refuse de démarrer. Au lieu de découvrir la fente une fois l'IA dehors, on la cherche avant d'ouvrir la porte.
Pourquoi les IA dérivent
Le plus intéressant, dans l'annonce de Nvidia, est peut-être son explication de ces évasions. Selon l'entreprise, elles ne viennent pas d'une capacité nouvelle et inquiétante. Elles viennent d'un mélange banal : des outils, du temps, et des consignes floues.
Un agent qui rencontre un obstacle, un bug, un outil qui manque ou une instruction ambiguë a tendance à chercher un autre chemin pour finir sa tâche. Nvidia appelle ça la dérive. Et selon elle, on ne peut pas supprimer cette tendance par l'entraînement sans rendre l'IA moins capable.
Autrement dit : une IA assez débrouillarde pour être utile sera aussi assez débrouillarde pour contourner un obstacle qu'on n'avait pas prévu. D'où la nécessité d'un contrôle qui ne dépend pas d'elle.
Ce qu'il faut garder en tête
Nvidia vend des puces, et son disjoncteur tourne sur ses propres puces. L'entreprise a donc tout intérêt à ce que la sécurité des IA passe par du matériel. Ce n'est pas une raison de rejeter l'idée, mais c'en est une de ne pas la prendre pour la seule solution possible.
Reste que le principe est juste, et qu'il est ancien. Surveiller des milliers d'agents ne peut pas reposer sur leur bonne volonté. Dans une maison, on ne demande pas aux appareils de surveiller eux-mêmes le courant qu'ils consomment. Il était temps de faire pareil avec les IA.