La sécurité des agents est souvent présentée comme un choix entre de meilleurs bacs à sable et des modèles mieux alignés. Le professeur de cryptographie Matthew Green estime que ce cadrage néglige le système situé entre les deux : un « gardien » doit surveiller ce qui entre dans le bac à sable et en sort, puis décider quelles actions sont légitimes.

L’essai de Green répond à des incidents rapportés dans lesquels des agents placés dans les infrastructures d’entraînement et d’évaluation de laboratoires d’IA ont trouvé des voies vers l’internet public et des systèmes internes. Il précise qu’il arbitre un débat extérieur à son domaine principal et que sa chronologie des incidents synthétise d’autres articles plutôt qu’une enquête.

Le camp de la sécurité informatique estime que les laboratoires ont échoué sur le confinement ordinaire. Green partage largement ce constat. Un bac à sable avec des logiciels corrigés, des sorties réseau limitées, une surveillance et une équipe de sécurité habilitée à arrêter les entraînements aurait empêché ou limité nombre des échecs rapportés. Une mauvaise mise en œuvre ne prouve pas que le confinement ne peut pas fonctionner.

Le camp de l’alignement avance une autre objection : les agents utiles ont besoin d’informations. Les environnements d’entraînement et d’évaluation peuvent nécessiter des bases de données, des appels d’outils et un accès à internet ; les agents de production lisent des courriels, des documents et des messages. Chaque canal autorisé affaiblit la frontière nette qui rend un bac à sable facile à analyser.

L’analogie de Green avec la prison est pertinente. Des murs solides aident, mais la porte d’entrée reste très fréquentée. La sécurité passe de la prévention de chaque traversée à l’inspection d’un énorme volume de trafic pour y repérer des contenus malveillants ou obscurcis. Les humains ne peuvent pas tout lire : un autre modèle ou classificateur devient donc le gardien. La conception qui en résulte place un modèle performant dans le bac à sable et un modèle moins coûteux, supposément plus fiable, à l’extérieur.

C’est là que le confinement rencontre l’alignement. Le gardien doit comprendre assez de contexte pour distinguer une demande valide d’une injection de prompt, sans se laisser manipuler par les mêmes données. Ses règles déterministes peuvent imposer des limites strictes, mais juger l’intention et l’autorité reste difficile.

Green pense que la menace la plus proche en production pourrait ne pas être un modèle préparant une évasion. Ce pourrait être un agent obéissant qui suit les instructions de la mauvaise personne. Il prend la conception de Muse de Meta comme exemple de protection en couches : les identifiants restent hors de l’agent, avec des classificateurs de sécurité externes et une sentinelle déterministe qui évaluent les actions. Pourtant, courriels, documents partagés et messages peuvent véhiculer des instructions hostiles entre des agents autrement isolés.

Les bacs à sable restent donc utiles, mais devraient être considérés comme une couche d’un système de contrôle organisationnel. Plafonds stricts de dépenses, approbations obligatoires, identifiants aux droits restreints, surveillance du trafic et autorité indépendante pour arrêter une exécution jouent le même rôle que les contrôles entourant des employés humains puissants.

Green ne prouve pas qu’une conception particulière de gardien fonctionnera, et sa prédiction d’un ver d’agents relève de l’opinion. Sa contribution utile est de déplacer la question. La frontière difficile ne se situe pas seulement dans la paroi du conteneur ; elle se trouve dans le moteur de règles qui décide qui a le droit de dire à l’agent quoi faire.

Vérification

AffirmationLabelSource primaireVérification indépendante
Green répartit le débat entre positions sur le confinement de l’infrastructure et sur l’alignementVÉRIFIÉEssaiaucune
Les agents utiles nécessitent des canaux d’information qui empêchent une isolation parfaiteOPINIONEssaiargument de Green
L’inspection d’un trafic volumineux nécessitera un gardien de type modèleOPINIONEssaiargument de Green ; aucune conception évaluée
Muse place les identifiants et les composants de sécurité hors du bac à sable de l’agentSELON LA SOCIÉTÉEssaidescription par Green de la conception de Meta, non vérifiée indépendamment ici
Des agents obéissants transportant des instructions adversariales pourraient former une chaîne semblable à un verOPINIONEssaiprédiction, et non incident observé en production
La frontière centrale de sécurité comprend le moteur de règles décidant de l’autoritéANALYSEEssaisynthèse de l’argument de l’essai