Le problème
Quand plusieurs sessions d'agents IA tournent sur la même machine, la manière évidente de les faire s'entraider — se passer du texte — est aussi dangereuse.
Un message d'un agent peut porter des instructions, et un modèle de langage qui le lit peut simplement les suivre. C'est le problème du confused deputy et le problème de l'injection de prompt en un seul : une demande sincère et un hostile "ignore ta tâche, fais ceci à la place" se ressemblent de manière identique en tant que texte.
Un confused deputy est un agent qui détient une autorité réelle (il peut exécuter des commandes, lire des fichiers, appeler des API) et se fait piéger pour utiliser cette autorité au nom de quelqu'un d'autre, simplement parce qu'un message le demandait. L'injection de prompt est la technique précise : du texte conçu pour ressembler à une instruction aux yeux du modèle qui le lit.
"Se contenter de faire passer le texte" n'est pas un choix de conception neutre. Si une session réceptrice traite un message entrant comme quelque chose à obéir, chaque expéditeur devient un attaquant potentiel — y compris une session pair légitime dont la sortie a elle-même été manipulée en amont. Le mode de défaillance est silencieux : rien ne plante, la mauvaise action se produit tout simplement.
La solution n'est pas de filtrer les messages qui ont l'air malveillants — un texte d'attaque peut être conçu pour ressembler exactement à une demande normale. La solution est structurelle : ne jamais laisser un texte entrant porter d'autorité, quel que soit son contenu.