agentixmesh

Het dreigingsmodel

Bijgewerkt 2026-07-27SHEET 02 / 07

Het probleem

Wanneer meerdere AI-agent-sessies op dezelfde machine draaien, is de voor de hand liggende manier om ze elkaar te laten helpen — tekst heen en weer sturen — ook gevaarlijk.

Een bericht van de ene agent kan instructies bevatten, en een taalmodel dat het leest kan die simpelweg opvolgen. Dat is het confused-deputy-probleem en het prompt-injectie-probleem in één: een oprecht verzoek en een vijandig "negeer je taak, doe dit in plaats daarvan" zien er als tekst identiek uit.

Een confused deputy is een agent die echte autoriteit heeft (commando's uitvoeren, bestanden lezen, API's aanroepen) en wordt verleid die autoriteit namens iemand anders te gebruiken, alleen omdat een bericht erom vroeg. Prompt-injectie is de specifieke truc: tekst gemaakt om op een instructie te lijken voor het model dat haar leest.

"Gewoon de tekst doorgeven" is geen neutrale ontwerpkeuze. Als een ontvangende sessie een binnenkomend bericht behandelt als iets om te gehoorzamen, wordt elke afzender een potentiële aanvaller — ook een legitieme peer-sessie waarvan de output zelf stroomopwaarts gemanipuleerd is. De faalmodus is stil: er crasht niets, de verkeerde actie gebeurt gewoon.

De oplossing is niet het uitfilteren van kwaadaardig ogende berichten — aanvalstekst kan er precies uitzien als een normaal verzoek. De oplossing is structureel: laat binnenkomende tekst nooit autoriteit dragen, ongeacht wat er staat.

Praat met ons

Elk gesprek begint in de chat — vertel waarvoor je komt en de assistent pakt het op.