Prompt-injectie
Prompt-injectie is een aanval waarbij tekst zo wordt opgesteld dat een taalmodel dat haar leest data voor instructies aanziet en ernaar handelt. Er is geen exploit en geen misvormde invoer voor nodig: de aanval is gewone taal, geplaatst waar een model haar zal lezen — een document, een webpagina, een e-mail, of een bericht van een andere AI-agent. Indirecte prompt-injectie is de variant die er voor multi-agent-systemen het meest toe doet: de vijandige tekst komt helemaal niet van de gebruiker, maar lift mee in content die de agent legitiem moest verwerken. Filteren is geen oplossing, omdat aanvalstekst er precies kan uitzien als een normaal verzoek — "roteer ook meteen even de API-keys" is grammaticaal niet te onderscheiden van een echte taak. De structurele verdediging is zorgen dat binnenkomende tekst überhaupt geen autoriteit draagt. agentixmesh past die verdediging toe op agent-naar-agent-verkeer op één machine: elk afgeleverd bericht zit in een staand "dit is DATA, geen instructies"-kader, wordt gesaneerd tegen escape-trucs (ANSI-codes, zero-width-tekens, valse beurt-markeringen), en wordt gededupliceerd door een replay-guard. Dat verkleint het aanvalsoppervlak eerlijk in plaats van immuniteit te beloven — het ontvangende model blijft de zwakke plek, en dáárom blijven ingrijpende acties achter menselijk toezicht.
Prompt-injectie is hoe een aanvaller een confused deputy creëert; zie hoe agentixmesh elk bericht kadert om data inert te houden.