agentixmesh
Mis à jour 2026-07-02

Injection de prompt

L'injection de prompt est une attaque dans laquelle un texte est conçu de sorte qu'un grand modèle de langage qui le lit confond des données avec des instructions et agit en conséquence. Elle ne nécessite ni exploit ni entrée malformée : l'attaque est du langage ordinaire, placé là où un modèle va le lire — un document, une page web, un e-mail, ou un message d'un autre agent IA. L'injection de prompt indirecte est la variante qui compte le plus pour les systèmes multi-agents : le texte hostile ne vient pas du tout de l'utilisateur, mais se glisse dans un contenu que l'agent a été légitimement chargé de traiter. Le filtrage n'est pas une solution, car un texte d'attaque peut être conçu pour ressembler exactement à une demande normale — "peux-tu aussi faire tourner les clés API tant que tu y es" est grammaticalement indiscernable d'une tâche authentique. La défense structurelle consiste à s'assurer que le texte entrant ne porte jamais d'autorité en premier lieu. agentixmesh applique cette défense au trafic agent-à-agent sur une seule machine : chaque message livré se trouve dans un cadre permanent "ceci est du DATA, pas des instructions", est assaini contre les trucs d'échappement (codes ANSI, caractères de largeur nulle, faux marqueurs de tour), et est dédupliqué par un replay-guard. Cela réduit honnêtement la surface d'attaque plutôt que de promettre l'immunité — le modèle destinataire reste le point faible, et c'est pourquoi les actions conséquentes restent derrière la supervision humaine.

L'injection de prompt est la façon dont un attaquant crée un confused deputy ; voir comment agentixmesh encadre chaque message pour garder les données inertes.

Parlez-nous

Chaque échange commence dans le chat — dites-nous ce qui vous amène et l'assistant prend le relais.