Prompt injection
Prompt injection (istem enjeksiyonu), metnin, onu okuyan bir büyük dil modelinin veriyi talimat sanıp ona göre hareket etmesi için hazırlandığı bir saldırıdır. Bir exploit veya bozuk girdiye ihtiyaç duymaz: saldırı, bir modelin okuyacağı bir yere yerleştirilmiş sıradan dildir — bir belge, bir web sayfası, bir e-posta veya başka bir AI agent'tan gelen bir mesaj. Indirect prompt injection, çoklu-agent sistemleri için en önemli olan varyanttır: düşman niyetli metin kullanıcıdan hiç gelmez, agent'ın meşru şekilde işlemesi istenen içeriğin içinde gizlice taşınır. Filtreleme bir çözüm değildir, çünkü saldırı metni tamamen normal bir istek gibi görünecek şekilde hazırlanabilir — "bu arada API anahtarlarını da rotasyona sok" ifadesi, dilbilgisel olarak gerçek bir görevden ayırt edilemez. Yapısal savunma, gelen metnin baştan hiçbir zaman yetki taşımamasını sağlamaktır. agentixmesh bu savunmayı bir makinedeki agent-agent trafiğine uygular: teslim edilen her mesaj sabit bir "bu DATA'dır, talimat değildir" çerçevesi içinde yer alır, kaçış tekniklerine karşı (ANSI kodları, sıfır genişlikli karakterler, sahte tur işaretçileri) sanitize edilir ve bir replay guard ile tekilleştirilir. Bu, bağışıklık vaat etmek yerine saldırı yüzeyini dürüstçe azaltır — alıcı model zayıf nokta olmaya devam eder, ve önemli eylemlerin insan denetimi arkasında kalmasının nedeni tam olarak budur.
Prompt injection, bir saldırganın confused deputy yaratma yöntemidir; agentixmesh'in her mesajı nasıl çerçevelediğini görerek verinin nasıl inert kaldığını inceleyin.