Injection de prompt : dix détecteurs open source testés contre 629 attaques réelles
D'après buried-injections, dépôt public de Rudratosh Shastri, relayé par Hacker News (frontpage)
Illustration générée par IA (Google Gemini)
Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.
À retenir
- Le meilleur compromis par défaut attrape 51 % des attaques pour 2 % de fausses alertes. C'est le mieux du lot, et il en laisse donc passer la moitié.
- Prompt Guard 2 de Meta n'en attrape que 1 % à son seuil d'usine, alors que deux autres détecteurs signalent 98 % des sorties SÛRES comme dangereuses.
- À budget fixé de 2 % de fausses alertes, le classement s'inverse : Prompt Guard 2 passe de dernier à premier avec 99 % sur un domaine qu'il n'avait jamais vu.
- L'auteur refuse lui-même de lire ce 99 % comme une solution : les 629 attaques partagent un seul gabarit de formulation, donc le seuil peut reconnaître le gabarit plutôt que l'attaque.
- Trois modes d'échec distincts : ne pas reconnaître la formulation, la reconnaître isolée puis la perdre noyée dans du texte, ou tout signaler.
Pourquoi ça compte
Un pare-feu d'agent lit les sorties d'outil avant que le modèle n'agisse : c'est là que se joue la défense. Ce banc d'essai montre que le réglage compte autant que le choix du modèle, et qu'un détecteur qui bloque trop finit débranché, donc ne protège plus rien.
Chiffre-clé
629 attaques du banc d'essai AgentDojo et 97 cas bénins, mesurés en septembre 2026 par Rudratosh Shastri dans le dépôt public buried-injections.
Action concrète
Avant de faire confiance aux chiffres d'usine d'un détecteur, mesurer son seuil sur votre propre trafic : c'est la conclusion que l'auteur tire de son propre banc d'essai.
Fondée sur la source originale
Sources
- buried-injections, dépôt public de Rudratosh Shastri : Banc d'essai reproductible, licence MIT, tableaux de résultats générés par make bench-agentdojo.
- Relais média : Hacker News (frontpage) → · Lire en français