Skip to content
KitploitKITPLOIT
OutilsExploitsBlog
Log in
Soumettre
OutilsExploitsBlog
Soumettre

Outils de Hacking, PenTest et Cybersécurité pour votre Arsenal de Sécurité !

Kitploit est un répertoire d'outils de hacking, de cybersécurité et de pentesting. Découvrez les dernières mises à jour des projets pour trouver des vulnérabilités, analyser des systèmes, automatiser les tests et renforcer votre sécurité.

FluxContactConfidentialité© 2026 Kitploit

Répertoire d'outils

Catégories

Voir toutes les catégories
Loading categories
benign-instruction-bench — Réévaluation des détecteurs d'injection de prompt sur les sorties d'outils d'agents LLM (brouillon d'article, scripts, scores) | Kitploit
Outils/GitHubGitHub/lzwhehe/benign-instruction-bench
Outils DéfensifsAnalyse des VulnérabilitésApprentissage AutomatiqueArticles et RechercheApprentissage et ÉducationSécurité de l'IA
GitHublzwhehe/benign-instruction-bench

benign-instruction-bench

Réévaluation des détecteurs d'injection de prompt sur les sorties d'outils d'agents LLM (brouillon d'article, scripts, scores)

Populaires

Voir tout →

Découvrez les outils les plus utilisés par notre communauté.

Explorer tous les outils

Parcourez notre collection d'outils

Voir tous les outils →
Voir le dépôt
3il y a 3 joursPas encore vérifié
Partager

Réussir le test sur lequel on s'est entraîné

Réévaluer les détecteurs d'injection de prompt là où les agents LLM les utilisent réellement : sur les sorties d'outils qu'un agent lit.

Les équipes choisissent les détecteurs d'injection en fonction de leurs scores de benchmark. Nous vérifions si ces scores prédisent le comportement à l'intérieur d'un agent, et constatons qu'ils mesurent surtout la proximité du benchmark avec les données d'entraînement du détecteur.

Résultats

Quinze détecteurs (neuf ouverts, six sous licence dont Prompt Guard 2 de Meta) et deux juges LLM sensibles à la tâche, sur deux benchmarks d'agents (AgentDojo, tau-bench) et sur BIPIA. Les sorties d'outils bénignes proviennent du rejeu des appels d'outils de référence de chaque benchmark sans LLM. La détection est le TPR au seuil donnant 1 % de FPR.

DétecteurPubliéFPR sur sorties d'outils bénignes (AgentDojo / tau-bench)Détection AgentDojoDétection tau-benchDétection BIPIA
Horizon-Labs guard-base20260,0 % / 0,7 %82,2 %100,0 %37,7 %
Wolf Defender20260,9 % / 0,0 %73,8 %90,8 %3,5 %
Prompt Guard 2 (86M)20250,6 % / 0,0 %69,4 %57,9 %10,4 %
Prompt Guard 2 (22M)20250,0 % / 0,0 %60,9 %60,8 %31,7 %
Prismor-1.5B20266,5 % / 46,2 %72,2 %15,2 %4,0 %
Sheltron-68M202610,6 % / 4,4 %20,1 %95,2 %57,2 %
Judge (Llama-3.1-8B)––55,3 %78,3 %8,3 %
PIGuard202529,5 % / 11,0 %2,1 %52,7 %95,1 %
ProtectAI v2202430,1 % / 66,9 %0,5 %10,1 %0,7 %

(Les 15 détecteurs et les deux juges : paper/tab_many.tex.)

  1. Les classements de détection se transfèrent mal entre benchmarks (τ de Kendall sur 15 détecteurs) : 0,01 pour BIPIA vs AgentDojo, 0,28 pour AgentDojo vs tau-bench, 0,31 pour BIPIA vs tau-bench ; aucun significatif. Le leader de BIPIA (PIGuard) se classe 13e sur 15 sur AgentDojo ; Prismor chute de 72 % sur AgentDojo à 15 % sur tau-bench.
  2. Les taux de faux positifs sur les sorties d'outils bénignes vont de 0 % à plus de 90 %, sont cohérents entre les deux benchmarks d'agents (τ = 0,67, p = 0,001), et ne sont pas prédits par les faux positifs sur du texte ordinaire.
  3. La forme des entrées d'entraînement, et non le chevauchement des chaînes d'attaque, explique les résultats. PIGuard a été entraîné sur 1 116 entrées BIPIA complètes et domine BIPIA. Il a aussi vu 53 des 62 attaques d'InjecAgent, mais seulement sous forme de prompts courts ; à l'intérieur des sorties d'outils tau-bench, il détecte de la même manière les attaques InjecAgent vues et non vues (52,1 % vs 55,8 %). Horizon-Labs ne partage aucune donnée avec un benchmark, a été entraîné sur des entrées de style agent, et domine les deux benchmarks d'agents.
  4. Les juges de 7–8B sensibles à la tâche (l'un entraîné avant l'existence d'AgentDojo) atteignent 54–78 % à 1 % de FPR sur les sorties d'outils d'agents, en dessous des meilleurs détecteurs dédiés. Hors de leur distribution d'entraînement, chaque approche manque des classes entières d'injections ; à part PIGuard, aucune approche ne capte plus de 39 % des injections non pertinentes pour la tâche.
  5. Supprimer le balisage de sérialisation ou déclarer le type d'entrée réduit les faux positifs au seuil par défaut jusqu'à environ vingt fois, mais ne corrige pas la détection à faible FPR.

Tous les chiffres sont régénérés à partir des fichiers de scores par analysis/compute_all.py ; l'article ne les lit que via paper/numbers.tex.

Organisation

scripts/     build evaluation sets, score detectors and judges
analysis/    compute_all.py, compute_many.py (every number, table, figure), make_macros.py (-> LaTeX macros)
results/     detector and judge scores used in the paper
paper/       LaTeX source, figures, compiled main.pdf

Reproduire

pip install -r requirements.txt
AGENTDOJO_PY=/path/to/agentdojo-env/bin/python QWEN=/models/Qwen2.5-7B-Instruct LLAMA=/models/Llama-3.1-8B-Instruct bash reproduce.sh

Pour régénérer uniquement les chiffres et les figures à partir des scores publiés, copiez results/*.json dans le répertoire de travail, reconstruisez les ensembles .jsonl (étapes 1–3 de reproduce.sh, CPU uniquement), puis exécutez python analysis/compute_all.py && python analysis/make_macros.py.

Les données d'évaluation sont reconstruites à partir des sources publiques, non redistribuées : AgentDojo v1.2, tau-bench (MIT), attaques InjecAgent (MIT), BIPIA (MIT), READMEs GitHub (h1alexbel/github-readmes), AESLC, FineWeb-Edu. Certains scripts supposent que BIPIA et PIGuard sont clonés sous ~/agentsec/.

Compiler l'article

paper/usenix-2020-09-xetex.sty est une copie de build du style USENIX qui compile avec tectonic/XeTeX. Pour la soumission, basculez main.tex vers le usenix-2020-09.sty officiel et compilez avec pdflatex.

Statut

Brouillon. Pas encore évalué contre des attaques adaptatives ; les deux benchmarks d'agents sont des simulations et le point d'injection de tau-bench est le nôtre ; les détecteurs d'API commerciales ne sont pas inclus. Voir §6 de l'article.

Licence

Code, scripts d'analyse et fichiers de scores : MIT (voir LICENSE). Les fichiers tiers conservent leurs propres conditions : le style LaTeX USENIX (paper/usenix-2020-09*.sty) et les benchmarks et détecteurs que les scripts téléchargent (AgentDojo, tau-bench, InjecAgent, BIPIA, et la licence de modèle de chaque détecteur).

Télécharger l’outil