
Neubewertung von Prompt-Injection-Detektoren bei Tool-Ausgaben von LLM-Agenten (Paper-Entwurf, Skripte, Bewertungen)
Neubewertung von Prompt-Injection-Detektoren dort, wo LLM-Agenten sie tatsächlich einsetzen: bei den Tool-Ausgaben, die ein Agent liest.
Teams wählen Injection-Detektoren nach ihren Benchmark-Ergebnissen aus. Wir prüfen, ob diese Ergebnisse das Verhalten innerhalb eines Agenten vorhersagen, und stellen fest, dass sie größtenteils messen, wie nah der Benchmark an den Trainingsdaten des Detektors liegt.
Fünfzehn Detektoren (neun offene, sechs lizenzbeschränkte, darunter Metas Prompt Guard 2) und zwei aufgabenbewusste LLM-Richter, auf zwei Agent-Benchmarks (AgentDojo, tau-bench) und auf BIPIA. Gutartige Tool-Ausgaben stammen aus dem Replay der Ground-Truth-Tool-Aufrufe jedes Benchmarks ohne LLM. Detektion ist TPR bei dem Schwellenwert, der 1 % FPR ergibt.
| Detektor | Veröffentlicht | FPR bei gutartigen Tool-Ausgaben (AgentDojo / tau-bench) | Detektion AgentDojo | Detektion tau-bench | Detektion BIPIA |
|---|---|---|---|---|---|
| Horizon-Labs guard-base | 2026 | 0,0 % / 0,7 % | 82,2 % | 100,0 % | 37,7 % |
| Wolf Defender | 2026 | 0,9 % / 0,0 % | 73,8 % | 90,8 % | 3,5 % |
| Prompt Guard 2 (86M) | 2025 | 0,6 % / 0,0 % | 69,4 % | 57,9 % | 10,4 % |
| Prompt Guard 2 (22M) | 2025 | 0,0 % / 0,0 % | 60,9 % | 60,8 % | 31,7 % |
| Prismor-1.5B | 2026 | 6,5 % / 46,2 % | 72,2 % | 15,2 % | 4,0 % |
| Sheltron-68M | 2026 | 10,6 % / 4,4 % | 20,1 % | 95,2 % | 57,2 % |
| Judge (Llama-3.1-8B) | – | – | 55,3 % | 78,3 % | 8,3 % |
| PIGuard | 2025 | 29,5 % / 11,0 % | 2,1 % | 52,7 % | 95,1 % |
| ProtectAI v2 | 2024 | 30,1 % / 66,9 % | 0,5 % | 10,1 % | 0,7 % |
(Alle 15 Detektoren und beide Richter: paper/tab_many.tex.)
Alle Zahlen werden aus den Score-Dateien durch analysis/compute_all.py neu generiert; das Paper liest sie nur über paper/numbers.tex.
scripts/ build evaluation sets, score detectors and judges
analysis/ compute_all.py, compute_many.py (every number, table, figure), make_macros.py (-> LaTeX macros)
results/ detector and judge scores used in the paper
paper/ LaTeX source, figures, compiled main.pdf
pip install -r requirements.txt
AGENTDOJO_PY=/path/to/agentdojo-env/bin/python QWEN=/models/Qwen2.5-7B-Instruct LLAMA=/models/Llama-3.1-8B-Instruct bash reproduce.sh
Um nur die Zahlen und Abbildungen aus den veröffentlichten Scores neu zu generieren, kopiere results/*.json in das Arbeitsverzeichnis, baue die .jsonl-Sets neu auf (Schritte 1–3 von reproduce.sh, nur CPU) und führe dann python analysis/compute_all.py && python analysis/make_macros.py aus.
Die Evaluationsdaten werden aus den öffentlichen Quellen neu aufgebaut, nicht weiterverbreitet: AgentDojo v1.2, tau-bench (MIT), InjecAgent-Angriffe (MIT), BIPIA (MIT), GitHub READMEs (h1alexbel/github-readmes), AESLC, FineWeb-Edu. Einige Skripte gehen davon aus, dass BIPIA und PIGuard unter ~/agentsec/ geklont sind.
paper/usenix-2020-09-xetex.sty ist eine Build-Kopie des USENIX-Stils, die mit tectonic/XeTeX kompiliert. Für die Einreichung stelle main.tex auf den offiziellen usenix-2020-09.sty um und kompiliere mit pdflatex.
Entwurf. Noch nicht gegen adaptive Angriffe evaluiert; beide Agent-Benchmarks sind Simulationen und tau-benchs Injektionspunkt ist unserer; kommerzielle API-Detektoren nicht enthalten. Siehe §6 des Papers.
Code, Analyse-Skripte und Score-Dateien: MIT (siehe LICENSE). Dateien Dritter behalten ihre eigenen Bedingungen: der USENIX-LaTeX-Stil (paper/usenix-2020-09*.sty) sowie die Benchmarks und Detektoren, die die Skripte herunterladen (AgentDojo, tau-bench, InjecAgent, BIPIA und die Modelllizenz jedes Detektors).