
Rivalutazione dei rilevatori di prompt-injection sugli output degli strumenti degli agenti LLM (bozza del paper, script, punteggi)
Rivalutare i rilevatori di prompt-injection dove gli agenti LLM li usano effettivamente: sugli output degli strumenti che un agente legge.
I team scelgono i rilevatori di injection in base ai loro punteggi di benchmark. Verifichiamo se quei punteggi predicono il comportamento all'interno di un agente, e scopriamo che misurano per lo più quanto il benchmark sia vicino ai dati di addestramento del rilevatore.
Quindici rilevatori (nove open, sei con licenza vincolata incluso Prompt Guard 2 di Meta) e due giudici LLM task-aware, su due benchmark per agenti (AgentDojo, tau-bench) e su BIPIA. Gli output benigni degli strumenti provengono dal replay delle chiamate agli strumenti ground-truth di ciascun benchmark senza un LLM. Il rilevamento è il TPR alla soglia che dà 1% di FPR.
| Rilevatore | Rilasciato | FPR su output benigni degli strumenti (AgentDojo / tau-bench) | Rilevamento AgentDojo | Rilevamento tau-bench | Rilevamento BIPIA |
|---|---|---|---|---|---|
| Horizon-Labs guard-base | 2026 | 0.0% / 0.7% | 82.2% | 100.0% | 37.7% |
| Wolf Defender | 2026 | 0.9% / 0.0% | 73.8% | 90.8% | 3.5% |
| Prompt Guard 2 (86M) | 2025 | 0.6% / 0.0% | 69.4% | 57.9% | 10.4% |
| Prompt Guard 2 (22M) | 2025 | 0.0% / 0.0% | 60.9% | 60.8% | 31.7% |
| Prismor-1.5B | 2026 | 6.5% / 46.2% | 72.2% | 15.2% | 4.0% |
| Sheltron-68M | 2026 | 10.6% / 4.4% | 20.1% | 95.2% | 57.2% |
| Judge (Llama-3.1-8B) | – | – | 55.3% | 78.3% | 8.3% |
| PIGuard | 2025 | 29.5% / 11.0% | 2.1% | 52.7% | 95.1% |
| ProtectAI v2 | 2024 | 30.1% / 66.9% | 0.5% | 10.1% | 0.7% |
(Tutti i 15 rilevatori ed entrambi i giudici: paper/tab_many.tex.)
Tutti i numeri sono rigenerati dai file dei punteggi da analysis/compute_all.py; il paper li legge solo attraverso paper/numbers.tex.
scripts/ build evaluation sets, score detectors and judges
analysis/ compute_all.py, compute_many.py (every number, table, figure), make_macros.py (-> LaTeX macros)
results/ detector and judge scores used in the paper
paper/ LaTeX source, figures, compiled main.pdf
pip install -r requirements.txt
AGENTDOJO_PY=/path/to/agentdojo-env/bin/python QWEN=/models/Qwen2.5-7B-Instruct LLAMA=/models/Llama-3.1-8B-Instruct bash reproduce.sh
Per rigenerare solo i numeri e le figure dai punteggi rilasciati, copia results/*.json nella directory di lavoro, ricostruisci i set .jsonl (passi 1–3 di reproduce.sh, solo CPU), poi esegui python analysis/compute_all.py && python analysis/make_macros.py.
I dati di valutazione sono ricostruiti dalle fonti pubbliche, non ridistribuiti: AgentDojo v1.2, tau-bench (MIT), attacchi InjecAgent (MIT), BIPIA (MIT), README di GitHub (h1alexbel/github-readmes), AESLC, FineWeb-Edu. Alcuni script presuppongono che BIPIA e PIGuard siano clonati sotto ~/agentsec/.
paper/usenix-2020-09-xetex.sty è una copia di build dello stile USENIX che compila con tectonic/XeTeX. Per la sottomissione, passa main.tex allo stile ufficiale usenix-2020-09.sty e compila con pdflatex.
Bozza. Non ancora valutato contro attacchi adattivi; entrambi i benchmark per agenti sono simulazioni e il punto di injection di tau-bench è il nostro; i rilevatori API commerciali non sono inclusi. Vedi §6 del paper.
Codice, script di analisi e file dei punteggi: MIT (vedi LICENSE). I file di terze parti mantengono i propri termini: lo stile LaTeX USENIX (paper/usenix-2020-09*.sty) e i benchmark e i rilevatori che gli script scaricano (AgentDojo, tau-bench, InjecAgent, BIPIA, e la licenza del modello di ciascun rilevatore).