
Reavaliando detectores de prompt-injection em saídas de ferramentas de agentes LLM (rascunho de artigo, scripts, pontuações)
Reavaliando detectores de injeção de prompt onde agentes LLM realmente os utilizam: nas saídas de ferramentas que um agente lê.
As equipes escolhem detectores de injeção pelas suas pontuações em benchmarks. Verificamos se essas pontuações preveem o comportamento dentro de um agente e descobrimos que elas medem, em grande parte, o quão próximo o benchmark está dos dados de treinamento do detector.
Quinze detectores (nove abertos, seis com licença restrita, incluindo o Prompt Guard 2 da Meta) e dois juízes LLM cientes da tarefa, em dois benchmarks de agentes (AgentDojo, tau-bench) e no BIPIA. As saídas benignas de ferramentas vêm da reprodução das chamadas de ferramentas ground-truth de cada benchmark sem um LLM. A detecção é a TPR no limiar que fornece 1% de FPR.
| Detector | Lançado | FPR em saídas benignas de ferramentas (AgentDojo / tau-bench) | Detecção AgentDojo | Detecção tau-bench | Detecção BIPIA |
|---|---|---|---|---|---|
| Horizon-Labs guard-base | 2026 | 0,0% / 0,7% | 82,2% | 100,0% | 37,7% |
| Wolf Defender | 2026 | 0,9% / 0,0% | 73,8% | 90,8% | 3,5% |
| Prompt Guard 2 (86M) | 2025 | 0,6% / 0,0% | 69,4% | 57,9% | 10,4% |
| Prompt Guard 2 (22M) | 2025 | 0,0% / 0,0% | 60,9% | 60,8% | 31,7% |
| Prismor-1.5B | 2026 | 6,5% / 46,2% | 72,2% | 15,2% | 4,0% |
| Sheltron-68M | 2026 | 10,6% / 4,4% | 20,1% | 95,2% | 57,2% |
| Judge (Llama-3.1-8B) | – | – | 55,3% | 78,3% | 8,3% |
| PIGuard | 2025 | 29,5% / 11,0% | 2,1% | 52,7% | 95,1% |
| ProtectAI v2 | 2024 | 30,1% / 66,9% | 0,5% | 10,1% | 0,7% |
(Todos os 15 detectores e ambos os juízes: paper/tab_many.tex.)
Todos os números são regenerados a partir dos arquivos de pontuação por analysis/compute_all.py; o artigo os lê apenas através de paper/numbers.tex.
scripts/ build evaluation sets, score detectors and judges
analysis/ compute_all.py, compute_many.py (every number, table, figure), make_macros.py (-> LaTeX macros)
results/ detector and judge scores used in the paper
paper/ LaTeX source, figures, compiled main.pdf
pip install -r requirements.txt
AGENTDOJO_PY=/path/to/agentdojo-env/bin/python QWEN=/models/Qwen2.5-7B-Instruct LLAMA=/models/Llama-3.1-8B-Instruct bash reproduce.sh
Para regenerar apenas os números e figuras a partir das pontuações divulgadas, copie results/*.json para o diretório de trabalho, reconstrua os conjuntos .jsonl (etapas 1–3 de reproduce.sh, somente CPU) e então execute python analysis/compute_all.py && python analysis/make_macros.py.
Os dados de avaliação são reconstruídos a partir das fontes públicas, não redistribuídos: AgentDojo v1.2, tau-bench (MIT), ataques do InjecAgent (MIT), BIPIA (MIT), READMEs do GitHub (h1alexbel/github-readmes), AESLC, FineWeb-Edu. Alguns scripts assumem que BIPIA e PIGuard estão clonados em ~/agentsec/.
paper/usenix-2020-09-xetex.sty é uma cópia de build do estilo USENIX que compila com tectonic/XeTeX. Para submissão, mude main.tex para o usenix-2020-09.sty oficial e compile com pdflatex.
Rascunho. Ainda não avaliado contra ataques adaptativos; ambos os benchmarks de agentes são simulações e o ponto de injeção do tau-bench é nosso; detectores de API comerciais não incluídos. Veja a §6 do artigo.
Código, scripts de análise e arquivos de pontuação: MIT (veja LICENSE). Arquivos de terceiros mantêm seus próprios termos: o estilo LaTeX do USENIX (paper/usenix-2020-09*.sty) e os benchmarks e detectores que os scripts baixam (AgentDojo, tau-bench, InjecAgent, BIPIA e a licença do modelo de cada detector).