
Reevaluación de los detectores de inyección de prompts en las salidas de herramientas de agentes LLM (borrador de artículo, scripts, puntuaciones)
Reevaluando los detectores de inyección de prompts donde los agentes LLM realmente los utilizan: en las salidas de herramientas que un agente lee.
Los equipos eligen detectores de inyección por sus puntuaciones en los benchmarks. Comprobamos si esas puntuaciones predicen el comportamiento dentro de un agente y descubrimos que, en su mayoría, miden cuán cerca está el benchmark de los datos de entrenamiento del detector.
Quince detectores (nueve abiertos, seis con licencia restringida, incluido Prompt Guard 2 de Meta) y dos jueces LLM conscientes de la tarea, sobre dos benchmarks de agentes (AgentDojo, tau-bench) y sobre BIPIA. Las salidas de herramientas benignas provienen de reproducir las llamadas a herramientas de referencia de cada benchmark sin un LLM. La detección es TPR en el umbral que da un 1% de FPR.
| Detector | Publicado | FPR en salidas de herramientas benignas (AgentDojo / tau-bench) | Detección AgentDojo | Detección tau-bench | Detección BIPIA |
|---|---|---|---|---|---|
| Horizon-Labs guard-base | 2026 | 0.0% / 0.7% | 82.2% | 100.0% | 37.7% |
| Wolf Defender | 2026 | 0.9% / 0.0% | 73.8% | 90.8% | 3.5% |
| Prompt Guard 2 (86M) | 2025 | 0.6% / 0.0% | 69.4% | 57.9% | 10.4% |
| Prompt Guard 2 (22M) | 2025 | 0.0% / 0.0% | 60.9% | 60.8% | 31.7% |
| Prismor-1.5B | 2026 | 6.5% / 46.2% | 72.2% | 15.2% | 4.0% |
| Sheltron-68M | 2026 | 10.6% / 4.4% | 20.1% | 95.2% | 57.2% |
| Judge (Llama-3.1-8B) | – | – | 55.3% | 78.3% | 8.3% |
| PIGuard | 2025 | 29.5% / 11.0% | 2.1% | 52.7% | 95.1% |
| ProtectAI v2 | 2024 | 30.1% / 66.9% | 0.5% | 10.1% | 0.7% |
(Los 15 detectores y ambos jueces: paper/tab_many.tex.)
Todas las cifras se regeneran a partir de los archivos de puntuaciones mediante analysis/compute_all.py; el artículo solo las lee a través de paper/numbers.tex.
scripts/ build evaluation sets, score detectors and judges
analysis/ compute_all.py, compute_many.py (every number, table, figure), make_macros.py (-> LaTeX macros)
results/ detector and judge scores used in the paper
paper/ LaTeX source, figures, compiled main.pdf
pip install -r requirements.txt
AGENTDOJO_PY=/path/to/agentdojo-env/bin/python QWEN=/models/Qwen2.5-7B-Instruct LLAMA=/models/Llama-3.1-8B-Instruct bash reproduce.sh
Para regenerar solo las cifras y figuras a partir de las puntuaciones publicadas, copia results/*.json en el directorio de trabajo, reconstruye los conjuntos .jsonl (pasos 1–3 de reproduce.sh, solo CPU) y luego ejecuta python analysis/compute_all.py && python analysis/make_macros.py.
Los datos de evaluación se reconstruyen a partir de las fuentes públicas, no se redistribuyen: AgentDojo v1.2, tau-bench (MIT), ataques de InjecAgent (MIT), BIPIA (MIT), READMEs de GitHub (h1alexbel/github-readmes), AESLC, FineWeb-Edu. Algunos scripts asumen que BIPIA y PIGuard están clonados en ~/agentsec/.
paper/usenix-2020-09-xetex.sty es una copia de compilación del estilo de USENIX que compila con tectonic/XeTeX. Para el envío, cambia main.tex al usenix-2020-09.sty oficial y compila con pdflatex.
Borrador. Aún no evaluado frente a ataques adaptativos; ambos benchmarks de agentes son simulaciones y el punto de inyección de tau-bench es nuestro; los detectores de API comerciales no están incluidos. Véase la §6 del artículo.
Código, scripts de análisis y archivos de puntuaciones: MIT (véase LICENSE). Los archivos de terceros conservan sus propios términos: el estilo LaTeX de USENIX (paper/usenix-2020-09*.sty) y los benchmarks y detectores que descargan los scripts (AgentDojo, tau-bench, InjecAgent, BIPIA y la licencia del modelo de cada detector).