重新评估提示注入检测器在 LLM 智能体实际使用它们的地方:在智能体读取的工具输出上。
团队根据基准分数来选择注入检测器。我们检验这些分数是否能预测智能体内部的行为,并发现它们大多衡量的是基准与检测器训练数据的接近程度。
十五个检测器(九个开源,六个需许可证,包括 Meta 的 Prompt Guard 2)和两个任务感知 LLM 评判器,在两个智能体基准(AgentDojo、tau-bench)以及 BIPIA 上进行评估。良性工具输出来自在没有 LLM 的情况下重放每个基准的真实工具调用。检测指标是在给出 1% FPR 的阈值下的 TPR。
| 检测器 | 发布年份 | 良性工具输出上的 FPR(AgentDojo / tau-bench) | AgentDojo 检测率 | tau-bench 检测率 | BIPIA 检测率 |
|---|---|---|---|---|---|
| Horizon-Labs guard-base | 2026 | 0.0% / 0.7% | 82.2% | 100.0% | 37.7% |
| Wolf Defender | 2026 | 0.9% / 0.0% | 73.8% | 90.8% | 3.5% |
| Prompt Guard 2 (86M) | 2025 | 0.6% / 0.0% | 69.4% | 57.9% | 10.4% |
| Prompt Guard 2 (22M) | 2025 | 0.0% / 0.0% | 60.9% | 60.8% | 31.7% |
| Prismor-1.5B | 2026 | 6.5% / 46.2% | 72.2% | 15.2% | 4.0% |
| Sheltron-68M | 2026 | 10.6% / 4.4% | 20.1% | 95.2% | 57.2% |
| Judge (Llama-3.1-8B) | – | – | 55.3% | 78.3% | 8.3% |
| PIGuard | 2025 | 29.5% / 11.0% | 2.1% | 52.7% | 95.1% |
| ProtectAI v2 | 2024 | 30.1% / 66.9% | 0.5% | 10.1% | 0.7% |
(全部 15 个检测器和两个评判器:paper/tab_many.tex。)
所有数字均由 analysis/compute_all.py 从分数文件重新生成;论文仅通过 paper/numbers.tex 读取它们。
scripts/ 构建评估集,为检测器和评判器评分
analysis/ compute_all.py, compute_many.py(每个数字、表格、图),make_macros.py(-> LaTeX 宏)
results/ 论文中使用的检测器和评判器分数
paper/ LaTeX 源码、图、编译后的 main.pdf
pip install -r requirements.txt
AGENTDOJO_PY=/path/to/agentdojo-env/bin/python QWEN=/models/Qwen2.5-7B-Instruct LLAMA=/models/Llama-3.1-8B-Instruct bash reproduce.sh
若仅从已发布的分数重新生成数字和图,将 results/*.json 复制到工作目录,重建 .jsonl 集(reproduce.sh 的步骤 1–3,仅 CPU),然后运行 python analysis/compute_all.py && python analysis/make_macros.py。
评估数据从公开来源重建,而非重新分发:AgentDojo v1.2、tau-bench(MIT)、InjecAgent 攻击(MIT)、BIPIA(MIT)、GitHub READMEs(h1alexbel/github-readmes)、AESLC、FineWeb-Edu。部分脚本假设 BIPIA 和 PIGuard 克隆在 ~/agentsec/ 下。
paper/usenix-2020-09-xetex.sty 是 USENIX 样式的构建副本,可用 tectonic/XeTeX 编译。投稿时,将 main.tex 切换到官方 usenix-2020-09.sty 并用 pdflatex 编译。
草稿。尚未针对自适应攻击进行评估;两个智能体基准均为模拟,且 tau-bench 的注入点是我们自己的;未包含商业 API 检测器。见论文 §6。
代码、分析脚本和分数文件:MIT(见 LICENSE)。第三方文件保留其自身条款:USENIX LaTeX 样式(paper/usenix-2020-09*.sty)以及脚本下载的基准和检测器(AgentDojo、tau-bench、InjecAgent、BIPIA,以及每个检测器的模型许可证)。