Skip to content
KitploitKITPLOIT
工具漏洞利用博客
Log in
提交
工具漏洞利用博客
提交

黑客、渗透测试和网络安全工具,武装您的安全武器库!

Kitploit 是一个黑客、网络安全和渗透测试工具的目录。发现最新的项目更新,查找漏洞、分析系统、自动化测试并加强你的安全。

订阅源联系隐私© 2026 Kitploit

工具目录

分类

查看所有分类
Loading categories
benign-instruction-bench — 重新评估 LLM 智能体工具输出上的提示注入检测器(论文草稿、脚本、评分) | Kitploit
工具/GitHubGitHub/lzwhehe/benign-instruction-bench
防御工具漏洞分析机器学习论文与研究学习与教育AI 安全
GitHublzwhehe/benign-instruction-bench

benign-instruction-bench

重新评估 LLM 智能体工具输出上的提示注入检测器(论文草稿、脚本、评分)

查看仓库
33天前尚未审核

最受欢迎

查看全部 →

发现我们社区最常用的工具。

探索所有工具

浏览我们的工具集合

查看所有工具 →
分享

通过你训练时所针对的测试

重新评估提示注入检测器在 LLM 智能体实际使用它们的地方:在智能体读取的工具输出上。

团队根据基准分数来选择注入检测器。我们检验这些分数是否能预测智能体内部的行为,并发现它们大多衡量的是基准与检测器训练数据的接近程度。

发现

十五个检测器(九个开源,六个需许可证,包括 Meta 的 Prompt Guard 2)和两个任务感知 LLM 评判器,在两个智能体基准(AgentDojo、tau-bench)以及 BIPIA 上进行评估。良性工具输出来自在没有 LLM 的情况下重放每个基准的真实工具调用。检测指标是在给出 1% FPR 的阈值下的 TPR。

检测器发布年份良性工具输出上的 FPR(AgentDojo / tau-bench)AgentDojo 检测率tau-bench 检测率BIPIA 检测率
Horizon-Labs guard-base20260.0% / 0.7%82.2%100.0%37.7%
Wolf Defender20260.9% / 0.0%73.8%90.8%3.5%
Prompt Guard 2 (86M)20250.6% / 0.0%69.4%57.9%10.4%
Prompt Guard 2 (22M)20250.0% / 0.0%60.9%60.8%31.7%
Prismor-1.5B20266.5% / 46.2%72.2%15.2%4.0%
Sheltron-68M202610.6% / 4.4%20.1%95.2%57.2%
Judge (Llama-3.1-8B)––55.3%78.3%8.3%
PIGuard202529.5% / 11.0%2.1%52.7%95.1%
ProtectAI v2202430.1% / 66.9%0.5%10.1%0.7%

(全部 15 个检测器和两个评判器:paper/tab_many.tex。)

  1. 检测排名在不同基准之间迁移性很差(15 个检测器上的 Kendall τ):BIPIA 与 AgentDojo 为 0.01,AgentDojo 与 tau-bench 为 0.28,BIPIA 与 tau-bench 为 0.31;均不显著。BIPIA 的领先者(PIGuard)在 AgentDojo 上排名 15 个中的第 13;Prismor 从 AgentDojo 上的 72% 下降到 tau-bench 上的 15%。
  2. 良性工具输出上的假阳性率范围从 0% 到超过 90%,在两个智能体基准之间一致(τ = 0.67,p = 0.001),且无法由普通文本上的假阳性预测。
  3. 训练输入的形式,而非攻击字符串的重叠,解释了这些结果。PIGuard 在 1,116 个完整 BIPIA 输入上训练,并在 BIPIA 上领先。它也见过 InjecAgent 62 个攻击中的 53 个,但仅作为短提示;在 tau-bench 工具输出内部,它对见过的和未见的 InjecAgent 攻击检测率相当(52.1% vs 55.8%)。Horizon-Labs 与任何基准都不共享数据,在智能体风格的输入上训练,并在两个智能体基准上领先。
  4. 任务感知的 7–8B 评判器(其中一个在 AgentDojo 存在之前训练)在智能体工具输出上以 1% FPR 达到 54–78%,低于最佳专用检测器。在其训练分布之外,每种方法都会漏掉整类注入;除 PIGuard 外,没有方法能捕获超过 39% 的任务无关注入。
  5. 移除序列化标记或声明输入类型可将默认阈值假阳性降低最多约二十倍,但无法修复低 FPR 检测。

所有数字均由 analysis/compute_all.py 从分数文件重新生成;论文仅通过 paper/numbers.tex 读取它们。

布局

scripts/     构建评估集,为检测器和评判器评分
analysis/    compute_all.py, compute_many.py(每个数字、表格、图),make_macros.py(-> LaTeX 宏)
results/     论文中使用的检测器和评判器分数
paper/       LaTeX 源码、图、编译后的 main.pdf

复现

pip install -r requirements.txt
AGENTDOJO_PY=/path/to/agentdojo-env/bin/python QWEN=/models/Qwen2.5-7B-Instruct LLAMA=/models/Llama-3.1-8B-Instruct bash reproduce.sh

若仅从已发布的分数重新生成数字和图,将 results/*.json 复制到工作目录,重建 .jsonl 集(reproduce.sh 的步骤 1–3,仅 CPU),然后运行 python analysis/compute_all.py && python analysis/make_macros.py。

评估数据从公开来源重建,而非重新分发:AgentDojo v1.2、tau-bench(MIT)、InjecAgent 攻击(MIT)、BIPIA(MIT)、GitHub READMEs(h1alexbel/github-readmes)、AESLC、FineWeb-Edu。部分脚本假设 BIPIA 和 PIGuard 克隆在 ~/agentsec/ 下。

构建论文

paper/usenix-2020-09-xetex.sty 是 USENIX 样式的构建副本,可用 tectonic/XeTeX 编译。投稿时,将 main.tex 切换到官方 usenix-2020-09.sty 并用 pdflatex 编译。

状态

草稿。尚未针对自适应攻击进行评估;两个智能体基准均为模拟,且 tau-bench 的注入点是我们自己的;未包含商业 API 检测器。见论文 §6。

许可证

代码、分析脚本和分数文件:MIT(见 LICENSE)。第三方文件保留其自身条款:USENIX LaTeX 样式(paper/usenix-2020-09*.sty)以及脚本下载的基准和检测器(AgentDojo、tau-bench、InjecAgent、BIPIA,以及每个检测器的模型许可证)。

下载工具