LLMエージェントが実際にプロンプトインジェクション検出器を使用する場面、すなわちエージェントが読み取るツール出力において、それらを再評価する。
チームはベンチマークスコアに基づいてインジェクション検出器を選定する。我々はそれらのスコアがエージェント内部での挙動を予測するかどうかを検証し、スコアの大半はベンチマークが検出器のトレーニングデータにどれだけ近いかを測定しているにすぎないことを明らかにする。
15の検出器(オープン9つ、MetaのPrompt Guard 2を含むライセンス制限付き6つ)と2つのタスク認識型LLMジャッジを、2つのエージェントベンチマーク(AgentDojo、tau-bench)およびBIPIA上で評価した。良性のツール出力は、各ベンチマークのグラウンドトゥルースのツール呼び出しをLLMなしでリプレイして得た。検出率はFPR 1%を与える閾値でのTPRである。
| 検出器 | リリース | 良性ツール出力でのFPR (AgentDojo / tau-bench) | 検出率 AgentDojo | 検出率 tau-bench | 検出率 BIPIA |
|---|---|---|---|---|---|
| Horizon-Labs guard-base | 2026 | 0.0% / 0.7% | 82.2% | 100.0% | 37.7% |
| Wolf Defender | 2026 | 0.9% / 0.0% | 73.8% | 90.8% | 3.5% |
| Prompt Guard 2 (86M) | 2025 | 0.6% / 0.0% | 69.4% | 57.9% | 10.4% |
| Prompt Guard 2 (22M) | 2025 | 0.0% / 0.0% | 60.9% | 60.8% | 31.7% |
| Prismor-1.5B | 2026 | 6.5% / 46.2% | 72.2% | 15.2% | 4.0% |
| Sheltron-68M | 2026 | 10.6% / 4.4% | 20.1% | 95.2% | 57.2% |
| Judge (Llama-3.1-8B) | – | – | 55.3% | 78.3% | 8.3% |
| PIGuard | 2025 | 29.5% / 11.0% | 2.1% | 52.7% | 95.1% |
| ProtectAI v2 | 2024 | 30.1% / 66.9% | 0.5% | 10.1% | 0.7% |
(15の検出器すべてと両ジャッジ:paper/tab_many.tex。)
すべての数値はスコアファイルからanalysis/compute_all.pyによって再生成され、論文はpaper/numbers.texを通じてのみそれらを読み込む。
scripts/ 評価セットの構築、検出器とジャッジのスコアリング
analysis/ compute_all.py、compute_many.py(すべての数値、表、図)、make_macros.py(-> LaTeXマクロ)
results/ 論文で使用される検出器とジャッジのスコア
paper/ LaTeXソース、図、コンパイル済みmain.pdf
pip install -r requirements.txt
AGENTDOJO_PY=/path/to/agentdojo-env/bin/python QWEN=/models/Qwen2.5-7B-Instruct LLAMA=/models/Llama-3.1-8B-Instruct bash reproduce.sh
公開されたスコアから数値と図のみを再生成するには、results/*.jsonを作業ディレクトリにコピーし、.jsonlセットを再構築して(reproduce.shのステップ1〜3、CPUのみ)、python analysis/compute_all.py && python analysis/make_macros.pyを実行する。
評価データは公開ソースから再構築され、再配布はされない:AgentDojo v1.2、tau-bench(MIT)、InjecAgent攻撃(MIT)、BIPIA(MIT)、GitHub README(h1alexbel/github-readmes)、AESLC、FineWeb-Edu。一部のスクリプトはBIPIAとPIGuardが~/agentsec/以下にクローンされていることを前提としている。
paper/usenix-2020-09-xetex.styは、tectonic/XeTeXでコンパイルできるUSENIXスタイルのビルド用コピーである。投稿時には、main.texを公式のusenix-2020-09.styに切り替え、pdflatexでコンパイルすること。
ドラフト。適応的攻撃に対する評価はまだ行われていない。両エージェントベンチマークはシミュレーションであり、tau-benchのインジェクションポイントは我々のものである。商用API検出器は含まれていない。論文の§6を参照。
コード、分析スクリプト、スコアファイル:MIT(LICENSEを参照)。サードパーティのファイルはそれぞれの条件を保持する:USENIX LaTeXスタイル(paper/usenix-2020-09*.sty)およびスクリプトがダウンロードするベンチマークと検出器(AgentDojo、tau-bench、InjecAgent、BIPIA、および各検出器のモデルライセンス)。