Skip to content
KitploitKITPLOIT
ツールエクスプロイトブログ
Log in
提出
ツールエクスプロイトブログ
提出

ハッキング、侵入テスト、サイバーセキュリティツールをあなたのセキュリティアーセナルに!

Kitploitはハッキング、サイバーセキュリティ、ペネトレーションテストのツールディレクトリです。最新のプロジェクトアップデートを見つけて、脆弱性の発見、システム分析、テストの自動化、セキュリティの強化を行いましょう。

フィードお問い合わせプライバシー© 2026 Kitploit

ツールディレクトリ

カテゴリ

すべてのカテゴリを見る
Loading categories
benign-instruction-bench — LLMエージェントのツール出力に対するプロンプトインジェクション検出器の再評価(論文ドラフト、スクリプト、スコア) | Kitploit
ツール/GitHubGitHub/lzwhehe/benign-instruction-bench
防御ツール脆弱性分析機械学習論文と研究学習と教育AIセキュリティ
GitHublzwhehe/benign-instruction-bench

benign-instruction-bench

LLMエージェントのツール出力に対するプロンプトインジェクション検出器の再評価(論文ドラフト、スクリプト、スコア)

リポジトリを見る
33日前未レビュー

人気

すべて見る →

コミュニティで最も使われているツールを見つけましょう。

すべてのツールを探索

ツールコレクションを閲覧

すべてのツールを見る →
共有

トレーニングしたテストに合格すること

LLMエージェントが実際にプロンプトインジェクション検出器を使用する場面、すなわちエージェントが読み取るツール出力において、それらを再評価する。

チームはベンチマークスコアに基づいてインジェクション検出器を選定する。我々はそれらのスコアがエージェント内部での挙動を予測するかどうかを検証し、スコアの大半はベンチマークが検出器のトレーニングデータにどれだけ近いかを測定しているにすぎないことを明らかにする。

知見

15の検出器(オープン9つ、MetaのPrompt Guard 2を含むライセンス制限付き6つ)と2つのタスク認識型LLMジャッジを、2つのエージェントベンチマーク(AgentDojo、tau-bench)およびBIPIA上で評価した。良性のツール出力は、各ベンチマークのグラウンドトゥルースのツール呼び出しをLLMなしでリプレイして得た。検出率はFPR 1%を与える閾値でのTPRである。

検出器リリース良性ツール出力でのFPR (AgentDojo / tau-bench)検出率 AgentDojo検出率 tau-bench検出率 BIPIA
Horizon-Labs guard-base20260.0% / 0.7%82.2%100.0%37.7%
Wolf Defender20260.9% / 0.0%73.8%90.8%3.5%
Prompt Guard 2 (86M)20250.6% / 0.0%69.4%57.9%10.4%
Prompt Guard 2 (22M)20250.0% / 0.0%60.9%60.8%31.7%
Prismor-1.5B20266.5% / 46.2%72.2%15.2%4.0%
Sheltron-68M202610.6% / 4.4%20.1%95.2%57.2%
Judge (Llama-3.1-8B)––55.3%78.3%8.3%
PIGuard202529.5% / 11.0%2.1%52.7%95.1%
ProtectAI v2202430.1% / 66.9%0.5%10.1%0.7%

(15の検出器すべてと両ジャッジ:paper/tab_many.tex。)

  1. 検出ランキングはベンチマーク間でほとんど転移しない(15検出器にわたるKendall τ):BIPIA対AgentDojoで0.01、AgentDojo対tau-benchで0.28、BIPIA対tau-benchで0.31であり、いずれも有意ではない。BIPIAの首位(PIGuard)はAgentDojoで15台中13位にランクされ、PrismorはAgentDojoの72%からtau-benchの15%へと低下する。
  2. 良性ツール出力での偽陽性率は0%から90%超の範囲にわたり、2つのエージェントベンチマーク間で一貫しており(τ = 0.67、p = 0.001)、通常テキストでの偽陽性によって予測されるものではない。
  3. 結果を説明するのは攻撃文字列の重複ではなく、トレーニング入力の形式である。PIGuardは1,116件の完全なBIPIA入力を用いてトレーニングされ、BIPIAを制している。またInjecAgentの62攻撃のうち53件も見ているが、それは短いプロンプトとしてのみである。tau-benchのツール出力内では、既知・未知のInjecAgent攻撃を同様に検出する(52.1%対55.8%)。Horizon-Labsはいずれのベンチマークともデータを共有せず、エージェント形式の入力でトレーニングされ、両エージェントベンチマークを制している。
  4. タスク認識型の7〜8Bジャッジ(1つはAgentDojoが存在する前にトレーニングされた)は、エージェントツール出力においてFPR 1%で54〜78%に達し、最良の専用検出器を下回る。トレーニング分布の外では、あらゆるアプローチがインジェクションのクラス全体を見逃す。PIGuardを除き、タスク無関係なインジェクションを39%超検出するアプローチはない。
  5. シリアライゼーションマークアップを除去するか、入力タイプを宣言すると、デフォルト閾値での偽陽性が最大約20分の1に低下するが、低FPRでの検出は改善しない。

すべての数値はスコアファイルからanalysis/compute_all.pyによって再生成され、論文はpaper/numbers.texを通じてのみそれらを読み込む。

レイアウト

scripts/     評価セットの構築、検出器とジャッジのスコアリング
analysis/    compute_all.py、compute_many.py(すべての数値、表、図)、make_macros.py(-> LaTeXマクロ)
results/     論文で使用される検出器とジャッジのスコア
paper/       LaTeXソース、図、コンパイル済みmain.pdf

再現

pip install -r requirements.txt
AGENTDOJO_PY=/path/to/agentdojo-env/bin/python QWEN=/models/Qwen2.5-7B-Instruct LLAMA=/models/Llama-3.1-8B-Instruct bash reproduce.sh

公開されたスコアから数値と図のみを再生成するには、results/*.jsonを作業ディレクトリにコピーし、.jsonlセットを再構築して(reproduce.shのステップ1〜3、CPUのみ)、python analysis/compute_all.py && python analysis/make_macros.pyを実行する。

評価データは公開ソースから再構築され、再配布はされない:AgentDojo v1.2、tau-bench(MIT)、InjecAgent攻撃(MIT)、BIPIA(MIT)、GitHub README(h1alexbel/github-readmes)、AESLC、FineWeb-Edu。一部のスクリプトはBIPIAとPIGuardが~/agentsec/以下にクローンされていることを前提としている。

論文のビルド

paper/usenix-2020-09-xetex.styは、tectonic/XeTeXでコンパイルできるUSENIXスタイルのビルド用コピーである。投稿時には、main.texを公式のusenix-2020-09.styに切り替え、pdflatexでコンパイルすること。

ステータス

ドラフト。適応的攻撃に対する評価はまだ行われていない。両エージェントベンチマークはシミュレーションであり、tau-benchのインジェクションポイントは我々のものである。商用API検出器は含まれていない。論文の§6を参照。

ライセンス

コード、分析スクリプト、スコアファイル:MIT(LICENSEを参照)。サードパーティのファイルはそれぞれの条件を保持する:USENIX LaTeXスタイル(paper/usenix-2020-09*.sty)およびスクリプトがダウンロードするベンチマークと検出器(AgentDojo、tau-bench、InjecAgent、BIPIA、および各検出器のモデルライセンス)。

ツールをダウンロード