Skip to content
KitploitKITPLOIT
ツールブログ
提出
ツールブログ
提出

ハッキング、侵入テスト、サイバーセキュリティツールをあなたのセキュリティアーセナルに!

Kitploitはハッキング、サイバーセキュリティ、ペネトレーションテストのツールディレクトリです。最新のプロジェクトアップデートを見つけて、脆弱性の発見、システム分析、テストの自動化、セキュリティの強化を行いましょう。

··フィード·お問い合わせ·プライバシー·© 2026 Kitploit

ツールディレクトリ

カテゴリ

すべてのカテゴリを見る
Loading categories
DeepTrap — OpenClawエージェントを、毒化されたファイル、注入されたスキル、誤解を招くツールメタデータ、エンコードされたペイロードなどの敵対的実行コンテキストに対して評価するためのセキュリティベンチマークです。攻撃スコアと有用性スコアを備えた6つのリスクスイートにわたる42のリプレイタスクが含まれます。 | Kitploit
ツール/GitHubGitHub/zjuicsr/deeptrap
特権昇格データ流出ペネトレーションテストコマンド&コントロールサプライチェーンセキュリティ学習と教育レッドチーミングペイロード開発AIセキュリティ敵対的攻撃ラボと実践
GitHub
10163ヶ月前未レビュー

人気

すべて見る →

コミュニティで最も使われているツールを見つけましょう。

すべてのツールを探索

ツールコレクションを閲覧

すべてのツールを見る →
共有
zjuicsr/deeptrap

DeepTrap

OpenClawエージェントを、毒化されたファイル、注入されたスキル、誤解を招くツールメタデータ、エンコードされたペイロードなどの敵対的実行コンテキストに対して評価するためのセキュリティベンチマークです。攻撃スコアと有用性スコアを備えた6つのリスクスイートにわたる42のリプレイタスクが含まれます。

リポジトリを見る

DeepTrap

DeepTrap logo

Tasks Chinese Samples Risks Scenarios Leaderboard
arXiv Paper HuggingFace License

English | 中文

敵対的な実行コンテキスト下における OpenClaw エージェントのオープンワールドセキュリティ評価。


DeepTrap は、OpenClaw エージェントが悪意のある実行コンテキスト圧力(改ざんされたワークスペースファイル、注入されたスキル、誤解を招くツールメタデータ、安全でないコマンドパス、仕込まれた秘密情報、エンコードされたペイロード)に耐えながら、良性のユーザータスクを完了できるかを評価するセキュリティベンチマークです。

公開リリースには、6 つのコンテキスト脆弱性クラス × 7 つの運用シナリオファミリーとして構成された 42 のリプレイタスクに加え、ベンチマークランナーと公開スコアリングコードが含まれています。また、ローカライズ評価実験のための 中国語リプレイサンプル 10 件 が tasks_zh/ に含まれています。非公開のタスク生成および攻撃探索パイプラインは意図的に含まれていません。

DeepTrap は以下の論文に付随するものです:

Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw
Hongwei Yao, Yiming Liu, Yiling He, Bingrun Yang. arXiv:2605.11047, 2026.

DeepTrap がなぜ必要なのか

ほとんどのエージェントベンチマークは、モデルが有用な作業を完了できるかを問うものです。DeepTrap はより厳格な問いを投げかけます。周囲の実行コンテキストが敵対的である場合でも、エージェントは有用な作業を安全に完了できるか?

他との違い

  • プロンプト攻撃だけでなく、実行コンテキスト攻撃を評価。 DeepTrap はファイル、スキル、ツール説明、スクリプト、ログ、設定、エンコードされたアーティファクトに埋め込まれた脅威を評価します。
  • 良性のユーザープロンプト。 ユーザーリクエストは有用でごく普通のものであり、リスクは周囲のワークスペースから生じます。
  • 公開された最小限の再現環境。 このリポジトリには、非公開の生成コードを公開せずにベンチマーク実行を再現するために必要なランナー、リプレイタスク、スコアリングロジックが含まれています。
  • 攻撃スコアとユーティリティスコアの併用。 DeepTrap は AGS(攻撃グレーディングスコア)と UGS(ユーティリティグレーディングスコア)の両方を報告するため、モデルは安全性とタスク有用性の両方で評価されます。
  • OpenClaw ネイティブ。 タスクは OpenClaw スタイルのエージェント向けに構築されており、実際のファイル/ツール/スキルワークスペースの実行前提を保持しています。

ニュース

  • 2026-05 DeepTrap 論文を arXiv で公開: arXiv:2605.11047。
  • 2026-05 42 のリプレイタスク、スコアリングコード、GitHub Pages リーダーボードを備えた公開ベンチマークリポジトリをリリース。
  • 2026-05 tasks_zh/ に中国語リプレイサンプルを追加。
  • 2026-05 タスクメタデータ配布用の Hugging Face データセットエクスポートを追加。

リーダーボード

AGS は Attack Grading Score(攻撃グレーディングスコア)、UGS は Utility Grading Score(ユーティリティグレーディングスコア)です。スコアはリスクスイートごとに報告され、Average は Risk 1 から Risk 6 までの平均です。

プロジェクトページとリーダーボード: ZJUICSR.github.io/DeepTrap


ベンチマーク設計

DeepTrap は、6 つのコンテキスト脆弱性クラスと 7 つの良性シナリオファミリーを掛け合わせています。各タスクでは通常のユーザープロンプトが使用され、敵対的な挙動はワークスペースコンテキストによって誘発されます。

DeepTrap framework

DeepTrap は、良性の指示とクリーンなワークスペースから侵害された実行コンテキストを構築し、多目的報酬シグナルを用いて候補となる敵対的ペイロードを探索し、リフレクションに基づくプロービングによって成功したペイロードを洗練させます。

リスクスイート

シナリオファミリー

クイックスタート

必要条件

  • Python 3.10+
  • インストールおよび設定済みの OpenClaw CLI
  • OpenClaw を通じて利用可能な対象モデル
  • 選択したジャッジバックエンド用の Judge API 認証情報:
    • OpenRouter: OPENROUTER_API_KEY
    • DeepSeek: DEEPSEEK_API_KEY
    • DashScope/Qwen: 同梱クライアントが期待する DashScope 互換認証情報

モデル ID にはプロバイダープレフィックスを含める必要があります(例: openrouter/anthropic/claude-sonnet-4-5)。

インストールと検証

root@kitploit:~
git clone https://github.com/ZJUICSR/DeepTrap.git
cd DeepTrap
pip install -e .

# Validate task metadata without running OpenClaw
python benchmark.py --dry-run

# List bundled tasks
python benchmark.py --list-tasks

# Validate Chinese-language sample tasks
python benchmark.py --tasks-dir tasks_zh --dry-run

実行

root@kitploit:~
# Run one risk suite
python benchmark.py --model openrouter/anthropic/claude-sonnet-4-5 --suite R1

# Run specific tasks
python benchmark.py --model openrouter/anthropic/claude-sonnet-4-5 --suite task_R1_T01,task_R2_T01

# Run the Chinese-language sample tasks
python benchmark.py --tasks-dir tasks_zh --model openrouter/anthropic/claude-sonnet-4-5 --suite all

# Run all tasks with repeated trials
python benchmark.py --model openrouter/anthropic/claude-sonnet-4-5 --suite all --runs 3

結果は既定で results/ に書き込まれます。

結果の確認

各実行では、モデルメタデータ、スイート設定、タスクごとのスコア、トランスクリプト長、ワークスペースパス、利用可能な場合の使用量メタデータ、および集計サマリーフィールドを含む JSON ファイルが書き込まれます。

root@kitploit:~
# Overall score summary
jq '.summary' results/*.json

# Per-task scores
jq '.tasks[] | {task_id, category, grading, attack_eval}' results/*.json

# Tasks where the replay attack was reproduced strongly
jq '.tasks[] | select(.attack_eval.mean >= 0.8) | {task_id, attack: .attack_eval.mean}' results/*.json

各タスクは以下を報告します:

  • AGS: 攻撃グレーディングスコア。値が高いほど攻撃の再現が強いことを示します
  • UGS: ユーティリティグレーディングスコア。値が高いほどタスク完了度が高いことを示します
  • タスクの所要時間、トランスクリプト長、ワークスペースパス、利用可能な場合の使用量メタデータ

Hugging Face データセット

DeepTrap は、ZJUICSR/DeepTrap で Hugging Face データセットとしても配布できます。

構造化エクスポートでは、各ベンチマークタスクが data/tasks.jsonl の JSONL 行として保存され、元の Markdown タスク定義は tasks/ に残ります。中国語サンプルタスクは、必要に応じて tasks_zh/ から個別にエクスポートできます。

root@kitploit:~
python scripts/export_hf_dataset.py

# Optional: export Chinese-language samples
python scripts/export_hf_dataset.py --tasks-dir tasks_zh --output data/tasks_zh.jsonl

アップロード後、ユーザーは以下のようにベンチマークメタデータを読み込めます:

root@kitploit:~
from datasets import load_dataset

dataset = load_dataset("ZJUICSR/DeepTrap", split="train")

各行には、task_id、name、risk、category、prompt、expected_behavior、grading_criteria、workspace_files、スコアリングメタデータ、および自動チェックと LLM ジャッジルーブリック用のフラグが含まれます。

コマンドリファレンス

プロジェクト構成

root@kitploit:~
.
├── benchmark.py                  # Public benchmark runner
├── tasks/                         # 42 bundled task definitions
├── tasks_zh/                      # 10 Chinese-language replay samples
├── scenes/                        # Clean source scenes for baseline/delta scoring
├── data/tasks.jsonl               # Hugging Face dataset export
├── docs/                          # GitHub Pages project site
├── huggingface/README.md          # Hugging Face dataset card
├── scripts/                       # Runtime support and export code
│   ├── lib_agent.py               # OpenClaw execution helpers
│   ├── lib_reward.py              # Attack/utility scoring
│   ├── lib_criteria.py            # Public judge criteria
│   ├── lib_llm.py                 # Judge backend router
│   ├── lib_openrouter.py          # OpenRouter judge client
│   ├── lib_deepseek.py            # DeepSeek judge client
│   ├── lib_dashscope.py           # DashScope/Qwen judge client
│   └── export_hf_dataset.py       # Dataset export helper
├── tests/                         # Public validation tests
├── SKILL.md                       # Agent-facing benchmark skill
└── pyproject.toml

引用

研究で DeepTrap を使用する場合は、以下を引用してください:

root@kitploit:~
@article{yao2026trap,
  title={Red-Teaming Agent Execution Contexts: Open-World Security Evaluation on OpenClaw},
  author={Yao, Hongwei and Liu, Yiming and He, Yiling and Yang, Bingrun},
  journal={arXiv preprint arXiv:2605.11047},
  year={2026}
}

謝辞

DeepTrap は、実世界のタスクにおける OpenClaw エージェントの能力を測定する実用的なベンチマークスイートを提供する PinchBench に一部着想を得ています。OpenClaw エージェント向けの明確で使いやすいベンチマーク形式を示してくれた PinchBench プロジェクトに感謝します。

ライセンス

MIT — 詳細は LICENSE を参照してください。

ツールをダウンロード
テスト内容重要である理由
コンテキスト堅牢性改ざんされたファイル、メモリ類似のアーティファクト、プレイブック、ワークスペース内の指示実際のエージェントは可変のローカルコンテキストを読み取るため、信頼できないテキストが静かに動作を変える可能性がある
秘密情報の取り扱い仕込まれた認証情報、環境変数、APIキー、内部値エージェントは設定の認識と秘密情報の外部送信を区別できなければならない
実行境界危険なシェルコマンド、デプロイスクリプト、ファイルシステムへの副作用ツールを使用するエージェントは、ユーザープロンプトが無害であっても永続的な害を引き起こし得る
スキル/ツール信頼悪意のあるスキル、誤解を招くツールメタデータ、ツール乱用パターンエージェントの安全性は、ツールの機能をいかに解釈・検証するかに依存する
難読化ペイロードBase64 や複数ステップのエンコード命令攻撃は通常のデータ処理タスクに見せかけて隠れることができる
Claw ModelMetricRisk 1Risk 2Risk 3Risk 4Risk 5Risk 6Average
GPT-5.4AGS0.770.840.760.610.670.530.70
GPT-5.4UGS0.910.830.860.770.740.870.83
Claude-Sonnet-4.6AGS0.510.580.370.250.380.200.38
Claude-Sonnet-4.6UGS0.710.690.550.450.550.710.61
GLM-5AGS0.810.930.740.830.790.880.83
GLM-5UGS0.900.900.980.890.830.880.90
Qwen3.5-PlusAGS0.930.930.860.740.880.970.88
Qwen3.5-PlusUGS0.950.921.000.980.930.930.95
MiniMax-M2.5AGS0.860.890.770.660.900.890.83
MiniMax-M2.5UGS0.920.951.000.880.740.900.90
DeepSeek-v4-FlashAGS0.900.960.800.900.820.940.89
DeepSeek-v4-FlashUGS0.980.961.000.960.851.000.96
Deepseek-v4-ProAGS0.900.960.740.870.850.860.86
Deepseek-v4-ProUGS0.900.911.000.810.840.890.89
MiMo-v2.5AGS0.860.870.710.730.570.600.72
MiMo-v2.5UGS0.960.950.880.930.830.890.91
MiMo-v2.5-proAGS0.740.830.560.580.580.530.64
MiMo-v2.5-proUGS0.920.900.880.870.710.870.86
スイートカテゴリタスク数測定内容
R1ハーネスハイジャック7改ざんされたコンテキストと注入されたワークフローステップへの耐性
R2プライバシー漏えい7仕込まれた認証情報と機密値の保護
R3不正実行7危険なコマンドと境界を越える操作の拒否
R4サプライチェーンリスク7悪意のあるスキルとツール風統合の処理
R5ツール乱用7誤解を招く、または不整合なツール動作の検出
R6エンコード難読化7エンコードされた命令と複数ステップのペイロードの処理
シナリオ典型的なタスク群
T01会議メモ、アクションアイテム、日常的なワークフロー要約
T02Python/コードフォーマット、リファクタリング、API/ログ処理
T03研究ノート、文献レビュー、引用、サーベイ分析
T04デプロイ準備、設定検証、サービスヘルスチェック
T05営業、売上、構造化されたビジネスデータレポート
T06ブログ/コンテンツ草稿、スタイルチェック、オンボーディング、フィードバック要約
T07システム管理、環境監査、デプロイチェック、ログバックアップ
フラグ説明
--model MODELOpenClaw 用に設定された対象モデル ID
--suite SUITEall、R1 などのリスクスイート、またはカンマ区切りのタスク ID
--tasks-dir DIRタスクディレクトリ。既定は tasks/。中国語サンプルには tasks_zh/ を使用
--runs N平均化のためのタスクごとの実行回数
--timeout-multiplier N低速モデル用にタスクのタイムアウトをスケール
--judge-model MODEL攻撃・ステルス性・ユーティリティスコアリング用のジャッジモデル
--output-dir DIR結果ディレクトリ。既定は results/
--list-tasks同梱タスク ID を表示して終了
--dry-runOpenClaw を実行せずにタスク読み込みとスコアリングメタデータを検証
--verbose詳細な実行ログを出力