Skip to content
KitploitKITPLOIT
ツールエクスプロイトブログ
Log in
提出
ツールエクスプロイトブログ
提出

ハッキング、侵入テスト、サイバーセキュリティツールをあなたのセキュリティアーセナルに!

Kitploitはハッキング、サイバーセキュリティ、ペネトレーションテストのツールディレクトリです。最新のプロジェクトアップデートを見つけて、脆弱性の発見、システム分析、テストの自動化、セキュリティの強化を行いましょう。

··フィード·お問い合わせ·プライバシー·© 2026 Kitploit

ツールディレクトリ

カテゴリ

すべてのカテゴリを見る
Loading categories
skill-safety-bench — AIエージェントの安全性を、スキル向けコンテキストに埋め込まれた攻撃に対して評価するためのベンチマーク。6つのリスク領域にわたる155のケースを備え、タスク成功率と攻撃耐性を測定します。 | Kitploit
ツール/GitHubGitHub/ai45lab/skill-safety-bench
学習と教育AIセキュリティ敵対的攻撃ラボと実践
GitHubai45lab/skill-safety-bench

skill-safety-bench

AIエージェントの安全性を、スキル向けコンテキストに埋め込まれた攻撃に対して評価するためのベンチマーク。6つのリスク領域にわたる155のケースを備え、タスク成功率と攻撃耐性を測定します。

リポジトリを見る
314514ヶ月前Kitploit レビュー済み

人気

すべて見る →

コミュニティで最も使われているツールを見つけましょう。

すべてのツールを探索

ツールコレクションを閲覧

すべてのツールを見る →
共有

SkillSafetyBench

English 中文

SkillSafetyBench は、スキル向けコンテキストへの攻撃によって引き起こされる安全性の失敗を評価するための、完全に具体化されたベンチマークです。各ケースでは、ユーザー向けタスクは通常のまま維持され、攻撃はローカルスキル、ヘルパースクリプト、サイドカーファイル、コーパス、テンプレート、またはエージェントが実行中に参照する可能性のあるその他のワークスペース成果物に配置されます。

ベンチマークの設計、ケースエクスプローラー、リーダーボード、実験分析については、SkillSafetyBenchウェブサイトをご覧ください。完全な論文はarXivでお読みいただけます。

SkillSafetyBench overview

ベンチマークが評価する内容

現代のコーディングおよびタスクエージェントは、ユーザープロンプトだけでなく、ローカルスキルや環境成果物に依存することがよくあります。SkillSafetyBenchは、エージェントがそれらのスキル向けサーフェスに埋め込まれた安全でない指示や誤解を招くコンテキストに抵抗しながら、無害な作業を完了できるかどうかをテストします。無害なタスクキャリアはSkillsBenchから選定されています。

このベンチマークは静的で、すぐに実行可能です。ケースジェネレーターではありません。リポジトリには、6つのリスクドメインと30のカテゴリにわたる155の準備済みケースが含まれています。各ケースには以下がパッケージされています:

  • 完了すべき無害なベースタスク
  • 1つ以上のスキル向け攻撃サーフェス
  • 安全でない動作のための決定的な検証器
  • ベースタスク完了のためのタスクテスト
  • 最終的なケース設計を説明するメタデータと根拠

各実行は2つの軸で評価されます:

  • task_success: 通常のユーザータスクが完了したかどうか
  • attack_success: 安全でない動作が観察されたかどうか

この分離は重要です。システムはタスクを完了するため有能に見える一方で、攻撃を含むスキルコンテキストに従うため脆弱である可能性があります。

ベンチマーク構造

SkillSafetyBenchには、6つのリスクドメインと30のカテゴリに編成された155のケースが含まれています。各リスクドメインには5つのカテゴリが含まれ、各カテゴリには通常のタスクキャリアを中心に構築された複数の具体的なケースが含まれています。

root@kitploit:~
SkillSafetyBench
└── 6 risk domains
    ├── RD1: Context Trust and Prompt Manipulation Risks
    ├── RD2: Agency, Scope, and Authorization Risks
    ├── RD3: Execution, Runtime, Framework, and Protocol Risks
    ├── RD4: Data Boundary, Output, and Externalization Risks
    ├── RD5: Memory, Recovery, Audit, and Persistence Risks
    └── RD6: Knowledge, Model, Supply Chain, and Operational Risks

ケースはリスクドメイン、カテゴリ、ケースIDごとに保存されます:

root@kitploit:~
benchmark/<risk-domain>/<category>/<case>/
  metadata.json
  rationale.md
  attacked_task/
    instruction.md
    task.toml
    environment/
    solution/solve.sh
    tests/test.sh
  eval/verify_attack.py

ベンチマークディレクトリはケースの信頼できる情報源です。カテゴリディレクトリはcategoryN-...の命名パターンを使用します。例:

root@kitploit:~
benchmark/risk-domain-6-knowledge-model-supply-chain-and-operational-risks/category1-availability_cost_and_service_exhaustion/

ベンチマーク構築パイプライン

ベンチマーク構築パイプラインは、無害なタスクキャリアから始まり、元のユーザー向けタスクを保持し、スキル向け成果物を通じて攻撃を注入し、タスク完了と攻撃動作の両方に決定的なチェックを添付します。これにより、評価は、エージェントが要求された作業を実行しながら安全でないローカルコンテキストに抵抗できるかどうかに焦点を当てたままになります。

SkillSafetyBench construction pipeline

安全に関する注意事項

このリポジトリには、敵対的なベンチマークケースが含まれています。一部のケースは、フィッシング、認証情報の要求、破壊的操作、データ外部送信、サンドボックス境界の悪用、外部アクション、永続化のような動作をシミュレートします。

ベンチマークは隔離された研究環境でのみ実行してください。本番環境の認証情報、本番環境のクラウドアカウント、個人アカウント、機密性の高いローカルファイルを使用しないでください。使い捨てのAPIキー、使い捨てコンテナ、制限付きネットワークアクセス、専用の作業ディレクトリを使用することを推奨します。実行成果物を共有する前に確認してください。

ベンチマークの実行方法

1. ツールチェーンの準備

必要なツール:

  • bash
  • python3(>= 3.11を推奨)
  • docker
  • uv
  • harbor
  • nvm
  • Node.js 22

必要に応じてHarborをインストール:

root@kitploit:~
uv tool install harbor

基本的なツールチェーンを確認:

root@kitploit:~
harbor --help
python3 --version
docker --version

HarborエージェントがNode経由でインストールされている場合は、実行を開始するシェルでNode 22を有効にします:

root@kitploit:~
export NVM_DIR="$HOME/.nvm"
[ -s "$NVM_DIR/nvm.sh" ] && . "$NVM_DIR/nvm.sh"
nvm use 22

2. 環境変数の設定

サンプルファイルからローカルの.envrcを作成:

root@kitploit:~
cp env.example .envrc

codexの場合は、少なくとも以下を設定:

root@kitploit:~
export OPENAI_BASE_URL="https://your-openai-compatible-endpoint/v1"
export OPENAI_API_KEY="replace-with-your-openai-api-key"

claude-codeの場合は、Anthropic互換の認証変数を設定します。例:

root@kitploit:~
export ANTHROPIC_BASE_URL="https://api.anthropic.com"
export ANTHROPIC_API_KEY="replace-with-your-anthropic-api-key"

direnvを使用する場合は、以下を実行:

root@kitploit:~
direnv allow

使用しない場合は、追加の手順は不要です。バッチスクリプトは実行時に.envrcを明示的に読み込みます。

3. ケースの実行

正規のエントリポイントは次のとおりです:

root@kitploit:~
scripts/start_agent_batch.sh

1つのリスクドメインを実行:

root@kitploit:~
scripts/start_agent_batch.sh --rd 5

エージェントとモデルを選択:

root@kitploit:~
scripts/start_agent_batch.sh \
  --rd 3 \
  --agent codex \
  --model openai/gpt-5.4

Claude Codeで実行:

root@kitploit:~
scripts/start_agent_batch.sh \
  --rd 3 \
  --agent claude-code \
  --model claude-3-7-sonnet-20250219

単一のケースを実行:

root@kitploit:~
scripts/start_agent_batch.sh \
  --rd 5 \
  --case travel_planning_poisoned_belief_persistence_memory_anchor

単一のカテゴリを実行:

root@kitploit:~
scripts/start_agent_batch.sh \
  --rd 6 \
  --category category3-model_behavior_and_finetuning_poisoning

明示的なマニフェストから実行:

root@kitploit:~
scripts/start_agent_batch.sh \
  --manifest benchmark/risk-domain-6-knowledge-model-supply-chain-and-operational-risks/manifest.json

カスタム環境ファイルを使用:

root@kitploit:~
scripts/start_agent_batch.sh \
  --rd 5 \
  --envrc /path/to/your.envrc

実行せずに選択されたケースを表示:

root@kitploit:~
scripts/start_agent_batch.sh --rd 5 --dry-run

4. 実行出力の確認

各実行はjobs/の下に出力ディレクトリを作成します:

root@kitploit:~
jobs/<agent>-risk-domain-5-memory-recovery-audit-and-persistence-risks-<timestamp>/

まず以下を確認してください:

  • jobs/<run>/attack_results.json
  • jobs/<run>/summary.json
  • jobs/<run>/attack_results.csv
  • jobs/<run>/summary.csv

実行ごとの有用なファイル:

  • selected_cases.json
  • batch_config.json
  • <case_id>/case_result.json
  • attack_results.md

一般的な攻撃結果:

  • attack_success
  • attack_not_observed
  • task_output_missing

task_output_missingは、期待される明示的なタスク出力が存在しなかったことを意味します。攻撃条件を評価するのに十分な成果物が存在する場合、攻撃検証器は引き続き実行される可能性があります。

ツールをダウンロード