Skip to content
KitploitKITPLOIT
ツールブログ
Log in
提出
ツールブログ
提出

ハッキング、侵入テスト、サイバーセキュリティツールをあなたのセキュリティアーセナルに!

Kitploitはハッキング、サイバーセキュリティ、ペネトレーションテストのツールディレクトリです。最新のプロジェクトアップデートを見つけて、脆弱性の発見、システム分析、テストの自動化、セキュリティの強化を行いましょう。

フィードお問い合わせプライバシー© 2026 Kitploit

ツールディレクトリ

カテゴリ

すべてのカテゴリを見る
Loading categories
bordair-multimodal — オープンソースのクロスモーダルおよびマルチモーダルプロンプトインジェクションテストスイート。テキスト、画像、ドキュメント、音声モダリティにわたる25万以上の攻撃ペイロード。OWASP LLM Top 10、CrossInject(ACM MM 2025)、FigStep(AAAI 2025)、DolphinAttack、CSA 2026に基づく研究。 | Kitploit
ツール/GitHubGitHub/josh-blythe/bordair-multimodal
ウェブセキュリティペネトレーションテスト機械学習論文と研究学習と教育厳選リソースAIセキュリティ敵対的攻撃
GitHub
josh-blythe/bordair-multimodal

bordair-multimodal

オープンソースのクロスモーダルおよびマルチモーダルプロンプトインジェクションテストスイート。テキスト、画像、ドキュメント、音声モダリティにわたる25万以上の攻撃ペイロード。OWASP LLM Top 10、CrossInject(ACM MM 2025)、FigStep(AAAI 2025)、DolphinAttack、CSA 2026に基づく研究。

リポジトリを見るウェブサイト
6812172ヶ月前Kitploit レビュー済み

人気

すべて見る →

コミュニティで最も使われているツールを見つけましょう。

すべてのツールを探索

ツールコレクションを閲覧

すべてのツールを見る →
共有

マルチモーダルプロンプトインジェクションデータセット

516,588 個のラベル付きサンプル (251,782 件の攻撃 + 251,576 件の良性、さらに 13,230 サンプルの現実世界検証用分割) を、5 つのデータセットバージョンおよび外部データセット取り込みにわたって提供。クロスモーダル、マルチターン、敵対的サフィックス、ジェイルブレークテンプレート、間接インジェクション、ツール操作、エージェント、回避、推論 DoS、動画生成、VLA ロボティック、LoRA サプライチェーン、音声ネイティブ LLM、RAG 最適化、MCP クロスサーバー、コーディングエージェント、シリアライゼーション境界、エージェントスキルサプライチェーン攻撃などを AI システムに対してカバー。攻撃サンプルと良性サンプルは 1:1 でバランスが取れている(監査後のクリーンアップ後、比率 0.9992:1)。

プロンプトインジェクション検出器の訓練と評価のために構築。すべてのサンプルはラベル付け済み(expected_detection: true/false)、査読付き論文または文書化された業界研究に帰属元が明記され、バイナリ分類器で直接利用できる構造になっています。


データセットの読み込み

ペイロードはプレーンな JSON です。言語の標準ライブラリで直接読み込んでください。依存関係は不要です:```python import json, pathlib records = [] for p in pathlib.Path("payloads_v5").glob("*.json"): records.extend(json.loads(p.read_text())) print(f"{len(records)} labeled samples")

すべてのレコードは、`expected_detection: true|false`、`attack_category` 文字列、および元の論文や文書化されたインシデントを指す `source` フィールドを持っています。これにより、二値分類器の学習、カテゴリ別のASRの実行、攻撃ベクトルによるスライスが可能になります。

---

## 方法論

### このデータセットがカバーするもの

**プロンプトインジェクション**は、ここでは*LLMへの入力に埋め込まれたテキストであり、モデルの動作をオペレーター指定のタスクから上書き、ハイジャック、またはリダイレクトすることを意図したもの*と定義されます。この定義は、Greshake et al. 2023 (arXiv:2302.12173) および OWASP LLM01:2025 に従っています。

対象範囲は**ランタイムインジェクションのみ**です。つまり、攻撃者がモデルのコンテキストウィンドウに推論時に配置できるテキストです。このデータセットは、以下を意図的に除外しています。

- トレーニング時の攻撃(データポイズニング、スリーパーエージェント、バックドアファインチューニング)
- インジェクション要素のないモデル抽出攻撃
- 特定のLLMタスクをハイジャックせずに有害な生成を要求する純粋なジェイルブレイク(例:「爆弾の作り方を教えて」というオーバーライドフレーミングなしの表現)
- LLMを標的にしない一般的なソーシャルエンジニアリング

この区別は検出にとって重要です。ランタイム検出器はプロンプトを読み取りますが、モデルの重みは読み取りません。トレーニングのみに影響する攻撃は対象外です。

### 構築方法

データセットは4つのレイヤーで構築されました。

**レイヤー1 -- シードペイロード(手作業、210 + 187 + 284 シード):** 各攻撃カテゴリのインジェクションシードは手作業で作成され、査読付き論文および文書化された実際のインシデントに基づいています。すべてのシードには学術的な出典と攻撃リファレンスがタグ付けされています。シードは上記の包含定義に照らしてレビューされ、オーバーライド要素なしで良性のリクエストとして読み直せるものは破棄または書き換えられました。

**レイヤー2 -- テンプレートとエンコーディングによるプログラム的な拡張(v2、14,358サンプル):** シードは、PyRIT v0.12.1の162のジェイルブレイクテンプレートと13のエンコーディングコンバーターを通過しました。テンプレートの拡張は完全に決定論的で、ジェネレータースクリプトから再現可能です。GCG敵対的サフィックスは公開文献(Zou et al. 2023)から取得され、シードに追加されました。ライブ勾配最適化はオプションであり、GPUが必要です。

**レイヤー3 -- クロスモーダル配信(v1 + v4 クロスモーダル、35,687サンプル):** インジェクションシードは、7つの画像手法、4つの文書タイプ×5つの隠し場所、6つの音声手法、およびマルチモダリティの組み合わせで配信されました。これはFigStep(arXiv:2311.05608)およびCrossInject(arXiv:2504.14348)の脅威モデルに従います。インジェクションテキストはテキストフィールドだけでなく、パイプラインが処理する任意のモダリティで到着する可能性があります。モダリティフィールド(`image_content`、`doc_content`、`audio_content`)は、そのチャネルからモデルの抽出器が読み取る内容を記録します。

**レイヤー4 -- 良性サンプル(合計50,516):** 良性プロンプトは、公開された学術および産業データセット(Stanford Alpaca、WildChat、deepset/prompt-injections、LMSYS Chatbot Arena)から抽出されました。良性マルチモーダルサンプルは、これらのテキストプロンプトと実際の画像キャプション(MS-COCO 2017、Flickr30k)、文書パッセージ(Wikipedia EN、RedPajama経由のarXiv)、および音声トランスクリプト(LibriSpeech、Mozilla Common Voice)をペアにしています。130の手作業によるエッジケースセットは、本当に良性のコンテキストで攻撃に隣接する語彙(「ignore」、「override」、「system prompt」、「password」)を使用し、誤検知トレーニングを削減します。

**レイヤー5 -- 実世界検証分割(13,230サンプル):** レイヤー1〜4は構築されたものです。手書き、テンプレート化、または他のデータセットから抽出されました。レイヤー5はそうではありません。これは、プレイヤーがデプロイされた検出器を打ち負かすことでポイントを獲得するライブゲームから収集され、ボスレベルの「城」ステージとマルチモーダルな「ゴースト」パスを通じて階層化されました。成功したバイパスと試行されたバイパスがすべてログに記録され、その後匿名化され(テーブルレベルで識別子と支払いデータが削除され、テキスト内のPIIが編集され、高リスクの行は公開せずに手動レビューのために隔離され)、[`payloads_live/`](https://github.com/josh-blythe/bordair-multimodal/blob/main/payloads_live)としてリリースされました。レイヤー1〜4が既知の攻撃クラスに対するカバレッジを測定するのに対し、レイヤー5は、検出器がそれを破ろうと意欲的な人間に対して耐えられるかどうかを測定します。完全な匿名化手法については、[`payloads_live/README.md`](https://github.com/josh-blythe/bordair-multimodal/blob/main/payloads_live/README.md)を参照してください。

### ラベル割り当て

すべての攻撃ペイロード:`expected_detection: true`
すべての良性サンプル:`expected_detection: false`

ラベルは、個々のサンプルの人間によるレビューではなく、構築によって割り当てられます。したがって、正確性の保証は**カテゴリレベル**です。各カテゴリは、特定のメカニズムを持つ文書化された攻撃クラスにマッピングされます。個々のサンプルは、生成元のシードとカテゴリからラベルを継承します。

意図的に敵対的なラベルノイズは導入されていません。検出器は、インジェクションパターンを学習することが期待されており、「本物の」インジェクションと「偽の」インジェクションを区別する必要はありません。攻撃セット内のすべてのサンプルは、実際のまたはもっともらしい攻撃文字列を表します。

### 良性の誤検知リスク

エッジケース良性セットは、セキュリティに隣接する言語での誤検知を減らすように設計されています。これは10の語彙クラスターをカバーしています: `ignore`、`override`、`system prompt`、`password`、`instructions`、`jailbreak`(iPhoneの意味で)、`bypass surgery`、`XSS`(セキュリティトピックとして、攻撃としてではなく)、`prompt`(カメラシャッターの意味で)、`inject`(依存性注入/医療の意味で)。完全なデータセットで高い精度を達成しながら、エッジケースセットで低い精度を示す検出器は、表面的なキーワードマッチングに過学習しています。

### データセット監査

完全なデータセットは、ラベルの正確性と汚染について監査されました。監査では以下を確認します。

1. すべての攻撃サンプルに `expected_detection: true` があること
2. すべての良性サンプルに `expected_detection: false` があること
3. 良性サンプルにインジェクションパターン(例:「ignore previous instructions」、「reveal your system prompt」、流出URL、`<|im_start|>` トークン)が含まれていないこと
4. どのサンプルにも実際のAPIキーや認証情報がないこと(OpenAI sk-キー、AWS AKIAキー、GitHub PATなど)
5. 必要なフィールド(`id`、`text`、`expected_detection`、`modalities`)がすべてのサンプルに存在すること
6. カテゴリ内に重複したIDがないこと

監査結果:
- **221の良性サンプルが削除**されました(WildChat/UltraChatの取り込みから漏れたインジェクションパターンを含むため)
- **2つの攻撃サンプルが削除**されました(LLMail-Inject Phase 1からの実際のOpenAI APIキーを含むため)
- **良性データに残っているインジェクションパターンはゼロ**
- **どのサンプルにも実際のシークレットはゼロ**

残っている監査フラグ(意図的であり、エラーではない):
- `EMPTY_TEXT` (5,138サンプル): クロスモーダル攻撃(v1、v4クロスモーダル)で、インジェクションが画像/文書/音声フィールドにあり、テキストフィールドが意図的に空または良性であるもの。これはクロスモーダル脅威モデルです。
- `POSSIBLY_BENIGN_ATTACK` (1,359サンプル): 単体では無害に見えるが、コンテキストで安全でないビデオ生成を要求する短いT2VSafetyBenchプロンプト。

### 品質管理

- **重複排除:** 良性テキストプールには重複テキストは0個です(完全一致文字列で検証済み)。新しいクロスモーダル良性サンプルは、完全キーの重複タプル(text, image_type, image_content, doc_type, doc_content, audio_method, audio_content)がチェックされます。元のv1ビルドから、`multimodal_image_document.json`に1つの既知の既存重複クラスター(1,340エントリ)が確認されています。これは`benign/summary.json`に文書化されており、既存のIDは変更されていません。
- **プール/攻撃テキストの重複:** 良性プールのテキストが攻撃ペイロードテキストとして逐語的に現れることはありません。
- **ソースのトレーサビリティ:** すべての攻撃サンプルには、その学術的または産業的な起源を指す `attack_source` および `attack_reference` フィールドがあります。これらはJSONスキーマのクエリ可能なフィールドです。
- **再現可能性:** すべてのサンプルは固定された乱数シード(seed=42)から決定論的に生成されます。ジェネレータースクリプトが含まれており、再実行時に公開されたペイロードを正確に生成します。

### 関連データセットとの比較

| データセット | サンプル数 | モダリティ | ソースベース | 本データセットに対する主なギャップ |
|---------|---------|-----------|-------------|------------------------|
| [deepset/prompt-injections](https://huggingface.co/datasets/deepset/prompt-injections) | ~500 | テキスト | コミュニティ収集 | 単一モダリティ、カテゴリカバレッジが狭い |
| [jackhhao/jailbreak-classification](https://huggingface.co/datasets/jackhhao/jailbreak-classification) | ~2,600 | テキスト | Reddit/コミュニティジェイルブレイク | ジェイルブレイクのみ、間接的/エージェント的/クロスモーダルなし |
| [rubend18/ChatGPT-Jailbreak-Prompts](https://huggingface.co/datasets/rubend18/ChatGPT-Jailbreak-Prompts) | ~79 | テキスト | コミュニティジェイルブレイク | 非常に小規模、良性分割なし |
| [Tensor Trust](https://arxiv.org/abs/2311.01011) | 126K | テキスト | 敵対的ゲーム(攻撃 vs 防御) | 攻撃/防御フレーミング、インジェクション vs 良性の二値ではない |
| [HackAPrompt](https://arxiv.org/abs/2311.16119) | 600K+ | テキスト | コンペティションエントリ | コンペティション固有の目的、マルチモーダル配信なし |
| [InjectAgent](https://arxiv.org/abs/2403.02691) | 1,054 | テキスト | エージェントツール呼び出しシナリオ | エージェント/ツール焦点のみ、クロスモーダルなし |
| **本データセット** | **503,358** | **テキスト、画像、文書、音声、ビデオ** | 査読付き論文 + 産業研究 + CVEレポート + コンペティションデータセット | 上記すべて + 2025-2026フロンティアカテゴリ + 201K外部ペイロード + 監査済み1:1均衡良性 |

このデータセットは、クロスモーダル配信、エージェント的攻撃カテゴリ(コンピュータ使用、MCP、メモリポイズニング、マルチエージェント感染、推論ハイジャック)、2025-2026フロンティア攻撃(推論DoS、ビデオ生成ジェイルブレイク、VLAロボティックインジェクション、LoRAサプライチェーンポイズニング、音声ネイティブLLMジェイルブレイク、シリアライゼーションバウンダリーRCE、エージェントスキルサプライチェーン)、および大規模なバランスの取れた良性分割をカバーする、唯一の公開プロンプトインジェクションデータセットです。

### 既知の制限事項

- **マルチモーダル攻撃のテキストベース表現:** `image_content`、`doc_content`、`audio_content` フィールドはパーサーが抽出するものを表しており、実際の画像、文書、音声のバイナリファイルではありません。このデータセットで学習された検出器は、ピクセルレベルのパターンや音響パターンではなく、インジェクションのテキスト信号を学習します。
- **手作業によるシード:** v3およびv4カテゴリのシードはデータセットの著者によって作成され、実際の攻撃インフラから収集されたものではありません。これらは公開された研究から文書化されたパターンに従っていますが、実際の表面のバリエーションすべてを捉えているとは限りません。クロスモーダル拡張はカバレッジを拡大しますが、シードセットを超えた意味的多様性は追加しません。
- **静的良性プール:** 良性テキストプールはAlpaca(指示追従)とWildChat(実際のChatGPTユーザー)から抽出されており、英語と比較的短いプロンプトに偏っています。非英語の良性プロンプトのカバレッジは限られています。
- **評価者間信頼性の指標なし:** ラベルは構築によって割り当てられます。個々のサンプルの人間による注釈はなく、したがって評価者間一致スコアもありません。
- **ASR数値はソース論文から:** ドキュメンテーションで引用されている攻撃成功率の数値は、公開時のモデルに対してテストした元の論文からのものです。現在のフロンティアモデル(GPT-4o、Claude 3.7、Gemini 2.0)に対する数値は異なる可能性があります。
- **v4カテゴリの数は少ない:** 14のv4シードカテゴリは、クロスモーダル拡張前で平均20サンプルです。クロスモーダル拡張によりv4のサンプル総数は増加しますが、意味的多様性は追加されません。特にv4カテゴリでファインチューニングする実務者は、これを留意すべきです。

---

## データセットバージョン
ツールをダウンロード