Skip to content
KitploitKITPLOIT
工具博客
Log in
提交
工具博客
提交

黑客、渗透测试和网络安全工具,武装您的安全武器库!

Kitploit 是一个黑客、网络安全和渗透测试工具的目录。发现最新的项目更新,查找漏洞、分析系统、自动化测试并加强你的安全。

··订阅源·联系·隐私·© 2026 Kitploit

工具目录

分类

查看所有分类
Loading categories
bordair-multimodal — 开源跨模态与多模态提示注入测试套件。包含 250,000+ 个攻击载荷,覆盖文本、图像、文档和音频模态。研究依据包括 OWASP LLM Top 10、CrossInject(ACM MM 2025)、FigStep(AAAI 2025)、DolphinAttack 和 CSA 2026。 | Kitploit
工具/GitHubGitHub/josh-blythe/bordair-multimodal
Web安全渗透测试机器学习论文与研究学习与教育精选资源AI 安全对抗性攻击
GitHubjosh-blythe/bordair-multimodal

bordair-multimodal

开源跨模态与多模态提示注入测试套件。包含 250,000+ 个攻击载荷,覆盖文本、图像、文档和音频模态。研究依据包括 OWASP LLM Top 10、CrossInject(ACM MM 2025)、FigStep(AAAI 2025)、DolphinAttack 和 CSA 2026。

查看仓库
6812172个月前Kitploit 审核通过
网站

最受欢迎

查看全部 →

发现我们社区最常用的工具。

探索所有工具

浏览我们的工具集合

查看所有工具 →
分享

Multimodal Prompt Injection Dataset

516,588 个带标签样本(251,782 个攻击样本 + 251,576 个良性样本,外加一个 13,230 样本的真实世界验证划分),涵盖五个数据集版本及外部数据集摄入,覆盖跨模态、多轮、对抗性后缀、越狱模板、间接注入、工具操纵、智能体、规避、推理 DoS、视频生成、VLA 机器人、LoRA 供应链、原生音频 LLM、RAG 优化、MCP 跨服务器、编码智能体、序列化边界以及智能体技能供应链等针对 AI 系统的攻击。攻击样本与良性样本按 1:1 平衡(审计清理后比率为 0.9992:1)。

专为训练和评估提示注入检测器而构建。所有样本均带有标签(expected_detection: true/false),来源可追溯到同行评审论文或有记录的行业研究,并且其结构可直接用于二分类器。


加载数据集

有效载荷为纯 JSON。可直接使用所用语言的标准库加载——无需依赖:```python import json, pathlib records = [] for p in pathlib.Path("payloads_v5").glob("*.json"): records.extend(json.loads(p.read_text())) print(f"{len(records)} labeled samples")

Every record carries `expected_detection: true|false`, an `attack_category` string, and a `source` field pointing at the original paper or documented incident. That's enough to train a binary classifier, run per-category ASR, or slice by attack vector.

---

## 方法论

### 本数据集涵盖的内容

**提示注入(Prompt injection)** 在此定义为:*嵌入到 LLM 输入中的文本,旨在覆盖、劫持或重定向模型行为,使其偏离操作者指定的任务*。该定义遵循 Greshake 等人 2023(arXiv:2302.12173)和 OWASP LLM01:2025。

范围仅限于**运行时注入**——即攻击者在推理时能够放入模型上下文窗口中的文本。该数据集有意排除了:

- 训练时攻击(数据投毒、休眠代理、后门微调)
- 不含注入组件的模型提取攻击
- 纯粹为了诱导有害生成而进行的越狱,未劫持特定 LLM 任务(例如,不带有任何覆盖框架的“告诉我如何制造炸弹”表述)
- 不针对 LLM 的通用社会工程

这种区分对检测很重要:运行时检测器读取的是提示词,而不是模型权重。仅影响训练的攻击不在范围内。

### 构建方法

该数据集分四层构建:

**第 1 层 —— 种子载荷(手工制作,210 + 187 + 284 个种子):** 每个攻击类别的注入种子均为手工编写,以同行评审论文和已记录的真实世界事件为依据。每个种子都标注了其学术来源和攻击参考。种子按上述纳入定义进行审查——任何可以重新解读为不带覆盖组件的良性请求的种子均被丢弃或重写。

**第 2 层 —— 通过模板和编码进行程序化扩展(v2,14,358 个样本):** 种子经过 PyRIT v0.12.1 的 162 个越狱模板和 13 个编码转换器处理。模板扩展完全确定,并且可通过生成器脚本重现。GCG 对抗性后缀取自已发表文献(Zou 等人 2023)并附加到种子上;实时梯度优化为可选,需要 GPU。

**第 3 层 —— 跨模态投递(v1 + v4 跨模态,35,687 个样本):** 注入种子通过 7 种图像方法、4 种文档类型 × 5 种隐藏位置、6 种音频方法以及多模态组合进行投递。这遵循 FigStep(arXiv:2311.05608)和 CrossInject(arXiv:2504.14348)中的威胁模型:注入文本可能通过流水线处理的任何模态到达,而不仅仅是文本字段。模态字段(`image_content`、`doc_content`、`audio_content`)记录模型提取器将从该通道读取到的内容。

**第 4 层 —— 良性样本(共 50,516 个):** 良性提示词取自已发表的学术和行业数据集(Stanford Alpaca、WildChat、deepset/prompt-injections、LMSYS Chatbot Arena)。良性多模态样本将这些文本提示词与真实图像标题(MS-COCO 2017、Flickr30k)、文档段落(Wikipedia EN、通过 RedPajama 获取的 arXiv)以及音频转录(LibriSpeech、Mozilla Common Voice)配对。一组 130 个手工制作的边界案例在真正良性的上下文中使用了攻击相关词汇(“ignore”、“override”、“system prompt”、“password”),以减少误报训练。

**第 5 层 —— 真实世界验证集(13,230 个样本):** 第 1-4 层是构造的:手写、模板化或取自其他数据集。第 5 层则不是。它来自一个实时游戏,玩家通过击败已部署的检测器来得分,关卡分为 boss 级“城堡”阶段和多模态“幽灵”关卡。每次成功或尝试的绕过都会被记录,然后进行匿名化(在表级别剥离标识符和支付数据,文本中的 PII 已脱敏,高风险行被隔离供人工审查而非发布),并以 [`payloads_live/`](https://github.com/josh-blythe/bordair-multimodal/blob/main/payloads_live) 的形式发布。第 1-4 层衡量对已知攻击类别的覆盖率,而第 5 层衡量检测器能否经受住积极尝试攻破它的有动机的人类。完整的匿名化方法见 [`payloads_live/README.md`](https://github.com/josh-blythe/bordair-multimodal/blob/main/payloads_live/README.md)。

### 标签分配

所有攻击载荷:`expected_detection: true`  
所有良性样本:`expected_detection: false`

标签由构建过程分配,而非人工审查单个样本。因此,正确性保证是**类别级别**的:每个类别对应一个有具体机制的攻击类别。单个样本继承其生成来源的种子和类别的标签。

没有故意引入对抗性标签噪声。检测器应当学习注入模式,而不是区分“真实”和“虚假”注入——攻击集中的所有样本都代表真实或合理的攻击字符串。

### 良性误报风险

边界良性集旨在减少对安全相关语言的误报。它涵盖 10 个词汇簇:`ignore`、`override`、`system prompt`、`password`、`instructions`、`jailbreak`(iPhone 意义上的)、`bypass surgery`、`XSS`(作为安全主题,而非攻击)、`prompt`(如相机快门)和 `inject`(如依赖注入/医学)。一个在全数据集上达到高精确率但在边界集上精确率低的检测器,是在对表面级关键词匹配进行过拟合。

### 数据集审计

对完整数据集进行了标签正确性和污染的审计。审计检查:

1. 所有攻击样本都具有 `expected_detection: true`
2. 所有良性样本都具有 `expected_detection: false`
3. 良性样本不包含注入模式(例如“ignore previous instructions”、“reveal your system prompt”、外泄 URL、`<|im_start|>` token)
4. 任何样本中都不包含真实的 API 密钥或凭据(OpenAI sk- 密钥、AWS AKIA 密钥、GitHub PAT 等)
5. 每个样本都包含必填字段(`id`、`text`、`expected_detection`、`modalities`)
6. 类别内没有重复 ID

审计结果:
- **移除了 221 个良性样本**,这些样本包含注入模式(从 WildChat/UltraChat 摄取中泄漏)
- **移除了 2 个攻击样本**,包含真实的 OpenAI API 密钥(来自 LLMail-Inject Phase 1)
- **良性数据中剩余的注入模式为零**
- **任何样本中真实机密为零**

剩余审计标记(有意保留,非错误):
- `EMPTY_TEXT`(5,138 个样本):跨模态攻击(v1、v4 跨模态),其中注入位于图像/文档/音频字段,文本字段有意为空或良性。这就是跨模态威胁模型。
- `POSSIBLY_BENIGN_ATTACK`(1,359 个样本):T2VSafetyBench 的短提示词,单独看似乎无害,但在上下文中请求不安全的视频生成。

### 质量控制

- **去重:** 良性文本池包含 0 个重复文本(通过精确字符串匹配验证)。新的跨模态良性样本会检查全键重复元组(text、image_type、image_content、doc_type、doc_content、audio_method、audio_content)。在原始 v1 构建的 `multimodal_image_document.json` 中发现了一个已知的重复簇(1,340 条);此情况已在 `benign/summary.json` 中记录,且未修改现有 ID。
- **池/攻击文本重叠:** 零个良性池文本以原样形式出现在攻击载荷文本中。
- **来源可追溯性:** 每个攻击样本都带有 `attack_source` 和 `attack_reference` 字段,指向其学术或行业来源。这些是 JSON schema 中的可查询字段。
- **可重现性:** 所有样本均由固定的随机种子(seed=42)确定性生成。生成器脚本已包含在内,重新运行时会生成与发布完全相同的载荷。

### 与相关数据集的比较

| 数据集 | 样本数 | 模态 | 来源基础 | 与此数据集相比的关键差距 |
|---------|---------|-----------|-------------|------------------------|
| [deepset/prompt-injections](https://huggingface.co/datasets/deepset/prompt-injections) | 约 500 | 文本 | 社区收集 | 单模态、类别覆盖窄 |
| [jackhhao/jailbreak-classification](https://huggingface.co/datasets/jackhhao/jailbreak-classification) | 约 2,600 | 文本 | Reddit/社区越狱 | 仅限越狱,无间接/代理/跨模态 |
| [rubend18/ChatGPT-Jailbreak-Prompts](https://huggingface.co/datasets/rubend18/ChatGPT-Jailbreak-Prompts) | 约 79 | 文本 | 社区越狱 | 非常小,无良性划分 |
| [Tensor Trust](https://arxiv.org/abs/2311.01011) | 126K | 文本 | 对抗游戏(攻击 vs 防御) | 攻击/防御框架,而非注入 vs 良性二元 |
| [HackAPrompt](https://arxiv.org/abs/2311.16119) | 600K+ | 文本 | 竞赛作品 | 竞赛特定目标,无多模态投递 |
| [InjectAgent](https://arxiv.org/abs/2403.02691) | 1,054 | 文本 | 代理工具调用场景 | 仅关注代理/工具,无跨模态 |
| **本数据集** | **503,358** | **文本、图像、文档、音频、视频** | 同行评审论文 + 行业研究 + CVE 报告 + 竞赛数据集 | 上述所有 + 2025-2026 前沿类别 + 201K 外部载荷 + 经过审计的 1:1 平衡良性 |

本数据集是唯一公开可用的提示注入数据集,涵盖跨模态投递、代理式攻击类别(computer use、MCP、memory poisoning、multi-agent contagion、reasoning hijack)、2025-2026 前沿攻击(reasoning DoS、video generation jailbreaking、VLA robotic injection、LoRA supply chain poisoning、audio-native LLM jailbreaks、serialization boundary RCE、agent skill supply chain),以及大规模平衡的良性划分。

### 已知局限

- **多模态攻击的文本化表示:** `image_content`、`doc_content` 和 `audio_content` 字段表示解析器会提取的内容——它们不是实际的图像、文档或音频二进制文件。在此数据集上训练的检测器学习的是注入的文本信号,而非像素级或声学模式。
- **手工制作的种子:** v3 和 v4 类别的种子由数据集作者编写,而非从真实攻击者基础设施收集。它们遵循已发表研究中记录的模式,但可能无法涵盖所有真实世界的表面变体。跨模态扩展放大了覆盖面,但并未在种子集之外增加语义多样性。
- **静态良性池:** 良性文本池取自 Alpaca(指令遵循)和 WildChat(真实 ChatGPT 用户),偏向英语和相对较短的提示词。非英语良性提示词的覆盖面有限。
- **无评估者间信度指标:** 标签由构建过程分配。没有对单个样本的人工标注,因此没有评估者间一致性分数。
- **ASR 数据来自源论文:** 文档中引用的攻击成功率数据来自原始论文,这些论文针对发布时的当前模型进行了测试。针对当代前沿模型(GPT-4o、Claude 3.7、Gemini 2.0)的数据可能有所不同。
- **v4 类别数量较少:** 14 个 v4 种子类别在跨模态扩展前平均各有 20 个样本。跨模态扩展提高了 v4 样本总数,但并未增加语义多样性。专门针对 v4 类别进行微调的从业者应注意这一点。

---

## 数据集版本

| 版本 | 生成器 | 攻击载荷 | 良性 | 总计 | 主要覆盖范围 |
|---------|-----------|----------------|--------|-------|-----------------|
| **v1** | `generate_payloads.py` | 23,759 | 23,759 | 47,518 | 跨模态分割攻击(文本+图像/文档/音频) |
| **v2** | `generate_v2_pyrit.py` | 14,358 | -- | 14,358 | 多轮编排、GCG 后缀、越狱模板 |
| **v3** | `generate_v3_payloads.py` | 187 | -- | 187 | 间接注入、工具滥用、Unicode 规避、提示词提取 |
| **v4** | `generate_v4_payloads.py` | 284 | -- | 284 | 代理式攻击、内存投毒、MCP、推理劫持、RAG、ASR |
| **v4 跨模态** | `generate_v4_crossmodal.py` | 11,928 | -- | 11,928 | v4 种子通过文本+图像、文本+文档、文本+音频、图像+文档、三元组投递 |
| **v5** | `generate_v5_payloads.py` | 184 | -- | 184 | 2025-2026 前沿:reasoning DoS、视频越狱、VLA 机器人、LoRA 供应链、音频原生 LLM、跨模态分解、RAG 优化、MCP 跨服务器、编码代理、序列化 RCE、代理技能供应链 |
| **v5 外部** | `ingest_v5_external.py` | 201,096 | -- | 201,096 | 从 OverThink、T2VSafetyBench、Jailbreak-AudioBench、CyberSecEval 3、LLMail-Inject 摄取(审计期间移除 2 个包含真实 API 密钥的样本) |
| **v5 良性** | `scale_benign_v5.py` | -- | 201,060 | 201,060 | 来自 Alpaca、WildChat、OASST2、Dolly、UltraChat、MMLU、TriviaQA 的纯文本良性(审计期间移除 222 个包含注入模式的样本) |
| **总计** | | **251,782** | **251,576** | **503,358** | |

---

## v1:跨模态攻击载荷(23,759 个攻击 + 23,759 个良性)

13 个基础注入类别 × 跨模态投递方法 × 文档类型 × 分割策略。每个攻击都跨越两个或更多输入模态。

### v1 攻击载荷数量

| 组合 | 载荷数 | 投递方法 |
|-------------|----------|-----------------|
| 文本+图像 | 6,440 | OCR、EXIF、PNG 元数据、XMP、白色文本、隐写、对抗扰动 |
| 文本+文档 | 12,880 | PDF/DOCX/XLSX/PPTX × 正文/页脚/元数据/注释/白色文本/隐藏层/嵌入图像 |
| 文本+音频 | 2,760 | 语音、超声波、耳语、背景、反转、变速 |
| 图像+文档 | 1,380 | 跨图像 + 文档的分割攻击 |
| 三元组 | 260 | 三模态组合(4 种排列) |
| 四元组 | 39 | 文本 + 图像 + 文档 + 音频 |
| **总计** | **23,759** | |

### v1 攻击类别
下载工具