Skip to content
KitploitKITPLOIT
도구익스플로잇블로그
Log in
제출
도구익스플로잇블로그
제출

해킹, 침투 테스트 및 사이버 보안 도구를 당신의 보안 무기고에!

Kitploit은 해킹, 사이버 보안 및 침투 테스트 도구 디렉토리입니다. 최신 프로젝트 업데이트를 발견하여 취약점을 찾고, 시스템을 분석하고, 테스트를 자동화하고, 보안을 강화하세요.

··피드·문의·개인정보·© 2026 Kitploit

도구 디렉토리

카테고리

모든 카테고리 보기
Loading categories
bordair-multimodal — 오픈소스 크로스 모달 및 멀티모달 프롬프트 인젝션 테스트 스위트. 텍스트, 이미지, 문서, 오디오 모달리티 전반에 걸친 250,000개 이상의 공격 페이로드. OWASP LLM Top 10, CrossInject (ACM MM 2025), FigStep (AAAI 2025), DolphinAttack 및 CSA 2026 연구를 기반으로 함. | Kitploit
도구/GitHubGitHub/josh-blythe/bordair-multimodal
Web SecurityPenetration TestingMachine LearningPapers & ResearchLearning & EducationCurated ResourcesAI SecurityAdversarial Attack
GitHub
josh-blythe/bordair-multimodal

bordair-multimodal

오픈소스 크로스 모달 및 멀티모달 프롬프트 인젝션 테스트 스위트. 텍스트, 이미지, 문서, 오디오 모달리티 전반에 걸친 250,000개 이상의 공격 페이로드. OWASP LLM Top 10, CrossInject (ACM MM 2025), FigStep (AAAI 2025), DolphinAttack 및 CSA 2026 연구를 기반으로 함.

저장소 보기웹사이트
6812172개월 전Kitploit 검토 완료

인기

모두 보기 →

커뮤니티에서 가장 많이 사용되는 도구를 찾아보세요.

모든 도구 탐색

도구 컬렉션을 둘러보세요

모든 도구 보기 →
공유

멀티모달 프롬프트 인젝션 데이터셋

레이블이 지정된 516,588개 샘플(공격 251,782개 + 정상 251,576개, 그리고 13,230개 샘플의 실사용 검증 분할 포함)은 5가지 데이터셋 버전과 외부 데이터셋 수집에 걸쳐 있으며, AI 시스템에 대한 교차 모달, 다중 턴, 적대적 접미사, 탈옥 템플릿, 간접 인젝션, 도구 조작, 에이전트 기반, 회피, 추론 DoS, 비디오 생성, VLA 로보틱, LoRA 공급망, 오디오 네이티브 LLM, RAG 최적화, MCP 크로스 서버, 코딩 에이전트, 직렬화 경계 및 에이전트 스킬 공급망 공격을 다룹니다. 공격 및 정상 샘플은 1:1로 균형을 이룹니다(감사 정리 후 비율 0.9992:1).

프롬프트 인젝션 탐지기의 학습 및 평가를 위해 제작되었습니다. 모든 샘플에는 레이블(expected_detection: true/false)이 지정되어 있고, 출처는 동료 검토 논문 또는 문서화된 업계 연구로 귀속되며, 이진 분류기에 직접 사용할 수 있도록 구조화되어 있습니다.


데이터셋 로드

페이로드는 일반 JSON입니다. 사용 중인 언어의 표준 라이브러리로 직접 로드하세요 — 종속성 없음:```python import json, pathlib records = [] for p in pathlib.Path("payloads_v5").glob("*.json"): records.extend(json.loads(p.read_text())) print(f"{len(records)} labeled samples")

모든 레코드는 `expected_detection: true|false`, `attack_category` 문자열, 그리고 원본 논문이나 문서화된 사고를 가리키는 `source` 필드를 담고 있습니다. 이는 이진 분류기 학습, 카테고리별 ASR 실행, 또는 공격 벡터별 분할에 충분합니다.

---

## 방법론

### 이 데이터셋이 다루는 범위

**프롬프트 인젝션**은 여기서 다음과 같이 정의됩니다: *운영자가 지정한 작업에서 모델의 동작을 무시(override)하거나, 가로채거나(hijack), 방향을 바꾸도록(redirect) 의도된 LLM 입력에 내장된 텍스트*. 이 정의는 Greshake et al. 2023 (arXiv:2302.12173) 및 OWASP LLM01:2025를 따릅니다.

범위는 **런타임 인젝션 전용**입니다 -- 공격자가 추론 시점에 모델의 컨텍스트 창에 넣을 수 있는 텍스트를 의미합니다. 이 데이터셋은 의도적으로 다음을 제외합니다:

- 학습 시점 공격 (데이터 포이즈닝, 슬리퍼 에이전트, 백도어 파인튜닝)
- 인젝션 구성 요소가 없는 모델 추출 공격
- 특정 LLM 작업을 가로채지 않고 유해한 생성을 요청하는 순수 제일브레이크 (예: 오버라이드 프레이밍 없이 표현된 "폭탄 만드는 방법을 알려줘")
- LLM을 대상으로 하지 않는 일반적인 사회공학 공격

이 구분은 탐지에 중요합니다: 런타임 탐지기는 모델 가중치가 아니라 프롬프트를 읽습니다. 학습에만 영향을 미치는 공격은 범위 밖입니다.

### 구축 방법

이 데이터셋은 네 개의 레이어로 구축되었습니다:

**레이어 1 -- 시드 페이로드 (수작업, 210 + 187 + 284개 시드):** 각 공격 카테고리의 인젝션 시드는 피어 리뷰 논문과 문서화된 실제 사고에 근거하여 수작업으로 작성되었습니다. 모든 시드에는 학술 출처와 공격 참조가 태그로 부착됩니다. 시드는 위의 포함 정의에 따라 검토되었으며 -- 오버라이드 구성 요소 없이 정상 요청으로 다시 읽힐 수 있는 시드는 폐기되거나 재작성되었습니다.

**레이어 2 -- 템플릿 및 인코딩을 통한 프로그램적 확장 (v2, 14,358개 샘플):** 시드는 PyRIT v0.12.1의 162개 제일브레이크 템플릿과 13개 인코딩 변환기를 통과했습니다. 템플릿 확장은 생성기 스크립트에서 완전히 결정적이며 재현 가능합니다. GCG 적대적 접미사는 발표된 문헌(Zou et al. 2023)에서 가져와 시드에 추가되었습니다. 라이브 그래디언트 최적화는 선택 사항이며 GPU가 필요합니다.

**레이어 3 -- 크로스모달 전달 (v1 + v4 크로스모달, 35,687개 샘플):** 인젝션 시드는 7가지 이미지 방식, 4가지 문서 유형 x 5가지 은닉 위치, 6가지 오디오 방식, 그리고 다중 모달리티 조합으로 전달되었습니다. 이는 FigStep (arXiv:2311.05608) 및 CrossInject (arXiv:2504.14348)의 위협 모델을 따릅니다: 인젝션 텍스트는 텍스트 필드뿐만 아니라 파이프라인이 처리하는 모든 모달리티를 통해 도달할 수 있습니다. 모달리티 필드(`image_content`, `doc_content`, `audio_content`)는 모델의 추출기가 해당 채널에서 읽게 될 내용을 기록합니다.

**레이어 4 -- 정상 샘플 (총 50,516개):** 정상 프롬프트는 발표된 학술 및 산업 데이터셋(Stanford Alpaca, WildChat, deepset/prompt-injections, LMSYS Chatbot Arena)에서 가져왔습니다. 정상 멀티모달 샘플은 이러한 텍스트 프롬프트를 실제 이미지 캡션(MS-COCO 2017, Flickr30k), 문서 구절(Wikipedia EN, RedPajama 경유 arXiv), 오디오 트랜스크립트(LibriSpeech, Mozilla Common Voice)와 짝지었습니다. 130개의 수작업 엣지 케이스 세트는 "ignore", "override", "system prompt", "password" 같은 공격 인접 어휘를 진정한 정상 맥락에서 사용하여 오탐 학습을 줄입니다.

**레이어 5 -- 실사용 검증 분할 (13,230개 샘플):** 레이어 1-4는 구성된 데이터입니다: 수작업, 템플릿화, 또는 다른 데이터셋에서 가져온 것입니다. 레이어 5는 그렇지 않습니다. 레이어 5는 배포된 탐지기를 돌파하면 점수를 얻는 라이브 게임에서 수집되었으며, 보스급 "castle" 스테이지와 멀티모달 "ghost" 패스로 티어가 나뉩니다. 성공 및 시도된 모든 우회가 기록된 후 익명화되어(식별자와 결제 데이터는 테이블 수준에서 제거, 텍스트 내 PII는 편집, 고위험 행은 게시 대신 수동 검토를 위해 격리) [`payloads_live/`](https://github.com/josh-blythe/bordair-multimodal/blob/main/payloads_live)로 공개되었습니다. 레이어 1-4가 알려진 공격 클래스에 대한 커버리지를 측정하는 반면, 레이어 5는 탐지기가 이를 깨려는 동기 부여된 인간에게 견디는지 측정합니다. 전체 익명화 방법론은 [`payloads_live/README.md`](https://github.com/josh-blythe/bordair-multimodal/blob/main/payloads_live/README.md)를 참조하십시오.

### 레이블 할당

모든 공격 페이로드: `expected_detection: true`  
모든 정상 샘플: `expected_detection: false`

레이블은 개별 샘플의 인간 검토가 아니라 구축 방식에 따라 할당됩니다. 따라서 정확성 보장은 **카테고리 수준**에 있습니다: 각 카테고리는 특정 메커니즘을 가진 문서화된 공격 클래스에 매핑됩니다. 개별 샘플은 자신이 생성된 시드와 카테고리에서 레이블을 상속받습니다.

의도적으로 도입된 적대적 레이블 노이즈는 없습니다. 탐지기는 "진짜"와 "가짜" 인젝션을 구별하는 것이 아니라 인젝션 패턴을 학습할 것으로 기대됩니다 -- 공격 세트의 모든 샘플은 실제 또는 그럴듯한 공격 문자열을 나타냅니다.

### 정상 샘플의 오탐 위험

엣지 케이스 정상 세트는 보안 관련 언어에 대한 오탐을 줄이기 위해 설계되었습니다. 10개의 어휘 클러스터를 다룹니다: `ignore`, `override`, `system prompt`, `password`, `instructions`, `jailbreak` (아이폰 탈옥 의미), `bypass surgery`, `XSS` (공격이 아닌 보안 주제), `prompt` (카메라 셔터의 의미), `inject` (의존성 주입/의료 의미). 전체 데이터셋에서는 높은 정밀도를 보이지만 엣지 케이스 세트에서는 낮은 정밀도를 보이는 탐지기는 표면적 키워드 매칭에 과적합된 것입니다.

### 데이터셋 감사

전체 데이터셋은 레이블 정확성과 오염 여부에 대해 감사되었습니다. 감사 항목은 다음과 같습니다:

1. 모든 공격 샘플에 `expected_detection: true`가 있는지
2. 모든 정상 샘플에 `expected_detection: false`가 있는지
3. 정상 샘플에 인젝션 패턴(예: "ignore previous instructions", "reveal your system prompt", 외부 유출 URL, `<|im_start|>` 토큰)이 없는지
4. 어떤 샘플에도 실제 API 키나 자격 증명이 없는지 (OpenAI sk- 키, AWS AKIA 키, GitHub PAT 등)
5. 모든 샘플에 필수 필드(`id`, `text`, `expected_detection`, `modalities`)가 있는지
6. 카테고리 내 중복 ID가 없는지

감사 결과:
- 인젝션 패턴을 포함한 **정상 샘플 221개 제거됨** (WildChat/UltraChat 수집 과정에서 유출됨)
- 실제 OpenAI API 키를 포함한 **공격 샘플 2개 제거됨** (LLMail-Inject Phase 1에서)
- **정상 데이터에 남은 인젝션 패턴 0개**
- **모든 샘플에서 실제 비밀 0개**

남은 감사 플래그 (의도적이며 오류가 아님):
- `EMPTY_TEXT` (5,138개 샘플): 인젝션이 이미지/문서/오디오 필드에 있고 텍스트 필드가 의도적으로 비어 있거나 정상인 크로스모달 공격(v1, v4 크로스모달)입니다. 이것이 크로스모달 위협 모델입니다.
- `POSSIBLY_BENIGN_ATTACK` (1,359개 샘플): 단독으로는 무해해 보이지만 맥락에서는 안전하지 않은 비디오 생성을 요청하는 짧은 T2VSafetyBench 프롬프트입니다.

### 품질 관리

- **중복 제거:** 정상 텍스트 풀에는 중복 텍스트가 0개 있습니다(정확한 문자열 일치로 검증됨). 새로운 크로스모달 정상 샘플은 전체 키 중복 튜플(text, image_type, image_content, doc_type, doc_content, audio_method, audio_content)을 검사합니다. 원래 v1 빌드의 `multimodal_image_document.json`에서 알려진 기존 중복 클러스터 1개(1,340개 항목)가 확인되었으며, 이는 `benign/summary.json`에 문서화되어 있고 기존 ID는 수정되지 않았습니다.
- **풀/공격 텍스트 중복:** 정상 풀 텍스트가 공격 페이로드 텍스트로 문자 그대로 나타나는 경우는 0건입니다.
- **출처 추적성:** 모든 공격 샘플에는 학술 또는 산업 기원을 가리키는 `attack_source` 및 `attack_reference` 필드가 있습니다. 이는 JSON 스키마에서 쿼리 가능한 필드입니다.
- **재현성:** 모든 샘플은 고정된 랜덤 시드(seed=42)에서 결정적으로 생성됩니다. 생성기 스크립트가 포함되어 있으며 다시 실행하면 정확히 동일한 게시 페이로드를 생성합니다.

### 관련 데이터셋과의 비교

| 데이터셋 | 샘플 수 | 모달리티 | 출처 기반 | 이 데이터셋 대비 주요 한계 |
|---------|---------|-----------|-------------|------------------------|
| [deepset/prompt-injections](https://huggingface.co/datasets/deepset/prompt-injections) | ~500 | text | 커뮤니티 수집 | 단일 모달리티, 좁은 카테고리 커버리지 |
| [jackhhao/jailbreak-classification](https://huggingface.co/datasets/jackhhao/jailbreak-classification) | ~2,600 | text | Reddit/커뮤니티 제일브레이크 | 제일브레이크만 포함, 간접/에이전틱/크로스모달 없음 |
| [rubend18/ChatGPT-Jailbreak-Prompts](https://huggingface.co/datasets/rubend18/ChatGPT-Jailbreak-Prompts) | ~79 | text | 커뮤니티 제일브레이크 | 매우 작음, 정상 분할 없음 |
| [Tensor Trust](https://arxiv.org/abs/2311.01011) | 126K | text | 적대적 게임 (공격 vs 방어) | 공격/방어 프레이밍, 인젝션 vs 정상 이진 분류가 아님 |
| [HackAPrompt](https://arxiv.org/abs/2311.16119) | 600K+ | text | 대회 참가작 | 대회 특화 목표, 멀티모달 전달 없음 |
| [InjectAgent](https://arxiv.org/abs/2403.02691) | 1,054 | text | 에이전트 도구 호출 시나리오 | 에이전트/도구 중심만, 크로스모달 없음 |
| **이 데이터셋** | **503,358** | **text, image, document, audio, video** | 피어 리뷰 논문 + 산업 연구 + CVE 보고서 + 대회 데이터셋 | 위의 모든 항목 + 2025-2026 프론티어 카테고리 + 201K 외부 페이로드 + 감사된 1:1 균형 정상 샘플 |

이 데이터셋은 크로스모달 전달, 에이전틱 공격 카테고리(컴퓨터 사용, MCP, 메모리 포이즈닝, 멀티 에이전트 전염, 추론 하이재킹), 2025-2026 프론티어 공격(추론 DoS, 비디오 생성 제일브레이킹, VLA 로봇 인젝션, LoRA 공급망 포이즈닝, 오디오 네이티브 LLM 제일브레이크, 직렬화 경계 RCE, 에이전트 스킬 공급망), 그리고 대규모 균형 잡힌 정상 분할을 모두 다루는 유일한 공개 프롬프트 인젝션 데이터셋입니다.

### 알려진 한계

- **멀티모달 공격의 텍스트 기반 표현:** `image_content`, `doc_content`, `audio_content` 필드는 파서가 추출할 내용을 나타냅니다 -- 실제 이미지, 문서, 또는 오디오 바이너리 파일이 아닙니다. 이 데이터셋으로 훈련된 탐지기는 픽셀 수준 또는 음향 패턴이 아닌 인젝션의 텍스트 신호를 학습합니다.
- **수작업 시드:** v3 및 v4 카테고리의 시드는 실제 공격자 인프라에서 수집된 것이 아니라 데이터셋 작성자가 작성했습니다. 이는 발표된 연구의 문서화된 패턴을 따르지만 모든 실제 표면 변형을 포착하지는 못할 수 있습니다. 크로스모달 확장은 커버리지를 증폭하지만 시드 세트 이상의 의미적 다양성을 추가하지는 않습니다.
- **정적 정상 풀:** 정상 텍스트 풀은 Alpaca(지시 추종)와 WildChat(실제 ChatGPT 사용자)에서 가져온 것으로, 영어와 비교적 짧은 프롬프트에 치우쳐 있습니다. 비영어 정상 프롬프트의 커버리지는 제한적입니다.
- **평가자 간 신뢰도 측정 없음:** 레이블은 구축 방식에 따라 할당됩니다. 개별 샘플에 대한 인간 주석이 없으므로 주석자 간 일치도 점수도 없습니다.
- **ASR 수치는 출처 논문 기준:** 문서에 인용된 공격 성공률 수치는 출판 당시 최신 모델을 대상으로 테스트한 원본 논문에서 가져온 것입니다. 최신 프론티어 모델(GPT-4o, Claude 3.7, Gemini 2.0)에 대한 수치는 다를 수 있습니다.
- **v4 카테고리 수가 적음:** 14개 v4 시드 카테고리는 크로스모달 확장 전에 각각 평균 20개 샘플입니다. 크로스모달 확장은 v4 총 샘플 수를 늘리지만 의미적 다양성을 추가하지는 않습니다. v4 카테고리를 대상으로 파인튜닝하는 실무자는 이 점을 유의해야 합니다.

---

## 데이터셋 버전
도구 다운로드