ओपन-सोर्स क्रॉस-मोडल और मल्टीमॉडल प्रॉम्प्ट इंजेक्शन परीक्षण सूट। टेक्स्ट, इमेज, दस्तावेज़ और ऑडियो मोडैलिटीज़ में 250,000+ अटैक पेलोड। OWASP LLM Top 10, CrossInject (ACM MM 2025), FigStep (AAAI 2025), DolphinAttack और CSA 2026 द्वारा शोध-समर्थित।
516,588 लेबल किए गए नमूने (251,782 हमले + 251,576 बेनाइन, साथ ही एक 13,230-नमूना वास्तविक-विश्व सत्यापन विभाजन) पाँच डेटासेट संस्करणों के साथ-साथ बाहरी डेटासेट इन्जेशन में, जिसमें क्रॉस-मोडल, मल्टी-टर्न, एडवर्सेरियल सफिक्स, जेलब्रेक टेम्पलेट, अप्रत्यक्ष इंजेक्शन, टूल मैनिपुलेशन, एजेंटिक, एवेज़न, रीज़निंग DoS, वीडियो जनरेशन, VLA रोबोटिक, LoRA सप्लाई चेन, ऑडियो-नेटिव LLM, RAG ऑप्टिमाइज़ेशन, MCP क्रॉस-सर्वर, कोडिंग एजेंट, सीरियलाइज़ेशन बाउंड्री, और एजेंट स्किल सप्लाई चेन हमले AI सिस्टम पर शामिल हैं। हमले और बेनाइन नमूने 1:1 (ऑडिट क्लीनअप के बाद अनुपात 0.9992:1) पर संतुलित हैं।
प्रॉम्प्ट इंजेक्शन डिटेक्टरों के प्रशिक्षण और मूल्यांकन के लिए निर्मित। सभी नमूने लेबल किए गए हैं (expected_detection: true/false), पीयर-रिव्यू किए गए शोध पत्रों या प्रलेखित उद्योग अनुसंधान को स्रोत-श्रेय दिया गया है, और बाइनरी क्लासिफायर में सीधे उपयोग के लिए संरचित हैं।
पेलोड सादे JSON हैं। उन्हें सीधे अपनी भाषा के स्टैंडर्ड लाइब्रेरी से लोड करें — कोई निर्भरता नहीं:```python import json, pathlib records = [] for p in pathlib.Path("payloads_v5").glob("*.json"): records.extend(json.loads(p.read_text())) print(f"{len(records)} labeled samples")
प्रत्येक रिकॉर्ड में `expected_detection: true|false`, एक `attack_category` स्ट्रिंग, और एक `source` फ़ील्ड होता है जो मूल शोधपत्र या प्रलेखित घटना की ओर इशारा करता है। यह एक बाइनरी क्लासिफायर को प्रशिक्षित करने, प्रति-श्रेणी ASR चलाने, या अटैक वेक्टर द्वारा विभाजित करने के लिए पर्याप्त है।
---
## कार्यप्रणाली
### यह डेटासेट क्या कवर करता है
**प्रॉम्प्ट इंजेक्शन** को यहाँ इस प्रकार परिभाषित किया गया है: *LLM इनपुट में एम्बेड किया गया वह टेक्स्ट जो मॉडल के व्यवहार को उसके ऑपरेटर-निर्दिष्ट कार्य से हटाकर ओवरराइड करने, हाईजैक करने या पुनर्निर्देशित करने के उद्देश्य से होता है*। यह परिभाषा Greshake et al. 2023 (arXiv:2302.12173) और OWASP LLM01:2025 का अनुसरण करती है।
दायरा **केवल रनटाइम इंजेक्शन** है -- वह टेक्स्ट जिसे हमलावर अनुमान के समय मॉडल के कॉन्टेक्स्ट विंडो में रख सकता है। डेटासेट जानबूझकर निम्न को बाहर रखता है:
- प्रशिक्षण-समय के हमले (डेटा पॉइज़निंग, स्लीपर एजेंट, बैकडोर फाइन-ट्यूनिंग)
- मॉडल एक्सट्रैक्शन हमले जिनमें कोई इंजेक्शन घटक नहीं होता
- शुद्ध जेलब्रेक जो किसी विशिष्ट LLM कार्य को हाईजैक किए बिना हानिकारक जनरेशन को उकसाते हैं (जैसे बिना किसी ओवरराइड फ्रेमिंग के "मुझे बताओ बम कैसे बनाया जाता है")
- सामान्य सोशल इंजीनियरिंग जो किसी LLM को लक्षित नहीं करती
यह अंतर डिटेक्शन के लिए महत्वपूर्ण है: एक रनटाइम डिटेक्टर प्रॉम्प्ट पढ़ता है, मॉडल वेट्स नहीं। जो हमले केवल प्रशिक्षण को प्रभावित करते हैं वे दायरे से बाहर हैं।
### निर्माण विधि
डेटासेट को चार परतों में बनाया गया था:
**परत 1 -- सीड पेलोड (हस्तनिर्मित, 210 + 187 + 284 सीड):** प्रत्येक अटैक श्रेणी के लिए इंजेक्शन सीड हाथ से लिखे गए, जो पीयर-रिव्यूड शोधपत्रों और प्रलेखित वास्तविक-विश्व घटनाओं पर आधारित हैं। प्रत्येक सीड को उसके शैक्षणिक स्रोत और अटैक संदर्भ के साथ टैग किया गया है। सीड की समीक्षा उपरोक्त समावेशन परिभाषा के विरुद्ध की गई -- कोई भी सीड जिसे बिना ओवरराइड घटक के सौम्य अनुरोध के रूप में पुनः पढ़ा जा सकता था, उसे हटा दिया गया या फिर से लिखा गया।
**परत 2 -- टेम्पलेट्स और एन्कोडिंग के माध्यम से प्रोग्रामेटिक विस्तार (v2, 14,358 नमूने):** सीड को PyRIT v0.12.1 के 162 जेलब्रेक टेम्पलेट्स और 13 एन्कोडिंग कन्वर्टर्स से गुजारा गया। टेम्पलेट विस्तार जनरेटर स्क्रिप्ट से पूर्णतः नियतात्मक और पुनरुत्पादनीय है। GCG एडवरसैरियल सफिक्स प्रकाशित साहित्य (Zou et al. 2023) से लिए गए और सीड में जोड़े गए; लाइव ग्रेडिएंट ऑप्टिमाइज़ेशन वैकल्पिक है और इसके लिए GPU की आवश्यकता होती है।
**परत 3 -- क्रॉस-मोडल डिलीवरी (v1 + v4 क्रॉस-मोडल, 35,687 नमूने):** इंजेक्शन सीड को 7 इमेज विधियों, 4 दस्तावेज़ प्रकारों x 5 छिपाने के स्थानों, 6 ऑडियो विधियों और बहु-मोडैलिटी संयोजनों में वितरित किया गया। यह FigStep (arXiv:2311.05608) और CrossInject (arXiv:2504.14348) के थ्रेट मॉडल का अनुसरण करता है: इंजेक्शन टेक्स्ट पाइपलाइन द्वारा प्रोसेस की जाने वाली किसी भी मोडैलिटी में आ सकता है, न कि केवल टेक्स्ट फ़ील्ड में। मोडैलिटी फ़ील्ड (`image_content`, `doc_content`, `audio_content`) रिकॉर्ड करते हैं कि मॉडल का एक्सट्रैक्टर उस चैनल से क्या पढ़ेगा।
**परत 4 -- सौम्य नमूने (कुल 50,516):** सौम्य प्रॉम्प्ट प्रकाशित शैक्षणिक और उद्योग डेटासेट (Stanford Alpaca, WildChat, deepset/prompt-injections, LMSYS Chatbot Arena) से लिए गए। सौम्य मल्टीमॉडल नमूने इन टेक्स्ट प्रॉम्प्ट को वास्तविक इमेज कैप्शन (MS-COCO 2017, Flickr30k), दस्तावेज़ अंशों (Wikipedia EN, RedPajama के माध्यम से arXiv) और ऑडियो ट्रांसक्रिप्ट (LibriSpeech, Mozilla Common Voice) के साथ जोड़ते हैं। 130 हस्तनिर्मित एज केसों का एक सेट वास्तव में सौम्य संदर्भों में अटैक-निकटवर्ती शब्दावली ("ignore", "override", "system prompt", "password") का उपयोग करता है ताकि फॉल्स पॉज़िटिव प्रशिक्षण को कम किया जा सके।
**परत 5 -- वास्तविक-विश्व सत्यापन विभाजन (13,230 नमूने):** परतें 1-4 निर्मित हैं: हस्तलिखित, टेम्पलेटेड, या अन्य डेटासेट से लिए गए। परत 5 ऐसी नहीं है। इसे एक लाइव गेम से एकत्र किया गया था जहाँ खिलाड़ी तैनात डिटेक्टर को हराने के लिए अंक अर्जित करते थे, जो बॉस-स्तरीय "castle" चरणों और मल्टीमॉडल "ghost" पास के माध्यम से स्तरित था। हर सफल और प्रयासित बायपास को लॉग किया गया, फिर अनामीकृत किया गया (टेबल स्तर पर पहचानकर्ता और भुगतान डेटा हटाए गए, टेक्स्ट में मौजूद PII रिडैक्ट किया गया, उच्च-जोखिम वाली पंक्तियों को प्रकाशित करने के बजाय मैन्युअल समीक्षा के लिए क्वारंटीन किया गया) और [`payloads_live/`](https://github.com/josh-blythe/bordair-multimodal/blob/main/payloads_live) के रूप में जारी किया गया। जहाँ परतें 1-4 ज्ञात अटैक वर्गों के विरुद्ध कवरेज मापती हैं, वहीं परत 5 मापती है कि क्या कोई डिटेक्टर एक प्रेरित इंसान के विरुद्ध टिकता है जो सक्रिय रूप से उसे तोड़ने का प्रयास कर रहा है। पूर्ण अनामीकरण पद्धति के लिए [`payloads_live/README.md`](https://github.com/josh-blythe/bordair-multimodal/blob/main/payloads_live/README.md) देखें।
### लेबल निर्धारण
सभी अटैक पेलोड: `expected_detection: true`
सभी सौम्य नमूने: `expected_detection: false`
लेबल निर्माण द्वारा निर्धारित किए जाते हैं, न कि व्यक्तिगत नमूनों की मानव समीक्षा द्वारा। इसलिए शुद्धता की गारंटी **श्रेणी स्तर** पर होती है: प्रत्येक श्रेणी एक विशिष्ट तंत्र के साथ एक प्रलेखित अटैक वर्ग से मैप होती है। व्यक्तिगत नमूने उस सीड और श्रेणी से लेबल प्राप्त करते हैं जिनसे वे उत्पन्न किए गए थे।
जानबूझकर कोई एडवरसैरियल लेबल नॉइज़ नहीं डाला गया है। डिटेक्टर से इंजेक्शन पैटर्न सीखने की अपेक्षा की जाती है, न कि "वास्तविक" और "नकली" इंजेक्शन के बीच अंतर करने की -- अटैक सेट के सभी नमूने वास्तविक या प्रशंसनीय अटैक स्ट्रिंग का प्रतिनिधित्व करते हैं।
### सौम्य फॉल्स-पॉज़िटिव जोखिम
एज-केस सौम्य सेट को सुरक्षा-निकटवर्ती भाषा पर फॉल्स पॉज़िटिव कम करने के लिए डिज़ाइन किया गया था। यह 10 शब्दावली क्लस्टर कवर करता है: `ignore`, `override`, `system prompt`, `password`, `instructions`, `jailbreak` (iPhone के अर्थ में), `bypass surgery`, `XSS` (एक सुरक्षा विषय के रूप में, हमले के रूप में नहीं), `prompt` (कैमरा शटर के अर्थ में), और `inject` (डिपेंडेंसी इंजेक्शन / चिकित्सा के अर्थ में)। एक डिटेक्टर जो पूर्ण डेटासेट पर उच्च प्रेसिजन प्राप्त करता है लेकिन एज-केस सेट पर कम प्रेसिजन रखता है, वह सतही कीवर्ड मिलान पर ओवरफिटिंग कर रहा है।
### डेटासेट ऑडिट
पूरे डेटासेट का लेबल शुद्धता और संदूषण के लिए ऑडिट किया गया। ऑडिट निम्न की जाँच करता है:
1. सभी अटैक नमूनों में `expected_detection: true` है
2. सभी सौम्य नमूनों में `expected_detection: false` है
3. सौम्य नमूनों में इंजेक्शन पैटर्न नहीं हैं (जैसे "ignore previous instructions", "reveal your system prompt", एक्सफिलट्रेशन URL, `<|im_start|>` टोकन)
4. किसी भी नमूने में कोई वास्तविक API कुंजी या क्रेडेंशियल नहीं (OpenAI sk- कुंजियाँ, AWS AKIA कुंजियाँ, GitHub PAT, आदि)
5. प्रत्येक नमूने पर आवश्यक फ़ील्ड (`id`, `text`, `expected_detection`, `modalities`) मौजूद हैं
6. श्रेणियों के भीतर कोई डुप्लिकेट ID नहीं
ऑडिट परिणाम:
- **221 सौम्य नमूने हटाए गए** जिनमें इंजेक्शन पैटर्न थे (WildChat/UltraChat इनजेशन से लीक)
- **2 अटैक नमूने हटाए गए** जिनमें वास्तविक OpenAI API कुंजियाँ थीं (LLMail-Inject Phase 1 से)
- **सौम्य डेटा में शून्य इंजेक्शन पैटर्न शेष**
- **किसी भी नमूने में शून्य वास्तविक गोपनीय जानकारी**
शेष ऑडिट फ्लैग (जानबूझकर, त्रुटियाँ नहीं):