
LLM सुरक्षा का आकलन और सुधार करने के लिए उपकरणों का सेट।
🤗 Hugging Face पर मॉडल | ब्लॉग | वेबसाइट | CyberSec Eval पेपर | Llama Guard पेपर
Purple Llama एक छत्र परियोजना है जो समय के साथ उपकरणों और मूल्यांकनों को एक साथ लाएगी, ताकि समुदाय को खुले जनरेटिव AI मॉडलों के साथ जिम्मेदारी से निर्माण करने में मदद मिल सके। प्रारंभिक रिलीज़ में साइबर सुरक्षा और इनपुट/आउटपुट सुरक्षा उपायों के लिए उपकरण और मूल्यांकन शामिल होंगे, लेकिन हम निकट भविष्य में और अधिक योगदान देने की योजना बना रहे हैं।
साइबर सुरक्षा की दुनिया से एक अवधारणा उधार लेते हुए, हम मानते हैं कि जनरेटिव AI द्वारा प्रस्तुत चुनौतियों को वास्तव में कम करने के लिए, हमें आक्रमण (रेड टीम) और रक्षात्मक (ब्लू टीम) दोनों रुख अपनाने की आवश्यकता है। रेड और ब्लू टीम दोनों की जिम्मेदारियों से बनी पर्पल टीमिंग, संभावित जोखिमों के मूल्यांकन और शमन के लिए एक सहयोगात्मक दृष्टिकोण है और यही सिद्धांत जनरेटिव AI पर भी लागू होता है, इसलिए Purple Llama में हमारा निवेश व्यापक होगा।
Purple Llama परियोजना के घटकों को अनुमतिपूर्ण (permissive) लाइसेंस के तहत लाइसेंस प्राप्त होगा, जो अनुसंधान और व्यावसायिक दोनों उपयोगों को सक्षम बनाता है। हम मानते हैं कि यह सामुदायिक सहयोग को सक्षम करने और जनरेटिव AI विकास के लिए विश्वास और सुरक्षा उपकरणों के विकास और उपयोग को मानकीकृत करने की दिशा में एक प्रमुख कदम है। अधिक स्पष्ट रूप से, मूल्यांकन और बेंचमार्क MIT लाइसेंस के तहत लाइसेंस प्राप्त हैं, जबकि किसी भी मॉडल के लिए संबंधित Llama Community लाइसेंस लागू होता है। नीचे दी गई तालिका देखें:
जैसा कि हमने Llama 3 की जिम्मेदार उपयोग मार्गदर्शिका में रेखांकित किया है, हम अनुशंसा करते हैं कि LLM के सभी इनपुट और आउटपुट को एप्लिकेशन के लिए उपयुक्त सामग्री दिशानिर्देशों के अनुसार जाँचा और फ़िल्टर किया जाए।
Llama Guard 3 में उच्च-प्रदर्शन वाले इनपुट और आउटपुट मॉडरेशन मॉडलों की एक श्रृंखला शामिल है, जो डेवलपर्स को विभिन्न सामान्य प्रकार की उल्लंघनकारी सामग्री का पता लगाने में सहायता करने के लिए डिज़ाइन की गई है।
इन्हें Meta-Llama 3.1 और 3.2 मॉडलों को फाइन-ट्यून करके बनाया गया है और MLCommons मानक खतरों की वर्गीकरण प्रणाली का पता लगाने में सहायता के लिए अनुकूलित किया गया है, जो विभिन्न डेवलपर उपयोग-मामलों को ध्यान में रखते हैं। ये Llama 3.2 क्षमताओं की रिलीज़ का समर्थन करते हैं, जिसमें 7 नई भाषाएँ, एक 128k संदर्भ विंडो और छवि तर्क (image reasoning) शामिल हैं। Llama Guard 3 मॉडलों को सहायक साइबर हमले प्रतिक्रियाओं का पता लगाने और LLM द्वारा उत्पन्न दुर्भावनापूर्ण कोड को कोड इंटरप्रेटर का उपयोग करने वाले Llama सिस्टम के होस्टिंग वातावरण में निष्पादित होने से रोकने के लिए भी अनुकूलित किया गया था।
Prompt Guard LLM-संचालित अनुप्रयोगों को दुर्भावनापूर्ण प्रॉम्प्ट से बचाने के लिए एक शक्तिशाली उपकरण है, ताकि उनकी सुरक्षा और अखंडता सुनिश्चित की जा सके।
प्रॉम्प्ट हमलों की श्रेणियों में प्रॉम्प्ट इंजेक्शन और जेलब्रेकिंग शामिल हैं:
Code Shield LLM द्वारा उत्पन्न असुरक्षित कोड के इन्फेरेंस-समय फ़िल्टरिंग के लिए समर्थन जोड़ता है। Code Shield असुरक्षित कोड सुझावों के जोखिम का शमन, कोड इंटरप्रेटर दुरुपयोग की रोकथाम और सुरक्षित कमांड निष्पादन प्रदान करता है। CodeShield उदाहरण नोटबुक।
CyberSec Eval v1 हमारे विश्वास के अनुसार LLM के लिए साइबर सुरक्षा सुरक्षा मूल्यांकनों का पहला उद्योग-व्यापक सेट था। ये बेंचमार्क उद्योग मार्गदर्शन और मानकों (जैसे, CWE और MITRE ATT&CK) पर आधारित हैं और हमारे सुरक्षा विषय-विशेषज्ञों के सहयोग से बनाए गए हैं। हमारा लक्ष्य ऐसे उपकरण प्रदान करना है जो जिम्मेदार AI विकसित करने पर व्हाइट हाउस की प्रतिबद्धताओं में उल्लिखित कुछ जोखिमों को दूर करने में मदद करें, जिनमें शामिल हैं:
हम मानते हैं कि ये उपकरण LLM द्वारा असुरक्षित AI-जनित कोड सुझाने की आवृत्ति को कम करेंगे और साइबर प्रतिद्वंद्वियों के प्रति उनकी सहायकता को घटाएंगे। अधिक विवरण के लिए हमारा Cybersec Eval पेपर देखें।
CyberSec Eval 2 अपने पूर्ववर्ती से आगे बढ़कर एक LLM की कोड इंटरप्रेटर के दुरुपयोग की प्रवृत्ति, आक्रामक साइबर सुरक्षा क्षमताओं और प्रॉम्प्ट इंजेक्शन के प्रति संवेदनशीलता को मापता है। आप पेपर यहाँ पढ़ सकते हैं।
आप 🤗 लीडरबोर्ड यहाँ भी देख सकते हैं।
नया जारी किया गया CyberSec Eval 3 तीन अतिरिक्त परीक्षण सुइट्स प्रदान करता है: विज़ुअल प्रॉम्प्ट इंजेक्शन परीक्षण, स्पीयर फ़िशिंग क्षमता परीक्षण और स्वायत्त आक्रामक साइबर ऑपरेशन परीक्षण।
Llama संदर्भ प्रणाली के हिस्से के रूप में, हम इन सुरक्षा उपायों को अपनाने और तैनात करने में सुविधा के लिए एक सुरक्षा परत को एकीकृत कर रहे हैं। सुरक्षा उपायों के साथ आरंभ करने के लिए संसाधन Llama-recipe GitHub रिपॉजिटरी में उपलब्ध हैं।
न केवल Purple Llama घटकों बल्कि सामान्य रूप से Llama मॉडलों के लिए भी अक्सर पूछे जाने वाले प्रश्नों की चालू सूची के लिए, FAQ यहाँ देखें।
मदद करने के तरीके के लिए CONTRIBUTING फ़ाइल देखें।
| घटक प्रकार | घटक | लाइसेंस |
|---|
| मूल्यांकन/बेंचमार्क | Cyber Security Eval (अन्य आने वाले हैं) | MIT |
| सुरक्षा उपाय | Llama Guard | Llama 2 Community License |
| सुरक्षा उपाय | Llama Guard 2 | Llama 3 Community License |
| सुरक्षा उपाय | Llama Guard 3-8B | Llama 3.2 Community License |
| सुरक्षा उपाय | Llama Guard 3-1B | Llama 3.2 Community License |
| सुरक्षा उपाय | Llama Guard 3-11B-vision | Llama 3.2 Community License |
| सुरक्षा उपाय | Prompt Guard | Llama 3.2 Community License |
| सुरक्षा उपाय | Code Shield | MIT |