
बड़े विज़न-भाषा मॉडलों में अज्ञात जेलब्रेक हमलों का पता छिपी अवस्था विश्लेषण और ऑटोएन्कोडर का उपयोग करके लगाता है, साथ ही मजबूत सुरक्षा निगरानी के लिए प्रशिक्षण और मूल्यांकन पाइपलाइनों के साथ।
यह रिपॉजिटरी "बड़े विज़न-लैंग्वेज मॉडल में अज्ञात जेलब्रेक हमलों का पता लगाना सीखना" का आधिकारिक कार्यान्वयन प्रदान करती है।
हमारी विधि निम्नलिखित दो बेस मॉडल का उपयोग करती है:
LLaVA-v1.6-Vicuna एक शक्तिशाली विज़न-लैंग्वेज मॉडल है जो मल्टीमॉडल इनपुट को संसाधित करने और प्राकृतिक भाषा प्रतिक्रियाएँ उत्पन्न करने के लिए Vicuna भाषा मॉडल के साथ एक विज़ुअल एनकोडर को जोड़ता है।
LlamaGuard3 Meta AI द्वारा विकसित एक सुरक्षा गार्डरेल मॉडल है, जिसे विशेष रूप से हानिकारक सामग्री निर्माण का पता लगाने और रोकने तथा संभावित असुरक्षित अनुरोधों और प्रतिक्रियाओं की प्रभावी रूप से पहचान करने के लिए डिज़ाइन किया गया है।
कृपया मॉडल वेट डाउनलोड करें और उन्हें code/asset/weights निर्देशिका में रखें।
(वैकल्पिक, क्योंकि संसाधित डेटा और निकाले गए स्टेट पहले से ही रिपॉजिटरी में संरक्षित हैं।)
python code/vicuna/qa.py --file code/vicuna/instructions/advbench.json
python code/vicuna/qa.py --file code/vicuna/instructions/GQA.json
python code/llama3_guard.py --file code/vicuna/instructions/advbench.json
python code/vicuna/instructions/process.py
python code/vicuna/qa-baseline.py
python code/vicuna/train.py --train
python code/vicuna/train.py --test
python code/autoencoder.py
python code/test.py
| डेटासेट | विवरण |
|---|---|
| MM-SafetyBench | |
| HADES |
कृपया डेटासेट डाउनलोड करें और उन्हें code/asset निर्देशिका में रखें।