Skip to content
KitploitKITPLOIT
उपकरणब्लॉग
जमा करें
उपकरणब्लॉग
जमा करें

हैकिंग, पेनटेस्ट और साइबर सुरक्षा उपकरण आपके सुरक्षा शस्त्रागार के लिए!

Kitploit हैकिंग, साइबर सुरक्षा और पेंटेस्टिंग टूल्स की एक निर्देशिका है। कमजोरियों को खोजने, सिस्टम का विश्लेषण करने, परीक्षण को स्वचालित करने और अपनी सुरक्षा को मजबूत करने के लिए नवीनतम प्रोजेक्ट अपडेट खोजें।

··फ़ीड·संपर्क·गोपनीयता·© 2026 Kitploit

टूल निर्देशिका

श्रेणियाँ

सभी श्रेणियाँ देखें
Loading categories
Learning-to-Detect — बड़े विज़न-भाषा मॉडलों में अज्ञात जेलब्रेक हमलों का पता छिपी अवस्था विश्लेषण और ऑटोएन्कोडर का उपयोग करके लगाता है, साथ ही मजबूत सुरक्षा निगरानी के लिए प्रशिक्षण और मूल्यांकन पाइपलाइनों के साथ। | Kitploit
उपकरण/GitHubGitHub/shuangliangx/learning-to-detect
रक्षात्मक उपकरणभेद्यता विश्लेषणमशीन लर्निंगAI सुरक्षाविसंगति का पता लगाना
GitHubshuangliangx/learning-to-detect

Learning-to-Detect

बड़े विज़न-भाषा मॉडलों में अज्ञात जेलब्रेक हमलों का पता छिपी अवस्था विश्लेषण और ऑटोएन्कोडर का उपयोग करके लगाता है, साथ ही मजबूत सुरक्षा निगरानी के लिए प्रशिक्षण और मूल्यांकन पाइपलाइनों के साथ।

रिपॉजिटरी देखें

सबसे लोकप्रिय

सभी देखें →

हमारे समुदाय द्वारा सबसे अधिक उपयोग किए जाने वाले उपकरण खोजें।

सभी उपकरण खोजें

हमारे उपकरणों का संग्रह ब्राउज़ करें

सभी उपकरण देखें →
साझा करें
183 महीने पहलेअभी तक समीक्षित नहीं

बड़े विज़न-लैंग्वेज मॉडल में अज्ञात जेलब्रेक हमलों का पता लगाना सीखना

यह रिपॉजिटरी "बड़े विज़न-लैंग्वेज मॉडल में अज्ञात जेलब्रेक हमलों का पता लगाना सीखना" का आधिकारिक कार्यान्वयन प्रदान करती है।

सामग्री

  • बेस मॉडल

  • जेलब्रेक हमले का पता लगाना

  • डेटासेट

बेस मॉडल

हमारी विधि निम्नलिखित दो बेस मॉडल का उपयोग करती है:

LLaVA-v1.6-Vicuna एक शक्तिशाली विज़न-लैंग्वेज मॉडल है जो मल्टीमॉडल इनपुट को संसाधित करने और प्राकृतिक भाषा प्रतिक्रियाएँ उत्पन्न करने के लिए Vicuna भाषा मॉडल के साथ एक विज़ुअल एनकोडर को जोड़ता है।

LlamaGuard3 Meta AI द्वारा विकसित एक सुरक्षा गार्डरेल मॉडल है, जिसे विशेष रूप से हानिकारक सामग्री निर्माण का पता लगाने और रोकने तथा संभावित असुरक्षित अनुरोधों और प्रतिक्रियाओं की प्रभावी रूप से पहचान करने के लिए डिज़ाइन किया गया है।

कृपया मॉडल वेट डाउनलोड करें और उन्हें code/asset/weights निर्देशिका में रखें।

जेलब्रेक हमले का पता लगाना

1. डेटा प्रोसेसिंग और हिडन स्टेट निष्कर्षण

(वैकल्पिक, क्योंकि संसाधित डेटा और निकाले गए स्टेट पहले से ही रिपॉजिटरी में संरक्षित हैं।)

$I^-$ (AdvBench) और $I^+$ (GQA) पर मॉडल से क्वेरी करें

root@kitploit:~
python code/vicuna/qa.py --file code/vicuna/instructions/advbench.json
python code/vicuna/qa.py --file code/vicuna/instructions/GQA.json

मॉडल प्रतिक्रियाओं का आकलन करें और प्रशिक्षण/परीक्षण डेटासेट में विभाजित करें

root@kitploit:~
    python code/llama3_guard.py --file code/vicuna/instructions/advbench.json
    python code/vicuna/instructions/process.py 

LoD प्रशिक्षण और बेंचमार्क मूल्यांकन के लिए हिडन स्टेट निकालें

root@kitploit:~
    python code/vicuna/qa-baseline.py 

2. MSCAV क्लासिफायर को प्रशिक्षित और परीक्षण करें

क्लासिफायर को प्रशिक्षित और परीक्षण करें

root@kitploit:~
    python code/vicuna/train.py --train
    python code/vicuna/train.py --test

3. सेफ्टी पैटर्न ऑटो-एनकोडर (SPAE) को प्रशिक्षित करें

root@kitploit:~
    python code/autoencoder.py

4. पता लगाने के प्रदर्शन का मूल्यांकन करें

root@kitploit:~
    python code/test.py

डेटासेट

डेटासेटविवरण
MM-SafetyBench
HADES

कृपया डेटासेट डाउनलोड करें और उन्हें code/asset निर्देशिका में रखें।

टूल डाउनलोड करें