Skip to content
KitploitKITPLOIT
उपकरणएक्सप्लॉइटब्लॉग
Log in
जमा करें
उपकरणएक्सप्लॉइटब्लॉग
जमा करें

हैकिंग, पेनटेस्ट और साइबर सुरक्षा उपकरण आपके सुरक्षा शस्त्रागार के लिए!

Kitploit हैकिंग, साइबर सुरक्षा और पेंटेस्टिंग टूल्स की एक निर्देशिका है। कमजोरियों को खोजने, सिस्टम का विश्लेषण करने, परीक्षण को स्वचालित करने और अपनी सुरक्षा को मजबूत करने के लिए नवीनतम प्रोजेक्ट अपडेट खोजें।

फ़ीडसंपर्कगोपनीयता© 2026 Kitploit

टूल निर्देशिका

श्रेणियाँ

सभी श्रेणियाँ देखें
Loading categories
SLDR — रक्षा ढांचा जो चयनात्मक परत पुनर्प्राप्ति और गतिशील रूटिंग का उपयोग करके LLMs के दुर्भावनापूर्ण फाइन-ट्यूनिंग को कम करता है, साथ ही प्रशिक्षण, हानिकारकता स्कोरिंग, और जेलब्रेक मूल्यांकन स्क्रिप्ट के साथ। | Kitploit
उपकरण/GitHubGitHub/stardust457/sldr
रक्षात्मक उपकरणमशीन लर्निंगपेपर और शोधAI सुरक्षाप्रतिकूल हमला
GitHubstardust457/sldr

SLDR

रक्षा ढांचा जो चयनात्मक परत पुनर्प्राप्ति और गतिशील रूटिंग का उपयोग करके LLMs के दुर्भावनापूर्ण फाइन-ट्यूनिंग को कम करता है, साथ ही प्रशिक्षण, हानिकारकता स्कोरिंग, और जेलब्रेक मूल्यांकन स्क्रिप्ट के साथ।

रिपॉजिटरी देखें
27 दिन पहलेअभी तक समीक्षित नहीं

सबसे लोकप्रिय

सभी देखें →

हमारे समुदाय द्वारा सबसे अधिक उपयोग किए जाने वाले उपकरण खोजें।

सभी उपकरण खोजें

हमारे उपकरणों का संग्रह ब्राउज़ करें

सभी उपकरण देखें →
साझा करें

[NeurIPS 2026] SLDR: चयनात्मक परत पुनर्प्राप्ति और गतिशील रूटिंग के माध्यम से दुर्भावनापूर्ण फाइन-ट्यूनिंग से बचाव

🔧 पर्यावरण सेटअप

रिपॉजिटरी को क्लोन करें, Conda पर्यावरण बनाएं और सक्रिय करें, फिर आवश्यक निर्भरताएं इंस्टॉल करें:

git clone https://github.com/Stardust457/SLDR.git
cd SLDR

conda create -n sldr python=3.12 -y

conda activate sldr

python -m pip install --upgrade pip

python -m pip install -r requirements.txt

🔑 Llama मॉडल तक पहुंचना और डाउनलोड करना

Llama मॉडल के लिए Hugging Face पर एक्सेस अनुरोध आवश्यक है।

किसी मॉडल का उपयोग करने से पहले, Hugging Face पर लॉग इन करें, Meta Llama के अंतर्गत वांछित मॉडल के पृष्ठ पर जाएं, उपयोग की शर्तें स्वीकार करें, और एक्सेस अनुरोध सबमिट करें। एक्सेस स्वीकृत होने के बाद, उसी खाते का उपयोग करके Access Tokens सेटिंग्स पृष्ठ पर लक्ष्य मॉडल तक पढ़ने की पहुंच वाला एक Access Token बनाएं। विवरण के लिए, Hugging Face gated मॉडल गाइड देखें।

सबसे पहले, Bash टर्मिनल में HF-Mirror कॉन्फ़िगर करें:

export HF_ENDPOINT="https://hf-mirror.com"

फिर, लॉग इन करने के लिए निम्नलिखित कमांड चलाएं:

hf auth login

संकेत मिलने पर अपना नव निर्मित Hugging Face Access Token दर्ज करें।


🚀 प्रशिक्षण और मूल्यांकन

प्रत्येक मॉडल को प्रशिक्षित और मूल्यांकन करने के लिए रिपॉजिटरी रूट से निम्नलिखित कमांड चलाएं:

Llama 3.1

bash scripts/run_llama31_downstream.sh

Llama 3

bash scripts/run_llama3_downstream.sh

Qwen 2.5

bash scripts/run_qwen25_downstream.sh

Mistral

bash scripts/run_mistral_downstream.sh

Llama Guard परिनियोजन और हानिकारकता स्कोरिंग

मॉडल प्रतिक्रियाएं एकत्र करने के बाद, Llama Guard को परिनियोजित करें और टर्मिनल में सेवा शुरू करें:

bash scripts/run_llama_guard.sh serve

इस टर्मिनल को चलते रहने दें और सेवा तैयार होने तक प्रतीक्षा करें। फिर, एक और टर्मिनल खोलें, sldr पर्यावरण सक्रिय करें, और मॉडल प्रतिक्रियाओं की हानिकारकता को स्कोर करने के लिए रिपॉजिटरी रूट से निम्नलिखित कमांड चलाएं:

bash scripts/run_llama_guard.sh score

⚠️ महत्वपूर्ण अनुस्मारक: Alpaca मूल्यांकन

Alpaca डेटासेट पर Llama 3.1 मूल्यांकन चलाने से पहले, उसी टर्मिनल में GPT जज का API बेस URL और API कुंजी कॉन्फ़िगर करें:

export GPT_JUDGE_BASE_URL='your base url'
export OPENAI_API_KEY='your API key'

मूल्यांकन शुरू करने से पहले प्लेसहोल्डर्स को अपने API बेस URL और API कुंजी से बदलें।

अतिरिक्त हानिकारक बेंचमार्क मूल्यांकन

संबंधित डाउनस्ट्रीम चेकपॉइंट्स उत्पन्न करने के बाद, अतिरिक्त हानिकारक बेंचमार्क्स, जिनमें DirectHarm4, HarmBench, और HEx-PHI शामिल हैं, पर Llama 3.1 का मूल्यांकन करने के लिए निम्नलिखित कमांड चलाएं:

DATASETS="sst2" \
POISON_RATIOS="0.1" \
SEEDS="42" \
VARIANTS="defended" \
bash /root/scripts/run_llama31_harm_benchmarks.sh

Zulu और IJP जेलब्रेक मूल्यांकन

संबंधित डाउनस्ट्रीम चेकपॉइंट्स का उपयोग करके Zulu और IJP जेलब्रेक हमलों के विरुद्ध Llama 3.1 का मूल्यांकन करने के लिए निम्नलिखित कमांड चलाएं:

DATASETS="sst2" \
POISON_RATIOS="0.1" \
TRAIN_SAMPLES="1000" \
SEEDS="42" \
VARIANTS="defended" \
JAILBREAK_ATTACKS="zulu ijp" \
bash /root/scripts/run_llama31_jailbreak.sh

नोट: Zulu डेटासेट के लिए उत्पन्न मॉडल प्रतिक्रियाओं का Llama Guard का उपयोग करके हानिकारकता मूल्यांकन करने से पहले उन्हें अंग्रेजी में अनुवादित किया जाना चाहिए।


टूल डाउनलोड करें