
रक्षा ढांचा जो चयनात्मक परत पुनर्प्राप्ति और गतिशील रूटिंग का उपयोग करके LLMs के दुर्भावनापूर्ण फाइन-ट्यूनिंग को कम करता है, साथ ही प्रशिक्षण, हानिकारकता स्कोरिंग, और जेलब्रेक मूल्यांकन स्क्रिप्ट के साथ।
रिपॉजिटरी को क्लोन करें, Conda पर्यावरण बनाएं और सक्रिय करें, फिर आवश्यक निर्भरताएं इंस्टॉल करें:
git clone https://github.com/Stardust457/SLDR.git
cd SLDR
conda create -n sldr python=3.12 -y
conda activate sldr
python -m pip install --upgrade pip
python -m pip install -r requirements.txt
Llama मॉडल के लिए Hugging Face पर एक्सेस अनुरोध आवश्यक है।
किसी मॉडल का उपयोग करने से पहले, Hugging Face पर लॉग इन करें, Meta Llama के अंतर्गत वांछित मॉडल के पृष्ठ पर जाएं, उपयोग की शर्तें स्वीकार करें, और एक्सेस अनुरोध सबमिट करें। एक्सेस स्वीकृत होने के बाद, उसी खाते का उपयोग करके Access Tokens सेटिंग्स पृष्ठ पर लक्ष्य मॉडल तक पढ़ने की पहुंच वाला एक Access Token बनाएं। विवरण के लिए, Hugging Face gated मॉडल गाइड देखें।
सबसे पहले, Bash टर्मिनल में HF-Mirror कॉन्फ़िगर करें:
export HF_ENDPOINT="https://hf-mirror.com"
फिर, लॉग इन करने के लिए निम्नलिखित कमांड चलाएं:
hf auth login
संकेत मिलने पर अपना नव निर्मित Hugging Face Access Token दर्ज करें।
प्रत्येक मॉडल को प्रशिक्षित और मूल्यांकन करने के लिए रिपॉजिटरी रूट से निम्नलिखित कमांड चलाएं:
bash scripts/run_llama31_downstream.sh
bash scripts/run_llama3_downstream.sh
bash scripts/run_qwen25_downstream.sh
bash scripts/run_mistral_downstream.sh
मॉडल प्रतिक्रियाएं एकत्र करने के बाद, Llama Guard को परिनियोजित करें और टर्मिनल में सेवा शुरू करें:
bash scripts/run_llama_guard.sh serve
इस टर्मिनल को चलते रहने दें और सेवा तैयार होने तक प्रतीक्षा करें। फिर, एक और टर्मिनल खोलें, sldr पर्यावरण सक्रिय करें, और मॉडल प्रतिक्रियाओं की हानिकारकता को स्कोर करने के लिए रिपॉजिटरी रूट से निम्नलिखित कमांड चलाएं:
bash scripts/run_llama_guard.sh score
Alpaca डेटासेट पर Llama 3.1 मूल्यांकन चलाने से पहले, उसी टर्मिनल में GPT जज का API बेस URL और API कुंजी कॉन्फ़िगर करें:
export GPT_JUDGE_BASE_URL='your base url'
export OPENAI_API_KEY='your API key'
मूल्यांकन शुरू करने से पहले प्लेसहोल्डर्स को अपने API बेस URL और API कुंजी से बदलें।
संबंधित डाउनस्ट्रीम चेकपॉइंट्स उत्पन्न करने के बाद, अतिरिक्त हानिकारक बेंचमार्क्स, जिनमें DirectHarm4, HarmBench, और HEx-PHI शामिल हैं, पर Llama 3.1 का मूल्यांकन करने के लिए निम्नलिखित कमांड चलाएं:
DATASETS="sst2" \
POISON_RATIOS="0.1" \
SEEDS="42" \
VARIANTS="defended" \
bash /root/scripts/run_llama31_harm_benchmarks.sh
संबंधित डाउनस्ट्रीम चेकपॉइंट्स का उपयोग करके Zulu और IJP जेलब्रेक हमलों के विरुद्ध Llama 3.1 का मूल्यांकन करने के लिए निम्नलिखित कमांड चलाएं:
DATASETS="sst2" \
POISON_RATIOS="0.1" \
TRAIN_SAMPLES="1000" \
SEEDS="42" \
VARIANTS="defended" \
JAILBREAK_ATTACKS="zulu ijp" \
bash /root/scripts/run_llama31_jailbreak.sh
नोट: Zulu डेटासेट के लिए उत्पन्न मॉडल प्रतिक्रियाओं का Llama Guard का उपयोग करके हानिकारकता मूल्यांकन करने से पहले उन्हें अंग्रेजी में अनुवादित किया जाना चाहिए।