
मल्टीमॉडल LLM में सुरक्षा-जागरूकता दिशाओं को निकालने और प्रशिक्षित करने के लिए शोध कोड, ताकि अस्वीकृति व्यवहार में सुधार हो सके जबकि सामान्य-कार्य विचलन सीमित रहे।
मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में क्रॉस-मोडल सुरक्षा बहाव के लिए स्थानांतरण सुरक्षा जागरूकता (EMNLP 2026 Findings) का आधिकारिक कार्यान्वयन।
इस रिपॉजिटरी में Qwen3-VL सुरक्षा-जागरूकता दिशा पाइपलाइन शामिल है। यह हानिकारक और हानिरहित मल्टीमॉडल उदाहरणों से इनकार-संबंधित सक्रियण दिशा निकालता है, उस दिशा का चयन करता है जो सौम्य-कार्य बहाव को सीमित करते हुए इनकार व्यवहार में सुधार करती है, और वैकल्पिक रूप से दिशा-विशिष्ट सुरक्षा-जागरूकता वेक्टर प्रशिक्षित करता है।
कोड वर्तमान में Hugging Face Transformers के माध्यम से Qwen/Qwen3-VL-8B-Instruct का समर्थन करता है।
.
├── artifacts/directions/ # पूर्व-गणना की गई चयनित दिशा और मेटाडेटा
├── data/csv/ # पाइपलाइन द्वारा उपयोग की जाने वाली CSV मेनिफेस्ट
├── data/images/ # स्थानीय छवि रूट (शामिल नहीं)
├── directions/ # दिशा निष्कर्षण और चयन
├── models/ # Qwen3-VL मॉडल और प्रोसेसर उपयोगिताएँ
├── training/ # सुरक्षा-जागरूकता दिशा प्रशिक्षण
├── utils/ # सक्रियण हुक उपयोगिताएँ
├── config.py
├── run_pipeline.py # दिशा निर्माण और चयन प्रवेश बिंदु
└── requirements.txt
Python 3.10+ और CUDA-सक्षम PyTorch स्थापना की अनुशंसा की जाती है।
git clone https://github.com/cucu220123/transfer-safety-awareness.git
cd transfer-safety-awareness
python -m venv .venv
source .venv/bin/activate
pip install -r requirements.txt
पहली बार चलाने पर Hugging Face से Qwen/Qwen3-VL-8B-Instruct डाउनलोड होता है। सुनिश्चित करें कि मशीन में पर्याप्त GPU मेमोरी है और आपने मॉडल प्रदाता द्वारा आवश्यक किसी भी मॉडल शर्तों को स्वीकार कर लिया है।
रिपॉजिटरी में प्रयोगों के लिए उपयोग की जाने वाली CSV मेनिफेस्ट शामिल हैं, लेकिन स्रोत छवि डेटासेट का पुनर्वितरण नहीं करती है। छवियों को उनके मूल डेटासेट प्रदाताओं से प्राप्त करें और उन्हें इन प्रोजेक्ट-सापेक्ष रूट्स के अंतर्गत रखें:
data/images/vlsafe_images
data/images/vlsbench_imgs
data/images/mmvet_images
मैपिंग इस प्रकार है:
छवि रूट्स और CSV पथ को कोड संपादित किए बिना ओवरराइड किया जा सकता है:
export VLM_HARMFUL_IMAGE_ROOT=/path/to/vlsafe_images
export VLM_HARMLESS_IMAGE_ROOT=/path/to/vlsbench_imgs
export VLM_KL_IMAGE_ROOT=/path/to/mmvet_images
export VLM_HARMFUL_CSV=/path/to/harmful.csv
export VLM_HARMLESS_CSV=/path/to/harmless.csv
export VLM_KL_CSV=/path/to/benign_vqa.csv
कृपया छवियों और मेनिफेस्ट को डाउनलोड या उपयोग करते समय प्रत्येक स्रोत डेटासेट के लाइसेंस और शर्तों का पालन करें।
उम्मीदवार दिशा निर्माण और सत्यापन-आधारित चयन चलाने के लिए:
CUDA_VISIBLE_DEVICES=0 python run_pipeline.py --direction_only
कमांड डिफ़ॉल्ट रूप से प्रति स्प्लिट 128 प्रशिक्षण और 32 सत्यापन उदाहरणों का उपयोग करता है। यह मध्यवर्ती परिणाम artifacts/direction_runs/<model-name>/ में लिखता है और चयनित दिशा को सहेजता है:
artifacts/directions/qwen3vl_refusal_direction.pt
artifacts/directions/qwen3vl_refusal_direction_metadata.json
स्थानीय मॉडल निर्देशिका या किसी अन्य संगत Hugging Face पहचानकर्ता को इंगित करने के लिए --model_path का उपयोग करें। --skip_filter फ्लैग इनकार-स्कोर फ़िल्टरिंग चरण को अक्षम करता है।
रिपॉजिटरी में पहले से ही डिफ़ॉल्ट Qwen3-VL चेकपॉइंट के लिए एक पूर्व-गणना की गई दिशा आर्टिफैक्ट शामिल है, इसलिए जब वह आर्टिफैक्ट आपके सेटअप के लिए उपयुक्त हो तो इस चरण को छोड़ा जा सकता है।
प्रशिक्षण पेपर कोड में उपयोग किए गए सौम्य-कार्य और इनकार उद्देश्यों के साथ चयनित दिशा को अपडेट करता है। चार-GPU उदाहरण है:
CUDA_VISIBLE_DEVICES=0,1,2,3 torchrun --nproc_per_node=4 --master_port=29501 \
-m training.train_safety_awareness_direction \
--epochs 8 \
--batch_size 1 \
--grad_accum_steps 1 \
--lr 5e-3
प्रशिक्षण आउटपुट डिफ़ॉल्ट रूप से outputs/qwen3vl_safety_awareness_train/ में लिखे जाते हैं। उपयोगी विकल्पों में --model_path, --direction_pt, --direction_meta, --artifact_dir, --epochs, --batch_size, और --lr शामिल हैं; पूरी सूची के लिए python -m training.train_safety_awareness_direction --help चलाएँ।
CUDA_VISIBLE_DEVICES सेट करें और समान मॉडल संशोधन, इनपुट मेनिफेस्ट और छवि फ़ाइलों का उपयोग करें।split कॉलम का उपयोग करके पंक्तियों को ट्रेन/सत्यापन/परीक्षण में निर्दिष्ट करता है; अन्यथा यह नियतात्मक रूप से question_id % 10 का उपयोग करता है।अंतिम ग्रंथ सूची संबंधी जानकारी और पेपर लिंक उपलब्ध होने पर पेपर उद्धरण जोड़ा जाएगा।
इस रिपॉजिटरी में कोड MIT लाइसेंस के तहत जारी किया गया है। तृतीय-पक्ष डेटासेट, छवियाँ और Qwen3-VL मॉडल अपने संबंधित लाइसेंस और शर्तों के अधीन रहते हैं।
| मेनिफेस्ट | छवि रूट | उद्देश्य |
|---|
qwen3vl_refusal_direction_harmful.csv | vlsafe_images | हानिकारक/इनकार-पक्ष उदाहरण |
qwen3vl_refusal_direction_harmless.csv | vlsbench_imgs | हानिरहित/गैर-इनकार-पक्ष उदाहरण |
qwen3vl_kl_benign_vqa.csv | mmvet_images | KL/दुष्प्रभाव मूल्यांकन के लिए सौम्य VQA उदाहरण |