
[NeurIPS 2025] पेपर "GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning" के लिए आधिकारिक सोर्स कोड।
Yue Liu, Shengfang Zhai, Mingzhe Du
Yulin Chen, Tri Cao, Hongcheng Gao, Cheng Wang
Xinfeng Li, Kun Wang, Junfeng Fang, Jiaheng Zhang, Bryan Hooi
1सिंगापुर का राष्ट्रीय विश्वविद्यालय, 2नानयांग तकनीकी विश्वविद्यालय
VLM की सुरक्षा बढ़ाने के लिए, यह पेपर एक नवीन तर्क-आधारित VLM गार्ड मॉडल प्रस्तुत करता है जिसे GuardReasoner-VL नाम दिया गया है। मुख्य विचार यह है कि गार्ड मॉडल को ऑनलाइन RL के माध्यम से मॉडरेशन निर्णय लेने से पहले जानबूझकर तर्क करने के लिए प्रोत्साहित किया जाए। पहले, हम GuardReasoner-VLTrain का निर्माण करते हैं, जो 123K नमूनों और 631K तर्क चरणों वाला एक तर्क कोष है, जो पाठ, छवि और पाठ-छवि इनपुट तक फैला हुआ है। फिर, इसके आधार पर, हम SFT के माध्यम से अपने मॉडल की तर्क क्षमता को कोल्ड-स्टार्ट करते हैं। इसके अलावा, हम ऑनलाइन RL के माध्यम से मॉडरेशन के संबंध में तर्क को और बढ़ाते हैं। विशेष रूप से, नमूनों की विविधता और कठिनाई बढ़ाने के लिए, हम प्रस्तावित सुरक्षा-जागरूक डेटा संयोजन के माध्यम से अस्वीकृति नमूनाकरण और उसके बाद डेटा संवर्धन करते हैं। इसके अलावा, हम प्रारंभिक चरणों में अन्वेषण और बाद के चरणों में दोहन को प्रोत्साहित करने के लिए एक गतिशील क्लिपिंग पैरामीटर का उपयोग करते हैं। प्रदर्शन और टोकन दक्षता को संतुलित करने के लिए, हम एक लंबाई-जागरूक सुरक्षा पुरस्कार डिज़ाइन करते हैं जो सटीकता, प्रारूप और टोकन लागत को एकीकृत करता है। व्यापक प्रयोग हमारे मॉडल की श्रेष्ठता प्रदर्शित करते हैं। उल्लेखनीय रूप से, यह उपविजेता को औसतन 19.27% F1 स्कोर से पीछे छोड़ देता है।
चित्र 1: GuardReasoner-VL का अवलोकन।
GuardReasoner-VL का मूल्यांकन करने के लिए, निम्नलिखित कोड चलाएँ।
python ./evaluate.py
परिणाम result.csv फ़ाइल में संग्रहीत किए जाते हैं।
Performance of GuardReasoner-VL (GuardReasoner-VL-7B):
ToxicChat ,HarmBenchPrompt ,OpenAIModeration ,AegisSafetyTest ,SimpleSafetyTests ,WildGuardTest ,Average (Text) ,HarmImageTest ,SPA-VL-Eval ,Average (All)
76.51 ,98.30 ,70.98 ,90.13 ,98.99 ,88.35 ,79.88 ,70.84 ,85.60 ,79.07
HarmBenchResponse ,SafeRLHF ,BeaverTails ,XSTestReponseHarmful,WildGuardTest ,Average (Text) ,SPA-VL-Eval ,Average (All)
87.22 ,66.37 ,84.76 ,92.72 ,79.04 ,79.42 ,73.22 ,77.58
Performance of GuardReasoner-VL (GuardReasoner-VL-Eco-7B):
ToxicChat ,HarmBenchPrompt ,OpenAIModeration ,AegisSafetyTest ,SimpleSafetyTests ,WildGuardTest ,Average (Text) ,HarmImageTest ,SPA-VL-Eval ,Average (All)
76.26 ,98.73 ,70.82 ,90.34 ,99.50 ,88.54 ,79.82 ,64.84 ,85.26 ,77.49
HarmBenchResponse ,SafeRLHF ,BeaverTails ,XSTestReponseHarmful,WildGuardTest ,Average (Text) ,SPA-VL-Eval ,Average (All)
86.22 ,66.15 ,85.51 ,93.33 ,78.60 ,79.51 ,70.81 ,76.94
Performance of GuardReasoner-VL (GuardReasoner-VL-3B):
ToxicChat ,HarmBenchPrompt ,OpenAIModeration ,AegisSafetyTest ,SimpleSafetyTests ,WildGuardTest ,Average (Text) ,HarmImageTest ,SPA-VL-Eval ,Average (All)
74.45 ,89.10 ,70.83 ,88.79 ,99.50 ,88.92 ,78.77 ,70.93 ,86.47 ,78.73
HarmBenchResponse ,SafeRLHF ,BeaverTails ,XSTestReponseHarmful,WildGuardTest ,Average (Text) ,SPA-VL-Eval ,Average (All)
85.76 ,66.37 ,85.16 ,93.08 ,76.07 ,78.83 ,71.19 ,76.56
Performance of GuardReasoner-VL (GuardReasoner-VL-Eco-3B):
ToxicChat ,HarmBenchPrompt ,OpenAIModeration ,AegisSafetyTest ,SimpleSafetyTests ,WildGuardTest ,Average (Text) ,HarmImageTest ,SPA-VL-Eval ,Average (All)
73.47 ,88.58 ,70.87 ,89.04 ,99.50 ,89.16 ,78.43 ,66.79 ,85.82 ,77.39
HarmBenchResponse ,SafeRLHF ,BeaverTails ,XSTestReponseHarmful,WildGuardTest ,Average (Text) ,SPA-VL-Eval ,Average (All)
84.72 ,66.96 ,85.39 ,93.59 ,77.39 ,79.31 ,72.01 ,77.14
चित्र 2: मल्टी-मोडल गार्डरेल बेंचमार्क पर GuardReasoner-VL का औसत प्रदर्शन।
तालिका 1: प्रॉम्प्ट हानिकारकता पहचान कार्य का प्रदर्शन।
तालिका 2: प्रतिक्रिया हानिकारकता पहचान कार्य का प्रदर्शन।
GuardReasoner-VL की उत्पादन प्रक्रिया को पुन: उत्पन्न करने के लिए, निम्नलिखित कोड चलाएँ।
bash test.sh
GuardReasoner-VL का उपयोग करने के लिए, निम्नलिखित कोड चलाएँ।
CUDA_VISIBLE_DEVICES=0 python deploy.py
GuardReasoner के प्रशिक्षण प्रक्रिया को पुन: उत्पन्न करने के लिए, प्रशिक्षण पाइपलाइन देखें।