Skip to content
KitploitKITPLOIT
उपकरणब्लॉग
जमा करें
उपकरणब्लॉग
जमा करें

हैकिंग, पेनटेस्ट और साइबर सुरक्षा उपकरण आपके सुरक्षा शस्त्रागार के लिए!

Kitploit हैकिंग, साइबर सुरक्षा और पेंटेस्टिंग टूल्स की एक निर्देशिका है। कमजोरियों को खोजने, सिस्टम का विश्लेषण करने, परीक्षण को स्वचालित करने और अपनी सुरक्षा को मजबूत करने के लिए नवीनतम प्रोजेक्ट अपडेट खोजें।

··फ़ीड·संपर्क·गोपनीयता·© 2026 Kitploit

टूल निर्देशिका

श्रेणियाँ

सभी श्रेणियाँ देखें
Loading categories
GuardReasoner-VL — [NeurIPS 2025] An official source code for paper "GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning". | Kitploit
उपकरण/GitHubGitHub/yueliu1999/guardreasoner-vl
Defensive ToolsMachine LearningAI SecurityAnomaly Detection
GitHubyueliu1999/guardreasoner-vl

GuardReasoner-VL

[NeurIPS 2025] An official source code for paper "GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning".

रिपॉजिटरी देखें
12595 महीने पहलेKitploit द्वारा समीक्षित

सबसे लोकप्रिय

सभी देखें →

हमारे समुदाय द्वारा सबसे अधिक उपयोग किए जाने वाले उपकरण खोजें।

सभी उपकरण खोजें

हमारे उपकरणों का संग्रह ब्राउज़ करें

सभी उपकरण देखें →
साझा करें

GuardReasoner-VL: प्रबलित तर्क के माध्यम से VLM की सुरक्षा

Yue Liu, Shengfang Zhai, Mingzhe Du
Yulin Chen, Tri Cao, Hongcheng Gao, Cheng Wang
Xinfeng Li, Kun Wang, Junfeng Fang, Jiaheng Zhang, Bryan Hooi
1सिंगापुर का राष्ट्रीय विश्वविद्यालय, 2नानयांग तकनीकी विश्वविद्यालय

VLM की सुरक्षा बढ़ाने के लिए, यह पेपर एक नवीन तर्क-आधारित VLM गार्ड मॉडल प्रस्तुत करता है जिसे GuardReasoner-VL नाम दिया गया है। मुख्य विचार यह है कि गार्ड मॉडल को ऑनलाइन RL के माध्यम से मॉडरेशन निर्णय लेने से पहले जानबूझकर तर्क करने के लिए प्रोत्साहित किया जाए। पहले, हम GuardReasoner-VLTrain का निर्माण करते हैं, जो 123K नमूनों और 631K तर्क चरणों वाला एक तर्क कोष है, जो पाठ, छवि और पाठ-छवि इनपुट तक फैला हुआ है। फिर, इसके आधार पर, हम SFT के माध्यम से अपने मॉडल की तर्क क्षमता को कोल्ड-स्टार्ट करते हैं। इसके अलावा, हम ऑनलाइन RL के माध्यम से मॉडरेशन के संबंध में तर्क को और बढ़ाते हैं। विशेष रूप से, नमूनों की विविधता और कठिनाई बढ़ाने के लिए, हम प्रस्तावित सुरक्षा-जागरूक डेटा संयोजन के माध्यम से अस्वीकृति नमूनाकरण और उसके बाद डेटा संवर्धन करते हैं। इसके अलावा, हम प्रारंभिक चरणों में अन्वेषण और बाद के चरणों में दोहन को प्रोत्साहित करने के लिए एक गतिशील क्लिपिंग पैरामीटर का उपयोग करते हैं। प्रदर्शन और टोकन दक्षता को संतुलित करने के लिए, हम एक लंबाई-जागरूक सुरक्षा पुरस्कार डिज़ाइन करते हैं जो सटीकता, प्रारूप और टोकन लागत को एकीकृत करता है। व्यापक प्रयोग हमारे मॉडल की श्रेष्ठता प्रदर्शित करते हैं। उल्लेखनीय रूप से, यह उपविजेता को औसतन 19.27% F1 स्कोर से पीछे छोड़ देता है।

चित्र 1: GuardReasoner-VL का अवलोकन।

अपडेट

  • (2025/09/19) GuardReasoner-VL को NeurIPS 2025 द्वारा स्वीकार किया गया।
  • (2025/07/01) GuardReasoner-VL को ICML R2-FM कार्यशाला द्वारा स्वीकार किया गया।
  • (2025/06/03) ऑनलाइन RL का प्रशिक्षण पाइपलाइन जारी किया गया।
  • (2025/05/29) R-SFT का प्रशिक्षण पाइपलाइन जारी किया गया।
  • (2025/05/29) प्रशिक्षण डेटा GuardReasoner-VLTrain और GuardReasoner-VLTrain-Image जारी किया गया।
  • (2025/05/18) मॉडल जारी किए गए (3B-Eco, 3B, 7B-Eco, 7B).
  • (2025/05/18) GuardReasoner-VL का कोड जारी किया गया।
  • (2025/05/18) GuardReasoner-VL arXiv पर उपलब्ध है।

उपयोग

त्वरित आरंभ

GuardReasoner-VL का मूल्यांकन करने के लिए, निम्नलिखित कोड चलाएँ।

root@kitploit:~
python ./evaluate.py

परिणाम result.csv फ़ाइल में संग्रहीत किए जाते हैं।

root@kitploit:~
Performance of GuardReasoner-VL (GuardReasoner-VL-7B):
ToxicChat           ,HarmBenchPrompt     ,OpenAIModeration    ,AegisSafetyTest     ,SimpleSafetyTests   ,WildGuardTest       ,Average (Text)      ,HarmImageTest       ,SPA-VL-Eval         ,Average (All)       
76.51               ,98.30               ,70.98               ,90.13               ,98.99               ,88.35               ,79.88               ,70.84               ,85.60               ,79.07               
HarmBenchResponse   ,SafeRLHF            ,BeaverTails         ,XSTestReponseHarmful,WildGuardTest       ,Average (Text)      ,SPA-VL-Eval         ,Average (All)       
87.22               ,66.37               ,84.76               ,92.72               ,79.04               ,79.42               ,73.22               ,77.58               

Performance of GuardReasoner-VL (GuardReasoner-VL-Eco-7B):
ToxicChat           ,HarmBenchPrompt     ,OpenAIModeration    ,AegisSafetyTest     ,SimpleSafetyTests   ,WildGuardTest       ,Average (Text)      ,HarmImageTest       ,SPA-VL-Eval         ,Average (All)       
76.26               ,98.73               ,70.82               ,90.34               ,99.50               ,88.54               ,79.82               ,64.84               ,85.26               ,77.49               
HarmBenchResponse   ,SafeRLHF            ,BeaverTails         ,XSTestReponseHarmful,WildGuardTest       ,Average (Text)      ,SPA-VL-Eval         ,Average (All)       
86.22               ,66.15               ,85.51               ,93.33               ,78.60               ,79.51               ,70.81               ,76.94               

Performance of GuardReasoner-VL (GuardReasoner-VL-3B):
ToxicChat           ,HarmBenchPrompt     ,OpenAIModeration    ,AegisSafetyTest     ,SimpleSafetyTests   ,WildGuardTest       ,Average (Text)      ,HarmImageTest       ,SPA-VL-Eval         ,Average (All)       
74.45               ,89.10               ,70.83               ,88.79               ,99.50               ,88.92               ,78.77               ,70.93               ,86.47               ,78.73               
HarmBenchResponse   ,SafeRLHF            ,BeaverTails         ,XSTestReponseHarmful,WildGuardTest       ,Average (Text)      ,SPA-VL-Eval         ,Average (All)       
85.76               ,66.37               ,85.16               ,93.08               ,76.07               ,78.83               ,71.19               ,76.56               

Performance of GuardReasoner-VL (GuardReasoner-VL-Eco-3B):
ToxicChat           ,HarmBenchPrompt     ,OpenAIModeration    ,AegisSafetyTest     ,SimpleSafetyTests   ,WildGuardTest       ,Average (Text)      ,HarmImageTest       ,SPA-VL-Eval         ,Average (All)       
73.47               ,88.58               ,70.87               ,89.04               ,99.50               ,89.16               ,78.43               ,66.79               ,85.82               ,77.39               
HarmBenchResponse   ,SafeRLHF            ,BeaverTails         ,XSTestReponseHarmful,WildGuardTest       ,Average (Text)      ,SPA-VL-Eval         ,Average (All)       
84.72               ,66.96               ,85.39               ,93.59               ,77.39               ,79.31               ,72.01               ,77.14               

मुख्य परिणाम

चित्र 2: मल्टी-मोडल गार्डरेल बेंचमार्क पर GuardReasoner-VL का औसत प्रदर्शन।

तालिका 1: प्रॉम्प्ट हानिकारकता पहचान कार्य का प्रदर्शन।

तालिका 2: प्रतिक्रिया हानिकारकता पहचान कार्य का प्रदर्शन।

विकास संस्करण

GuardReasoner-VL की उत्पादन प्रक्रिया को पुन: उत्पन्न करने के लिए, निम्नलिखित कोड चलाएँ।

root@kitploit:~
bash test.sh

GuardReasoner-VL का उपयोग करने के लिए, निम्नलिखित कोड चलाएँ।

root@kitploit:~
CUDA_VISIBLE_DEVICES=0 python deploy.py

GuardReasoner के प्रशिक्षण प्रक्रिया को पुन: उत्पन्न करने के लिए, प्रशिक्षण पाइपलाइन देखें।

आभार

हमारी विधि आंशिक रूप से निम्नलिखित संसाधनों पर आधारित है। उनके शानदार कार्यों के लिए धन्यवाद।

  • GuardReasoner
  • LLaMA Factory
  • EasyR1
  • Qwen2.5-VL

उद्धरण

यदि आपको यह रिपॉजिटरी उपयोगी लगे, तो कृपया हमारे पेपर को उद्धृत करें।

root@kitploit:~
@article{GuardReasoner,
  title={GuardReasoner: Towards Reasoning-based LLM Safeguards},
  author={Liu, Yue and Gao, Hongcheng and Zhai, Shengfang and Jun, Xia and Wu, Tianyi and Xue, Zhiwei and Chen, Yulin and Kawaguchi, Kenji and Zhang, Jiaheng and Hooi, Bryan},
  journal={arXiv preprint arXiv:2501.18492},
  year={2025}
}


@article{GuardReasoner-VL,
  title={GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning},
  author={Liu, Yue and Zhai, Shengfang and Du, Mingzhe and Chen, Yulin and Cao, Tri and Gao, Hongcheng and Wang, Cheng and Li, Xinfeng and Wang, Kun and Fang, Junfeng and Zhang, Jiaheng and Hooi, Bryan},
  journal={arXiv preprint arXiv:2505.11049},
  year={2025}
}

(शीर्ष पर वापस जाएँ)

टूल डाउनलोड करें