
[NeurIPS 2025] الكود المصدري الرسمي للورقة البحثية "GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning"
Yue Liu, Shengfang Zhai, Mingzhe Du
Yulin Chen, Tri Cao, Hongcheng Gao, Cheng Wang
Xinfeng Li, Kun Wang, Junfeng Fang, Jiaheng Zhang, Bryan Hooi
1جامعة سنغافورة الوطنية, 2جامعة نانيانغ التكنولوجية
لتعزيز سلامة نماذج الرؤية اللغوية، تقدم هذه الورقة نموذج حارس جديد قائم على الاستدلال لنماذج الرؤية اللغوية يُدعى GuardReasoner-VL. الفكرة الأساسية هي تحفيز نموذج الحارس على الاستدلال بتأنٍ قبل اتخاذ قرارات الإشراف عبر التعلم المعزز عبر الإنترنت. أولاً، نبني GuardReasoner-VLTrain، وهو مرجع استدلالي يضم 123K عينة و631K خطوة استدلال، تغطي مدخلات النص والصورة ومدخلات النص-الصورة. ثم، بناءً عليه، نبدأ تشغيل قدرة الاستدلال لنموذجنا عبر التدريب الموجه (SFT). بالإضافة إلى ذلك، نعزز الاستدلال المتعلق بالإشراف عبر التعلم المعزز عبر الإنترنت. وتحديدًا، لتعزيز تنوع وصعوبة العينات، نُجري أخذ العينات بالرفض متبوعًا بتوسيع البيانات عبر الربط المقترح للبيانات المراعي للسلامة. إلى جانب ذلك، نستخدم معامل اقتطاع ديناميكي لتشجيع الاستكشاف في المراحل المبكرة والاستغلال في المراحل اللاحقة. ولتحقيق التوازن بين الأداء وكفاءة الرموز، نصمم مكافأة سلامة مدركة للطول تدمج الدقة والتنسيق وتكلفة الرموز. تُظهر التجارب الموسعة تفوق نموذجنا. ومن الملاحظ أنه يتفوق على الوصيف بمتوسط 19.27% في درجة F1.
الشكل 1: نظرة عامة على GuardReasoner-VL.
لتقييم GuardReasoner-VL، شغّل الكود التالي.
python ./evaluate.py
تُخزَّن النتائج في ملف result.csv.
Performance of GuardReasoner-VL (GuardReasoner-VL-7B):
ToxicChat ,HarmBenchPrompt ,OpenAIModeration ,AegisSafetyTest ,SimpleSafetyTests ,WildGuardTest ,Average (Text) ,HarmImageTest ,SPA-VL-Eval ,Average (All)
76.51 ,98.30 ,70.98 ,90.13 ,98.99 ,88.35 ,79.88 ,70.84 ,85.60 ,79.07
HarmBenchResponse ,SafeRLHF ,BeaverTails ,XSTestReponseHarmful,WildGuardTest ,Average (Text) ,SPA-VL-Eval ,Average (All)
87.22 ,66.37 ,84.76 ,92.72 ,79.04 ,79.42 ,73.22 ,77.58
Performance of GuardReasoner-VL (GuardReasoner-VL-Eco-7B):
ToxicChat ,HarmBenchPrompt ,OpenAIModeration ,AegisSafetyTest ,SimpleSafetyTests ,WildGuardTest ,Average (Text) ,HarmImageTest ,SPA-VL-Eval ,Average (All)
76.26 ,98.73 ,70.82 ,90.34 ,99.50 ,88.54 ,79.82 ,64.84 ,85.26 ,77.49
HarmBenchResponse ,SafeRLHF ,BeaverTails ,XSTestReponseHarmful,WildGuardTest ,Average (Text) ,SPA-VL-Eval ,Average (All)
86.22 ,66.15 ,85.51 ,93.33 ,78.60 ,79.51 ,70.81 ,76.94
Performance of GuardReasoner-VL (GuardReasoner-VL-3B):
ToxicChat ,HarmBenchPrompt ,OpenAIModeration ,AegisSafetyTest ,SimpleSafetyTests ,WildGuardTest ,Average (Text) ,HarmImageTest ,SPA-VL-Eval ,Average (All)
74.45 ,89.10 ,70.83 ,88.79 ,99.50 ,88.92 ,78.77 ,70.93 ,86.47 ,78.73
HarmBenchResponse ,SafeRLHF ,BeaverTails ,XSTestReponseHarmful,WildGuardTest ,Average (Text) ,SPA-VL-Eval ,Average (All)
85.76 ,66.37 ,85.16 ,93.08 ,76.07 ,78.83 ,71.19 ,76.56
Performance of GuardReasoner-VL (GuardReasoner-VL-Eco-3B):
ToxicChat ,HarmBenchPrompt ,OpenAIModeration ,AegisSafetyTest ,SimpleSafetyTests ,WildGuardTest ,Average (Text) ,HarmImageTest ,SPA-VL-Eval ,Average (All)
73.47 ,88.58 ,70.87 ,89.04 ,99.50 ,89.16 ,78.43 ,66.79 ,85.82 ,77.39
HarmBenchResponse ,SafeRLHF ,BeaverTails ,XSTestReponseHarmful,WildGuardTest ,Average (Text) ,SPA-VL-Eval ,Average (All)
84.72 ,66.96 ,85.39 ,93.59 ,77.39 ,79.31 ,72.01 ,77.14
الشكل 2: متوسط أداء GuardReasoner-VL على معايير الحواجز الواقية متعددة الوسائط.
الجدول 1: أداء مهمة كشف ضرر المطالبات.
الجدول 2: أداء مهمة كشف ضرر الاستجابات.
لإعادة إنتاج عملية التوليد الخاصة بـ GuardReasoner-VL، شغّل الكود التالي.
bash test.sh
لاستخدام GuardReasoner-VL، شغّل الكود التالي.
CUDA_VISIBLE_DEVICES=0 python deploy.py
لإعادة إنتاج عملية التدريب الخاصة بـ GuardReasoner، راجع خط أنابيب التدريب.
تعتمد طريقتنا جزئياً على الموارد التالية. شكراً لأعمالهم الرائعة.
إذا وجدت هذا المستودع مفيداً، يرجى الاستشهاد بورقتنا.
@article{GuardReasoner,
title={GuardReasoner: Towards Reasoning-based LLM Safeguards},
author={Liu, Yue and Gao, Hongcheng and Zhai, Shengfang and Jun, Xia and Wu, Tianyi and Xue, Zhiwei and Chen, Yulin and Kawaguchi, Kenji and Zhang, Jiaheng and Hooi, Bryan},
journal={arXiv preprint arXiv:2501.18492},
year={2025}
}
@article{GuardReasoner-VL,
title={GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning},
author={Liu, Yue and Zhai, Shengfang and Du, Mingzhe and Chen, Yulin and Cao, Tri and Gao, Hongcheng and Wang, Cheng and Li, Xinfeng and Wang, Kun and Fang, Junfeng and Zhang, Jiaheng and Hooi, Bryan},
journal={arXiv preprint arXiv:2505.11049},
year={2025}
}