Skip to content
KitploitKITPLOIT
أدواتالمدونة
إرسال
أدواتالمدونة
إرسال

أدوات الاختراق واختبار الاختراق والأمن السيبراني لترسانتك الأمنية!

Kitploit هو دليل لأدوات الاختراق والأمن السيبراني واختبار الاختراق. اكتشف آخر تحديثات المشاريع للعثور على الثغرات وتحليل الأنظمة وأتمتة الاختبارات وتعزيز أمنك.

··الخلاصات·اتصال·الخصوصية·© 2026 Kitploit

دليل الأدوات

الفئات

عرض جميع الفئات
Loading categories
GuardReasoner-VL — [NeurIPS 2025] الكود المصدري الرسمي للورقة البحثية "GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning" | Kitploit
أدوات/GitHubGitHub/yueliu1999/guardreasoner-vl
أدوات دفاعيةتعلم الآلةأمن الذكاء الاصطناعيكشف الشذوذ
GitHubyueliu1999/guardreasoner-vl

GuardReasoner-VL

[NeurIPS 2025] الكود المصدري الرسمي للورقة البحثية "GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning"

عرض المستودع
1259منذ 6 أشهرتمت المراجعة من قبل Kitploit

الأكثر شعبية

عرض الكل →

اكتشف الأدوات الأكثر استخدامًا من قبل مجتمعنا.

استكشف جميع الأدوات

تصفح مجموعتنا من الأدوات

عرض جميع الأدوات →
مشاركة

GuardReasoner-VL: حماية نماذج الرؤية اللغوية عبر الاستدلال المعزّز

Yue Liu, Shengfang Zhai, Mingzhe Du
Yulin Chen, Tri Cao, Hongcheng Gao, Cheng Wang
Xinfeng Li, Kun Wang, Junfeng Fang, Jiaheng Zhang, Bryan Hooi
1جامعة سنغافورة الوطنية, 2جامعة نانيانغ التكنولوجية

لتعزيز سلامة نماذج الرؤية اللغوية، تقدم هذه الورقة نموذج حارس جديد قائم على الاستدلال لنماذج الرؤية اللغوية يُدعى GuardReasoner-VL. الفكرة الأساسية هي تحفيز نموذج الحارس على الاستدلال بتأنٍ قبل اتخاذ قرارات الإشراف عبر التعلم المعزز عبر الإنترنت. أولاً، نبني GuardReasoner-VLTrain، وهو مرجع استدلالي يضم 123K عينة و631K خطوة استدلال، تغطي مدخلات النص والصورة ومدخلات النص-الصورة. ثم، بناءً عليه، نبدأ تشغيل قدرة الاستدلال لنموذجنا عبر التدريب الموجه (SFT). بالإضافة إلى ذلك، نعزز الاستدلال المتعلق بالإشراف عبر التعلم المعزز عبر الإنترنت. وتحديدًا، لتعزيز تنوع وصعوبة العينات، نُجري أخذ العينات بالرفض متبوعًا بتوسيع البيانات عبر الربط المقترح للبيانات المراعي للسلامة. إلى جانب ذلك، نستخدم معامل اقتطاع ديناميكي لتشجيع الاستكشاف في المراحل المبكرة والاستغلال في المراحل اللاحقة. ولتحقيق التوازن بين الأداء وكفاءة الرموز، نصمم مكافأة سلامة مدركة للطول تدمج الدقة والتنسيق وتكلفة الرموز. تُظهر التجارب الموسعة تفوق نموذجنا. ومن الملاحظ أنه يتفوق على الوصيف بمتوسط 19.27% في درجة F1.

الشكل 1: نظرة عامة على GuardReasoner-VL.

التحديثات

  • (2025/09/19) تم قبول GuardReasoner-VL في NeurIPS 2025.
  • (2025/07/01) تم قبول GuardReasoner-VL في ورشة عمل ICML R2-FM.
  • (2025/06/03) تم إصدار خط أنابيب التدريب الخاص بـ Online RL.
  • (2025/05/29) تم إصدار خط أنابيب التدريب الخاص بـ R-SFT.
  • (2025/05/29) تم إصدار بيانات التدريب GuardReasoner-VLTrain وGuardReasoner-VLTrain-Image.
  • (2025/05/18) تم إصدار النماذج (3B-Eco, 3B, 7B-Eco, 7B).
  • (2025/05/18) تم إصدار كود GuardReasoner-VL.
  • (2025/05/18) GuardReasoner-VL متاح على arXiv.

الاستخدام

بدء سريع

لتقييم GuardReasoner-VL، شغّل الكود التالي.

root@kitploit:~
python ./evaluate.py

تُخزَّن النتائج في ملف result.csv.

root@kitploit:~
Performance of GuardReasoner-VL (GuardReasoner-VL-7B):
ToxicChat           ,HarmBenchPrompt     ,OpenAIModeration    ,AegisSafetyTest     ,SimpleSafetyTests   ,WildGuardTest       ,Average (Text)      ,HarmImageTest       ,SPA-VL-Eval         ,Average (All)       
76.51               ,98.30               ,70.98               ,90.13               ,98.99               ,88.35               ,79.88               ,70.84               ,85.60               ,79.07               
HarmBenchResponse   ,SafeRLHF            ,BeaverTails         ,XSTestReponseHarmful,WildGuardTest       ,Average (Text)      ,SPA-VL-Eval         ,Average (All)       
87.22               ,66.37               ,84.76               ,92.72               ,79.04               ,79.42               ,73.22               ,77.58               

Performance of GuardReasoner-VL (GuardReasoner-VL-Eco-7B):
ToxicChat           ,HarmBenchPrompt     ,OpenAIModeration    ,AegisSafetyTest     ,SimpleSafetyTests   ,WildGuardTest       ,Average (Text)      ,HarmImageTest       ,SPA-VL-Eval         ,Average (All)       
76.26               ,98.73               ,70.82               ,90.34               ,99.50               ,88.54               ,79.82               ,64.84               ,85.26               ,77.49               
HarmBenchResponse   ,SafeRLHF            ,BeaverTails         ,XSTestReponseHarmful,WildGuardTest       ,Average (Text)      ,SPA-VL-Eval         ,Average (All)       
86.22               ,66.15               ,85.51               ,93.33               ,78.60               ,79.51               ,70.81               ,76.94               

Performance of GuardReasoner-VL (GuardReasoner-VL-3B):
ToxicChat           ,HarmBenchPrompt     ,OpenAIModeration    ,AegisSafetyTest     ,SimpleSafetyTests   ,WildGuardTest       ,Average (Text)      ,HarmImageTest       ,SPA-VL-Eval         ,Average (All)       
74.45               ,89.10               ,70.83               ,88.79               ,99.50               ,88.92               ,78.77               ,70.93               ,86.47               ,78.73               
HarmBenchResponse   ,SafeRLHF            ,BeaverTails         ,XSTestReponseHarmful,WildGuardTest       ,Average (Text)      ,SPA-VL-Eval         ,Average (All)       
85.76               ,66.37               ,85.16               ,93.08               ,76.07               ,78.83               ,71.19               ,76.56               

Performance of GuardReasoner-VL (GuardReasoner-VL-Eco-3B):
ToxicChat           ,HarmBenchPrompt     ,OpenAIModeration    ,AegisSafetyTest     ,SimpleSafetyTests   ,WildGuardTest       ,Average (Text)      ,HarmImageTest       ,SPA-VL-Eval         ,Average (All)       
73.47               ,88.58               ,70.87               ,89.04               ,99.50               ,89.16               ,78.43               ,66.79               ,85.82               ,77.39               
HarmBenchResponse   ,SafeRLHF            ,BeaverTails         ,XSTestReponseHarmful,WildGuardTest       ,Average (Text)      ,SPA-VL-Eval         ,Average (All)       
84.72               ,66.96               ,85.39               ,93.59               ,77.39               ,79.31               ,72.01               ,77.14               

النتائج الرئيسية

الشكل 2: متوسط أداء GuardReasoner-VL على معايير الحواجز الواقية متعددة الوسائط.

الجدول 1: أداء مهمة كشف ضرر المطالبات.

الجدول 2: أداء مهمة كشف ضرر الاستجابات.

نسخة التطوير

لإعادة إنتاج عملية التوليد الخاصة بـ GuardReasoner-VL، شغّل الكود التالي.

root@kitploit:~
bash test.sh

لاستخدام GuardReasoner-VL، شغّل الكود التالي.

root@kitploit:~
CUDA_VISIBLE_DEVICES=0 python deploy.py

لإعادة إنتاج عملية التدريب الخاصة بـ GuardReasoner، راجع خط أنابيب التدريب.

شكر وتقدير

تعتمد طريقتنا جزئياً على الموارد التالية. شكراً لأعمالهم الرائعة.

  • GuardReasoner
  • LLaMA Factory
  • EasyR1
  • Qwen2.5-VL

الاستشهادات

إذا وجدت هذا المستودع مفيداً، يرجى الاستشهاد بورقتنا.

root@kitploit:~
@article{GuardReasoner,
  title={GuardReasoner: Towards Reasoning-based LLM Safeguards},
  author={Liu, Yue and Gao, Hongcheng and Zhai, Shengfang and Jun, Xia and Wu, Tianyi and Xue, Zhiwei and Chen, Yulin and Kawaguchi, Kenji and Zhang, Jiaheng and Hooi, Bryan},
  journal={arXiv preprint arXiv:2501.18492},
  year={2025}
}


@article{GuardReasoner-VL,
  title={GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning},
  author={Liu, Yue and Zhai, Shengfang and Du, Mingzhe and Chen, Yulin and Cao, Tri and Gao, Hongcheng and Wang, Cheng and Li, Xinfeng and Wang, Kun and Fang, Junfeng and Zhang, Jiaheng and Hooi, Bryan},
  journal={arXiv preprint arXiv:2505.11049},
  year={2025}
}

(العودة إلى الأعلى)

تنزيل الأداة