Skip to content
KitploitKITPLOIT
أدواتالمدونة
إرسال
أدواتالمدونة
إرسال

أدوات الاختراق واختبار الاختراق والأمن السيبراني لترسانتك الأمنية!

Kitploit هو دليل لأدوات الاختراق والأمن السيبراني واختبار الاختراق. اكتشف آخر تحديثات المشاريع للعثور على الثغرات وتحليل الأنظمة وأتمتة الاختبارات وتعزيز أمنك.

··الخلاصات·اتصال·الخصوصية·© 2026 Kitploit

دليل الأدوات

الفئات

عرض جميع الفئات
Loading categories
Rubrics-as-an-Attack-Surface — بحث برمجي حول انحراف التفضيل المُحفَّز بالمعايير (RIPD): البحث التطوري عن المعايير، والاختيار الحافظ للمعايير المرجعية، وتقييم عدم توافق سياسة DPO في نماذج تقييم LLM. | Kitploit
أدوات/GitHubGitHub/zdcslab/rubrics-as-an-attack-surface
تعلم الآلةالأوراق والأبحاثالتعلم والتعليمأمن الذكاء الاصطناعيالهجوم العدائي
GitHubzdcslab/rubrics-as-an-attack-surface

Rubrics-as-an-Attack-Surface

بحث برمجي حول انحراف التفضيل المُحفَّز بالمعايير (RIPD): البحث التطوري عن المعايير، والاختيار الحافظ للمعايير المرجعية، وتقييم عدم توافق سياسة DPO في نماذج تقييم LLM.

عرض المستودع

الأكثر شعبية

عرض الكل →

اكتشف الأدوات الأكثر استخدامًا من قبل مجتمعنا.

استكشف جميع الأدوات

تصفح مجموعتنا من الأدوات

عرض جميع الأدوات →
مشاركة
613منذ 6 أشهرلم تتم المراجعة بعد

المعايير كسطح هجومي: انحراف التفضيلات الخفي في حكام النماذج اللغوية الكبيرة

📊 مجموعة البيانات  •  🤖 النماذج المدرَّبة  •  📝 الورقة البحثية  •  💻 المستودع

Teaser

يحتوي هذا المستودع على الكود الخاص بالورقة البحثية المعايير كسطح هجومي: انحراف التفضيلات الخفي في حكام النماذج اللغوية الكبيرة من تأليف Ruomeng Ding*، وYifei Pang*، وHe Sun، وYizhong Wang، وSteven Wu، وZhun Deng.

ندرس انحراف التفضيلات المُحرَّض بالمعايير (RIPD) في خطوط أنابيب التقييم والمواءمة القائمة على النماذج اللغوية الكبيرة، موضحين أن تعديلات المعايير التي تجتاز التحقق من المعايير المرجعية يمكن مع ذلك أن تُحرِّض انحرافًا منهجيًا واتجاهيًا في التفضيلات على النطاقات المستهدفة يصعب اكتشافه بالمقاييس القياسية. كما نوضح هجمات التفضيلات القائمة على المعايير ونبيّن كيف ينتشر التحيز الناتج عبر التدريب اللاحق في المراحل التالية، مما يؤدي إلى عدم مواءمة مستمرة للسياسة.

الإعداد

  1. استنسخ مستودع Rubrics-as-an-Attack-Surface.
root@kitploit:~
    git clone https://github.com/ruomengd/Rubrics-as-an-Attack-Surface.git
    cd Rubrics-as-an-Attack-Surface
  1. أنشئ البيئة.
root@kitploit:~
    conda create -n rubrics python=3.9
    conda activate rubrics
    pip install -r requirements.txt

مجموعة البيانات

نستخدم خمس مجموعات بيانات للتفضيلات البشرية (UltraFeedback، وChatbotArena، وRMB، وAnthropic hh-rlhf، وPKU-SafeRLHF) لبناء أربع إعدادات من المعيار–الهدف: Ultra-Real وUltra-Creative للمفيدة (UltraFeedback → ChatbotArena)، وSafeRLHF–RMB وAnthropic–SafeRLHF لغير الضارة. تُحوَّل جميع البيانات إلى صيغة تفضيل زوجية موحّدة؛ تفرض المعايير المرجعية الحفاظ على المعايير، بينما تقيس الأهداف انحراف التفضيلات ذا الصلة بالنشر، مع تجارب السياسة اللاحقة على Ultra-Real وAnthropic–SafeRLHF.

النصوص البرمجية

يُشغَّل خط أنابيب البيانات الكامل (التنزيل، والمعالجة المسبقة، والتصفية، وتقسيم النطاقات) عبر:

root@kitploit:~
sh ./scripts/dataset.sh

بدلاً من ذلك، يمكنك تنزيل البيانات مباشرةً من Hugging Face.

بنية الدليل

بعد اكتمال خط الأنابيب، يكون تخطيط الدليل كما يلي:

root@kitploit:~
data/
├── helpfulness/
│   ├── Ultra-Real/
│   │   ├── Ultra-Real-Bench/
│   │   │   ├── train.jsonl
│   │   │   ├── val.jsonl
│   │   │   └── test.jsonl
│   │   └── Ultra-Real-Target/
│   │       ├── train.jsonl
│   │       ├── val.jsonl
│   │       └── test.jsonl
│   └── ...
├── harmlessness/
│   ├── Anthropic-SafeRLHF/
│   │   ├── Anthropic-SafeRLHF-Bench/
│   │   │   ├── train.jsonl
│   │   │   ├── val.jsonl
│   │   │   └── test.jsonl
│   │   └── Anthropic-SafeRLHF-Target/
│   │       ├── train.jsonl
│   │       ├── val.jsonl
│   │       └── test.jsonl
│   └── ...

المعيار مقابل الهدف.
لكل إعداد من إعدادات مجموعة البيانات، يشير Bench إلى نطاق المعيار المرجعي المستخدم أثناء تطوير المعايير، بينما يشير Target إلى نطاق نشر محجوز يُستخدم لتقييم التعميم وانحراف التفضيلات. تُتحقَّق تعديلات المعايير حصريًا على نطاق Bench ولا تُحسَّن أبدًا باستخدام بيانات Target.

تقسيمات البيانات واستخدامها.

  • train.jsonl: يُستخدم للبحث عن المعايير وتحسينها.
  • val.jsonl: يُستخدم لاختيار المعايير، مما يضمن الامتثال للمعيار المرجعي.
  • test.jsonl: يُستخدم حصريًا لتقييم انحراف التفضيلات المُحرَّض بالمعايير (RIPD) ولا يُ accessed أبدًا أثناء تحرير المعايير.

البحث عن المعايير المتحيزة

يقع كود البحث عن المعايير تحت rubrics_search/search/ ويُنفِّذ إجراءً تطوريًا قائمًا على التجمعات لإيجاد متغيرات معايير تحافظ على المعيار المرجعي ولكنها متحيزة نحو الهدف.

  1. شغِّل البحث التطوري لتوليد معايير مرشحة باستخدام main.py.
  2. اختر أفضل k لكل جيل باستخدام select_rubrics.py.
  3. قيّم المعايير المختارة على target-val (قياس الانحراف المُحرَّض) للاختيار اللاحق.
  4. قيّم المعايير المختارة من target-val باستخدام select_final.py للاختيار اللاحق.

لتشغيل خط أنابيب البحث الكامل عن المعايير:

root@kitploit:~
sh ./scripts/rubrics_search_helpfulness.sh
sh ./scripts/rubrics_search_harmlessness.sh

اختيار المعايير

تُختار المعايير في ظل قيد الحفاظ على المعيار المرجعي: يجب أن يطابق المرشحون أو يتجاوزوا توافق معيار البذرة على تقسيم تحقق محجوز للمعيار المرجعي. ومن بين المرشحين الممكنين، نختار المعيار الذي يُدهور التوافق على تقسيم تحقق الهدف إلى أقصى حد.

root@kitploit:~
sh ./scripts/rubrics_selection.sh

لتقييم قابلية نقل المعايير المُحسَّنة، نوفّر نصوصًا برمجية للتقييم عبر النماذج. لأخذ المعايير المُحسَّنة على نموذج مصدر (النموذج A) واختبار أدائها على نموذج هدف (النموذج B):

root@kitploit:~
sh ./scripts/rubrics_cross_model_eval.sh

تقييم عدم مواءمة السياسة اللاحقة

لتجارب عدم مواءمة السياسة اللاحقة، نركّز على Ultra-Real (المفيدة) وAnthropic–SafeRLHF (غير الضارة)، وندرب نماذج السياسة مباشرةً على تسميات التفضيلات المولَّدة بواسطة المعايير المختارة.

تدريب DPO

  1. ولِّد تسميات التفضيلات باستخدام المعايير المختارة:
root@kitploit:~
sh scripts/dpo_labelling.sh
  1. درِّب السياسة باستخدام بيانات التدريب المُسمَّاة:
root@kitploit:~
sh scripts/dpo_train.sh

تقييم السياسة

شغِّل خط أنابيب التقييم (يمكنك تنفيذ أي مجموعة فرعية من الخطوات) عبر:

root@kitploit:~
sh scripts/dpo_eval.sh

يدعم نص التقييم البرمجي المراحل التالية:

  • توليد استجابات النموذج
  • تقييم الاستجابات (باستخدام المُقيِّمين/نماذج المكافأة)
  • تحليل معدلات الفوز
  • اختيار أفضل-N (BoN) من الاستجابات
  • تقييم المخرجات النهائية بواسطة حَكَم طرف ثالث

استشهد بعملنا

root@kitploit:~
@misc{ding2026rubricsattacksurfacestealthy,
      title={Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges}, 
      author={Ruomeng Ding and Yifei Pang and He Sun and Yizhong Wang and Zhiwei Steven Wu and Zhun Deng},
      year={2026},
      eprint={2602.13576},
      archivePrefix={arXiv},
      primaryClass={cs.CR},
      url={https://arxiv.org/abs/2602.13576}, 
}
تنزيل الأداة