Skip to content
KitploitKITPLOIT
أدواتالمدونة
إرسال
أدواتالمدونة
إرسال

أدوات الاختراق واختبار الاختراق والأمن السيبراني لترسانتك الأمنية!

Kitploit هو دليل لأدوات الاختراق والأمن السيبراني واختبار الاختراق. اكتشف آخر تحديثات المشاريع للعثور على الثغرات وتحليل الأنظمة وأتمتة الاختبارات وتعزيز أمنك.

··الخلاصات·اتصال·الخصوصية·© 2026 Kitploit

دليل الأدوات

الفئات

عرض جميع الفئات
Loading categories
SecOPD — تطبيق بحثي للتخفيف من حقن التعليمات التكيفية عبر التقطير على السياسة (on-policy distillation)، مع وصفات تدريب ومقيمات لمعايير SEP وPISmith وAgentDojo. | Kitploit
أدوات/GitHubGitHub/pppyb/secopd
تعلم الآلةالأوراق والأبحاثالتعلم والتعليمأمن الذكاء الاصطناعيالهجوم العدائي
GitHubpppyb/secopd

SecOPD

تطبيق بحثي للتخفيف من حقن التعليمات التكيفية عبر التقطير على السياسة (on-policy distillation)، مع وصفات تدريب ومقيمات لمعايير SEP وPISmith وAgentDojo.

عرض المستودع
2منذ 9س 49دلم تتم المراجعة بعد

الأكثر شعبية

عرض الكل →

اكتشف الأدوات الأكثر استخدامًا من قبل مجتمعنا.

استكشف جميع الأدوات

تصفح مجموعتنا من الأدوات

عرض جميع الأدوات →
مشاركة

SecOPD: التخفيف من حقن المطالبات التكيفية عبر التقطير وفق السياسة

Yibo Peng · Long Lian · David Wagner† · Sizhe Chen†

† إشراف مشترك.

[الورقة] [صفحة المشروع] [النموذج]

يوفّر هذا الإصدار صيغة KL لكامل الاستجابة النهائية الواردة في الورقة، وهي موصوفة أيضًا بأنها المتغير بدون تحليل. ينفّذ الطالب التوليد في سياق مُهاجَم، بينما يقيّم معلّم في سياق نظيف، مُهيأ من النموذج الأساسي نفسه، الرموز المولّدة من الطالب في السياق النظيف المقترن. تُطبَّق إشارة KL العكسية على كل رمز استجابة مولّد، بما في ذلك رموز الاستدلال؛ ولا يُستخدم حد </think> لتحديد نطاق الإشراف.

هيكل المستودع

  • training/tinker/: وصفة تدريب KL لكامل الاستجابة والتهيئة الدقيقة الواردة في الورقة.
  • scripts/: أدوات إعداد البيانات وتصدير نقاط تفتيش Tinker.
  • evaluation/sep/: مقيّما SEP الثابت والتكيفي.
  • evaluation/pismith/: طبقة تدريب/تقييم PISmith ومشغّلاتها.
  • evaluation/agentdojo/: أداة AgentDojo ومشغّل الهجمات.
  • evaluation/lm_eval/: مشغّل MMLU-Pro وGPQA Diamond وGSM8K وMinerva MATH.
  • docs/REPRODUCIBILITY.md: أوامر شاملة والإعدادات التجريبية.

بدء سريع

root@kitploit:~
cp .env.example .env
python scripts/prepare_data.py
bash training/tinker/setup.sh
bash training/tinker/train_full_kl_qwen36.sh

يسترجع سكربت الإعداد الالتزام المُثبَّت من مستودع Tinker Cookbook الرئيسي ويطبّق طبقة المصدر في هذا المستودع. وهو لا يعدّل أي نسخة Tinker أخرى على الجهاز.

يجب تحويل نقاط تفتيش Tinker باستخدام محوّل الأوزان في Tinker Cookbook:

root@kitploit:~
python scripts/export_tinker_adapter.py \
  --tinker-path 'tinker://RUN_ID:train:0/weights/final' \
  --output-dir adapters/secopd-full-kl

لا تدمج محوّل Tinker الخام مع PEFT العادي. تتطلب أسماء مفاتيح الانتباه الخطي في Qwen3.6 وlm_head التخطيط الذي يوفره tinker_cookbook.weights.

راجع docs/REPRODUCIBILITY.md للحصول على أوامر التقييم وملاحظات العتاد والتهيئة المجمّدة الدقيقة.

الأمان والملفات

لا تُتتبَّع أي مفاتيح API أو أوزان نماذج أو مخرجات مولّدة أو مسارات خاصة أو سجلات تجارب. تُقرأ بيانات الاعتماد من متغيرات البيئة، وتُكتب تهيئة الحكم وقت التشغيل فقط داخل دليل runtime/ المتجاهَل.

كود الطرف الثالث

تستهدف طبقة التدريب Tinker Cookbook من Thinking Machines Lab. اشتُقّ تقييم SEP من Meta-SecAlign، ويستهدف تقييم PISmith أداة PISmith، ويستهدف تقييم AgentDojo أداة AgentDojo. تُدرَج المراجعات الأصلية الدقيقة والتراخيص في docs/THIRD_PARTY.md.

الاستشهاد

root@kitploit:~
@article{peng2026secopd,
  title   = {{SecOPD}: Mitigating Adaptive Prompt Injections by On-Policy Distillation},
  author  = {Peng, Yibo and Lian, Long and Wagner, David and Chen, Sizhe},
  journal = {arXiv preprint arXiv:2608.21500},
  year    = {2026}
}
تنزيل الأداة