
تطبيق بحثي للتخفيف من حقن التعليمات التكيفية عبر التقطير على السياسة (on-policy distillation)، مع وصفات تدريب ومقيمات لمعايير SEP وPISmith وAgentDojo.
Yibo Peng · Long Lian · David Wagner† · Sizhe Chen†
† إشراف مشترك.
[الورقة] [صفحة المشروع] [النموذج]
يوفّر هذا الإصدار صيغة KL لكامل الاستجابة النهائية الواردة في الورقة، وهي موصوفة أيضًا بأنها المتغير بدون تحليل. ينفّذ الطالب التوليد في سياق مُهاجَم، بينما يقيّم معلّم في سياق نظيف، مُهيأ من النموذج الأساسي نفسه، الرموز المولّدة من الطالب في السياق النظيف المقترن. تُطبَّق إشارة KL العكسية على كل رمز استجابة مولّد، بما في ذلك رموز الاستدلال؛ ولا يُستخدم حد </think> لتحديد نطاق الإشراف.
training/tinker/: وصفة تدريب KL لكامل الاستجابة والتهيئة الدقيقة الواردة في الورقة.scripts/: أدوات إعداد البيانات وتصدير نقاط تفتيش Tinker.evaluation/sep/: مقيّما SEP الثابت والتكيفي.evaluation/pismith/: طبقة تدريب/تقييم PISmith ومشغّلاتها.evaluation/agentdojo/: أداة AgentDojo ومشغّل الهجمات.evaluation/lm_eval/: مشغّل MMLU-Pro وGPQA Diamond وGSM8K وMinerva MATH.docs/REPRODUCIBILITY.md: أوامر شاملة والإعدادات التجريبية.cp .env.example .env
python scripts/prepare_data.py
bash training/tinker/setup.sh
bash training/tinker/train_full_kl_qwen36.sh
يسترجع سكربت الإعداد الالتزام المُثبَّت من مستودع Tinker Cookbook الرئيسي ويطبّق طبقة المصدر في هذا المستودع. وهو لا يعدّل أي نسخة Tinker أخرى على الجهاز.
يجب تحويل نقاط تفتيش Tinker باستخدام محوّل الأوزان في Tinker Cookbook:
python scripts/export_tinker_adapter.py \
--tinker-path 'tinker://RUN_ID:train:0/weights/final' \
--output-dir adapters/secopd-full-kl
لا تدمج محوّل Tinker الخام مع PEFT العادي. تتطلب أسماء مفاتيح الانتباه الخطي في Qwen3.6 وlm_head التخطيط الذي يوفره tinker_cookbook.weights.
راجع docs/REPRODUCIBILITY.md للحصول على أوامر التقييم وملاحظات العتاد والتهيئة المجمّدة الدقيقة.
لا تُتتبَّع أي مفاتيح API أو أوزان نماذج أو مخرجات مولّدة أو مسارات خاصة أو سجلات تجارب. تُقرأ بيانات الاعتماد من متغيرات البيئة، وتُكتب تهيئة الحكم وقت التشغيل فقط داخل دليل runtime/ المتجاهَل.
تستهدف طبقة التدريب Tinker Cookbook من Thinking Machines Lab. اشتُقّ تقييم SEP من Meta-SecAlign، ويستهدف تقييم PISmith أداة PISmith، ويستهدف تقييم AgentDojo أداة AgentDojo. تُدرَج المراجعات الأصلية الدقيقة والتراخيص في docs/THIRD_PARTY.md.
@article{peng2026secopd,
title = {{SecOPD}: Mitigating Adaptive Prompt Injections by On-Policy Distillation},
author = {Peng, Yibo and Lian, Long and Wagner, David and Chen, Sizhe},
journal = {arXiv preprint arXiv:2608.21500},
year = {2026}
}