
Исследовательская реализация для смягчения адаптивных инъекций промптов с помощью on-policy дистилляции, включающая рецепты обучения и средства оценки для бенчмарков SEP, PISmith и AgentDojo.
Yibo Peng · Long Lian · David Wagner† · Sizhe Chen†
† Совместное руководство.
[Статья] [Страница проекта] [Модель]
В этом релизе реализована финальная KL-формулировка полного ответа из статьи, также называемая вариантом без парсинга. Студент выполняет роллаут в атакованном контексте. Учитель с чистым контекстом, инициализированный из той же базовой модели, оценивает сэмплированные токены студента в парном чистом контексте. Обратный KL-сигнал применяется к каждому сэмплированному токену ответа, включая токены рассуждений; граница </think> не используется для выбора области супервизии.
training/tinker/: рецепт обучения с KL по полному ответу и точная конфигурация из статьи.scripts/: подготовка данных и утилиты экспорта чекпоинтов Tinker.evaluation/sep/: статические и адаптивные оценщики SEP.evaluation/pismith/: оверлей обучения/оценки PISmith и лаунчеры.evaluation/agentdojo/: утилита AgentDojo и раннер атак.evaluation/lm_eval/: раннер для MMLU-Pro, GPQA Diamond, GSM8K и Minerva MATH.docs/REPRODUCIBILITY.md: сквозные команды и экспериментальные настройки.cp .env.example .env
python scripts/prepare_data.py
bash training/tinker/setup.sh
bash training/tinker/train_full_kl_qwen36.sh
Скрипт настройки выполняет checkout зафиксированного коммита вышестоящего Tinker Cookbook и применяет оверлей исходного кода из этого репозитория. Он не изменяет другие копии Tinker на машине.
Чекпоинты Tinker необходимо конвертировать с помощью маппера весов Tinker Cookbook:
python scripts/export_tinker_adapter.py \
--tinker-path 'tinker://RUN_ID:train:0/weights/final' \
--output-dir adapters/secopd-full-kl
Не объединяйте сырой адаптер Tinker с ванильным PEFT. Имена ключей linear-attention Qwen3.6 и lm_head требуют маппинга Tinker, реализованного в tinker_cookbook.weights.
Команды оценки, заметки об оборудовании и точную зафиксированную конфигурацию см. в docs/REPRODUCIBILITY.md.
Никакие API-ключи, веса моделей, сгенерированные выходные данные, приватные пути или журналы экспериментов не отслеживаются. Учетные данные считываются из переменных окружения, а конфигурация судьи времени выполнения записывается только в игнорируемую директорию runtime/.
Обучающий оверлей предназначен для Tinker Cookbook от Thinking Machines Lab. Оценка SEP основана на Meta-SecAlign, оценка PISmith предназначена для PISmith, а оценка AgentDojo — для AgentDojo. Точные вышестоящие ревизии и лицензии перечислены в docs/THIRD_PARTY.md.
@article{peng2026secopd,
title = {{SecOPD}: Mitigating Adaptive Prompt Injections by On-Policy Distillation},
author = {Peng, Yibo and Lian, Long and Wagner, David and Chen, Sizhe},
journal = {arXiv preprint arXiv:2608.21500},
year = {2026}
}