Skip to content
KitploitKITPLOIT
ИнструментыБлог
Отправить
ИнструментыБлог
Отправить

Инструменты для хакинга, пентеста и кибербезопасности — ваш арсенал защиты!

Kitploit — это каталог инструментов для хакинга, кибербезопасности и пентестинга. Находите последние обновления проектов для поиска уязвимостей, анализа систем, автоматизации тестирования и усиления вашей безопасности.

··Ленты·Контакты·Конфиденциальность·© 2026 Kitploit

Каталог инструментов

Категории

Все категории
Loading categories
SecOPD — Исследовательская реализация для смягчения адаптивных инъекций промптов с помощью on-policy дистилляции, включающая рецепты обучения и средства оценки для бенчмарков SEP, PISmith и AgentDojo. | Kitploit
Инструменты/GitHubGitHub/pppyb/secopd
Машинное ОбучениеСтатьи и ИсследованияОбучение и ОбразованиеБезопасность ИИСостязательная Атака
GitHubpppyb/secopd

SecOPD

Исследовательская реализация для смягчения адаптивных инъекций промптов с помощью on-policy дистилляции, включающая рецепты обучения и средства оценки для бенчмарков SEP, PISmith и AgentDojo.

Репозиторий
29 ч 53 мин назадЕщё не проверено

Популярное

Смотреть все →

Откройте для себя самые используемые инструменты нашего сообщества.

Изучить все инструменты

Просмотрите нашу коллекцию инструментов

Смотреть все инструменты →
Поделиться

SecOPD: смягчение адаптивных промпт-инъекций с помощью on-policy дистилляции

Yibo Peng · Long Lian · David Wagner† · Sizhe Chen†

† Совместное руководство.

[Статья] [Страница проекта] [Модель]

В этом релизе реализована финальная KL-формулировка полного ответа из статьи, также называемая вариантом без парсинга. Студент выполняет роллаут в атакованном контексте. Учитель с чистым контекстом, инициализированный из той же базовой модели, оценивает сэмплированные токены студента в парном чистом контексте. Обратный KL-сигнал применяется к каждому сэмплированному токену ответа, включая токены рассуждений; граница </think> не используется для выбора области супервизии.

Структура репозитория

  • training/tinker/: рецепт обучения с KL по полному ответу и точная конфигурация из статьи.
  • scripts/: подготовка данных и утилиты экспорта чекпоинтов Tinker.
  • evaluation/sep/: статические и адаптивные оценщики SEP.
  • evaluation/pismith/: оверлей обучения/оценки PISmith и лаунчеры.
  • evaluation/agentdojo/: утилита AgentDojo и раннер атак.
  • evaluation/lm_eval/: раннер для MMLU-Pro, GPQA Diamond, GSM8K и Minerva MATH.
  • docs/REPRODUCIBILITY.md: сквозные команды и экспериментальные настройки.

Быстрый старт

root@kitploit:~
cp .env.example .env
python scripts/prepare_data.py
bash training/tinker/setup.sh
bash training/tinker/train_full_kl_qwen36.sh

Скрипт настройки выполняет checkout зафиксированного коммита вышестоящего Tinker Cookbook и применяет оверлей исходного кода из этого репозитория. Он не изменяет другие копии Tinker на машине.

Чекпоинты Tinker необходимо конвертировать с помощью маппера весов Tinker Cookbook:

root@kitploit:~
python scripts/export_tinker_adapter.py \
  --tinker-path 'tinker://RUN_ID:train:0/weights/final' \
  --output-dir adapters/secopd-full-kl

Не объединяйте сырой адаптер Tinker с ванильным PEFT. Имена ключей linear-attention Qwen3.6 и lm_head требуют маппинга Tinker, реализованного в tinker_cookbook.weights.

Команды оценки, заметки об оборудовании и точную зафиксированную конфигурацию см. в docs/REPRODUCIBILITY.md.

Безопасность и артефакты

Никакие API-ключи, веса моделей, сгенерированные выходные данные, приватные пути или журналы экспериментов не отслеживаются. Учетные данные считываются из переменных окружения, а конфигурация судьи времени выполнения записывается только в игнорируемую директорию runtime/.

Сторонний код

Обучающий оверлей предназначен для Tinker Cookbook от Thinking Machines Lab. Оценка SEP основана на Meta-SecAlign, оценка PISmith предназначена для PISmith, а оценка AgentDojo — для AgentDojo. Точные вышестоящие ревизии и лицензии перечислены в docs/THIRD_PARTY.md.

Цитирование

root@kitploit:~
@article{peng2026secopd,
  title   = {{SecOPD}: Mitigating Adaptive Prompt Injections by On-Policy Distillation},
  author  = {Peng, Yibo and Lian, Long and Wagner, David and Chen, Sizhe},
  journal = {arXiv preprint arXiv:2608.21500},
  year    = {2026}
}
Скачать инструмент