Skip to content
KitploitKITPLOIT
ツールブログ
提出
ツールブログ
提出

ハッキング、侵入テスト、サイバーセキュリティツールをあなたのセキュリティアーセナルに!

Kitploitはハッキング、サイバーセキュリティ、ペネトレーションテストのツールディレクトリです。最新のプロジェクトアップデートを見つけて、脆弱性の発見、システム分析、テストの自動化、セキュリティの強化を行いましょう。

··フィード·お問い合わせ·プライバシー·© 2026 Kitploit

ツールディレクトリ

カテゴリ

すべてのカテゴリを見る
Loading categories
SecOPD — 適応的プロンプトインジェクションをオン・ポリシー蒸留(on-policy distillation)で緩和するための研究実装。SEP、PISmith、AgentDojo ベンチマーク向けのトレーニングレシピと評価器を備えています。 | Kitploit
ツール/GitHubGitHub/pppyb/secopd
機械学習論文と研究学習と教育AIセキュリティ敵対的攻撃
GitHubpppyb/secopd

SecOPD

適応的プロンプトインジェクションをオン・ポリシー蒸留(on-policy distillation)で緩和するための研究実装。SEP、PISmith、AgentDojo ベンチマーク向けのトレーニングレシピと評価器を備えています。

リポジトリを見る
29時間53分前未レビュー

人気

すべて見る →

コミュニティで最も使われているツールを見つけましょう。

すべてのツールを探索

ツールコレクションを閲覧

すべてのツールを見る →
共有

SecOPD: オンポリシー蒸留による適応型プロンプトインジェクションの軽減

Yibo Peng · Long Lian · David Wagner† · Sizhe Chen†

† 共同指導。

[論文] [プロジェクトページ] [モデル]

このリリースは、論文の最終的なfull-response KL定式化を実装したものであり、 no-parsingバリアントとも呼ばれます。生徒モデルは攻撃されたコンテキスト下で ロールアウトします。同じベースモデルから初期化されたクリーンコンテキストの教師モデルが、 ペアとなるクリーンコンテキスト下で生徒モデルのサンプリングされたトークンをスコアリングします。 逆KLシグナルは、推論トークンを含むすべてのサンプリングされた応答トークンに適用され、 監視スパンの選択に</think>境界は使用されません。

リポジトリ構成

  • training/tinker/: full-response KLトレーニングレシピと論文の正確な 設定。
  • scripts/: データ準備とTinkerチェックポイントエクスポートユーティリティ。
  • evaluation/sep/: SEP静的・適応型評価器。
  • evaluation/pismith/: PISmithトレーニング/評価オーバーレイとランチャー。
  • evaluation/agentdojo/: AgentDojoユーティリティと攻撃ランナー。
  • evaluation/lm_eval/: MMLU-Pro、GPQA Diamond、GSM8K、Minerva MATHランナー。
  • docs/REPRODUCIBILITY.md: エンドツーエンドのコマンドと実験設定。

クイックスタート

root@kitploit:~
cp .env.example .env
python scripts/prepare_data.py
bash training/tinker/setup.sh
bash training/tinker/train_full_kl_qwen36.sh

セットアップスクリプトは、固定されたアップストリームのTinker Cookbookコミットを チェックアウトし、このリポジトリ内のソースオーバーレイを適用します。 マシン上の他のTinkerチェックアウトは変更されません。

Tinkerチェックポイントは、Tinker Cookbookのウェイトマッパーで変換する必要があります:

root@kitploit:~
python scripts/export_tinker_adapter.py \
  --tinker-path 'tinker://RUN_ID:train:0/weights/final' \
  --output-dir adapters/secopd-full-kl

生のTinkerアダプタをバニラPEFTとマージしないでください。Qwen3.6の linear-attentionおよびlm_headキー名には、tinker_cookbook.weightsによって 実装されたTinkerマッピングが必要です。

評価コマンド、ハードウェアに関する注意事項、正確な固定設定については、 docs/REPRODUCIBILITY.mdを参照してください。

セキュリティとアーティファクト

APIキー、モデルウェイト、生成された出力、プライベートパス、実験ログは 一切追跡されません。認証情報は環境変数から読み取られ、ランタイムのジャッジ設定は 無視されるruntime/ディレクトリ配下にのみ書き込まれます。

サードパーティコード

トレーニングオーバーレイはThinking Machines LabのTinker Cookbookを対象としています。 SEP評価はMeta-SecAlignに由来し、PISmith評価はPISmithを対象とし、AgentDojo評価は AgentDojoを対象としています。正確なアップストリームのリビジョンとライセンスは docs/THIRD_PARTY.mdに記載されています。

引用

root@kitploit:~
@article{peng2026secopd,
  title   = {{SecOPD}: Mitigating Adaptive Prompt Injections by On-Policy Distillation},
  author  = {Peng, Yibo and Lian, Long and Wagner, David and Chen, Sizhe},
  journal = {arXiv preprint arXiv:2608.21500},
  year    = {2026}
}
ツールをダウンロード