TurnGateは、マルチターン対話システムにおける隠れた悪意のある意図を検出・緩和するために設計された応答認識型の防御メカニズムです。CKA-Agentのような最先端のマルチターン悪意攻撃を防御し、過剰な拒否を避けつつ優れた防御性能を実現します。
CKA-Agentは、GPT-5.2、Gemini-3.0-Pro、Claude-Haiku-4.5を含む最新のフロンティアモデルに対して、一貫して高い攻撃成功率を示しています。結果は以下の通りです:
| Model | HarmBench | StrongREJECT | ||||||
|---|---|---|---|---|---|---|---|---|
| FS ↑ | PS ↑ | V ↓ | R ↓ | FS ↑ | PS ↑ | V ↓ | R ↓ | |
| 🟢 GPT-5.2 | 0.889 | 0.079 | 0.024 | 0.008 | 0.932 | 0.056 | 0.006 | 0.006 |
| 🟣 Gemini-3.0-Pro | 0.881 | 0.087 | 0.000 | 0.032 | 0.951 | 0.037 | 0.006 | 0.006 |
| 🟠 Claude-Haiku-4.5 | 0.960 | 0.024 | 0.008 | 0.008 | 0.969 | 0.025 | 0.006 | 0.000 |
指標: FS = 完全成功、PS = 部分成功、V = 空虚、R = 拒否。結果は2025年12月に収集されました。
このリポジトリには、無害なプロンプトウィービングと適応的木探索技術を通じて、商用大規模言語モデル(LLM)のガードレールを回避する新しいアプローチであるCKA-Agentの公式実装が含まれています。

uvをインストール
curl -LsSf https://astral.sh/uv/install.sh | sh
環境を作成
uv venv --python 3.12
source .venv/bin/activate
uv pip install vllm --torch-backend=auto
uv pip install accelerate fastchat nltk pandas google-genai httpx[socks] anthropic
config/config.ymlファイルを変更して実験を設定します。以下の項目を制御できます:
harmbench_ckaやstrongreject_ckaなどの利用可能なデータセットから選択します。gpt-oss-120bやgemini-2.5-xxxなどのブラックボックスまたはホワイトボックスモデルを選択します。gemini-2.5-flashなどのジャッジモデルを定義します。詳細な設定手順と例については、設定READMEを参照してください。
run_experiment.shスクリプトは、デフォルトでmain.pyを実行し、実験パイプライン全体(ジェイルブレイクと評価)を実行します。
./run_experiment.sh
run_experiment.shスクリプトを変更するか、main.pyに直接引数を渡すことで、特定のフェーズを実行できます:
full: パイプライン全体を実行します(デフォルト)。jailbreak: ジェイルブレイク手法のみを実行します。judge: 既存の結果に対する評価のみを実行します。resume: 中断された実験を再開します。例(ジェイルブレイクフェーズのみを実行):
python main.py --phase jailbreak
このリポジトリがあなたの研究に役立つ場合は、以下の論文を引用することをご検討ください:
@inproceedings{wei2025trojan,
title={The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search},
author={Rongzhe Wei and Peizhi Niu and Xinjie Shen and Tony Tu and Yifan Li and Ruihan Wu and Eli Chien and Pin-Yu Chen and Olgica Milenkovic and Pan Li},
booktitle={Forty-third International Conference on Machine Learning},
year={2026},
url={https://openreview.net/forum?id=IlJeOnKW0K}
}