TurnGate 是一种响应感知的防御机制,旨在检测并缓解多轮对话系统中隐藏的恶意意图。它能够防御像 CKA-Agent 这样的最先进多轮恶意攻击,在实现出色防御性能的同时避免过度拒绝。
CKA-Agent 对最新前沿模型(包括 GPT-5.2、Gemini-3.0-Pro 和 Claude-Haiku-4.5)展现出持续的高攻击成功率。结果总结如下:
| 模型 | HarmBench | StrongREJECT | ||||||
|---|---|---|---|---|---|---|---|---|
| FS ↑ | PS ↑ | V ↓ | R ↓ | FS ↑ | PS ↑ | V ↓ | R ↓ | |
| 🟢 GPT-5.2 | 0.889 | 0.079 | 0.024 | 0.008 | 0.932 | 0.056 | 0.006 | 0.006 |
| 🟣 Gemini-3.0-Pro | 0.881 | 0.087 | 0.000 | 0.032 | 0.951 | 0.037 | 0.006 | 0.006 |
| 🟠 Claude-Haiku-4.5 | 0.960 | 0.024 | 0.008 | 0.008 | 0.969 | 0.025 | 0.006 | 0.000 |
指标: FS = 完全成功,PS = 部分成功,V = 空泛,R = 拒绝。结果收集于 2025 年 12 月。
本仓库包含 CKA-Agent 的官方实现,这是一种通过无害提示编织和自适应树搜索技术绕过商业大型语言模型(LLM)护栏的新方法。

安装 uv
curl -LsSf https://astral.sh/uv/install.sh | sh
创建环境
uv venv --python 3.12
source .venv/bin/activate
uv pip install vllm --torch-backend=auto
uv pip install accelerate fastchat nltk pandas google-genai httpx[socks] anthropic
通过修改 config/config.yml 文件来配置实验。你可以控制以下方面:
harmbench_cka 或 strongreject_cka。gpt-oss-120b 或 gemini-2.5-xxx。gemini-2.5-flash。有关详细的配置说明和示例,请参阅配置 README。
run_experiment.sh 脚本默认执行 main.py 以运行整个实验流程(越狱和评估)。
./run_experiment.sh
你可以修改 run_experiment.sh 脚本或直接向 main.py 传递参数以运行特定阶段:
full:运行整个流程(默认)。jailbreak:仅运行越狱方法。judge:仅对现有结果运行评估。resume:恢复中断的实验。示例(仅运行越狱阶段):
python main.py --phase jailbreak
如果你觉得本仓库对你的研究有用,请考虑引用以下论文:
@inproceedings{wei2025trojan,
title={The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search},
author={Rongzhe Wei and Peizhi Niu and Xinjie Shen and Tony Tu and Yifan Li and Ruihan Wu and Eli Chien and Pin-Yu Chen and Olgica Milenkovic and Pan Li},
booktitle={Forty-third International Conference on Machine Learning},
year={2026},
url={https://openreview.net/forum?id=IlJeOnKW0K}
}