Skip to content
KitploitKITPLOIT
工具漏洞利用博客
Log in
提交
工具漏洞利用博客
提交

黑客、渗透测试和网络安全工具,武装您的安全武器库!

Kitploit 是一个黑客、网络安全和渗透测试工具的目录。发现最新的项目更新,查找漏洞、分析系统、自动化测试并加强你的安全。

订阅源联系隐私© 2026 Kitploit

工具目录

分类

查看所有分类
Loading categories
工具/GitHubGitHub/graph-com/cka-agent
机器学习论文与研究学习与教育红队AI 安全对抗性攻击
GitHubgraph-com/cka-agent

CKA-Agent

研究实现了一种LLM越狱代理,该代理利用无害提示编织和自适应树搜索绕过商业模型的防护栏。

查看仓库
21347154个月前Kitploit 审核通过

最受欢迎

查看全部 →

发现我们社区最常用的工具。

探索所有工具

浏览我们的工具集合

查看所有工具 →
分享
网站

[ICML 2026 & ICLR 2026 AIWILD] CKA-Agent:通过无害提示编织与自适应树搜索绕过 LLM 护栏

arXiv Website GitHub code Cite Python

🛡️ 针对 CKA 的防御

TurnGate 是一种响应感知的防御机制,旨在检测并缓解多轮对话系统中隐藏的恶意意图。它能够防御像 CKA-Agent 这样的最先进多轮恶意攻击,在实现出色防御性能的同时避免过度拒绝。

🔥 前沿模型上的最新结果(2025 年 12 月)

CKA-Agent 对最新前沿模型(包括 GPT-5.2、Gemini-3.0-Pro 和 Claude-Haiku-4.5)展现出持续的高攻击成功率。结果总结如下:

模型 HarmBench StrongREJECT
FS ↑ PS ↑ V ↓ R ↓ FS ↑ PS ↑ V ↓ R ↓
🟢 GPT-5.2 0.889 0.079 0.024 0.008 0.932 0.056 0.006 0.006
🟣 Gemini-3.0-Pro 0.881 0.087 0.000 0.032 0.951 0.037 0.006 0.006
🟠 Claude-Haiku-4.5 0.960 0.024 0.008 0.008 0.969 0.025 0.006 0.000

指标: FS = 完全成功,PS = 部分成功,V = 空泛,R = 拒绝。结果收集于 2025 年 12 月。

概述

本仓库包含 CKA-Agent 的官方实现,这是一种通过无害提示编织和自适应树搜索技术绕过商业大型语言模型(LLM)护栏的新方法。

CKA-Agent

环境配置

安装 uv

curl -LsSf https://astral.sh/uv/install.sh | sh

创建环境

uv venv --python 3.12
source .venv/bin/activate
uv pip install vllm --torch-backend=auto
uv pip install accelerate fastchat nltk pandas google-genai httpx[socks] anthropic

实验配置

通过修改 config/config.yml 文件来配置实验。你可以控制以下方面:

  1. 测试数据集:从可用数据集中选择,如 harmbench_cka 或 strongreject_cka。
  2. 目标模型:选择黑盒或白盒模型,如 gpt-oss-120b 或 gemini-2.5-xxx。
  3. 越狱方法:启用并配置各种已实现的基线方法。
  4. 评估:定义评估指标和评判模型,如 gemini-2.5-flash。
  5. 防御方法:根据需要应用不同的防御机制。

有关详细的配置说明和示例,请参阅配置 README。

运行实验

run_experiment.sh 脚本默认执行 main.py 以运行整个实验流程(越狱和评估)。

./run_experiment.sh

你可以修改 run_experiment.sh 脚本或直接向 main.py 传递参数以运行特定阶段:

  • full:运行整个流程(默认)。
  • jailbreak:仅运行越狱方法。
  • judge:仅对现有结果运行评估。
  • resume:恢复中断的实验。

示例(仅运行越狱阶段):

python main.py --phase jailbreak

引用

如果你觉得本仓库对你的研究有用,请考虑引用以下论文:

@inproceedings{wei2025trojan,
      title={The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search}, 
      author={Rongzhe Wei and Peizhi Niu and Xinjie Shen and Tony Tu and Yifan Li and Ruihan Wu and Eli Chien and Pin-Yu Chen and Olgica Milenkovic and Pan Li},
    booktitle={Forty-third International Conference on Machine Learning},
    year={2026},
    url={https://openreview.net/forum?id=IlJeOnKW0K}
}
下载工具