Skip to content
KitploitKITPLOIT
ツールエクスプロイトブログ
Log in
提出
ツールエクスプロイトブログ
提出

ハッキング、侵入テスト、サイバーセキュリティツールをあなたのセキュリティアーセナルに!

Kitploitはハッキング、サイバーセキュリティ、ペネトレーションテストのツールディレクトリです。最新のプロジェクトアップデートを見つけて、脆弱性の発見、システム分析、テストの自動化、セキュリティの強化を行いましょう。

フィードお問い合わせプライバシー© 2026 Kitploit

ツールディレクトリ

カテゴリ

すべてのカテゴリを見る
Loading categories
ツール/GitHubGitHub/graph-com/cka-agent
機械学習論文と研究学習と教育レッドチーミングAIセキュリティ敵対的攻撃
GitHubgraph-com/cka-agent

CKA-Agent

商用モデルのガードレールを、無害なプロンプトウィービングと適応的木探索を用いて回避するLLMジェイルブレイクエージェントの研究実装。

リポジトリを見る
21347154ヶ月前Kitploit レビュー済み

人気

すべて見る →

コミュニティで最も使われているツールを見つけましょう。

すべてのツールを探索

ツールコレクションを閲覧

すべてのツールを見る →
共有
ウェブサイト

[ICML 2026 & ICLR 2026 AIWILD] CKA-Agent: 無害なプロンプトウィービングと適応的木探索によるLLMガードレールの回避

arXiv Website GitHub code Cite Python

🛡️ CKAに対する防御

TurnGateは、マルチターン対話システムにおける隠れた悪意のある意図を検出・緩和するために設計された応答認識型の防御メカニズムです。CKA-Agentのような最先端のマルチターン悪意攻撃を防御し、過剰な拒否を避けつつ優れた防御性能を実現します。

🔥 フロンティアモデルにおける最新結果(2025年12月)

CKA-Agentは、GPT-5.2、Gemini-3.0-Pro、Claude-Haiku-4.5を含む最新のフロンティアモデルに対して、一貫して高い攻撃成功率を示しています。結果は以下の通りです:

Model HarmBench StrongREJECT
FS ↑ PS ↑ V ↓ R ↓ FS ↑ PS ↑ V ↓ R ↓
🟢 GPT-5.2 0.889 0.079 0.024 0.008 0.932 0.056 0.006 0.006
🟣 Gemini-3.0-Pro 0.881 0.087 0.000 0.032 0.951 0.037 0.006 0.006
🟠 Claude-Haiku-4.5 0.960 0.024 0.008 0.008 0.969 0.025 0.006 0.000

指標: FS = 完全成功、PS = 部分成功、V = 空虚、R = 拒否。結果は2025年12月に収集されました。

概要

このリポジトリには、無害なプロンプトウィービングと適応的木探索技術を通じて、商用大規模言語モデル(LLM)のガードレールを回避する新しいアプローチであるCKA-Agentの公式実装が含まれています。

CKA-Agent

環境構築

uvをインストール

curl -LsSf https://astral.sh/uv/install.sh | sh

環境を作成

uv venv --python 3.12
source .venv/bin/activate
uv pip install vllm --torch-backend=auto
uv pip install accelerate fastchat nltk pandas google-genai httpx[socks] anthropic

実験設定

config/config.ymlファイルを変更して実験を設定します。以下の項目を制御できます:

  1. テストデータセット: harmbench_ckaやstrongreject_ckaなどの利用可能なデータセットから選択します。
  2. ターゲットモデル: gpt-oss-120bやgemini-2.5-xxxなどのブラックボックスまたはホワイトボックスモデルを選択します。
  3. ジェイルブレイク手法: 実装された各種ベースライン手法を有効化および設定します。
  4. 評価: 評価指標とgemini-2.5-flashなどのジャッジモデルを定義します。
  5. 防御手法: 必要に応じて異なる防御メカニズムを適用します。

詳細な設定手順と例については、設定READMEを参照してください。

実験の実行

run_experiment.shスクリプトは、デフォルトでmain.pyを実行し、実験パイプライン全体(ジェイルブレイクと評価)を実行します。

./run_experiment.sh

run_experiment.shスクリプトを変更するか、main.pyに直接引数を渡すことで、特定のフェーズを実行できます:

  • full: パイプライン全体を実行します(デフォルト)。
  • jailbreak: ジェイルブレイク手法のみを実行します。
  • judge: 既存の結果に対する評価のみを実行します。
  • resume: 中断された実験を再開します。

例(ジェイルブレイクフェーズのみを実行):

python main.py --phase jailbreak

引用

このリポジトリがあなたの研究に役立つ場合は、以下の論文を引用することをご検討ください:

@inproceedings{wei2025trojan,
      title={The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search}, 
      author={Rongzhe Wei and Peizhi Niu and Xinjie Shen and Tony Tu and Yifan Li and Ruihan Wu and Eli Chien and Pin-Yu Chen and Olgica Milenkovic and Pan Li},
    booktitle={Forty-third International Conference on Machine Learning},
    year={2026},
    url={https://openreview.net/forum?id=IlJeOnKW0K}
}
ツールをダウンロード