Skip to content
KitploitKITPLOIT
FerramentasExploitsBlog
Log in
Enviar
FerramentasExploitsBlog
Enviar

Ferramentas de Hacking, PenTest e Cibersegurança para o seu Arsenal de Segurança!

Kitploit é um diretório de ferramentas de hacking, cibersegurança e pentesting. Descubra as últimas atualizações de projetos para encontrar vulnerabilidades, analisar sistemas, automatizar testes e fortalecer sua segurança.

FeedsContatoPrivacidade© 2026 Kitploit

Diretório de Ferramentas

Categorias

Ver todas as categorias
Loading categories
Ferramentas/GitHubGitHub/graph-com/cka-agent
Aprendizado de MáquinaPapers e PesquisaAprendizado e EducaçãoRed TeamingSegurança de IAAtaque Adversário
GitHubgraph-com/cka-agent

CKA-Agent

Implementação de pesquisa de um agente de jailbreak de LLM que contorna as barreiras de proteção de modelos comerciais usando entrelaçamento de prompts inofensivos e busca em árvore adaptativa.

Ver Repositório
2134715há 4 mesesRevisado pelo Kitploit

Mais Populares

Ver todos →

Descubra as ferramentas mais usadas pela nossa comunidade.

Explore todas as ferramentas

Navegue pela nossa coleção de ferramentas

Ver todas as ferramentas →
Compartilhar
Site

[ICML 2026 & ICLR 2026 AIWILD] CKA-Agent: Contornando Guardrails de LLM via Tecelagem de Prompts Inofensivos e Busca em Árvore Adaptativa

arXiv Website GitHub code Cite Python

🛡️ Defesa contra CKA

TurnGate é um mecanismo de defesa ciente da resposta, projetado para detectar e mitigar intenções maliciosas ocultas em sistemas de diálogo multi-turno. Defende contra ataques maliciosos multi-turno de última geração, como o CKA-Agent, alcançando ótimo desempenho de defesa enquanto evita recusas excessivas.

🔥 Resultados Mais Recentes em Modelos de Fronteira (Dez 2025)

O CKA-Agent demonstra taxas de sucesso de ataque consistentemente altas contra os mais recentes modelos de fronteira, incluindo GPT-5.2, Gemini-3.0-Pro e Claude-Haiku-4.5. Os resultados estão resumidos abaixo:

Model HarmBench StrongREJECT
FS ↑ PS ↑ V ↓ R ↓ FS ↑ PS ↑ V ↓ R ↓
🟢 GPT-5.2 0.889 0.079 0.024 0.008 0.932 0.056 0.006 0.006
🟣 Gemini-3.0-Pro 0.881 0.087 0.000 0.032 0.951 0.037 0.006 0.006
🟠 Claude-Haiku-4.5 0.960 0.024 0.008 0.008 0.969 0.025 0.006 0.000

Métricas: FS = Sucesso Total, PS = Sucesso Parcial, V = Vazio, R = Recusa. Resultados coletados em dezembro de 2025.

Visão Geral

Este repositório contém a implementação oficial do CKA-Agent, uma nova abordagem para contornar os guardrails de grandes modelos de linguagem (LLMs) comerciais por meio de técnicas de tecelagem de prompts inofensivos e busca em árvore adaptativa.

CKA-Agent

Configuração do Ambiente

Instale o uv

curl -LsSf https://astral.sh/uv/install.sh | sh

Crie o ambiente

uv venv --python 3.12
source .venv/bin/activate
uv pip install vllm --torch-backend=auto
uv pip install accelerate fastchat nltk pandas google-genai httpx[socks] anthropic

Configuração do Experimento

Configure seus experimentos modificando o arquivo config/config.yml. Você pode controlar os seguintes aspectos:

  1. Conjunto de Dados de Teste: Escolha entre os conjuntos de dados disponíveis, como harmbench_cka ou strongreject_cka.
  2. Modelos Alvo: Selecione modelos de caixa-preta ou caixa-branca, como gpt-oss-120b ou gemini-2.5-xxx.
  3. Métodos de Jailbreak: Habilite e configure vários métodos de linha de base implementados.
  4. Avaliações: Defina métricas de avaliação e modelos juízes, como gemini-2.5-flash.
  5. Métodos de Defesa: Aplique diferentes mecanismos de defesa conforme necessário.

Para instruções detalhadas de configuração e exemplos, consulte o README de configuração.

Executando Experimentos

O script run_experiment.sh executa o main.py para rodar todo o pipeline de experimento (jailbreak e avaliação) por padrão.

./run_experiment.sh

Você pode modificar o script run_experiment.sh ou passar argumentos diretamente para o main.py para executar fases específicas:

  • full: Executa todo o pipeline (padrão).
  • jailbreak: Executa apenas os métodos de jailbreak.
  • judge: Executa apenas a avaliação nos resultados existentes.
  • resume: Retoma um experimento interrompido.

Exemplo (executando apenas a fase de jailbreak):

python main.py --phase jailbreak

Citar

Se você achar este repositório útil para sua pesquisa, por favor considere citar o seguinte artigo:

@inproceedings{wei2025trojan,
      title={The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search}, 
      author={Rongzhe Wei and Peizhi Niu and Xinjie Shen and Tony Tu and Yifan Li and Ruihan Wu and Eli Chien and Pin-Yu Chen and Olgica Milenkovic and Pan Li},
    booktitle={Forty-third International Conference on Machine Learning},
    year={2026},
    url={https://openreview.net/forum?id=IlJeOnKW0K}
}
Baixar ferramenta