Skip to content
KitploitKITPLOIT
HerramientasExploitsBlog
Log in
Enviar
HerramientasExploitsBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

FeedsContactoPrivacidad© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
Herramientas/GitHubGitHub/graph-com/cka-agent
Aprendizaje AutomáticoPapers e InvestigaciónAprendizaje y EducaciónRed TeamingSeguridad de IAAtaque Adversario
GitHubgraph-com/cka-agent

CKA-Agent

Implementación de investigación de un agente de jailbreak para LLM que elude las barreras de seguridad de modelos comerciales mediante el tejido de prompts inofensivos y la búsqueda adaptativa en árbol.

Ver Repositorio
2134715hace 4 mesesRevisado por Kitploit

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
Compartir
Sitio web

[ICML 2026 & ICLR 2026 AIWILD] CKA-Agent: Eludiendo las barreras de seguridad de los LLM mediante el tejido de prompts inofensivos y la búsqueda adaptativa en árbol

arXiv Website GitHub code Cite Python

🛡️ Defensa contra CKA

TurnGate es un mecanismo de defensa consciente de la respuesta, diseñado para detectar y mitigar la intención maliciosa oculta en sistemas de diálogo multiturno. Defiende contra ataques maliciosos multiturno de última generación como CKA-Agent, logrando un gran rendimiento de defensa mientras evita la sobrerrechazo.

🔥 Últimos resultados en modelos de frontera (dic 2025)

CKA-Agent demuestra tasas de éxito de ataque consistentemente altas contra los últimos modelos de frontera, incluidos GPT-5.2, Gemini-3.0-Pro y Claude-Haiku-4.5. Los resultados se resumen a continuación:

Model HarmBench StrongREJECT
FS ↑ PS ↑ V ↓ R ↓ FS ↑ PS ↑ V ↓ R ↓
🟢 GPT-5.2 0.889 0.079 0.024 0.008 0.932 0.056 0.006 0.006
🟣 Gemini-3.0-Pro 0.881 0.087 0.000 0.032 0.951 0.037 0.006 0.006
🟠 Claude-Haiku-4.5 0.960 0.024 0.008 0.008 0.969 0.025 0.006 0.000

Métricas: FS = Éxito total, PS = Éxito parcial, V = Vacuo, R = Rechazo. Resultados recopilados en diciembre de 2025.

Descripción general

Este repositorio contiene la implementación oficial de CKA-Agent, un enfoque novedoso para eludir las barreras de seguridad de los grandes modelos de lenguaje (LLM) comerciales mediante técnicas de tejido de prompts inofensivos y búsqueda adaptativa en árbol.

CKA-Agent

Configuración del entorno

Instalar uv

curl -LsSf https://astral.sh/uv/install.sh | sh

Crear entorno

uv venv --python 3.12
source .venv/bin/activate
uv pip install vllm --torch-backend=auto
uv pip install accelerate fastchat nltk pandas google-genai httpx[socks] anthropic

Configuración del experimento

Configure sus experimentos modificando el archivo config/config.yml. Puede controlar los siguientes aspectos:

  1. Conjunto de datos de prueba: Elija entre los conjuntos de datos disponibles como harmbench_cka o strongreject_cka.
  2. Modelos objetivo: Seleccione modelos de caja negra o caja blanca como gpt-oss-120b o gemini-2.5-xxx.
  3. Métodos de jailbreak: Habilite y configure varios métodos de referencia implementados.
  4. Evaluaciones: Defina métricas de evaluación y modelos jueces como gemini-2.5-flash.
  5. Métodos de defensa: Aplique diferentes mecanismos de defensa según sea necesario.

Para obtener instrucciones de configuración detalladas y ejemplos, consulte el README de configuración.

Ejecución de experimentos

El script run_experiment.sh ejecuta main.py para ejecutar todo el pipeline del experimento (jailbreak y evaluación) de forma predeterminada.

./run_experiment.sh

Puede modificar el script run_experiment.sh o pasar argumentos directamente a main.py para ejecutar fases específicas:

  • full: Ejecuta todo el pipeline (predeterminado).
  • jailbreak: Ejecuta solo los métodos de jailbreak.
  • judge: Ejecuta solo la evaluación sobre los resultados existentes.
  • resume: Reanuda un experimento interrumpido.

Ejemplo (ejecutando solo la fase de jailbreak):

python main.py --phase jailbreak

Citar

Si encuentra este repositorio útil para su investigación, considere citar el siguiente artículo:

@inproceedings{wei2025trojan,
      title={The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search}, 
      author={Rongzhe Wei and Peizhi Niu and Xinjie Shen and Tony Tu and Yifan Li and Ruihan Wu and Eli Chien and Pin-Yu Chen and Olgica Milenkovic and Pan Li},
    booktitle={Forty-third International Conference on Machine Learning},
    year={2026},
    url={https://openreview.net/forum?id=IlJeOnKW0K}
}
Descargar herramienta