Skip to content
KitploitKITPLOIT
HerramientasBlog
Enviar
HerramientasBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

··Feeds·Contacto·Privacidad·© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
Herramientas/GitHubGitHub/jackpurcell/autoran-public
ExplotaciónPapers e InvestigaciónRed TeamingSeguridad de IAAtaque Adversario
GitHubjackpurcell/autoran-public

AutoRAN-public

Ver Repositorio
111hace 10 mesesAún no revisado

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
Compartir

🧠 AutoRAN: Secuestro automatizado del razonamiento de seguridad en grandes modelos de razonamiento

AutoRAN es un secuestro automatizado del razonamiento de seguridad que aprovecha modelos auxiliares (secundarios) menos alineados para simular trazas de razonamiento, generar prompts narrativos y refinar iterativamente esos prompts para eludir el razonamiento de seguridad en los grandes modelos de razonamiento (LRM) modernos.

Visión general de AutoRAN

⚠️ Aviso: Este repositorio está destinado únicamente a la investigación de seguridad controlada y al red-teaming de seguridad de IA.

🔍 Características principales

  • ⚙️ Jailbreak automatizado de múltiples turnos mediante el refinamiento iterativo de prompts
  • 🧩 Plantillas narrativas que enmarcan objetivos maliciosos bajo pretextos educativos/éticos plausibles
  • 🔁 Estrategias de refinamiento que utilizan trazas de razonamiento intermedias para evolucionar los prompts
  • 📈 Tasa de éxito de ataque cercana al 100 % en LRM comerciales
  • 🔬 Evaluado en AdvBench, HarmBench y StrongReject

🛠️ Descripción general del método

AutoRAN sigue un pipeline de tres etapas:

  1. Simular el razonamiento: utiliza un modelo débil para imitar la estructura de CoT de alto nivel de la víctima
  2. Generar el prompt: rellena una plantilla narrativa utilizando el razonamiento simulado
  3. Refinar el prompt: ajusta en función del razonamiento intermedio y de los patrones de rechazo de seguridad

Pipeline de AutoRAN

📊 Resultados

Rendimiento del ataque

📁 Registros de ejecución

Puedes encontrar los registros y resultados en el directorio /records. Por ejemplo:

root@kitploit:~
ls -lh records/

🚀 Inicio rápido: Demo

root@kitploit:~
# Clone the repository
git clone {THIS_REPO}
cd AutoRAN

# Install dependencies
pip install -r requirements.txt

# Apply for model access (see HuggingFace link)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main

# Start the model server (recommended: use tmux or screen)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000

# Edit the attack prompt in demo.py as needed
python demo.py

# Follow the command line instructions.
# You may need to copy questions to GPT-o3, GPT-o4 Mini, or Gemini 2.5-Flash/Pro,
# then paste the results back into the terminal as prompted.

🚀 Flujo de trabajo completo del experimento

root@kitploit:~
# Clone the repository
git clone {THIS_REPO}
cd AutoRAN

# Install dependencies
pip install -r requirements.txt

# Set up chat2api for automatic ChatGPT interaction:
# https://github.com/lanqian528/chat2api

# Apply for model access (see HuggingFace link)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main

# Start the model server (recommended: use tmux or screen)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000

# Run the main experiment script
python main.py

🧷 Aviso legal

Este código se publica únicamente con fines de investigación y educativos. Su objetivo es respaldar la evaluación responsable de las vulnerabilidades de seguridad en los LLM. No utilices este código para atacar sistemas del mundo real ni para generar resultados dañinos fuera de entornos controlados.

📚 Citación

root@kitploit:~
@misc{liang2025autoranautomatedhijackingsafety,
      title={AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models}, 
      author={Jiacheng Liang and Tanqiu Jiang and Yuhui Wang and Rongyi Zhu and Fenglong Ma and Ting Wang},
      year={2025},
      eprint={2505.10846},
      archivePrefix={arXiv},
      primaryClass={cs.LG},
      url={https://arxiv.org/abs/2505.10846}, 
}
Descargar herramienta