
AutoRAN es un secuestro automatizado del razonamiento de seguridad que aprovecha modelos auxiliares (secundarios) menos alineados para simular trazas de razonamiento, generar prompts narrativos y refinar iterativamente esos prompts para eludir el razonamiento de seguridad en los grandes modelos de razonamiento (LRM) modernos.
⚠️ Aviso: Este repositorio está destinado únicamente a la investigación de seguridad controlada y al red-teaming de seguridad de IA.
AutoRAN sigue un pipeline de tres etapas:
Puedes encontrar los registros y resultados en el directorio /records. Por ejemplo:
ls -lh records/
# Clone the repository
git clone {THIS_REPO}
cd AutoRAN
# Install dependencies
pip install -r requirements.txt
# Apply for model access (see HuggingFace link)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main
# Start the model server (recommended: use tmux or screen)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000
# Edit the attack prompt in demo.py as needed
python demo.py
# Follow the command line instructions.
# You may need to copy questions to GPT-o3, GPT-o4 Mini, or Gemini 2.5-Flash/Pro,
# then paste the results back into the terminal as prompted.
# Clone the repository
git clone {THIS_REPO}
cd AutoRAN
# Install dependencies
pip install -r requirements.txt
# Set up chat2api for automatic ChatGPT interaction:
# https://github.com/lanqian528/chat2api
# Apply for model access (see HuggingFace link)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main
# Start the model server (recommended: use tmux or screen)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000
# Run the main experiment script
python main.py
Este código se publica únicamente con fines de investigación y educativos. Su objetivo es respaldar la evaluación responsable de las vulnerabilidades de seguridad en los LLM. No utilices este código para atacar sistemas del mundo real ni para generar resultados dañinos fuera de entornos controlados.
@misc{liang2025autoranautomatedhijackingsafety,
title={AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models},
author={Jiacheng Liang and Tanqiu Jiang and Yuhui Wang and Rongyi Zhu and Fenglong Ma and Ting Wang},
year={2025},
eprint={2505.10846},
archivePrefix={arXiv},
primaryClass={cs.LG},
url={https://arxiv.org/abs/2505.10846},
}