
O AutoRAN é um sequestro automatizado do raciocínio de segurança que aproveita modelos auxiliares (secundários) menos alinhados para simular trilhas de raciocínio, gerar prompts narrativos e refinar iterativamente esses prompts para contornar o raciocínio de segurança em modelos de raciocínio avançados (LRMs) modernos.
⚠️ Aviso Legal: Este repositório destina-se exclusivamente a pesquisa controlada de segurança e testes de adversidade (red-teaming) de segurança de IA.
O AutoRAN segue um pipeline de três estágios:
Você pode encontrar logs e resultados no diretório /records. Por exemplo:
ls -lh records/
# Clone o repositório
git clone {ESTE_REPO}
cd AutoRAN
# Instale as dependências
pip install -r requirements.txt
# Solicite acesso aos modelos (veja o link do HuggingFace)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main
# Inicie o servidor de modelos (recomendado: use tmux ou screen)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000
# Edite o prompt de ataque em demo.py conforme necessário
python demo.py
# Siga as instruções da linha de comando.
# Talvez seja necessário copiar as perguntas para GPT-o3, GPT-o4 Mini ou Gemini 2.5-Flash/Pro,
# e colar os resultados de volta no terminal quando solicitado.
# Clone o repositório
git clone {ESTE_REPO}
cd AutoRAN
# Instale as dependências
pip install -r requirements.txt
# Configure o chat2api para interação automática com o ChatGPT:
# https://github.com/lanqian528/chat2api
# Solicite acesso aos modelos (veja o link do HuggingFace)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main
# Inicie o servidor de modelos (recomendado: use tmux ou screen)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000
# Execute o script principal do experimento
python main.py
Este código é disponibilizado apenas para fins de pesquisa e educacionais. Ele destina-se a apoiar a avaliação responsável de vulnerabilidades de segurança em LLMs. Não use este código para atingir sistemas do mundo real ou para gerar saídas prejudiciais fora de ambientes controlados.
@misc{liang2025autoranautomatedhijackingsafety,
title={AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models},
author={Jiacheng Liang and Tanqiu Jiang and Yuhui Wang and Rongyi Zhu and Fenglong Ma and Ting Wang},
year={2025},
eprint={2505.10846},
archivePrefix={arXiv},
primaryClass={cs.LG},
url={https://arxiv.org/abs/2505.10846},
}