
AutoRAN est un détournement automatisé du raisonnement de sécurité qui exploite des modèles auxiliaires (secondaires) moins alignés pour simuler des traces de raisonnement, générer des prompts narratifs et affiner itérativement ces prompts afin de contourner le raisonnement de sécurité des grands modèles de raisonnement (LRM) modernes.
⚠️ Avertissement : Ce dépôt est destiné exclusivement à la recherche en sécurité contrôlée et au red-teaming pour la sécurité de l'IA.
AutoRAN suit un pipeline en trois étapes :
Vous pouvez trouver les journaux et les résultats dans le répertoire /records. Par exemple :
ls -lh records/
# Clone the repository
git clone {THIS_REPO}
cd AutoRAN
# Install dependencies
pip install -r requirements.txt
# Apply for model access (see HuggingFace link)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main
# Start the model server (recommended: use tmux or screen)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000
# Edit the attack prompt in demo.py as needed
python demo.py
# Follow the command line instructions.
# You may need to copy questions to GPT-o3, GPT-o4 Mini, or Gemini 2.5-Flash/Pro,
# then paste the results back into the terminal as prompted.
# Clone the repository
git clone {THIS_REPO}
cd AutoRAN
# Install dependencies
pip install -r requirements.txt
# Set up chat2api for automatic ChatGPT interaction:
# https://github.com/lanqian528/chat2api
# Apply for model access (see HuggingFace link)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main
# Start the model server (recommended: use tmux or screen)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000
# Run the main experiment script
python main.py
Ce code est publié à des fins de recherche et d'éducation uniquement. Il est destiné à soutenir l'évaluation responsable des vulnérabilités de sécurité des LLM. N'utilisez pas ce code pour cibler des systèmes réels ou pour générer des sorties nuisibles en dehors d'environnements contrôlés.
@misc{liang2025autoranautomatedhijackingsafety,
title={AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models},
author={Jiacheng Liang and Tanqiu Jiang and Yuhui Wang and Rongyi Zhu and Fenglong Ma and Ting Wang},
year={2025},
eprint={2505.10846},
archivePrefix={arXiv},
primaryClass={cs.LG},
url={https://arxiv.org/abs/2505.10846},
}