
Framework automatizzato per il dirottamento del ragionamento di sicurezza nei modelli di ragionamento di grandi dimensioni tramite tracce di ragionamento simulate e raffinamento iterativo dei prompt per generare jailbreak efficaci.
AutoRAN è un hijacking automatizzato del ragionamento di sicurezza che sfrutta modelli ausiliari (secondari) meno allineati per simulare tracce di ragionamento, generare prompt narrativi e rifinire iterativamente tali prompt per bypassare il ragionamento di sicurezza nei moderni Large Reasoning Models (LRM).
⚠️ Disclaimer: Questo repository è destinato esclusivamente a ricerca sulla sicurezza controllata e red-teaming per la sicurezza dell'IA.
AutoRAN segue una pipeline in tre fasi:
Puoi trovare log e risultati nella directory /records. Ad esempio:
ls -lh records/
# Clone the repository
git clone {THIS_REPO}
cd AutoRAN
# Install dependencies
pip install -r requirements.txt
# Apply for model access (see HuggingFace link)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main
# Start the model server (recommended: use tmux or screen)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000
# Edit the attack prompt in demo.py as needed
python demo.py
# Follow the command line instructions.
# You may need to copy questions to GPT-o3, GPT-o4 Mini, or Gemini 2.5-Flash/Pro,
# then paste the results back into the terminal as prompted.
# Clone the repository
git clone {THIS_REPO}
cd AutoRAN
# Install dependencies
pip install -r requirements.txt
# Set up chat2api for automatic ChatGPT interaction:
# https://github.com/lanqian528/chat2api
# Apply for model access (see HuggingFace link)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main
# Start the model server (recommended: use tmux or screen)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000
# Run the main experiment script
python main.py
Questo codice è rilasciato esclusivamente a scopo di ricerca e didattico. È inteso a supportare la valutazione responsabile delle vulnerabilità di sicurezza nei LLM. Non utilizzare questo codice per prendere di mira sistemi reali o per generare output dannosi al di fuori di ambienti controllati.
@misc{liang2025autoranautomatedhijackingsafety,
title={AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models},
author={Jiacheng Liang and Tanqiu Jiang and Yuhui Wang and Rongyi Zhu and Fenglong Ma and Ting Wang},
year={2025},
eprint={2505.10846},
archivePrefix={arXiv},
primaryClass={cs.LG},
url={https://arxiv.org/abs/2505.10846},
}