
Автоматизированный фреймворк для перехвата механизмов безопасного рассуждения в больших моделях рассуждений с помощью смоделированных трассировок рассуждений и итеративного уточнения промптов для генерации эффективных джейлбрейков.
AutoRAN — это инструмент автоматического перехвата механизма безопасных рассуждений (Hijacking of Safety Reasoning), который использует менее выровненные (вторичные) вспомогательные модели для имитации трасс рассуждений, генерации повествовательных промптов и их итеративного уточнения с целью обхода механизма безопасных рассуждений в современных больших моделях рассуждений (LRM).
⚠️ Предупреждение: репозиторий предназначен только для контролируемых исследований в области безопасности и red-teaming систем ИИ.
Процесс AutoRAN состоит из трёх этапов:
Журналы и результаты можно найти в каталоге /records. Например:
ls -lh records/
# Клонируйте репозиторий
git clone {THIS_REPO}
cd AutoRAN
# Установите зависимости
pip install -r requirements.txt
# Запросите доступ к модели (см. ссылку HuggingFace)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main
# Запустите сервер модели (рекомендуется использовать tmux или screen)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000
# При необходимости отредактируйте промпт атаки в файле demo.py
python demo.py
# Следуйте инструкциям в командной строке.
# Возможно, потребуется скопировать вопросы в GPT-o3, GPT-o4 Mini или Gemini 2.5-Flash/Pro,
# а затем вставить ответы обратно в терминал по запросу.
# Клонируйте репозиторий
git clone {THIS_REPO}
cd AutoRAN
# Установите зависимости
pip install -r requirements.txt
# Настройте chat2api для автоматического взаимодействия с ChatGPT:
# https://github.com/lanqian528/chat2api
# Запросите доступ к модели (см. ссылку HuggingFace)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main
# Запустите сервер модели (рекомендуется использовать tmux или screen)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000
# Запустите основной скрипт эксперимента
python main.py
Этот код опубликован только в исследовательских и образовательных целях. Он предназначен для поддержки ответственной оценки уязвимостей безопасности в LLM. Не используйте этот код для атак на реальные системы или для генерации вредоносных выходных данных за пределами контролируемых сред.
@misc{liang2025autoranautomatedhijackingsafety,
title={AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models},
author={Jiacheng Liang and Tanqiu Jiang and Yuhui Wang and Rongyi Zhu and Fenglong Ma and Ting Wang},
year={2025},
eprint={2505.10846},
archivePrefix={arXiv},
primaryClass={cs.LG},
url={https://arxiv.org/abs/2505.10846},
}