
AutoRAN은 정렬이 덜 된(보조) 보조 모델을 활용하여 추론 흔적을 시뮬레이션하고, 서술형 프롬프트를 생성한 뒤, 이를 반복적으로 정제하여 최신 대형 추론 모델(LRM)의 안전 추론을 우회하는 자동화된 안전 추론 하이재킹 도구입니다.
⚠️ 고지 사항: 이 저장소는 통제된 보안 연구 및 AI 안전 레드티밍(red-teaming) 목적으로만 사용하십시오.
AutoRAN은 3단계 파이프라인으로 동작합니다:
로그와 결과는 /records 디렉토리에서 확인할 수 있습니다. 예시:
ls -lh records/
# 저장소 클론
git clone {THIS_REPO}
cd AutoRAN
# 의존성 설치
pip install -r requirements.txt
# 모델 액세스 신청 (HuggingFace 링크 참조)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main
# 모델 서버 시작 (권장: tmux 또는 screen 사용)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000
# 필요에 따라 demo.py에서 공격 프롬프트 수정
python demo.py
# 명령줄 지침을 따르세요.
# GPT-o3, GPT-o4 Mini 또는 Gemini 2.5-Flash/Pro에 질문을 복사한 다음
# 프롬프트에 따라 결과를 터미널에 다시 붙여넣어야 할 수 있습니다.
# 저장소 클론
git clone {THIS_REPO}
cd AutoRAN
# 의존성 설치
pip install -r requirements.txt
# 자동 ChatGPT 상호작용을 위한 chat2api 설정:
# https://github.com/lanqian528/chat2api
# 모델 액세스 신청 (HuggingFace 링크 참조)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main
# 모델 서버 시작 (권장: tmux 또는 screen 사용)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000
# 메인 실험 스크립트 실행
python main.py
이 코드는 연구 및 교육 목적으로만 공개됩니다. LLM의 안전 취약점에 대한 책임 있는 평가를 지원하기 위한 것입니다. 통제된 환경 밖에서 실제 시스템을 대상으로 이 코드를 사용하거나 유해한 출력을 생성하지 마십시오.
@misc{liang2025autoranautomatedhijackingsafety,
title={AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models},
author={Jiacheng Liang and Tanqiu Jiang and Yuhui Wang and Rongyi Zhu and Fenglong Ma and Ting Wang},
year={2025},
eprint={2505.10846},
archivePrefix={arXiv},
primaryClass={cs.LG},
url={https://arxiv.org/abs/2505.10846},
}