
إطار آلي لاختطاف منطق السلامة في نماذج الاستدلال الكبيرة عبر مسارات استدلال مُحاكاة وتحسين متكرر للموجّهات لتوليد اختراقات فعّالة للحماية.
AutoRAN هو أسلوب آلي للاستيلاء على استدلال السلامة يستفيد من النماذج المساعدة الأقل توافقًا (الثانوية) لمحاكاة مسارات الاستدلال، وتوليد مطالبات سردية، وتحسين تلك المطالبات بشكل تكراري لتجاوز استدلال السلامة في نماذج الاستدلال الكبيرة الحديثة (LRMs).
⚠️ إخلاء مسؤولية: هذا المستودع مخصص لأغراض البحث الأمني الخاضع للرقابة والاختبار الأحمر لسلامة الذكاء الاصطناعي فقط.
يتبع AutoRAN مسارًا من ثلاث مراحل:
يمكنك العثور على السجلات والنتائج في دليل /records. على سبيل المثال:
ls -lh records/
# Clone the repository
git clone {THIS_REPO}
cd AutoRAN
# Install dependencies
pip install -r requirements.txt
# Apply for model access (see HuggingFace link)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main
# Start the model server (recommended: use tmux or screen)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000
# Edit the attack prompt in demo.py as needed
python demo.py
# Follow the command line instructions.
# You may need to copy questions to GPT-o3, GPT-o4 Mini, or Gemini 2.5-Flash/Pro,
# then paste the results back into the terminal as prompted.
# Clone the repository
git clone {THIS_REPO}
cd AutoRAN
# Install dependencies
pip install -r requirements.txt
# Set up chat2api for automatic ChatGPT interaction:
# https://github.com/lanqian528/chat2api
# Apply for model access (see HuggingFace link)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main
# Start the model server (recommended: use tmux or screen)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000
# Run the main experiment script
python main.py
تم إصدار هذا الكود لأغراض البحث والتعليم فقط. وهو مخصص لدعم التقييم المسؤول لثغرات السلامة في نماذج اللغات الكبيرة (LLMs). لا تستخدم هذا الكود لاستهداف أنظمة في العالم الحقيقي أو لتوليد مخرجات ضارة خارج البيئات الخاضعة للرقابة.
@misc{liang2025autoranautomatedhijackingsafety,
title={AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models},
author={Jiacheng Liang and Tanqiu Jiang and Yuhui Wang and Rongyi Zhu and Fenglong Ma and Ting Wang},
year={2025},
eprint={2505.10846},
archivePrefix={arXiv},
primaryClass={cs.LG},
url={https://arxiv.org/abs/2505.10846},
}