Skip to content
KitploitKITPLOIT
أدواتالمدونة
إرسال
أدواتالمدونة
إرسال

أدوات الاختراق واختبار الاختراق والأمن السيبراني لترسانتك الأمنية!

Kitploit هو دليل لأدوات الاختراق والأمن السيبراني واختبار الاختراق. اكتشف آخر تحديثات المشاريع للعثور على الثغرات وتحليل الأنظمة وأتمتة الاختبارات وتعزيز أمنك.

··الخلاصات·اتصال·الخصوصية·© 2026 Kitploit

دليل الأدوات

الفئات

عرض جميع الفئات
Loading categories
AutoRAN-public — إطار آلي لاختطاف منطق السلامة في نماذج الاستدلال الكبيرة عبر مسارات استدلال مُحاكاة وتحسين متكرر للموجّهات لتوليد اختراقات فعّالة للحماية. | Kitploit
أدوات/GitHubGitHub/jackpurcell/autoran-public
الاستغلالالأوراق والأبحاثالفريق الأحمرأمن الذكاء الاصطناعيالهجوم العدائي
GitHubjackpurcell/autoran-public

AutoRAN-public

إطار آلي لاختطاف منطق السلامة في نماذج الاستدلال الكبيرة عبر مسارات استدلال مُحاكاة وتحسين متكرر للموجّهات لتوليد اختراقات فعّالة للحماية.

عرض المستودع
111منذ 10 أشهرلم تتم المراجعة بعد

الأكثر شعبية

عرض الكل →

اكتشف الأدوات الأكثر استخدامًا من قبل مجتمعنا.

استكشف جميع الأدوات

تصفح مجموعتنا من الأدوات

عرض جميع الأدوات →
مشاركة

🧠 AutoRAN: الاستيلاء الآلي على استدلال السلامة في نماذج الاستدلال الكبيرة

AutoRAN هو أسلوب آلي للاستيلاء على استدلال السلامة يستفيد من النماذج المساعدة الأقل توافقًا (الثانوية) لمحاكاة مسارات الاستدلال، وتوليد مطالبات سردية، وتحسين تلك المطالبات بشكل تكراري لتجاوز استدلال السلامة في نماذج الاستدلال الكبيرة الحديثة (LRMs).

نظرة عامة على AutoRAN

⚠️ إخلاء مسؤولية: هذا المستودع مخصص لأغراض البحث الأمني الخاضع للرقابة والاختبار الأحمر لسلامة الذكاء الاصطناعي فقط.

🔍 الميزات الرئيسية

  • ⚙️ كسر الحماية الآلي متعدد الأدوار عبر التحسين التكراري للمطالبات
  • 🧩 قوالب سردية تؤطر الأهداف الضارة بذريعة تعليمية/أخلاقية معقولة
  • 🔁 استراتيجيات تحسين تستخدم مسارات الاستدلال الوسيطة لتطوير المطالبات
  • 📈 معدل نجاح هجوم يقارب 100% عبر نماذج LRMs التجارية
  • 🔬 تم التقييم على AdvBench و HarmBench و StrongReject

🛠️ نظرة عامة على المنهجية

يتبع AutoRAN مسارًا من ثلاث مراحل:

  1. محاكاة الاستدلال: استخدام نموذج ضعيف لمحاكاة بنية سلسلة الأفكار (CoT) عالية المستوى للنموذج المستهدف
  2. توليد المطالبة: ملء قالب سردي باستخدام الاستدلال المُحاكى
  3. تحسين المطالبة: التعديل بناءً على الاستدلال الوسيط وأنماط رفض السلامة

مسار عمل AutoRAN

📊 النتائج

أداء الهجوم

📁 سجلات التشغيل

يمكنك العثور على السجلات والنتائج في دليل /records. على سبيل المثال:

root@kitploit:~
ls -lh records/

🚀 بدء سريع: عرض توضيحي

root@kitploit:~
# Clone the repository
git clone {THIS_REPO}
cd AutoRAN

# Install dependencies
pip install -r requirements.txt

# Apply for model access (see HuggingFace link)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main

# Start the model server (recommended: use tmux or screen)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000

# Edit the attack prompt in demo.py as needed
python demo.py

# Follow the command line instructions.
# You may need to copy questions to GPT-o3, GPT-o4 Mini, or Gemini 2.5-Flash/Pro,
# then paste the results back into the terminal as prompted.

🚀 سير العمل الكامل للتجربة

root@kitploit:~
# Clone the repository
git clone {THIS_REPO}
cd AutoRAN

# Install dependencies
pip install -r requirements.txt

# Set up chat2api for automatic ChatGPT interaction:
# https://github.com/lanqian528/chat2api

# Apply for model access (see HuggingFace link)
# https://huggingface.co/huihui-ai/Qwen3-8B-abliterated/tree/main

# Start the model server (recommended: use tmux or screen)
vllm serve huihui-ai/Qwen3-8B-abliterated --tensor-parallel-size 4 --port 8000

# Run the main experiment script
python main.py

🧷 إخلاء المسؤولية

تم إصدار هذا الكود لأغراض البحث والتعليم فقط. وهو مخصص لدعم التقييم المسؤول لثغرات السلامة في نماذج اللغات الكبيرة (LLMs). لا تستخدم هذا الكود لاستهداف أنظمة في العالم الحقيقي أو لتوليد مخرجات ضارة خارج البيئات الخاضعة للرقابة.

📚 الاستشهاد

root@kitploit:~
@misc{liang2025autoranautomatedhijackingsafety,
      title={AutoRAN: Automated Hijacking of Safety Reasoning in Large Reasoning Models}, 
      author={Jiacheng Liang and Tanqiu Jiang and Yuhui Wang and Rongyi Zhu and Fenglong Ma and Ting Wang},
      year={2025},
      eprint={2505.10846},
      archivePrefix={arXiv},
      primaryClass={cs.LG},
      url={https://arxiv.org/abs/2505.10846}, 
}
تنزيل الأداة