Skip to content
KitploitKITPLOIT
أدواتالمدونة
إرسال
أدواتالمدونة
إرسال

أدوات الاختراق واختبار الاختراق والأمن السيبراني لترسانتك الأمنية!

Kitploit هو دليل لأدوات الاختراق والأمن السيبراني واختبار الاختراق. اكتشف آخر تحديثات المشاريع للعثور على الثغرات وتحليل الأنظمة وأتمتة الاختبارات وتعزيز أمنك.

··الخلاصات·اتصال·الخصوصية·© 2026 Kitploit

دليل الأدوات

الفئات

عرض جميع الفئات
Loading categories
INTACT — كود بحثي يعيد إنتاج تجارب كسر حماية نماذج اللغة الكبيرة متعددة الأدوار (FITD، MRCJ، ActorAttack، X-Teaming) من ورقة التنظيم المنهجي الموجّه بالنية SoK. | Kitploit
أدوات/GitHubGitHub/siyuanli00/intact
تعلم الآلةالأوراق والأبحاثالتعلم والتعليمأمن الذكاء الاصطناعيالهجوم العدائي
GitHubsiyuanli00/intact

INTACT

كود بحثي يعيد إنتاج تجارب كسر حماية نماذج اللغة الكبيرة متعددة الأدوار (FITD، MRCJ، ActorAttack، X-Teaming) من ورقة التنظيم المنهجي الموجّه بالنية SoK.

عرض المستودع
5110منذ 3 أشهرلم تتم المراجعة بعد

الأكثر شعبية

عرض الكل →

اكتشف الأدوات الأكثر استخدامًا من قبل مجتمعنا.

استكشف جميع الأدوات

تصفح مجموعتنا من الأدوات

عرض جميع الأدوات →
مشاركة

تجارب كسر الحماية متعددة الأدوار في SoK

يحتوي هذا المستودع على نسخة الإصدار من الكود المستخدم في تحليلات الآلية في SoK: Intent-Oriented Systematization of Multi-Turn LLM Jailbreaks.

تم تقليص المستودع للاحتفاظ فقط بالكود والمطالبات وملفات التكوين ومجموعات البيانات اللازمة للتجارب الموصوفة في الملحق A من الورقة. تمت إزالة السجلات المُنشأة والملفات المخزنة مؤقتًا والبيئات الافتراضية والنتائج السابقة والرسوم البيانية ومخرجات التحليل المخصصة عن قصد.

تعيين التجارب

سؤال الورقةالطريقة (الطرق)الفئةالدليل المحليمجموعة (مجموعات) البيانات
RQ1: التنظيم مقابل التراكمFITD, MRCJDEA / SRAFoot-in-the-door-Jailbreak/, Inc_Exp/MRCJ/JailbreakBench, MUCD, AdvBench
RQ2: مكونات التضخيمActorAttackDEAactorattack/ActorAttack/HarmBench
RQ3: شكل التصعيدMRCJSRAInc_Exp/MRCJ/MUCD, AdvBench
RQ4: تقدم النموذج الفرعيX-TeamingSRAx-teaming/مجموعة سلوك بنمط JailbreakBench

نظرة عامة على الدليل

  • Foot-in-the-door-Jailbreak/: تنفيذ FITD لتجربة التنظيم مقابل التراكم على جانب DEA في RQ1.
  • Inc_Exp/MRCJ/: تنفيذ MRCJ لمقارنة جانب SRA في RQ1 وتجارب شكل التصعيد في RQ3.
  • actorattack/ActorAttack/: تنفيذ ActorAttack لتجارب عدد الفاعلين والحديث الذاتي في RQ2.
  • x-teaming/: العمود الفقري لـ X-Teaming وإعدادات configs/exp3 لتجربة تقدم النموذج الفرعي A1/A2/A3 في RQ4.

البيئة

تحتفظ كل طريقة بملف التبعيات الأصلي الخاص بها:

root@kitploit:~
pip install -r actorattack/ActorAttack/requirements.txt
pip install -r Foot-in-the-door-Jailbreak/requirements.txt
pip install -r Inc_Exp/requirements.txt
conda env create -f x-teaming/environment.yml

يجب توفير مفاتيح API ونقاط نهاية الخدمة من خلال متغيرات البيئة أو ملفات التكوين المحلية. ملفات .env التي تحتوي على أسرار ليست جزءًا من الإصدار.

تشغيل التجارب

RQ1: FITD

يستخدم FITD مجموعة سلوك JailbreakBench وتكوين هجومه الافتراضي متعدد الأدوار.

root@kitploit:~
cd Foot-in-the-door-Jailbreak
python FITD.py

لإعادة التشغيل القائمة على المطالبات:

root@kitploit:~
python FITD_prompt.py --model_name gpt-4o --control True --max_length 10

RQ1/RQ3: MRCJ

يستخدم MRCJ أسئلة مساعدة بنمط MUCD مع مستويات الخبث وأهداف AdvBench النهائية. تحدد الورقة أربع خطوات تصعيد لـ RQ3.

root@kitploit:~
cd Inc_Exp
python MRCJ/train/train.py --target_model mistral --judge_model gpt-4o --cat_questions_num 2 --harmful_score_threshold 4 --train_from_scratch --dir my_model_data
python MRCJ/test/test.py --target_model mistral --judge_model gpt-4o

استخدم أسماء النماذج المدعومة بواسطة MRCJ/train/train.py و MRCJ/test/test.py.

RQ2: ActorAttack

يستخدم ActorAttack استعلامات HarmBench. غيّر --actors من 1 إلى 5 لتجربة عدد الفاعلين. ثبّت --actors 3 وعطّل الحديث الذاتي في الكود/التكوين لتجربة الحديث الذاتي، بما يتوافق مع إعداد الورقة.

root@kitploit:~
cd actorattack/ActorAttack
python main.py --questions 400 --actors 3 --behavior ./data/harmbench.csv --attack_model_name deepseek-chat --target_model_name gpt-4o --early_stop --step_modify

RQ4: X-Teaming

يستخدم RQ4 العمود الفقري لـ X-Teaming مع DeepSeek-V3 كنموذج مهاجم ويقارن A1 و A2 و A3 تحت نفس ميزانية الأدوار.

root@kitploit:~
cd x-teaming
python main.py --config configs/exp3/A1_gpt4o.yaml
python main.py --config configs/exp3/A2_gpt4o.yaml
python main.py --config configs/exp3/A3_gpt4o.yaml

تتوفر تكوينات مكافئة لنماذج الأهداف الأخرى المستخدمة في الورقة.

التقييم

تستخدم الورقة GPT-4o كحكم آلي بمقياس خبث من 1 إلى 5. تُحتسب الدرجة 4 أو أعلى ككسر حماية ناجح. المخرجات المُنشأة وتقارير الحكم غير مضمنة في هذا الإصدار؛ يجب أن تكتب عمليات إعادة التشغيل سجلات/نتائج جديدة محليًا.

سياسة الإصدار

هذا الكود مخصص فقط لإعادة إنتاج البحث الخاضع للرقابة. يستبعد المستودع عن قصد مخرجات التجارب التاريخية، والبايت كود المخزن مؤقتًا، والبيئات الافتراضية، ودفاتر الملاحظات، والأسرار المحلية، والكود الاستكشافي غير ذي الصلة.

تنزيل الأداة