Skip to content
KitploitKITPLOIT
أدواتالمدونة
Log in
إرسال
أدواتالمدونة
إرسال

أدوات الاختراق واختبار الاختراق والأمن السيبراني لترسانتك الأمنية!

Kitploit هو دليل لأدوات الاختراق والأمن السيبراني واختبار الاختراق. اكتشف آخر تحديثات المشاريع للعثور على الثغرات وتحليل الأنظمة وأتمتة الاختبارات وتعزيز أمنك.

··الخلاصات·اتصال·الخصوصية·© 2026 Kitploit

دليل الأدوات

الفئات

عرض جميع الفئات
Loading categories
DARWIN — إطار عمل تطوري لكسر حماية نماذج اللغة الكبيرة (LLM) وحواجز الأمان، ينمّي مجموعة استراتيجيات قابلة لإعادة الاستخدام عبر الطفرة الجينية، واختيار ماركوف، والتدريب العدائي عبر الإنترنت لتقييم الأمان. | Kitploit
أدوات/GitHubGitHub/zju-llm-safety/darwin
أدوات دفاعيةتحليل الثغرات الأمنيةتعلم الآلةالأوراق والأبحاثالتعلم والتعليمالفريق الأحمرأمن الذكاء الاصطناعيالهجوم العدائي
GitHubzju-llm-safety/darwin

DARWIN

إطار عمل تطوري لكسر حماية نماذج اللغة الكبيرة (LLM) وحواجز الأمان، ينمّي مجموعة استراتيجيات قابلة لإعادة الاستخدام عبر الطفرة الجينية، واختيار ماركوف، والتدريب العدائي عبر الإنترنت لتقييم الأمان.

عرض المستودع
741041منذ 2 أيامتمت المراجعة من قبل Kitploit

الأكثر شعبية

عرض الكل →

اكتشف الأدوات الأكثر استخدامًا من قبل مجتمعنا.

استكشف جميع الأدوات

تصفح مجموعتنا من الأدوات

عرض جميع الأدوات →
مشاركة

🧬 DARWIN

تطور خصم كسر الحماية والحاجز
لتقييم وحماية أمان نماذج اللغة الكبيرة

Paper Model Python

رسم توضيحي للتطور

إطار هجوم–دفاع تطوري يقرن
DARWIN-Attack مع DARWIN-Guard من خلال التدريب العدائي عبر الإنترنت.

الورقة البحثية · نقطة تفتيش الحاجز · التثبيت · استخدام DARWIN-Attack · استخدام DARWIN-Guard · التدريب · الاقتباس

يصوغ DARWIN كسر الحماية كعملية تطورية مستمرة ويحدّث الحواجز باستمرار من خلال حلقة هجوم–دفاع. يوسّع DARWIN-Attack مجموعة استراتيجيات صريحة من خلال اكتشاف الاستراتيجيات والطفرات والانتقاء، ويؤلف الاستراتيجيات بشكل تكيفي باستخدام ملاحظات الهدف. يتعلم DARWIN-Guard من العينات العدائية الناشئة، ويتدرب بشكل مشترك على الاستعلامات الضارة والحميدة المتنكرة للتعرف على النية الكامنة بدلاً من أنماط الهجوم السطحية.

✨ الميزات الرئيسية

ما يقدمه DARWIN
خصم متطورمجموعة استراتيجيات صريحة قابلة لإعادة الاستخدام تنمو من خلال اكتساب المعرفة الخارجية والتطور الجيني وتأمل الفشل، دون ضبط دقيق لنموذج لغوي مهاجم.
تأليف استراتيجيات تكيفيتهيئة مستنيرة بالتاريخ وانتقالات استراتيجية ماركوفية مع تحديثات مستوحاة من Q-learning، تدعم تقييم كل من نماذج اللغة الكبيرة وحواجز الأمان.
توسيع استراتيجيات مُتحقق منهإزالة التكرار الدلالي تليها مصادقة في بيئة معزولة مقابل نموذج لغوي كبير متوافق قبل دخول الاستراتيجيات المرشحة إلى المجموعة.
تدريب حاجز عدائي عبر الإنترنتتدريب تكراري ضد الخصم المتطور، مع تهيئة كل جولة من نقطة تفتيش الحاجز السابقة.
تصنيف أمان واعٍ بالنيةمطالبات ضارة وحميدة متنكرة مقترنة بنظيراتها الخام، مع الحفاظ على تسميات المصدر لتحسين المتانة مع التخفيف من الرفض المفرط.

📊 النتائج

يحقق DARWIN-Attack أعلى معدل نجاح للهجوم (ASR) عبر جميع الأهداف الستة المُقيَّمة في كلا المعيارين، مقارنة بستة خطوط أساس لكسر الحماية.

الهدفHarmBench ASRAdvBench ASR
DeepSeek-V4-Pro99.7%97.6%
GPT-5.593.7%90.7%
Gemini-3.5-Flash93.0%90.9%
Claude Sonnet 4.678.2%68.2%
Qwen3Guard99.7%98.8%
YuFeng-XGuard99.2%96.7%

يحقق DARWIN-Guard استدعاءً غير آمن بمتوسط 95.0% عبر تسعة معايير للمطالبات الضارة، ومتوسط معدل مرور حميد يقارب 100% عبر ستة معايير حميدة قياسية، ومعدلات مرور حميد تبلغ 97.6% على XSTest و80.0% على JBB-Benign.

🏗️ البنية

إطار DARWIN: تطور الاستراتيجيات والهجمات التكيفية مقترنة بتدريب الحاجز العدائي عبر الإنترنت

يطوّر DARWIN-Attack خصوم كسر الحماية من خلال تطور مجموعة الاستراتيجيات والاختيار التكيفي للاستراتيجيات والتحسين المدفوع بالملاحظات. يتحسن DARWIN-Guard باستمرار من خلال التدريب العدائي عبر الإنترنت بعينات مولّدة بواسطة DARWIN-Attack.

📁 هيكل المشروع

DARWIN/
├── assets/                         # Evolution illustration and framework diagram
├── configs/
│   ├── darwin_attack.example.yaml  # Attack, evolution, and evaluation settings
│   └── darwin_guard.example.yaml   # Online adversarial training and guard evaluation
├── src/
│   ├── darwin_attack/              # Strategy pool, evolution, composition, and evaluation
│   └── darwin_guard/               # Data preparation, attack bridge, training, and inference
├── strategies/
│   ├── final_strategy_pool.jsonl   # Released pool of 200 strategies
│   └── mutation_operators.jsonl    # 15 operators across five dimensions
├── schemas/
│   ├── attack/                     # Dataset, strategy, and mutation-operator formats
│   └── guard/                      # Source, paired-training, and evaluation formats
├── tests/
│   ├── attack/
│   └── guard/
├── NOTICE                          # Third-party attribution
└── pyproject.toml                  # Package dependencies and CLI entry points

🚀 التثبيت

استخدم Python 3.10+. يتطلب الاستدلال والتدريب المحليان PyTorch متوافقًا مع عتادك؛ يستخدم إعداد التدريب CUDA وBF16. تتضمن تبعيات النموذج المحلي Transformers >=5.10.1,<6، بما في ذلك دعم مرشح Gemma المستخدم أثناء التدريب.

git clone https://github.com/ZJU-LLM-Safety/DARWIN.git
cd DARWIN

python -m venv .venv
source .venv/bin/activate
python -m pip install -e '.[api,local,training]'

لاستدلال الحاجز فقط، يكفي python -m pip install -e '.[local]'. شغّل الأوامر أدناه من جذر المستودع.

⚔️ DARWIN-Attack

🔄 أربع آليات تطورية متكاملة

الآليةالدور
التطور بالمعرفة الخارجيةيحوّل المواد المقدمة خارجيًا إلى استراتيجيات مرشحة قابلة لإعادة الاستخدام.
التطور الجيني للاستراتيجياتيولّد مرشحين من خلال التهجين والطفرات للاستراتيجيات الموجودة.
التطور المدفوع بالتأمليحلل ملاحظات الرفض ويحسّن الاستراتيجيات غير الناجحة.
التطور الموجّه بالملاحظاتيستخدم نتائج الهجوم في الوقت الفعلي لتكييف اختيار وتأليف الاستراتيجيات اللاحقة.

🧬 15 عامل طفرة

تُنظَّم العوامل في خمسة أبعاد، بثلاثة عوامل لكل بُعد. تُقدَّم تعريفاتها في mutation_operators.jsonl.

البُعدالعواملالدور
🧠 النفسي والسلطةAuthority Inversion
Emotional Gaslighting
Third-Party Proxy
تغيير الدور الاجتماعي أو المسؤولية المُتصوَّرة.
🌀 المعرفي والمنطقيCognitive Overload
Foot-in-the-Door
Reverse Engineering Logic
إعادة هيكلة مسار الاستدلال.
📦 التنسيقي والبنائيPseudocode Mapping
Low-Resource Language Encoding
Cross-Medium Simulation
تعديل صيغة العرض.
🔓 القيود والحدودRule Redefinition
Token Reward Injection
Constraint Relaxation
تعديل قيود التفاعل المعلنة.
🎭 المنظور والسردAcademic Historicization
Meta-Cognitive Detachment
Fictional Universe Embedding
تغيير المنظور الزمني أو السردي أو السياقي.

🔧 تهيئة النماذج والبيانات

cp configs/darwin_attack.example.yaml configs/darwin_attack.yaml

أكمل معرّفات النماذج وحدود التوليد والأجهزة ومسارات مجموعات البيانات وإعدادات وقت التشغيل في القالب. اضبط معرّفات الهدف ومجموعة البيانات لتجربتك، إلى جانب البذرة العشوائية وعتبة تشابه التاريخ ومعاملات أخذ العينات في البيئة المعزولة. يسجّل models.*.identity اسم عرض النموذج؛ وmodels.*.model هو المعرّف الفعلي المستخدم من مزوّد النموذج لديك.

استخدم provider: transformers للنماذج المحلية أو provider: openai_compatible لنقاط نهاية API المتوافقة. لأدوار API، صدّر متغيرات المفتاح ونقطة النهاية المذكورة في الإعداد، مثل TARGET_API_KEY وTARGET_BASE_URL وJUDGE_API_KEY وJUDGE_BASE_URL. اضبط متغيرات الحكم البديل عند استخدام rejudge. احتفظ ببيانات الاعتماد في متغيرات البيئة.

تُحل مسارات مجموعة البيانات وقاعدة البيانات وملف الطفرات والقالب المخصص في ملف YAML الخاص بالهجوم نسبةً إلى ملف YAML ذلك. استخدم معرّفات Hugging Face الكاملة أو المسارات المطلقة لمواقع النماذج والتضمينات. المسارات المقدمة كوسائط سطر الأوامر نسبةً إلى دليل العمل الحالي.

تنزيل الأداة