Skip to content
KitploitKITPLOIT
أدواتعمليات الاستغلالالمدونة
Log in
إرسال
أدواتعمليات الاستغلالالمدونة
إرسال

أدوات الاختراق واختبار الاختراق والأمن السيبراني لترسانتك الأمنية!

Kitploit هو دليل لأدوات الاختراق والأمن السيبراني واختبار الاختراق. اكتشف آخر تحديثات المشاريع للعثور على الثغرات وتحليل الأنظمة وأتمتة الاختبارات وتعزيز أمنك.

··الخلاصات·اتصال·الخصوصية·© 2026 Kitploit

دليل الأدوات

الفئات

عرض جميع الفئات
Loading categories
CVE-Factory — CVE-Factory | Kitploit
أدوات/GitHubGitHub/livecvebench/cve-factory
أمن الحاوياتالتحليل الديناميكي (عزل)تحليل الثغرات الأمنيةالاستغلالاختبار الاختراقالأوراق والأبحاثالتعلم والتعليمموارد منسقةأمن الذكاء الاصطناعي
GitHublivecvebench/cve-factory

CVE-Factory

CVE-Factory

164718منذ 6 أشهرتمت المراجعة من قبل Kitploit

الأكثر شعبية

عرض الكل →

اكتشف الأدوات الأكثر استخدامًا من قبل مجتمعنا.

استكشف جميع الأدوات

تصفح مجموعتنا من الأدوات

عرض جميع الأدوات →
مشاركة
عرض المستودع

CVE-Factory: توسيع نطاق المهام الوكيلية على مستوى الخبراء لثغرات أمن الكود

Paper Leaderboard Benchmark Model Dataset License: MIT

CVE-Factory هو نظام متعدد الوكلاء (Multi-Agent) لإعادة إنتاج ثغرات CVE آليًا بالكامل ومن البداية إلى النهاية. عند تلقّي سجلات CVE، يبحث النظام تلقائيًا في التفاصيل، وينشئ حالات الاختبار، ويبني بيئات Docker، ويتحقق من أن كل ثغرة يمكن استغلالها وتصحيحها على حد سواء. يحوّل خط الأنابيب بيانات CVE الوصفية إلى بيئات ثغرات قابلة لإعادة الإنتاج والاختبار دون أي تدخل يدوي.

⚠️ تحذير أمني: يبني هذا النظام حاويات Docker تحتوي على برمجيات قابلة للاستغلال ويشغّلها. يجب عليك حتمًا استخدام بيئة Docker-in-Docker (DinD) لعزل حاويات CVE عن نظام المضيف. لا تشغّل CVE-Factory أبدًا مباشرة على برنامج Docker الخفي (daemon) الخاص بالمضيف.

📢 الأخبار

  • [2026-03-27] تمت إضافة 3,181 بيئة مهام CVE جديدة (Hugging Face)، ونموذج Abacus-cve-v1.1 مع 18.8 ألف أثر تدريبي، ومعايير LiveCVEBench-verified وPatchEval-verified. كما أضفنا 4 وكلاء جدد (Judger وChanger وComparer وExpert)، و3 مهارات (cve-test-generator وcheat-detect وcheat-detect-evaluate)، وبدّلنا التحكم في الوصول إلى الأدوات من القائمة المسموحة (allowlist) إلى القائمة المحظورة (denylist). راجع ملاحظات التحديث للتفاصيل.

✨ أبرز المزايا

🤖 أتمتة من البداية إلى النهاية

أدخل سجلات CVE واحصل على بيئة إعادة إنتاج كاملة للثغرة. وفقًا لمعيار Terminal Bench، تتضمن كل حزمة مهام مولّدة:

  • إعداد البيئة: Dockerfile وdocker-compose.yaml لاستضافة التطبيق القابل للاستغلال
  • إعداد المهمة: task.yaml يحتوي على أوصاف تعليمات منظمة (خالية من هوية CVE)
  • الإصلاح المرجعي: solution.sh لتصحيح الثغرة
  • نقطة بدء التقييم: run-tests.sh لبدء التقييم

صُمم منطق الاختبار لدينا خصيصًا لمهام الأمان، وينقسم إلى:

  • test_func.py: اختبارات وظيفية تضمن عمل الميزات الأساسية قبل الإصلاح وبعده
  • test_vuln.py: اختبارات استغلال تتحقق من وجود الثغرة قبل التصحيح وزوالها بعده

لا بحث يدوي، ولا برمجة يدوية - أتمتة كاملة من بيانات CVE الأولية إلى إعادة إنتاج مُتحقق منها.

بنية المخرجات المولّدة:

CVE-2025-XXXX/
├── task.yaml              # Structured Task Metadata
├── Dockerfile          # Vulnerable Environment Setup
├── docker-compose.yaml # Service Orchestration   
├── task-deps/  
├── solution.sh            # Verified Patch
└── test/
    ├── test_func.py       # Functionality Check
    ├── test_vuln.py       # Vulnerability Exploit Check
    └── run-tests.sh           # One-click Evaluation Script 

📊 معدل نجاح مرتفع مثبت

في تقييم واسع النطاق لـ554 ثغرة CVE من عام 2025، نجح CVE-Factory في إعادة إنتاج 499 حالة، محققًا معدل نجاح 90.1%. علاوة على ذلك، أكدت مراجعة خبراء صارمة لـ471 حالة ناجحة أن 312 مهمة (66.2%) أُعيد إنتاجها بشكل كامل ودقيق!

عند المقارنة مع خبراء الأمان باستخدام نفس المعلومات الأولية، حقق نظامنا معدل اجتياز تحقق يبلغ ~95% في بناء البيئة والحل — مما يُظهر قدرة على مستوى الخبراء في إعادة إنتاج الثغرات آليًا.

📂 مجموعة بيانات مفتوحة: ننشر أكثر من 1,000 بيئة مهام CVE في دليل cve_tasks/:

  • trainset/ (887 مهمة): تُستخدم لتدريب Abacus-cve. تُولَّد أكثر من 4,000 من آثار الوكلاء المقطّرة على Hugging Face 🤗 من هذه المهام باستخدام Claude Opus 4.5 مع إطار Mini SWE-Agent.
  • trainset-2/: مهام إضافية بصعوبة أبسط نسبيًا. غير مدرجة في بيانات التدريب.
  • جديد: 3,181 مهمة إضافية متاحة في cve_tasks_3k_compressed على Hugging Face (أرشيف مضغوط بسبب حدود الحجم)، مع 18.8 ألف أثر وكيل لتدريب Abacus-cve-v1.1.

🚀 نتائج التدريب

يؤدي الضبط الدقيق على آثار CVE-Factory إلى تحسينات هائلة عبر معايير الأمان. يحقق Qwen3-32B تحسينًا بنحو ~6.8× على LiveCVEBench (من 5.29% إلى 35.79%)، و~4.2× على PatchEval (من 5.66% إلى 23.58%)، بل ويُظهر مكاسب كبيرة على Terminal-Bench (من 12.50% إلى 28.75%) — مما يثبت تعميمًا قويًا عبر المهام.

النموذجLiveCVEBenchPatchEvalTerminal-Benchالمتوسط
Qwen3-32B (الأساس)5.295.6612.507.82
Abacus-cve (خاص بنا)35.7923.5828.7529.37
Qwen3-Coder-30B10.589.9113.7511.41
Qwen3-Coder-480B19.5819.3436.2525.06
MiniMax-M224.8719.3437.5027.24
Claude Sonnet 420.1122.6433.7525.50
Claude Sonnet 4.534.3928.7745.0036.05
Claude Opus 4.541.2732.0848.7540.70

مع 4 آلاف أثر فقط، يتفوق Abacus-cve (32B) على Qwen3-Coder-480B وMiniMax-M2 وClaude Sonnet 4، مقتربًا من مستوى Claude Sonnet 4.5 في مهام الأمان.

جديد: يحقق Abacus-cve-v1.1 المدرب على 18.8 ألف أثر مكاسب إضافية (+3.83 على LiveCVEBench، +2.38 على PatchEval). راجع cve_train_v1.1 للحصول على بيانات التدريب الموسعة.

🧠 وكلاء Claude Code مستقلون

خلافًا لسير عمل الاسترجاع الجامدة أو حلقات استخدام الأدوات البسيطة، يعمل كل وكيل كجلسة Claude Code كاملة. نحن لا نُرمّز الخطوات بشكل ثابت؛ بل نعرّف كل وكيل من خلال دوره (مثل Analyzer)، وهدفه (مثل "بناء بيئة قابلة للاستغلال")، وموارده (مثل الوصول إلى مستندات محددة)، وطريقة التحقق (مثل "يجب اجتياز check_env_ready"). يتصرف الوكلاء مثل المطورين البشر: يستكشفون الملفات بشكل مستقل، ويصححون الأخطاء، ويقرؤون السجلات، ويكررون الحلول داخل مساحة العمل المخصصة لهم.

⚡ معالجة متوازية لامتزامنة

صُمم CVE-Factory للتعامل مع عدة ثغرات CVE في وقت واحد. ينفذ كل خط أنابيب CVE بشكل لامتزامن، مما يعني أن المهام الأسرع تنتقل إلى المراحل اللاحقة دون انتظار المهام الأبطأ. يستخدم النظام بنية لامتزامنة تتيح لك فصل حدود التزامن لكل نوع وكيل على حدة. على سبيل المثال، يمكنك تعيين حد أعلى لمهام البحث الخفيفة (Analyzer) وحدًا أدنى لمهام Docker المكثفة من حيث الموارد (Builder). تمنع هذه المرونة تحميل النظام الزائد مع زيادة سرعة المعالجة إلى أقصى حد. تضمن المهلات الزمنية على مستوى المرحلة عدم قيام العمليات المعلقة بحظر قائمة انتظار المعالجة.

🧩 خط أنابيب معياري متعدد المراحل

يتكون خط الأنابيب من 6 مراحل مستقلة يمكن تشغيلها منفصلة أو مجتمعة.

  • المرحلة 1 (من Analyzer إلى Generator): تجري بحث CVE وتولّد المخرجات دون الحاجة إلى Docker.

    متطلب الأدوات: يعتمد وكيل Analyzer على أداتي web_search وweb_fetch. إذا كنت تستخدم مزود واجهة برمجة تطبيقات تابعًا لجهة خارجية، فيجب عليك التأكد من أنه يدعم هاتين الأداتين المحددتين.

تنزيل الأداة