
CVE-फैक्ट्री
CVE-Factory पूर्णतः स्वचालित, एंड-टू-एंड CVE पुनरुत्पादन के लिए एक मल्टी-एजेंट प्रणाली है। CVE रिकॉर्ड दिए जाने पर, सिस्टम स्वचालित रूप से विवरणों पर शोध करता है, परीक्षण मामले उत्पन्न करता है, Docker वातावरण बनाता है, और सत्यापित करता है कि प्रत्येक भेद्यता का शोषण और पैच दोनों किया जा सकता है। यह पाइपलाइन CVE मेटाडेटा को बिना मैन्युअल हस्तक्षेप के पुनरुत्पादनीय, परीक्षण-योग्य भेद्यता वातावरण में बदल देती है।
⚠️ सुरक्षा चेतावनी: यह सिस्टम भेद्यता युक्त सॉफ़्टवेयर वाले Docker कंटेनर बनाता और चलाता है। आपको अपने होस्ट सिस्टम से CVE कंटेनरों को अलग करने के लिए Docker-in-Docker (DinD) वातावरण का उपयोग अवश्य करना चाहिए। CVE-Factory को कभी भी सीधे अपने होस्ट Docker डेमॉन पर न चलाएँ।
CVE रिकॉर्ड इनपुट करें, एक पूर्ण CVE पुनरुत्पादन वातावरण प्राप्त करें। Terminal Bench मानक का पालन करते हुए, प्रत्येक उत्पन्न कार्य पैकेज में शामिल है:
Dockerfile और docker-compose.yamltask.yaml जिसमें संरचित निर्देश विवरण (CVE-पहचान-मुक्त) होते हैंsolution.shrun-tests.shविशेष रूप से सुरक्षा कार्यों के लिए डिज़ाइन किया गया, हमारी परीक्षण तर्क दो भागों में विभाजित है:
कोई मैन्युअल शोध नहीं, कोई मैन्युअल कोडिंग नहीं - कच्चे CVE मेटाडेटा से सत्यापित पुनरुत्पादन तक पूर्णतः स्वचालित।
उत्पन्न आर्टिफैक्ट संरचना:
CVE-2025-XXXX/
├── task.yaml # Structured Task Metadata
├── Dockerfile # Vulnerable Environment Setup
├── docker-compose.yaml # Service Orchestration
├── task-deps/
├── solution.sh # Verified Patch
└── test/
├── test_func.py # Functionality Check
├── test_vuln.py # Vulnerability Exploit Check
└── run-tests.sh # One-click Evaluation Script
2025 के 554 CVEs के बड़े पैमाने पर मूल्यांकन में, CVE-Factory ने 499 मामलों को सफलतापूर्वक पुनरुत्पादित किया, जो 90.1% सफलता दर प्राप्त करता है। इसके अलावा, 471 सफल मामलों की कठोर विशेषज्ञ समीक्षा ने पुष्टि की कि 312 कार्य (66.2%) पूरी तरह और सटीक रूप से पुनरुत्पादित किए गए थे!
समान प्रारंभिक जानकारी का उपयोग करने वाले सुरक्षा विशेषज्ञों की तुलना में, हमारी प्रणाली ने वातावरण और समाधान निर्माण पर ~95% सत्यापन पास दर हासिल की — जो स्वचालित भेद्यता पुनरुत्पादन में विशेषज्ञ-स्तर की क्षमता प्रदर्शित करती है।
📂 ओपन डेटासेट: हम
cve_tasks/निर्देशिका में 1,000+ CVE कार्य वातावरण जारी करते हैं:
trainset/(887 कार्य): Abacus-cve के प्रशिक्षण के लिए उपयोग किए जाते हैं। Hugging Face 🤗 पर 4,000+ डिस्टिल्ड एजेंट ट्रेस इन कार्यों से Claude Opus 4.5 और Mini SWE-Agent हार्नेस का उपयोग करके उत्पन्न किए गए हैं।trainset-2/: अपेक्षाकृत सरल कठिनाई वाले अतिरिक्त कार्य। प्रशिक्षण डेटा में शामिल नहीं हैं।- नया: Hugging Face पर
cve_tasks_3k_compressedपर अतिरिक्त 3,181 कार्य उपलब्ध हैं (आकार सीमाओं के कारण संपीड़ित संग्रह), Abacus-cve-v1.1 के प्रशिक्षण के लिए 18.8k एजेंट ट्रेस के साथ।
CVE-Factory ट्रेस पर फाइन-ट्यूनिंग सुरक्षा बेंचमार्क में नाटकीय सुधार लाती है। Qwen3-32B LiveCVEBench पर ~6.8× सुधार (5.29% → 35.79%), PatchEval पर ~4.2× (5.66% → 23.58%) प्राप्त करता है, और यहाँ तक कि Terminal-Bench (12.50% → 28.75%) पर भी महत्वपूर्ण लाभ दिखाता है — जो मजबूत क्रॉस-टास्क सामान्यीकरण प्रदर्शित करता है।
| मॉडल | LiveCVEBench | PatchEval | Terminal-Bench | औसत |
|---|---|---|---|---|
| Qwen3-32B (आधार) | 5.29 | 5.66 | 12.50 | 7.82 |
| Abacus-cve (हमारा) | 35.79 | 23.58 | 28.75 | 29.37 |
| Qwen3-Coder-30B | 10.58 | 9.91 | 13.75 | 11.41 |
| Qwen3-Coder-480B | 19.58 | 19.34 | 36.25 | 25.06 |
| MiniMax-M2 | 24.87 | 19.34 | 37.50 | 27.24 |
| Claude Sonnet 4 | 20.11 | 22.64 | 33.75 | 25.50 |
| Claude Sonnet 4.5 | 34.39 | 28.77 | 45.00 | 36.05 |
| Claude Opus 4.5 | 41.27 | 32.08 | 48.75 | 40.70 |
केवल 4k ट्रेस के साथ, Abacus-cve (32B) सुरक्षा कार्यों में Qwen3-Coder-480B, MiniMax-M2, और Claude Sonnet 4 से बेहतर प्रदर्शन करता है, जो Claude Sonnet 4.5 के स्तर के करीब पहुँचता है।
नया: 18.8k ट्रेस पर प्रशिक्षित Abacus-cve-v1.1 और लाभ प्राप्त करता है (LiveCVEBench पर +3.83, PatchEval पर +2.38)। विस्तृत प्रशिक्षण डेटा के लिए cve_train_v1.1 देखें।
कठोर पुनर्प्राप्ति वर्कफ़्लो या सरल टूल-उपयोग लूप के विपरीत, प्रत्येक एजेंट एक पूर्ण Claude Code सत्र के रूप में संचालित होता है। हम चरणों को हार्ड-कोड नहीं करते; इसके बजाय, हम प्रत्येक एजेंट को उसकी भूमिका (जैसे, Analyzer), लक्ष्य (जैसे, "भेद्यता युक्त वातावरण बनाएँ"), संसाधन (जैसे, विशिष्ट दस्तावेज़ों तक पहुँच), और सत्यापन विधि (जैसे, "check_env_ready पास होना चाहिए") द्वारा परिभाषित करते हैं। एजेंट मानव डेवलपर्स की तरह कार्य करते हैं: वे अपने निर्दिष्ट कार्यक्षेत्र के भीतर स्वायत्त रूप से फ़ाइलों का पता लगाते हैं, त्रुटियों को डीबग करते हैं, लॉग पढ़ते हैं, और समाधानों पर पुनरावृति करते हैं।