
CVE-Factory
CVE-Factory ist ein Multi-Agenten-System für die vollautomatische End-to-End-Reproduktion von CVEs. Ausgehend von CVE-Einträgen recherchiert das System automatisch Details, generiert Testfälle, erstellt Docker-Umgebungen und validiert, dass jede Schwachstelle sowohl ausgenutzt als auch gepatcht werden kann. Die Pipeline wandelt CVE-Metadaten ohne manuelles Eingreifen in reproduzierbare, testbare Schwachstellenumgebungen um.
⚠️ Sicherheitswarnung: Dieses System erstellt und startet Docker-Container, die verwundbare Software enthalten. Du MUSST die Docker-in-Docker-Umgebung (DinD) verwenden, um die CVE-Container von deinem Host-System zu isolieren. Führe CVE-Factory niemals direkt auf deinem Host-Docker-Daemon aus.
CVE-Einträge eingeben, eine vollständige CVE-Reproduktionsumgebung erhalten. Dem Terminal-Bench-Standard folgend enthält jedes generierte Aufgabenpaket:
Dockerfile und docker-compose.yaml zum Hosten der verwundbaren Anwendungtask.yaml mit strukturierten Anweisungsbeschreibungen (ohne CVE-Identität)solution.sh zum Patchen der Schwachstellerun-tests.sh zum Starten der EvaluierungUnsere Testlogik ist speziell für Sicherheitsaufgaben ausgelegt und gliedert sich in:
Keine manuelle Recherche, keine manuelle Programmierung - vollautomatisch von den rohen CVE-Metadaten bis zur validierten Reproduktion.
Struktur der generierten Artefakte:
CVE-2025-XXXX/
├── task.yaml # Structured Task Metadata
├── Dockerfile # Vulnerable Environment Setup
├── docker-compose.yaml # Service Orchestration
├── task-deps/
├── solution.sh # Verified Patch
└── test/
├── test_func.py # Functionality Check
├── test_vuln.py # Vulnerability Exploit Check
└── run-tests.sh # One-click Evaluation Script
In einer groß angelegten Evaluierung von 554 CVEs aus dem Jahr 2025 reproduzierte CVE-Factory erfolgreich 499 Fälle, was einer Erfolgsquote von 90,1 % entspricht. Darüber hinaus bestätigte eine strenge Expertenprüfung von 471 erfolgreichen Fällen, dass 312 Aufgaben (66,2 %) vollständig und präzise reproduziert wurden!
Im Vergleich zu Sicherheitsexperten, die identische Ausgangsinformationen verwendeten, erreichte unser System eine Verifizierungs-Bestehensquote von ~95 % beim Aufbau von Umgebung und Lösung — ein Beleg für Fähigkeiten auf Expertenniveau bei der automatisierten Schwachstellenreproduktion.
📂 Offener Datensatz: Wir veröffentlichen über 1.000 CVE-Aufgabenumgebungen im Verzeichnis
cve_tasks/:
trainset/(887 Aufgaben): Wird für das Training von Abacus-cve verwendet. Die über 4.000 destillierten Agenten-Traces auf Hugging Face 🤗 werden aus diesen Aufgaben mit Claude Opus 4.5 und einem Mini-SWE-Agent-Harness generiert.trainset-2/: Zusätzliche Aufgaben mit vergleichsweise geringerem Schwierigkeitsgrad. Nicht in den Trainingsdaten enthalten.- NEU: Weitere 3.181 Aufgaben sind unter
cve_tasks_3k_compressedauf Hugging Face verfügbar (komprimiertes Archiv aufgrund von Größenbeschränkungen), mit 18,8k Agenten-Traces zum Training von Abacus-cve-v1.1.
Feinabstimmung (Fine-Tuning) mit CVE-Factory-Traces führt zu dramatischen Verbesserungen bei Sicherheits-Benchmarks. Qwen3-32B erreicht eine ~6,8-fache Verbesserung bei LiveCVEBench (5,29 % → 35,79 %), ~4,2-fach bei PatchEval (5,66 % → 23,58 %) und zeigt sogar deutliche Zugewinne bei Terminal-Bench (12,50 % → 28,75 %) — was eine starke aufgabenübergreifende Generalisierung demonstriert.
| Modell | LiveCVEBench | PatchEval | Terminal-Bench | Ø |
|---|---|---|---|---|
| Qwen3-32B (Basis) | 5,29 | 5,66 | 12,50 | 7,82 |
| Abacus-cve (Unser) | 35,79 | 23,58 | 28,75 | 29,37 |
| Qwen3-Coder-30B | 10,58 | 9,91 | 13,75 | 11,41 |
| Qwen3-Coder-480B | 19,58 | 19,34 | 36,25 | 25,06 |
| MiniMax-M2 | 24,87 | 19,34 | 37,50 | 27,24 |
| Claude Sonnet 4 | 20,11 | 22,64 | 33,75 | 25,50 |
| Claude Sonnet 4.5 | 34,39 | 28,77 | 45,00 | 36,05 |
| Claude Opus 4.5 | 41,27 | 32,08 | 48,75 | 40,70 |
Mit nur 4k Traces übertrifft Abacus-cve (32B) Qwen3-Coder-480B, MiniMax-M2 und Claude Sonnet 4 und erreicht bei Sicherheitsaufgaben nahezu das Niveau von Claude Sonnet 4.5.
NEU: Abacus-cve-v1.1, trainiert auf 18,8k Traces, erzielt weitere Zugewinne (+3,83 bei LiveCVEBench, +2,38 bei PatchEval). Die erweiterten Trainingsdaten findest du unter cve_train_v1.1.