
CVE-Factory
CVE-Factory è un sistema multi-agente per la riproduzione CVE end-to-end completamente automatizzata. A partire dalle registrazioni CVE, il sistema ricerca automaticamente i dettagli, genera casi di test, costruisce ambienti Docker e verifica che ogni vulnerabilità possa essere sia sfruttata che corretta. La pipeline trasforma i metadati delle CVE in ambienti di vulnerabilità riproducibili e testabili senza intervento manuale.
⚠️ Avviso di sicurezza: Questo sistema costruisce ed esegue container Docker contenenti software vulnerabili. Devi ASSOLUTAMENTE utilizzare l'ambiente Docker-in-Docker (DinD) per isolare i container CVE dal sistema host. Non eseguire mai CVE-Factory direttamente sul demone Docker del tuo host.
Inserisci le registrazioni CVE e ottieni un ambiente completo di riproduzione CVE. Seguendo lo standard Terminal Bench, ogni pacchetto di task generato include:
Dockerfile e docker-compose.yaml che ospitano l'applicazione vulnerabiletask.yaml contenente descrizioni strutturate delle istruzioni (senza identità CVE)solution.sh per correggere la vulnerabilitàrun-tests.sh per avviare la valutazioneProgettata specificamente per task di sicurezza, la nostra logica di testing è suddivisa in:
Nessuna ricerca manuale, nessuna codifica manuale — completamente automatizzato dai metadati CVE grezzi alla riproduzione validata.
Struttura degli artefatti generati:
CVE-2025-XXXX/
├── task.yaml # Structured Task Metadata
├── Dockerfile # Vulnerable Environment Setup
├── docker-compose.yaml # Service Orchestration
├── task-deps/
├── solution.sh # Verified Patch
└── test/
├── test_func.py # Functionality Check
├── test_vuln.py # Vulnerability Exploit Check
└── run-tests.sh # One-click Evaluation Script
In una valutazione su larga scala di 554 CVE del 2025, CVE-Factory ha riprodotto con successo 499 casi, raggiungendo un tasso di successo del 90,1%. Inoltre, una rigorosa revisione di esperti su 471 casi riusciti ha confermato che 312 task (66,2%) sono stati riprodotti in modo completo e accurato!
Rispetto a esperti di sicurezza che utilizzavano informazioni iniziali identiche, il nostro sistema ha raggiunto un tasso di superamento della verifica di ~95% nella costruzione di ambienti e soluzioni, dimostrando capacità di livello esperto nella riproduzione automatizzata delle vulnerabilità.
📂 Dataset aperto: Rilasciamo oltre 1.000 ambienti di task CVE nella directory
cve_tasks/:
trainset/(887 task): Utilizzati per l'addestramento di Abacus-cve. Le oltre 4.000 tracce di agenti distillate su Hugging Face 🤗 sono generate da questi task utilizzando Claude Opus 4.5 con un harness Mini SWE-Agent.trainset-2/: Task aggiuntivi con difficoltà relativamente più semplice. Non inclusi nei dati di addestramento.- NUOVO: Ulteriori 3.181 task disponibili in
cve_tasks_3k_compressedsu Hugging Face (archivio compresso a causa dei limiti di dimensione), con 18,8k tracce di agenti per l'addestramento di Abacus-cve-v1.1.
Il fine-tuning sulle tracce di CVE-Factory produce miglioramenti drammatici sui benchmark di sicurezza. Qwen3-32B ottiene un miglioramento di ~6,8× su LiveCVEBench (5,29% → 35,79%), ~4,2× su PatchEval (5,66% → 23,58%), e mostra persino guadagni significativi su Terminal-Bench (12,50% → 28,75%), dimostrando una forte generalizzazione tra task differenti.
| Modello | LiveCVEBench | PatchEval | Terminal-Bench | Media |
|---|---|---|---|---|
| Qwen3-32B (base) | 5,29 | 5,66 | 12,50 | 7,82 |
| Abacus-cve (Nostro) | 35,79 | 23,58 | 28,75 | 29,37 |
| Qwen3-Coder-30B | 10,58 | 9,91 | 13,75 | 11,41 |
| Qwen3-Coder-480B | 19,58 | 19,34 | 36,25 | 25,06 |
| MiniMax-M2 | 24,87 | 19,34 | 37,50 | 27,24 |
| Claude Sonnet 4 | 20,11 | 22,64 | 33,75 | 25,50 |
| Claude Sonnet 4.5 | 34,39 | 28,77 | 45,00 | 36,05 |
| Claude Opus 4.5 | 41,27 | 32,08 | 48,75 | 40,70 |
Con solo 4k tracce, Abacus-cve (32B) supera Qwen3-Coder-480B, MiniMax-M2 e Claude Sonnet 4, avvicinandosi al livello di Claude Sonnet 4.5 nei task di sicurezza.
NUOVO: Abacus-cve-v1.1 addestrato su 18,8k tracce ottiene ulteriori guadagni (+3,83 su LiveCVEBench, +2,38 su PatchEval). Vedi cve_train_v1.1 per i dati di addestramento ampliati.