
CVE-Factory es un sistema Multi-Agente para la reproducción de CVEs totalmente automatizada y de extremo a extremo. Dados los registros CVE, el sistema investiga automáticamente los detalles, genera casos de prueba, construye entornos Docker y valida que cada vulnerabilidad pueda ser tanto explotada como parcheada. El pipeline transforma los metadatos CVE en entornos de vulnerabilidad reproducibles y comprobables sin intervención manual.
⚠️ Advertencia de Seguridad: Este sistema construye y ejecuta contenedores Docker que contienen software vulnerable. DEBE utilizar el entorno Docker-in-Docker (DinD) para aislar los contenedores CVE de su sistema host. Nunca ejecute CVE-Factory directamente en el daemon Docker de su host.
Ingrese registros CVE y obtenga un entorno completo de reproducción de CVE. Siguiendo el estándar Terminal Bench, cada paquete de tareas generado incluye:
Dockerfile y docker-compose.yaml que alojan la aplicación vulnerabletask.yaml que contiene descripciones estructuradas de instrucciones (sin identidad CVE)solution.sh para parchear la vulnerabilidadrun-tests.sh para iniciar la evaluaciónDiseñada específicamente para tareas de seguridad, nuestra lógica de prueba se divide en:
Sin investigación manual, sin codificación manual - totalmente automatizado desde los metadatos CVE brutos hasta la reproducción validada.
Estructura de Artefactos Generados:
CVE-2025-XXXX/
├── task.yaml # Structured Task Metadata
├── Dockerfile # Vulnerable Environment Setup
├── docker-compose.yaml # Service Orchestration
├── task-deps/
├── solution.sh # Verified Patch
└── test/
├── test_func.py # Functionality Check
├── test_vuln.py # Vulnerability Exploit Check
└── run-tests.sh # One-click Evaluation Script
En una evaluación a gran escala de 554 CVEs de 2025, CVE-Factory reprodujo con éxito 499 casos, logrando una tasa de éxito del 90.1%. Además, una rigurosa revisión de expertos de 471 casos exitosos confirmó que 312 tareas (66.2%) se reprodujeron de forma completa y precisa.
Al compararse con expertos en seguridad que utilizaban información inicial idéntica, nuestro sistema logró una tasa de aprobación de verificación de ~95% en la construcción de entornos y soluciones, lo que demuestra una capacidad de nivel experto en la reproducción automatizada de vulnerabilidades.
📂 Conjunto de Datos Abierto: Publicamos más de 1,000 entornos de tareas CVE en el directorio
cve_tasks/:
trainset/(887 tareas): Se utiliza para entrenar Abacus-cve. Las más de 4,000 trazas de agente destiladas en Hugging Face 🤗 se generan a partir de estas tareas utilizando Claude Opus 4.5 con un harness Mini SWE-Agent.trainset-2/: Tareas adicionales de dificultad relativamente más sencilla. No se incluyen en los datos de entrenamiento.- NUEVO: 3,181 tareas adicionales disponibles en
cve_tasks_3k_compresseden Hugging Face (archivo comprimido debido a límites de tamaño), con 18.8k trazas de agente para entrenar Abacus-cve-v1.1.
El fine-tuning con las trazas de CVE-Factory produce mejoras dramáticas en los benchmarks de seguridad. Qwen3-32B logra una mejora de ~6.8× en LiveCVEBench (5.29% → 35.79%), ~4.2× en PatchEval (5.66% → 23.58%), e incluso muestra ganancias significativas en Terminal-Bench (12.50% → 28.75%), lo que demuestra una fuerte generalización entre tareas.
| Modelo | LiveCVEBench | PatchEval | Terminal-Bench | Promedio |
|---|---|---|---|---|
| Qwen3-32B (base) | 5.29 | 5.66 | 12.50 | 7.82 |
| Abacus-cve (Nuestro) | 35.79 | 23.58 | 28.75 | 29.37 |
| Qwen3-Coder-30B | 10.58 | 9.91 | 13.75 | 11.41 |
| Qwen3-Coder-480B | 19.58 | 19.34 | 36.25 | 25.06 |
| MiniMax-M2 | 24.87 | 19.34 | 37.50 | 27.24 |
| Claude Sonnet 4 | 20.11 | 22.64 | 33.75 | 25.50 |
| Claude Sonnet 4.5 | 34.39 | 28.77 | 45.00 | 36.05 |
| Claude Opus 4.5 | 41.27 | 32.08 | 48.75 | 40.70 |
Con solo 4k trazas, Abacus-cve (32B) supera a Qwen3-Coder-480B, MiniMax-M2 y Claude Sonnet 4, acercándose al nivel de Claude Sonnet 4.5 en tareas de seguridad.
NUEVO: Abacus-cve-v1.1 entrenado con 18.8k trazas logra mejoras adicionales (+3.83 en LiveCVEBench, +2.38 en PatchEval). Consulte cve_train_v1.1 para ver los datos de entrenamiento ampliados.