Skip to content
KitploitKITPLOIT
HerramientasBlog
Log in
Enviar
HerramientasBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

··Feeds·Contacto·Privacidad·© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
CVE-Factory — CVE-Factory | Kitploit
Herramientas/GitHubGitHub/livecvebench/cve-factory
Seguridad de ContenedoresAnálisis Dinámico (Sandboxing)Análisis de VulnerabilidadesExplotaciónPruebas de PenetraciónPapers e InvestigaciónAprendizaje y EducaciónRecursos CuradosSeguridad de IA
GitHublivecvebench/cve-factory

CVE-Factory

CVE-Factory

164718hace 6 mesesRevisado por Kitploit

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
Compartir
Ver Repositorio

CVE-Factory: Escalando Tareas Agénticas de Nivel Experto para Vulnerabilidades de Seguridad en Código

Paper Leaderboard Benchmark Model Dataset License: MIT

CVE-Factory es un sistema Multi-Agente para la reproducción de CVEs totalmente automatizada y de extremo a extremo. Dados los registros CVE, el sistema investiga automáticamente los detalles, genera casos de prueba, construye entornos Docker y valida que cada vulnerabilidad pueda ser tanto explotada como parcheada. El pipeline transforma los metadatos CVE en entornos de vulnerabilidad reproducibles y comprobables sin intervención manual.

⚠️ Advertencia de Seguridad: Este sistema construye y ejecuta contenedores Docker que contienen software vulnerable. DEBE utilizar el entorno Docker-in-Docker (DinD) para aislar los contenedores CVE de su sistema host. Nunca ejecute CVE-Factory directamente en el daemon Docker de su host.

📢 Noticias

  • [2026-03-27] Se añadieron 3,181 nuevos entornos de tareas CVE (Hugging Face), Abacus-cve-v1.1 con 18.8k trazas de entrenamiento, y los benchmarks LiveCVEBench-verified y PatchEval-verified. Se añadieron 4 nuevos agentes (Judger, Changer, Comparer, Expert), 3 habilidades (cve-test-generator, cheat-detect, cheat-detect-evaluate), y el control de acceso a herramientas pasó de allowlist a denylist. Consulte las Notas de Actualización para más detalles.

✨ Destacados

🤖 Automatización de Extremo a Extremo

Ingrese registros CVE y obtenga un entorno completo de reproducción de CVE. Siguiendo el estándar Terminal Bench, cada paquete de tareas generado incluye:

  • Configuración del Entorno: Dockerfile y docker-compose.yaml que alojan la aplicación vulnerable
  • Configuración de la Tarea: task.yaml que contiene descripciones estructuradas de instrucciones (sin identidad CVE)
  • Corrección de Referencia: solution.sh para parchear la vulnerabilidad
  • Entrada de Evaluación: run-tests.sh para iniciar la evaluación

Diseñada específicamente para tareas de seguridad, nuestra lógica de prueba se divide en:

  • test_func.py: Pruebas de funcionalidad que garantizan que las funciones básicas funcionan tanto antes como después de la corrección
  • test_vuln.py: Pruebas de explotación que verifican que la vulnerabilidad existe antes del parcheo y se resuelve después

Sin investigación manual, sin codificación manual - totalmente automatizado desde los metadatos CVE brutos hasta la reproducción validada.

Estructura de Artefactos Generados:

CVE-2025-XXXX/
├── task.yaml              # Structured Task Metadata
├── Dockerfile          # Vulnerable Environment Setup
├── docker-compose.yaml # Service Orchestration   
├── task-deps/  
├── solution.sh            # Verified Patch
└── test/
    ├── test_func.py       # Functionality Check
    ├── test_vuln.py       # Vulnerability Exploit Check
    └── run-tests.sh           # One-click Evaluation Script 

📊 Tasa de Éxito Comprobada

En una evaluación a gran escala de 554 CVEs de 2025, CVE-Factory reprodujo con éxito 499 casos, logrando una tasa de éxito del 90.1%. Además, una rigurosa revisión de expertos de 471 casos exitosos confirmó que 312 tareas (66.2%) se reprodujeron de forma completa y precisa.

Al compararse con expertos en seguridad que utilizaban información inicial idéntica, nuestro sistema logró una tasa de aprobación de verificación de ~95% en la construcción de entornos y soluciones, lo que demuestra una capacidad de nivel experto en la reproducción automatizada de vulnerabilidades.

📂 Conjunto de Datos Abierto: Publicamos más de 1,000 entornos de tareas CVE en el directorio cve_tasks/:

  • trainset/ (887 tareas): Se utiliza para entrenar Abacus-cve. Las más de 4,000 trazas de agente destiladas en Hugging Face 🤗 se generan a partir de estas tareas utilizando Claude Opus 4.5 con un harness Mini SWE-Agent.
  • trainset-2/: Tareas adicionales de dificultad relativamente más sencilla. No se incluyen en los datos de entrenamiento.
  • NUEVO: 3,181 tareas adicionales disponibles en cve_tasks_3k_compressed en Hugging Face (archivo comprimido debido a límites de tamaño), con 18.8k trazas de agente para entrenar Abacus-cve-v1.1.

🚀 Resultados de Entrenamiento

El fine-tuning con las trazas de CVE-Factory produce mejoras dramáticas en los benchmarks de seguridad. Qwen3-32B logra una mejora de ~6.8× en LiveCVEBench (5.29% → 35.79%), ~4.2× en PatchEval (5.66% → 23.58%), e incluso muestra ganancias significativas en Terminal-Bench (12.50% → 28.75%), lo que demuestra una fuerte generalización entre tareas.

ModeloLiveCVEBenchPatchEvalTerminal-BenchPromedio
Qwen3-32B (base)5.295.6612.507.82
Abacus-cve (Nuestro)35.7923.5828.7529.37
Qwen3-Coder-30B10.589.9113.7511.41
Qwen3-Coder-480B19.5819.3436.2525.06
MiniMax-M224.8719.3437.5027.24
Claude Sonnet 420.1122.6433.7525.50
Claude Sonnet 4.534.3928.7745.0036.05
Claude Opus 4.541.2732.0848.7540.70

Con solo 4k trazas, Abacus-cve (32B) supera a Qwen3-Coder-480B, MiniMax-M2 y Claude Sonnet 4, acercándose al nivel de Claude Sonnet 4.5 en tareas de seguridad.

NUEVO: Abacus-cve-v1.1 entrenado con 18.8k trazas logra mejoras adicionales (+3.83 en LiveCVEBench, +2.38 en PatchEval). Consulte cve_train_v1.1 para ver los datos de entrenamiento ampliados.

🧠 Agentes Claude Code Autónomos

Descargar herramienta