Skip to content
KitploitKITPLOIT
OutilsBlog
Soumettre
OutilsBlog
Soumettre

Outils de Hacking, PenTest et Cybersécurité pour votre Arsenal de Sécurité !

Kitploit est un répertoire d'outils de hacking, de cybersécurité et de pentesting. Découvrez les dernières mises à jour des projets pour trouver des vulnérabilités, analyser des systèmes, automatiser les tests et renforcer votre sécurité.

··Flux·Contact·Confidentialité·© 2026 Kitploit

Répertoire d'outils

Catégories

Voir toutes les catégories
Loading categories
CVE-Factory — CVE-Factory | Kitploit
Outils/GitHubGitHub/livecvebench/cve-factory
Sécurité des ConteneursAnalyse Dynamique (Sandboxing)Analyse des VulnérabilitésExploitationTests d'IntrusionArticles et RechercheApprentissage et ÉducationRessources OrganiséesSécurité de l'IA
GitHublivecvebench/cve-factory

CVE-Factory

CVE-Factory

1647il y a 4 moisVérifié par Kitploit

Populaires

Voir tout →

Découvrez les outils les plus utilisés par notre communauté.

Explorer tous les outils

Parcourez notre collection d'outils

Voir tous les outils →
Partager
Voir le dépôt

CVE-Factory : Mise à l'échelle de tâches agentiques de niveau expert pour les vulnérabilités de sécurité du code

Paper Leaderboard Benchmark Model Dataset License: MIT

CVE-Factory est un système Multi-Agent pour la reproduction de CVE entièrement automatisée, de bout en bout. À partir des enregistrements CVE, le système recherche automatiquement les détails, génère des cas de test, construit des environnements Docker et valide que chaque vulnérabilité peut être à la fois exploitée et corrigée. Le pipeline transforme les métadonnées CVE en environnements de vulnérabilité reproductibles et testables, sans intervention manuelle.

⚠️ Avertissement de sécurité : Ce système construit et exécute des conteneurs Docker contenant des logiciels vulnérables. Vous DEVEZ utiliser l'environnement Docker-in-Docker (DinD) pour isoler les conteneurs CVE de votre système hôte. N'exécutez jamais CVE-Factory directement sur le démon Docker de votre hôte.

📢 Actualités

  • [2026-03-27] Ajout de 3,181 nouveaux environnements de tâches CVE (Hugging Face), Abacus-cve-v1.1 avec 18.8k traces d'entraînement, et des benchmarks LiveCVEBench-verified & PatchEval-verified. Ajout de 4 nouveaux agents (Judger, Changer, Comparer, Expert), de 3 compétences (cve-test-generator, cheat-detect, cheat-detect-evaluate), et passage du contrôle d'accès aux outils d'une liste blanche (allowlist) à une liste noire (denylist). Voir Notes de mise à jour pour plus de détails.

✨ Points forts

🤖 Automatisation de bout en bout

Fournissez des enregistrements CVE, obtenez un environnement complet de reproduction de CVE. Conformément à la norme Terminal Bench, chaque package de tâches généré comprend :

  • Configuration de l'environnement : Dockerfile et docker-compose.yaml hébergeant l'application vulnérable
  • Configuration de la tâche : task.yaml contenant des descriptions d'instructions structurées (sans identité CVE)
  • Correctif de référence : solution.sh pour corriger la vulnérabilité
  • Point d'entrée d'évaluation : run-tests.sh pour lancer l'évaluation

Conçue spécifiquement pour les tâches de sécurité, notre logique de test est divisée en :

  • test_func.py : Tests fonctionnels garantissant que les fonctionnalités de base fonctionnent avant et après le correctif
  • test_vuln.py : Tests d'exploitation vérifiant que la vulnérabilité existe avant le correctif et est résolue après

Aucune recherche manuelle, aucun codage manuel — entièrement automatisé, des métadonnées CVE brutes à la reproduction validée.

Structure des artefacts générés :

root@kitploit:~
CVE-2025-XXXX/
├── task.yaml              # Structured Task Metadata
├── Dockerfile          # Vulnerable Environment Setup
├── docker-compose.yaml # Service Orchestration   
├── task-deps/  
├── solution.sh            # Verified Patch
└── test/
    ├── test_func.py       # Functionality Check
    ├── test_vuln.py       # Vulnerability Exploit Check
    └── run-tests.sh           # One-click Evaluation Script 

📊 Taux de réussite élevé prouvé

Lors d'une évaluation à grande échelle de 554 CVE de 2025, CVE-Factory a reproduit avec succès 499 cas, atteignant un taux de réussite de 90.1%. En outre, un examen rigoureux par des experts de 471 cas réussis a confirmé que 312 tâches (66.2%) avaient été reproduites de manière complète et précise !

Comparé à des experts en sécurité disposant d'informations initiales identiques, notre système a atteint un taux de réussite de vérification de ~95% dans la construction des environnements et des solutions — démontrant une capacité de niveau expert en matière de reproduction automatisée de vulnérabilités.

📂 Jeu de données ouvert : Nous publions 1,000+ environnements de tâches CVE dans le répertoire cve_tasks/ :

  • trainset/ (887 tâches) : Utilisé pour l'entraînement de Abacus-cve. Les 4,000+ traces d'agents distillées sur Hugging Face 🤗 sont générées à partir de ces tâches en utilisant Claude Opus 4.5 avec un harnais Mini SWE-Agent.
  • trainset-2/ : Tâches supplémentaires relativement plus simples. Non incluses dans les données d'entraînement.
  • NOUVEAU : 3,181 tâches supplémentaires disponibles sur cve_tasks_3k_compressed sur Hugging Face (archive compressée en raison des limites de taille), avec 18.8k traces d'agents pour l'entraînement de Abacus-cve-v1.1.

🚀 Résultats d'entraînement

Le fine-tuning sur les traces CVE-Factory produit des améliorations spectaculaires sur les benchmarks de sécurité. Qwen3-32B atteint une amélioration de ~6.8× sur LiveCVEBench, de ~4.2× sur PatchEval (5.66% → 23.58%), et montre même des gains significatifs sur Terminal-Bench (12.50% → 28.75%) — démontrant une forte généralisation inter-tâches.

Avec seulement 4k traces, Abacus-cve (32B) surpasse Qwen3-Coder-480B, MiniMax-M2 et Claude Sonnet 4, se rapprochant du niveau de Claude Sonnet 4.5 sur les tâches de sécurité.

NOUVEAU : Abacus-cve-v1.1 entraîné sur 18.8k traces obtient des gains supplémentaires (+3.83 sur LiveCVEBench, +2.38 sur PatchEval). Voir cve_train_v1.1 pour les données d'entraînement étendues.

🧠 Agents Claude Code autonomes

Contrairement aux flux de travail rigides de récupération ou aux simples boucles d'utilisation d'outils, chaque agent fonctionne comme une session Claude Code complète. Nous ne codons pas en dur les étapes ; nous définissons plutôt chaque agent par son Rôle (par ex., Analyzer), son Objectif (par ex., « Construire un environnement vulnérable »), ses Ressources (par ex., accès à des documents spécifiques) et sa Méthode de vérification (par ex., « Doit réussir check_env_ready »). Les agents agissent comme des développeurs humains : ils explorent les fichiers de manière autonome, corrigent les erreurs, lisent les journaux et itèrent sur les solutions dans leur espace de travail désigné.

⚡ Traitement asynchrone concurrent

CVE-Factory est conçu pour traiter plusieurs CVE simultanément. Chaque pipeline CVE s'exécute de manière asynchrone, ce qui signifie que les tâches les plus rapides passent aux étapes suivantes sans attendre les plus lentes. Le système utilise une architecture asynchrone qui vous permet de définir des limites de concurrence distinctes pour chaque type d'agent. Par exemple, vous pouvez définir une limite plus élevée pour les tâches de recherche légères (Analyzer) et une limite plus faible pour les tâches Docker gourmandes en ressources (Builder). Cette flexibilité évite la surcharge du système tout en maximisant la vitesse de traitement. Des délais d'attente (timeouts) au niveau des étapes garantissent que les processus bloqués ne bloquent pas la file de traitement.

🧩 Pipeline modulaire multi-étapes

Le pipeline se compose de 6 étapes indépendantes qui peuvent être exécutées séparément ou combinées.

  • Phase 1 (Analyzer → Generator) : effectue la recherche CVE et génère des artefacts sans nécessiter Docker.

    Exigence d'outillage : L'agent Analyzer s'appuie sur les outils web_search et web_fetch. Si vous utilisez un fournisseur d'API tiers, vous devez vous assurer qu'il prend en charge ces capacités d'outils spécifiques.

  • Phase 2 (Builder → Validator → Solver → Checker) : gère la construction et la validation de l'environnement Docker. De la construction de l'environnement à la validation holistique, aucun outil lié au web n'est requis, car les agents interagissent uniquement avec le système de fichiers local et le démon Docker.

Chaque étape peut également être invoquée individuellement, ce qui permet un contrôle fin du processus de reproduction et un débogage facile des étapes spécifiques.

🏗️ Architecture

Architecture du pipeline

Le système se compose de 6 étapes :

🚀 Démarrage rapide

🐳 1. Configurer l'environnement Docker-in-Docker

root@kitploit:~
# Start the isolated DinD environment (required for security)
cd dev-env
docker compose up -d

# Enter the development container
docker compose exec cve-factory bash

Voir dev-env/README.md pour la configuration détaillée de DinD et le dépannage.

📂 2. Préparer les entrées CVE

Placez les CVE que vous souhaitez reproduire dans le répertoire original_cves_md/. Les fichiers doivent être nommés au format CVE-YYYY-NNNNN.md et contenir les informations pertinentes. Nous recommandons d'utiliser cve-sampler de LiveCVEBench-Preview pour préparer ces entrées.

root@kitploit:~
# Inside the DinD development container
cd /workspace
pip install -r requirements.txt

# Verify CVE input files are ready
ls original_cves_md/

▶️ 3. Exécuter CVE-Factory

root@kitploit:~
# Set API key or use Claude subscription
export ANTHROPIC_API_KEY="your-key"
export ANTHROPIC_BASE_URL="your-url"
# Process a specific CVE
python -m orchestrator.run --cve CVE-2025-XXXXX

# Or process all CVEs in the input directory
python -m orchestrator.run

# Run phases separately
python -m orchestrator.run --phase1  --cve CVE-2025-XXXXX # Analyzer + Generator only (no Docker needed)
python -m orchestrator.run --phase2  --cve CVE-2025-XXXXX # Builder → Checker (requires Docker)

Une reproduction de CVE est considérée comme réussie lorsque :

  • État vulnérable : test_func.py PASS, test_vuln.py FAIL (l'application fonctionne, la vulnérabilité est exploitable)
  • État corrigé : test_func.py PASS, test_vuln.py PASS (l'application fonctionne, la vulnérabilité est corrigée)

⚙️ Configuration

Paramètres clés de config.yaml pour optimiser votre exécution :

root@kitploit:~
# Example config.yaml tweak
orchestrator:
  max_concurrent_cves: 3  # Lower concurrency for stability

agents:
  limits:
    builder: 2            # Prevent Docker from consuming all resources

📚 Documentation

  • Environnement DinD - Guide de configuration Docker-in-Docker (commencez ici)
  • Scripts - Scripts manuels de débogage et de vérification
  • Architecture - Conception détaillée du système et flux de données
  • Gestion des agents - Orchestration et contrôle des ressources
  • Communication - Protocoles de messages inter-agents
  • Feuille de route future - Améliorations et fonctionnalités prévues

🚧 Développement en cours

Nous développons activement OneFactory, un framework synthétique unifié qui intègre les capacités Terminal, SWE et Sécurité (CVE) dans un pipeline de données agentique 3-en-1 complet.

Sur la base de CVE-Factory, nous avons développé LiveCVEBench et publié la première version du benchmark, les données d'entraînement et le modèle Abacus-cve. Nous continuerons à étendre le benchmark et à optimiser nos recettes d'entraînement SFT & RL. Restez à l'écoute pour plus de mises à jour !


🤝 Contribution

Nous élargissons et mettons continuellement à jour ce projet. Si vous avez des suggestions ou souhaitez rejoindre/contribuer à ce projet, veuillez contacter [email protected] !

📝 Licence

Licence MIT

🎓 Citation

root@kitploit:~
@misc{luo2026cvefactory,
  title={CVE-Factory: Scaling Expert-Level Agentic Tasks for Code Security Vulnerability}, 
  author={Xianzhen Luo and Jingyuan Zhang and Shiqi Zhou and Rain Huang and Chuan Xiao and Qingfu Zhu and Zhiyuan Ma and Xing Yue and Yang Yue and Wencong Zeng and Wanxiang Che},
  year={2026},
  eprint={2602.03012},
  archivePrefix={arXiv},
  primaryClass={cs.CR},
  url={https://arxiv.org/abs/2602.03012}
}
Télécharger l’outil
ModèleLiveCVEBenchPatchEvalTerminal-BenchMoy.
Qwen3-32B (base)5.295.6612.507.82
Abacus-cve (Notre)35.7923.5828.7529.37
Qwen3-Coder-30B10.589.9113.7511.41
Qwen3-Coder-480B19.5819.3436.2525.06
MiniMax-M224.8719.3437.5027.24
Claude Sonnet 420.1122.6433.7525.50
Claude Sonnet 4.534.3928.7745.0036.05
Claude Opus 4.541.2732.0848.7540.70
ÉtapeObjectif
Collecte d'informationsL'Analyzer rassemble les détails dans public.md et les documents spécifiques au rôle (for_generator.md, etc.). Se termine si les informations sont insuffisantes.
Génération de fichiersLe Generator crée les composants logiques : task.yaml, les tests (test_func.py, test_vuln.py), solution.sh, run-tests.sh et les directives docker-reqs.md.
Construction de l'environnementLe Builder produit Dockerfile et docker-compose.yaml, en opérant en « construction à l'aveugle » (sans accès aux tests/solutions) pour garantir la rigueur.
Vérification de la vulnérabilitéL'Orchestrator vérifie que test_vuln échoue (FAIL) et que test_func réussit (PASS) via check_env_ready. En cas d'échec, l'agent Validator corrige l'environnement (3 tentatives max).
Vérification de la solutionL'Orchestrator vérifie le correctif via check_fix_ready. Exige que les deux tests réussissent (PASS). En cas d'échec, l'agent Solver ajuste la solution ou l'environnement.
Validation holistiqueL'agent Checker gère les erreurs ou effectue une assurance qualité (QA) (nettoyage du code/données factices) quel que soit le résultat de check_cve_ready. La vérification finale E2E confirme le succès.
SectionParamètreDescription
Orchestratormax_concurrent_cvesContrôle combien de CVE sont traitées en parallèle. Réduisez cette valeur si vous atteignez les limites de débit de l'API.
AgentslimitsDéfinit les plafonds de concurrence pour des étapes spécifiques (par ex., limiter builder pour économiser le disque/CPU).
Modèlesmodels.defaultChange les LLM sous-jacents (par ex., Claude 4.5 Sonnet vs Opus).