Skip to content
KitploitKITPLOIT
StrumentiExploitsBlog
Log in
Invia
StrumentiExploitsBlog
Invia

Strumenti di Hacking, PenTest e Cybersecurity per il tuo Arsenale di Sicurezza!

Kitploit è una directory di strumenti di hacking, cybersecurity e pentesting. Scopri gli ultimi aggiornamenti dei progetti per trovare vulnerabilità, analizzare sistemi, automatizzare i test e rafforzare la tua sicurezza.

FeedContattoPrivacy© 2026 Kitploit

Directory degli strumenti

Categorie

Vedi tutte le categorie
Loading categories
CVE-Factory — CVE-Factory | Kitploit
Strumenti/GitHubGitHub/livecvebench/cve-factory
Sicurezza dei ContenitoriAnalisi Dinamica (Sandboxing)Analisi delle VulnerabilitàExploitPenetration TestingPaper e RicercaApprendimento e FormazioneRisorse CurateSicurezza dell'IA
GitHublivecvebench/cve-factory

CVE-Factory

CVE-Factory

1647196 mesi faRevisionato da Kitploit

Più Popolari

Vedi tutti →

Scopri gli strumenti più utilizzati dalla nostra community.

Esplora tutti gli strumenti

Sfoglia la nostra collezione di strumenti

Vedi tutti gli strumenti →
Condividi
Vedi Repository

CVE-Factory: Scalare Attività Agentiche di Livello Esperto per le Vulnerabilità della Sicurezza del Codice

Paper Leaderboard Benchmark Model Dataset License: MIT

CVE-Factory è un sistema multi-agente per la riproduzione CVE end-to-end completamente automatizzata. A partire dalle registrazioni CVE, il sistema ricerca automaticamente i dettagli, genera casi di test, costruisce ambienti Docker e verifica che ogni vulnerabilità possa essere sia sfruttata che corretta. La pipeline trasforma i metadati delle CVE in ambienti di vulnerabilità riproducibili e testabili senza intervento manuale.

⚠️ Avviso di sicurezza: Questo sistema costruisce ed esegue container Docker contenenti software vulnerabili. Devi ASSOLUTAMENTE utilizzare l'ambiente Docker-in-Docker (DinD) per isolare i container CVE dal sistema host. Non eseguire mai CVE-Factory direttamente sul demone Docker del tuo host.

📢 Novità

  • [2026-03-27] Aggiunti 3.181 nuovi ambienti di task CVE (Hugging Face), Abacus-cve-v1.1 con 18,8k tracce di addestramento e benchmark LiveCVEBench-verified e PatchEval-verified. Aggiunti 4 nuovi agenti (Judger, Changer, Comparer, Expert), 3 skill (cve-test-generator, cheat-detect, cheat-detect-evaluate), e passato il controllo di accesso agli strumenti da allowlist a denylist. Vedi Note di aggiornamento per i dettagli.

✨ Punti salienti

🤖 Automazione end-to-end

Inserisci le registrazioni CVE e ottieni un ambiente completo di riproduzione CVE. Seguendo lo standard Terminal Bench, ogni pacchetto di task generato include:

  • Setup dell'ambiente: Dockerfile e docker-compose.yaml che ospitano l'applicazione vulnerabile
  • Configurazione del task: task.yaml contenente descrizioni strutturate delle istruzioni (senza identità CVE)
  • Fix di riferimento: solution.sh per correggere la vulnerabilità
  • Punto di ingresso per la valutazione: run-tests.sh per avviare la valutazione

Progettata specificamente per task di sicurezza, la nostra logica di testing è suddivisa in:

  • test_func.py: test di funzionalità che garantiscono il corretto funzionamento delle funzionalità di base sia prima che dopo il fix
  • test_vuln.py: test di exploit che verificano l'esistenza della vulnerabilità prima della correzione e la sua risoluzione successiva

Nessuna ricerca manuale, nessuna codifica manuale — completamente automatizzato dai metadati CVE grezzi alla riproduzione validata.

Struttura degli artefatti generati:

CVE-2025-XXXX/
├── task.yaml              # Structured Task Metadata
├── Dockerfile          # Vulnerable Environment Setup
├── docker-compose.yaml # Service Orchestration   
├── task-deps/  
├── solution.sh            # Verified Patch
└── test/
    ├── test_func.py       # Functionality Check
    ├── test_vuln.py       # Vulnerability Exploit Check
    └── run-tests.sh           # One-click Evaluation Script 

📊 Tasso di successo elevato e comprovato

In una valutazione su larga scala di 554 CVE del 2025, CVE-Factory ha riprodotto con successo 499 casi, raggiungendo un tasso di successo del 90,1%. Inoltre, una rigorosa revisione di esperti su 471 casi riusciti ha confermato che 312 task (66,2%) sono stati riprodotti in modo completo e accurato!

Rispetto a esperti di sicurezza che utilizzavano informazioni iniziali identiche, il nostro sistema ha raggiunto un tasso di superamento della verifica di ~95% nella costruzione di ambienti e soluzioni, dimostrando capacità di livello esperto nella riproduzione automatizzata delle vulnerabilità.

📂 Dataset aperto: Rilasciamo oltre 1.000 ambienti di task CVE nella directory cve_tasks/:

  • trainset/ (887 task): Utilizzati per l'addestramento di Abacus-cve. Le oltre 4.000 tracce di agenti distillate su Hugging Face 🤗 sono generate da questi task utilizzando Claude Opus 4.5 con un harness Mini SWE-Agent.
  • trainset-2/: Task aggiuntivi con difficoltà relativamente più semplice. Non inclusi nei dati di addestramento.
  • NUOVO: Ulteriori 3.181 task disponibili in cve_tasks_3k_compressed su Hugging Face (archivio compresso a causa dei limiti di dimensione), con 18,8k tracce di agenti per l'addestramento di Abacus-cve-v1.1.

🚀 Risultati dell'addestramento

Il fine-tuning sulle tracce di CVE-Factory produce miglioramenti drammatici sui benchmark di sicurezza. Qwen3-32B ottiene un miglioramento di ~6,8× su LiveCVEBench (5,29% → 35,79%), ~4,2× su PatchEval (5,66% → 23,58%), e mostra persino guadagni significativi su Terminal-Bench (12,50% → 28,75%), dimostrando una forte generalizzazione tra task differenti.

ModelloLiveCVEBenchPatchEvalTerminal-BenchMedia
Qwen3-32B (base)5,295,6612,507,82
Abacus-cve (Nostro)35,7923,5828,7529,37
Qwen3-Coder-30B10,589,9113,7511,41
Qwen3-Coder-480B19,5819,3436,2525,06
MiniMax-M224,8719,3437,5027,24
Claude Sonnet 420,1122,6433,7525,50
Claude Sonnet 4.534,3928,7745,0036,05
Claude Opus 4.541,2732,0848,7540,70

Con solo 4k tracce, Abacus-cve (32B) supera Qwen3-Coder-480B, MiniMax-M2 e Claude Sonnet 4, avvicinandosi al livello di Claude Sonnet 4.5 nei task di sicurezza.

NUOVO: Abacus-cve-v1.1 addestrato su 18,8k tracce ottiene ulteriori guadagni (+3,83 su LiveCVEBench, +2,38 su PatchEval). Vedi cve_train_v1.1 per i dati di addestramento ampliati.

🧠 Agenti Claude Code autonomi

Scarica lo strumento