Skip to content
KitploitKITPLOIT
ToolsBlog
Log in
Einreichen
ToolsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

··Feeds·Kontakt·Datenschutz·© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
CVE-Factory — CVE-Factory | Kitploit
Tools/GitHubGitHub/livecvebench/cve-factory
Container-SicherheitDynamische Analyse (Sandboxing)SchwachstellenanalyseExploitationPenetrationstestsPapers & ForschungLernen & BildungKuratierte RessourcenKI-Sicherheit
GitHublivecvebench/cve-factory

CVE-Factory

CVE-Factory

164718vor 6 MonatenVon Kitploit geprüft

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →
Teilen
Repository anzeigen

CVE-Factory: Skalierung agentischer Aufgaben auf Expertenniveau für Code-Sicherheitsschwachstellen

Paper Leaderboard Benchmark Model Dataset License: MIT

CVE-Factory ist ein Multi-Agenten-System für die vollautomatische End-to-End-Reproduktion von CVEs. Ausgehend von CVE-Einträgen recherchiert das System automatisch Details, generiert Testfälle, erstellt Docker-Umgebungen und validiert, dass jede Schwachstelle sowohl ausgenutzt als auch gepatcht werden kann. Die Pipeline wandelt CVE-Metadaten ohne manuelles Eingreifen in reproduzierbare, testbare Schwachstellenumgebungen um.

⚠️ Sicherheitswarnung: Dieses System erstellt und startet Docker-Container, die verwundbare Software enthalten. Du MUSST die Docker-in-Docker-Umgebung (DinD) verwenden, um die CVE-Container von deinem Host-System zu isolieren. Führe CVE-Factory niemals direkt auf deinem Host-Docker-Daemon aus.

📢 Aktuelles

  • [2026-03-27] 3.181 neue CVE-Aufgabenumgebungen (Hugging Face), Abacus-cve-v1.1 mit 18,8k Trainings-Traces und LiveCVEBench-verified- & PatchEval-verified-Benchmarks hinzugefügt. Außerdem 4 neue Agenten (Judger, Changer, Comparer, Expert), 3 Skills (cve-test-generator, cheat-detect, cheat-detect-evaluate) hinzugefügt und die Tool-Zugriffskontrolle von Allowlist auf Denylist umgestellt. Details siehe Update-Notizen.

✨ Highlights

🤖 End-to-End-Automatisierung

CVE-Einträge eingeben, eine vollständige CVE-Reproduktionsumgebung erhalten. Dem Terminal-Bench-Standard folgend enthält jedes generierte Aufgabenpaket:

  • Umgebungseinrichtung: Dockerfile und docker-compose.yaml zum Hosten der verwundbaren Anwendung
  • Aufgabenkonfiguration: task.yaml mit strukturierten Anweisungsbeschreibungen (ohne CVE-Identität)
  • Referenz-Fix: solution.sh zum Patchen der Schwachstelle
  • Evaluations-Einstieg: run-tests.sh zum Starten der Evaluierung

Unsere Testlogik ist speziell für Sicherheitsaufgaben ausgelegt und gliedert sich in:

  • test_func.py: Funktionstests, die sicherstellen, dass die Grundfunktionen sowohl vor als auch nach dem Fix funktionieren
  • test_vuln.py: Exploit-Tests, die verifizieren, dass die Schwachstelle vor dem Patchen existiert und danach behoben ist

Keine manuelle Recherche, keine manuelle Programmierung - vollautomatisch von den rohen CVE-Metadaten bis zur validierten Reproduktion.

Struktur der generierten Artefakte:

CVE-2025-XXXX/
├── task.yaml              # Structured Task Metadata
├── Dockerfile          # Vulnerable Environment Setup
├── docker-compose.yaml # Service Orchestration   
├── task-deps/  
├── solution.sh            # Verified Patch
└── test/
    ├── test_func.py       # Functionality Check
    ├── test_vuln.py       # Vulnerability Exploit Check
    └── run-tests.sh           # One-click Evaluation Script 

📊 Nachgewiesene hohe Erfolgsquote

In einer groß angelegten Evaluierung von 554 CVEs aus dem Jahr 2025 reproduzierte CVE-Factory erfolgreich 499 Fälle, was einer Erfolgsquote von 90,1 % entspricht. Darüber hinaus bestätigte eine strenge Expertenprüfung von 471 erfolgreichen Fällen, dass 312 Aufgaben (66,2 %) vollständig und präzise reproduziert wurden!

Im Vergleich zu Sicherheitsexperten, die identische Ausgangsinformationen verwendeten, erreichte unser System eine Verifizierungs-Bestehensquote von ~95 % beim Aufbau von Umgebung und Lösung — ein Beleg für Fähigkeiten auf Expertenniveau bei der automatisierten Schwachstellenreproduktion.

📂 Offener Datensatz: Wir veröffentlichen über 1.000 CVE-Aufgabenumgebungen im Verzeichnis cve_tasks/:

  • trainset/ (887 Aufgaben): Wird für das Training von Abacus-cve verwendet. Die über 4.000 destillierten Agenten-Traces auf Hugging Face 🤗 werden aus diesen Aufgaben mit Claude Opus 4.5 und einem Mini-SWE-Agent-Harness generiert.
  • trainset-2/: Zusätzliche Aufgaben mit vergleichsweise geringerem Schwierigkeitsgrad. Nicht in den Trainingsdaten enthalten.
  • NEU: Weitere 3.181 Aufgaben sind unter cve_tasks_3k_compressed auf Hugging Face verfügbar (komprimiertes Archiv aufgrund von Größenbeschränkungen), mit 18,8k Agenten-Traces zum Training von Abacus-cve-v1.1.

🚀 Trainingsergebnisse

Feinabstimmung (Fine-Tuning) mit CVE-Factory-Traces führt zu dramatischen Verbesserungen bei Sicherheits-Benchmarks. Qwen3-32B erreicht eine ~6,8-fache Verbesserung bei LiveCVEBench (5,29 % → 35,79 %), ~4,2-fach bei PatchEval (5,66 % → 23,58 %) und zeigt sogar deutliche Zugewinne bei Terminal-Bench (12,50 % → 28,75 %) — was eine starke aufgabenübergreifende Generalisierung demonstriert.

ModellLiveCVEBenchPatchEvalTerminal-BenchØ
Qwen3-32B (Basis)5,295,6612,507,82
Abacus-cve (Unser)35,7923,5828,7529,37
Qwen3-Coder-30B10,589,9113,7511,41
Qwen3-Coder-480B19,5819,3436,2525,06
MiniMax-M224,8719,3437,5027,24
Claude Sonnet 420,1122,6433,7525,50
Claude Sonnet 4.534,3928,7745,0036,05
Claude Opus 4.541,2732,0848,7540,70

Mit nur 4k Traces übertrifft Abacus-cve (32B) Qwen3-Coder-480B, MiniMax-M2 und Claude Sonnet 4 und erreicht bei Sicherheitsaufgaben nahezu das Niveau von Claude Sonnet 4.5.

NEU: Abacus-cve-v1.1, trainiert auf 18,8k Traces, erzielt weitere Zugewinne (+3,83 bei LiveCVEBench, +2,38 bei PatchEval). Die erweiterten Trainingsdaten findest du unter cve_train_v1.1.

🧠 Autonome Claude-Code-Agenten

Tool herunterladen