Skip to content
KitploitKITPLOIT
ToolsBlog
Einreichen
ToolsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

··Feeds·Kontakt·Datenschutz·© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
CVE-Factory — CVE-Factory | Kitploit
Tools/GitHubGitHub/livecvebench/cve-factory
Container SecurityDynamic Analysis (Sandboxing)Vulnerability AnalysisExploitationPenetration TestingPapers & ResearchLearning & EducationCurated ResourcesAI Security
GitHublivecvebench/cve-factory

CVE-Factory

CVE-Factory

1647vor 4 MonatenVon Kitploit geprüft

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →
Teilen
Repository anzeigen

CVE-Factory: Skalierung agentischer Aufgaben auf Expertenniveau für Code-Sicherheitsschwachstellen

Paper Leaderboard Benchmark Model Dataset License: MIT

CVE-Factory ist ein Multi-Agenten-System für die vollautomatische End-to-End-Reproduktion von CVEs. Ausgehend von CVE-Einträgen recherchiert das System automatisch Details, generiert Testfälle, erstellt Docker-Umgebungen und validiert, dass jede Schwachstelle sowohl ausgenutzt als auch gepatcht werden kann. Die Pipeline wandelt CVE-Metadaten ohne manuelles Eingreifen in reproduzierbare, testbare Schwachstellenumgebungen um.

⚠️ Sicherheitswarnung: Dieses System erstellt und startet Docker-Container, die verwundbare Software enthalten. Du MUSST die Docker-in-Docker-Umgebung (DinD) verwenden, um die CVE-Container von deinem Host-System zu isolieren. Führe CVE-Factory niemals direkt auf deinem Host-Docker-Daemon aus.

📢 Aktuelles

  • [2026-03-27] 3.181 neue CVE-Aufgabenumgebungen (Hugging Face), Abacus-cve-v1.1 mit 18,8k Trainings-Traces und LiveCVEBench-verified- & PatchEval-verified-Benchmarks hinzugefügt. Außerdem 4 neue Agenten (Judger, Changer, Comparer, Expert), 3 Skills (cve-test-generator, cheat-detect, cheat-detect-evaluate) hinzugefügt und die Tool-Zugriffskontrolle von Allowlist auf Denylist umgestellt. Details siehe Update-Notizen.

✨ Highlights

🤖 End-to-End-Automatisierung

CVE-Einträge eingeben, eine vollständige CVE-Reproduktionsumgebung erhalten. Dem Terminal-Bench-Standard folgend enthält jedes generierte Aufgabenpaket:

  • Umgebungseinrichtung: Dockerfile und docker-compose.yaml zum Hosten der verwundbaren Anwendung
  • Aufgabenkonfiguration: task.yaml mit strukturierten Anweisungsbeschreibungen (ohne CVE-Identität)
  • Referenz-Fix: solution.sh zum Patchen der Schwachstelle
  • Evaluations-Einstieg: run-tests.sh zum Starten der Evaluierung

Unsere Testlogik ist speziell für Sicherheitsaufgaben ausgelegt und gliedert sich in:

  • test_func.py: Funktionstests, die sicherstellen, dass die Grundfunktionen sowohl vor als auch nach dem Fix funktionieren
  • test_vuln.py: Exploit-Tests, die verifizieren, dass die Schwachstelle vor dem Patchen existiert und danach behoben ist

Keine manuelle Recherche, keine manuelle Programmierung - vollautomatisch von den rohen CVE-Metadaten bis zur validierten Reproduktion.

Struktur der generierten Artefakte:

root@kitploit:~
CVE-2025-XXXX/
├── task.yaml              # Structured Task Metadata
├── Dockerfile          # Vulnerable Environment Setup
├── docker-compose.yaml # Service Orchestration   
├── task-deps/  
├── solution.sh            # Verified Patch
└── test/
    ├── test_func.py       # Functionality Check
    ├── test_vuln.py       # Vulnerability Exploit Check
    └── run-tests.sh           # One-click Evaluation Script 

📊 Nachgewiesene hohe Erfolgsquote

In einer groß angelegten Evaluierung von 554 CVEs aus dem Jahr 2025 reproduzierte CVE-Factory erfolgreich 499 Fälle, was einer Erfolgsquote von 90,1 % entspricht. Darüber hinaus bestätigte eine strenge Expertenprüfung von 471 erfolgreichen Fällen, dass 312 Aufgaben (66,2 %) vollständig und präzise reproduziert wurden!

Im Vergleich zu Sicherheitsexperten, die identische Ausgangsinformationen verwendeten, erreichte unser System eine Verifizierungs-Bestehensquote von ~95 % beim Aufbau von Umgebung und Lösung — ein Beleg für Fähigkeiten auf Expertenniveau bei der automatisierten Schwachstellenreproduktion.

📂 Offener Datensatz: Wir veröffentlichen über 1.000 CVE-Aufgabenumgebungen im Verzeichnis cve_tasks/:

  • trainset/ (887 Aufgaben): Wird für das Training von Abacus-cve verwendet. Die über 4.000 destillierten Agenten-Traces auf Hugging Face 🤗 werden aus diesen Aufgaben mit Claude Opus 4.5 und einem Mini-SWE-Agent-Harness generiert.
  • trainset-2/: Zusätzliche Aufgaben mit vergleichsweise geringerem Schwierigkeitsgrad. Nicht in den Trainingsdaten enthalten.
  • NEU: Weitere 3.181 Aufgaben sind unter cve_tasks_3k_compressed auf Hugging Face verfügbar (komprimiertes Archiv aufgrund von Größenbeschränkungen), mit 18,8k Agenten-Traces zum Training von Abacus-cve-v1.1.

🚀 Trainingsergebnisse

Feinabstimmung (Fine-Tuning) mit CVE-Factory-Traces führt zu dramatischen Verbesserungen bei Sicherheits-Benchmarks. Qwen3-32B erreicht eine ~6,8-fache Verbesserung bei LiveCVEBench (5,29 % → 35,79 %), ~4,2-fach bei PatchEval (5,66 % → 23,58 %) und zeigt sogar deutliche Zugewinne bei Terminal-Bench (12,50 % → 28,75 %) — was eine starke aufgabenübergreifende Generalisierung demonstriert.

Mit nur 4k Traces übertrifft Abacus-cve (32B) Qwen3-Coder-480B, MiniMax-M2 und Claude Sonnet 4 und erreicht bei Sicherheitsaufgaben nahezu das Niveau von Claude Sonnet 4.5.

NEU: Abacus-cve-v1.1, trainiert auf 18,8k Traces, erzielt weitere Zugewinne (+3,83 bei LiveCVEBench, +2,38 bei PatchEval). Die erweiterten Trainingsdaten findest du unter cve_train_v1.1.

🧠 Autonome Claude-Code-Agenten

Anders als starre Retrieval-Workflows oder einfache Tool-Nutzungsschleifen arbeitet jeder Agent als vollwertige Claude-Code-Session. Wir kodieren keine Schritte fest; stattdessen definieren wir jeden Agenten über seine Rolle (z. B. Analyzer), sein Ziel (z. B. „Eine verwundbare Umgebung aufbauen"), seine Ressourcen (z. B. Zugriff auf bestimmte Dokumente) und seine Verifikationsmethode (z. B. „Muss check_env_ready bestehen"). Die Agenten agieren wie menschliche Entwickler: Sie erkunden eigenständig Dateien, beheben Fehler, lesen Logs und iterieren innerhalb ihres zugewiesenen Arbeitsbereichs an Lösungen.

⚡ Asynchrone parallele Verarbeitung

CVE-Factory ist dafür ausgelegt, mehrere CVEs gleichzeitig zu verarbeiten. Jede CVE-Pipeline läuft asynchron ab, d. h. schnellere Aufgaben gehen zu den nachfolgenden Stufen über, ohne auf langsamere zu warten. Das System nutzt eine asynchrone Architektur, mit der du die Parallelitätsgrenzen für jeden Agententyp separat festlegen kannst. So kannst du beispielsweise ein höheres Limit für leichte Rechercheaufgaben (Analyzer) und ein niedrigeres Limit für ressourcenintensive Docker-Aufgaben (Builder) festlegen. Diese Flexibilität verhindert eine Systemüberlastung und maximiert gleichzeitig die Verarbeitungsgeschwindigkeit. Timeouts auf Stufenebene stellen sicher, dass hängende Prozesse die Verarbeitungswarteschlange nicht blockieren.

🧩 Modulare mehrstufige Pipeline

Die Pipeline besteht aus 6 unabhängigen Stufen, die getrennt oder kombiniert ausgeführt werden können.

  • Phase 1 (Analyzer → Generator) führt die CVE-Recherche durch und generiert Artefakte, ohne dass Docker erforderlich ist.

    Tool-Anforderung: Der Analyzer-Agent ist auf die Tools web_search und web_fetch angewiesen. Wenn du einen Drittanbieter-API-Provider verwendest, musst du sicherstellen, dass dieser diese spezifischen Tool-Fähigkeiten unterstützt.

  • Phase 2 (Builder → Validator → Solver → Checker) übernimmt die Erstellung und Validierung der Docker-Umgebung. Von der Umgebungserstellung bis zur ganzheitlichen Validierung sind keine webbasierten Tools erforderlich, da die Agenten ausschließlich mit dem lokalen Dateisystem und dem Docker-Daemon interagieren.

Jede Stufe kann auch einzeln aufgerufen werden, was eine feingranulare Kontrolle über den Reproduktionsprozess und ein einfaches Debugging einzelner Stufen ermöglicht.

🏗️ Architektur

Pipeline Architecture

Das System besteht aus 6 Stufen:

🚀 Schnellstart

🐳 1. Docker-in-Docker-Umgebung einrichten

root@kitploit:~
# Start the isolated DinD environment (required for security)
cd dev-env
docker compose up -d

# Enter the development container
docker compose exec cve-factory bash

Detaillierte DinD-Konfiguration und Fehlerbehebung findest du unter dev-env/README.md.

📂 2. CVE-Eingaben vorbereiten

Lege die CVEs, die du reproduzieren möchtest, im Verzeichnis original_cves_md/ ab. Die Dateien müssen im Format CVE-YYYY-NNNNN.md benannt sein und die relevanten Informationen enthalten. Wir empfehlen, zur Vorbereitung dieser Eingaben den cve-sampler aus LiveCVEBench-Preview zu verwenden.

root@kitploit:~
# Inside the DinD development container
cd /workspace
pip install -r requirements.txt

# Verify CVE input files are ready
ls original_cves_md/

▶️ 3. CVE-Factory ausführen

root@kitploit:~
# Set API key or use Claude subscription
export ANTHROPIC_API_KEY="your-key"
export ANTHROPIC_BASE_URL="your-url"
# Process a specific CVE
python -m orchestrator.run --cve CVE-2025-XXXXX

# Or process all CVEs in the input directory
python -m orchestrator.run

# Run phases separately
python -m orchestrator.run --phase1  --cve CVE-2025-XXXXX # Analyzer + Generator only (no Docker needed)
python -m orchestrator.run --phase2  --cve CVE-2025-XXXXX # Builder → Checker (requires Docker)

Eine CVE-Reproduktion gilt als erfolgreich, wenn:

  • Verwundbarer Zustand: test_func.py PASS, test_vuln.py FAIL (App funktioniert, Schwachstelle ausnutzbar)
  • Behobener Zustand: test_func.py PASS, test_vuln.py PASS (App funktioniert, Schwachstelle gepatcht)

⚙️ Konfiguration

Wichtige Einstellungen in config.yaml, um deinen Lauf zu optimieren:

root@kitploit:~
# Example config.yaml tweak
orchestrator:
  max_concurrent_cves: 3  # Lower concurrency for stability

agents:
  limits:
    builder: 2            # Prevent Docker from consuming all resources

📚 Dokumentation

  • DinD-Umgebung - Anleitung zur Docker-in-Docker-Einrichtung (hier beginnen)
  • Skripte - Manuelle Debug- und Verifizierungsskripte
  • Architektur - Detailliertes Systemdesign und Datenfluss
  • Agentenverwaltung - Orchestrierung und Ressourcenkontrolle
  • Kommunikation - Nachrichtenprotokolle zwischen den Agenten
  • Zukünftige Roadmap - Geplante Verbesserungen und Funktionen

🚧 Laufende Entwicklung

Wir entwickeln aktiv OneFactory, ein einheitliches synthetisches Framework, das Terminal-, SWE- und Security- (CVE)-Fähigkeiten in eine umfassende 3-in-1-Agenten-Datenpipeline integriert.

Auf Basis von CVE-Factory haben wir LiveCVEBench entwickelt und die erste Version des Benchmarks, die Trainingsdaten und das Abacus-cve-Modell veröffentlicht. Wir werden den Benchmark weiter ausbauen und unsere SFT- & RL-Trainingsrezepte optimieren. Bleib gespannt auf weitere Updates!


🤝 Mitwirken

Wir erweitern und aktualisieren dieses Projekt kontinuierlich. Wenn du Vorschläge hast oder an diesem Projekt mitwirken möchtest, kontaktiere uns bitte unter [email protected]!

📝 Lizenz

MIT-Lizenz

🎓 Zitieren

root@kitploit:~
@misc{luo2026cvefactory,
  title={CVE-Factory: Scaling Expert-Level Agentic Tasks for Code Security Vulnerability}, 
  author={Xianzhen Luo and Jingyuan Zhang and Shiqi Zhou and Rain Huang and Chuan Xiao and Qingfu Zhu and Zhiyuan Ma and Xing Yue and Yang Yue and Wencong Zeng and Wanxiang Che},
  year={2026},
  eprint={2602.03012},
  archivePrefix={arXiv},
  primaryClass={cs.CR},
  url={https://arxiv.org/abs/2602.03012}
}
Tool herunterladen
ModellLiveCVEBenchPatchEvalTerminal-BenchØ
Qwen3-32B (Basis)5,295,6612,507,82
Abacus-cve (Unser)35,7923,5828,7529,37
Qwen3-Coder-30B10,589,9113,7511,41
Qwen3-Coder-480B19,5819,3436,2525,06
MiniMax-M224,8719,3437,5027,24
Claude Sonnet 420,1122,6433,7525,50
Claude Sonnet 4.534,3928,7745,0036,05
Claude Opus 4.541,2732,0848,7540,70
StufeZweck
InformationssammlungDer Analyzer sammelt Details in public.md und rollenspezifischen Dokumenten (for_generator.md usw.). Bricht ab, wenn die Informationen unzureichend sind.
DateigenerierungDer Generator erstellt logische Komponenten: task.yaml, Tests (test_func.py, test_vuln.py), solution.sh, run-tests.sh und docker-reqs.md als Leitfaden.
UmgebungsaufbauDer Builder erstellt Dockerfile und docker-compose.yaml und arbeitet dabei nach dem Prinzip des „blinden Aufbaus" (ohne Zugriff auf Tests/Lösung), um die Stringenz zu gewährleisten.
SchwachstellenverifizierungDer Orchestrator verifiziert über check_env_ready, dass test_vuln FAIL und test_func PASS ergeben. Bei einem Fehlschlag repariert der Validator-Agent die Umgebung (max. 3 Wiederholungen).
LösungsverifizierungDer Orchestrator verifiziert den Fix über check_fix_ready. Erfordert, dass beide Tests PASS ergeben. Bei einem Fehlschlag passt der Solver-Agent die Lösung oder die Umgebung an.
Ganzheitliche ValidierungDer Checker-Agent behandelt Fehler oder führt QA durch (Bereinigung von Mock-Code/Daten), unabhängig vom Ergebnis von check_cve_ready. Eine abschließende E2E-Prüfung bestätigt den Erfolg.
AbschnittEinstellungBeschreibung
Orchestratormax_concurrent_cvesSteuert, wie viele CVEs parallel verarbeitet werden. Reduziere diesen Wert, wenn du auf API-Ratenlimits stößt.
AgentenlimitsLegt Parallelitäts-Obergrenzen für bestimmte Stufen fest (z. B. builder begrenzen, um Speicher/CPU zu schonen).
Modellemodels.defaultWechselt die zugrunde liegenden LLMs (z. B. Claude 4.5 Sonnet vs. Opus).