Skip to content
KitploitKITPLOIT
ToolsBlog
Einreichen
ToolsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

··Feeds·Kontakt·Datenschutz·© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
socbench — Eine offene Testumgebung und Benchmark für KI in Cybersicherheitsoperationen. | Kitploit
Tools/GitHubGitHub/deeptempo/socbench
NetzwerksicherheitBedrohungsanalyseMaschinelles LernenLernen & BildungKI-Sicherheit
GitHubdeeptempo/socbench

socbench

Eine offene Testumgebung und Benchmark für KI in Cybersicherheitsoperationen.

Repository anzeigen
5664vor 15 TagenVon Kitploit geprüft

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →
Webseite
Teilen

socbench

Testen Sie die neuesten Reasoning-LLMs als SOC-Agenten anhand von rohen NetFlow-Daten.

socbench benchmarkt die neuesten Reasoning-Modelle als SOC-Agenten: Jedes Modell durchläuft eine begrenzte Multi-Turn-Agentenschleife gegen einen deterministischen, vorindizierten NetFlow-Korpus mit persona-bezogenen Nur-Lese-Werkzeugen, festen Dollarbegrenzungen pro Untersuchung und einem strengen JSON-Vertrag für die endgültige Antwort. Vier Personas (SOC Analyst, Threat Analyst, Adversary Hunter, Detection Engineer) und drei Anbieter (OpenAI, Anthropic, Google) teilen sich dieselben Bewertungseinheiten, Bewertungslinsen und Ablationsoberfläche, sodass die Überschriftenzahlen und die Deltas von tools_off / playbooks_off direkt vergleichbar sind.

Das Repository ist lokal-zuerst. Ein Laptop, drei API-Schlüssel und ein im Repo festgeschriebenes Beispiel-Parquet reichen aus, um einen Smoke-Test unter einem Budget von 10 $ zu reproduzieren.

Status

Alpha. Die gesamte Pipeline läuft von Anfang bis Ende. Abgedeckte Komponenten:

  • Schritt 1: Paketgerüst, Verträge, Konfigurationen, Schema
  • Schritt 2: Der Index-Builder (socbench build-index) mit deterministischen, inhaltsadressierten Indizes
  • Schritt 3: Nur-Lese-Werkzeugschicht mit Persona-Zulassungsliste + Beispiel-Builder
  • Schritt 4: Personas, Playbooks, Prompt-Komposition + Verbotene-Token-Prüfung
  • Schritt 5: Anbieter-Adapter (OpenAI / Anthropic / Gemini + immer anwendbarer Mock) und die Multi-Turn-Agentenschleife mit Budgetgrenzen und Kosten/Latenz-Zusammenfassungen
  • Schritt 6: Bewertung (pro Flow / pro Paar / pro Host F1), stratifiziertes Sampling, Ablationsaggregation
  • Schritt 7: Schnellstart + Ergebnisse-Explorer-Notebooks; Reproduktionsanweisungen in REPRODUCE.md
  • Sie können noch heute einen kompletten Smoke-Test ohne API-Schlüssel über den Mock-Provider durchführen (siehe Quickstart Schritt 3 oder notebooks/quickstart.ipynb).

    Installation

    socbench wird als Standard-PEP-621-/Hatchling-Projekt ausgeliefert. Beide Installationswege funktionieren.

    Mit uv (empfohlen für die Entwicklung)

    root@kitploit:~
    curl -LsSf https://astral.sh/uv/install.sh | sh
    
    git clone https://github.com/DeepTempo/socbench.git
    cd socbench
    
    uv venv --python 3.11
    source .venv/bin/activate
    uv pip install -e ".[dev,providers]"
    

    Mit einfachem pip

    root@kitploit:~
    git clone https://github.com/DeepTempo/socbench.git
    cd socbench
    
    python3.11 -m venv .venv
    source .venv/bin/activate
    pip install -e ".[dev,providers]"
    

    In beiden Fällen sollte socbench --help nun die verfügbaren Unterbefehle auflisten.

    Konfiguration

    BereichStandardOrt
    Benchmark-Standardwerte (Sampling, Agentenbudgets, Anbieter, Persona × Tool-Matrix)benchmark_config.yamlconfig/
    Kanonisches NetFlow-Schema + Normalisierungsaliaseschema.jsonconfig/
    Preisschnappschuss des Anbieters (USD pro 1 M Token)pricing.yamlconfig/
    API-Schlüssel des AnbietersUmgebungsvariablen OPENAI_API_KEY, ANTHROPIC_API_KEY, GOOGLE_API_KEYShell-Umgebung

    config/benchmark_config.yaml enthält sichere Standardwerte: Smoke cost_budget_usd: 10, voll cost_budget_usd: 900, fest cost_usd_cap_per_rendering: 0.50. Pfade darin, die auf Geschwister-Konfigurationsdateien verweisen (schema_path, pricing_path), werden relativ zum eigenen Verzeichnis der YAML aufgelöst, sodass Umbenennen oder Verschieben von config/ keine Codeänderungen erfordert.

    Schnellstart

    1. Erstellen eines inhaltsadressierten Index aus einem Parquet-Datensatz

    root@kitploit:~
    socbench build-index \
      --config config/benchmark_config.yaml \
      --dataset sample
    

    Dies normalisiert das Parquet gegen config/schema.json, sortiert global nach ts_start mit deterministischer Tie-Break-Auflösung, weist stabile flow_ids zu, leitet pair_timeline / host_egress-Bewertungseinheiten ab, berechnet Zusammenfassungen und schreibt in indexes/<dataset_hash>/.

    Ein erneutes Ausführen des Befehls auf denselben Daten ist ein No-Op. Übergeben Sie --rebuild, um einen erneuten Build zu erzwingen.

    2. Untersuchen der Werkzeugschicht

    root@kitploit:~
    socbench tools-smoke \
      --dataset-hash <dataset_hash> \
      --persona soc_analyst
    

    Dies ruft jedes Werkzeug in der Zulassungsliste der Persona gegen den erstellten Index auf und gibt eine Zusammenfassung aus, ohne Modellaufrufe.

    3. Ausführen des Benchmarks

    root@kitploit:~
    # Free, deterministic, no API keys (the mock provider):
    socbench run --dataset-hash <dataset_hash> --providers mock --personas all
    
    # Real models (after `pip install -e ".[providers]"` + exporting API keys):
    socbench run --dataset-hash <dataset_hash> --providers all --personas all
    

    Die Einheitenauswahl erfolgt standardmäßig durch stratifiziertes Sampling, deterministisch in (dataset_hash, sample_seed, mode). Jede (Einheit × Persona × Anbieter)-Rendering durchläuft eine begrenzte Multi-Turn-Agentenschleife; Ergebnisse landen unter runs/<run_id>/ mit summary.json (Bewertung + Kosten + Cache-Zusammenfassungen), eval_units_summary.jsonl, predictions_raw.jsonl, renderings.jsonl, tool_calls.jsonl und prompts_used/.

    4. Ausführen von Ablationen und Aggregieren der Deltas

    root@kitploit:~
    socbench run --dataset-hash <dataset_hash> --ablation tools_off --providers mock --personas all
    socbench aggregate --dataset-hash <dataset_hash>
    # → ablations/<dataset_hash>/<seed>/ablation_summary.json  (tools_off → main deltas)
    

    5. Erkunden

    notebooks/quickstart.ipynb führt die gesamte Schleife aus (es synthetisiert einen Beispieldatensatz, benötigt also keine festgeschriebenen Daten) und zeichnet das F1 pro Persona. notebooks/results_explorer.ipynb lädt ein beliebiges runs/<run_id>/ und schneidet die Ergebnisse nach Stratum, Persona und Anbieter auf. Installieren mit pip install -e ".[notebooks]".

    Erweitern des Benchmarks

    Jedes für die Weiterentwicklung konzipierte Interface ist entweder eine Registry oder ein YAML-Schlüssel:

    • Neues Werkzeug: Legen Sie eine neue Datei unter src/socbench/tools/catalog/<name>.py an, mit einer Tool-Unterklasse, registrieren Sie es in src/socbench/tools/catalog/__init__.py durch Anhängen an ALL_TOOLS, und fügen Sie seinen Namen zu den entsprechenden Persona-tools:-Listen in config/benchmark_config.yaml hinzu. Der tools_manifest_sha verschiebt sich automatisch. Dateiname, YAML-Name und Matrixeintrag sind absichtlich 1:1.
    • Neuer Bewertungseinheitentyp: Fügen Sie einen Zuweiser in src/socbench/index.py und einen passenden Literal zu EvalUnitType in src/socbench/models.py hinzu.
    • Neuer Anbieter-Adapter: Implementieren Sie die Adapter-ABC in einer neuen src/socbench/providers/<name>_adapter.py, registrieren Sie ihn in der build_adapter-Factory in providers/base.py, und fügen Sie einen Eintrag unter providers: in config/benchmark_config.yaml hinzu. Die Preisgestaltung kommt in config/pricing.yaml. SDK-Importe bleiben lazy, sodass die Abhängigkeit optional ist.
    • Neue Persona: Fügen Sie einen Block unter agent.personas: in config/benchmark_config.yaml mit ihrem Budget und der tools:-Zulassungsliste hinzu.
    • Neue Bewertungslinse: Fügen Sie eine Linse zu score_unit in src/socbench/scoring.py und ein passendes Feld zu EvalUnitSummary in models.py hinzu.
    • Neue Ablation: Erweitern Sie die Ablation-Behandlung in prompts.py / agent.py und die Tag-Liste in aggregate.py.

    Methodik

    Die vollständige Methodik (Bewertungseinheiten, Persona x Tool-Matrix, Agentenschleife, Bewertung, Kostenmodell, Reparaturrichtlinie, Sampling, Ablationen, Laufartefakte) ist über die modulebene Dateien in src/socbench/ implementiert (jede enthält einen fokussierten Modul-Docstring).

    Lizenz

    Apache-2.0. Siehe LICENSE.

    Tool herunterladen