Skip to content
KitploitKITPLOIT
ToolsBlog
Einreichen
ToolsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

··Feeds·Kontakt·Datenschutz·© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
socbench — Eine offene Testumgebung und Benchmark für KI in Cybersicherheitsoperationen. | Kitploit
Tools/GitHubGitHub/deeptempo/socbench
NetzwerksicherheitBedrohungsanalyseMaschinelles LernenLernen & BildungKI-Sicherheit
GitHubdeeptempo/socbench

socbench

Eine offene Testumgebung und Benchmark für KI in Cybersicherheitsoperationen.

Repository anzeigen
566vor 22 TagenVon Kitploit geprüft

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →
Teilen
Webseite

socbench

Testen Sie die neuesten Reasoning-LLMs als SOC-Agenten anhand von rohen NetFlow-Daten.

socbench benchmarkt die neuesten Reasoning-Modelle als SOC-Agenten: Jedes Modell durchläuft eine begrenzte Multi-Turn-Agentenschleife gegen einen deterministischen, vorindizierten NetFlow-Korpus mit persona-bezogenen Nur-Lese-Werkzeugen, festen Dollarbegrenzungen pro Untersuchung und einem strengen JSON-Vertrag für die endgültige Antwort. Vier Personas (SOC Analyst, Threat Analyst, Adversary Hunter, Detection Engineer) und drei Anbieter (OpenAI, Anthropic, Google) teilen sich dieselben Bewertungseinheiten, Bewertungslinsen und Ablationsoberfläche, sodass die Überschriftenzahlen und die Deltas von tools_off / playbooks_off direkt vergleichbar sind.

Das Repository ist lokal-zuerst. Ein Laptop, drei API-Schlüssel und ein im Repo festgeschriebenes Beispiel-Parquet reichen aus, um einen Smoke-Test unter einem Budget von 10 $ zu reproduzieren.

Status

Alpha. Die gesamte Pipeline läuft von Anfang bis Ende. Abgedeckte Komponenten:

  • Schritt 1: Paketgerüst, Verträge, Konfigurationen, Schema
  • Schritt 2: Der Index-Builder (socbench build-index) mit deterministischen, inhaltsadressierten Indizes
  • Schritt 3: Nur-Lese-Werkzeugschicht mit Persona-Zulassungsliste + Beispiel-Builder
  • Schritt 4: Personas, Playbooks, Prompt-Komposition + Verbotene-Token-Prüfung
  • Schritt 5: Anbieter-Adapter (OpenAI / Anthropic / Gemini + immer anwendbarer Mock) und die Multi-Turn-Agentenschleife mit Budgetgrenzen und Kosten/Latenz-Zusammenfassungen
  • Schritt 6: Bewertung (pro Flow / pro Paar / pro Host F1), stratifiziertes Sampling, Ablationsaggregation
  • Schritt 7: Schnellstart + Ergebnisse-Explorer-Notebooks; Reproduktionsanweisungen in REPRODUCE.md

Sie können noch heute einen kompletten Smoke-Test ohne API-Schlüssel über den Mock-Provider durchführen (siehe Quickstart Schritt 3 oder notebooks/quickstart.ipynb).

Installation

socbench wird als Standard-PEP-621-/Hatchling-Projekt ausgeliefert. Beide Installationswege funktionieren.

Mit uv (empfohlen für die Entwicklung)

root@kitploit:~
curl -LsSf https://astral.sh/uv/install.sh | sh

git clone https://github.com/DeepTempo/socbench.git
cd socbench

uv venv --python 3.11
source .venv/bin/activate
uv pip install -e ".[dev,providers]"

Mit einfachem pip

root@kitploit:~
git clone https://github.com/DeepTempo/socbench.git
cd socbench

python3.11 -m venv .venv
source .venv/bin/activate
pip install -e ".[dev,providers]"

In beiden Fällen sollte socbench --help nun die verfügbaren Unterbefehle auflisten.

Konfiguration

config/benchmark_config.yaml enthält sichere Standardwerte: Smoke cost_budget_usd: 10, voll cost_budget_usd: 900, fest cost_usd_cap_per_rendering: 0.50. Pfade darin, die auf Geschwister-Konfigurationsdateien verweisen (schema_path, pricing_path), werden relativ zum eigenen Verzeichnis der YAML aufgelöst, sodass Umbenennen oder Verschieben von config/ keine Codeänderungen erfordert.

Schnellstart

1. Erstellen eines inhaltsadressierten Index aus einem Parquet-Datensatz

root@kitploit:~
socbench build-index \
  --config config/benchmark_config.yaml \
  --dataset sample

Dies normalisiert das Parquet gegen config/schema.json, sortiert global nach ts_start mit deterministischer Tie-Break-Auflösung, weist stabile flow_ids zu, leitet pair_timeline / host_egress-Bewertungseinheiten ab, berechnet Zusammenfassungen und schreibt in indexes/<dataset_hash>/.

Ein erneutes Ausführen des Befehls auf denselben Daten ist ein No-Op. Übergeben Sie --rebuild, um einen erneuten Build zu erzwingen.

2. Untersuchen der Werkzeugschicht

root@kitploit:~
socbench tools-smoke \
  --dataset-hash <dataset_hash> \
  --persona soc_analyst

Dies ruft jedes Werkzeug in der Zulassungsliste der Persona gegen den erstellten Index auf und gibt eine Zusammenfassung aus, ohne Modellaufrufe.

3. Ausführen des Benchmarks

root@kitploit:~
# Free, deterministic, no API keys (the mock provider):
socbench run --dataset-hash <dataset_hash> --providers mock --personas all

# Real models (after `pip install -e ".[providers]"` + exporting API keys):
socbench run --dataset-hash <dataset_hash> --providers all --personas all

Die Einheitenauswahl erfolgt standardmäßig durch stratifiziertes Sampling, deterministisch in (dataset_hash, sample_seed, mode). Jede (Einheit × Persona × Anbieter)-Rendering durchläuft eine begrenzte Multi-Turn-Agentenschleife; Ergebnisse landen unter runs/<run_id>/ mit summary.json (Bewertung + Kosten + Cache-Zusammenfassungen), eval_units_summary.jsonl, predictions_raw.jsonl, renderings.jsonl, tool_calls.jsonl und prompts_used/.

4. Ausführen von Ablationen und Aggregieren der Deltas

root@kitploit:~
socbench run --dataset-hash <dataset_hash> --ablation tools_off --providers mock --personas all
socbench aggregate --dataset-hash <dataset_hash>
# → ablations/<dataset_hash>/<seed>/ablation_summary.json  (tools_off → main deltas)

5. Erkunden

notebooks/quickstart.ipynb führt die gesamte Schleife aus (es synthetisiert einen Beispieldatensatz, benötigt also keine festgeschriebenen Daten) und zeichnet das F1 pro Persona. notebooks/results_explorer.ipynb lädt ein beliebiges runs/<run_id>/ und schneidet die Ergebnisse nach Stratum, Persona und Anbieter auf. Installieren mit pip install -e ".[notebooks]".

Erweitern des Benchmarks

Jedes für die Weiterentwicklung konzipierte Interface ist entweder eine Registry oder ein YAML-Schlüssel:

  • Neues Werkzeug: Legen Sie eine neue Datei unter src/socbench/tools/catalog/<name>.py an, mit einer Tool-Unterklasse, registrieren Sie es in src/socbench/tools/catalog/__init__.py durch Anhängen an ALL_TOOLS, und fügen Sie seinen Namen zu den entsprechenden Persona-tools:-Listen in config/benchmark_config.yaml hinzu. Der tools_manifest_sha verschiebt sich automatisch. Dateiname, YAML-Name und Matrixeintrag sind absichtlich 1:1.
  • Neuer Bewertungseinheitentyp: Fügen Sie einen Zuweiser in src/socbench/index.py und einen passenden Literal zu EvalUnitType in src/socbench/models.py hinzu.
  • Neuer Anbieter-Adapter: Implementieren Sie die Adapter-ABC in einer neuen , registrieren Sie ihn in der -Factory in , und fügen Sie einen Eintrag unter in hinzu. Die Preisgestaltung kommt in . SDK-Importe bleiben lazy, sodass die Abhängigkeit optional ist.

Methodik

Die vollständige Methodik (Bewertungseinheiten, Persona x Tool-Matrix, Agentenschleife, Bewertung, Kostenmodell, Reparaturrichtlinie, Sampling, Ablationen, Laufartefakte) ist über die modulebene Dateien in src/socbench/ implementiert (jede enthält einen fokussierten Modul-Docstring).

Lizenz

Apache-2.0. Siehe LICENSE.

Tool herunterladen
BereichStandardOrt
Benchmark-Standardwerte (Sampling, Agentenbudgets, Anbieter, Persona × Tool-Matrix)benchmark_config.yamlconfig/
Kanonisches NetFlow-Schema + Normalisierungsaliaseschema.jsonconfig/
Preisschnappschuss des Anbieters (USD pro 1 M Token)pricing.yamlconfig/
API-Schlüssel des AnbietersUmgebungsvariablen OPENAI_API_KEY, ANTHROPIC_API_KEY, GOOGLE_API_KEYShell-Umgebung
src/socbench/providers/<name>_adapter.py
build_adapter
providers/base.py
providers:
config/benchmark_config.yaml
config/pricing.yaml
  • Neue Persona: Fügen Sie einen Block unter agent.personas: in config/benchmark_config.yaml mit ihrem Budget und der tools:-Zulassungsliste hinzu.
  • Neue Bewertungslinse: Fügen Sie eine Linse zu score_unit in src/socbench/scoring.py und ein passendes Feld zu EvalUnitSummary in models.py hinzu.
  • Neue Ablation: Erweitern Sie die Ablation-Behandlung in prompts.py / agent.py und die Tag-Liste in aggregate.py.