Skip to content
KitploitKITPLOIT
ToolsExploitsBlog
Log in
Einreichen
ToolsExploitsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

··Feeds·Kontakt·Datenschutz·© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
redteam-ai-benchmark — Red Team AI Benchmark: Bewertung von LLMs für autorisierte offensive Sicherheitsaufgaben. Red Team AI Benchmark ist ein CLI-Modellbewertungs-Benchmark. Er misst, wie LLMs Red-Team-Fragen und Sicherheitsszenarien verstehen und darauf reagieren; es ist kein Werkzeug zur Durchführung dieser Aktivitäten. Version 2 verwendet einen rubrikbasierten Datensatz, anstatt Antworten nur anhand einer einzigen goldenen Antwort zu bewerten. | Kitploit
Tools/GitLabGitLab/toxy4ny/redteam-ai-benchmark
PenetrationstestsMaschinelles LernenLernen & BildungRed TeamingKI-SicherheitLabs & Praxis
GitLabtoxy4ny/redteam-ai-benchmark

redteam-ai-benchmark

Repository anzeigen
221vor 2 MonatenNoch nicht geprüft

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →

Über

Red Team AI Benchmark: Bewertung von LLMs für autorisierte offensive Sicherheitsaufgaben. Red Team AI Benchmark ist ein CLI-Modellbewertungs-Benchmark. Er misst, wie LLMs Red-Team-Fragen und Sicherheitsszenarien verstehen und darauf reagieren; es ist kein Werkzeug zur Durchführung dieser Aktivitäten. Version 2 verwendet einen rubrikbasierten Datensatz, anstatt Antworten nur anhand einer einzigen goldenen Antwort zu bewerten.

Teilen

Red Team AI Benchmark

Russische Version: README.ru.md

Red Team AI Benchmark ist ein CLI Modellbewertungs-Benchmark. Er misst, wie LLMs Red-Team-Fragen und Sicherheitsszenarien verstehen und darauf antworten; er ist kein Werkzeug zur Durchführung dieser Aktivitäten. Version 2 verwendet einen rubrikbasierten Datensatz anstatt Antworten nur anhand einer einzigen goldenen Antwort zu bewerten.

Der standardmäßige v2-Satz enthält 60 Fragen in datasets/v2/benchmark.jsonl, gruppiert nach Domäne und Schwierigkeitsgrad.

Repository-Status

Das ursprüngliche GitHub-Repository ist nicht mehr verfügbar; als sein Eigentümer wurde ich von der GitHub-Plattform ausgeschlossen. Ein alternatives Spiegel-Repository für das Projekt (gepflegt vom Hauptbeitragenden und Co-Autor) ist verfügbar unter https://github.com/szybnev/redteam-ai-benchmark. Der derzeitige Eigentümer dieses Repositorys ist sein aktiver Entwickler und Betreuer.

Zweck und Umfang

project_type: LLM evaluation benchmark
primary_function: assess model responses to red-team questions and scenarios
execution_target: configured LLM provider, optional judge, and optional tracing services
target_system_access: none
model_output_execution: none
user_control: all actions after a response is returned depend solely on the end user and their own framework, permissions, and environment

Explizite Nicht-Ziele

  • Dieses Repository ist kein Hacking-Tool, Exploit-Framework, Scanner, C2, Persistenz-Tool, Payload-Runner oder autonomer Red-Team-Agent.
  • Es entdeckt, greift nicht auf Zielsysteme zu, nutzt sie nicht aus, modifiziert sie nicht und hält keinen Zugriff aufrecht.
  • Es führt keine Modellausgabe aus. Der Benchmark sendet nur Bewertungsprompts an konfigurierte Modellendpunkte, bewertet den zurückgegebenen Text und schreibt Ergebnisse.
  • Das Vorhandensein von offensive-security Themen im Testdatensatz beschreibt die Bewertungsdomäne; es gewährt keine Erlaubnis oder Autorisierung für Aktivitäten gegen ein System.

Benutzerverantwortung

Der Benchmark autorisiert, leitet oder kontrolliert keine Aktivität außerhalb des Evaluierungslaufs. Jegliche nachgelagerte Nutzung von Modellantworten, einschließlich der Nutzung durch einen separaten Agenten oder ein Automatisierungsframework, hängt vollständig vom Endbenutzer, seiner Konfiguration, seinen Berechtigungen und seiner Umgebung ab. Nutzen Sie den Datensatz und die Ergebnisse nur für autorisierte Evaluierung, Forschung, Tests oder Bildung.

image

Veröffentlichte Rangliste

In diesem Branch wird derzeit keine Rangliste veröffentlicht. Historische Ergebnisse wurden mit älteren lexikalischen und partiellen Judge-Semantiken erstellt und sind nicht mit dem aktuellen Bewerter vergleichbar.

Eine veröffentlichungsfähige Rangliste erfordert einen vollständigen Judge-Durchlauf mit passenden Dataset-Hashes, null Judge-Fehlern und vollständiger Abdeckung. Erzeugen Sie die geprüften JSON- und Markdown-Artefakte mit:

uv run run_benchmark.py leaderboard \
  --judge-summary judge_results_v2/summary.csv \
  --output-dir leaderboard

Der Befehl erfordert die zugehörigen per_model/*.json-Judge-Aufzeichnungen und lehnt disputed-Zusammenfassungen, unvollständige Judge-Abdeckung, Dataset-Hash-Unterschiede und Zeilen ohne Judge-Modell-Provenienz ab. Das resultierende Paket enthält rohe Benchmark-Ergebnisse, Judge-Aufzeichnungen pro Frage, deren Hashes und eine Kopie von summary.csv. Das Ranking verwendet den rohen rubric_score; judge_adjusted_score wird nur als separates Prüfergebnis angezeigt.

Was v2 misst

Der Benchmark berichtet die gewichtete Gesamtpunktzahl sowie separate Prüfmetriken:

MetrikBedeutungPopulation / Nenner
refusal_rateProzentsatz der verweigerten oder zensierten AntwortenAbgeschlossene Modellantworten
lexical_coverageAbdeckung von technischen KriterienmusternAbgeschlossene Antworten; Verweigerungen und fatale Übereinstimmungen zählen null
critical_error_rateAntworten, die nicht abgelehnte fatale Fehlerregeln erfüllenAbgeschlossene Modellantworten
lexical_completenessAbdeckung von VollständigkeitskriterienmusternAbgeschlossene Antworten; Verweigerungen und fatale Übereinstimmungen zählen null
lexical_specificityAbdeckung von SpezifitätskriterienmusternAbgeschlossene Antworten; Verweigerungen und fatale Übereinstimmungen zählen null
latency_ms_avgDurchschnittliche AntwortlatenzAbgeschlossene Antworten mit gemessener Latenz
metric_coverageBeobachtungen, die zu jedem lexikalischen Aggregat beitragenAbgeschlossene Modellantworten
run_coverageAbgeschlossene, fehlgeschlagene und übersprungene ModellanfragenErwartete Frage-Wiederholungsbeobachtungen
repeat_statisticsPunktzahlen pro Wiederholung, Standardabweichung und 95 % Bootstrap-KIAbgeschlossene Beobachtungen gruppiert nach Wiederholung

Interpretationslabels sind bewusst konservativ:

EndpunktzahlInterpretation
< 60%nicht geeignet
60-79,9%erfordert Validierung
>= 80%starker Kandidat

Interpretationslabels gelten nur für vollständige Läufe. Jeder Anfragefehler ändert die Interpretation zu incomplete, unter Beibehaltung der partiellen Punktzahl und Abdeckung für Diagnosezwecke. Wenn Wiederholungs-Konfidenzintervalle die 60- oder 80-Schwelle überschreiten, lautet die Interpretation uncertain. Eine hohe Punktzahl ist keine Produktionsfreigabe.

Dataset-Abdeckung

Das v2-Dataset umfasst:

  • Windows-Tradecraft
  • AD und AD CS
  • Web-Exploitation
  • Cloud und IAM
  • Container und Kubernetes
  • Erkennungs- und Ausweichlogik
  • OpSec und operative Abwägungen
  • Werkzeugnutzung
  • Post-Exploitation-Planung
  • Validierung und Berichterstattung

Schwierigkeitsstufen sind L1 factual, L2 procedure, L3 troubleshooting, L4 scenario reasoning und L5 multi-step operator task.

Installation

Voraussetzungen:

  • Python 3.13+
  • uv
  • Ein Anbieter: Ollama, LM Studio, OpenWebUI oder OpenRouter

Installieren Sie die Basisabhängigkeiten:

uv sync

Anbieter

AnbieterStandard-EndpunktHinweise
ollamahttp://localhost:11434Native Ollama-API; optionale Bearer-Authentifizierung für Reverse-Proxies
lmstudiohttp://localhost:1234OpenAI-kompatible LM Studio-API
openwebuihttp://localhost:3000OpenAI-kompatible OpenWebUI-API
openrouterhttps://openrouter.ai/api/v1Erfordert einen API-Schlüssel

Nutzung

Modelle auflisten:

uv run run_benchmark.py ls ollama
uv run run_benchmark.py ls lmstudio
uv run run_benchmark.py ls openwebui
uv run run_benchmark.py ls openrouter --api-key "$OPENROUTER_API_KEY"

Das standardmäßige v2-Profil ausführen:

uv run run_benchmark.py run ollama -m "llama3.1:8b"

Ein schnelles Smoke-Subset ausführen:

uv run run_benchmark.py run ollama -m "llama3.1:8b" --profile quick

Ausgewählte v2-Fragen nach ID ausführen:

uv run run_benchmark.py run ollama -m "llama3.1:8b" --question-ids 5 12

Ein append-only Anforderungslog pro Frage schreiben:

uv run run_benchmark.py run ollama -m "llama3.1:8b" --request-log results/requests.jsonl

Mehrere lokale Modelle interaktiv ausführen:

uv run run_benchmark.py interactive ollama --profile standard

Unterstützte Profile:

ProfilZweck
quick16-Fragen L1/L2 API- und Pipeline-Smoke-Subset; kein Ranking-Stellvertreter
standardVollständiger 60-Fragen v2-Benchmark

Bewertung

Tool herunterladen