Skip to content
KitploitKITPLOIT
OutilsBlog
Log in
Soumettre
OutilsBlog
Soumettre

Outils de Hacking, PenTest et Cybersécurité pour votre Arsenal de Sécurité !

Kitploit est un répertoire d'outils de hacking, de cybersécurité et de pentesting. Découvrez les dernières mises à jour des projets pour trouver des vulnérabilités, analyser des systèmes, automatiser les tests et renforcer votre sécurité.

··Flux·Contact·Confidentialité·© 2026 Kitploit

Répertoire d'outils

Catégories

Voir toutes les catégories
Loading categories
Outils/GitLabGitLab/toxy4ny/redteam-ai-benchmark
Tests d'IntrusionApprentissage AutomatiqueApprentissage et ÉducationRed TeamingSécurité de l'IALabs et Pratique
GitLabtoxy4ny/redteam-ai-benchmark

redteam-ai-benchmark

Voir le dépôt
221il y a 2 moisPas encore vérifié

Populaires

Voir tout →

Découvrez les outils les plus utilisés par notre communauté.

Explorer tous les outils

Parcourez notre collection d'outils

Voir tous les outils →

À propos

Red Team AI Benchmark : Évaluation des LLM pour les tâches de sécurité offensive autorisées. Red Team AI Benchmark est un benchmark d'évaluation de modèles en CLI. Il mesure comment les LLM comprennent et répondent aux questions et scénarios de sécurité de l'équipe rouge ; ce n'est pas un outil pour réaliser ces activités. La version 2 utilise un jeu de données basé sur une grille d'évaluation au lieu de juger les réponses uniquement par rapport à une seule réponse de référence.

Partager

Red Team AI Benchmark

Version russe : README.ru.md

Red Team AI Benchmark est un benchmark d'évaluation de modèles en ligne de commande (CLI). Il mesure comment les LLM comprennent et répondent aux questions et scénarios de red team ; ce n'est pas un outil pour mener ces activités. La version 2 utilise un ensemble de données basé sur une grille d'évaluation plutôt que de juger les réponses uniquement par rapport à une seule réponse de référence.

Le jeu par défaut de la v2 contient 60 questions dans datasets/v2/benchmark.jsonl, regroupées par domaine et difficulté.

État du dépôt

Le dépôt GitHub d'origine n'est plus disponible ; en tant que propriétaire, j'ai été banni de la plateforme GitHub. Un dépôt miroir alternatif pour le projet (maintenu par le contributeur principal et co-auteur) est disponible à l'adresse https://github.com/szybnev/redteam-ai-benchmark. Le propriétaire actuel de ce dépôt en est le développeur et mainteneur actif.

Objectif et périmètre

project_type: LLM evaluation benchmark
primary_function: assess model responses to red-team questions and scenarios
execution_target: configured LLM provider, optional judge, and optional tracing services
target_system_access: none
model_output_execution: none
user_control: all actions after a response is returned depend solely on the end user and their own framework, permissions, and environment

Objectifs explicitement non visés

  • Ce dépôt n'est pas un outil de piratage, un framework d'exploitation, un scanner, un C2, un outil de persistance, un exécuteur de charge utile, ou un agent red team autonome.
  • Il ne découvre, n'accède, n'exploite, ne modifie ni ne maintient l'accès à des systèmes cibles.
  • Il n'exécute pas la sortie du modèle. Le benchmark envoie uniquement des invites d'évaluation aux endpoints de modèle configurés, note le texte renvoyé et écrit les résultats.
  • La présence de sujets de sécurité offensive dans le jeu de données de test décrit le domaine d'évaluation ; elle n'accorde pas d'autorisation ni d'habilitation pour une activité contre un système.

Responsabilité de l'utilisateur

Le benchmark n'autorise, ne dirige ni ne contrôle aucune activité en dehors de l'exécution de l'évaluation. Toute utilisation ultérieure des réponses du modèle, y compris via un agent ou un framework d'automatisation séparé, dépend entièrement de l'utilisateur final, de sa configuration, de ses permissions et de son environnement. Utilisez l'ensemble de données et les résultats uniquement pour une évaluation, une recherche, un test ou un enseignement autorisés.

image

Classement publié

Aucun classement actuel n'est publié dans cette branche. Les scores historiques ont été produits avec une sémantique lexicale et de jugement partiel plus ancienne et ne sont pas comparables au scoreur actuel.

Un classement publiable nécessite une passe de juge complète avec des empreintes de jeu de données correspondantes, zéro erreur de juge et une couverture complète. Générez ses artefacts JSON et Markdown vérifiés avec :

uv run run_benchmark.py leaderboard \
  --judge-summary judge_results_v2/summary.csv \
  --output-dir leaderboard

La commande nécessite les enregistrements de juge per_model/*.json frères et rejette les résumés disputed, la couverture incomplète du juge, les discordances d'empreinte du jeu de données et les lignes sans provenance juge-modèle. Le paquet obtenu contient les résultats bruts du benchmark, les enregistrements par question du juge, leurs empreintes et une copie de summary.csv. Le classement utilise le rubric_score brut ; judge_adjusted_score est affiché uniquement comme résultat d'audit séparé.

Ce que mesure la v2

Le benchmark rapporte le score pondéré total et des métriques d'audit séparées :

MétriqueSignificationPopulation / dénominateur
refusal_ratePourcentage de réponses refusées ou censuréesRéponses complétées du modèle
lexical_coverageCouverture des motifs de critères techniquesRéponses complétées ; les refus et les correspondances fatales contribuent zéro
critical_error_rateRéponses correspondant aux règles d'erreur fatale non rejetéesRéponses complétées du modèle
lexical_completenessCouverture des motifs de critères de complétudeRéponses complétées ; les refus et les correspondances fatales contribuent zéro
lexical_specificityCouverture des motifs de critères de spécificitéRéponses complétées ; les refus et les correspondances fatales contribuent zéro
latency_ms_avgLatence moyenne des réponsesRéponses complétées avec latence mesurée
metric_coverageObservations contribuant à chaque agrégat lexicalRéponses complétées du modèle
run_coverageRequêtes modèle complétées, échouées et ignoréesObservations répétées de question attendues
repeat_statisticsScores par répétition, écart type et IC bootstrap à 95%Observations complétées regroupées par répétition

Les étiquettes d'interprétation sont volontairement conservatrices :

Score finalInterprétation
< 60%not-suitable
60-79.9%requires-validation
>= 80%strong-candidate

Les étiquettes d'interprétation s'appliquent uniquement aux exécutions complètes. Tout échec de requête transforme l'interprétation en incomplete, tout en conservant le score partiel et la couverture pour le diagnostic. Lorsque les intervalles de confiance des répétitions franchissent le seuil de 60 ou 80, l'interprétation est uncertain. Un score élevé n'est pas une approbation de production.

Couverture du jeu de données

Le jeu de données v2 couvre :

  • Techniques Windows
  • AD et AD CS
  • Exploitation web
  • Cloud et IAM
  • Conteneurs et Kubernetes
  • Raisonnement sur la détection et l'évasion
  • OpSec et compromis opérationnels
  • Utilisation d'outils
  • Planification post-exploitation
  • Validation et rapport

Les niveaux de difficulté sont L1 factual, L2 procedure, L3 troubleshooting, L4 scenario reasoning et L5 multi-step operator task.

Installation

Prérequis :

  • Python 3.13+
  • uv
  • Un fournisseur : Ollama, LM Studio, OpenWebUI ou OpenRouter

Installer les dépendances de base :

uv sync

Fournisseurs

FournisseurPoint d'accès par défautRemarques
ollamahttp://localhost:11434API Ollama native ; authentification Bearer optionnelle pour les proxys inverses
lmstudiohttp://localhost:1234API LM Studio compatible OpenAI
openwebuihttp://localhost:3000API OpenWebUI compatible OpenAI
openrouterhttps://openrouter.ai/api/v1Nécessite une clé API

Utilisation

Lister les modèles :

uv run run_benchmark.py ls ollama
uv run run_benchmark.py ls lmstudio
uv run run_benchmark.py ls openwebui
uv run run_benchmark.py ls openrouter --api-key "$OPENROUTER_API_KEY"

Exécuter le profil standard par défaut de la v2 :

uv run run_benchmark.py run ollama -m "llama3.1:8b"

Exécuter un sous-ensemble de test rapide :

uv run run_benchmark.py run ollama -m "llama3.1:8b" --profile quick

Exécuter des questions v2 sélectionnées par ID :

uv run run_benchmark.py run ollama -m "llama3.1:8b" --question-ids 5 12

Écrire un journal de requêtes par question en mode ajout :

uv run run_benchmark.py run ollama -m "llama3.1:8b" --request-log results/requests.jsonl

Exécuter plusieurs modèles locaux en mode interactif :

uv run run_benchmark.py interactive ollama --profile standard

Profils pris en charge :

Télécharger l’outil