Skip to content
KitploitKITPLOIT
OutilsExploitsBlog
Log in
Soumettre
OutilsExploitsBlog
Soumettre

Outils de Hacking, PenTest et Cybersécurité pour votre Arsenal de Sécurité !

Kitploit est un répertoire d'outils de hacking, de cybersécurité et de pentesting. Découvrez les dernières mises à jour des projets pour trouver des vulnérabilités, analyser des systèmes, automatiser les tests et renforcer votre sécurité.

··Flux·Contact·Confidentialité·© 2026 Kitploit

Répertoire d'outils

Catégories

Voir toutes les catégories
Loading categories
redeval — [ICLR 2026] - Dépôt officiel de l'article : "RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models" | Kitploit
Outils/GitHubGitHub/knoveleng/redeval
Articles et RechercheApprentissage et ÉducationRessources OrganiséesSécurité de l'IAAttaque Adversariale
GitHubknoveleng/redeval

redeval

[ICLR 2026] - Dépôt officiel de l'article : "RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models"

Voir le dépôt
29412il y a 7 moisVérifié par Kitploit

Populaires

Voir tout →

Découvrez les outils les plus utilisés par notre communauté.

Explorer tous les outils

Parcourez notre collection d'outils

Voir tous les outils →
Partager
Site web

RedEval - Framework d'évaluation de la sécurité des LLM

Python 3.8+ License: MIT Dataset on HF

Un framework complet pour évaluer la sécurité des grands modèles de langage (LLM) grâce à des tests systématiques d'attaque et de refus. RedEval fournit une plateforme unifiée, sécurisée et extensible pour évaluer la robustesse des LLM face aux prompts adverses et aux contenus nuisibles. Il fait partie de l'article "RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models", qui est un jeu de données universel pour le red teaming complet des LLM.

📦 Jeu de données : Le jeu de données RedBench est disponible publiquement sur HuggingFace à l'adresse knoveleng/redbench. Il inclut des prompts de red teaming complets couvrant plusieurs catégories et domaines de sécurité.

🚀 Démarrage rapide

1. Configuration de l'environnement

# Clone the repository
git clone https://github.com/knoveleng/redeval.git
cd redeval

# Install dependencies
pip install -r requirements.txt

# Copy and configure environment variables
cp .env.template .env
# Edit .env with your API keys

2. Configuration des clés API

Modifiez le fichier .env avec vos identifiants :

OPENAI_API_KEY=your_openai_api_key_here
HUGGINGFACE_TOKEN=your_huggingface_token_here

3. Exécution de l'évaluation

# Set up environment
source ./sh/setup_env.sh

# Run with default models, you can edit .env to define models which you wanna run
python -m redeval.cli run-pipeline

# Run complete pipeline with specific models
python -m redeval.cli run-pipeline --models "Qwen/Qwen2.5-7B-Instruct" "gpt-4o-mini"

# Or run individual phases
./sh/generate_attack.sh
./sh/run_attack.sh
./sh/eval_attack.sh

📋 Table des matières

  • Aperçu
  • Architecture
  • Installation
  • Configuration
  • Utilisation
  • Fonctionnalités de sécurité
  • Référence de l'API
  • Contribution
  • Licence

🎯 Aperçu

RedEval évalue la sécurité des LLM selon deux approches complémentaires :

🔴 Phase d'attaque

Teste la vulnérabilité des LLM face aux prompts adverses à l'aide de diverses techniques de jailbreak :

  • Attaques directes : Des prompts nuisibles directs
  • Jailbreaks humains : Des techniques de contournement élaborées par des humains
  • Attaques zero-shot : Génération automatisée de prompts adverses

🛡️ Phase de refus

Évalue la capacité des LLM à refuser de manière appropriée les requêtes nuisibles sur plusieurs jeux de données de sécurité :

  • CoCoNot : Modération de contenu contextuelle
  • SGXSTest : Examen des directives de sécurité
  • XSTest : Tests de sécurité inter-domaines
  • ORBench : Benchmarking objectif du refus

📊 Calcul du score

Calcule des métriques de sécurité complètes combinant les performances d'attaque et de refus.

🏗️ Architecture

Composants principaux

redeval/
├── redeval/                 # Core Python modules
│   ├── config.py           # Environment & configuration management
│   ├── pipeline.py         # Centralized pipeline orchestrator
│   ├── cli.py              # Unified command-line interface
│   ├── exceptions.py       # Custom exception handling
│   ├── generate_attack.py  # Attack prompt generation
│   ├── run_attack.py       # Attack execution
│   ├── eval_attack.py      # Attack evaluation
│   ├── run_refuse.py       # Refusal testing
│   ├── eval_refuse.py      # Refusal evaluation
│   └── score.py            # Metric calculation
├── sh/                     # Shell script interfaces
│   ├── setup_env.sh        # Environment setup
│   ├── generate_attack.sh  # Attack generation script
│   ├── run_attack.sh       # Attack execution script
│   ├── eval_attack.sh      # Attack evaluation script
│   ├── run_refuse.sh       # Refusal testing script
│   ├── eval_refuse.sh      # Refusal evaluation script
│   └── score.sh            # Scoring script
├── recipes/                # Configuration files
├── logs/                   # Evaluation results
└── .env                    # Environment variables

Pipeline d'évaluation

graph TD
    A[Generate Attack Prompts] --> B[Run Attack Tests]
    B --> C[Evaluate Attack Results]
    D[Run Refuse Tests] --> E[Evaluate Refuse Results]
    C --> F[Calculate Final Scores]
    E --> F
    F --> G[Generate Reports]

🛠️ Installation

Prérequis

  • Python 3.8 ou supérieur
  • Clé API OpenAI
  • Jeton HuggingFace
  • Git

Installation étape par étape

  1. Cloner le dépôt

    git clone <repository-url>
    cd redeval
    
  2. Installer les dépendances

    pip install -r requirements.txt
    
  3. Configurer l'environnement

    cp .env.template .env
    # Edit .env with your API credentials
    
  4. Vérifier l'installation

    python -m redeval.cli --help
    

⚙️ Configuration

Variables d'environnement

RedEval utilise des variables d'environnement pour une configuration sécurisée et flexible :

Variables requises

VariableDescriptionExemple
OPENAI_API_KEYClé API OpenAIsk-proj-...
HUGGINGFACE_TOKENJeton HuggingFacehf_...

Configuration optionnelle

VariableDescriptionDéfaut
REDEVAL_PROJECT_ROOTRépertoire racine du projetRépertoire actuel
REDEVAL_LOG_DIRRépertoire des journaux./logs
REDEVAL_RECIPES_DIRRépertoire de configuration./recipes
REDEVAL_LOG_LEVELNiveau de journalisationINFO
REDEVAL_NUM_SAMPLESNombre d'échantillons d'évaluation10
REDEVAL_SEEDGraine aléatoire0

Configuration des modèles

VariableDescriptionDéfaut
REDEVAL_OPEN_SOURCE_MODELSListe des modèles open source"Qwen/Qwen2.5-7B-Instruct"
REDEVAL_CLOSED_SOURCE_MODELSListe des modèles à source fermée"gpt-4o-mini"

Fichiers de configuration

Les fichiers de configuration du répertoire recipes/ contrôlent les paramètres d'évaluation :

  • attack/base-open.yml - Configuration d'attaque des modèles open source
  • attack/base-close.yml - Configuration d'attaque des modèles à source fermée
  • attack/eval.yml - Configuration d'évaluation des attaques
  • refuse/base-open.yml - Configuration de refus des modèles open source
  • refuse/base-close.yml - Configuration de refus des modèles à source fermée
  • refuse/eval.yml - Configuration d'évaluation des refus

🚀 Utilisation

Interface en ligne de commande

RedEval fournit une CLI unifiée pour toutes les opérations :

Pipeline complet

# Run full evaluation pipeline
python -m redeval.cli run-pipeline

# Run with specific models
python -m redeval.cli run-pipeline --models "Qwen/Qwen2.5-7B-Instruct" "gpt-4o-mini"

# Run specific phases only
python -m redeval.cli run-pipeline --phases generate_attack run_attack eval_attack

Composants individuels

# Generate attack prompts
python -m redeval.cli generate-attack --config ./recipes/attack/base-close.yml

# Run attack evaluation
python -m redeval.cli run-attack --config ./recipes/attack/base-open.yml --model "Qwen/Qwen2.5-7B-Instruct"

# Evaluate attack results
python -m redeval.cli eval-attack --config ./recipes/attack/eval.yml --log-dir ./logs/attack/HarmBench/direct/model_name
Télécharger l’outil