Skip to content
KitploitKITPLOIT
HerramientasExploitsBlog
Log in
Enviar
HerramientasExploitsBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

··Feeds·Contacto·Privacidad·© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
redeval — [ICLR 2026] - Repositorio oficial del artículo: "RedBench: Un Conjunto de Datos Universal para Red Teaming Integral de Modelos de Lenguaje de Gran Escala" | Kitploit
Herramientas/GitHubGitHub/knoveleng/redeval
Papers e InvestigaciónAprendizaje y EducaciónRecursos CuradosSeguridad de IAAtaque Adversario
GitHubknoveleng/redeval

redeval

[ICLR 2026] - Repositorio oficial del artículo: "RedBench: Un Conjunto de Datos Universal para Red Teaming Integral de Modelos de Lenguaje de Gran Escala"

Ver Repositorio
29412hace 7 mesesRevisado por Kitploit

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
Compartir
Sitio web

RedEval - Marco de evaluación de seguridad de LLM

Python 3.8+ License: MIT Dataset on HF

Un marco integral para evaluar la seguridad de los modelos de lenguaje de gran escala (LLM) mediante pruebas sistemáticas de ataque y rechazo. RedEval proporciona una plataforma unificada, segura y extensible para evaluar la robustez de los LLM frente a prompts adversarios y contenido dañino. Forma parte del artículo "RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models", que presenta un conjunto de datos universal para el red teaming integral de LLM.

📦 Conjunto de datos: El conjunto de datos RedBench está disponible públicamente en HuggingFace en knoveleng/redbench. Incluye prompts integrales de red teaming en múltiples categorías y dominios de seguridad.

🚀 Inicio rápido

1. Configurar el entorno

# Clonar el repositorio
git clone https://github.com/knoveleng/redeval.git
cd redeval

# Instalar dependencias
pip install -r requirements.txt

# Copiar y configurar las variables de entorno
cp .env.template .env
# Edita .env con tus claves de API

2. Configurar las claves de API

Edita el archivo .env con tus credenciales:

OPENAI_API_KEY=your_openai_api_key_here
HUGGINGFACE_TOKEN=your_huggingface_token_here

3. Ejecutar la evaluación

# Configurar el entorno
source ./sh/setup_env.sh

# Ejecutar con los modelos predeterminados; puedes editar .env para definir los modelos que desees ejecutar
python -m redeval.cli run-pipeline

# Ejecutar el pipeline completo con modelos específicos
python -m redeval.cli run-pipeline --models "Qwen/Qwen2.5-7B-Instruct" "gpt-4o-mini"

# O ejecutar fases individuales
./sh/generate_attack.sh
./sh/run_attack.sh
./sh/eval_attack.sh

📋 Tabla de contenido

  • Descripción general
  • Arquitectura
  • Instalación
  • Configuración
  • Uso
  • Funciones de seguridad
  • Referencia de API
  • Contribuciones
  • Licencia

🎯 Descripción general

RedEval evalúa la seguridad de los LLM mediante dos enfoques complementarios:

🔴 Fase de ataque

Prueba la vulnerabilidad de los LLM frente a prompts adversarios mediante diversas técnicas de jailbreak:

  • Ataques directos: Prompts dañinos directos
  • Jailbreaks humanos: Técnicas de evasión creadas por humanos
  • Ataques zero-shot: Generación automatizada de prompts adversarios

🛡️ Fase de rechazo

Evalúa la capacidad del LLM para rechazar adecuadamente solicitudes dañinas en múltiples conjuntos de datos de seguridad:

  • CoCoNot: Moderación de contenido sensible al contexto
  • SGXSTest: Examen de pautas de seguridad
  • XSTest: Pruebas de seguridad entre dominios
  • ORBench: Evaluación comparativa objetiva del rechazo

📊 Puntuación

Calcula métricas de seguridad integrales que combinan el rendimiento de ataque y rechazo.

🏗️ Arquitectura

Componentes principales

redeval/
├── redeval/                 # Módulos principales de Python
│   ├── config.py           # Gestión de entorno y configuración
│   ├── pipeline.py         # Orquestador centralizado del pipeline
│   ├── cli.py              # Interfaz de línea de comandos unificada
│   ├── exceptions.py       # Manejo personalizado de excepciones
│   ├── generate_attack.py  # Generación de prompts de ataque
│   ├── run_attack.py       # Ejecución de ataques
│   ├── eval_attack.py      # Evaluación de ataques
│   ├── run_refuse.py       # Pruebas de rechazo
│   ├── eval_refuse.py      # Evaluación de rechazo
│   └── score.py            # Cálculo de métricas
├── sh/                     # Interfaces de scripts de shell
│   ├── setup_env.sh        # Configuración del entorno
│   ├── generate_attack.sh  # Script de generación de ataques
│   ├── run_attack.sh       # Script de ejecución de ataques
│   ├── eval_attack.sh      # Script de evaluación de ataques
│   ├── run_refuse.sh       # Script de pruebas de rechazo
│   ├── eval_refuse.sh      # Script de evaluación de rechazo
│   └── score.sh            # Script de puntuación
├── recipes/                # Archivos de configuración
├── logs/                   # Resultados de la evaluación
└── .env                    # Variables de entorno

Pipeline de evaluación

graph TD
    A[Generar prompts de ataque] --> B[Ejecutar pruebas de ataque]
    B --> C[Evaluar resultados de ataque]
    D[Ejecutar pruebas de rechazo] --> E[Evaluar resultados de rechazo]
    C --> F[Calcular puntuaciones finales]
    E --> F
    F --> G[Generar informes]

🛠️ Instalación

Requisitos previos

  • Python 3.8 o superior
  • Clave de API de OpenAI
  • Token de HuggingFace
  • Git

Instalación paso a paso

  1. Clonar el repositorio

    git clone <repository-url>
    cd redeval
    
  2. Instalar dependencias

    pip install -r requirements.txt
    
  3. Configurar el entorno

    cp .env.template .env
    # Edita .env con tus credenciales de API
    
  4. Verificar la instalación

    python -m redeval.cli --help
    

⚙️ Configuración

Variables de entorno

RedEval utiliza variables de entorno para una configuración segura y flexible:

Variables obligatorias

VariableDescripciónEjemplo
OPENAI_API_KEYClave de API de OpenAIsk-proj-...
HUGGINGFACE_TOKENToken de HuggingFacehf_...

Configuración opcional

VariableDescripciónValor predeterminado
REDEVAL_PROJECT_ROOTDirectorio raíz del proyectoDirectorio actual
REDEVAL_LOG_DIRDirectorio de logs./logs
REDEVAL_RECIPES_DIRDirectorio de configuración./recipes
REDEVAL_LOG_LEVELNivel de registroINFO
REDEVAL_NUM_SAMPLESNúmero de muestras de evaluación10
REDEVAL_SEEDSemilla aleatoria0

Configuración de modelos

VariableDescripciónValor predeterminado
REDEVAL_OPEN_SOURCE_MODELSLista de modelos de código abierto"Qwen/Qwen2.5-7B-Instruct"
REDEVAL_CLOSED_SOURCE_MODELSLista de modelos de código cerrado"gpt-4o-mini"

Archivos de configuración

Los archivos de configuración del directorio recipes/ controlan los parámetros de evaluación:

  • attack/base-open.yml - Configuración de ataque para modelos de código abierto
  • attack/base-close.yml - Configuración de ataque para modelos de código cerrado
  • attack/eval.yml - Configuración de evaluación de ataques
  • refuse/base-open.yml - Configuración de rechazo para modelos de código abierto
  • refuse/base-close.yml - Configuración de rechazo para modelos de código cerrado
  • refuse/eval.yml - Configuración de evaluación de rechazo

🚀 Uso

Interfaz de línea de comandos

RedEval proporciona una CLI unificada para todas las operaciones:

Pipeline completo

# Ejecutar el pipeline de evaluación completo
python -m redeval.cli run-pipeline

# Ejecutar con modelos específicos
python -m redeval.cli run-pipeline --models "Qwen/Qwen2.5-7B-Instruct" "gpt-4o-mini"

# Ejecutar únicamente fases específicas
python -m redeval.cli run-pipeline --phases generate_attack run_attack eval_attack

Componentes individuales

# Generar prompts de ataque
python -m redeval.cli generate-attack --config ./recipes/attack/base-close.yml
Descargar herramienta