Skip to content
KitploitKITPLOIT
FerramentasExploitsBlog
Log in
Enviar
FerramentasExploitsBlog
Enviar

Ferramentas de Hacking, PenTest e Cibersegurança para o seu Arsenal de Segurança!

Kitploit é um diretório de ferramentas de hacking, cibersegurança e pentesting. Descubra as últimas atualizações de projetos para encontrar vulnerabilidades, analisar sistemas, automatizar testes e fortalecer sua segurança.

··Feeds·Contato·Privacidade·© 2026 Kitploit

Diretório de Ferramentas

Categorias

Ver todas as categorias
Loading categories
redeval — [ICLR 2026] - Repositório oficial do artigo: 'RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models' | Kitploit
Ferramentas/GitHubGitHub/knoveleng/redeval
Papers e PesquisaAprendizado e EducaçãoRecursos CuradosSegurança de IAAtaque Adversário
GitHubknoveleng/redeval

redeval

[ICLR 2026] - Repositório oficial do artigo: 'RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models'

Ver Repositório
29412há 7 mesesRevisado pelo Kitploit

Mais Populares

Ver todos →

Descubra as ferramentas mais usadas pela nossa comunidade.

Explore todas as ferramentas

Navegue pela nossa coleção de ferramentas

Ver todas as ferramentas →
Compartilhar
Site

RedEval - Framework de Avaliação de Segurança para LLMs

Python 3.8+ License: MIT Dataset on HF

Um framework abrangente para avaliar a segurança de Grandes Modelos de Linguagem (LLMs) por meio de testes sistemáticos de ataque e recusa. O RedEval fornece uma plataforma unificada, segura e extensível para avaliar a robustez de LLMs contra prompts adversariais e conteúdo prejudicial. Ele faz parte do artigo "RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models", que é um dataset universal para red teaming abrangente de LLMs.

📦 Dataset: O dataset RedBench está disponível publicamente no HuggingFace em knoveleng/redbench. Ele inclui prompts abrangentes de red teaming em várias categorias e domínios de segurança.

🚀 Início Rápido

1. Configurar Ambiente

# Clone o repositório
git clone https://github.com/knoveleng/redeval.git
cd redeval

# Instale as dependências
pip install -r requirements.txt

# Copie e configure as variáveis de ambiente
cp .env.template .env
# Edite .env com suas chaves de API

2. Configurar Chaves de API

Edite o arquivo .env com suas credenciais:

OPENAI_API_KEY=sua_chave_openai_api_aqui
HUGGINGFACE_TOKEN=seu_token_huggingface_aqui

3. Executar Avaliação

# Configure o ambiente
source ./sh/setup_env.sh

# Execute com modelos padrão; você pode editar .env para definir os modelos que deseja executar
python -m redeval.cli run-pipeline

# Execute o pipeline completo com modelos específicos
python -m redeval.cli run-pipeline --models "Qwen/Qwen2.5-7B-Instruct" "gpt-4o-mini"

# Ou execute fases individuais
./sh/generate_attack.sh
./sh/run_attack.sh
./sh/eval_attack.sh

📋 Índice

  • Visão Geral
  • Arquitetura
  • Instalação
  • Configuração
  • Uso
  • Recursos de Segurança
  • Referência da API
  • Contribuição
  • Licença

🎯 Visão Geral

O RedEval avalia a segurança de LLMs por meio de duas abordagens complementares:

🔴 Fase de Ataque

Testa a vulnerabilidade do LLM a prompts adversariais usando várias técnicas de jailbreak:

  • Ataques diretos: Prompts prejudiciais diretos
  • Jailbreaks humanos: Técnicas de contorno criadas por humanos
  • Ataques zero-shot: Geração automatizada de prompts adversariais

🛡️ Fase de Recusa

Avalia a capacidade do LLM de recusar adequadamente solicitações prejudiciais em vários datasets de segurança:

  • CoCoNot: Moderação de conteúdo sensível ao contexto
  • SGXTest: Exame de diretrizes de segurança
  • XSTest: Teste de segurança entre domínios
  • ORBench: Benchmarking objetivo de recusa

📊 Pontuação

Calcula métricas de segurança abrangentes combinando o desempenho de ataque e recusa.

🏗️ Arquitetura

Componentes Principais

redeval/
├── redeval/                 # Módulos principais em Python
│   ├── config.py           # Gerenciamento de ambiente e configuração
│   ├── pipeline.py         # Orquestrador centralizado do pipeline
│   ├── cli.py              # Interface de linha de comando unificada
│   ├── exceptions.py       # Tratamento personalizado de exceções
│   ├── generate_attack.py  # Geração de prompts de ataque
│   ├── run_attack.py       # Execução de ataque
│   ├── eval_attack.py      # Avaliação de ataque
│   ├── run_refuse.py       # Teste de recusa
│   ├── eval_refuse.py      # Avaliação de recusa
│   └── score.py            # Cálculo de métricas
├── sh/                     # Interfaces de script shell
│   ├── setup_env.sh        # Configuração do ambiente
│   ├── generate_attack.sh  # Script de geração de ataque
│   ├── run_attack.sh       # Script de execução de ataque
│   ├── eval_attack.sh      # Script de avaliação de ataque
│   ├── run_refuse.sh       # Script de teste de recusa
│   ├── eval_refuse.sh      # Script de avaliação de recusa
│   └── score.sh            # Script de pontuação
├── recipes/                # Arquivos de configuração
├── logs/                   # Resultados da avaliação
└── .env                    # Variáveis de ambiente

Pipeline de Avaliação

graph TD
    A[Gerar Prompts de Ataque] --> B[Executar Testes de Ataque]
    B --> C[Avaliar Resultados do Ataque]
    D[Executar Testes de Recusa] --> E[Avaliar Resultados da Recusa]
    C --> F[Calcular Pontuações Finais]
    E --> F
    F --> G[Gerar Relatórios]

🛠️ Instalação

Pré-requisitos

  • Python 3.8 ou superior
  • Chave da API OpenAI
  • Token do HuggingFace
  • Git

Instalação Passo a Passo

  1. Clonar Repositório

    git clone <url-do-repositorio>
    cd redeval
    
  2. Instalar Dependências

    pip install -r requirements.txt
    
  3. Configurar Ambiente

    cp .env.template .env
    # Edite .env com suas credenciais de API
    
  4. Verificar Instalação

    python -m redeval.cli --help
    

⚙️ Configuração

Variáveis de Ambiente

O RedEval usa variáveis de ambiente para configuração segura e flexível:

Variáveis Obrigatórias

VariávelDescriçãoExemplo
OPENAI_API_KEYChave da API OpenAIsk-proj-...
HUGGINGFACE_TOKENToken do HuggingFacehf_...

Configuração Opcional

VariávelDescriçãoPadrão
REDEVAL_PROJECT_ROOTDiretório raiz do projetoDiretório atual
REDEVAL_LOG_DIRDiretório de logs./logs
REDEVAL_RECIPES_DIRDiretório de configuração./recipes
REDEVAL_LOG_LEVELNível de logINFO
REDEVAL_NUM_SAMPLESNúmero de amostras de avaliação10
REDEVAL_SEEDSemente aleatória0

Configuração de Modelos

VariávelDescriçãoPadrão
REDEVAL_OPEN_SOURCE_MODELSLista de modelos open-source"Qwen/Qwen2.5-7B-Instruct"
REDEVAL_CLOSED_SOURCE_MODELSLista de modelos closed-source"gpt-4o-mini"

Arquivos de Configuração

Os arquivos de configuração no diretório recipes/ controlam os parâmetros de avaliação:

  • attack/base-open.yml - Configuração de ataque para modelos open-source
  • attack/base-close.yml - Configuração de ataque para modelos closed-source
  • attack/eval.yml - Configuração de avaliação de ataque
  • refuse/base-open.yml - Configuração de recusa para modelos open-source
  • refuse/base-close.yml - Configuração de recusa para modelos closed-source
  • refuse/eval.yml - Configuração de avaliação de recusa

🚀 Uso

Interface de Linha de Comando

O RedEval fornece uma CLI unificada para todas as operações:

Pipeline Completo

# Execute o pipeline de avaliação completo
python -m redeval.cli run-pipeline

# Execute com modelos específicos
python -m redeval.cli run-pipeline --models "Qwen/Qwen2.5-7B-Instruct" "gpt-4o-mini"

# Execute apenas fases específicas
python -m redeval.cli run-pipeline --phases generate_attack run_attack eval_attack

Componentes Individuais

# Gere prompts de ataque
python -m redeval.cli generate-attack --config ./recipes/attack/base-close.yml

# Execute avaliação de ataque
python -m redeval.cli run-attack --config ./recipes/attack/base-open.yml --model "Qwen/Qwen2.5-7B-Instruct"

# Avalie resultados do ataque
python -m redeval.cli eval-attack --config ./recipes/attack/eval.yml --log-dir ./logs/attack/HarmBench/direct/model_name
Baixar ferramenta