Skip to content
KitploitKITPLOIT
FerramentasBlog
Enviar
FerramentasBlog
Enviar

Ferramentas de Hacking, PenTest e Cibersegurança para o seu Arsenal de Segurança!

Kitploit é um diretório de ferramentas de hacking, cibersegurança e pentesting. Descubra as últimas atualizações de projetos para encontrar vulnerabilidades, analisar sistemas, automatizar testes e fortalecer sua segurança.

··Feeds·Contato·Privacidade·© 2026 Kitploit

Diretório de Ferramentas

Categorias

Ver todas as categorias
Loading categories
redeval — [ICLR 2026] - Repositório oficial do artigo: 'RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models' | Kitploit
Ferramentas/GitHubGitHub/knoveleng/redeval
Papers e PesquisaAprendizado e EducaçãoRecursos CuradosSegurança de IAAtaque Adversário
GitHubknoveleng/redeval

redeval

[ICLR 2026] - Repositório oficial do artigo: 'RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models'

Ver Repositório
2943há 6 mesesRevisado pelo Kitploit

Mais Populares

Ver todos →

Descubra as ferramentas mais usadas pela nossa comunidade.

Explore todas as ferramentas

Navegue pela nossa coleção de ferramentas

Ver todas as ferramentas →
Compartilhar
Site

RedEval - Framework de Avaliação de Segurança para LLMs

Python 3.8+ License: MIT Dataset on HF

Um framework abrangente para avaliar a segurança de Grandes Modelos de Linguagem (LLMs) por meio de testes sistemáticos de ataque e recusa. O RedEval fornece uma plataforma unificada, segura e extensível para avaliar a robustez de LLMs contra prompts adversariais e conteúdo prejudicial. Ele faz parte do artigo "RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models", que é um dataset universal para red teaming abrangente de LLMs.

📦 Dataset: O dataset RedBench está disponível publicamente no HuggingFace em knoveleng/redbench. Ele inclui prompts abrangentes de red teaming em várias categorias e domínios de segurança.

🚀 Início Rápido

1. Configurar Ambiente

root@kitploit:~
# Clone o repositório
git clone https://github.com/knoveleng/redeval.git
cd redeval

# Instale as dependências
pip install -r requirements.txt

# Copie e configure as variáveis de ambiente
cp .env.template .env
# Edite .env com suas chaves de API

2. Configurar Chaves de API

Edite o arquivo .env com suas credenciais:

root@kitploit:~
OPENAI_API_KEY=sua_chave_openai_api_aqui
HUGGINGFACE_TOKEN=seu_token_huggingface_aqui

3. Executar Avaliação

root@kitploit:~
# Configure o ambiente
source ./sh/setup_env.sh

# Execute com modelos padrão; você pode editar .env para definir os modelos que deseja executar
python -m redeval.cli run-pipeline

# Execute o pipeline completo com modelos específicos
python -m redeval.cli run-pipeline --models "Qwen/Qwen2.5-7B-Instruct" "gpt-4o-mini"

# Ou execute fases individuais
./sh/generate_attack.sh
./sh/run_attack.sh
./sh/eval_attack.sh

📋 Índice

  • Visão Geral
  • Arquitetura
  • Instalação
  • Configuração
  • Uso
  • Recursos de Segurança
  • Referência da API
  • Contribuição
  • Licença

🎯 Visão Geral

O RedEval avalia a segurança de LLMs por meio de duas abordagens complementares:

🔴 Fase de Ataque

Testa a vulnerabilidade do LLM a prompts adversariais usando várias técnicas de jailbreak:

  • Ataques diretos: Prompts prejudiciais diretos
  • Jailbreaks humanos: Técnicas de contorno criadas por humanos
  • Ataques zero-shot: Geração automatizada de prompts adversariais

🛡️ Fase de Recusa

Avalia a capacidade do LLM de recusar adequadamente solicitações prejudiciais em vários datasets de segurança:

  • CoCoNot: Moderação de conteúdo sensível ao contexto
  • SGXTest: Exame de diretrizes de segurança
  • XSTest: Teste de segurança entre domínios
  • ORBench: Benchmarking objetivo de recusa

📊 Pontuação

Calcula métricas de segurança abrangentes combinando o desempenho de ataque e recusa.

🏗️ Arquitetura

Componentes Principais

root@kitploit:~
redeval/
├── redeval/                 # Módulos principais em Python
│   ├── config.py           # Gerenciamento de ambiente e configuração
│   ├── pipeline.py         # Orquestrador centralizado do pipeline
│   ├── cli.py              # Interface de linha de comando unificada
│   ├── exceptions.py       # Tratamento personalizado de exceções
│   ├── generate_attack.py  # Geração de prompts de ataque
│   ├── run_attack.py       # Execução de ataque
│   ├── eval_attack.py      # Avaliação de ataque
│   ├── run_refuse.py       # Teste de recusa
│   ├── eval_refuse.py      # Avaliação de recusa
│   └── score.py            # Cálculo de métricas
├── sh/                     # Interfaces de script shell
│   ├── setup_env.sh        # Configuração do ambiente
│   ├── generate_attack.sh  # Script de geração de ataque
│   ├── run_attack.sh       # Script de execução de ataque
│   ├── eval_attack.sh      # Script de avaliação de ataque
│   ├── run_refuse.sh       # Script de teste de recusa
│   ├── eval_refuse.sh      # Script de avaliação de recusa
│   └── score.sh            # Script de pontuação
├── recipes/                # Arquivos de configuração
├── logs/                   # Resultados da avaliação
└── .env                    # Variáveis de ambiente

Pipeline de Avaliação

root@kitploit:~
graph TD
    A[Gerar Prompts de Ataque] --> B[Executar Testes de Ataque]
    B --> C[Avaliar Resultados do Ataque]
    D[Executar Testes de Recusa] --> E[Avaliar Resultados da Recusa]
    C --> F[Calcular Pontuações Finais]
    E --> F
    F --> G[Gerar Relatórios]

🛠️ Instalação

Pré-requisitos

  • Python 3.8 ou superior
  • Chave da API OpenAI
  • Token do HuggingFace
  • Git

Instalação Passo a Passo

  1. Clonar Repositório

    root@kitploit:~
    git clone <url-do-repositorio>
    cd redeval
    
  2. Instalar Dependências

    root@kitploit:~
    pip install -r requirements.txt
    
  3. Configurar Ambiente

    root@kitploit:~
    cp .env.template .env
    # Edite .env com suas credenciais de API
    
  4. Verificar Instalação

    root@kitploit:~
    python -m redeval.cli --help
    

⚙️ Configuração

Variáveis de Ambiente

O RedEval usa variáveis de ambiente para configuração segura e flexível:

Variáveis Obrigatórias

VariávelDescriçãoExemplo
OPENAI_API_KEYChave da API OpenAIsk-proj-...
HUGGINGFACE_TOKENToken do HuggingFacehf_...

Configuração Opcional

Configuração de Modelos

VariávelDescriçãoPadrão
REDEVAL_OPEN_SOURCE_MODELSLista de modelos open-source"Qwen/Qwen2.5-7B-Instruct"
REDEVAL_CLOSED_SOURCE_MODELSLista de modelos closed-source"gpt-4o-mini"

Arquivos de Configuração

Os arquivos de configuração no diretório recipes/ controlam os parâmetros de avaliação:

  • attack/base-open.yml - Configuração de ataque para modelos open-source
  • attack/base-close.yml - Configuração de ataque para modelos closed-source
  • attack/eval.yml - Configuração de avaliação de ataque
  • refuse/base-open.yml - Configuração de recusa para modelos open-source
  • refuse/base-close.yml - Configuração de recusa para modelos closed-source
  • refuse/eval.yml - Configuração de avaliação de recusa

🚀 Uso

Interface de Linha de Comando

O RedEval fornece uma CLI unificada para todas as operações:

Pipeline Completo

root@kitploit:~
# Execute o pipeline de avaliação completo
python -m redeval.cli run-pipeline

# Execute com modelos específicos
python -m redeval.cli run-pipeline --models "Qwen/Qwen2.5-7B-Instruct" "gpt-4o-mini"

# Execute apenas fases específicas
python -m redeval.cli run-pipeline --phases generate_attack run_attack eval_attack

Componentes Individuais

root@kitploit:~
# Gere prompts de ataque
python -m redeval.cli generate-attack --config ./recipes/attack/base-close.yml

# Execute avaliação de ataque
python -m redeval.cli run-attack --config ./recipes/attack/base-open.yml --model "Qwen/Qwen2.5-7B-Instruct"

# Avalie resultados do ataque
python -m redeval.cli eval-attack --config ./recipes/attack/eval.yml --log-dir ./logs/attack/HarmBench/direct/model_name

# Execute testes de recusa
python -m redeval.cli run-refuse --config ./recipes/refuse/base-open.yml --model "Qwen/Qwen2.5-7B-Instruct"

# Avalie resultados da recusa
python -m redeval.cli eval-refuse --config ./recipes/refuse/eval.yml --log-dir ./logs/refuse/CoCoNot/base/model_name

# Calcule pontuações
python -m redeval.cli score --log-dir ./logs/attack/HarmBench/direct/model_name --keyword "unsafe"

Interface de Script Shell

Para usuários que preferem scripts shell:

root@kitploit:~
# Configure o ambiente (execute primeiro)
source ./sh/setup_env.sh

# Execute fases de avaliação
./sh/generate_attack.sh    # Gere prompts de ataque
./sh/run_attack.sh         # Execute ataques
./sh/eval_attack.sh        # Avalie resultados do ataque
./sh/run_refuse.sh         # Execute testes de recusa
./sh/eval_refuse.sh        # Avalie resultados da recusa
./sh/score.sh              # Calcule pontuações finais

API Python

Para acesso programático:

root@kitploit:~
from redeval.pipeline import PipelineOrchestrator, PipelinePhase
from redeval.config import EnvironmentConfig

# Inicialize a configuração
config = EnvironmentConfig.from_env()

# Crie o orquestrador do pipeline
orquestrador = PipelineOrchestrator(config)

# Execute o pipeline completo
orquestrador.run_complete_pipeline()

# Execute fases específicas
orquestrador.run_phase(PipelinePhase.GENERATE_ATTACK)
orquestrador.run_phase(PipelinePhase.RUN_ATTACK)

🔒 Recursos de Segurança

✅ Gerenciamento Seguro de Credenciais

  • Sem chaves de API hardcoded no código-fonte
  • Configuração baseada em variáveis de ambiente
  • Suporte a arquivo .env com validação
  • Manipulação segura de tokens para autenticação no HuggingFace

✅ Validação de Entrada

  • Validação de variáveis de ambiente na inicialização
  • Validação de arquivos de configuração
  • Validação de nomes de modelos e parâmetros

✅ Tratamento de Erros

  • Classes de exceção personalizadas para diferentes tipos de erro
  • Log abrangente de erros
  • Tratamento elegante de falhas

✅ Melhores Práticas

  • Princípio do menor privilégio
  • Padrões seguros
  • Log abrangente sem exposição de dados sensíveis

📚 Referência da API

Comandos CLI

run-pipeline

Execute o pipeline de avaliação completo ou fases específicas.

Opções:

  • --models: Lista de modelos a serem avaliados
  • --phases: Fases específicas a serem executadas
  • --config-dir: Caminho do diretório de configuração
  • --log-dir: Diretório de saída para logs

generate-attack

Gere prompts de ataque adversariais.

Opções:

  • --config: Caminho do arquivo de configuração
  • --num-samples: Número de amostras a gerar
  • --seed: Semente aleatória para reprodutibilidade

run-attack

Execute a avaliação de ataque contra modelos alvo.

Opções:

  • --config: Caminho do arquivo de configuração
  • --model: Nome do modelo alvo
  • --num-samples: Número de amostras a processar

eval-attack

Avalie os resultados do ataque usando modelos juízes.

Opções:

  • --config: Caminho do arquivo de configuração
  • --log-dir: Diretório contendo logs de ataque

run-refuse

Execute o teste de capacidade de recusa.

Opções:

  • --config: Caminho do arquivo de configuração
  • --model: Nome do modelo alvo
  • --num-samples: Número de amostras a testar
  • --split: Divisão do dataset a ser usada

eval-refuse

Avalie os resultados do teste de recusa.

Opções:

  • --config: Caminho do arquivo de configuração
  • --log-dir: Diretório contendo logs de recusa

score

Calcule pontuações de segurança a partir dos resultados da avaliação.

Opções:

  • --log-dir: Diretório contendo logs de avaliação
  • --keyword: Palavra-chave a ser pesquisada nos resultados

Classes da API Python

PipelineOrchestrator

Gerenciamento centralizado do pipeline.

Métodos:

  • run_complete_pipeline(): Execute o pipeline de avaliação completo
  • run_phase(phase): Execute uma fase específica do pipeline
  • get_phase_status(phase): Obtenha o status de uma fase do pipeline

EnvironmentConfig

Gerenciamento de ambiente e configuração.

Métodos:

  • from_env(): Carregue a configuração a partir de variáveis de ambiente
  • validate(): Valide a integridade da configuração
  • setup_logging(): Configure o sistema de log

🤝 Contribuição

Configuração de Desenvolvimento

  1. Fork e Clone

    root@kitploit:~
    git clone https://github.com/knoveleng/redeval.git
    cd redeval
    
  2. Crie o Ambiente de Desenvolvimento

    root@kitploit:~
    python -m venv venv
    source venv/bin/activate  # No Windows: venv\Scripts\activate
    pip install -r requirements.txt
    
  3. Configure Hooks de Pre-commit

    root@kitploit:~
    pip install pre-commit
    pre-commit install
    

Diretrizes de Contribuição

  • Segurança em Primeiro Lugar: Nunca commite chaves de API ou dados sensíveis
  • Variáveis de Ambiente: Use variáveis de ambiente para toda configuração
  • Tratamento de Erros: Adicione tratamento de erros adequado com exceções personalizadas
  • Documentação: Atualize a documentação para novos recursos
  • Testes: Adicione testes para novas funcionalidades
  • Compatibilidade Reversa: Mantenha a compatibilidade com interfaces existentes

Estilo de Código

  • Siga PEP 8 para código Python
  • Use dicas de tipo quando apropriado
  • Adicione docstrings abrangentes
  • Mantenha padrões de log consistentes

📄 Licença

Este projeto está licenciado sob a Licença MIT - consulte o arquivo LICENSE para obter detalhes.

📚 Citação

Se você achar este projeto útil, considere citá-lo em sua pesquisa:

root@kitploit:~
@inproceedings{
   dang2026redbench,
   title={RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models},
   author={Quy-Anh Dang and Chris Ngo and Truong-Son Hy},
   booktitle={ICLR 2026 Workshop on Principled Design for Trustworthy AI - Interpretability, Robustness, and Safety across Modalities},
   year={2026},
   url={https://openreview.net/forum?id=7pZXyk0d07}
}
Baixar ferramenta
VariávelDescriçãoPadrão
REDEVAL_PROJECT_ROOTDiretório raiz do projetoDiretório atual
REDEVAL_LOG_DIRDiretório de logs./logs
REDEVAL_RECIPES_DIRDiretório de configuração./recipes
REDEVAL_LOG_LEVELNível de logINFO
REDEVAL_NUM_SAMPLESNúmero de amostras de avaliação10
REDEVAL_SEEDSemente aleatória0