Skip to content
KitploitKITPLOIT
StrumentiExploitsBlog
Log in
Invia
StrumentiExploitsBlog
Invia

Strumenti di Hacking, PenTest e Cybersecurity per il tuo Arsenale di Sicurezza!

Kitploit è una directory di strumenti di hacking, cybersecurity e pentesting. Scopri gli ultimi aggiornamenti dei progetti per trovare vulnerabilità, analizzare sistemi, automatizzare i test e rafforzare la tua sicurezza.

··Feed·Contatto·Privacy·© 2026 Kitploit

Directory degli strumenti

Categorie

Vedi tutte le categorie
Loading categories
redeval — [ICLR 2026] - Repository ufficiale del paper: "RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models" | Kitploit
Strumenti/GitHubGitHub/knoveleng/redeval
Paper e RicercaApprendimento e FormazioneRisorse CurateSicurezza dell'IAAttacco Avversario
GitHubknoveleng/redeval

redeval

[ICLR 2026] - Repository ufficiale del paper: "RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models"

Vedi Repository
294127 mesi faRevisionato da Kitploit

Più Popolari

Vedi tutti →

Scopri gli strumenti più utilizzati dalla nostra community.

Esplora tutti gli strumenti

Sfoglia la nostra collezione di strumenti

Vedi tutti gli strumenti →
Condividi
Sito web

RedEval - Framework di Valutazione della Sicurezza per LLM

Python 3.8+ License: MIT Dataset on HF

Un framework completo per valutare la sicurezza dei Large Language Model (LLM) attraverso test sistematici di attacco e rifiuto. RedEval fornisce una piattaforma unificata, sicura ed estensibile per valutare la robustezza degli LLM contro prompt avversari e contenuti dannosi. Fa parte dell'articolo "RedBench: A Universal Dataset for Comprehensive Red Teaming of Large Language Models", un dataset universale per il red teaming completo degli LLM.

📦 Dataset: Il dataset RedBench è disponibile pubblicamente su HuggingFace all'indirizzo knoveleng/redbench. Include prompt di red teaming completi in molteplici categorie e domini di sicurezza.

🚀 Avvio Rapido

1. Configurazione dell'Ambiente

# Clona il repository
git clone https://github.com/knoveleng/redeval.git
cd redeval

# Installa le dipendenze
pip install -r requirements.txt

# Copia e configura le variabili d'ambiente
cp .env.template .env
# Modifica .env con le tue chiavi API

2. Configurazione delle Chiavi API

Modifica il file .env con le tue credenziali:

OPENAI_API_KEY=your_openai_api_key_here
HUGGINGFACE_TOKEN=your_huggingface_token_here

3. Esecuzione della Valutazione

# Configura l'ambiente
source ./sh/setup_env.sh

# Esegui con i modelli predefiniti, puoi modificare .env per definire i modelli che vuoi eseguire
python -m redeval.cli run-pipeline

# Esegui la pipeline completa con modelli specifici
python -m redeval.cli run-pipeline --models "Qwen/Qwen2.5-7B-Instruct" "gpt-4o-mini"

# Oppure esegui le singole fasi
./sh/generate_attack.sh
./sh/run_attack.sh
./sh/eval_attack.sh

📋 Indice

  • Panoramica
  • Architettura
  • Installazione
  • Configurazione
  • Utilizzo
  • Funzionalità di Sicurezza
  • Riferimento API
  • Contributi
  • Licenza

🎯 Panoramica

RedEval valuta la sicurezza degli LLM attraverso due approcci complementari:

🔴 Fase di Attacco

Verifica la vulnerabilità degli LLM a prompt avversari utilizzando varie tecniche di jailbreak:

  • Attacchi diretti: Prompt dannosi semplici
  • Jailbreak umani: Tecniche di bypass create da esseri umani
  • Attacchi zero-shot: Generazione automatizzata di prompt avversari

🛡️ Fase di Rifiuto

Valuta la capacità degli LLM di rifiutare in modo appropriato richieste dannose attraverso molteplici dataset di sicurezza:

  • CoCoNot: Moderazione dei contenuti sensibile al contesto
  • SGXSTest: Esame delle linee guida di sicurezza
  • XSTest: Test di sicurezza cross-domain
  • ORBench: Benchmark oggettivo sul rifiuto

📊 Punteggio

Calcola metriche di sicurezza complete combinando le prestazioni sia di attacco che di rifiuto.

🏗️ Architettura

Componenti Principali

redeval/
├── redeval/                 # Moduli Python principali
│   ├── config.py           # Gestione ambiente e configurazione
│   ├── pipeline.py         # Orchestratore centralizzato della pipeline
│   ├── cli.py              # Interfaccia a riga di comando unificata
│   ├── exceptions.py       # Gestione personalizzata delle eccezioni
│   ├── generate_attack.py  # Generazione dei prompt di attacco
│   ├── run_attack.py       # Esecuzione degli attacchi
│   ├── eval_attack.py      # Valutazione degli attacchi
│   ├── run_refuse.py       # Test di rifiuto
│   ├── eval_refuse.py      # Valutazione del rifiuto
│   └── score.py            # Calcolo delle metriche
├── sh/                     # Interfacce script di shell
│   ├── setup_env.sh        # Configurazione dell'ambiente
│   ├── generate_attack.sh  # Script di generazione degli attacchi
│   ├── run_attack.sh       # Script di esecuzione degli attacchi
│   ├── eval_attack.sh      # Script di valutazione degli attacchi
│   ├── run_refuse.sh       # Script di test del rifiuto
│   ├── eval_refuse.sh      # Script di valutazione del rifiuto
│   └── score.sh            # Script di punteggio
├── recipes/                # File di configurazione
├── logs/                   # Risultati della valutazione
└── .env                    # Variabili d'ambiente

Pipeline di Valutazione

graph TD
    A[Generate Attack Prompts] --> B[Run Attack Tests]
    B --> C[Evaluate Attack Results]
    D[Run Refuse Tests] --> E[Evaluate Refuse Results]
    C --> F[Calculate Final Scores]
    E --> F
    F --> G[Generate Reports]

🛠️ Installazione

Prerequisiti

  • Python 3.8 o superiore
  • Chiave API OpenAI
  • Token HuggingFace
  • Git

Installazione Passo per Passo

  1. Clona il Repository

    git clone <repository-url>
    cd redeval
    
  2. Installa le Dipendenze

    pip install -r requirements.txt
    
  3. Configura l'Ambiente

    cp .env.template .env
    # Modifica .env con le tue credenziali API
    
  4. Verifica l'Installazione

    python -m redeval.cli --help
    

⚙️ Configurazione

Variabili d'Ambiente

RedEval utilizza variabili d'ambiente per una configurazione sicura e flessibile:

Variabili Obbligatorie

VariabileDescrizioneEsempio
OPENAI_API_KEYChiave API OpenAIsk-proj-...
HUGGINGFACE_TOKENToken HuggingFacehf_...

Configurazione Opzionale

VariabileDescrizionePredefinito
REDEVAL_PROJECT_ROOTDirectory principale del progettoDirectory corrente
REDEVAL_LOG_DIRDirectory dei log./logs
REDEVAL_RECIPES_DIRDirectory di configurazione./recipes
REDEVAL_LOG_LEVELLivello di loggingINFO
REDEVAL_NUM_SAMPLESNumero di campioni di valutazione10
REDEVAL_SEEDSeme casuale0

Configurazione dei Modelli

VariabileDescrizionePredefinito
REDEVAL_OPEN_SOURCE_MODELSElenco modelli open-source"Qwen/Qwen2.5-7B-Instruct"
REDEVAL_CLOSED_SOURCE_MODELSElenco modelli closed-source"gpt-4o-mini"

File di Configurazione

I file di configurazione nella directory recipes/ controllano i parametri di valutazione:

  • attack/base-open.yml - Configurazione attacco per modelli open-source
  • attack/base-close.yml - Configurazione attacco per modelli closed-source
  • attack/eval.yml - Configurazione valutazione attacchi
  • refuse/base-open.yml - Configurazione rifiuto per modelli open-source
  • refuse/base-close.yml - Configurazione rifiuto per modelli closed-source
  • refuse/eval.yml - Configurazione valutazione del rifiuto

🚀 Utilizzo

Interfaccia a Riga di Comando

RedEval fornisce una CLI unificata per tutte le operazioni:

Pipeline Completa

# Esegui la pipeline di valutazione completa
python -m redeval.cli run-pipeline

# Esegui con modelli specifici
python -m redeval.cli run-pipeline --models "Qwen/Qwen2.5-7B-Instruct" "gpt-4o-mini"

# Esegui solo fasi specifiche
python -m redeval.cli run-pipeline --phases generate_attack run_attack eval_attack

Componenti Individuali

# Genera i prompt di attacco
python -m redeval.cli generate-attack --config ./recipes/attack/base-close.yml

# Esegui la valutazione degli attacchi
python -m redeval.cli run-attack --config ./recipes/attack/base-open.yml --model "Qwen/Qwen2.5-7B-Instruct"
Scarica lo strumento