Skip to content
KitploitKITPLOIT
StrumentiExploitsBlog
Log in
Invia
StrumentiExploitsBlog
Invia

Strumenti di Hacking, PenTest e Cybersecurity per il tuo Arsenale di Sicurezza!

Kitploit è una directory di strumenti di hacking, cybersecurity e pentesting. Scopri gli ultimi aggiornamenti dei progetti per trovare vulnerabilità, analizzare sistemi, automatizzare i test e rafforzare la tua sicurezza.

··Feed·Contatto·Privacy·© 2026 Kitploit

Directory degli strumenti

Categorie

Vedi tutte le categorie
Loading categories
DARWIN — Framework evolutivo di jailbreak e guardrail per LLM che sviluppa un pool di strategie riutilizzabili tramite mutazione genetica, selezione di Markov e addestramento avversariale online per la valutazione della sicurezza. | Kitploit
Strumenti/GitHubGitHub/zju-llm-safety/darwin
Strumenti DifensiviAnalisi delle VulnerabilitàMachine LearningPaper e RicercaApprendimento e FormazioneRed TeamingSicurezza dell'IAAttacco Avversario
GitHubzju-llm-safety/darwin

DARWIN

Framework evolutivo di jailbreak e guardrail per LLM che sviluppa un pool di strategie riutilizzabili tramite mutazione genetica, selezione di Markov e addestramento avversariale online per la valutazione della sicurezza.

7410382 giorni faRevisionato da Kitploit

Più Popolari

Vedi tutti →

Scopri gli strumenti più utilizzati dalla nostra community.

Esplora tutti gli strumenti

Sfoglia la nostra collezione di strumenti

Vedi tutti gli strumenti →
Vedi Repository
Condividi

🧬 DARWIN

Evoluzione dell'avversario di jailbreak e guardrail
per la valutazione e la protezione della sicurezza degli LLM

Paper Model Python

Un'illustrazione dell'evoluzione

Un framework evolutivo di attacco–difesa che accoppia
DARWIN-Attack con DARWIN-Guard tramite addestramento avversario online.

Paper · Checkpoint del Guard · Installazione · Usare DARWIN-Attack · Usare DARWIN-Guard · Addestramento · Citazione

DARWIN formula il jailbreaking come un processo evolutivo continuo e aggiorna continuamente le guardrail attraverso un ciclo attacco–difesa. DARWIN-Attack espande un pool esplicito di strategie tramite scoperta, mutazione e selezione delle strategie, e compone adattivamente le strategie utilizzando il feedback del target. DARWIN-Guard apprende dai campioni avversari emergenti, addestrandosi congiuntamente su query dannose e benigne camuffate per riconoscere l'intento sottostante piuttosto che i pattern di attacco superficiali.

✨ Caratteristiche principali

Cosa offre DARWIN
Un avversario in evoluzioneUn pool di strategie esplicito e riutilizzabile che cresce attraverso l'acquisizione di conoscenza esterna, l'evoluzione genetica e la riflessione sui fallimenti, senza fine-tuning di un LLM attaccante.
Composizione adattiva delle strategieInizializzazione informata dalla storia e transizioni di strategia Markoviane con aggiornamenti ispirati al Q-learning, a supporto della valutazione sia di LLM che di guardrail di sicurezza.
Espansione validata delle strategieDeduplicazione semantica seguita da validazione in sandbox contro un LLM allineato prima che le strategie candidate entrino nel pool.
Addestramento avversario online della guardrailAddestramento iterativo contro l'avversario in evoluzione, con ogni round inizializzato dal checkpoint della guardrail precedente.
Classificazione di sicurezza consapevole dell'intentoPrompt dannosi e benigni camuffati accoppiati con le loro controparti grezze, con etichette di origine preservate per migliorare la robustezza riducendo al contempo i rifiuti eccessivi.

📊 Risultati

DARWIN-Attack raggiunge il più alto tasso di successo degli attacchi (ASR) su tutti e sei i target valutati su entrambi i benchmark, rispetto a sei baseline di jailbreak.

TargetASR HarmBenchASR AdvBench
DeepSeek-V4-Pro99.7%97.6%
GPT-5.593.7%90.7%
Gemini-3.5-Flash93.0%90.9%
Claude Sonnet 4.678.2%68.2%
Qwen3Guard99.7%98.8%
YuFeng-XGuard99.2%96.7%

DARWIN-Guard raggiunge un recall medio del 95.0% sugli unsafe su nove benchmark di prompt dannosi, un tasso medio di superamento dei benigni di quasi il 100% su sei benchmark benigni standard, e tassi di superamento dei benigni del 97.6% su XSTest e dell'80.0% su JBB-Benign.

🏗️ Architettura

Framework DARWIN: evoluzione delle strategie e attacchi adattivi accoppiati con l'addestramento avversario online della guardrail

DARWIN-Attack fa evolvere gli avversari di jailbreak attraverso l'evoluzione del pool di strategie, la selezione adattiva delle strategie e il raffinamento guidato dal feedback. DARWIN-Guard migliora continuamente attraverso l'addestramento avversario online con campioni generati da DARWIN-Attack.

📁 Struttura del progetto

DARWIN/
├── assets/                         # Evolution illustration and framework diagram
├── configs/
│   ├── darwin_attack.example.yaml  # Attack, evolution, and evaluation settings
│   └── darwin_guard.example.yaml   # Online adversarial training and guard evaluation
├── src/
│   ├── darwin_attack/              # Strategy pool, evolution, composition, and evaluation
│   └── darwin_guard/               # Data preparation, attack bridge, training, and inference
├── strategies/
│   ├── final_strategy_pool.jsonl   # Released pool of 200 strategies
│   └── mutation_operators.jsonl    # 15 operators across five dimensions
├── schemas/
│   ├── attack/                     # Dataset, strategy, and mutation-operator formats
│   └── guard/                      # Source, paired-training, and evaluation formats
├── tests/
│   ├── attack/
│   └── guard/
├── NOTICE                          # Third-party attribution
└── pyproject.toml                  # Package dependencies and CLI entry points

🚀 Installazione

Usa Python 3.10+. L'inferenza e l'addestramento locali richiedono PyTorch compatibile con il tuo hardware; la configurazione di addestramento utilizza CUDA e BF16. Le dipendenze per i modelli locali includono Transformers >=5.10.1,<6, incluso il supporto per il filtro Gemma utilizzato durante l'addestramento.

git clone https://github.com/ZJU-LLM-Safety/DARWIN.git
cd DARWIN

python -m venv .venv
source .venv/bin/activate
python -m pip install -e '.[api,local,training]'

Per la sola inferenza della guardrail, python -m pip install -e '.[local]' è sufficiente. Esegui i comandi seguenti dalla radice del repository.

⚔️ DARWIN-Attack

🔄 Quattro meccanismi evolutivi complementari

MeccanismoRuolo
Evoluzione della conoscenza esternaConverte materiale fornito esternamente in candidati strategia riutilizzabili.
Evoluzione genetica delle strategieGenera candidati attraverso crossover e mutazione delle strategie esistenti.
Evoluzione guidata dalla riflessioneAnalizza il feedback di rifiuto e raffina le strategie non riuscite.
Evoluzione guidata dal feedbackUtilizza gli esiti degli attacchi in tempo reale per adattare la successiva selezione e composizione delle strategie.

🧬 15 operatori di mutazione

Gli operatori sono organizzati in cinque dimensioni, con tre operatori per dimensione. Le loro definizioni sono fornite in mutation_operators.jsonl.

DimensioneOperatoriRuolo
🧠 Psicologica e di potereAuthority Inversion
Emotional Gaslighting
Third-Party Proxy
Alterano il ruolo sociale o la responsabilità percepiti.
🌀 Cognitiva e logicaCognitive Overload
Foot-in-the-Door
Reverse Engineering Logic
Ristrutturano il percorso di ragionamento.
📦 Di formato e strutturalePseudocode Mapping
Low-Resource Language Encoding
Cross-Medium Simulation
Modificano il formato di presentazione.
🔓 Di vincolo e confineRule Redefinition
Token Reward Injection
Constraint Relaxation
Modificano i vincoli di interazione dichiarati.
🎭 Di prospettiva e narrativaAcademic Historicization
Meta-Cognitive Detachment
Fictional Universe Embedding
Spostano la prospettiva temporale, narrativa o contestuale.

🔧 Configurare modelli e dati

Scarica lo strumento