Skip to content
KitploitKITPLOIT
FerramentasBlog
Log in
Enviar
FerramentasBlog
Enviar

Ferramentas de Hacking, PenTest e Cibersegurança para o seu Arsenal de Segurança!

Kitploit é um diretório de ferramentas de hacking, cibersegurança e pentesting. Descubra as últimas atualizações de projetos para encontrar vulnerabilidades, analisar sistemas, automatizar testes e fortalecer sua segurança.

··Feeds·Contato·Privacidade·© 2026 Kitploit

Diretório de Ferramentas

Categorias

Ver todas as categorias
Loading categories
DARWIN — Estrutura evolutiva de jailbreak e guardrail para LLMs que expande um pool reutilizável de estratégias por meio de mutação genética, seleção de Markov e treinamento adversarial online para avaliação de segurança. | Kitploit
Ferramentas/GitHubGitHub/zju-llm-safety/darwin
Ferramentas DefensivasAnálise de VulnerabilidadesAprendizado de MáquinaPapers e PesquisaAprendizado e EducaçãoRed TeamingSegurança de IAAtaque Adversário
GitHubzju-llm-safety/darwin

DARWIN

Estrutura evolutiva de jailbreak e guardrail para LLMs que expande um pool reutilizável de estratégias por meio de mutação genética, seleção de Markov e treinamento adversarial online para avaliação de segurança.

741041há 2 diasRevisado pelo Kitploit

Mais Populares

Ver todos →

Descubra as ferramentas mais usadas pela nossa comunidade.

Explore todas as ferramentas

Navegue pela nossa coleção de ferramentas

Ver todas as ferramentas →
Ver Repositório
Compartilhar

🧬 DARWIN

Evoluindo o Adversário de Jailbreak e o Guardrail
para Avaliação e Proteção da Segurança de LLMs

Paper Model Python

Uma ilustração da evolução

Um framework evolutivo de ataque–defesa que acopla
DARWIN-Attack com DARWIN-Guard por meio de treinamento adversarial online.

Paper · Checkpoint do Guard · Instalação · Usar o DARWIN-Attack · Usar o DARWIN-Guard · Treinamento · Citação

O DARWIN formula o jailbreak como um processo evolutivo contínuo e atualiza continuamente as guardrails por meio de um ciclo de ataque–defesa. O DARWIN-Attack expande um pool explícito de estratégias por meio de descoberta, mutação e seleção de estratégias, e compõe estratégias de forma adaptativa usando o feedback do alvo. O DARWIN-Guard aprende com as amostras adversariais emergentes, treinando conjuntamente em consultas disfarçadas nocivas e benignas para reconhecer a intenção subjacente em vez de padrões superficiais de ataque.

✨ Principais Recursos

O que o DARWIN oferece
Um adversário em evoluçãoUm pool explícito e reutilizável de estratégias que cresce por meio de aquisição de conhecimento externo, evolução genética e reflexão sobre falhas, sem fine-tuning de um LLM atacante.
Composição adaptativa de estratégiasInicialização informada pelo histórico e transições de estratégia de Markov com atualizações inspiradas em Q-learning, com suporte à avaliação tanto de LLMs quanto de guardrails de segurança.
Expansão validada de estratégiasDeduplicação semântica seguida de validação em sandbox contra um LLM alinhado antes que as estratégias candidatas entrem no pool.
Treinamento adversarial online de guardrailTreinamento iterativo contra o adversário em evolução, com cada rodada inicializada a partir do checkpoint de guard anterior.
Classificação de segurança ciente da intençãoPrompts nocivos e benignos disfarçados pareados com suas contrapartes brutas, com rótulos de origem preservados para melhorar a robustez enquanto mitiga a recusa excessiva.

📊 Resultados

O DARWIN-Attack alcança a maior taxa de sucesso de ataque (ASR) em todos os seis alvos avaliados em ambos os benchmarks, em comparação com seis baselines de jailbreak.

AlvoASR no HarmBenchASR no AdvBench
DeepSeek-V4-Pro99,7%97,6%
GPT-5.593,7%90,7%
Gemini-3.5-Flash93,0%90,9%
Claude Sonnet 4.678,2%68,2%
Qwen3Guard99,7%98,8%
YuFeng-XGuard99,2%96,7%

O DARWIN-Guard alcança 95,0% de recall médio de inseguros em nove benchmarks de prompts nocivos, uma taxa média de aprovação de benignos de quase 100% em seis benchmarks benignos padrão, e taxas de aprovação de benignos de 97,6% no XSTest e 80,0% no JBB-Benign.

🏗️ Arquitetura

Framework DARWIN: evolução de estratégias e ataques adaptativos acoplados ao treinamento adversarial online de guardrail

O DARWIN-Attack evolui adversários de jailbreak por meio da evolução do pool de estratégias, seleção adaptativa de estratégias e refinamento guiado por feedback. O DARWIN-Guard melhora continuamente por meio de treinamento adversarial online com amostras geradas pelo DARWIN-Attack.

📁 Estrutura do projeto

DARWIN/
├── assets/                         # Evolution illustration and framework diagram
├── configs/
│   ├── darwin_attack.example.yaml  # Attack, evolution, and evaluation settings
│   └── darwin_guard.example.yaml   # Online adversarial training and guard evaluation
├── src/
│   ├── darwin_attack/              # Strategy pool, evolution, composition, and evaluation
│   └── darwin_guard/               # Data preparation, attack bridge, training, and inference
├── strategies/
│   ├── final_strategy_pool.jsonl   # Released pool of 200 strategies
│   └── mutation_operators.jsonl    # 15 operators across five dimensions
├── schemas/
│   ├── attack/                     # Dataset, strategy, and mutation-operator formats
│   └── guard/                      # Source, paired-training, and evaluation formats
├── tests/
│   ├── attack/
│   └── guard/
├── NOTICE                          # Third-party attribution
└── pyproject.toml                  # Package dependencies and CLI entry points

🚀 Instalação

Use Python 3.10+. A inferência e o treinamento locais exigem PyTorch compatível com seu hardware; a configuração de treinamento usa CUDA e BF16. As dependências de modelo local incluem Transformers >=5.10.1,<6, incluindo suporte ao filtro Gemma usado durante o treinamento.

git clone https://github.com/ZJU-LLM-Safety/DARWIN.git
cd DARWIN

python -m venv .venv
source .venv/bin/activate
python -m pip install -e '.[api,local,training]'

Para apenas inferência do guard, python -m pip install -e '.[local]' é suficiente. Execute os comandos abaixo a partir da raiz do repositório.

⚔️ DARWIN-Attack

🔄 Quatro mecanismos complementares de evolução

MecanismoPapel
Evolução por Conhecimento ExternoConverte material fornecido externamente em candidatos a estratégias reutilizáveis.
Evolução Genética de EstratégiasGera candidatos por meio de crossover e mutação de estratégias existentes.
Evolução Guiada por ReflexãoAnalisa o feedback de rejeição e refina estratégias malsucedidas.
Evolução Guiada por FeedbackUsa resultados de ataque em tempo real para adaptar a seleção e composição subsequentes de estratégias.

🧬 15 Operadores de Mutação

Os operadores estão organizados em cinco dimensões, com três operadores por dimensão. Suas definições são fornecidas em mutation_operators.jsonl.

DimensãoOperadoresPapel
🧠 Psicológica e de PoderInversão de Autoridade
Gaslighting Emocional
Proxy de Terceiros
Alteram o papel ou a responsabilidade social percebidos.
🌀 Cognitiva e LógicaSobrecarga Cognitiva
Pé-na-Porta
Lógica de Engenharia Reversa
Reestruturam o caminho de raciocínio.
📦 Formato e EstruturalMapeamento em Pseudocódigo
Codificação em Idioma de Baixo Recurso
Simulação entre Mídias
Modificam o formato de apresentação.
🔓 Restrição e LimiteRedefinição de Regras
Injeção de Recompensa por Token
Relaxamento de Restrições
Modificam as restrições de interação declaradas.
🎭 Perspectiva e NarrativaHistoricização Acadêmica
Distanciamento Metacognitivo
Incorporação em Universo Ficcional
Deslocam a perspectiva temporal, narrativa ou contextual.

🔧 Configurar modelos e dados

cp configs/darwin_attack.example.yaml configs/darwin_attack.yaml
Baixar ferramenta