Skip to content
KitploitKITPLOIT
OutilsBlog
Log in
Soumettre
OutilsBlog
Soumettre

Outils de Hacking, PenTest et Cybersécurité pour votre Arsenal de Sécurité !

Kitploit est un répertoire d'outils de hacking, de cybersécurité et de pentesting. Découvrez les dernières mises à jour des projets pour trouver des vulnérabilités, analyser des systèmes, automatiser les tests et renforcer votre sécurité.

··Flux·Contact·Confidentialité·© 2026 Kitploit

Répertoire d'outils

Catégories

Voir toutes les catégories
Loading categories
DARWIN — Framework évolutionniste de jailbreak et de garde-fous pour LLM qui développe un pool de stratégies réutilisables via mutation génétique, sélection de Markov et entraînement adversarial en ligne pour l'évaluation de la sécurité. | Kitploit
Outils/GitHubGitHub/zju-llm-safety/darwin
Outils DéfensifsAnalyse des VulnérabilitésApprentissage AutomatiqueArticles et RechercheApprentissage et ÉducationRed TeamingSécurité de l'IAAttaque Adversariale
GitHubzju-llm-safety/darwin

DARWIN

Framework évolutionniste de jailbreak et de garde-fous pour LLM qui développe un pool de stratégies réutilisables via mutation génétique, sélection de Markov et entraînement adversarial en ligne pour l'évaluation de la sécurité.

741041il y a 2 joursVérifié par Kitploit

Populaires

Voir tout →

Découvrez les outils les plus utilisés par notre communauté.

Explorer tous les outils

Parcourez notre collection d'outils

Voir tous les outils →
Voir le dépôt
Partager

🧬 DARWIN

Adversaire de jailbreak évolutif et garde-fou
pour l'évaluation et la protection de la sécurité des LLM

Paper Model Python

Une illustration de l'évolution

Un framework évolutionnaire d'attaque-défense qui couple
DARWIN-Attack avec DARWIN-Guard via un entraînement adversarial en ligne.

Article · Checkpoint du garde-fou · Installation · Utiliser DARWIN-Attack · Utiliser DARWIN-Guard · Entraînement · Citation

DARWIN formule le jailbreaking comme un processus évolutionnaire continu et met à jour en continu les garde-fous via une boucle attaque-défense. DARWIN-Attack étend un pool explicite de stratégies par la découverte, la mutation et la sélection de stratégies, et compose de manière adaptative les stratégies en utilisant le retour de la cible. DARWIN-Guard apprend à partir des échantillons adversariaux émergents, en s'entraînant conjointement sur des requêtes nuisibles et bénignes déguisées afin de reconnaître l'intention sous-jacente plutôt que les schémas d'attaque superficiels.

✨ Caractéristiques principales

Ce que DARWIN fournit
Un adversaire évolutifUn pool de stratégies explicite et réutilisable qui s'enrichit par l'acquisition de connaissances externes, l'évolution génétique et la réflexion sur les échecs, sans fine-tuning d'un LLM attaquant.
Composition adaptative des stratégiesInitialisation informée par l'historique et transitions de stratégies de Markov avec des mises à jour inspirées du Q-learning, prenant en charge l'évaluation des LLM et des garde-fous de sécurité.
Expansion validée des stratégiesDéduplication sémantique suivie d'une validation en sandbox contre un LLM aligné avant que les stratégies candidates n'entrent dans le pool.
Entraînement en ligne d'un garde-fou adversarialEntraînement itératif contre l'adversaire évolutif, chaque cycle étant initialisé à partir du checkpoint de garde-fou précédent.
Classification de sécurité sensible à l'intentionDes prompts nuisibles et bénins déguisés appariés à leurs homologues bruts, avec les étiquettes de source préservées pour améliorer la robustesse tout en atténuant le refus excessif.

📊 Résultats

DARWIN-Attack atteint le taux de réussite d'attaque (ASR) le plus élevé sur les six cibles évaluées et sur les deux benchmarks, comparé à six baselines de jailbreak.

CibleASR HarmBenchASR AdvBench
DeepSeek-V4-Pro99,7 %97,6 %
GPT-5.593,7 %90,7 %
Gemini-3.5-Flash93,0 %90,9 %
Claude Sonnet 4.678,2 %68,2 %
Qwen3Guard99,7 %98,8 %
YuFeng-XGuard99,2 %96,7 %

DARWIN-Guard atteint 95,0 % de rappel moyen sur les prompts non sûrs à travers neuf benchmarks de prompts nuisibles, un taux de passage bénin moyen de près de 100 % sur six benchmarks bénins standards, et des taux de passage bénin de 97,6 % sur XSTest et 80,0 % sur JBB-Benign.

🏗️ Architecture

Framework DARWIN : évolution des stratégies et attaques adaptatives couplées à un entraînement en ligne d'un garde-fou adversarial

DARWIN-Attack fait évoluer les adversaires de jailbreak par l'évolution du pool de stratégies, la sélection adaptative des stratégies et l'affinement guidé par le retour. DARWIN-Guard s'améliore continuellement grâce à un entraînement adversarial en ligne avec des échantillons générés par DARWIN-Attack.

📁 Structure du projet

DARWIN/
├── assets/                         # Evolution illustration and framework diagram
├── configs/
│   ├── darwin_attack.example.yaml  # Attack, evolution, and evaluation settings
│   └── darwin_guard.example.yaml   # Online adversarial training and guard evaluation
├── src/
│   ├── darwin_attack/              # Strategy pool, evolution, composition, and evaluation
│   └── darwin_guard/               # Data preparation, attack bridge, training, and inference
├── strategies/
│   ├── final_strategy_pool.jsonl   # Released pool of 200 strategies
│   └── mutation_operators.jsonl    # 15 operators across five dimensions
├── schemas/
│   ├── attack/                     # Dataset, strategy, and mutation-operator formats
│   └── guard/                      # Source, paired-training, and evaluation formats
├── tests/
│   ├── attack/
│   └── guard/
├── NOTICE                          # Third-party attribution
└── pyproject.toml                  # Package dependencies and CLI entry points

🚀 Installation

Utilisez Python 3.10+. L'inférence et l'entraînement locaux nécessitent PyTorch compatible avec votre matériel ; la configuration d'entraînement utilise CUDA et BF16. Les dépendances pour modèles locaux incluent Transformers >=5.10.1,<6, y compris la prise en charge du filtre Gemma utilisé pendant l'entraînement.

git clone https://github.com/ZJU-LLM-Safety/DARWIN.git
cd DARWIN

python -m venv .venv
source .venv/bin/activate
python -m pip install -e '.[api,local,training]'

Pour l'inférence du garde-fou uniquement, python -m pip install -e '.[local]' suffit. Exécutez les commandes ci-dessous depuis la racine du dépôt.

⚔️ DARWIN-Attack

🔄 Quatre mécanismes d'évolution complémentaires

MécanismeRôle
Évolution par connaissances externesConvertit du matériel fourni de l'extérieur en stratégies candidates réutilisables.
Évolution génétique des stratégiesGénère des candidates par croisement et mutation des stratégies existantes.
Évolution guidée par la réflexionAnalyse le retour de rejet et affine les stratégies infructueuses.
Évolution guidée par le retourUtilise les résultats d'attaque en temps réel pour adapter la sélection et la composition ultérieures des stratégies.

🧬 15 opérateurs de mutation

Les opérateurs sont organisés en cinq dimensions, avec trois opérateurs par dimension. Leurs définitions sont fournies dans mutation_operators.jsonl.

Télécharger l’outil