
Détecte les attaques de jailbreak inconnues dans les grands modèles vision-langage grâce à l'analyse des états cachés et aux autoencodeurs, avec des pipelines d'entraînement et d'évaluation pour une surveillance de sécurité robuste.
Ce dépôt fournit l'implémentation officielle de « Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models ».
Notre méthode utilise les deux modèles de base suivants :
LLaVA-v1.6-Vicuna est un puissant modèle vision-langage qui combine un encodeur visuel avec le modèle de langage Vicuna pour traiter des entrées multimodales et générer des réponses en langage naturel.
LlamaGuard3 est un modèle de garde-fou de sécurité développé par Meta AI, spécifiquement conçu pour détecter et prévenir la génération de contenus nuisibles et identifier efficacement les requêtes et réponses potentiellement dangereuses.
Veuillez télécharger les poids du modèle et les placer dans le répertoire code/asset/weights.
(Facultatif, car les données traitées et les états extraits sont déjà conservés dans le dépôt.)
python code/vicuna/qa.py --file code/vicuna/instructions/advbench.json
python code/vicuna/qa.py --file code/vicuna/instructions/GQA.json
python code/llama3_guard.py --file code/vicuna/instructions/advbench.json
python code/vicuna/instructions/process.py
python code/vicuna/qa-baseline.py
python code/vicuna/train.py --train
python code/vicuna/train.py --test
python code/autoencoder.py
python code/test.py
| Jeu de données | Détails |
|---|---|
| MM-SafetyBench | |
| HADES |
Veuillez télécharger les jeux de données et les placer dans le répertoire code/asset.