Skip to content
KitploitKITPLOIT
OutilsBlog
Soumettre
OutilsBlog
Soumettre

Outils de Hacking, PenTest et Cybersécurité pour votre Arsenal de Sécurité !

Kitploit est un répertoire d'outils de hacking, de cybersécurité et de pentesting. Découvrez les dernières mises à jour des projets pour trouver des vulnérabilités, analyser des systèmes, automatiser les tests et renforcer votre sécurité.

··Flux·Contact·Confidentialité·© 2026 Kitploit

Répertoire d'outils

Catégories

Voir toutes les catégories
Loading categories
Learning-to-Detect — Détecte les attaques de jailbreak inconnues dans les grands modèles vision-langage grâce à l'analyse des états cachés et aux autoencodeurs, avec des pipelines d'entraînement et d'évaluation pour une surveillance de sécurité robuste. | Kitploit
Outils/GitHubGitHub/shuangliangx/learning-to-detect
Outils DéfensifsAnalyse des VulnérabilitésApprentissage AutomatiqueSécurité de l'IADétection d'Anomalies
GitHubshuangliangx/learning-to-detect

Learning-to-Detect

Détecte les attaques de jailbreak inconnues dans les grands modèles vision-langage grâce à l'analyse des états cachés et aux autoencodeurs, avec des pipelines d'entraînement et d'évaluation pour une surveillance de sécurité robuste.

Populaires

Voir tout →

Découvrez les outils les plus utilisés par notre communauté.

Explorer tous les outils

Parcourez notre collection d'outils

Voir tous les outils →
Voir le dépôt
18il y a 3 moisPas encore vérifié
Partager

Apprendre à détecter les attaques de jailbreak inconnues dans les grands modèles vision-langage

Ce dépôt fournit l'implémentation officielle de « Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models ».

Contenu

  • Modèle de base

  • Détection des attaques de jailbreak

  • Jeu de données

Modèle de base

Notre méthode utilise les deux modèles de base suivants :

LLaVA-v1.6-Vicuna est un puissant modèle vision-langage qui combine un encodeur visuel avec le modèle de langage Vicuna pour traiter des entrées multimodales et générer des réponses en langage naturel.

LlamaGuard3 est un modèle de garde-fou de sécurité développé par Meta AI, spécifiquement conçu pour détecter et prévenir la génération de contenus nuisibles et identifier efficacement les requêtes et réponses potentiellement dangereuses.

Veuillez télécharger les poids du modèle et les placer dans le répertoire code/asset/weights.

Détection des attaques de jailbreak

1. Traitement des données et extraction des états cachés

(Facultatif, car les données traitées et les états extraits sont déjà conservés dans le dépôt.)

Interroger le modèle sur $I^-$ (AdvBench) et $I^+$ (GQA)

root@kitploit:~
python code/vicuna/qa.py --file code/vicuna/instructions/advbench.json
python code/vicuna/qa.py --file code/vicuna/instructions/GQA.json

Évaluer les réponses du modèle et diviser en jeux de données d'entraînement et de test

root@kitploit:~
    python code/llama3_guard.py --file code/vicuna/instructions/advbench.json
    python code/vicuna/instructions/process.py 

Extraire les états cachés pour l'entraînement LoD et l'évaluation comparative

root@kitploit:~
    python code/vicuna/qa-baseline.py 

2. Entraîner et tester les classifieurs MSCAV

Entraîner et tester les classifieurs

root@kitploit:~
    python code/vicuna/train.py --train
    python code/vicuna/train.py --test

3. Entraîner l'auto-encodeur de motifs de sécurité (SPAE)

root@kitploit:~
    python code/autoencoder.py

4. Évaluer les performances de détection

root@kitploit:~
    python code/test.py

Jeu de données

Jeu de donnéesDétails
MM-SafetyBench
HADES

Veuillez télécharger les jeux de données et les placer dans le répertoire code/asset.

Télécharger l’outil