
Rileva attacchi jailbreak sconosciuti nei grandi modelli visione-linguaggio utilizzando l'analisi degli stati nascosti e autoencoder, con pipeline di addestramento e valutazione per un monitoraggio di sicurezza robusto.
Questo repository fornisce l'implementazione ufficiale di "Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models".
Il nostro metodo utilizza i seguenti due modelli base:
LLaVA-v1.6-Vicuna è un potente modello visione-linguaggio che combina un encoder visivo con il modello linguistico Vicuna per elaborare input multimodali e generare risposte in linguaggio naturale.
LlamaGuard3 è un modello di salvaguardia sviluppato da Meta AI, progettato specificamente per rilevare e prevenire la generazione di contenuti dannosi e identificare efficacemente richieste e risposte potenzialmente non sicure.
Si prega di scaricare i pesi del modello e di inserirli nella directory code/asset/weights.
(Opzionale, poiché i dati elaborati e gli stati estratti sono già conservati nel repository.)
python code/vicuna/qa.py --file code/vicuna/instructions/advbench.json
python code/vicuna/qa.py --file code/vicuna/instructions/GQA.json
python code/llama3_guard.py --file code/vicuna/instructions/advbench.json
python code/vicuna/instructions/process.py
python code/vicuna/qa-baseline.py
python code/vicuna/train.py --train
python code/vicuna/train.py --test
python code/autoencoder.py
python code/test.py
| Dataset | Dettagli |
|---|---|
| MM-SafetyBench | |
| HADES |
Si prega di scaricare i dataset e di inserirli nella directory code/asset.