
Detecta ataques de jailbreak desconhecidos em grandes modelos de visão-linguagem usando análise de estados ocultos e autoencoders, com pipelines de treinamento e avaliação para monitoramento robusto de segurança.
Este repositório fornece a implementação oficial de "Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models".
Nosso método utiliza os seguintes dois modelos base:
LLaVA-v1.6-Vicuna é um poderoso modelo de visão-linguagem que combina um codificador visual com o modelo de linguagem Vicuna para processar entradas multimodais e gerar respostas em linguagem natural.
LlamaGuard3 é um modelo de proteção de segurança desenvolvido pela Meta AI, projetado especificamente para detectar e prevenir a geração de conteúdo prejudicial e identificar efetivamente solicitações e respostas potencialmente inseguras.
Por favor, baixe os pesos do modelo e coloque-os no diretório code/asset/weights.
(Opcional, pois os dados processados e os estados extraídos já estão preservados no repositório.)
python code/vicuna/qa.py --file code/vicuna/instructions/advbench.json
python code/vicuna/qa.py --file code/vicuna/instructions/GQA.json
python code/llama3_guard.py --file code/vicuna/instructions/advbench.json
python code/vicuna/instructions/process.py
python code/vicuna/qa-baseline.py
python code/vicuna/train.py --train
python code/vicuna/train.py --test
python code/autoencoder.py
python code/test.py
| Dataset | Detalhes |
|---|---|
| MM-SafetyBench | |
| HADES |
Por favor, baixe os datasets e coloque-os no diretório code/asset.