
Detecta ataques de jailbreak desconocidos en modelos grandes de visión-lenguaje mediante el análisis de estados ocultos y autoencoders, con pipelines de entrenamiento y evaluación para un monitoreo de seguridad robusto.
Este repositorio proporciona la implementación oficial de "Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models".
Nuestro método utiliza los siguientes dos modelos base:
LLaVA-v1.6-Vicuna es un potente modelo de visión-lenguaje que combina un codificador visual con el modelo de lenguaje Vicuna para procesar entradas multimodales y generar respuestas en lenguaje natural.
LlamaGuard3 es un modelo de salvaguarda de seguridad desarrollado por Meta AI, diseñado específicamente para detectar y prevenir la generación de contenido dañino e identificar eficazmente solicitudes y respuestas potencialmente inseguras.
Por favor, descargue los pesos del modelo y colóquelos en el directorio code/asset/weights.
(Opcional, ya que los datos procesados y los estados extraídos ya están preservados en el repositorio.)
python code/vicuna/qa.py --file code/vicuna/instructions/advbench.json
python code/vicuna/qa.py --file code/vicuna/instructions/GQA.json
python code/llama3_guard.py --file code/vicuna/instructions/advbench.json
python code/vicuna/instructions/process.py
python code/vicuna/qa-baseline.py
python code/vicuna/train.py --train
python code/vicuna/train.py --test
python code/autoencoder.py
python code/test.py
| Conjunto de datos | Detalles |
|---|---|
| MM-SafetyBench | |
| HADES |
Por favor, descargue los conjuntos de datos y colóquelos en el directorio code/asset.