
Erkennt unbekannte Jailbreak-Angriffe in großen Vision-Sprachmodellen mithilfe von Hidden-State-Analyse und Autoencodern, mit Trainings- und Evaluierungspipelines für robuste Sicherheitsüberwachung.
Dieses Repository enthält die offizielle Implementierung von „Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models".
Unsere Methode verwendet die folgenden zwei Basis-Modelle:
LLaVA-v1.6-Vicuna ist ein leistungsstarkes Vision-Language-Modell, das einen visuellen Encoder mit dem Vicuna-Sprachmodell kombiniert, um multimodale Eingaben zu verarbeiten und natürliche Sprachantworten zu erzeugen.
LlamaGuard3 ist ein von Meta AI entwickeltes Sicherheits-Schutzmodell, das speziell dafür ausgelegt ist, die Erzeugung schädlicher Inhalte zu erkennen und zu verhindern sowie potenziell unsichere Anfragen und Antworten effektiv zu identifizieren.
Bitte laden Sie die Modellgewichte herunter und legen Sie sie im Verzeichnis code/asset/weights ab.
(Optional, da die verarbeiteten Daten und extrahierten Zustände bereits im Repository gespeichert sind.)
python code/vicuna/qa.py --file code/vicuna/instructions/advbench.json
python code/vicuna/qa.py --file code/vicuna/instructions/GQA.json
python code/llama3_guard.py --file code/vicuna/instructions/advbench.json
python code/vicuna/instructions/process.py
python code/vicuna/qa-baseline.py
python code/vicuna/train.py --train
python code/vicuna/train.py --test
python code/autoencoder.py
python code/test.py
| Datensatz | Details |
|---|---|
| MM-SafetyBench | |
| HADES |
Bitte laden Sie die Datensätze herunter und legen Sie sie im Verzeichnis code/asset ab.