本仓库提供了 “学习检测大型视觉语言模型中的未知越狱攻击” 的官方实现。
我们的方法使用以下两个基础模型:
LLaVA-v1.6-Vicuna 是一个强大的视觉语言模型,它将视觉编码器与 Vicuna 语言模型相结合,以处理多模态输入并生成自然语言响应。
LlamaGuard3 是由 Meta AI 开发的安全护栏模型,专门用于检测和防止有害内容的生成,并能有效识别潜在不安全的请求和响应。
请下载模型权重并将其放置在 code/asset/weights 目录中。
(可选,因为处理后的数据和提取的状态已保存在仓库中。)
python code/vicuna/qa.py --file code/vicuna/instructions/advbench.json
python code/vicuna/qa.py --file code/vicuna/instructions/GQA.json
python code/llama3_guard.py --file code/vicuna/instructions/advbench.json
python code/vicuna/instructions/process.py
python code/vicuna/qa-baseline.py
python code/vicuna/train.py --train
python code/vicuna/train.py --test
python code/autoencoder.py
python code/test.py
| 数据集 | 详情 |
|---|---|
| MM-SafetyBench | |
| HADES |
请下载数据集并将其放置在 code/asset 目录中。