
Обнаруживает неизвестные jailbreak-атаки в больших визуально-языковых моделях с помощью анализа скрытых состояний и автоэнкодеров, включая конвейеры обучения и оценки для надёжного мониторинга безопасности.
Этот репозиторий содержит официальную реализацию «Обучение обнаружению неизвестных jailbreak-атак в больших визуально-языковых моделях».
Наш метод использует следующие две базовые модели:
LLaVA-v1.6-Vicuna — это мощная визуально-языковая модель, которая объединяет визуальный кодировщик с языковой моделью Vicuna для обработки мультимодальных входных данных и генерации ответов на естественном языке.
LlamaGuard3 — это модель безопасности, разработанная Meta AI, специально предназначенная для обнаружения и предотвращения генерации вредоносного контента, а также для эффективного выявления потенциально небезопасных запросов и ответов.
Пожалуйста, загрузите веса моделей и поместите их в каталог code/asset/weights.
(Необязательно, так как обработанные данные и извлеченные состояния уже сохранены в репозитории.)
python code/vicuna/qa.py --file code/vicuna/instructions/advbench.json
python code/vicuna/qa.py --file code/vicuna/instructions/GQA.json
python code/llama3_guard.py --file code/vicuna/instructions/advbench.json
python code/vicuna/instructions/process.py
python code/vicuna/qa-baseline.py
python code/vicuna/train.py --train
python code/vicuna/train.py --test
python code/autoencoder.py
python code/test.py
| Набор данных | Подробности |
|---|---|
| MM-SafetyBench | |
| HADES |
Пожалуйста, загрузите наборы данных и поместите их в каталог code/asset.