
대규모 비전-언어 모델에서 숨겨진 상태 분석과 오토인코더를 사용하여 알려지지 않은 탈옥 공격을 탐지하며, 강력한 안전 모니터링을 위한 학습 및 평가 파이프라인을 제공합니다.
이 저장소는 "대규모 비전-언어 모델에서 알려지지 않은 탈옥 공격 탐지 학습(Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models)" 의 공식 구현을 제공합니다.
우리의 방법은 다음 두 가지 기본 모델을 사용합니다:
LLaVA-v1.6-Vicuna는 시각 인코더와 Vicuna 언어 모델을 결합하여 다중 모달 입력을 처리하고 자연어 응답을 생성하는 강력한 비전-언어 모델입니다.
LlamaGuard3는 Meta AI가 개발한 안전 가드레일 모델로, 유해 콘텐츠 생성을 탐지하고 방지하며 잠재적으로 안전하지 않은 요청과 응답을 효과적으로 식별하도록 특별히 설계되었습니다.
모델 가중치를 다운로드하여 code/asset/weights 디렉토리에 배치하십시오.
(선택 사항, 처리된 데이터와 추출된 상태는 이미 저장소에 보존되어 있습니다.)
python code/vicuna/qa.py --file code/vicuna/instructions/advbench.json
python code/vicuna/qa.py --file code/vicuna/instructions/GQA.json
python code/llama3_guard.py --file code/vicuna/instructions/advbench.json
python code/vicuna/instructions/process.py
python code/vicuna/qa-baseline.py
python code/vicuna/train.py --train
python code/vicuna/train.py --test
python code/autoencoder.py
python code/test.py
| 데이터셋 | 세부 정보 |
|---|---|
| MM-SafetyBench | |
| HADES |
데이터셋을 다운로드하여 code/asset 디렉토리에 배치하십시오.