このリポジトリは、「大規模視覚言語モデルにおける未知のジェイルブレイク攻撃の検出を学習する」 の公式実装を提供します。
本手法では、以下の2つのベースモデルを使用します:
LLaVA-v1.6-Vicuna は、視覚エンコーダとVicuna言語モデルを組み合わせ、マルチモーダル入力を処理して自然言語応答を生成する強力な視覚言語モデルです。
LlamaGuard3 は、Meta AIが開発した安全性ガードレールモデルであり、有害なコンテンツ生成の検出と防止、および潜在的に安全でないリクエストや応答の効果的な識別に特化しています。
モデルの重みをダウンロードし、code/asset/weights ディレクトリに配置してください。
(処理済みデータと抽出済み状態はリポジトリに保存されているため、この手順は任意です。)
python code/vicuna/qa.py --file code/vicuna/instructions/advbench.json
python code/vicuna/qa.py --file code/vicuna/instructions/GQA.json
python code/llama3_guard.py --file code/vicuna/instructions/advbench.json
python code/vicuna/instructions/process.py
python code/vicuna/qa-baseline.py
python code/vicuna/train.py --train
python code/vicuna/train.py --test
python code/autoencoder.py
python code/test.py
| データセット | 詳細 |
|---|---|
| MM-SafetyBench | |
| HADES |
データセットをダウンロードし、code/asset ディレクトリに配置してください。