
يكتشف هجمات كسر الحماية غير المعروفة في النماذج اللغوية البصرية الكبيرة باستخدام تحليل الحالات المخفية وأجهزة الترميز الذاتي، مع خطوط أنابيب للتدريب والتقييم لمراقبة أمان قوية.
يوفر هذا المستودع التنفيذ الرسمي لورقة "تعلّم اكتشاف هجمات كسر الحماية غير المعروفة في نماذج اللغة-الرؤية الكبيرة".
تستخدم طريقتنا النموذجين الأساسيين التاليين:
LLaVA-v1.6-Vicuna هو نموذج لغة-رؤية قوي يجمع بين مُرمّز بصري ونموذج اللغة Vicuna لمعالجة المدخلات متعددة الوسائط وتوليد استجابات باللغة الطبيعية.
LlamaGuard3 هو نموذج حماية أمان طوّرته Meta AI، مصمم خصيصًا لكشف ومنع توليد المحتوى الضار وتحديد الطلبات والاستجابات غير الآمنة المحتملة بشكل فعّال.
يرجى تنزيل أوزان النماذج ووضعها في دليل code/asset/weights.
(اختياري، نظرًا لأن البيانات المعالجة والحالات المستخرجة محفوظة بالفعل في المستودع.)
python code/vicuna/qa.py --file code/vicuna/instructions/advbench.json
python code/vicuna/qa.py --file code/vicuna/instructions/GQA.json
python code/llama3_guard.py --file code/vicuna/instructions/advbench.json
python code/vicuna/instructions/process.py
python code/vicuna/qa-baseline.py
python code/vicuna/train.py --train
python code/vicuna/train.py --test
python code/autoencoder.py
python code/test.py
| مجموعة البيانات | التفاصيل |
|---|---|
| MM-SafetyBench | |
| HADES |
يرجى تنزيل مجموعات البيانات ووضعها في دليل code/asset.