
هجوم عدائي جديد على LLM يعتمد على تقنية Exponentiated Gradient Descent.
هذا مشروع يستكشف طريقة تحسين النزول المتدرج الأسي (Exponentiated Gradient Descent) لإنتاج لاحقة عدائية لمهاجمة نماذج اللغة الكبيرة المتوافقة. أظهرت الطريقة فعالية على نموذج المحادثة Llama-2 بسبعة مليارات معامل.
لتشغيل سكربت pgd على عدد من السلوكيات (أي 20)، نفّذ الأمر التالي في الطرفية (Shell):
python run_pgd.py
--input_file "/home/samuel/research/llmattacks/llm-attacks/data/advbench/harmful_behaviors.csv"
--output_file "./JSON_Files/PGD_AdvBench_Llama2.jsonl"
--model "Llama2"
--dataset_name "AdvBench"
--num_behaviors 20
الهدف التالي هو بناء خط أنابيب مماثل لـ EGD مع سكربت تحسين Adam.