
एक्सपोनेंशिएटेड ग्रेडिएंट डीसेंट तकनीक पर आधारित LLM पर एक नवीन प्रतिकूल हमला।
यह एक प्रोजेक्ट है जो एक्सपोनेन्टिएटेड ग्रेडिएंट डिसेंट ऑप्टिमाइज़ेशन विधि का पता लगाता है ताकि संरेखित बड़े भाषा मॉडलों पर हमला करने के लिए प्रतिकूल प्रत्यय उत्पन्न किया जा सके। यह विधि 7 बिलियन पैरामीटर वाले Llama-2 चैट मॉडल पर प्रभावी दिखाई गई है।
पीजीडी (pgd) स्क्रिप्ट को कुछ व्यवहारों (जैसे, 20) पर चलाने के लिए, शेल में निम्न कमांड निष्पादित करें।
python run_pgd.py
--input_file "/home/samuel/research/llmattacks/llm-attacks/data/advbench/harmful_behaviors.csv"
--output_file "./JSON_Files/PGD_AdvBench_Llama2.jsonl"
--model "Llama2"
--dataset_name "AdvBench"
--num_behaviors 20
अगला लक्ष्य एडम (Adam) ऑप्टिमाइज़ेशन स्क्रिप्ट के साथ EGD के लिए समान पाइपलाइन बनाना है।