
Un nuovo attacco avversario sui LLM basato sulla tecnica dell'Exponentiated Gradient Descent.
Questo è un progetto che esplora il metodo di ottimizzazione Exponentiated Gradient Descent per produrre suffissi avversari con cui attaccare modelli linguistici di grandi dimensioni allineati. Il metodo si è dimostrato efficace sul modello chat Llama-2 con 7 miliardi di parametri.
Per eseguire lo script pgd su un certo numero di comportamenti (ad esempio, 20), esegui il seguente comando nella shell.
python run_pgd.py
--input_file "/home/samuel/research/llmattacks/llm-attacks/data/advbench/harmful_behaviors.csv"
--output_file "./JSON_Files/PGD_AdvBench_Llama2.jsonl"
--model "Llama2"
--dataset_name "AdvBench"
--num_behaviors 20
Il prossimo obiettivo è costruire una pipeline simile per EGD con lo script di ottimizzazione Adam.