
Ein neuartiger adversarischer Angriff auf LLM, basierend auf der Exponentiated Gradient Descent Technik.
Dies ist ein Projekt, das die Optimierungsmethode des Exponentiated Gradient Descent untersucht, um adversariale Suffixe zu erzeugen, die ausgerichtete Large Language Models angreifen. Die Methode erweist sich als wirksam beim Llama-2-Chat-Modell mit 7 Milliarden Parametern.
Um das pgd-Skript für eine Reihe von Verhaltensweisen (d. h. 20) auszuführen, führen Sie den folgenden Befehl in der Shell aus.
python run_pgd.py
--input_file "/home/samuel/research/llmattacks/llm-attacks/data/advbench/harmful_behaviors.csv"
--output_file "./JSON_Files/PGD_AdvBench_Llama2.jsonl"
--model "Llama2"
--dataset_name "AdvBench"
--num_behaviors 20
Nächstes Ziel ist es, eine ähnliche Pipeline für das EGD- mit Adam-Optimierungsskript aufzubauen.