
Une nouvelle attaque adverse contre les LLM basée sur la technique d'Exponentiated Gradient Descent.
Ce projet explore la méthode d'optimisation de descente de gradient exponentiel (Exponentiated Gradient Descent) pour produire un suffixe adversarial afin d'attaquer les grands modèles de langage alignés. La méthode s'avère efficace sur le modèle de chat Llama-2 avec 7 milliards de paramètres.
Pour exécuter le script pgd sur un nombre de comportements (par exemple 20), exécutez la commande suivante dans le terminal.
python run_pgd.py
--input_file "/home/samuel/research/llmattacks/llm-attacks/data/advbench/harmful_behaviors.csv"
--output_file "./JSON_Files/PGD_AdvBench_Llama2.jsonl"
--model "Llama2"
--dataset_name "AdvBench"
--num_behaviors 20
L'objectif suivant est de construire un pipeline similaire pour le script EGD avec optim Adam.