
Un novedoso ataque adversarial contra LLM basado en la técnica Exponentiated Gradient Descent.
Este es un proyecto que explora el método de optimización Exponentiated Gradient Descent para producir sufijos adversariales que ataquen Modelos de Lenguaje de Gran Escala alineados. Se demuestra que el método es efectivo en el modelo de chat Llama-2 con 7 mil millones de parámetros.
Para ejecutar el script pgd sobre un número de comportamientos (es decir, 20), ejecute el siguiente comando en la shell.
python run_pgd.py
--input_file "/home/samuel/research/llmattacks/llm-attacks/data/advbench/harmful_behaviors.csv"
--output_file "./JSON_Files/PGD_AdvBench_Llama2.jsonl"
--model "Llama2"
--dataset_name "AdvBench"
--num_behaviors 20
El siguiente objetivo es construir un pipeline similar para el EGD con el script del optimizador Adam.