
Um novo ataque adversarial em LLM baseado na técnica de Exponentiated Gradient Descent.
Este é um projeto que explora o método de otimização Exponentiated Gradient Descent para produzir sufixos adversariais para atacar modelos de linguagem de grande porte alinhados. O método se mostra eficaz no modelo de chat Llama-2 com 7 bilhões de parâmetros.
Para executar o script pgd em um número de comportamentos (ou seja, 20), execute o seguinte comando no shell.
python run_pgd.py
--input_file "/home/samuel/research/llmattacks/llm-attacks/data/advbench/harmful_behaviors.csv"
--output_file "./JSON_Files/PGD_AdvBench_Llama2.jsonl"
--model "Llama2"
--dataset_name "AdvBench"
--num_behaviors 20
O próximo objetivo é construir um pipeline semelhante para o EGD com o script de otimização Adam.