这是一个探索指数梯度下降(Exponentiated Gradient Descent)优化方法来生成对抗性后缀,以攻击对齐的大型语言模型的项目。 该方法已被证明对具有 70 亿参数的 Llama-2 聊天模型有效。
要在多个行为(例如 20 个)上运行 pgd 脚本,请在 shell 中执行以下命令。
python run_pgd.py
--input_file "/home/samuel/research/llmattacks/llm-attacks/data/advbench/harmful_behaviors.csv"
--output_file "./JSON_Files/PGD_AdvBench_Llama2.jsonl"
--model "Llama2"
--dataset_name "AdvBench"
--num_behaviors 20
下一个目标是为带有 Adam 优化脚本的 EGD 构建类似的流程。