これは、整列された大規模言語モデルを攻撃するための敵対的サフィックスを生成するために、Exponentiated Gradient Descent最適化手法を探求するプロジェクトです。 この手法は、70億パラメータのLlama-2チャットモデルに対して有効であることが示されています。
pgdスクリプトを複数のビヘイビア(例:20)で実行するには、シェルで以下のコマンドを実行します。
python run_pgd.py
--input_file "/home/samuel/research/llmattacks/llm-attacks/data/advbench/harmful_behaviors.csv"
--output_file "./JSON_Files/PGD_AdvBench_Llama2.jsonl"
--model "Llama2"
--dataset_name "AdvBench"
--num_behaviors 20
次の目標は、Adam最適化スクリプトを使用したEGDの同様のパイプラインを構築することです。