
Exponentiated Gradient Descent 기법을 기반으로 한 LLM에 대한 새로운 적대적 공격.
이 프로젝트는 정렬된 대규모 언어 모델을 공격하기 위한 적대적 접미사를 생성하는 지수 경사 하강(Exponentiated Gradient Descent) 최적화 방법을 탐구합니다. 이 방법은 70억 개의 매개변수를 가진 Llama-2 채팅 모델에서 효과적인 것으로 나타났습니다.
여러 행동(예: 20개)에 대해 pgd 스크립트를 실행하려면 셸에서 다음 명령을 실행하십시오.
python run_pgd.py
--input_file "/home/samuel/research/llmattacks/llm-attacks/data/advbench/harmful_behaviors.csv"
--output_file "./JSON_Files/PGD_AdvBench_Llama2.jsonl"
--model "Llama2"
--dataset_name "AdvBench"
--num_behaviors 20
다음 목표는 Adam 최적화 스크립트를 사용하는 EGD에 대해 유사한 파이프라인을 구축하는 것입니다.