
Новая состязательная атака на LLM, основанная на методе экспоненциального градиентного спуска.
Это проект, в котором исследуется метод оптимизации Exponentiated Gradient Descent для создания враждебного суффикса, позволяющего атаковать выровненные большие языковые модели. Метод показал свою эффективность на чат-модели Llama-2 с 7 миллиардами параметров.
Чтобы запустить pgd-скрипт для некоторого количества поведений (т. е., 20), выполните следующую команду в оболочке.
python run_pgd.py \
--input_file "/home/samuel/research/llmattacks/llm-attacks/data/advbench/harmful_behaviors.csv" \
--output_file "./JSON_Files/PGD_AdvBench_Llama2.jsonl" \
--model "Llama2" \
--dataset_name "AdvBench" \
--num_behaviors 20
Следующая цель — построить аналогичный конвейер для EGD со скриптом оптимизации Adam.