
AGLS
Аннотация: Крупные языковые модели (LLM) все чаще оснащаются модулями автоматической оптимизации промптов, которые переписывают ввод пользователя и явно представляют «улучшенный» промпт перед генерацией окончательного ответа. Хотя эта видимость предназначена для повышения доверия и контроля пользователя, автономный выбор оптимизатором единственного «лучшего» кандидата остается неограниченным. Атакующий может угнать исходный промпт или промпт, сгенерированный автоматической оптимизацией, для альтернативного переписывания, тем самым вызывая семантический дрейф и завершая процесс оптимизации угона, что в значительной степени влияет на ответ LLM. Чтобы систематически выявить этот риск, мы предлагаем Adaptive Greedy Local Search (AGLS) — атаку угона промптов. Эта атака внедряет семантическое смещение путем угона результатов автоматической оптимизации промптов в сценарии черного ящика. AGLS динамически корректирует замены кандидатов на лингвистических контрольных точках, чтобы поддерживать BERTScore $\approx 0.80$, одновременно максимизируя расхождение целей. Обширные эксперименты на популярных и открытых LLM показывают, что AGLS достигает более высоких показателей успеха атак, чем предыдущие семантически сохраняющие атаки при строго сопоставимых бюджетах сходства. Результаты подчеркивают риск угона и подделки явных оптимизаций автоматического промптинга в пользовательских системах.

Начальные настройки
Пожалуйста, сначала установите ollama. Примеры для Linux сервера: Ollama
curl -fsSL https://ollama.com/install.sh | sh
ollama serve
ollama pull [target models]
Здесь целевые модели из наших экспериментов можно найти в: Список моделей Ollama [llama3.1, llama3.2, llama3.3, qwen2.5, gemma2, phi3.5, ...]
Закрытая модель [gpt-4o-latest, gpt-4-turbbo] доступна через OpenAI API.
Основной тест
Наборы данных, которые нужно скачать и разместить в определенном месте:bash /Dataset/, все в формате JSON.
GSM-IC_mstep.json,
SVAMP.json (Need Reshape),
SQUAD.json,
StrategyQA.json,
MovieQA.json,
ComplexWebQuestions.json
Процесс тестирования можно запустить непосредственно из нашего bash-скрипта:
sh /Bash_scripts/Main_bash.sh
sh /Bash_scripts/Auto_eval_ablation.sh
sh /Bash_scripts/Auto_eval_gpt.sh
Или вы можете запустить его с пользовательскими аргументами:
python Main.py --api_key [openai key] --baidu_key [Baidu Qianfan Key] --gemini_key [Google Gemini Key]
--question_limits [Number of tested problems] --beam_width [the max beam width] --tokenizer [tokenizer] --embedding_model [The detailed BERT type.]
--target_model [llama3.1:8b, llama3.1:70b, qwen2.5:1.5b, qwen2.5:3b, qwen2.5:7b, qwen2.5:14b, gemma2:2b, gemma2:9b, phi3.5:3.8b, ...]
--filename [the dataset selected file name: gsm, webqa, movqa, compx, ....]
or
python GPT-main.py --api_key [openai key]
--question_limits [Number of tested problems] --beam_width [the max beam width] --tokenizer [tokenizer] --embedding_model [The detailed BERT type.]
--target_model [chatgpt-4o-latest, gpt-4-turbo-preview, ...]
--filename [the dataset selected file name: gsm, webqa, movqa, compx, ....]
Цитата для нашей работы следующая:
@misc{zhang2025semanticpreservingadversarialattacksllms,
title={Semantic-Preserving Adversarial Attacks on LLMs: An Adaptive Greedy Binary Search Approach},
author={Chong Zhang and Xiang Li and Jia Wang and Shan Liang and Haochen Xue and Xiaobo Jin},
year={2025},
eprint={2506.18756},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2506.18756},
}