概要: 大規模言語モデル(LLM)は、ユーザーの入力を書き換え、最終応答を生成する前に「改善された」プロンプトを明示的に提示する、自動プロンプト最適化モジュールを備えることが増えている。この可視性は信頼性とユーザー制御を高めるように設計されているが、オプティマイザによる単一の「最良」候補の自律的な選択は、依然として制約を受けていない。攻撃者は、元のプロンプトまたは自動プロンプト最適化によって生成されたプロンプトをハイジャックして代替の書き換えを行い、それにより意味的ドリフトを誘発してハイジャック最適化プロセスを完了させ、LLMの応答に大きな影響を与えることができる。このリスクを体系的に明らかにするため、我々はプロンプトハイジャック攻撃であるAdaptive Greedy Local Search(AGLS)を提案する。この攻撃は、ブラックボックス環境において自動プロンプト最適化の結果をハイジャックすることで、意味的オフセットを注入する。AGLSは、言語的チェックポイントにおいて候補の置換を動的に調整し、目標の乖離を最大化しながらBERTScore $\approx 0.80$ を維持する。一般的なオープンソースLLMに対する広範な実験により、AGLSは厳密に同等の類似度予算の下で、従来の意味保存型攻撃よりも高い攻撃成功率を達成することが実証された。この結果は、ユーザー向けシステムにおける明示的な自動プロンプト最適化をハイジャックおよび改ざんするリスクを浮き彫りにしている。

初期設定
最初にollamaをインストールしてください。Linuxサーバーの例:Ollama
curl -fsSL https://ollama.com/install.sh | sh
ollama serve
ollama pull [target models]
ここで、実験で使用した対象モデルはこちらで確認できます:Ollama Model List [llama3.1, llama3.2, llama3.3, qwen2.5, gemma2, phi3.5, ...]
クローズドソースモデル[gpt-4o-latest, gpt-4-turbbo]は、OpenAI API経由で利用できます。
メインテスト
ダウンロードして特定の場所に配置する必要があるデータセット:bash /Dataset/、すべてJSON形式です。
GSM-IC_mstep.json,
SVAMP.json (Need Reshape),
SQUAD.json,
StrategyQA.json,
MovieQA.json,
ComplexWebQuestions.json
テストプロセスは、以下のbashスクリプトから直接実行できます:
sh /Bash_scripts/Main_bash.sh
sh /Bash_scripts/Auto_eval_ablation.sh
sh /Bash_scripts/Auto_eval_gpt.sh
または、カスタム引数で実行することもできます:
python Main.py --api_key [openai key] --baidu_key [Baidu Qianfan Key] --gemini_key [Google Gemini Key]
--question_limits [Number of tested problems] --beam_width [the max beam width] --tokenizer [tokenizer] --embedding_model [The detailed BERT type.]
--target_model [llama3.1:8b, llama3.1:70b, qwen2.5:1.5b, qwen2.5:3b, qwen2.5:7b, qwen2.5:14b, gemma2:2b, gemma2:9b, phi3.5:3.8b, ...]
--filename [the dataset selected file name: gsm, webqa, movqa, compx, ....]
or
python GPT-main.py --api_key [openai key]
--question_limits [Number of tested problems] --beam_width [the max beam width] --tokenizer [tokenizer] --embedding_model [The detailed BERT type.]
--target_model [chatgpt-4o-latest, gpt-4-turbo-preview, ...]
--filename [the dataset selected file name: gsm, webqa, movqa, compx, ....]
本研究成果の引用は以下の通りです:
@misc{zhang2025semanticpreservingadversarialattacksllms,
title={Semantic-Preserving Adversarial Attacks on LLMs: An Adaptive Greedy Binary Search Approach},
author={Chong Zhang and Xiang Li and Jia Wang and Shan Liang and Haochen Xue and Xiaobo Jin},
year={2025},
eprint={2506.18756},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2506.18756},
}