
AGLS
Zusammenfassung: Große Sprachmodelle (LLMs) werden zunehmend mit automatischen Prompt-Optimierungsmodulen ausgestattet, die die Eingabe des Benutzers umschreiben und vor der Generierung der endgültigen Antwort explizit einen „verbesserten“ Prompt präsentieren. Obwohl diese Sichtbarkeit das Vertrauen und die Benutzerkontrolle stärken soll, bleibt die autonome Auswahl des einzigen „besten“ Kandidaten durch den Optimierer uneingeschränkt. Ein Angreifer kann den ursprünglichen Prompt oder den durch automatische Prompt-Optimierung generierten Prompt für eine alternative Umschreibung kapern, wodurch eine semantische Drift ausgelöst und der Hijacking-Optimierungsprozess abgeschlossen wird, was die Antwort des LLM erheblich beeinflusst. Um dieses Risiko systematisch aufzudecken, schlagen wir Adaptive Greedy Local Search (AGLS) vor, einen Prompt-Hijacking-Angriff. Dieser Angriff injiziert eine semantische Verschiebung, indem er die Ergebnisse der automatischen Prompt-Optimierung in einem Black-Box-Szenario kapert. AGLS passt Kandidatenersetzungen an linguistischen Kontrollpunkten dynamisch an, um BERTScore ≈ 0,80 zu halten, während die Zielabweichung maximiert wird. Umfangreiche Experimente mit gängigen und Open-Source-LLMs zeigen, dass AGLS unter streng vergleichbaren Ähnlichkeitsbudgets höhere Angriffserfolgsraten erzielt als frühere semantikerhaltende Angriffe. Die Ergebnisse unterstreichen das Risiko des Hijackings und der Manipulation expliziter Auto-Prompt-Optimierungen in benutzerorientierten Systemen.

Ersteinstellungen
Bitte installieren Sie zuerst ollama. Linux-Server-Beispiele: Ollama
curl -fsSL https://ollama.com/install.sh | sh
ollama serve
ollama pull [target models]
Hier finden Sie die von uns in Experimenten verwendeten Zielmodelle: Ollama Model List [llama3.1, llama3.2, llama3.3, qwen2.5, gemma2, phi3.5, ...]
Das Closed-Source-Modell [gpt-4o-latest, gpt-4-turbbo] ist über die OpenAI-API verfügbar.
Haupttest
Die Datensätze, die Sie herunterladen und an einem bestimmten Ort ablegen müssen: bash /Dataset/, alle im JSON-Format.
GSM-IC_mstep.json,
SVAMP.json (Need Reshape),
SQUAD.json,
StrategyQA.json,
MovieQA.json,
ComplexWebQuestions.json
Der Testprozess kann direkt über unser Bash-Skript ausgeführt werden:
sh /Bash_scripts/Main_bash.sh
sh /Bash_scripts/Auto_eval_ablation.sh
sh /Bash_scripts/Auto_eval_gpt.sh
Oder Sie können es mit benutzerdefinierten Argumenten ausführen:
python Main.py --api_key [openai key] --baidu_key [Baidu Qianfan Key] --gemini_key [Google Gemini Key]
--question_limits [Number of tested problems] --beam_width [the max beam width] --tokenizer [tokenizer] --embedding_model [The detailed BERT type.]
--target_model [llama3.1:8b, llama3.1:70b, qwen2.5:1.5b, qwen2.5:3b, qwen2.5:7b, qwen2.5:14b, gemma2:2b, gemma2:9b, phi3.5:3.8b, ...]
--filename [the dataset selected file name: gsm, webqa, movqa, compx, ....]
or
python GPT-main.py --api_key [openai key]
--question_limits [Number of tested problems] --beam_width [the max beam width] --tokenizer [tokenizer] --embedding_model [The detailed BERT type.]
--target_model [chatgpt-4o-latest, gpt-4-turbo-preview, ...]
--filename [the dataset selected file name: gsm, webqa, movqa, compx, ....]
Das Zitat für unsere Arbeit lautet wie folgt:
@misc{zhang2025semanticpreservingadversarialattacksllms,
title={Semantic-Preserving Adversarial Attacks on LLMs: An Adaptive Greedy Binary Search Approach},
author={Chong Zhang and Xiang Li and Jia Wang and Shan Liang and Haochen Xue and Xiaobo Jin},
year={2025},
eprint={2506.18756},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2506.18756},
}