
AGLS
सारांश: बड़े भाषा मॉडल (एलएलएम) तेजी से स्वचालित प्रॉम्प्ट-ऑप्टिमाइजेशन मॉड्यूल से सुसज्जित हो रहे हैं जो उपयोगकर्ता के इनपुट को फिर से लिखते हैं और अंतिम प्रतिक्रिया उत्पन्न करने से पहले स्पष्ट रूप से एक "बेहतर" प्रॉम्प्ट प्रस्तुत करते हैं। हालाँकि यह दृश्यता विश्वास और उपयोगकर्ता नियंत्रण को बढ़ाने के लिए डिज़ाइन की गई है, लेकिन ऑप्टिमाइज़र का एकल "सर्वश्रेष्ठ" उम्मीदवार का स्वायत्त चयन अनियंत्रित रहता है। हमलावर मूल प्रॉम्प्ट या स्वचालित प्रॉम्प्ट ऑप्टिमाइजेशन द्वारा उत्पन्न प्रॉम्प्ट को वैकल्पिक पुनर्लेखन के लिए हाइजैक कर सकता है, जिससे अर्थगत बहाव उत्पन्न होता है और हाइजैक ऑप्टिमाइजेशन प्रक्रिया पूरी होती है, जिससे एलएलएम की प्रतिक्रिया बहुत प्रभावित होती है। इस जोखिम को व्यवस्थित रूप से उजागर करने के लिए, हम अडेप्टिव ग्रीडी लोकल सर्च (एजीएलएस) प्रस्तावित करते हैं, जो एक प्रॉम्प्ट हाइजैकिंग हमला है। यह हमला ब्लैक-बॉक्स परिदृश्य में ऑटो-प्रॉम्प्ट ऑप्टिमाइजेशन परिणामों को हाइजैक करके एक अर्थगत ऑफसेट इंजेक्ट करता है। AGLS भाषाई जांच बिंदुओं पर उम्मीदवार प्रतिस्थापनों को गतिशील रूप से समायोजित करता है ताकि BERTScore $\approx 0.80$ बनाए रखा जा सके और साथ ही लक्ष्य विसंगति को अधिकतम किया जा सके। लोकप्रिय और ओपन-सोर्स LLMs पर व्यापक प्रयोगों से पता चलता है कि AGLS सख्ती से तुलनीय समानता बजट के तहत पिछले अर्थ-संरक्षण हमलों की तुलना में उच्च हमला सफलता दर प्राप्त करता है। परिणाम उपयोगकर्ता-सामना करने वाली प्रणालियों में स्पष्ट ऑटो-प्रॉम्प्टिंग ऑप्टिमाइजेशन को हाइजैक करने और उसके साथ छेड़छाड़ करने के जोखिम को उजागर करते हैं।

प्रारंभिक सेटिंग्स
कृपया पहले ollama स्थापित करें। लिनक्स सर्वर नमूने: Ollama
curl -fsSL https://ollama.com/install.sh | sh
ollama serve
ollama pull [target models]
यहाँ, प्रयोगों में हमारे लक्ष्य मॉडल यहाँ पाए जा सकते हैं: Ollama Model List [llama3.1, llama3.2, llama3.3, qwen2.5, gemma2, phi3.5, ...]
क्लोज्ड-सोर्स मॉडल [gpt-4o-latest, gpt-4-turbbo] OpenAI API के माध्यम से उपलब्ध है।
मुख्य परीक्षण
आपको जिन डेटासेट को डाउनलोड करना है और एक विशिष्ट स्थान पर रखना है: bash /Dataset/, सभी JSON प्रारूप में हैं।
GSM-IC_mstep.json,
SVAMP.json (Need Reshape),
SQUAD.json,
StrategyQA.json,
MovieQA.json,
ComplexWebQuestions.json
परीक्षण प्रक्रिया को सीधे हमारी बैश स्क्रिप्ट से चलाया जा सकता है:
sh /Bash_scripts/Main_bash.sh
sh /Bash_scripts/Auto_eval_ablation.sh
sh /Bash_scripts/Auto_eval_gpt.sh
या आप इसे कस्टम तर्कों के साथ चला सकते हैं:
python Main.py --api_key [openai key] --baidu_key [Baidu Qianfan Key] --gemini_key [Google Gemini Key]
--question_limits [Number of tested problems] --beam_width [the max beam width] --tokenizer [tokenizer] --embedding_model [The detailed BERT type.]
--target_model [llama3.1:8b, llama3.1:70b, qwen2.5:1.5b, qwen2.5:3b, qwen2.5:7b, qwen2.5:14b, gemma2:2b, gemma2:9b, phi3.5:3.8b, ...]
--filename [the dataset selected file name: gsm, webqa, movqa, compx, ....]
or
python GPT-main.py --api_key [openai key]
--question_limits [Number of tested problems] --beam_width [the max beam width] --tokenizer [tokenizer] --embedding_model [The detailed BERT type.]
--target_model [chatgpt-4o-latest, gpt-4-turbo-preview, ...]
--filename [the dataset selected file name: gsm, webqa, movqa, compx, ....]
हमारे कार्य के लिए उद्धरण निम्नलिखित है:
@misc{zhang2025semanticpreservingadversarialattacksllms,
title={Semantic-Preserving Adversarial Attacks on LLMs: An Adaptive Greedy Binary Search Approach},
author={Chong Zhang and Xiang Li and Jia Wang and Shan Liang and Haochen Xue and Xiaobo Jin},
year={2025},
eprint={2506.18756},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2506.18756},
}