
AGLS
الملخص: تُجهَّز نماذج اللغة الكبيرة (LLMs) بشكل متزايد بوحدات تحسين تلقائي للمطالبات تعيد كتابة مدخلات المستخدم وتعرض بشكل صريح مطالبة «محسّنة» قبل توليد الاستجابة النهائية. ورغم أن هذه الشفافية مصمَّمة لتعزيز الثقة وتحكُّم المستخدم، فإن اختيار المحسِّن المستقل للمرشح «الأفضل» الوحيد يظل غير مُقيَّد. يمكن للمهاجم اختطاف المطالبة الأصلية أو المطالبة الناتجة عن التحسين التلقائي للمطالبة لإعادة كتابتها بطريقة بديلة، مما يحفّز انحرافًا دلاليًا ويكمّل عملية تحسين الاختطاف، وبالتالي يؤثر بشكل كبير على استجابة نموذج اللغة الكبير. لكشف هذا الخطر بشكل منهجي، نقترح البحث المحلي الجشع التكيفي (Adaptive Greedy Local Search - AGLS)، وهو هجوم اختطاف للمطالبات. يضخ هذا الهجوم إزاحة دلالية عبر اختطاف مخرجات تحسين المطالبة التلقائية في سيناريو الصندوق الأسود. يضبط AGLS ديناميكيًا البدائل المرشحة عند نقاط التفتيش اللغوية للحفاظ على BERTScore $\approx 0.80$ مع تعظيم تباين الهدف. تُظهر التجارب الموسعة على نماذج اللغة الكبيرة الشائعة ومفتوحة المصدر أن AGLS يحقق معدلات نجاح هجوم أعلى من الهجمات السابقة التي تحافظ على الدلالات، وذلك في ظل ميزانيات تشابه قابلة للمقارنة بشكل صارم. وتسلط النتائج الضوء على خطر اختطاف تحسينات المطالبة التلقائية الصريحة والعبث بها في الأنظمة الموجهة للمستخدم.

الإعدادات الأولية
يرجى تثبيت ollama أولاً. نماذج لخوادم Linux: Ollama
curl -fsSL https://ollama.com/install.sh | sh
ollama serve
ollama pull [target models]
يمكن العثور على نماذجنا المستهدفة في التجارب هنا: قائمة نماذج Ollama [llama3.1, llama3.2, llama3.3, qwen2.5, gemma2, phi3.5, ...]
النموذج مغلق المصدر [gpt-4o-latest, gpt-4-turbbo] متاح عبر OpenAI API.
الاختبار الرئيسي
مجموعات البيانات التي تحتاج إلى تنزيلها ووضعها في موقع محدد: bash /Dataset/، وجميعها بتنسيق JSON.
GSM-IC_mstep.json,
SVAMP.json (Need Reshape),
SQUAD.json,
StrategyQA.json,
MovieQA.json,
ComplexWebQuestions.json
يمكن تشغيل عملية الاختبار مباشرة من خلال سكربت bash الخاص بنا:
sh /Bash_scripts/Main_bash.sh
sh /Bash_scripts/Auto_eval_ablation.sh
sh /Bash_scripts/Auto_eval_gpt.sh
أو يمكنك تشغيله بوسائط مخصصة:
python Main.py --api_key [openai key] --baidu_key [Baidu Qianfan Key] --gemini_key [Google Gemini Key]
--question_limits [Number of tested problems] --beam_width [the max beam width] --tokenizer [tokenizer] --embedding_model [The detailed BERT type.]
--target_model [llama3.1:8b, llama3.1:70b, qwen2.5:1.5b, qwen2.5:3b, qwen2.5:7b, qwen2.5:14b, gemma2:2b, gemma2:9b, phi3.5:3.8b, ...]
--filename [the dataset selected file name: gsm, webqa, movqa, compx, ....]
أو
python GPT-main.py --api_key [openai key]
--question_limits [Number of tested problems] --beam_width [the max beam width] --tokenizer [tokenizer] --embedding_model [The detailed BERT type.]
--target_model [chatgpt-4o-latest, gpt-4-turbo-preview, ...]
--filename [the dataset selected file name: gsm, webqa, movqa, compx, ....]
الاقتباس المرجعي لعملنا هو كما يلي:
@misc{zhang2025semanticpreservingadversarialattacksllms,
title={Semantic-Preserving Adversarial Attacks on LLMs: An Adaptive Greedy Binary Search Approach},
author={Chong Zhang and Xiang Li and Jia Wang and Shan Liang and Haochen Xue and Xiaobo Jin},
year={2025},
eprint={2506.18756},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2506.18756},
}