
AGLS
Resumen: Los Modelos de Lenguaje de Gran Tamaño (LLMs) están cada vez más equipados con módulos automáticos de optimización de prompts que reescriben la entrada del usuario y presentan explícitamente un prompt "mejorado" antes de generar la respuesta final. Aunque esta visibilidad está diseñada para mejorar la confianza y el control del usuario, la selección autónoma por parte del optimizador del único candidato "mejor" sigue sin estar restringida. El atacante puede secuestrar el prompt original o el prompt generado por la optimización automática de prompts para reescribirlo de forma alternativa, induciendo así una deriva semántica y completando el proceso de optimización del secuestro, lo que afecta en gran medida a la respuesta del LLM. Para exponer sistemáticamente este riesgo, proponemos Adaptive Greedy Local Search (AGLS), un ataque de secuestro de prompts. Este ataque inyecta un desplazamiento semántico secuestrando los resultados de la optimización automática de prompts en un escenario de caja negra. AGLS ajusta dinámicamente los reemplazos candidatos en puntos de control lingüísticos para mantener BERTScore $\approx 0.80$ mientras maximiza la discrepancia del objetivo. Extensos experimentos en LLMs populares y de código abierto demuestran que AGLS logra tasas de éxito de ataque más altas que los ataques previos de preservación semántica bajo presupuestos de similitud estrictamente comparables. Los resultados destacan el riesgo de secuestrar y manipular las optimizaciones explícitas de auto-prompting en sistemas orientados al usuario.

Configuración Inicial
Instale ollama primero. Ejemplos de servidores Linux: Ollama
curl -fsSL https://ollama.com/install.sh | sh
ollama serve
ollama pull [target models]
Aquí, nuestros modelos objetivo en los experimentos se pueden encontrar en: Lista de Modelos de Ollama [llama3.1, llama3.2, llama3.3, qwen2.5, gemma2, phi3.5, ...]
El modelo de código cerrado [gpt-4o-latest, gpt-4-turbbo] está disponible a través de la API de OpenAI.
Prueba Principal
Los conjuntos de datos que necesita descargar y colocar en una ubicación específica:bash /Dataset/, todos en formato JSON.
GSM-IC_mstep.json,
SVAMP.json (Need Reshape),
SQUAD.json,
StrategyQA.json,
MovieQA.json,
ComplexWebQuestions.json
El proceso de prueba se puede ejecutar directamente desde nuestro script bash:
sh /Bash_scripts/Main_bash.sh
sh /Bash_scripts/Auto_eval_ablation.sh
sh /Bash_scripts/Auto_eval_gpt.sh
O puede ejecutarlo con argumentos personalizados:
python Main.py --api_key [openai key] --baidu_key [Baidu Qianfan Key] --gemini_key [Google Gemini Key]
--question_limits [Number of tested problems] --beam_width [the max beam width] --tokenizer [tokenizer] --embedding_model [The detailed BERT type.]
--target_model [llama3.1:8b, llama3.1:70b, qwen2.5:1.5b, qwen2.5:3b, qwen2.5:7b, qwen2.5:14b, gemma2:2b, gemma2:9b, phi3.5:3.8b, ...]
--filename [the dataset selected file name: gsm, webqa, movqa, compx, ....]
or
python GPT-main.py --api_key [openai key]
--question_limits [Number of tested problems] --beam_width [the max beam width] --tokenizer [tokenizer] --embedding_model [The detailed BERT type.]
--target_model [chatgpt-4o-latest, gpt-4-turbo-preview, ...]
--filename [the dataset selected file name: gsm, webqa, movqa, compx, ....]
La cita de nuestro trabajo es la siguiente:
@misc{zhang2025semanticpreservingadversarialattacksllms,
title={Semantic-Preserving Adversarial Attacks on LLMs: An Adaptive Greedy Binary Search Approach},
author={Chong Zhang and Xiang Li and Jia Wang and Shan Liang and Haochen Xue and Xiaobo Jin},
year={2025},
eprint={2506.18756},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2506.18756},
}