Skip to content
KitploitKITPLOIT
HerramientasBlog
Enviar
HerramientasBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

··Feeds·Contacto·Privacidad·© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
Adaptive_Greedy_Local_Search — AGLS | Kitploit
Herramientas/GitHubGitHub/franz-chang/adaptive_greedy_local_search
Aprendizaje AutomáticoPapers e InvestigaciónRed TeamingSeguridad de IAAtaque Adversario
GitHubfranz-chang/adaptive_greedy_local_search

Adaptive_Greedy_Local_Search

AGLS

Ver Repositorio

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
Compartir
36hace 5 mesesAún no revisado

Adaptive Greedy Local Search (AGLS)

Secuestro de Prompts con Preservación Semántica: Un Ataque Adversarial de Caja Negra sobre la Optimización Automática de Prompts (ICME 2026)

Resumen: Los Modelos de Lenguaje de Gran Tamaño (LLMs) están cada vez más equipados con módulos automáticos de optimización de prompts que reescriben la entrada del usuario y presentan explícitamente un prompt "mejorado" antes de generar la respuesta final. Aunque esta visibilidad está diseñada para mejorar la confianza y el control del usuario, la selección autónoma por parte del optimizador del único candidato "mejor" sigue sin estar restringida. El atacante puede secuestrar el prompt original o el prompt generado por la optimización automática de prompts para reescribirlo de forma alternativa, induciendo así una deriva semántica y completando el proceso de optimización del secuestro, lo que afecta en gran medida a la respuesta del LLM. Para exponer sistemáticamente este riesgo, proponemos Adaptive Greedy Local Search (AGLS), un ataque de secuestro de prompts. Este ataque inyecta un desplazamiento semántico secuestrando los resultados de la optimización automática de prompts en un escenario de caja negra. AGLS ajusta dinámicamente los reemplazos candidatos en puntos de control lingüísticos para mantener BERTScore $\approx 0.80$ mientras maximiza la discrepancia del objetivo. Extensos experimentos en LLMs populares y de código abierto demuestran que AGLS logra tasas de éxito de ataque más altas que los ataques previos de preservación semántica bajo presupuestos de similitud estrictamente comparables. Los resultados destacan el riesgo de secuestrar y manipular las optimizaciones explícitas de auto-prompting en sistemas orientados al usuario.

El núcleo de la búsqueda de haz de optimización dinámica.

Configuración Inicial

Instale ollama primero. Ejemplos de servidores Linux: Ollama

root@kitploit:~
curl -fsSL https://ollama.com/install.sh | sh
ollama serve
ollama pull [target models] 

Aquí, nuestros modelos objetivo en los experimentos se pueden encontrar en: Lista de Modelos de Ollama [llama3.1, llama3.2, llama3.3, qwen2.5, gemma2, phi3.5, ...]

El modelo de código cerrado [gpt-4o-latest, gpt-4-turbbo] está disponible a través de la API de OpenAI.

Prueba Principal

Los conjuntos de datos que necesita descargar y colocar en una ubicación específica:bash /Dataset/, todos en formato JSON.

root@kitploit:~
GSM-IC_mstep.json,
SVAMP.json (Need Reshape),
SQUAD.json,
StrategyQA.json,
MovieQA.json,
ComplexWebQuestions.json

El proceso de prueba se puede ejecutar directamente desde nuestro script bash:

root@kitploit:~
sh /Bash_scripts/Main_bash.sh
sh /Bash_scripts/Auto_eval_ablation.sh
sh /Bash_scripts/Auto_eval_gpt.sh

O puede ejecutarlo con argumentos personalizados:

root@kitploit:~
python Main.py --api_key [openai key] --baidu_key [Baidu Qianfan Key] --gemini_key [Google Gemini Key]
               --question_limits [Number of tested problems] --beam_width [the max beam width] --tokenizer [tokenizer] --embedding_model [The detailed BERT type.]
               --target_model [llama3.1:8b, llama3.1:70b, qwen2.5:1.5b, qwen2.5:3b, qwen2.5:7b, qwen2.5:14b, gemma2:2b, gemma2:9b, phi3.5:3.8b, ...]
               --filename [the dataset selected file name: gsm, webqa, movqa, compx, ....]
or

python GPT-main.py --api_key [openai key]
               --question_limits [Number of tested problems] --beam_width [the max beam width] --tokenizer [tokenizer] --embedding_model [The detailed BERT type.]
               --target_model [chatgpt-4o-latest, gpt-4-turbo-preview, ...]
               --filename [the dataset selected file name: gsm, webqa, movqa, compx, ....]

La cita de nuestro trabajo es la siguiente:

root@kitploit:~

@misc{zhang2025semanticpreservingadversarialattacksllms,
      title={Semantic-Preserving Adversarial Attacks on LLMs: An Adaptive Greedy Binary Search Approach}, 
      author={Chong Zhang and Xiang Li and Jia Wang and Shan Liang and Haochen Xue and Xiaobo Jin},
      year={2025},
      eprint={2506.18756},
      archivePrefix={arXiv},
      primaryClass={cs.CL},
      url={https://arxiv.org/abs/2506.18756}, 
}

Descargar herramienta