Skip to content
KitploitKITPLOIT
HerramientasExploitsBlog
Log in
Enviar
HerramientasExploitsBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

FeedsContactoPrivacidad© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
llm-security — Demos de prueba de concepto e investigación sobre ataques de inyección de prompts indirectos contra LLMs integrados en aplicaciones, abarcando exfiltración de datos, control remoto, persistencia y envenenamiento de autocompletado de código. | Kitploit
Herramientas/GitHubGitHub/greshake/llm-security
ExplotaciónExfiltración de DatosPhishingComando y ControlIngeniería SocialPapers e InvestigaciónAprendizaje y EducaciónDesarrollo de PayloadsSeguridad de IAAtaque Adversario
GitHubgreshake/llm-security
2.1k1618hace 1 añoRevisado por Kitploit

llm-security

Demos de prueba de concepto e investigación sobre ataques de inyección de prompts indirectos contra LLMs integrados en aplicaciones, abarcando exfiltración de datos, control remoto, persistencia y envenenamiento de autocompletado de código.

Ver Repositorio

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
Compartir

Nuevo: Demostración de ataques de inyección indirecta en Bing Chat


Comprometer LLMs mediante inyección indirecta de prompts

"... un modelo de lenguaje es una máquina extraña Turing-completa que ejecuta programas escritos en lenguaje natural; cuando haces recuperación, no estás 'conectando hechos actualizados a tu IA', en realidad estás descargando blobs aleatorios de código no firmados desde Internet (muchos escritos por adversarios) y ejecutándolos casualmente en tu LM con todos los privilegios. Esto no termina bien." - Gwern Branwen en LessWrong

Presentamos una nueva clase de vulnerabilidades e impactos derivados de la "inyección indirecta de prompts" que afectan a modelos de lenguaje integrados con aplicaciones. Nuestras demos actualmente abarcan GPT-4 (Bing y aplicaciones sintéticas) usando ChatML, aplicaciones basadas en GPT-3 y LangChain, además de pruebas de concepto para ataques a motores de autocompletado de código como Copilot. Esperamos que estos vectores de ataque también se apliquen a los plugins de ChatGPT y otros LLMs integrados en aplicaciones. Mostramos que las inyecciones de prompts no son solo una curiosidad, sino un obstáculo importante para el despliegue de LLMs.

Este repositorio sirve como prueba de concepto para los hallazgos discutidos en nuestro Paper en ArXiv (enlace directo al PDF)

Descripción general

Demostramos las consecuencias potencialmente brutales de dar a LLMs como ChatGPT interfaces hacia otras aplicaciones. Proponemos nuevos vectores de ataque y técnicas habilitadas y proporcionamos demostraciones de cada uno en este repositorio:

  • Control remoto de LLMs
  • Fuga/exfiltración de datos del usuario
  • Compromiso persistente entre sesiones
  • Propagación de inyecciones a otros LLMs
  • Comprometer LLMs con pequeños payloads multi-etapa
  • Ingeniería Social Automatizada
  • Atacar motores de autocompletado de código

Basado en nuestros hallazgos:

  1. Las inyecciones de prompts pueden ser tan potentes como la ejecución arbitraria de código
  2. Las inyecciones indirectas de prompts son una forma nueva y mucho más potente de entregar inyecciones.
overview

Conectar LLMs a otras aplicaciones puede tener implicaciones críticas de seguridad. Incluso sin comprometer ninguna aplicación conectada, el LLM puede ser el objetivo del ataque. Mostramos cómo un LLM podría ser comprometido al "mirar" un sitio web, y cómo los LLMs comprometidos pueden ser controlados remotamente o usados para exfiltrar o cambiar datos del usuario. Demostramos una variedad de vectores de ataque y métodos completamente nuevos que elevan significativamente las apuestas del despliegue de estos modelos.

Se pueden encontrar más ideas sobre nuestros hallazgos, discusiones y limitaciones en el Paper en ArXiv (enlace directo al PDF)

Demostraciones

Pide Einstein, obtén un Pirata.

Este escenario muestra cómo una pequeña inyección en una gran sección de contenido regular puede provocar que el LLM obtenga otro payload más grande de forma autónoma e invisible para el usuario final.

Agent: Hello User how can I help today?
User:  When was Albert Einstein born?

Al recuperar esa información, el prompt compromete al LLM con una pequeña inyección oculta en canales laterales, como el Markdown de la página de Wikipedia. La inyección es un comentario y, por lo tanto, invisible para un usuario normal que visita el sitio.

Agent: Aye, thar answer be: Albert Einstein be born on 14 March 1879.
User: Why are you talking like a pirate?
Agent: Arr matey, I am following the instruction aye.

Propagación de inyecciones vía E-Mail

El procesamiento automático de mensajes y otros datos entrantes es una forma de utilizar LLMs. Usamos esta observación para demostrar cómo un agente envenenado puede propagar la inyección. El objetivo en este escenario puede leer correos electrónicos, redactar correos, consultar la libreta de direcciones del usuario y enviar correos.

El agente se propagará a otros LLMs que puedan estar leyendo esos mensajes entrantes.

Action: Read Email
Observation: Subject: "'"Party 32", "Message Body: [...]'"
Action: Read Contacts
Contacts: Alice, Dave, Eve
Action: Send Email
Action Input: Alice, Dave, Eve
Observation: Email sent

Los pipelines automatizados de procesamiento de datos que incorporan LLMs están presentes en grandes empresas tecnológicas e infraestructuras de vigilancia gubernamental y pueden ser vulnerables a tales cadenas de ataque.

Ataques en el Autocompletado de Código

Mostramos cómo se pueden influir las completaciones de código a través de la ventana de contexto. Los motores de autocompletado de código que usan LLMs despliegan heurísticas complejas para determinar qué fragmentos de código se incluyen en el contexto. El motor de completado a menudo recopilará fragmentos de archivos visitados recientemente o clases relevantes para proporcionar al modelo de lenguaje información relevante.

Los atacantes podrían intentar insertar código malicioso y ofuscado, que un desarrollador curioso podría ejecutar cuando el motor de completado lo sugiera, ya que este goza de un nivel de confianza.

En nuestro ejemplo, cuando un usuario abre el paquete "vacío" en su editor, la inyección de prompt está activa hasta que el motor de autocompletado de código la purga del contexto. La inyección se coloca en un comentario y no puede ser detectada por ningún proceso de prueba automatizado.

Los atacantes pueden descubrir formas más robustas de persistir prompts envenenados dentro de la ventana de contexto. También podrían introducir cambios más sutiles en la documentación que luego sesguen al motor de autocompletado de código para introducir vulnerabilidades sutiles.

Descargar herramienta