Skip to content
KitploitKITPLOIT
HerramientasExploitsBlog
Log in
Enviar
HerramientasExploitsBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

··Feeds·Contacto·Privacidad·© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
Prompt-Injection-in-the-Wild — Rastreador de técnicas de inyección de prompts reportadas públicamente, desglosadas por método de entrega, codificación y comportamiento de propagación, con modelos confirmados, fuentes y etiquetas MITRE ATLAS. | Kitploit
Herramientas/GitHubGitHub/cybershujin/prompt-injection-in-the-wild
Gestión de Indicadores de Compromiso (IOC)Feeds y Agregadores de AmenazasAnálisis de VulnerabilidadesInteligencia de AmenazasPapers e InvestigaciónAprendizaje y EducaciónRecursos CuradosSeguridad de IA

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
Ataque Adversario
GitHubcybershujin/prompt-injection-in-the-wild

Prompt-Injection-in-the-Wild

Rastreador de técnicas de inyección de prompts reportadas públicamente, desglosadas por método de entrega, codificación y comportamiento de propagación, con modelos confirmados, fuentes y etiquetas MITRE ATLAS.

Ver Repositorio
226hace 12 díasAún no revisado
Compartir

Inyección de prompts en estado salvaje

Un rastreador de técnicas de inyección de prompts reportadas públicamente de aproximadamente los últimos dos años, mantenido por Rachel James (cybershujin).

Cada técnica se desglosa en los tres elementos de una inyección de prompts:

  1. Método de entrega — cómo las instrucciones inyectadas llegan al modelo (el resultado de una llamada a una herramienta, un sitio web externo, una conexión MCP, un documento, un correo electrónico, una imagen, etc.).
  2. Codificación — la ofuscación aplicada al payload, si la hay (Base64, leetspeak, caracteres de etiqueta Unicode invisibles, homoglifos, …). En blanco cuando el payload es texto plano o el informe no lo indica.
  3. Comportamiento de propagación — si la inyección está diseñada para propagarse o persistir (entregada a cualquiera que se conecte a un servidor MCP envenenado, persistida en la memoria a largo plazo/de proyecto de un agente, arrastrada a lo largo de una cadena de llamadas a herramientas, forzada a emitir un correo electrónico que transporta más instrucciones, …). En blanco cuando no hay propagación.

Cada entrada también registra los modelos contra los que se confirmó que funciona (si los hay), un enlace a la fuente que lo reporta y — cuando se conoce — la fuente del ataque (el investigador, el equipo rojo o el actor en estado salvaje del que se originó).

Panel en vivo: https://cybershujin.github.io/Prompt-Injection-in-the-Wild/


Alcance y metodología

  • Dentro del alcance: técnicas para inyectar instrucciones adversarias en un LLM o en un agente impulsado por LLM que hayan sido — por investigadores de seguridad, equipos rojos, proveedores, o según lo observado en actividad en estado salvaje. Se incluyen tanto la inyección de prompts directa como la indirecta (transportada por datos).
| Técnica | Método de entrega | Codificación | Propagación | Modelos confirmados | Origen del ataque | Evidencia | Verificación | Resumen | ATLAS | Reportado | Enlace |
reportadas públicamente
  • Fuera del alcance: listas genéricas de palabras para jailbreak sin mecanismo de entrega/propagación, quejas puras sobre la alineación de modelos, y marketing sin sustancia técnica.
  • Nunca se adivina. Cada celda no vacía se toma de una declaración explícita en la fuente citada. Si un informe no indica la codificación, el comportamiento de propagación, los modelos confirmados o la fuente del ataque, esa celda se deja en blanco — un blanco significa "no declarado", nunca un "ninguno" inferido.
  • Verificación. Cada entrada se marca como Confirmed o Not fully vetted. "Not fully vetted" señala una entrada cuya fuente es vaga, no confirmada, o cuyo mecanismo no está claro — se muestra en lugar de descartarse, para que un revisor pueda juzgarla.
  • Clase de evidencia — en estado salvaje vs. investigación. Cada entrada se etiqueta como In-the-wild (abuso observado en el mundo real o un incidente real en producción), Research / red-team (una demostración de un investigador de seguridad o equipo rojo / divulgación responsable — una técnica real y funcional, pero no observada siendo abusada por un atacante), Vendor advisory o Unclear. Este es un eje separado de la verificación: una técnica puede estar Confirmed (verificada y funcional) y aun así haber sido demostrada únicamente en un laboratorio. Tenga en cuenta: la inyección de prompts maliciosa genuina en estado salvaje todavía se documenta raramente en público, por lo que la gran mayoría de las entradas aquí son divulgaciones de investigación / equipo rojo — en el momento del backfill inicial, 29 de 32 eran de investigación/equipo rojo y solo 3 eran en estado salvaje. Use el filtro Evidence en el panel para aislar los casos del mundo real.
  • Actualizaciones. Los nuevos informes se rastrean mensualmente (Perplexity sonar-deep-research, red amplia) y se proponen como un pull request en borrador para revisión del mantenedor. Nada se fusiona automáticamente. Consulte el rastreador hermano Threat-Actors-use-of-Artifical-Intelligence para el mismo flujo de trabajo aplicado al uso de IA por parte de actores de amenazas.
  • Cómo se construyen los datos

    Los datos viven únicamente en la tabla de abajo (este archivo es la única fuente de verdad). Un generador determinista y sin dependencias (tools/build_exports.py) los compila en cada commit en:

    • index.html — el panel interactivo (servido a través de GitHub Pages),
    • tracker.json — datos normalizados legibles por máquina,
    • stix/prompt-injection-stix2.1.json — un bundle STIX 2.1 (cada técnica como un attack-pattern, etiquetada con su ID de MITRE ATLAS y un mapeo Not fully vetted → baja confianza).

    No edite manualmente esos tres archivos; edite la tabla y deje que CI los reconstruya.


    Técnicas

    |---|---|---|---|---|---|---|---|---|---|---|---| | ASCII smuggling across LLMs (FireTail) | Calendario / invitación; Indirecto – correo electrónico | Caracteres de etiqueta Unicode (invisibles) | | Google Gemini; Grok; DeepSeek | Investigador: Viktor Markopoulos (FireTail) | Investigación / red-team | Confirmado | Caracteres de etiqueta Unicode invisibles ocultos en invitaciones de calendario y correos electrónicos ordinarios fueron interpretados por Gemini, Grok y DeepSeek pero no mostrados al usuario; se descubrió que ChatGPT, Copilot y Claude los eliminaban. Google respondió "no action". | AML.T0051.001; AML.T0068 | Oct 2025 | https://www.firetail.ai/blog/ghosts-in-the-machine-ascii-smuggling-across-various-llms | | CamoLeak (GitHub Copilot Chat) | Código / contenido de repositorio | Comentario HTML / Markdown | | GitHub Copilot Chat | Investigador: Omer Mayraz (Legit Security) | Investigación / red-team | Confirmado | CVE-2025-59145 (CVSS 9.6): una inyección de prompt invisible en un comentario HTML dentro de un pull request hizo que Copilot Chat buscara secretos en un repositorio privado y los exfiltrara carácter por carácter mediante URLs de imágenes de GitHub Camo pregeneradas por el atacante; corregido deshabilitando la renderización de imágenes. | AML.T0051.001; AML.T0068; AML.T0057 | Oct 2025 | https://www.legitsecurity.com/blog/camoleak-critical-github-copilot-vulnerability-leaks-private-source-code | | Unseeable screenshot-OCR injection | Multimodal – imagen | | | Perplexity Comet; Fellou; Opera Neon | Investigador: Artem Chaikin, Shivan Kaul Sahib (Brave) | Investigación / red-team | Confirmado | Instrucciones de inyección de prompt renderizadas como texto de bajo contraste casi invisible dentro de imágenes en la página son recuperadas por el OCR de un navegador con IA cuando procesa una captura de pantalla, de modo que un humano no ve nada mientras el agente obedece. Demostrado en múltiples navegadores agénticos. | AML.T0051.001; AML.T0068 | Oct 2025 | https://brave.com/blog/unseeable-prompt-injections/ | | ChatGPT Atlas omnibox injection | Prompt directo; Indirecto – sitio web / HTML | | | ChatGPT Atlas | Investigador: NeuralTrust | Investigación / red-team | Confirmado | Una cadena que parece una URL pero falla al analizarse como URL hace que la omnibox de Atlas trate el texto incrustado como un prompt de confianza; pegada o entregada tras un botón "Copy link", puede llevar al agente a visitar sitios del atacante o eliminar archivos de Google Drive en la sesión autenticada del usuario. | AML.T0051.000; AML.T0051.001 | Oct 2025 | https://neuraltrust.ai/blog/openai-atlas-omnibox-prompt-injection | | Invitation Is All You Need (Gemini) | Calendario / invitación; Indirecto – correo electrónico | | Persiste en la memoria del agente / proyecto; Se desplaza por la cadena de llamadas a herramientas; Entre agentes / entre sesiones | Google Gemini (web, app móvil, asistente de Android) | Investigador: Or Yair, Ben Nassi, Stav Cohen (SafeBreach / Technion) | Investigación / red-team | Confirmado | Una invitación de Google Calendar (o correo electrónico) cuyos campos contienen una inyección de prompt indirecta secuestra a Gemini cuando el usuario interactúa con su calendario; 14 ataques demostrados abarcan envenenamiento de memoria a corto/largo plazo, uso indebido de herramientas e invocación automática de agentes/apps, alcanzando apps conectadas y dispositivos de hogar inteligente. | AML.T0051.001; AML.T0053 | Ago 2025 | https://www.safebreach.com/blog/invitation-is-all-you-need-hacking-gemini/ | | MCPoison (Cursor MCP rug-pull) | Servidor MCP / conexión; Código / contenido de repositorio | | | Cursor IDE (< v1.3) | Investigador: Check Point Research | Investigación / red-team | Confirmado | CVE-2025-54136: Cursor confiaba permanentemente en una configuración MCP aprobada, por lo que un atacante que consigue que se apruebe un mcp.json benigno en un repositorio compartido puede después sustituirlo por un comando malicioso que se ejecuta silenciosamente en cada apertura posterior del proyecto. | AML.T0051.001; AML.T0053 | Ago 2025 | https://research.checkpoint.com/2025/cursor-vulnerability-mcpoison/ | | GitHub Copilot RCE / "YOLO mode" | Indirecto – sitio web / HTML; Código / contenido de repositorio; Resultado de llamada a herramienta / función | Caracteres de etiqueta Unicode (invisibles) | | GitHub Copilot (VS Code — Windows, macOS, Linux) | Investigador: Johann Rehberger (Embrace The Red) | Investigación / red-team | Confirmado | CVE-2025-53773: una instrucción inyectada hace que Copilot edite .vscode/settings.json para habilitar chat.tools.autoApprove ("YOLO mode"), eliminando las solicitudes de aprobación de comandos y permitiendo la ejecución arbitraria de código; una variante usó etiquetas Unicode invisibles. | AML.T0051.001; AML.T0053 | Ago 2025 | https://embracethered.com/blog/posts/2025/github-copilot-remote-code-execution-via-prompt-injection/ | | CurXecute (Cursor RCE via MCP) | Resultado de llamada a herramienta / función | | Se desplaza por la cadena de llamadas a herramientas | Cursor (corregido v1.3) | Investigador: Aim Labs (Aim Security) | Investigación / red-team | No verificado por completo | CVE-2025-54135: una inyección de prompt entregada a través de una fuente de datos MCP externa (p. ej. un mensaje de Slack devuelto mediante una herramienta) hace que Cursor reescriba su propio mcp.json, y la ejecución automática ejecuta el comando del atacante sin aprobación. La página principal de Aim Labs no estaba accesible en el momento de la verificación; corroborado por reportes secundarios. | AML.T0051.001; AML.T0053 | Ago 2025 | https://www.catonetworks.com/blog/curxecute-rce/ | | AgentFlayer (ChatGPT Connectors) | Indirecto – documento / archivo | | | ChatGPT (Connectors) | Investigador: Tamir Ishay Sharbat (Zenity Labs) | Investigación / red-team | Confirmado | Una carga útil invisible oculta en un documento compartido instruye a ChatGPT — mediante Connectors como Google Drive — a renderizar una imagen markdown cuyos parámetros de URL transportan datos robados; la renderización dispara la solicitud sin ningún clic. | AML.T0051.001; AML.T0057 | Ago 2025 | https://labs.zenity.io/post/agentflayer-chatgpt-connectors-0click-attack-5b41 | | Perplexity Comet Reddit injection | Indirecto – sitio web / HTML | | | Perplexity Comet | Investigador: Artem Chaikin, Shivan Kaul Sahib (Brave) | Investigación / red-team | Confirmado | Resumir una página de Reddit cuyo comentario ocultaba instrucciones tras una etiqueta spoiler hizo que el navegador Comet leyera el correo electrónico del usuario y un OTP de Gmail de sesiones autenticadas y los exfiltrara respondiendo al comentario. | AML.T0051.001; AML.T0057 | Ago 2025 | https://brave.com/blog/comet-prompt-injection/ | | Amazon Q Developer wiper prompt | Código / contenido de repositorio | | | Amazon Q Developer (extensión de VS Code) | En el mundo real: actor "lkmanka58" | En el mundo real | No verificado por completo | Un atacante fusionó un PR en la extensión Amazon Q Developer plantando un prompt que instruía al asistente a borrar archivos locales y recursos de AWS; se distribuyó en la v1.84.0 antes de su eliminación (según los reportes no se ejecutaría debido al formato). Verificado mediante reportes agregados; fuente primaria no confirmada directamente. | AML.T0051.001 | Jul 2025 | https://www.scworld.com/news/amazon-q-extension-for-vs-code-reportedly-injected-with-wiper-prompt | | EchoLeak (M365 Copilot, LLM Scope Violation) | Indirecto – correo electrónico | | | Microsoft 365 Copilot | Investigador: Aim Labs (Aim Security) | Investigación / red-team | Confirmado | CVE-2025-32711 (CVSS 9.3): un único correo electrónico manipulado hizo que el motor RAG de M365 Copilot incorporara instrucciones del atacante al contexto junto con datos privilegiados ("LLM Scope Violation") y los exfiltrara con cero interacción del usuario, eludiendo el clasificador XPIA y la redacción de enlaces/imágenes; parcheado en el servidor. | AML.T0051.001; AML.T0057 | Jun 2025 | https://www.aim.security/lp/aim-labs-echoleak-m365 | | GitHub MCP toxic agent flow | Código / contenido de repositorio; Servidor MCP / conexión | | Se desplaza por la cadena de llamadas a herramientas | Claude 4 Opus (Claude Desktop + GitHub MCP) | Investigador: Invariant Labs | Investigación / red-team | Confirmado | Una inyección de prompt plantada en un issue público de GitHub, alcanzada a través del servidor GitHub MCP, obliga al agente a incorporar datos de un repositorio privado al contexto y filtrarlos en un pull request público creado autónomamente; ningún componente falla. | AML.T0051.001; AML.T0057; AML.T0053 | May 2025 | https://invariantlabs.ai/blog/mcp-github-vulnerability | | Character-injection guardrail evasion | Prompt directo | Caracteres de ancho cero; Homoglifos; Contrabando con emoji / selectores de variación; Multicapa | | Azure Prompt Shield; Meta Prompt Guard; ProtectAI Prompt Injection v1/v2; NVIDIA NeMo Guard; Vijil | Investigador: Mindgard / Lancaster University (Hackett et al.) | Investigación / red-team | Confirmado | Estudio sistemático: caracteres de ancho cero no imprimibles, sustitución por homoglifos y contrabando con selectores de variación de emoji eluden clasificadores comerciales de protección contra inyección de prompt/jailbreak (los objetivos confirmados son los sistemas de detección, no los LLM); los de ancho cero promediaron 44–76% de evasión, el contrabando con emoji fue el más alto. | AML.T0068; AML.T0051 | Abr 2025 | https://arxiv.org/html/2504.11168v1 | | MCP tool poisoning | Servidor MCP / conexión | | Se desplaza por la cadena de llamadas a herramientas | Cursor | Investigador: Invariant Labs | Investigación / red-team | Confirmado | Instrucciones maliciosas incrustadas en la descripción de una herramienta MCP son invisibles para el usuario pero leídas por el modelo; una herramienta "add" envenenada hizo que Cursor leyera y exfiltrara silenciosamente la clave SSH del desarrollador mientras devolvía un resultado correcto. Anthropic, OpenAI y Zapier nombrados como clientes afectados. | AML.T0051.001; AML.T0053 | Abr 2025 | https://invariantlabs.ai/blog/mcp-security-notification-tool-poisoning-attacks | | MCP line jumping | Servidor MCP / conexión | | | Claude Desktop | Red team: Trail of Bits | Investigación / red-team | Confirmado | Debido a que los clientes MCP cargan cada descripción de herramienta en el contexto del modelo en cuanto se lista un servidor, una descripción maliciosa puede alterar el comportamiento del modelo antes de que se invoque ninguna herramienta, eludiendo el paso de aprobación de llamadas a herramientas del usuario. | AML.T0051.001; AML.T0053 | Abr 2025 | https://blog.trailofbits.com/2025/04/21/jumping-the-line-how-mcp-servers-can-attack-you-before-you-ever-use-them/ | | MCP rug pull | Servidor MCP / conexión | | | | Investigador: Invariant Labs | Investigación / red-team | Confirmado | Un servidor MCP malicioso presenta una herramienta benigna para obtener aprobación y luego la sustituye silenciosamente por instrucciones envenenadas; los clientes no vuelven a solicitar aprobación porque la identidad de la herramienta no ha cambiado. | AML.T0051.001; AML.T0053 | Abr 2025 | https://invariantlabs.ai/blog/mcp-security-notification-tool-poisoning-attacks | | Rules File Backdoor (Cursor / Copilot) | Código / contenido de repositorio | Caracteres de ancho cero; Caracteres de etiqueta Unicode (invisibles) | Se propaga mediante archivos de configuración / reglas compartidos | Cursor; GitHub Copilot | Investigador: Ziv Karliner (Pillar Security) | Investigación / red-team | Confirmado | Instrucciones en Unicode invisible ocultas en archivos de "reglas"/configuración de codificación con IA dirigen silenciosamente a Cursor y GitHub Copilot a insertar puertas traseras en el código generado, sin mostrar nada en el chat ni en los registros; los caracteres ocultos son invisibles incluso en la vista de revisión de PR de GitHub. | AML.T0051.001; AML.T0068 | Mar 2025 | https://www.pillar.security/blog/new-vulnerability-in-github-copilot-and-cursor-how-hackers-can-weaponize-code-agents | | Gemini memory persistence (delayed tool invocation) | Indirecto – documento / archivo | | Persiste en la memoria del agente / proyecto; Entre agentes / entre sesiones | Gemini Advanced | Investigador: Johann Rehberger (Embrace The Red) | Investigación / red-team | Confirmado | Un documento malicioso subido envenena el chat de modo que cuando el usuario dice después una palabra clave, Gemini invoca su herramienta de memoria "en nombre del usuario" ("delayed tool invocation") y escribe recuerdos falsos a largo plazo elegidos por el atacante que persisten en sesiones futuras. | AML.T0051.001; AML.T0053 | Feb 2025 | https://embracethered.com/blog/posts/2025/gemini-memory-persistence-prompt-injection/ | | ZombAIs (Claude Computer Use C2) | Indirecto – sitio web / HTML | | | Claude Computer Use | Investigador: Johann Rehberger (Embrace The Red) | Investigación / red-team | Confirmado | Una página web maliciosa inyecta instrucciones que hacen que Claude Computer Use descargue y ejecute un binario que se conecta de vuelta al servidor del investigador — una cadena completa de inyección de prompt a comando y control en un agente que usa computadoras. | AML.T0051.001; AML.T0053 | Oct 2024 | https://embracethered.com/blog/posts/2024/claude-computer-use-c2-the-zombais-are-coming/ | | SpAIware (ChatGPT memory) | Indirecto – sitio web / HTML; Indirecto – documento / archivo | | Persiste en la memoria del agente / proyecto; Entre agentes / entre sesiones | ChatGPT (app de macOS) | Investigador: Johann Rehberger (Embrace The Red) | Investigación / red-team | Confirmado | Una inyección de prompt desde contenido web/documento no confiable escribe una instrucción persistente en la memoria a largo plazo de ChatGPT, provocando la exfiltración continua (mediante URLs de imágenes renderizadas) de todo lo que el usuario escribe o recibe en todas las sesiones futuras hasta que se elimina la memoria. | AML.T0051.001; AML.T0057 | Sep 2024 | https://embracethered.com/blog/posts/2024/chatgpt-macos-app-persistent-data-exfiltration/ | | M365 Copilot ASCII smuggling exfiltration | Indirecto – correo electrónico; Indirecto – documento / archivo | Caracteres de etiqueta Unicode (invisibles) | Se desplaza por la cadena de llamadas a herramientas | Microsoft 365 Copilot | Investigador: Johann Rehberger (Embrace The Red) | Investigación / red-team | Confirmado | Una inyección de prompt oculta en un correo electrónico malicioso o documento compartido hizo que M365 Copilot buscara automáticamente en otros correos/documentos, y luego usó ASCII smuggling (etiquetas Unicode invisibles) para incrustar datos recolectados (p. ej. códigos MFA) en hipervínculos clicables renderizados al usuario; parcheado ~Jul 2024. | AML.T0051.001; AML.T0068; AML.T0057; AML.T0053 | Ago 2024 | https://embracethered.com/blog/posts/2024/m365-copilot-prompt-injection-tool-invocation-and-data-exfil-using-ascii-smuggling/ | | Slack AI indirect injection exfiltration | Indirecto – RAG / contenido recuperado | | Envenena el almacén de datos compartido / RAG | Slack AI | Red team: PromptArmor | Investigación / red-team | Confirmado | Un atacante planta instrucciones en un canal público de Slack; Slack AI las ingiere en su pipeline RAG, y cuando una víctima consulta después, la instrucción inyectada renderiza un enlace markdown que contrabandea datos de canales privados (p. ej. una clave API) en la URL hacia el atacante. | AML.T0051.001; AML.T0057 | Ago 2024 | https://www.promptarmor.com/resources/data-exfiltration-from-slack-ai-via-indirect-prompt-injection | | GitHub Copilot Chat data exfiltration | Código / contenido de repositorio | | | GitHub Copilot Chat (GPT-4) | Investigador: Johann Rehberger (Embrace The Red) | Investigación / red-team | Confirmado | Instrucciones manipuladas en un archivo de código fuente hicieron que GitHub Copilot Chat emitiera una imagen markdown cuya URL transportaba datos de la conversación previa; al renderizarse automáticamente, los datos fueron exfiltrados al atacante. | AML.T0051.001; AML.T0057 | Jun 2024 | https://embracethered.com/blog/posts/2024/github-copilot-chat-prompt-injection-data-exfiltration/ | | Morris II (self-replicating GenAI worm) | Indirecto – RAG / contenido recuperado; Indirecto – correo electrónico; Multimodal – imagen | | Autopropagación / gusano (IA a IA); Envenena el almacén de datos compartido / RAG; Emite correo electrónico / mensaje saliente con más instrucciones; Entre agentes / entre sesiones | Gemini Pro; ChatGPT 4.0; LLaVA | Investigador: Stav Cohen (Technion), Ron Bitton (Intuit), Ben Nassi (Cornell Tech) | Investigación / red-team | Confirmado | Un "prompt adversario autorreplicante" hace que un asistente de correo electrónico GenAI basado en RAG copie el prompt en su propia salida y lo entregue a más agentes, desencadenando una cascada tipo gusano de inyecciones de prompt indirectas que envía spam y exfiltra datos. Demostrado con cargas útiles de texto e imagen. | AML.T0051.001 | Mar 2024 | https://arxiv.org/abs/2403.02817 | | Hidden prompt injection against Claude (Unicode tags) | Prompt directo | Caracteres de etiqueta Unicode (invisibles) | | Anthropic Claude | Investigador: Johann Rehberger (Embrace The Red) | Investigación / red-team | Confirmado | Claude interpretó puntos de código de etiqueta Unicode invisibles pegados en su interfaz — el mismo comportamiento de instrucciones ocultas mostrado contra ChatGPT. Anthropic lo revisó y lo marcó como "Not Applicable" (sin impacto de seguridad identificado), pero el comportamiento de interpretación fue demostrado. | AML.T0051.000; AML.T0068 | Feb 2024 | https://embracethered.com/blog/posts/2024/claude-hidden-prompt-injection-ascii-smuggling/ | | ASCII smuggling / invisible Unicode tags (foundational) | Indirecto – sitio web / HTML; Indirecto – documento / archivo; Prompt directo | Caracteres de etiqueta Unicode (invisibles) | | ChatGPT (GPT-4 / DALL·E) | Investigador: Johann Rehberger (Embrace The Red) | Investigación / red-team | Confirmado | Artículo fundacional y herramienta "ASCII Smuggler": los puntos de código del bloque Unicode Tags (rango U+E0000) reflejan ASCII pero se renderizan de forma invisible, mientras que los LLM aún los interpretan; instrucciones ocultas hicieron que ChatGPT invocara DALL·E. Base de toda la clase de inyección invisible. | AML.T0051; AML.T0068 | Ene 2024 | https://embracethered.com/blog/posts/2024/hiding-and-finding-text-with-unicode-tags/ | | DPD support chatbot override | Prompt directo | | | | En el mundo real: Ashley Beauchamp | En el mundo real | Confirmado | Un cliente instruyó al chatbot de soporte de DPD a ignorar sus reglas, haciéndolo insultar y escribir un poema menospreciando a DPD — anulación directa de instrucciones; DPD deshabilitó el bot ese mismo día. El modelo subyacente no fue divulgado. (Manipulación por parte del usuario del bot con el que estaba chateando; sin víctima tercera ni exfiltración.) | AML.T0051.000; AML.T0054 | Ene 2024 | https://www.theregister.com/2024/01/23/dpd_chatbot_goes_rogue | | Chevrolet dealership chatbot override ("$1 Tahoe") | Prompt directo | | | Asistente de concesionario basado en ChatGPT | En el mundo real: Chris Bakke | En el mundo real | Confirmado | Un usuario inyectó instrucciones haciendo que el asistente web basado en ChatGPT de un concesionario Chevrolet "aceptara" vender un Tahoe 2024 por $1 y lo declarara legalmente vinculante — anulación directa de instrucciones clásica (no vinculante en la realidad; impulsado por el usuario, sin víctima tercera). | AML.T0051.000 | Dic 2023 | https://the-decoder.com/people-buy-brand-new-chevrolets-for-1-from-a-chatgpt-chatbot/ | | Google Bard markdown-image exfiltration | Indirecto – documento / archivo; Indirecto – correo electrónico | | | Google Bard | Investigador: Johann Rehberger (Embrace The Red) | Investigación / red-team | Confirmado | Una inyección de prompt indirecta en un Google Doc compartido hizo que Bard emitiera una imagen markdown cuya URL incrustaba los datos del chat del usuario; el cliente cargó automáticamente la imagen, exfiltrando datos sin interacción del usuario. Uno de los primeros casos de exfiltración de LLM sin clic; corregido en Oct 2023. | AML.T0051.001; AML.T0057 | Nov 2023 | https://embracethered.com/blog/posts/2023/google-bard-data-exfiltration/ | | Multimodal image prompt injection (GPT-4V) | Multimodal – imagen | | | GPT-4V | Investigador: Riley Goodside (vía Simon Willison) | Investigación / red-team | Confirmado | Una imagen que parece en blanco lleva instrucciones en texto casi blanco sobre fondo blanco; el OCR de GPT-4V las lee y las sigue (la demo de Goodside hizo que el modelo suprimiera su descripción y anunciara una oferta falsa). Inyección de prompt multimodal temprana. | AML.T0051.001 | Oct 2023 | https://simonwillison.net/2023/Oct/14/multi-modal-prompt-injection/ | | Base64 encoded-prompt jailbreak | Prompt directo | Base64; Multicapa | | GPT-4; Claude v1.3; GPT-3.5 Turbo | Investigador: Wei, Haghtalab, Steinhardt (UC Berkeley) | Investigación / red-team | Confirmado | Codificar una solicitud prohibida en Base64 explota la "mismatched generalization" — los modelos aprenden a decodificar Base64 en el preentrenamiento pero el entrenamiento de seguridad nunca cubrió tales entradas — eludiendo las protecciones; los ataques combinados alcanzaron ~94% de éxito en GPT-4. Publicado en Jul 2023, justo antes de la ventana de 2 años; fuente primaria canónica para jailbreaks con carga útil codificada. | AML.T0054; AML.T0068; AML.T0051.000 | Jul 2023 | https://arxiv.org/abs/2307.02483 |


    Apéndice A — Métodos de entrega (vocabulario controlado)

    Cómo llegan las instrucciones inyectadas al modelo. Extensible; añade un nuevo término aquí cuando un reporte describa un vector genuinamente nuevo.- Prompt directo — texto controlado por el atacante introducido directamente en la entrada del modelo.

    • Indirecto – sitio web / HTML — instrucciones incrustadas en una página web que el modelo navega o resume.
    • Indirecto – documento / archivo — payload dentro de un PDF, DOCX, hoja de cálculo u otro archivo que el modelo ingiere.
    • Indirecto – correo electrónico — instrucciones dentro de un correo electrónico que un agente lee o clasifica.
    • Indirecto – RAG / contenido recuperado — payload plantado en una base de conocimiento, almacén vectorial o resultado de búsqueda que el modelo recupera.
    • Llamada a herramienta / resultado de función — instrucciones devueltas en la salida de una herramienta/función que el agente invoca.
    • Servidor MCP / conexión — payload servido por un servidor Model Context Protocol o descripción de herramienta.
    • Multimodal – imagen — instrucciones en una imagen (texto visible, texto de bajo contraste o payload en píxeles/metadatos).
    • Multimodal – audio — instrucciones transportadas en una entrada de audio.
    • Código / contenido de repositorio — payload en código fuente, comentarios, issues o registros de CI que un agente lee.
    • Calendario / invitación — instrucciones dentro de un evento de calendario, invitación o nota de reunión.

    Apéndice B — Codificaciones (vocabulario controlado)

    Ofuscación aplicada al payload. En blanco en la tabla significa que el payload era texto plano o que el informe no lo especificó.

    • Base64
    • Hex
    • ROT13
    • Leetspeak
    • Caracteres de etiqueta Unicode (invisibles) — glifos "tag" del rango U+E0000 que se renderizan de forma invisible.
    • Caracteres de ancho cero — espacio/unión de ancho cero usado para ocultar o dividir texto.
    • Homoglifos — sustitutos Unicode de aspecto similar para letras ASCII.
    • Contrabando con emoji / selectores de variación
    • Comentario HTML / Markdown — payload oculto en comentarios o marcado no renderizado.
    • Metadatos / EXIF — instrucciones en metadatos de archivo o imagen.
    • Multicapa — más de uno de los anteriores, apilados.

    Apéndice C — Comportamientos de propagación (vocabulario controlado)

    Si la inyección está diseñada para propagarse o persistir. En blanco en la tabla significa que no se reportó ningún comportamiento de propagación.

    • Autopropagación / gusano (IA a IA) — la salida está diseñada para convertirse en la entrada inyectada del siguiente sistema.
    • Persiste en la memoria del agente / proyecto — se escribe en la memoria a largo plazo o del proyecto para que se reactive en sesiones posteriores.
    • Se propaga vía MCP a conectores — un servidor MCP envenenado entrega el payload a cada cliente que se conecta.
    • Se desplaza por la cadena de llamadas a herramientas — se transporta a lo largo de una secuencia de llamadas a herramientas dentro de una ejecución de agente.
    • Emite correo electrónico / mensaje saliente con más instrucciones — provoca que el agente envíe un mensaje que a su vez porta la inyección.
    • Envenena el almacén de datos compartido / RAG — planta el payload donde las recuperaciones de otros usuarios o agentes lo recogerán.
    • Se propaga vía archivos de configuración / reglas compartidos — reglas/configuración maliciosas de agente se propagan a través de repositorios de reglas compartidos o centrales hacia proyectos derivados (CRÉDITO: Rachel James, basado en el informe "Rules File Backdoor" de Pillar Security).
    • Entre agentes / entre sesiones — alcanza a otros agentes o sesiones posteriores más allá del contexto inicial.

    Apéndice D — Cruce con MITRE ATLAS

    Las técnicas se etiquetan con IDs de técnicas de MITRE ATLAS cuando corresponde. Los IDs se validan en cada actualización contra la fuente canónica de MITRE mitre-atlas/atlas-data (los datos que generan la matriz en vivo; el sitio atlas.mitre.org es una app JS que bloquea la obtención automatizada). Los comportamientos sin una asignación limpia en ATLAS se anotan con una etiqueta acuñada (CRÉDITO: Rachel James, basado en el informe citado). IDs usados en este tracker:

    • AML.T0051 LLM Prompt Injection — AML.T0051.000 Direct, AML.T0051.001 Indirect
    • AML.T0053 AI Agent Tool Invocation (reemplaza el título retirado "LLM Plugin Compromise")
    • AML.T0054 LLM Jailbreak
    • AML.T0057 LLM Data Leakage
    • AML.T0068 LLM Prompt Obfuscation

    Contribuciones bienvenidas — consulta CONTRIBUTING.md, o envía una técnica directamente. Cada fila propuesta debe citar una fuente explícita para cada campo no vacío; las entradas poco claras se marcan como "Not fully vetted" en lugar de descartarse.

    Descargar herramienta