Skip to content
KitploitKITPLOIT
FerramentasExploitsBlog
Log in
Enviar
FerramentasExploitsBlog
Enviar

Ferramentas de Hacking, PenTest e Cibersegurança para o seu Arsenal de Segurança!

Kitploit é um diretório de ferramentas de hacking, cibersegurança e pentesting. Descubra as últimas atualizações de projetos para encontrar vulnerabilidades, analisar sistemas, automatizar testes e fortalecer sua segurança.

··Feeds·Contato·Privacidade·© 2026 Kitploit

Diretório de Ferramentas

Categorias

Ver todas as categorias
Loading categories
Prompt-Injection-in-the-Wild — Rastreador de técnicas de prompt injection reportadas publicamente, divididas por método de entrega, codificação e comportamento de propagação, com modelos confirmados, fontes e tags MITRE ATLAS. | Kitploit
Ferramentas/GitHubGitHub/cybershujin/prompt-injection-in-the-wild
Gerenciamento de Indicadores de Comprometimento (IOC)Feeds e Agregadores de AmeaçasAnálise de VulnerabilidadesInteligência de AmeaçasPapers e PesquisaAprendizado e EducaçãoRecursos CuradosSegurança de IA

Mais Populares

Ver todos →

Descubra as ferramentas mais usadas pela nossa comunidade.

Explore todas as ferramentas

Navegue pela nossa coleção de ferramentas

Ver todas as ferramentas →
Ataque Adversário
GitHubcybershujin/prompt-injection-in-the-wild

Prompt-Injection-in-the-Wild

Rastreador de técnicas de prompt injection reportadas publicamente, divididas por método de entrega, codificação e comportamento de propagação, com modelos confirmados, fontes e tags MITRE ATLAS.

Ver Repositório
220há 12 diasAinda não revisado
Compartilhar

Prompt Injection in the Wild

Um rastreador de técnicas de prompt injection reportadas publicamente dos últimos dois anos, aproximadamente, mantido por Rachel James (cybershujin).

Cada técnica é dividida nos três elementos de um prompt injection:

  1. Método de entrega — como as instruções injetadas chegam ao modelo (o resultado de uma chamada de ferramenta, um site externo, uma conexão MCP, um documento, um e-mail, uma imagem, etc.).
  2. Codificação — a ofuscação aplicada ao payload, se houver (Base64, leetspeak, caracteres de tag Unicode invisíveis, homoglifos, …). Em branco quando o payload é texto simples ou o relatório não informa.
  3. Comportamento de propagação — se a injeção foi projetada para se espalhar ou persistir (entregue a qualquer pessoa que se conecte a um servidor MCP envenenado, persistida na memória de longo prazo/projeto de um agente, transportada ao longo de uma cadeia de chamadas de ferramentas, feita para emitir um e-mail carregando instruções adicionais, …). Em branco quando não há propagação.

Cada entrada também registra os modelos contra os quais foi confirmada como funcional (se houver), um link para a fonte do relatório e — quando conhecida — a origem do ataque (o pesquisador, red team ou ator em atividade real de onde se originou).

Dashboard ao vivo: https://cybershujin.github.io/Prompt-Injection-in-the-Wild/


Escopo e metodologia

  • No escopo: técnicas para injetar instruções adversariais em um LLM ou agente baseado em LLM que tenham sido reportadas publicamente — por pesquisadores de segurança, red teams, fornecedores, ou conforme observado em atividade real. Tanto prompt injection direto quanto indireto (transportado por dados) estão incluídos.
| Técnica | Método de entrega | Codificação | Propagação | Modelos confirmados | Fonte do ataque | Evidência | Verificação | Resumo | ATLAS | Reportado | Link |
  • Fora do escopo: wordlists genéricas de jailbreak sem mecanismo de entrega/propagação, reclamações puras sobre alinhamento de modelo e marketing sem substância técnica.
  • Nunca adivinhado. Toda célula não vazia é retirada de uma declaração explícita na fonte citada. Se um relatório não declara a codificação, o comportamento de propagação, os modelos confirmados ou a origem do ataque, essa célula é deixada em branco — um espaço em branco significa "não declarado", nunca um "nenhum" inferido.
  • Verificação. Cada entrada é marcada como Confirmed ou Not fully vetted. "Not fully vetted" sinaliza uma entrada cuja fonte é vaga, não confirmada, ou cujo mecanismo é pouco claro — ela é exposta em vez de descartada, para que um revisor possa julgá-la.
  • Classe de evidência — in-the-wild vs. pesquisa. Cada entrada é marcada como In-the-wild (abuso real observado ou um incidente real em produção), Research / red-team (uma demonstração de pesquisador de segurança ou red team / divulgação responsável — uma técnica real e funcional, mas não observada sendo abusada por um atacante), Vendor advisory ou Unclear. Este é um eixo separado da verificação: uma técnica pode ser Confirmed (verificada e funcional) e ainda assim ter sido demonstrada apenas em laboratório. Esteja ciente: prompt injection malicioso genuinamente in-the-wild ainda é raramente documentado publicamente, então a grande maioria das entradas aqui são divulgações de pesquisa / red-team — no momento do preenchimento inicial, 29 de 32 eram pesquisa/red-team e apenas 3 eram in-the-wild. Use o filtro Evidence no dashboard para isolar os casos do mundo real.
  • Atualizações. Novos relatos são varridos mensalmente (Perplexity sonar-deep-research, rede ampla) e propostos como um pull request de rascunho para revisão do mantenedor. Nada é mesclado automaticamente. Veja o rastreador irmão Threat-Actors-use-of-Artifical-Intelligence para o mesmo fluxo de trabalho aplicado ao uso de IA por atores de ameaça.
  • Como os dados são construídos

    Os dados residem apenas na tabela abaixo (este arquivo é a única fonte de verdade). Um gerador determinístico e sem dependências (tools/build_exports.py) os compila a cada commit em:

    • index.html — o dashboard interativo (servido via GitHub Pages),
    • tracker.json — dados normalizados legíveis por máquina,
    • stix/prompt-injection-stix2.1.json — um bundle STIX 2.1 (cada técnica como um attack-pattern, marcada com seu ID MITRE ATLAS e um mapeamento Not fully vetted → baixa confiança).

    Não edite manualmente esses três arquivos; edite a tabela e deixe o CI reconstruí-los.


    Técnicas

    |---|---|---|---|---|---|---|---|---|---|---|---| | Contrabando de ASCII entre LLMs (FireTail) | Calendário / convite; Indireto – e-mail | Caracteres de tag Unicode (invisíveis) | | Google Gemini; Grok; DeepSeek | Pesquisador: Viktor Markopoulos (FireTail) | Pesquisa / red-team | Confirmado | Caracteres de tag Unicode invisíveis escondidos em convites de calendário e e-mails comuns foram interpretados pelo Gemini, Grok e DeepSeek, mas não exibidos ao usuário; ChatGPT, Copilot e Claude foram identificados como capazes de removê-los. O Google respondeu "nenhuma ação". | AML.T0051.001; AML.T0068 | Out 2025 | https://www.firetail.ai/blog/ghosts-in-the-machine-ascii-smuggling-across-various-llms | | CamoLeak (GitHub Copilot Chat) | Código / conteúdo de repositório | Comentário HTML / Markdown | | GitHub Copilot Chat | Pesquisador: Omer Mayraz (Legit Security) | Pesquisa / red-team | Confirmado | CVE-2025-59145 (CVSS 9.6): injeção de prompt invisível em comentário HTML em um pull request fez o Copilot Chat buscar segredos em um repositório privado e exfiltrá-los caractere por caractere por meio de URLs de imagem GitHub Camo pré-geradas pelo atacante; corrigido ao desabilitar a renderização de imagens. | AML.T0051.001; AML.T0068; AML.T0057 | Out 2025 | https://www.legitsecurity.com/blog/camoleak-critical-github-copilot-vulnerability-leaks-private-source-code | | Injeção de OCR em captura de tela invisível | Multimodal – imagem | | | Perplexity Comet; Fellou; Opera Neon | Pesquisador: Artem Chaikin, Shivan Kaul Sahib (Brave) | Pesquisa / red-team | Confirmado | Instruções de injeção de prompt renderizadas como texto de baixo contraste quase invisível dentro de imagens na página são recuperadas pelo OCR de um navegador de IA quando ele processa uma captura de tela, de modo que um humano não vê nada enquanto o agente obedece. Demonstrado em vários navegadores agênticos. | AML.T0051.001; AML.T0068 | Out 2025 | https://brave.com/blog/unseeable-prompt-injections/ | | Injeção na omnibox do ChatGPT Atlas | Prompt direto; Indireto – site / HTML | | | ChatGPT Atlas | Pesquisador: NeuralTrust | Pesquisa / red-team | Confirmado | Uma string que parece uma URL, mas falha no parsing de URL, faz a omnibox do Atlas tratar o texto incorporado como um prompt confiável; colada ou entregue por trás de um botão "Copiar link", ela pode levar o agente a visitar sites do atacante ou excluir arquivos do Google Drive na sessão autenticada do usuário. | AML.T0051.000; AML.T0051.001 | Out 2025 | https://neuraltrust.ai/blog/openai-atlas-omnibox-prompt-injection | | Invitation Is All You Need (Gemini) | Calendário / convite; Indireto – e-mail | | Persiste na memória do agente / projeto; Move-se pela cadeia de chamadas de ferramentas; Cross-agent / cross-session | Google Gemini (web, aplicativo móvel, assistente Android) | Pesquisador: Or Yair, Ben Nassi, Stav Cohen (SafeBreach / Technion) | Pesquisa / red-team | Confirmado | Um convite do Google Calendar (ou e-mail) cujos campos carregam uma injeção de prompt indireta sequestra o Gemini quando o usuário interage com seu calendário; 14 ataques demonstrados abrangem envenenamento de memória de curto/longo prazo, uso indevido de ferramentas e invocação automática de agente/app, alcançando aplicativos conectados e dispositivos de casa inteligente. | AML.T0051.001; AML.T0053 | Ago 2025 | https://www.safebreach.com/blog/invitation-is-all-you-need-hacking-gemini/ | | MCPoison (rug-pull do MCP do Cursor) | Servidor MCP / conexão; Código / conteúdo de repositório | | | Cursor IDE (< v1.3) | Pesquisador: Check Point Research | Pesquisa / red-team | Confirmado | CVE-2025-54136: o Cursor confiava permanentemente em uma configuração MCP aprovada, então um atacante que consegue aprovação de um mcp.json benigno em um repositório compartilhado pode depois substituí-lo por um comando malicioso que executa silenciosamente a cada abertura subsequente do projeto. | AML.T0051.001; AML.T0053 | Ago 2025 | https://research.checkpoint.com/2025/cursor-vulnerability-mcpoison/ | | RCE do GitHub Copilot / "modo YOLO" | Indireto – site / HTML; Código / conteúdo de repositório; Resultado de chamada de ferramenta / função | Caracteres de tag Unicode (invisíveis) | | GitHub Copilot (VS Code — Windows, macOS, Linux) | Pesquisador: Johann Rehberger (Embrace The Red) | Pesquisa / red-team | Confirmado | CVE-2025-53773: uma instrução injetada faz o Copilot editar .vscode/settings.json para habilitar chat.tools.autoApprove ("modo YOLO"), removendo os prompts de aprovação de comando e permitindo execução arbitrária de código; uma variante usou tags Unicode invisíveis. | AML.T0051.001; AML.T0053 | Ago 2025 | https://embracethered.com/blog/posts/2025/github-copilot-remote-code-execution-via-prompt-injection/ | | CurXecute (RCE do Cursor via MCP) | Resultado de chamada de ferramenta / função | | Move-se pela cadeia de chamadas de ferramentas | Cursor (corrigido v1.3) | Pesquisador: Aim Labs (Aim Security) | Pesquisa / red-team | Não totalmente verificado | CVE-2025-54135: uma injeção de prompt entregue por meio de uma fonte de dados MCP externa (por exemplo, uma mensagem do Slack retornada por uma ferramenta) faz o Cursor reescrever seu próprio mcp.json, e a execução automática executa o comando do atacante sem aprovação. A página principal do Aim Labs estava inacessível no momento da verificação; corroborado por reportagens secundárias. | AML.T0051.001; AML.T0053 | Ago 2025 | https://www.catonetworks.com/blog/curxecute-rce/ | | AgentFlayer (ChatGPT Connectors) | Indireto – documento / arquivo | | | ChatGPT (Connectors) | Pesquisador: Tamir Ishay Sharbat (Zenity Labs) | Pesquisa / red-team | Confirmado | Um payload invisível escondido em um documento compartilhado instrui o ChatGPT — por meio de Connectors como o Google Drive — a renderizar uma imagem markdown cujos parâmetros de URL carregam dados roubados; a renderização dispara a requisição sem nenhum clique. | AML.T0051.001; AML.T0057 | Ago 2025 | https://labs.zenity.io/post/agentflayer-chatgpt-connectors-0click-attack-5b41 | | Injeção no Reddit do Perplexity Comet | Indireto – site / HTML | | | Perplexity Comet | Pesquisador: Artem Chaikin, Shivan Kaul Sahib (Brave) | Pesquisa / red-team | Confirmado | Resumir uma página do Reddit cujo comentário escondia instruções atrás de uma tag spoiler fez o navegador Comet ler o e-mail do usuário e um OTP do Gmail de sessões autenticadas e exfiltrá-los respondendo ao comentário. | AML.T0051.001; AML.T0057 | Ago 2025 | https://brave.com/blog/comet-prompt-injection/ | | Prompt de apagador do Amazon Q Developer | Código / conteúdo de repositório | | | Amazon Q Developer (extensão do VS Code) | In-the-wild: ator "lkmanka58" | In-the-wild | Não totalmente verificado | Um atacante fez merge de um PR na extensão Amazon Q Developer plantando um prompt que instruía o assistente a apagar arquivos locais e recursos da AWS; foi distribuído na v1.84.0 antes da remoção (relatado que não seria executado devido à formatação). Verificado por meio de reportagens agregadas; fonte primária não confirmada diretamente. | AML.T0051.001 | Jul 2025 | https://www.scworld.com/news/amazon-q-extension-for-vs-code-reportedly-injected-with-wiper-prompt | | EchoLeak (M365 Copilot, violação de escopo do LLM) | Indireto – e-mail | | | Microsoft 365 Copilot | Pesquisador: Aim Labs (Aim Security) | Pesquisa / red-team | Confirmado | CVE-2025-32711 (CVSS 9.3): um único e-mail elaborado fez o motor RAG do M365 Copilot puxar instruções do atacante para o contexto junto com dados privilegiados ("violação de escopo do LLM") e exfiltrá-los sem nenhuma interação do usuário, contornando o classificador XPIA e a redação de links/imagens; corrigido no lado do servidor. | AML.T0051.001; AML.T0057 | Jun 2025 | https://www.aim.security/lp/aim-labs-echoleak-m365 | | Fluxo de agente tóxico do GitHub MCP | Código / conteúdo de repositório; Servidor MCP / conexão | | Move-se pela cadeia de chamadas de ferramentas | Claude 4 Opus (Claude Desktop + GitHub MCP) | Pesquisador: Invariant Labs | Pesquisa / red-team | Confirmado | Uma injeção de prompt plantada em uma issue pública do GitHub, alcançada por meio do servidor GitHub MCP, força o agente a puxar dados de repositório privado para o contexto e vazá-los em um pull request público criado autonomamente; nenhum componente apresenta mau funcionamento. | AML.T0051.001; AML.T0057; AML.T0053 | Mai 2025 | https://invariantlabs.ai/blog/mcp-github-vulnerability | | Evasão de guardrail por injeção de caracteres | Prompt direto | Caracteres de largura zero; Homoglifos; Contrabando de emoji / seletores de variação; Multicamada | | Azure Prompt Shield; Meta Prompt Guard; ProtectAI Prompt Injection v1/v2; NVIDIA NeMo Guard; Vijil | Pesquisador: Mindgard / Lancaster University (Hackett et al.) | Pesquisa / red-team | Confirmado | Estudo sistemático: caracteres de largura zero não imprimíveis, substituição por homoglifos e contrabando de seletores de variação de emoji evadem classificadores comerciais de guardrail de injeção de prompt/jailbreak (os alvos confirmados são os sistemas de detecção, não os LLMs); largura zero teve média de 44–76% de evasão, contrabando de emoji foi o mais alto. | AML.T0068; AML.T0051 | Abr 2025 | https://arxiv.org/html/2504.11168v1 | | Envenenamento de ferramenta MCP | Servidor MCP / conexão | | Move-se pela cadeia de chamadas de ferramentas | Cursor | Pesquisador: Invariant Labs | Pesquisa / red-team | Confirmado | Instruções maliciosas incorporadas na descrição de uma ferramenta MCP são invisíveis ao usuário, mas lidas pelo modelo; uma ferramenta "add" envenenada fez o Cursor ler e exfiltrar silenciosamente a chave SSH do desenvolvedor enquanto retornava um resultado correto. Anthropic, OpenAI e Zapier foram nomeados como clientes afetados. | AML.T0051.001; AML.T0053 | Abr 2025 | https://invariantlabs.ai/blog/mcp-security-notification-tool-poisoning-attacks | | Salto de linha MCP | Servidor MCP / conexão | | | Claude Desktop | Red team: Trail of Bits | Pesquisa / red-team | Confirmado | Como os clientes MCP carregam todas as descrições de ferramentas no contexto do modelo assim que um servidor é listado, uma descrição maliciosa pode alterar o comportamento do modelo antes que qualquer ferramenta seja invocada, contornando a etapa de aprovação de chamada de ferramenta do usuário. | AML.T0051.001; AML.T0053 | Abr 2025 | https://blog.trailofbits.com/2025/04/21/jumping-the-line-how-mcp-servers-can-attack-you-before-you-ever-use-them/ | | Rug pull MCP | Servidor MCP / conexão | | | | Pesquisador: Invariant Labs | Pesquisa / red-team | Confirmado | Um servidor MCP malicioso apresenta uma ferramenta benigna para obter aprovação e depois substitui silenciosamente por instruções envenenadas; os clientes não solicitam novamente porque a identidade da ferramenta permanece inalterada. | AML.T0051.001; AML.T0053 | Abr 2025 | https://invariantlabs.ai/blog/mcp-security-notification-tool-poisoning-attacks | | Backdoor em arquivo de regras (Cursor / Copilot) | Código / conteúdo de repositório | Caracteres de largura zero; Caracteres de tag Unicode (invisíveis) | Espalha-se via arquivos de configuração / regras compartilhados | Cursor; GitHub Copilot | Pesquisador: Ziv Karliner (Pillar Security) | Pesquisa / red-team | Confirmado | Instruções em Unicode invisível escondidas em arquivos de "regras"/configuração de codificação com IA direcionam silenciosamente o Cursor e o GitHub Copilot a inserir backdoors no código gerado, sem nada exibido no chat ou nos logs; os caracteres ocultos são invisíveis até na visualização de revisão de PR do GitHub. | AML.T0051.001; AML.T0068 | Mar 2025 | https://www.pillar.security/blog/new-vulnerability-in-github-copilot-and-cursor-how-hackers-can-weaponize-code-agents | | Persistência de memória do Gemini (invocação de ferramenta atrasada) | Indireto – documento / arquivo | | Persiste na memória do agente / projeto; Cross-agent / cross-session | Gemini Advanced | Pesquisador: Johann Rehberger (Embrace The Red) | Pesquisa / red-team | Confirmado | Um documento malicioso enviado envenena o chat de modo que, quando o usuário posteriormente diz uma palavra-gatilho, o Gemini invoca sua ferramenta de memória "em nome do usuário" ("invocação de ferramenta atrasada") e grava memórias falsas de longo prazo escolhidas pelo atacante que persistem em sessões futuras. | AML.T0051.001; AML.T0053 | Fev 2025 | https://embracethered.com/blog/posts/2025/gemini-memory-persistence-prompt-injection/ | | ZombAIs (C2 do Claude Computer Use) | Indireto – site / HTML | | | Claude Computer Use | Pesquisador: Johann Rehberger (Embrace The Red) | Pesquisa / red-team | Confirmado | Uma página web maliciosa injeta instruções que fazem o Claude Computer Use baixar e executar um binário que se conecta de volta ao servidor do pesquisador — uma cadeia completa de injeção de prompt até comando e controle em um agente que usa computador. | AML.T0051.001; AML.T0053 | Out 2024 | https://embracethered.com/blog/posts/2024/claude-computer-use-c2-the-zombais-are-coming/ | | SpAIware (memória do ChatGPT) | Indireto – site / HTML; Indireto – documento / arquivo | | Persiste na memória do agente / projeto; Cross-agent / cross-session | ChatGPT (aplicativo macOS) | Pesquisador: Johann Rehberger (Embrace The Red) | Pesquisa / red-team | Confirmado | Injeção de prompt a partir de conteúdo web/documento não confiável grava uma instrução persistente na Memória de longo prazo do ChatGPT, causando exfiltração contínua (via URLs de imagens renderizadas) de tudo que o usuário digita ou recebe em todas as sessões futuras até que a memória seja removida. | AML.T0051.001; AML.T0057 | Set 2024 | https://embracethered.com/blog/posts/2024/chatgpt-macos-app-persistent-data-exfiltration/ | | Exfiltração por contrabando de ASCII no M365 Copilot | Indireto – e-mail; Indireto – documento / arquivo | Caracteres de tag Unicode (invisíveis) | Move-se pela cadeia de chamadas de ferramentas | Microsoft 365 Copilot | Pesquisador: Johann Rehberger (Embrace The Red) | Pesquisa / red-team | Confirmado | Uma injeção de prompt escondida em um e-mail malicioso ou documento compartilhado fez o M365 Copilot buscar automaticamente outros e-mails/documentos e depois usou contrabando de ASCII (tags Unicode invisíveis) para incorporar dados coletados (por exemplo, códigos MFA) em hiperlinks clicáveis renderizados ao usuário; corrigido ~Jul 2024. | AML.T0051.001; AML.T0068; AML.T0057; AML.T0053 | Ago 2024 | https://embracethered.com/blog/posts/2024/m365-copilot-prompt-injection-tool-invocation-and-data-exfil-using-ascii-smuggling/ | | Exfiltração por injeção indireta no Slack AI | Indireto – conteúdo RAG / recuperado | | Envenena armazenamento de dados compartilhado / RAG | Slack AI | Red team: PromptArmor | Pesquisa / red-team | Confirmado | Um atacante planta instruções em um canal público do Slack; o Slack AI as ingere em seu pipeline RAG e, quando uma vítima posteriormente consulta, a instrução injetada renderiza um link markdown contrabandeando dados de canal privado (por exemplo, uma chave de API) na URL para o atacante. | AML.T0051.001; AML.T0057 | Ago 2024 | https://www.promptarmor.com/resources/data-exfiltration-from-slack-ai-via-indirect-prompt-injection | | Exfiltração de dados do GitHub Copilot Chat | Código / conteúdo de repositório | | | GitHub Copilot Chat (GPT-4) | Pesquisador: Johann Rehberger (Embrace The Red) | Pesquisa / red-team | Confirmado | Instruções elaboradas em um arquivo de código-fonte fizeram o GitHub Copilot Chat emitir uma imagem markdown cuja URL carregava dados de conversas anteriores; quando renderizada automaticamente, os dados foram exfiltrados para o atacante. | AML.T0051.001; AML.T0057 | Jun 2024 | https://embracethered.com/blog/posts/2024/github-copilot-chat-prompt-injection-data-exfiltration/ | | Morris II (verme GenAI autorreplicante) | Indireto – conteúdo RAG / recuperado; Indireto – e-mail; Multimodal – imagem | | Autorreplicante / verme (IA para IA); Envenena armazenamento de dados compartilhado / RAG; Emite e-mail / mensagem de saída com mais instruções; Cross-agent / cross-session | Gemini Pro; ChatGPT 4.0; LLaVA | Pesquisador: Stav Cohen (Technion), Ron Bitton (Intuit), Ben Nassi (Cornell Tech) | Pesquisa / red-team | Confirmado | Um "prompt autorreplicante adversário" faz um assistente de e-mail GenAI baseado em RAG copiar o prompt em sua própria saída e entregá-lo a outros agentes, desencadeando uma cascata semelhante a um verme de injeções de prompt indiretas que envia spam e exfiltra dados. Demonstrado com payloads de texto e imagem. | AML.T0051.001 | Mar 2024 | https://arxiv.org/abs/2403.02817 | | Injeção de prompt oculta contra o Claude (tags Unicode) | Prompt direto | Caracteres de tag Unicode (invisíveis) | | Anthropic Claude | Pesquisador: Johann Rehberger (Embrace The Red) | Pesquisa / red-team | Confirmado | O Claude interpretou pontos de código de tag Unicode invisíveis colados em sua interface — o mesmo comportamento de instrução oculta demonstrado contra o ChatGPT. A Anthropic revisou e marcou como "Não Aplicável" (nenhum impacto de segurança identificado), mas o comportamento de interpretação foi demonstrado. | AML.T0051.000; AML.T0068 | Fev 2024 | https://embracethered.com/blog/posts/2024/claude-hidden-prompt-injection-ascii-smuggling/ | | Contrabando de ASCII / tags Unicode invisíveis (fundacional) | Indireto – site / HTML; Indireto – documento / arquivo; Prompt direto | Caracteres de tag Unicode (invisíveis) | | ChatGPT (GPT-4 / DALL·E) | Pesquisador: Johann Rehberger (Embrace The Red) | Pesquisa / red-team | Confirmado | Artigo fundacional e ferramenta "ASCII Smuggler": pontos de código do bloco Unicode Tags (faixa U+E0000) espelham ASCII, mas são renderizados de forma invisível, enquanto os LLMs ainda os interpretam; instruções ocultas fizeram o ChatGPT invocar o DALL·E. Base para toda a classe de injeção invisível. | AML.T0051; AML.T0068 | Jan 2024 | https://embracethered.com/blog/posts/2024/hiding-and-finding-text-with-unicode-tags/ | | Substituição do chatbot de suporte da DPD | Prompt direto | | | | In-the-wild: Ashley Beauchamp | In-the-wild | Confirmado | Um cliente instruiu o chatbot de suporte da DPD a desconsiderar suas regras, fazendo-o xingar e escrever um poema depreciando a DPD — substituição direta de instrução; a DPD desativou o bot no mesmo dia. Modelo subjacente não divulgado. (Manipulação pelo usuário do bot com o qual estava conversando; sem vítima terceira ou exfiltração.) | AML.T0051.000; AML.T0054 | Jan 2024 | https://www.theregister.com/2024/01/23/dpd_chatbot_goes_rogue | | Substituição do chatbot de concessionária Chevrolet ("Tahoe por $1") | Prompt direto | | | Assistente de concessionária baseado em ChatGPT | In-the-wild: Chris Bakke | In-the-wild | Confirmado | Um usuário injetou instruções fazendo o assistente de site baseado em ChatGPT de uma concessionária Chevrolet "concordar" em vender um Tahoe 2024 por $1 e chamá-lo de legalmente vinculativo — substituição direta de instrução clássica (não vinculativo na realidade; conduzido pelo usuário, sem vítima terceira). | AML.T0051.000 | Dez 2023 | https://the-decoder.com/people-buy-brand-new-chevrolets-for-1-from-a-chatgpt-chatbot/ | | Exfiltração por imagem markdown do Google Bard | Indireto – documento / arquivo; Indireto – e-mail | | | Google Bard | Pesquisador: Johann Rehberger (Embrace The Red) | Pesquisa / red-team | Confirmado | Uma injeção de prompt indireta em um Google Doc compartilhado fez o Bard emitir uma imagem markdown cuja URL incorporava os dados de chat do usuário; o cliente carregou a imagem automaticamente, exfiltrando dados sem nenhuma interação do usuário. Um dos primeiros casos de exfiltração zero-click em LLM; corrigido em Out 2023. | AML.T0051.001; AML.T0057 | Nov 2023 | https://embracethered.com/blog/posts/2023/google-bard-data-exfiltration/ | | Injeção de prompt em imagem multimodal (GPT-4V) | Multimodal – imagem | | | GPT-4V | Pesquisador: Riley Goodside (via Simon Willison) | Pesquisa / red-team | Confirmado | Uma imagem que parece em branco carrega instruções em texto quase branco sobre fundo branco; o OCR do GPT-4V as lê e segue (a demonstração de Goodside fez o modelo suprimir sua descrição e anunciar uma promoção falsa). Injeção de prompt multimodal inicial. | AML.T0051.001 | Out 2023 | https://simonwillison.net/2023/Oct/14/multi-modal-prompt-injection/ | | Jailbreak de prompt codificado em Base64 | Prompt direto | Base64; Multicamada | | GPT-4; Claude v1.3; GPT-3.5 Turbo | Pesquisador: Wei, Haghtalab, Steinhardt (UC Berkeley) | Pesquisa / red-team | Confirmado | Codificar uma solicitação proibida em Base64 explora a "generalização incompatível" — os modelos aprendem a decodificar Base64 no pré-treinamento, mas o treinamento de segurança nunca cobriu tais entradas — contornando os guardrails; ataques combinados alcançaram ~94% de sucesso no GPT-4. Publicado em Jul 2023, pouco antes da janela de 2 anos; fonte primária canônica para jailbreaks de payload codificado. | AML.T0054; AML.T0068; AML.T0051.000 | Jul 2023 | https://arxiv.org/abs/2307.02483 |


    Apêndice A — Métodos de entrega (vocabulário controlado)

    Como as instruções injetadas chegam ao modelo. Extensível; adicione um novo termo aqui quando um relatório descrever um vetor genuinamente novo.- Prompt direto — texto controlado pelo atacante digitado diretamente na entrada do modelo.

    • Indireto – site / HTML — instruções incorporadas em uma página web que o modelo navega ou resume.
    • Indireto – documento / arquivo — payload dentro de um PDF, DOCX, planilha ou outro arquivo que o modelo ingere.
    • Indireto – e-mail — instruções dentro de um e-mail que um agente lê ou faz triagem.
    • Indireto – RAG / conteúdo recuperado — payload plantado em uma base de conhecimento, vector store ou resultado de busca que o modelo recupera.
    • Chamada de ferramenta / resultado de função — instruções retornadas na saída de uma ferramenta/função que o agente invoca.
    • Servidor MCP / conexão — payload servido por um servidor Model Context Protocol ou descrição de ferramenta.
    • Multimodal – imagem — instruções em uma imagem (texto visível, texto de baixo contraste ou payload em pixel/metadados).
    • Multimodal – áudio — instruções transportadas em uma entrada de áudio.
    • Código / conteúdo de repositório — payload em código-fonte, comentários, issues ou logs de CI que um agente lê.
    • Calendário / convite — instruções dentro de um evento de calendário, convite ou nota de reunião.

    Apêndice B — Codificações (vocabulário controlado)

    Ofuscação aplicada ao payload. Em branco na tabela significa que o payload era texto simples ou que o relatório não especificou.

    • Base64
    • Hex
    • ROT13
    • Leetspeak
    • Caracteres de tag Unicode (invisíveis) — glifos "tag" na faixa U+E0000 que são renderizados de forma invisível.
    • Caracteres de largura zero — espaço/conector de largura zero usado para ocultar ou dividir texto.
    • Homoglifos — substitutos Unicode visualmente semelhantes para letras ASCII.
    • Contrabando por emoji / seletor de variação
    • Comentário HTML / Markdown — payload oculto em comentários ou marcação não renderizada.
    • Metadados / EXIF — instruções em metadados de arquivo ou imagem.
    • Multicamada — mais de um dos itens acima, empilhados.

    Apêndice C — Comportamentos de propagação (vocabulário controlado)

    Se a injeção foi projetada para se espalhar ou persistir. Em branco na tabela significa que nenhum comportamento de propagação foi relatado.

    • Autorreplicante / worm (IA para IA) — a saída é elaborada para se tornar a entrada injetada do próximo sistema.
    • Persiste na memória do agente / do projeto — gravado na memória de longo prazo ou do projeto para ser reativado em sessões posteriores.
    • Espalha-se via MCP para conectores — um servidor MCP envenenado entrega o payload a todos os clientes que se conectam.
    • Move-se pela cadeia de chamadas de ferramentas — transportado adiante por uma sequência de chamadas de ferramentas dentro de uma execução de agente.
    • Emite e-mail / mensagem de saída com novas instruções — faz o agente enviar uma mensagem que ela própria carrega a injeção.
    • Envenena armazenamento de dados compartilhado / RAG — planta o payload onde as recuperações de outros usuários ou agentes irão capturá-lo.
    • Espalha-se via arquivos de configuração / regras compartilhados — regras/configurações maliciosas de agente propagam-se por repositórios de regras compartilhados ou centrais para projetos derivados (CRÉDITO: Rachel James, com base no relatório "Rules File Backdoor" da Pillar Security).
    • Entre agentes / entre sessões — alcança outros agentes ou sessões posteriores além do contexto inicial.

    Apêndice D — Cruzamento com MITRE ATLAS

    As técnicas são marcadas com IDs de técnica do MITRE ATLAS quando aplicável. Os IDs são validados a cada atualização contra a fonte canônica mitre-atlas/atlas-data do MITRE (os dados que geram a matriz ao vivo; o site atlas.mitre.org é um app JS que bloqueia requisições automatizadas). Comportamentos sem mapeamento ATLAS claro são anotados com um rótulo cunhado (CRÉDITO: Rachel James, com base no relatório citado). IDs usados neste tracker:

    • AML.T0051 LLM Prompt Injection — AML.T0051.000 Direct, AML.T0051.001 Indirect
    • AML.T0053 AI Agent Tool Invocation (substitui o título retirado "LLM Plugin Compromise")
    • AML.T0054 LLM Jailbreak
    • AML.T0057 LLM Data Leakage
    • AML.T0068 LLM Prompt Obfuscation

    Contribuições são bem-vindas — consulte CONTRIBUTING.md, ou envie uma técnica diretamente. Toda linha proposta deve citar uma fonte explícita para cada campo não vazio; entradas pouco claras são marcadas como "Not fully vetted" em vez de descartadas.

    Baixar ferramenta