Skip to content
KitploitKITPLOIT
StrumentiExploitsBlog
Log in
Invia
StrumentiExploitsBlog
Invia

Strumenti di Hacking, PenTest e Cybersecurity per il tuo Arsenale di Sicurezza!

Kitploit è una directory di strumenti di hacking, cybersecurity e pentesting. Scopri gli ultimi aggiornamenti dei progetti per trovare vulnerabilità, analizzare sistemi, automatizzare i test e rafforzare la tua sicurezza.

··Feed·Contatto·Privacy·© 2026 Kitploit

Directory degli strumenti

Categorie

Vedi tutte le categorie
Loading categories
Prompt-Injection-in-the-Wild — Tracker delle tecniche di prompt-injection segnalate pubblicamente, suddivise per metodo di consegna, codifica e comportamento di propagazione, con modelli confermati, fonti e tag MITRE ATLAS. | Kitploit
Strumenti/GitHubGitHub/cybershujin/prompt-injection-in-the-wild
Gestione degli Indicatori di Compromissione (IOC)Feed e Aggregatori di MinacceAnalisi delle VulnerabilitàThreat IntelligencePaper e RicercaApprendimento e FormazioneRisorse CurateSicurezza dell'IA

Più Popolari

Vedi tutti →

Scopri gli strumenti più utilizzati dalla nostra community.

Esplora tutti gli strumenti

Sfoglia la nostra collezione di strumenti

Vedi tutti gli strumenti →
Attacco Avversario
GitHubcybershujin/prompt-injection-in-the-wild

Prompt-Injection-in-the-Wild

Tracker delle tecniche di prompt-injection segnalate pubblicamente, suddivise per metodo di consegna, codifica e comportamento di propagazione, con modelli confermati, fonti e tag MITRE ATLAS.

Vedi Repository
22012 giorni faNon ancora revisionato
Condividi

Prompt Injection in the Wild

Un tracker delle tecniche di prompt injection segnalate pubblicamente negli ultimi due anni circa, mantenuto da Rachel James (cybershujin).

Ogni tecnica è suddivisa nei tre elementi di una prompt injection:

  1. Metodo di delivery — come le istruzioni iniettate raggiungono il modello (il risultato di una tool-call, un sito web esterno, una connessione MCP, un documento, un'email, un'immagine, ecc.).
  2. Encoding — l'offuscamento applicato al payload, se presente (Base64, leetspeak, caratteri tag Unicode invisibili, omoglifi, …). Vuoto quando il payload è testo in chiaro o il report non lo specifica.
  3. Comportamento di propagazione — se l'injection è progettata per diffondersi o persistere (veicolata a chiunque si connetta a un server MCP avvelenato, persistita nella memoria a lungo termine/di progetto di un agente, trasportata lungo una catena di tool call, fatta emettere un'email contenente ulteriori istruzioni, …). Vuoto quando non c'è propagazione.

Ogni voce registra anche i modelli contro cui è stato confermato che funziona (se presenti), un link alla fonte che lo segnala e — dove noto — la fonte dell'attacco (il ricercatore, il red team o l'attore in-the-wild da cui ha avuto origine).

Dashboard live: https://cybershujin.github.io/Prompt-Injection-in-the-Wild/


Ambito e metodologia

  • In ambito: tecniche per iniettare istruzioni avversariali in un LLM o in un agente basato su LLM che sono state segnalate pubblicamente — da ricercatori di sicurezza, red team, vendor, o come attività osservata in-the-wild. Sono incluse sia la prompt injection diretta che quella indiretta (veicolata dai dati).
| Tecnica | Metodo di consegna | Codifica | Propagazione | Modelli confermati | Fonte dell'attacco | Evidenza | Verifica | Sintesi | ATLAS | Segnalato | Link |
  • Fuori ambito: wordlist generiche di jailbreak senza alcun meccanismo di delivery/propagazione, pure lamentele sull'allineamento dei modelli e marketing senza sostanza tecnica.
  • Mai ipotizzato. Ogni cella non vuota è tratta da un'affermazione esplicita nella fonte citata. Se un report non indica l'encoding, il comportamento di propagazione, i modelli confermati o la fonte dell'attacco, quella cella viene lasciata vuota — una cella vuota significa "non specificato", mai un "nessuno" dedotto.
  • Verifica. Ogni voce è contrassegnata come Confirmed o Not fully vetted. "Not fully vetted" segnala una voce la cui fonte è vaga, non confermata, o il cui meccanismo è poco chiaro — viene evidenziata anziché scartata, così un revisore può valutarla.
  • Classe di evidenza — in-the-wild vs. ricerca. Ogni voce è etichettata come In-the-wild (abuso reale osservato o un incidente reale in produzione), Research / red-team (una dimostrazione di un ricercatore di sicurezza o di un red team / responsible disclosure — una tecnica reale e funzionante, ma non osservata come abusata da un attaccante), Vendor advisory o Unclear. Questo è un asse separato dalla verifica: una tecnica può essere Confirmed (verificata e funzionante) ma essere stata dimostrata solo in laboratorio. Attenzione: una genuina prompt injection malevola in-the-wild è ancora raramente documentata pubblicamente, quindi la grande maggioranza delle voci qui presenti sono disclosure di ricerca / red-team — al momento del backfill iniziale, 29 su 32 erano research/red-team e solo 3 erano in-the-wild. Usa il filtro Evidence sulla dashboard per isolare i casi reali.
  • Aggiornamenti. Le nuove segnalazioni vengono raccolte mensilmente (Perplexity sonar-deep-research, con una ricerca ampia) e proposte come pull request in bozza per la revisione del maintainer. Nulla viene unito automaticamente. Vedi il tracker gemello Threat-Actors-use-of-Artifical-Intelligence per lo stesso flusso di lavoro applicato all'uso dell'IA da parte dei threat actor.
  • Come vengono costruiti i dati

    I dati risiedono solo nella tabella sottostante (questo file è l'unica fonte di verità). Un generatore deterministico e senza dipendenze (tools/build_exports.py) li compila a ogni commit in:

    • index.html — la dashboard interattiva (servita tramite GitHub Pages),
    • tracker.json — dati normalizzati leggibili dalla macchina,
    • stix/prompt-injection-stix2.1.json — un bundle STIX 2.1 (ogni tecnica come attack-pattern, etichettata con il suo ID MITRE ATLAS e una mappatura Not fully vetted → bassa confidenza).

    Non modificare manualmente questi tre file; modifica la tabella e lascia che la CI li ricostruisca.


    Tecniche

    |---|---|---|---|---|---|---|---|---|---|---|---| | ASCII smuggling across LLMs (FireTail) | Calendario / invito; Indiretto – email | Caratteri tag Unicode (invisibili) | | Google Gemini; Grok; DeepSeek | Ricercatore: Viktor Markopoulos (FireTail) | Ricerca / red-team | Confermato | Caratteri tag Unicode invisibili nascosti in normali inviti di calendario ed email sono stati interpretati da Gemini, Grok e DeepSeek ma non mostrati all'utente; è stato rilevato che ChatGPT, Copilot e Claude li eliminano. Google ha risposto "nessuna azione". | AML.T0051.001; AML.T0068 | Ott 2025 | https://www.firetail.ai/blog/ghosts-in-the-machine-ascii-smuggling-across-various-llms | | CamoLeak (GitHub Copilot Chat) | Codice / contenuto del repository | Commento HTML / Markdown | | GitHub Copilot Chat | Ricercatore: Omer Mayraz (Legit Security) | Ricerca / red-team | Confermato | CVE-2025-59145 (CVSS 9.6): un'iniezione di prompt invisibile in un commento HTML all'interno di una pull request ha indotto Copilot Chat a cercare segreti in un repo privato e a esfiltrarli carattere per carattere tramite URL di immagini GitHub Camo pregenerate dall'attaccante; risolto disabilitando il rendering delle immagini. | AML.T0051.001; AML.T0068; AML.T0057 | Ott 2025 | https://www.legitsecurity.com/blog/camoleak-critical-github-copilot-vulnerability-leaks-private-source-code | | Unseeable screenshot-OCR injection | Multimodale – immagine | | | Perplexity Comet; Fellou; Opera Neon | Ricercatore: Artem Chaikin, Shivan Kaul Sahib (Brave) | Ricerca / red-team | Confermato | Istruzioni di prompt injection renderizzate come testo a basso contrasto quasi invisibile all'interno di immagini sulla pagina vengono recuperate dall'OCR di un browser AI quando elabora uno screenshot, così un umano non vede nulla mentre l'agente obbedisce. Dimostrato su più browser agentici. | AML.T0051.001; AML.T0068 | Ott 2025 | https://brave.com/blog/unseeable-prompt-injections/ | | ChatGPT Atlas omnibox injection | Prompt diretto; Indiretto – sito web / HTML | | | ChatGPT Atlas | Ricercatore: NeuralTrust | Ricerca / red-team | Confermato | Una stringa che sembra un URL ma fallisce il parsing dell'URL fa sì che l'omnibox di Atlas tratti il testo incorporato come un prompt attendibile; incollata o consegnata dietro un pulsante "Copia link", può spingere l'agente a visitare siti dell'attaccante o eliminare file di Google Drive nella sessione autenticata dell'utente. | AML.T0051.000; AML.T0051.001 | Ott 2025 | https://neuraltrust.ai/blog/openai-atlas-omnibox-prompt-injection | | Invitation Is All You Need (Gemini) | Calendario / invito; Indiretto – email | | Persiste nella memoria dell'agente / del progetto; Si muove attraverso la catena di tool-call; Cross-agent / cross-session | Google Gemini (web, app mobile, assistente Android) | Ricercatore: Or Yair, Ben Nassi, Stav Cohen (SafeBreach / Technion) | Ricerca / red-team | Confermato | Un invito di Google Calendar (o un'email) i cui campi contengono un'iniezione di prompt indiretta dirotta Gemini quando l'utente interagisce con il proprio calendario; 14 attacchi dimostrati spaziano dall'avvelenamento della memoria a breve/lungo termine all'abuso di strumenti e all'invocazione automatica di agenti/app, raggiungendo app connesse e dispositivi smart-home. | AML.T0051.001; AML.T0053 | Ago 2025 | https://www.safebreach.com/blog/invitation-is-all-you-need-hacking-gemini/ | | MCPoison (Cursor MCP rug-pull) | Server MCP / connessione; Codice / contenuto del repository | | | Cursor IDE (< v1.3) | Ricercatore: Check Point Research | Ricerca / red-team | Confermato | CVE-2025-54136: Cursor considerava attendibile in modo permanente una configurazione MCP approvata, quindi un attaccante che ottiene l'approvazione di un mcp.json benigno in un repo condiviso può successivamente sostituirlo con un comando malevolo che viene eseguito silenziosamente a ogni successiva apertura del progetto. | AML.T0051.001; AML.T0053 | Ago 2025 | https://research.checkpoint.com/2025/cursor-vulnerability-mcpoison/ | | GitHub Copilot RCE / "YOLO mode" | Indiretto – sito web / HTML; Codice / contenuto del repository; Risultato di tool-call / funzione | Caratteri tag Unicode (invisibili) | | GitHub Copilot (VS Code — Windows, macOS, Linux) | Ricercatore: Johann Rehberger (Embrace The Red) | Ricerca / red-team | Confermato | CVE-2025-53773: un'istruzione iniettata fa sì che Copilot modifichi .vscode/settings.json per abilitare chat.tools.autoApprove ("YOLO mode"), rimuovendo le richieste di approvazione dei comandi e consentendo l'esecuzione arbitraria di codice; una variante utilizzava tag Unicode invisibili. | AML.T0051.001; AML.T0053 | Ago 2025 | https://embracethered.com/blog/posts/2025/github-copilot-remote-code-execution-via-prompt-injection/ | | CurXecute (Cursor RCE via MCP) | Risultato di tool-call / funzione | | Si muove attraverso la catena di tool-call | Cursor (corretto v1.3) | Ricercatore: Aim Labs (Aim Security) | Ricerca / red-team | Non completamente verificato | CVE-2025-54135: un'iniezione di prompt veicolata tramite una fonte dati MCP esterna (ad es. un messaggio Slack restituito attraverso uno strumento) fa sì che Cursor riscriva il proprio mcp.json, e l'auto-run esegue il comando dell'attaccante senza alcuna approvazione. La pagina principale di Aim Labs era irraggiungibile al momento della verifica; corroborato da report secondari. | AML.T0051.001; AML.T0053 | Ago 2025 | https://www.catonetworks.com/blog/curxecute-rce/ | | AgentFlayer (ChatGPT Connectors) | Indiretto – documento / file | | | ChatGPT (Connectors) | Ricercatore: Tamir Ishay Sharbat (Zenity Labs) | Ricerca / red-team | Confermato | Un payload invisibile nascosto in un documento condiviso istruisce ChatGPT — tramite Connectors come Google Drive — a renderizzare un'immagine markdown i cui parametri URL trasportano dati rubati; il rendering attiva la richiesta senza alcun clic. | AML.T0051.001; AML.T0057 | Ago 2025 | https://labs.zenity.io/post/agentflayer-chatgpt-connectors-0click-attack-5b41 | | Perplexity Comet Reddit injection | Indiretto – sito web / HTML | | | Perplexity Comet | Ricercatore: Artem Chaikin, Shivan Kaul Sahib (Brave) | Ricerca / red-team | Confermato | Il riepilogo di una pagina Reddit il cui commento nascondeva istruzioni dietro un tag spoiler ha indotto il browser Comet a leggere l'email dell'utente e un OTP di Gmail da sessioni autenticate e a esfiltrarli rispondendo al commento. | AML.T0051.001; AML.T0057 | Ago 2025 | https://brave.com/blog/comet-prompt-injection/ | | Amazon Q Developer wiper prompt | Codice / contenuto del repository | | | Amazon Q Developer (estensione VS Code) | In-the-wild: attore "lkmanka58" | In-the-wild | Non completamente verificato | Un attaccante ha effettuato il merge di una PR nell'estensione Amazon Q Developer inserendo un prompt che istruiva l'assistente a cancellare file locali e risorse AWS; è stato distribuito nella v1.84.0 prima della rimozione (secondo quanto riportato non sarebbe stato eseguito a causa della formattazione). Verificato tramite report aggregati; fonte primaria non confermata direttamente. | AML.T0051.001 | Lug 2025 | https://www.scworld.com/news/amazon-q-extension-for-vs-code-reportedly-injected-with-wiper-prompt | | EchoLeak (M365 Copilot, LLM Scope Violation) | Indiretto – email | | | Microsoft 365 Copilot | Ricercatore: Aim Labs (Aim Security) | Ricerca / red-team | Confermato | CVE-2025-32711 (CVSS 9.3): una singola email confezionata ad arte ha indotto il motore RAG di M365 Copilot a inserire istruzioni dell'attaccante nel contesto insieme a dati privilegiati ("LLM Scope Violation") e a esfiltrarli senza alcuna interazione dell'utente, aggirando il classificatore XPIA e la redazione di link/immagini; corretto lato server. | AML.T0051.001; AML.T0057 | Giu 2025 | https://www.aim.security/lp/aim-labs-echoleak-m365 | | GitHub MCP toxic agent flow | Codice / contenuto del repository; Server MCP / connessione | | Si muove attraverso la catena di tool-call | Claude 4 Opus (Claude Desktop + GitHub MCP) | Ricercatore: Invariant Labs | Ricerca / red-team | Confermato | Un'iniezione di prompt inserita in una issue pubblica di GitHub, raggiunta attraverso il server GitHub MCP, costringe l'agente a portare dati di repo privati nel contesto e a farli trapelare in una pull request pubblica creata autonomamente; nessun componente presenta malfunzionamenti. | AML.T0051.001; AML.T0057; AML.T0053 | Mag 2025 | https://invariantlabs.ai/blog/mcp-github-vulnerability | | Character-injection guardrail evasion | Prompt diretto | Caratteri zero-width; Omoglifi; Emoji / variation-selector smuggling; Multi-livello | | Azure Prompt Shield; Meta Prompt Guard; ProtectAI Prompt Injection v1/v2; NVIDIA NeMo Guard; Vijil | Ricercatore: Mindgard / Lancaster University (Hackett et al.) | Ricerca / red-team | Confermato | Studio sistematico: caratteri zero-width non stampabili, sostituzione con omoglifi ed emoji variation-selector smuggling aggirano i classificatori commerciali di prompt-injection/jailbreak (i target confermati sono i sistemi di rilevamento, non gli LLM); lo zero-width ha registrato in media il 44–76% di evasione, l'emoji smuggling il valore più alto. | AML.T0068; AML.T0051 | Apr 2025 | https://arxiv.org/html/2504.11168v1 | | MCP tool poisoning | Server MCP / connessione | | Si muove attraverso la catena di tool-call | Cursor | Ricercatore: Invariant Labs | Ricerca / red-team | Confermato | Istruzioni malevole incorporate nella descrizione di uno strumento MCP sono invisibili all'utente ma lette dal modello; uno strumento "add" avvelenato ha indotto silenziosamente Cursor a leggere ed esfiltrare la chiave SSH dello sviluppatore restituendo al contempo un risultato corretto. Anthropic, OpenAI e Zapier indicati come client interessati. | AML.T0051.001; AML.T0053 | Apr 2025 | https://invariantlabs.ai/blog/mcp-security-notification-tool-poisoning-attacks | | MCP line jumping | Server MCP / connessione | | | Claude Desktop | Red team: Trail of Bits | Ricerca / red-team | Confermato | Poiché i client MCP caricano ogni descrizione di strumento nel contesto del modello non appena un server viene elencato, una descrizione malevola può alterare il comportamento del modello prima che qualsiasi strumento venga invocato, aggirando la fase di approvazione delle tool-call da parte dell'utente. | AML.T0051.001; AML.T0053 | Apr 2025 | https://blog.trailofbits.com/2025/04/21/jumping-the-line-how-mcp-servers-can-attack-you-before-you-ever-use-them/ | | MCP rug pull | Server MCP / connessione | | | | Ricercatore: Invariant Labs | Ricerca / red-team | Confermato | Un server MCP malevolo presenta uno strumento benigno per ottenere l'approvazione, poi vi sostituisce silenziosamente istruzioni avvelenate; i client non richiedono nuovamente l'approvazione perché l'identità dello strumento è invariata. | AML.T0051.001; AML.T0053 | Apr 2025 | https://invariantlabs.ai/blog/mcp-security-notification-tool-poisoning-attacks | | Rules File Backdoor (Cursor / Copilot) | Codice / contenuto del repository | Caratteri zero-width; Caratteri tag Unicode (invisibili) | Si diffonde tramite file di configurazione / regole condivisi | Cursor; GitHub Copilot | Ricercatore: Ziv Karliner (Pillar Security) | Ricerca / red-team | Confermato | Istruzioni in Unicode invisibile nascoste nei file di "regole"/configurazione per il coding AI inducono silenziosamente Cursor e GitHub Copilot a inserire backdoor nel codice generato, senza mostrare nulla in chat o nei log; i caratteri nascosti sono invisibili persino nella vista di revisione delle PR di GitHub. | AML.T0051.001; AML.T0068 | Mar 2025 | https://www.pillar.security/blog/new-vulnerability-in-github-copilot-and-cursor-how-hackers-can-weaponize-code-agents | | Gemini memory persistence (delayed tool invocation) | Indiretto – documento / file | | Persiste nella memoria dell'agente / del progetto; Cross-agent / cross-session | Gemini Advanced | Ricercatore: Johann Rehberger (Embrace The Red) | Ricerca / red-team | Confermato | Un documento malevolo caricato avvelena la chat in modo che, quando l'utente in seguito pronuncia una parola trigger, Gemini invochi il proprio strumento di memoria "per conto dell'utente" ("delayed tool invocation") e scriva falsi ricordi a lungo termine scelti dall'attaccante che persistono nelle sessioni future. | AML.T0051.001; AML.T0053 | Feb 2025 | https://embracethered.com/blog/posts/2025/gemini-memory-persistence-prompt-injection/ | | ZombAIs (Claude Computer Use C2) | Indiretto – sito web / HTML | | | Claude Computer Use | Ricercatore: Johann Rehberger (Embrace The Red) | Ricerca / red-team | Confermato | Una pagina web malevola inietta istruzioni che inducono Claude Computer Use a scaricare ed eseguire un binario che si riconnette al server del ricercatore — una catena completa da prompt injection a command-and-control su un agente che usa il computer. | AML.T0051.001; AML.T0053 | Ott 2024 | https://embracethered.com/blog/posts/2024/claude-computer-use-c2-the-zombais-are-coming/ | | SpAIware (ChatGPT memory) | Indiretto – sito web / HTML; Indiretto – documento / file | | Persiste nella memoria dell'agente / del progetto; Cross-agent / cross-session | ChatGPT (app macOS) | Ricercatore: Johann Rehberger (Embrace The Red) | Ricerca / red-team | Confermato | Un'iniezione di prompt da contenuti web/documenti non attendibili scrive un'istruzione persistente nella memoria a lungo termine di ChatGPT, causando l'esfiltrazione continua (tramite URL di immagini renderizzate) di tutto ciò che l'utente digita o riceve in tutte le sessioni future finché la memoria non viene rimossa. | AML.T0051.001; AML.T0057 | Set 2024 | https://embracethered.com/blog/posts/2024/chatgpt-macos-app-persistent-data-exfiltration/ | | M365 Copilot ASCII smuggling exfiltration | Indiretto – email; Indiretto – documento / file | Caratteri tag Unicode (invisibili) | Si muove attraverso la catena di tool-call | Microsoft 365 Copilot | Ricercatore: Johann Rehberger (Embrace The Red) | Ricerca / red-team | Confermato | Un'iniezione di prompt nascosta in un'email malevola o in un documento condiviso ha indotto M365 Copilot a cercare automaticamente in altre email/documenti, poi ha usato l'ASCII smuggling (tag Unicode invisibili) per incorporare i dati raccolti (ad es. codici MFA) in collegamenti ipertestuali cliccabili mostrati all'utente; corretto ~Lug 2024. | AML.T0051.001; AML.T0068; AML.T0057; AML.T0053 | Ago 2024 | https://embracethered.com/blog/posts/2024/m365-copilot-prompt-injection-tool-invocation-and-data-exfil-using-ascii-smuggling/ | | Slack AI indirect injection exfiltration | Indiretto – contenuto RAG / recuperato | | Avvelena l'archivio dati condiviso / RAG | Slack AI | Red team: PromptArmor | Ricerca / red-team | Confermato | Un attaccante inserisce istruzioni in un canale Slack pubblico; Slack AI le acquisisce nella propria pipeline RAG e, quando una vittima in seguito interroga il sistema, l'istruzione iniettata renderizza un link markdown che contrabbanda dati di canali privati (ad es. una chiave API) nell'URL verso l'attaccante. | AML.T0051.001; AML.T0057 | Ago 2024 | https://www.promptarmor.com/resources/data-exfiltration-from-slack-ai-via-indirect-prompt-injection | | GitHub Copilot Chat data exfiltration | Codice / contenuto del repository | | | GitHub Copilot Chat (GPT-4) | Ricercatore: Johann Rehberger (Embrace The Red) | Ricerca / red-team | Confermato | Istruzioni confezionate ad arte in un file di codice sorgente hanno indotto GitHub Copilot Chat a emettere un'immagine markdown il cui URL trasportava i dati della conversazione precedente; al momento del rendering automatico, i dati sono stati esfiltrati all'attaccante. | AML.T0051.001; AML.T0057 | Giu 2024 | https://embracethered.com/blog/posts/2024/github-copilot-chat-prompt-injection-data-exfiltration/ | | Morris II (self-replicating GenAI worm) | Indiretto – contenuto RAG / recuperato; Indiretto – email; Multimodale – immagine | | Auto-propagante / worm (AI-to-AI); Avvelena l'archivio dati condiviso / RAG; Emette email / messaggi in uscita con ulteriori istruzioni; Cross-agent / cross-session | Gemini Pro; ChatGPT 4.0; LLaVA | Ricercatore: Stav Cohen (Technion), Ron Bitton (Intuit), Ben Nassi (Cornell Tech) | Ricerca / red-team | Confermato | Un "prompt avversariale auto-replicante" induce un assistente email GenAI basato su RAG a copiare il prompt nel proprio output e a consegnarlo ad altri agenti, innescando una cascata simile a un worm di iniezioni di prompt indirette che invia spam ed esfiltra dati. Dimostrato con payload testuali e immagini. | AML.T0051.001 | Mar 2024 | https://arxiv.org/abs/2403.02817 | | Hidden prompt injection against Claude (Unicode tags) | Prompt diretto | Caratteri tag Unicode (invisibili) | | Anthropic Claude | Ricercatore: Johann Rehberger (Embrace The Red) | Ricerca / red-team | Confermato | Claude ha interpretato code point tag Unicode invisibili incollati nella sua interfaccia — lo stesso comportamento di istruzioni nascoste mostrato contro ChatGPT. Anthropic ha esaminato e classificato il problema come "Not Applicable" (nessun impatto di sicurezza identificato), ma il comportamento di interpretazione è stato dimostrato. | AML.T0051.000; AML.T0068 | Feb 2024 | https://embracethered.com/blog/posts/2024/claude-hidden-prompt-injection-ascii-smuggling/ | | ASCII smuggling / invisible Unicode tags (foundational) | Indiretto – sito web / HTML; Indiretto – documento / file; Prompt diretto | Caratteri tag Unicode (invisibili) | | ChatGPT (GPT-4 / DALL·E) | Ricercatore: Johann Rehberger (Embrace The Red) | Ricerca / red-team | Confermato | Scritto fondativo e strumento "ASCII Smuggler": i code point del blocco Unicode Tags (intervallo U+E0000) rispecchiano l'ASCII ma vengono renderizzati in modo invisibile, mentre gli LLM continuano a interpretarli; istruzioni nascoste hanno indotto ChatGPT a invocare DALL·E. Base per l'intera classe delle iniezioni invisibili. | AML.T0051; AML.T0068 | Gen 2024 | https://embracethered.com/blog/posts/2024/hiding-and-finding-text-with-unicode-tags/ | | DPD support chatbot override | Prompt diretto | | | | In-the-wild: Ashley Beauchamp | In-the-wild | Confermato | Un cliente ha istruito il chatbot di supporto di DPD a ignorare le proprie regole, facendogli dire parolacce e scrivere una poesia denigratoria nei confronti di DPD — override diretto delle istruzioni; DPD ha disabilitato il bot lo stesso giorno. Il modello sottostante non è stato divulgato. (Manipolazione guidata dall'utente del bot con cui stava chattando; nessuna vittima terza né esfiltrazione.) | AML.T0051.000; AML.T0054 | Gen 2024 | https://www.theregister.com/2024/01/23/dpd_chatbot_goes_rogue | | Chevrolet dealership chatbot override ("$1 Tahoe") | Prompt diretto | | | Assistente di concessionaria basato su ChatGPT | In-the-wild: Chris Bakke | In-the-wild | Confermato | Un utente ha iniettato istruzioni facendo sì che l'assistente web basato su ChatGPT di una concessionaria Chevrolet "accettasse" di vendere un Tahoe 2024 per $1 e lo definisse legalmente vincolante — classico override diretto delle istruzioni (non vincolante nella realtà; guidato dall'utente, nessuna vittima terza). | AML.T0051.000 | Dic 2023 | https://the-decoder.com/people-buy-brand-new-chevrolets-for-1-from-a-chatgpt-chatbot/ | | Google Bard markdown-image exfiltration | Indiretto – documento / file; Indiretto – email | | | Google Bard | Ricercatore: Johann Rehberger (Embrace The Red) | Ricerca / red-team | Confermato | Un'iniezione di prompt indiretta in un Google Doc condiviso ha indotto Bard a emettere un'immagine markdown il cui URL incorporava i dati della chat dell'utente; il client caricava automaticamente l'immagine, esfiltrando i dati senza alcuna interazione dell'utente. Uno dei primi casi di esfiltrazione LLM zero-click; corretto Ott 2023. | AML.T0051.001; AML.T0057 | Nov 2023 | https://embracethered.com/blog/posts/2023/google-bard-data-exfiltration/ | | Multimodal image prompt injection (GPT-4V) | Multimodale – immagine | | | GPT-4V | Ricercatore: Riley Goodside (via Simon Willison) | Ricerca / red-team | Confermato | Un'immagine che sembra vuota contiene istruzioni in testo bianco sporco su sfondo bianco; l'OCR di GPT-4V le legge e le segue (la demo di Goodside ha indotto il modello a sopprimere la propria descrizione e a pubblicizzare una finta promozione). Prima iniezione di prompt multimodale. | AML.T0051.001 | Ott 2023 | https://simonwillison.net/2023/Oct/14/multi-modal-prompt-injection/ | | Base64 encoded-prompt jailbreak | Prompt diretto | Base64; Multi-livello | | GPT-4; Claude v1.3; GPT-3.5 Turbo | Ricercatore: Wei, Haghtalab, Steinhardt (UC Berkeley) | Ricerca / red-team | Confermato | Codificare una richiesta proibita in Base64 sfrutta la "mismatched generalization" — i modelli imparano a decodificare il Base64 nel pretraining ma il safety training non ha mai coperto tali input — aggirando le guardrail; gli attacchi combinati hanno raggiunto ~94% di successo su GPT-4. Pubblicato Lug 2023, appena prima della finestra di 2 anni; fonte primaria canonica per i jailbreak con payload codificati. | AML.T0054; AML.T0068; AML.T0051.000 | Lug 2023 | https://arxiv.org/abs/2307.02483 |


    Appendice A — Metodi di consegna (vocabolario controllato)

    Come le istruzioni iniettate raggiungono il modello. Estensibile; aggiungi qui un nuovo termine quando un report descrive un vettore genuinamente nuovo.- Prompt diretto — testo controllato dall'attaccante digitato direttamente nell'input del modello.

    • Indiretto – sito web / HTML — istruzioni incorporate in una pagina web che il modello naviga o riassume.
    • Indiretto – documento / file — payload all'interno di un PDF, DOCX, foglio di calcolo o altro file che il modello elabora.
    • Indiretto – email — istruzioni all'interno di un'email che un agente legge o smista.
    • Indiretto – RAG / contenuto recuperato — payload inserito in una knowledge base, vector store o risultato di ricerca che il modello recupera.
    • Tool-call / risultato di funzione — istruzioni restituite nell'output di uno strumento/funzione che l'agente invoca.
    • Server MCP / connessione — payload servito da un server Model Context Protocol o da una descrizione di strumento.
    • Multimodale – immagine — istruzioni in un'immagine (testo visibile, testo a basso contrasto o payload in pixel/metadati).
    • Multimodale – audio — istruzioni veicolate in un input audio.
    • Codice / contenuto di repository — payload in codice sorgente, commenti, issue o log CI che un agente legge.
    • Calendario / invito — istruzioni all'interno di un evento di calendario, invito o nota di riunione.

    Appendice B — Codifiche (vocabolario controllato)

    Offuscamento applicato al payload. Vuoto nella tabella significa che il payload era testo in chiaro o che il report non lo specificava.

    • Base64
    • Hex
    • ROT13
    • Leetspeak
    • Caratteri tag Unicode (invisibili) — glifi "tag" nell'intervallo U+E0000 che vengono renderizzati in modo invisibile.
    • Caratteri a larghezza zero — spazio/joiner a larghezza zero usato per nascondere o spezzare il testo.
    • Omoglifi — sostituti Unicode simili per lettere ASCII.
    • Contrabbando tramite emoji / variation selector
    • Commento HTML / Markdown — payload nascosto in commenti o markup non renderizzato.
    • Metadati / EXIF — istruzioni nei metadati di file o immagini.
    • Multi-livello — più di uno dei precedenti, sovrapposti.

    Appendice C — Comportamenti di propagazione (vocabolario controllato)

    Se l'iniezione è progettata per diffondersi o persistere. Vuoto nella tabella significa che non è stato segnalato alcun comportamento di propagazione.

    • Auto-propagante / worm (AI-to-AI) — l'output è costruito per diventare l'input iniettato del sistema successivo.
    • Persiste nella memoria dell'agente / di progetto — scritto nella memoria a lungo termine o di progetto in modo da riattivarsi nelle sessioni successive.
    • Si diffonde via MCP verso i connettori — un server MCP avvelenato consegna il payload a ogni client che si connette.
    • Si muove attraverso la catena di tool-call — trasportato in avanti lungo una sequenza di tool call all'interno di una singola esecuzione dell'agente.
    • Emette email / messaggi in uscita con ulteriori istruzioni — induce l'agente a inviare un messaggio che a sua volta veicola l'iniezione.
    • Avvelena data store condiviso / RAG — inserisce il payload dove i recuperi di altri utenti o agenti lo preleveranno.
    • Si diffonde tramite file di configurazione / regole condivisi — regole/configurazioni dannose dell'agente si propagano attraverso repository di regole condivisi o centrali in progetti derivati (CREDIT: Rachel James, basato sul report "Rules File Backdoor" di Pillar Security).
    • Cross-agent / cross-session — raggiunge altri agenti o sessioni successive oltre al contesto iniziale.

    Appendice D — Correlazione con MITRE ATLAS

    Le tecniche sono etichettate con gli ID delle tecniche MITRE ATLAS dove applicabile. Gli ID vengono validati a ogni aggiornamento rispetto alla fonte canonica mitre-atlas/atlas-data di MITRE (i dati che generano la matrice live; il sito atlas.mitre.org è un'app JS che blocca il fetch automatizzato). I comportamenti senza una mappatura ATLAS pulita sono annotati con un'etichetta coniata (CREDIT: Rachel James, basato sul report citato). ID usati in questo tracker:

    • AML.T0051 LLM Prompt Injection — AML.T0051.000 Direct, AML.T0051.001 Indirect
    • AML.T0053 AI Agent Tool Invocation (sostituisce il titolo ritirato "LLM Plugin Compromise")
    • AML.T0054 LLM Jailbreak
    • AML.T0057 LLM Data Leakage
    • AML.T0068 LLM Prompt Obfuscation

    Contributi benvenuti — vedi CONTRIBUTING.md, oppure invia una tecnica direttamente. Ogni riga proposta deve citare una fonte esplicita per ciascun campo non vuoto; le voci poco chiare sono contrassegnate come "Not fully vetted" anziché essere eliminate.

    Scarica lo strumento