Skip to content
KitploitKITPLOIT
OutilsExploitsBlog
Log in
Soumettre
OutilsExploitsBlog
Soumettre

Outils de Hacking, PenTest et Cybersécurité pour votre Arsenal de Sécurité !

Kitploit est un répertoire d'outils de hacking, de cybersécurité et de pentesting. Découvrez les dernières mises à jour des projets pour trouver des vulnérabilités, analyser des systèmes, automatiser les tests et renforcer votre sécurité.

··Flux·Contact·Confidentialité·© 2026 Kitploit

Répertoire d'outils

Catégories

Voir toutes les catégories
Loading categories
Prompt-Injection-in-the-Wild — Suivi des techniques d'injection de prompt signalées publiquement, classées par méthode de livraison, encodage et comportement de propagation, avec les modèles confirmés, les sources et les balises MITRE ATLAS. | Kitploit
Outils/GitHubGitHub/cybershujin/prompt-injection-in-the-wild
Gestion des Indicateurs de Compromission (IOC)Flux et Agrégateurs de MenacesAnalyse des VulnérabilitésRenseignement sur les MenacesArticles et RechercheApprentissage et ÉducationRessources OrganiséesSécurité de l'IA

Populaires

Voir tout →

Découvrez les outils les plus utilisés par notre communauté.

Explorer tous les outils

Parcourez notre collection d'outils

Voir tous les outils →
Attaque Adversariale
GitHubcybershujin/prompt-injection-in-the-wild

Prompt-Injection-in-the-Wild

Suivi des techniques d'injection de prompt signalées publiquement, classées par méthode de livraison, encodage et comportement de propagation, avec les modèles confirmés, les sources et les balises MITRE ATLAS.

Voir le dépôt
220il y a 12 joursPas encore vérifié
Partager

Injection de prompt dans la nature

Un tracker des techniques d'injection de prompt signalées publiquement sur environ les deux dernières années, maintenu par Rachel James (cybershujin).

Chaque technique est décomposée en trois éléments d'une injection de prompt :

  1. Méthode de livraison — comment les instructions injectées atteignent le modèle (un résultat d'appel d'outil, un site web externe, une connexion MCP, un document, un e-mail, une image, etc.).
  2. Encodage — l'obfuscation appliquée à la charge utile, le cas échéant (Base64, leetspeak, caractères de balise Unicode invisibles, homoglyphes, …). Vide lorsque la charge utile est en texte brut ou que le rapport ne le précise pas.
  3. Comportement de propagation — si l'injection est conçue pour se propager ou persister (diffusée à quiconque se connecte à un serveur MCP empoisonné, persistée dans la mémoire à long terme/de projet d'un agent, transportée le long d'une chaîne d'appels d'outils, amenée à émettre un e-mail portant d'autres instructions, …). Vide lorsqu'il n'y a pas de propagation.

Chaque entrée enregistre également les modèles contre lesquels elle a été confirmée fonctionner (le cas échéant), un lien vers la source du signalement, et — lorsque connu — la source de l'attaque (le chercheur, l'équipe rouge ou l'acteur en conditions réelles dont elle provient).

Tableau de bord en direct : https://cybershujin.github.io/Prompt-Injection-in-the-Wild/


Périmètre et méthodologie

  • Dans le périmètre : les techniques d'injection d'instructions adverses dans un LLM ou un agent propulsé par LLM qui ont été — par des chercheurs en sécurité, des équipes rouges, des fournisseurs, ou telles qu'observées en conditions réelles. L'injection de prompt directe et indirecte (portée par les données) sont incluses.
| Technique | Méthode de livraison | Encodage | Propagation | Modèles confirmés | Source de l'attaque | Preuve | Vérification | Résumé | ATLAS | Signalé | Lien |
signalées publiquement
  • Hors périmètre : les listes génériques de jailbreak sans mécanisme de livraison/propagation, les simples plaintes sur l'alignement des modèles, et le marketing sans substance technique.
  • Jamais deviné. Chaque cellule non vide est tirée d'une déclaration explicite dans la source citée. Si un rapport ne précise pas l'encodage, le comportement de propagation, les modèles confirmés ou la source de l'attaque, cette cellule est laissée vide — une cellule vide signifie « non précisé », jamais un « aucun » inféré.
  • Vérification. Chaque entrée est marquée Confirmed ou Not fully vetted. « Not fully vetted » signale une entrée dont la source est vague, non confirmée, ou dont le mécanisme est flou — elle est exposée plutôt qu'écartée, afin qu'un relecteur puisse en juger.
  • Classe de preuve — en conditions réelles vs. recherche. Chaque entrée est étiquetée In-the-wild (abus réel observé ou incident de production réel), Research / red-team (démonstration de chercheur en sécurité ou d'équipe rouge / divulgation responsable — une technique réelle et fonctionnelle, mais non observée comme exploitée par un attaquant), Vendor advisory, ou Unclear. Il s'agit d'un axe distinct de la vérification : une technique peut être Confirmed (vérifiée et fonctionnelle) tout en n'ayant jamais été démontrée qu'en laboratoire. À noter : une véritable injection de prompt malveillante en conditions réelles est encore rarement documentée publiquement, donc la grande majorité des entrées ici sont des divulgations de recherche / d'équipe rouge — au moment du remplissage initial, 29 sur 32 étaient de la recherche/équipe rouge et seulement 3 étaient en conditions réelles. Utilisez le filtre Evidence du tableau de bord pour isoler les cas réels.
  • Mises à jour. Les nouveaux signalements sont balayés mensuellement (Perplexity sonar-deep-research, large filet) et proposés sous forme de pull request en brouillon pour examen par le mainteneur. Rien n'est fusionné automatiquement. Voir le tracker frère Threat-Actors-use-of-Artifical-Intelligence pour le même flux de travail appliqué à l'usage de l'IA par les acteurs de menace.
  • Comment les données sont construites

    Les données résident uniquement dans le tableau ci-dessous (ce fichier est la source unique de vérité). Un générateur déterministe et sans dépendances (tools/build_exports.py) les compile à chaque commit en :

    • index.html — le tableau de bord interactif (servi via GitHub Pages),
    • tracker.json — données normalisées lisibles par machine,
    • stix/prompt-injection-stix2.1.json — un bundle STIX 2.1 (chaque technique comme attack-pattern, étiquetée avec son ID MITRE ATLAS et une correspondance Not fully vetted → faible confiance).

    Ne modifiez pas ces trois fichiers à la main ; modifiez le tableau et laissez la CI les reconstruire.


    Techniques

    |---|---|---|---|---|---|---|---|---|---|---|---| | ASCII smuggling across LLMs (FireTail) | Calendrier / invitation ; Indirect – e-mail | Caractères de balise Unicode (invisibles) | | Google Gemini ; Grok ; DeepSeek | Chercheur : Viktor Markopoulos (FireTail) | Recherche / red-team | Confirmé | Des caractères de balise Unicode invisibles cachés dans des invitations de calendrier et des e-mails ordinaires ont été interprétés par Gemini, Grok et DeepSeek mais n'ont pas été montrés à l'utilisateur ; ChatGPT, Copilot et Claude ont été trouvés en train de les nettoyer. Google a répondu « aucune action ». | AML.T0051.001 ; AML.T0068 | Oct 2025 | https://www.firetail.ai/blog/ghosts-in-the-machine-ascii-smuggling-across-various-llms | | CamoLeak (GitHub Copilot Chat) | Code / contenu de dépôt | Commentaire HTML / Markdown | | GitHub Copilot Chat | Chercheur : Omer Mayraz (Legit Security) | Recherche / red-team | Confirmé | CVE-2025-59145 (CVSS 9.6) : une injection de prompt invisible dans un commentaire HTML au sein d'une pull request a amené Copilot Chat à rechercher des secrets dans un dépôt privé et à les exfiltrer caractère par caractère via des URL d'images GitHub Camo pré-générées par l'attaquant ; corrigé en désactivant le rendu des images. | AML.T0051.001 ; AML.T0068 ; AML.T0057 | Oct 2025 | https://www.legitsecurity.com/blog/camoleak-critical-github-copilot-vulnerability-leaks-private-source-code | | Unseeable screenshot-OCR injection | Multimodal – image | | | Perplexity Comet ; Fellou ; Opera Neon | Chercheur : Artem Chaikin, Shivan Kaul Sahib (Brave) | Recherche / red-team | Confirmé | Des instructions d'injection de prompt rendues sous forme de texte à très faible contraste, quasi invisible, à l'intérieur d'images sur une page sont récupérées par l'OCR d'un navigateur IA lorsqu'il traite une capture d'écran, de sorte qu'un humain ne voit rien tandis que l'agent obéit. Démontré sur plusieurs navigateurs agentiques. | AML.T0051.001 ; AML.T0068 | Oct 2025 | https://brave.com/blog/unseeable-prompt-injections/ | | ChatGPT Atlas omnibox injection | Prompt direct ; Indirect – site web / HTML | | | ChatGPT Atlas | Chercheur : NeuralTrust | Recherche / red-team | Confirmé | Une chaîne qui ressemble à une URL mais échoue à l'analyse d'URL amène l'omnibox d'Atlas à traiter le texte intégré comme un prompt de confiance ; collée ou livrée derrière un bouton « Copier le lien », elle peut pousser l'agent à visiter des sites d'attaquants ou à supprimer des fichiers Google Drive dans la session authentifiée de l'utilisateur. | AML.T0051.000 ; AML.T0051.001 | Oct 2025 | https://neuraltrust.ai/blog/openai-atlas-omnibox-prompt-injection | | Invitation Is All You Need (Gemini) | Calendrier / invitation ; Indirect – e-mail | | Persiste dans la mémoire de l'agent / du projet ; Circule dans la chaîne d'appels d'outils ; Inter-agents / inter-sessions | Google Gemini (web, application mobile, assistant Android) | Chercheur : Or Yair, Ben Nassi, Stav Cohen (SafeBreach / Technion) | Recherche / red-team | Confirmé | Une invitation Google Calendar (ou un e-mail) dont les champs portent une injection de prompt indirecte détourne Gemini lorsque l'utilisateur interagit avec son calendrier ; 14 attaques démontrées couvrent l'empoisonnement de la mémoire à court/long terme, le détournement d'outils et l'invocation automatique d'agents/applications, atteignant les applications connectées et les appareils domotiques. | AML.T0051.001 ; AML.T0053 | Août 2025 | https://www.safebreach.com/blog/invitation-is-all-you-need-hacking-gemini/ | | MCPoison (Cursor MCP rug-pull) | Serveur MCP / connexion ; Code / contenu de dépôt | | | Cursor IDE (< v1.3) | Chercheur : Check Point Research | Recherche / red-team | Confirmé | CVE-2025-54136 : Cursor faisait confiance de manière permanente à une configuration MCP approuvée, de sorte qu'un attaquant qui fait approuver un mcp.json bénin dans un dépôt partagé peut ensuite y substituer une commande malveillante qui s'exécute silencieusement à chaque ouverture ultérieure du projet. | AML.T0051.001 ; AML.T0053 | Août 2025 | https://research.checkpoint.com/2025/cursor-vulnerability-mcpoison/ | | GitHub Copilot RCE / « YOLO mode » | Indirect – site web / HTML ; Code / contenu de dépôt ; Résultat d'appel d'outil / de fonction | Caractères de balise Unicode (invisibles) | | GitHub Copilot (VS Code — Windows, macOS, Linux) | Chercheur : Johann Rehberger (Embrace The Red) | Recherche / red-team | Confirmé | CVE-2025-53773 : une instruction injectée amène Copilot à modifier .vscode/settings.json pour activer chat.tools.autoApprove (« YOLO mode »), supprimant les invites d'approbation de commandes et permettant l'exécution de code arbitraire ; une variante utilisait des balises Unicode invisibles. | AML.T0051.001 ; AML.T0053 | Août 2025 | https://embracethered.com/blog/posts/2025/github-copilot-remote-code-execution-via-prompt-injection/ | | CurXecute (Cursor RCE via MCP) | Résultat d'appel d'outil / de fonction | | Circule dans la chaîne d'appels d'outils | Cursor (corrigé v1.3) | Chercheur : Aim Labs (Aim Security) | Recherche / red-team | Non entièrement vérifié | CVE-2025-54135 : une injection de prompt délivrée via une source de données MCP externe (par ex. un message Slack renvoyé par un outil) amène Cursor à réécrire son propre mcp.json, et l'exécution automatique lance la commande de l'attaquant sans approbation. La page principale d'Aim Labs était inaccessible lors de la vérification ; corroboré par des rapports secondaires. | AML.T0051.001 ; AML.T0053 | Août 2025 | https://www.catonetworks.com/blog/curxecute-rce/ | | AgentFlayer (ChatGPT Connectors) | Indirect – document / fichier | | | ChatGPT (Connectors) | Chercheur : Tamir Ishay Sharbat (Zenity Labs) | Recherche / red-team | Confirmé | Une charge utile invisible cachée dans un document partagé demande à ChatGPT — via des Connectors tels que Google Drive — de rendre une image markdown dont les paramètres d'URL transportent des données volées ; le rendu déclenche la requête sans aucun clic. | AML.T0051.001 ; AML.T0057 | Août 2025 | https://labs.zenity.io/post/agentflayer-chatgpt-connectors-0click-attack-5b41 | | Perplexity Comet Reddit injection | Indirect – site web / HTML | | | Perplexity Comet | Chercheur : Artem Chaikin, Shivan Kaul Sahib (Brave) | Recherche / red-team | Confirmé | Résumer une page Reddit dont un commentaire cachait des instructions derrière une balise spoiler a amené le navigateur Comet à lire l'e-mail de l'utilisateur et un code OTP Gmail depuis des sessions authentifiées et à les exfiltrer en répondant au commentaire. | AML.T0051.001 ; AML.T0057 | Août 2025 | https://brave.com/blog/comet-prompt-injection/ | | Amazon Q Developer wiper prompt | Code / contenu de dépôt | | | Amazon Q Developer (extension VS Code) | En conditions réelles : acteur « lkmanka58 » | En conditions réelles | Non entièrement vérifié | Un attaquant a fusionné une PR dans l'extension Amazon Q Developer, y implantant un prompt demandant à l'assistant d'effacer des fichiers locaux et des ressources AWS ; elle a été publiée en v1.84.0 avant retrait (ne se serait pas exécutée en raison du formatage, selon les rapports). Vérifié via des rapports agrégés ; source primaire non confirmée directement. | AML.T0051.001 | Juil 2025 | https://www.scworld.com/news/amazon-q-extension-for-vs-code-reportedly-injected-with-wiper-prompt | | EchoLeak (M365 Copilot, LLM Scope Violation) | Indirect – e-mail | | | Microsoft 365 Copilot | Chercheur : Aim Labs (Aim Security) | Recherche / red-team | Confirmé | CVE-2025-32711 (CVSS 9.3) : un seul e-mail conçu à cet effet a amené le moteur RAG de M365 Copilot à intégrer les instructions de l'attaquant dans le contexte aux côtés de données privilégiées (« LLM Scope Violation ») et à les exfiltrer sans aucune interaction de l'utilisateur, contournant le classifieur XPIA et la rédaction des liens/images ; corrigé côté serveur. | AML.T0051.001 ; AML.T0057 | Juin 2025 | https://www.aim.security/lp/aim-labs-echoleak-m365 | | GitHub MCP toxic agent flow | Code / contenu de dépôt ; Serveur MCP / connexion | | Circule dans la chaîne d'appels d'outils | Claude 4 Opus (Claude Desktop + GitHub MCP) | Chercheur : Invariant Labs | Recherche / red-team | Confirmé | Une injection de prompt implantée dans une issue GitHub publique, atteinte via le serveur GitHub MCP, contraint l'agent à extraire des données d'un dépôt privé dans son contexte et à les divulguer dans une pull request publique créée de manière autonome ; aucun composant ne dysfonctionne. | AML.T0051.001 ; AML.T0057 ; AML.T0053 | Mai 2025 | https://invariantlabs.ai/blog/mcp-github-vulnerability | | Character-injection guardrail evasion | Prompt direct | Caractères de largeur nulle ; Homoglyphes ; Contrebande d'emoji / sélecteurs de variation ; Multicouche | | Azure Prompt Shield ; Meta Prompt Guard ; ProtectAI Prompt Injection v1/v2 ; NVIDIA NeMo Guard ; Vijil | Chercheur : Mindgard / Université de Lancaster (Hackett et al.) | Recherche / red-team | Confirmé | Étude systématique : les caractères non imprimables de largeur nulle, la substitution par homoglyphes et la contrebande via sélecteurs de variation d'emoji contournent les classifieurs commerciaux de garde-fous contre l'injection de prompt / le jailbreak (les cibles confirmées sont les systèmes de détection, pas les LLM) ; la largeur nulle a atteint en moyenne 44–76 % d'évasion, la contrebande d'emoji étant la plus élevée. | AML.T0068 ; AML.T0051 | Avr 2025 | https://arxiv.org/html/2504.11168v1 | | MCP tool poisoning | Serveur MCP / connexion | | Circule dans la chaîne d'appels d'outils | Cursor | Chercheur : Invariant Labs | Recherche / red-team | Confirmé | Des instructions malveillantes intégrées dans la description d'un outil MCP sont invisibles pour l'utilisateur mais lues par le modèle ; un outil « add » empoisonné a silencieusement amené Cursor à lire et exfiltrer la clé SSH du développeur tout en renvoyant un résultat correct. Anthropic, OpenAI et Zapier sont cités comme clients affectés. | AML.T0051.001 ; AML.T0053 | Avr 2025 | https://invariantlabs.ai/blog/mcp-security-notification-tool-poisoning-attacks | | MCP line jumping | Serveur MCP / connexion | | | Claude Desktop | Red team : Trail of Bits | Recherche / red-team | Confirmé | Parce que les clients MCP chargent chaque description d'outil dans le contexte du modèle dès qu'un serveur est listé, une description malveillante peut altérer le comportement du modèle avant même qu'un outil ne soit invoqué, contournant l'étape d'approbation des appels d'outils par l'utilisateur. | AML.T0051.001 ; AML.T0053 | Avr 2025 | https://blog.trailofbits.com/2025/04/21/jumping-the-line-how-mcp-servers-can-attack-you-before-you-ever-use-them/ | | MCP rug pull | Serveur MCP / connexion | | | | Chercheur : Invariant Labs | Recherche / red-team | Confirmé | Un serveur MCP malveillant présente un outil bénin pour obtenir l'approbation, puis y substitue silencieusement des instructions empoisonnées par la suite ; les clients ne redemandent pas d'approbation car l'identité de l'outil est inchangée. | AML.T0051.001 ; AML.T0053 | Avr 2025 | https://invariantlabs.ai/blog/mcp-security-notification-tool-poisoning-attacks | | Rules File Backdoor (Cursor / Copilot) | Code / contenu de dépôt | Caractères de largeur nulle ; Caractères de balise Unicode (invisibles) | Se propage via des fichiers de configuration / règles partagés | Cursor ; GitHub Copilot | Chercheur : Ziv Karliner (Pillar Security) | Recherche / red-team | Confirmé | Des instructions en Unicode invisible cachées dans les fichiers de « règles »/configuration de codage IA orientent silencieusement Cursor et GitHub Copilot pour insérer des portes dérobées dans le code généré, sans rien afficher dans le chat ni les journaux ; les caractères cachés sont invisibles même dans la vue de revue de PR de GitHub. | AML.T0051.001 ; AML.T0068 | Mars 2025 | https://www.pillar.security/blog/new-vulnerability-in-github-copilot-and-cursor-how-hackers-can-weaponize-code-agents | | Gemini memory persistence (delayed tool invocation) | Indirect – document / fichier | | Persiste dans la mémoire de l'agent / du projet ; Inter-agents / inter-sessions | Gemini Advanced | Chercheur : Johann Rehberger (Embrace The Red) | Recherche / red-team | Confirmé | Un document malveillant téléversé empoisonne le chat de sorte que, lorsque l'utilisateur prononce plus tard un mot déclencheur, Gemini invoque son outil de mémoire « au nom de l'utilisateur » (« delayed tool invocation ») et écrit de faux souvenirs à long terme choisis par l'attaquant qui persistent au fil des sessions futures. | AML.T0051.001 ; AML.T0053 | Fév 2025 | https://embracethered.com/blog/posts/2025/gemini-memory-persistence-prompt-injection/ | | ZombAIs (Claude Computer Use C2) | Indirect – site web / HTML | | | Claude Computer Use | Chercheur : Johann Rehberger (Embrace The Red) | Recherche / red-team | Confirmé | Une page web malveillante injecte des instructions qui amènent Claude Computer Use à télécharger et exécuter un binaire qui se reconnecte au serveur du chercheur — une chaîne complète d'injection de prompt à commande et contrôle sur un agent utilisant un ordinateur. | AML.T0051.001 ; AML.T0053 | Oct 2024 | https://embracethered.com/blog/posts/2024/claude-computer-use-c2-the-zombais-are-coming/ | | SpAIware (ChatGPT memory) | Indirect – site web / HTML ; Indirect – document / fichier | | Persiste dans la mémoire de l'agent / du projet ; Inter-agents / inter-sessions | ChatGPT (application macOS) | Chercheur : Johann Rehberger (Embrace The Red) | Recherche / red-team | Confirmé | Une injection de prompt provenant de contenu web/document non fiable écrit une instruction persistante dans la mémoire à long terme de ChatGPT, provoquant une exfiltration continue (via des URL d'images rendues) de tout ce que l'utilisateur tape ou reçoit dans toutes les sessions futures jusqu'à ce que la mémoire soit supprimée. | AML.T0051.001 ; AML.T0057 | Sep 2024 | https://embracethered.com/blog/posts/2024/chatgpt-macos-app-persistent-data-exfiltration/ | | M365 Copilot ASCII smuggling exfiltration | Indirect – e-mail ; Indirect – document / fichier | Caractères de balise Unicode (invisibles) | Circule dans la chaîne d'appels d'outils | Microsoft 365 Copilot | Chercheur : Johann Rehberger (Embrace The Red) | Recherche / red-team | Confirmé | Une injection de prompt cachée dans un e-mail malveillant ou un document partagé a amené M365 Copilot à rechercher automatiquement dans d'autres e-mails/documents, puis a utilisé la contrebande ASCII (balises Unicode invisibles) pour intégrer les données collectées (par ex. codes MFA) dans des hyperliens cliquables rendus à l'utilisateur ; corrigé vers juil. 2024. | AML.T0051.001 ; AML.T0068 ; AML.T0057 ; AML.T0053 | Août 2024 | https://embracethered.com/blog/posts/2024/m365-copilot-prompt-injection-tool-invocation-and-data-exfil-using-ascii-smuggling/ | | Slack AI indirect injection exfiltration | Indirect – contenu RAG / récupéré | | Empoisonne le magasin de données partagé / RAG | Slack AI | Red team : PromptArmor | Recherche / red-team | Confirmé | Un attaquant implante des instructions dans un canal Slack public ; Slack AI les ingère dans son pipeline RAG, et lorsqu'une victime l'interroge plus tard, l'instruction injectée rend un lien markdown qui fait passer en contrebande des données de canaux privés (par ex. une clé API) dans l'URL vers l'attaquant. | AML.T0051.001 ; AML.T0057 | Août 2024 | https://www.promptarmor.com/resources/data-exfiltration-from-slack-ai-via-indirect-prompt-injection | | GitHub Copilot Chat data exfiltration | Code / contenu de dépôt | | | GitHub Copilot Chat (GPT-4) | Chercheur : Johann Rehberger (Embrace The Red) | Recherche / red-team | Confirmé | Des instructions élaborées dans un fichier de code source ont amené GitHub Copilot Chat à émettre une image markdown dont l'URL transportait des données de conversation antérieures ; lors du rendu automatique, les données ont été exfiltrées vers l'attaquant. | AML.T0051.001 ; AML.T0057 | Juin 2024 | https://embracethered.com/blog/posts/2024/github-copilot-chat-prompt-injection-data-exfiltration/ | | Morris II (self-replicating GenAI worm) | Indirect – contenu RAG / récupéré ; Indirect – e-mail ; Multimodal – image | | Auto-propagé / ver (IA à IA) ; Empoisonne le magasin de données partagé / RAG ; Émet un e-mail / message sortant avec d'autres instructions ; Inter-agents / inter-sessions | Gemini Pro ; ChatGPT 4.0 ; LLaVA | Chercheur : Stav Cohen (Technion), Ron Bitton (Intuit), Ben Nassi (Cornell Tech) | Recherche / red-team | Confirmé | Un « prompt adversarial auto-répliquant » amène un assistant e-mail GenAI basé sur RAG à copier le prompt dans sa propre sortie et à le transmettre à d'autres agents, déclenchant une cascade de type ver d'injections de prompt indirectes qui spamme et exfiltre des données. Démontré avec des charges utiles textuelles et imagées. | AML.T0051.001 | Mars 2024 | https://arxiv.org/abs/2403.02817 | | Hidden prompt injection against Claude (Unicode tags) | Prompt direct | Caractères de balise Unicode (invisibles) | | Anthropic Claude | Chercheur : Johann Rehberger (Embrace The Red) | Recherche / red-team | Confirmé | Claude a interprété des points de code de balise Unicode invisibles collés dans son interface — le même comportement d'instruction cachée que celui observé contre ChatGPT. Anthropic a examiné et classé le problème « Non applicable » (aucun impact de sécurité identifié), mais le comportement d'interprétation a été démontré. | AML.T0051.000 ; AML.T0068 | Fév 2024 | https://embracethered.com/blog/posts/2024/claude-hidden-prompt-injection-ascii-smuggling/ | | ASCII smuggling / invisible Unicode tags (foundational) | Indirect – site web / HTML ; Indirect – document / fichier ; Prompt direct | Caractères de balise Unicode (invisibles) | | ChatGPT (GPT-4 / DALL·E) | Chercheur : Johann Rehberger (Embrace The Red) | Recherche / red-team | Confirmé | Article fondateur et outil « ASCII Smuggler » : les points de code du bloc Unicode Tags (plage U+E0000) reproduisent l'ASCII mais s'affichent de manière invisible, tandis que les LLM les interprètent toujours ; des instructions cachées ont amené ChatGPT à invoquer DALL·E. Base de toute la classe des injections invisibles. | AML.T0051 ; AML.T0068 | Jan 2024 | https://embracethered.com/blog/posts/2024/hiding-and-finding-text-with-unicode-tags/ | | DPD support chatbot override | Prompt direct | | | | En conditions réelles : Ashley Beauchamp | En conditions réelles | Confirmé | Un client a demandé au chatbot d'assistance de DPD d'ignorer ses règles, le faisant jurer et écrire un poème dénigrant DPD — contournement direct des instructions ; DPD a désactivé le bot le jour même. Le modèle sous-jacent n'a pas été divulgué. (Manipulation par l'utilisateur du bot avec lequel il discutait ; aucune victime tierce ni exfiltration.) | AML.T0051.000 ; AML.T0054 | Jan 2024 | https://www.theregister.com/2024/01/23/dpd_chatbot_goes_rogue | | Chevrolet dealership chatbot override (« $1 Tahoe ») | Prompt direct | | | Assistant de concession basé sur ChatGPT | En conditions réelles : Chris Bakke | En conditions réelles | Confirmé | Un utilisateur a injecté des instructions amenant l'assistant de site web d'une concession Chevrolet, basé sur ChatGPT, à « accepter » de vendre un Tahoe 2024 pour 1 $ et à le qualifier de juridiquement contraignant — contournement direct classique des instructions (non contraignant en réalité ; piloté par l'utilisateur, aucune victime tierce). | AML.T0051.000 | Déc 2023 | https://the-decoder.com/people-buy-brand-new-chevrolets-for-1-from-a-chatgpt-chatbot/ | | Google Bard markdown-image exfiltration | Indirect – document / fichier ; Indirect – e-mail | | | Google Bard | Chercheur : Johann Rehberger (Embrace The Red) | Recherche / red-team | Confirmé | Une injection de prompt indirecte dans un Google Doc partagé a amené Bard à émettre une image markdown dont l'URL intégrait les données de chat de l'utilisateur ; le client a chargé automatiquement l'image, exfiltrant les données sans interaction de l'utilisateur. L'un des premiers cas d'exfiltration LLM sans clic ; corrigé en oct. 2023. | AML.T0051.001 ; AML.T0057 | Nov 2023 | https://embracethered.com/blog/posts/2023/google-bard-data-exfiltration/ | | Multimodal image prompt injection (GPT-4V) | Multimodal – image | | | GPT-4V | Chercheur : Riley Goodside (via Simon Willison) | Recherche / red-team | Confirmé | Une image qui semble vide porte des instructions en texte blanc cassé sur fond blanc ; l'OCR de GPT-4V les lit et les suit (la démo de Goodside a amené le modèle à supprimer sa description et à faire la publicité d'une fausse promotion). Première injection de prompt multimodale. | AML.T0051.001 | Oct 2023 | https://simonwillison.net/2023/Oct/14/multi-modal-prompt-injection/ | | Base64 encoded-prompt jailbreak | Prompt direct | Base64 ; Multicouche | | GPT-4 ; Claude v1.3 ; GPT-3.5 Turbo | Chercheur : Wei, Haghtalab, Steinhardt (UC Berkeley) | Recherche / red-team | Confirmé | Encoder une requête interdite en Base64 exploite la « généralisation inadéquate » — les modèles apprennent à décoder le Base64 lors du pré-entraînement mais l'entraînement de sécurité n'a jamais couvert de telles entrées — contournant les garde-fous ; les attaques combinées ont atteint ~94 % de réussite sur GPT-4. Publié en juil. 2023, juste avant la fenêtre de 2 ans ; source primaire canonique pour les jailbreaks à charge utile encodée. | AML.T0054 ; AML.T0068 ; AML.T0051.000 | Juil 2023 | https://arxiv.org/abs/2307.02483 |


    Annexe A — Méthodes de livraison (vocabulaire contrôlé)

    Comment les instructions injectées atteignent le modèle. Extensible ; ajoutez un nouveau terme ici lorsqu'un rapport décrit un vecteur véritablement nouveau.- Invite directe — texte contrôlé par l'attaquant saisi directement dans l'entrée du modèle.

    • Indirect – site web / HTML — instructions intégrées dans une page web que le modèle parcourt ou résume.
    • Indirect – document / fichier — charge utile à l'intérieur d'un PDF, DOCX, tableur ou autre fichier que le modèle ingère.
    • Indirect – e-mail — instructions à l'intérieur d'un e-mail qu'un agent lit ou trie.
    • Indirect – RAG / contenu récupéré — charge utile implantée dans une base de connaissances, un magasin vectoriel ou un résultat de recherche que le modèle récupère.
    • Appel d'outil / résultat de fonction — instructions renvoyées dans la sortie d'un outil/de une fonction que l'agent invoque.
    • Serveur MCP / connexion — charge utile servie par un serveur Model Context Protocol ou une description d'outil.
    • Multimodal – image — instructions dans une image (texte visible, texte à faible contraste, ou charge utile dans les pixels/métadonnées).
    • Multimodal – audio — instructions portées par une entrée audio.
    • Contenu de code / dépôt — charge utile dans le code source, les commentaires, les issues ou les journaux de CI qu'un agent lit.
    • Calendrier / invitation — instructions à l'intérieur d'un événement de calendrier, d'une invitation ou d'une note de réunion.

    Annexe B — Encodages (vocabulaire contrôlé)

    Obfuscation appliquée à la charge utile. Une case vide dans le tableau signifie que la charge utile était en texte clair ou que le rapport ne l'a pas précisé.

    • Base64
    • Hex
    • ROT13
    • Leetspeak
    • Caractères de balise Unicode (invisibles) — glyphes « tag » de la plage U+E0000 qui s'affichent de manière invisible.
    • Caractères de largeur nulle — espace/jointeur de largeur nulle utilisé pour masquer ou scinder du texte.
    • Homoglyphes — substituts Unicode ressemblants pour les lettres ASCII.
    • Contrebande par emoji / sélecteur de variation
    • Commentaire HTML / Markdown — charge utile dissimulée dans des commentaires ou du balisage non rendu.
    • Métadonnées / EXIF — instructions dans les métadonnées d'un fichier ou d'une image.
    • Multi-couche — plus d'un des éléments ci-dessus, empilés.

    Annexe C — Comportements de propagation (vocabulaire contrôlé)

    Si l'injection est conçue pour se propager ou persister. Une case vide dans le tableau signifie qu'aucun comportement de propagation n'a été signalé.

    • Auto-propagateur / ver (IA-vers-IA) — la sortie est conçue pour devenir l'entrée injectée du système suivant.
    • Persiste dans la mémoire de l'agent / du projet — écrit dans la mémoire à long terme ou de projet afin de se redéclencher lors de sessions ultérieures.
    • Se propage via MCP vers les connecteurs — un serveur MCP empoisonné délivre la charge utile à chaque client qui s'y connecte.
    • Circule dans la chaîne d'appels d'outils — transporté à travers une séquence d'appels d'outils au sein d'une même exécution d'agent.
    • Émet un e-mail / message sortant avec d'autres instructions — amène l'agent à envoyer un message qui porte lui-même l'injection.
    • Empoisonne un magasin de données partagé / RAG — implante la charge utile là où les récupérations d'autres utilisateurs ou agents la récupéreront.
    • Se propage via des fichiers de configuration / règles partagés — des règles/configurations d'agent malveillantes se propagent via des dépôts de règles partagés ou centraux vers les projets dérivés (CRÉDIT : Rachel James, d'après le rapport « Rules File Backdoor » de Pillar Security).
    • Inter-agents / inter-sessions — atteint d'autres agents ou des sessions ultérieures au-delà du contexte initial.

    Annexe D — Correspondance MITRE ATLAS

    Les techniques sont étiquetées avec les identifiants de technique MITRE ATLAS lorsqu'un identifiant s'applique. Les identifiants sont validés à chaque mise à jour par rapport à la source canonique mitre-atlas/atlas-data de MITRE (les données qui génèrent la matrice en direct ; le site atlas.mitre.org est une application JS qui bloque la récupération automatisée). Les comportements sans correspondance ATLAS claire sont signalés par une étiquette forgée (CRÉDIT : Rachel James, d'après le rapport cité). Identifiants utilisés dans ce tracker :

    • AML.T0051 LLM Prompt Injection — AML.T0051.000 Direct, AML.T0051.001 Indirect
    • AML.T0053 AI Agent Tool Invocation (remplace le titre retiré « LLM Plugin Compromise »)
    • AML.T0054 LLM Jailbreak
    • AML.T0057 LLM Data Leakage
    • AML.T0068 LLM Prompt Obfuscation

    Contributions bienvenues — voir CONTRIBUTING.md, ou soumettre une technique directement. Chaque ligne proposée doit citer une source explicite pour chaque champ non vide ; les entrées peu claires sont marquées « Not fully vetted » plutôt que supprimées.

    Télécharger l’outil