Skip to content
KitploitKITPLOIT
ToolsExploitsBlog
Log in
Einreichen
ToolsExploitsBlog
Einreichen

Hacking-, PenTest- und Cybersicherheits-Tools für Ihr Sicherheitsarsenal!

Kitploit ist ein Verzeichnis von Hacking-, Cybersicherheits- und Pentesting-Tools. Entdecken Sie die neuesten Projekt-Updates, um Schwachstellen zu finden, Systeme zu analysieren, Tests zu automatisieren und Ihre Sicherheit zu stärken.

··Feeds·Kontakt·Datenschutz·© 2026 Kitploit

Tool-Verzeichnis

Kategorien

Alle Kategorien anzeigen
Loading categories
Prompt-Injection-in-the-Wild — Tracker öffentlich gemeldeter Prompt-Injection-Techniken, aufgeschlüsselt nach Übermittlungsmethode, Kodierung und Ausbreitungsverhalten, mit bestätigten Modellen, Quellen und MITRE-ATLAS-Tags. | Kitploit
Tools/GitHubGitHub/cybershujin/prompt-injection-in-the-wild
Management von Indicators of Compromise (IOC)Bedrohungsfeeds & AggregatorenSchwachstellenanalyseBedrohungsanalysePapers & ForschungLernen & BildungKuratierte RessourcenKI-SicherheitAdversarial-Angriff

Beliebteste

Alle anzeigen →

Entdecken Sie die meistgenutzten Tools unserer Community.

Alle Tools erkunden

Durchsuchen Sie unsere Tool-Sammlung

Alle Tools anzeigen →
GitHubcybershujin/prompt-injection-in-the-wild

Prompt-Injection-in-the-Wild

Tracker öffentlich gemeldeter Prompt-Injection-Techniken, aufgeschlüsselt nach Übermittlungsmethode, Kodierung und Ausbreitungsverhalten, mit bestätigten Modellen, Quellen und MITRE-ATLAS-Tags.

Repository anzeigen
226vor 12 TagenNoch nicht geprüft
Teilen

Prompt-Injection in freier Wildbahn

Ein Tracker für öffentlich gemeldete Prompt-Injection-Techniken aus ungefähr den letzten zwei Jahren, gepflegt von Rachel James (cybershujin).

Jede Technik wird in die drei Elemente einer Prompt-Injection unterteilt:

  1. Übertragungsmethode — wie die injizierten Anweisungen das Modell erreichen (ein Tool-Call-Ergebnis, eine externe Website, eine MCP-Verbindung, ein Dokument, eine E-Mail, ein Bild usw.).
  2. Kodierung — die auf die Payload angewandte Verschleierung, falls vorhanden (Base64, Leetspeak, unsichtbare Unicode-Tag-Zeichen, Homoglyphen, …). Leer, wenn die Payload Klartext ist oder der Bericht nichts dazu sagt.
  3. Ausbreitungsverhalten — ob die Injection darauf ausgelegt ist, sich zu verbreiten oder zu persistieren (an jeden ausgeliefert, der sich mit einem vergifteten MCP-Server verbindet, im Langzeit-/Projektgedächtnis eines Agenten persistiert, entlang einer Kette von Tool-Calls mitgeführt, dazu gebracht, eine E-Mail mit weiteren Anweisungen zu versenden, …). Leer, wenn keine Ausbreitung vorliegt.

Jeder Eintrag erfasst außerdem die Modelle, gegen die sie nachweislich funktioniert (falls vorhanden), einen Link zur meldenen Quelle und — sofern bekannt — die Angriffsquelle (der Forscher, das Red Team oder der Akteur in freier Wildbahn, von dem sie stammt).

Live-Dashboard: https://cybershujin.github.io/Prompt-Injection-in-the-Wild/


Umfang & Methodik

  • Im Umfang: Techniken zum Injizieren adversarieller Anweisungen in ein LLM oder einen LLM-gestützten Agenten, die öffentlich gemeldet wurden — von Sicherheitsforschern, Red Teams, Herstellern oder als in freier Wildbahn beobachtete Aktivität. Sowohl direkte als auch indirekte (datengetragene) Prompt-Injection sind enthalten.
| Technik | Übermittlungsmethode | Kodierung | Verbreitung | Bestätigte Modelle | Angriffsquelle | Nachweis | Prüfung | Kurzbeschreibung | ATLAS | Gemeldet | Link |
  • Außerhalb des Umfangs: generische Jailbreak-Wortlisten ohne Übertragungs-/Ausbreitungsmechanismus, reine Beschwerden über Modellausrichtung und Marketing ohne technische Substanz.
  • Niemals geraten. Jede nicht leere Zelle stammt aus einer expliziten Aussage in der zitierten Quelle. Wenn ein Bericht die Kodierung, das Ausbreitungsverhalten, die bestätigten Modelle oder die Angriffsquelle nicht angibt, bleibt diese Zelle leer — eine leere Zelle bedeutet „nicht angegeben“, niemals ein abgeleitetes „keine“.
  • Prüfung. Jeder Eintrag ist als Confirmed oder Not fully vetted markiert. „Not fully vetted“ kennzeichnet einen Eintrag, dessen Quelle vage, unbestätigt oder dessen Mechanismus unklar ist — er wird sichtbar gemacht statt verworfen, damit ein Prüfer ihn beurteilen kann.
  • Evidenzklasse — in freier Wildbahn vs. Forschung. Jeder Eintrag ist getaggt als In-the-wild (beobachteter realer Missbrauch oder ein echter Produktionsvorfall), Research / red-team (eine Demonstration / verantwortungsvolle Offenlegung eines Sicherheitsforschers oder Red Teams — eine echte, funktionierende Technik, aber nicht als von einem Angreifer missbraucht beobachtet), Vendor advisory oder Unclear. Dies ist eine von der Prüfung getrennte Achse: Eine Technik kann Confirmed (verifiziert und funktionierend) sein und dennoch nur im Labor demonstriert worden sein. Beachten Sie: Echte bösartige Prompt-Injection in freier Wildbahn wird öffentlich noch selten dokumentiert, daher sind die große Mehrheit der Einträge hier Research-/Red-Team-Offenlegungen — zum Zeitpunkt der anfänglichen Nacherfassung waren 29 von 32 Research/Red-Team und nur 3 in freier Wildbahn. Verwenden Sie den Evidence-Filter im Dashboard, um die realen Fälle zu isolieren.
  • Aktualisierungen. Neue Berichte werden monatlich erfasst (Perplexity sonar-deep-research, breites Netz) und als Draft-Pull-Request zur Prüfung durch die Maintainer vorgeschlagen. Nichts wird automatisch gemergt. Siehe den verwandten Tracker Threat-Actors-use-of-Artifical-Intelligence für denselben Workflow, angewandt auf die KI-Nutzung durch Bedrohungsakteure.
  • Wie die Daten aufgebaut sind

    Die Daten liegen ausschließlich in der untenstehenden Tabelle (diese Datei ist die einzige Quelle der Wahrheit). Ein deterministischer, abhängigkeitsfreier Generator (tools/build_exports.py) kompiliert sie bei jedem Commit in:

    • index.html — das interaktive Dashboard (bereitgestellt über GitHub Pages),
    • tracker.json — normalisierte maschinenlesbare Daten,
    • stix/prompt-injection-stix2.1.json — ein STIX-2.1-Bundle (jede Technik als attack-pattern, getaggt mit ihrer MITRE-ATLAS-ID und einem Not fully vetted → Low-Confidence-Mapping).

    Bearbeiten Sie diese drei Dateien nicht manuell; bearbeiten Sie die Tabelle und lassen Sie CI sie neu erstellen.


    Techniken

    |---|---|---|---|---|---|---|---|---|---|---|---| | ASCII-Schmuggel über LLMs hinweg (FireTail) | Kalender / Einladung; Indirekt – E-Mail | Unicode-Tag-Zeichen (unsichtbar) | | Google Gemini; Grok; DeepSeek | Forscher: Viktor Markopoulos (FireTail) | Forschung / Red-Team | Bestätigt | Unsichtbare Unicode-Tag-Zeichen, die in gewöhnlichen Kalendereinladungen und E-Mails versteckt waren, wurden von Gemini, Grok und DeepSeek interpretiert, dem Nutzer aber nicht angezeigt; ChatGPT, Copilot und Claude entfernten sie nachweislich. Google antwortete mit „no action". | AML.T0051.001; AML.T0068 | Okt. 2025 | https://www.firetail.ai/blog/ghosts-in-the-machine-ascii-smuggling-across-various-llms | | CamoLeak (GitHub Copilot Chat) | Code / Repository-Inhalt | HTML- / Markdown-Kommentar | | GitHub Copilot Chat | Forscher: Omer Mayraz (Legit Security) | Forschung / Red-Team | Bestätigt | CVE-2025-59145 (CVSS 9.6): Eine unsichtbare Prompt-Injection in einem HTML-Kommentar in einem Pull Request veranlasste Copilot Chat, ein privates Repository nach Geheimnissen zu durchsuchen und sie Zeichen für Zeichen über vom Angreifer vorab generierte GitHub-Camo-Bild-URLs zu exfiltrieren; behoben durch Deaktivierung der Bilddarstellung. | AML.T0051.001; AML.T0068; AML.T0057 | Okt. 2025 | https://www.legitsecurity.com/blog/camoleak-critical-github-copilot-vulnerability-leaks-private-source-code | | Unsichtbare Screenshot-OCR-Injection | Multimodal – Bild | | | Perplexity Comet; Fellou; Opera Neon | Forscher: Artem Chaikin, Shivan Kaul Sahib (Brave) | Forschung / Red-Team | Bestätigt | Prompt-Injection-Anweisungen, die als nahezu unsichtbarer Text mit geringem Kontrast in Bilder auf der Seite eingebettet sind, werden von der OCR eines KI-Browsers wiederhergestellt, wenn dieser einen Screenshot verarbeitet, sodass ein Mensch nichts sieht, während der Agent gehorcht. Demonstriert über mehrere agentische Browser hinweg. | AML.T0051.001; AML.T0068 | Okt. 2025 | https://brave.com/blog/unseeable-prompt-injections/ | | ChatGPT Atlas Omnibox-Injection | Direkter Prompt; Indirekt – Website / HTML | | | ChatGPT Atlas | Forscher: NeuralTrust | Forschung / Red-Team | Bestätigt | Eine Zeichenkette, die wie eine URL aussieht, aber die URL-Analyse fehlschlägt, veranlasst die Omnibox von Atlas, den eingebetteten Text als vertrauenswürdigen Prompt zu behandeln; eingefügt oder hinter einem „Copy link"-Button geliefert, kann sie den Agenten dazu bringen, Angreifer-Websites zu besuchen oder Google-Drive-Dateien in der authentifizierten Sitzung des Nutzers zu löschen. | AML.T0051.000; AML.T0051.001 | Okt. 2025 | https://neuraltrust.ai/blog/openai-atlas-omnibox-prompt-injection | | Invitation Is All You Need (Gemini) | Kalender / Einladung; Indirekt – E-Mail | | Persistiert im Agenten- / Projektgedächtnis; Bewegt sich durch Tool-Aufrufkette; Cross-Agent / Cross-Session | Google Gemini (Web, mobile App, Android-Assistent) | Forscher: Or Yair, Ben Nassi, Stav Cohen (SafeBreach / Technion) | Forschung / Red-Team | Bestätigt | Eine Google-Kalender-Einladung (oder E-Mail), deren Felder eine indirekte Prompt-Injection tragen, übernimmt Gemini, wenn der Nutzer mit seinem Kalender interagiert; 14 demonstrierte Angriffe umfassen Kurz-/Langzeitgedächtnisvergiftung, Tool-Missbrauch und automatische Agenten-/App-Aufrufe bis hin zu verbundenen Apps und Smart-Home-Geräten. | AML.T0051.001; AML.T0053 | Aug. 2025 | https://www.safebreach.com/blog/invitation-is-all-you-need-hacking-gemini/ | | MCPoison (Cursor MCP Rug-Pull) | MCP-Server / Verbindung; Code / Repository-Inhalt | | | Cursor IDE (< v1.3) | Forscher: Check Point Research | Forschung / Red-Team | Bestätigt | CVE-2025-54136: Cursor vertraute einer genehmigten MCP-Konfiguration dauerhaft, sodass ein Angreifer, der eine harmlose mcp.json in einem geteilten Repository genehmigt bekommt, später einen bösartigen Befehl austauschen kann, der bei jedem weiteren Öffnen des Projekts still ausgeführt wird. | AML.T0051.001; AML.T0053 | Aug. 2025 | https://research.checkpoint.com/2025/cursor-vulnerability-mcpoison/ | | GitHub Copilot RCE / „YOLO mode" | Indirekt – Website / HTML; Code / Repository-Inhalt; Tool-Aufruf / Funktionsergebnis | Unicode-Tag-Zeichen (unsichtbar) | | GitHub Copilot (VS Code — Windows, macOS, Linux) | Forscher: Johann Rehberger (Embrace The Red) | Forschung / Red-Team | Bestätigt | CVE-2025-53773: Eine injizierte Anweisung bringt Copilot dazu, .vscode/settings.json zu bearbeiten, um chat.tools.autoApprove („YOLO mode") zu aktivieren, wodurch Befehlsgenehmigungsabfragen entfallen und beliebige Codeausführung ermöglicht wird; eine Variante nutzte unsichtbare Unicode-Tags. | AML.T0051.001; AML.T0053 | Aug. 2025 | https://embracethered.com/blog/posts/2025/github-copilot-remote-code-execution-via-prompt-injection/ | | CurXecute (Cursor RCE über MCP) | Tool-Aufruf / Funktionsergebnis | | Bewegt sich durch Tool-Aufrufkette | Cursor (behoben v1.3) | Forscher: Aim Labs (Aim Security) | Forschung / Red-Team | Nicht vollständig geprüft | CVE-2025-54135: Eine Prompt-Injection, die über eine externe MCP-Datenquelle (z. B. eine über ein Tool zurückgegebene Slack-Nachricht) geliefert wird, bringt Cursor dazu, seine eigene mcp.json neu zu schreiben, und die automatische Ausführung führt den Befehl des Angreifers ohne Genehmigung aus. Die primäre Aim-Labs-Seite war bei der Verifizierung nicht erreichbar; durch Sekundärberichterstattung bestätigt. | AML.T0051.001; AML.T0053 | Aug. 2025 | https://www.catonetworks.com/blog/curxecute-rce/ | | AgentFlayer (ChatGPT Connectors) | Indirekt – Dokument / Datei | | | ChatGPT (Connectors) | Forscher: Tamir Ishay Sharbat (Zenity Labs) | Forschung / Red-Team | Bestätigt | Eine unsichtbare Nutzlast, die in einem geteilten Dokument versteckt ist, weist ChatGPT — über Connectors wie Google Drive — an, ein Markdown-Bild darzustellen, dessen URL-Parameter gestohlene Daten tragen; die Darstellung löst die Anfrage ohne Klick aus. | AML.T0051.001; AML.T0057 | Aug. 2025 | https://labs.zenity.io/post/agentflayer-chatgpt-connectors-0click-attack-5b41 | | Perplexity Comet Reddit-Injection | Indirekt – Website / HTML | | | Perplexity Comet | Forscher: Artem Chaikin, Shivan Kaul Sahib (Brave) | Forschung / Red-Team | Bestätigt | Das Zusammenfassen einer Reddit-Seite, deren Kommentar Anweisungen hinter einem Spoiler-Tag verbarg, veranlasste den Comet-Browser, die E-Mail des Nutzers und einen Gmail-OTP aus authentifizierten Sitzungen zu lesen und sie durch Antworten auf den Kommentar zu exfiltrieren. | AML.T0051.001; AML.T0057 | Aug. 2025 | https://brave.com/blog/comet-prompt-injection/ | | Amazon Q Developer Wiper-Prompt | Code / Repository-Inhalt | | | Amazon Q Developer (VS Code-Erweiterung) | In-the-Wild: Akteur „lkmanka58" | In-the-Wild | Nicht vollständig geprüft | Ein Angreifer führte einen PR in die Amazon-Q-Developer-Erweiterung ein, der einen Prompt einpflanzte, der den Assistenten anwies, lokale Dateien und AWS-Ressourcen zu löschen; er wurde in v1.84.0 ausgeliefert, bevor er entfernt wurde (Berichten zufolge würde er aufgrund der Formatierung nicht ausgeführt). Verifiziert über aggregierte Berichterstattung; Primärquelle nicht direkt bestätigt. | AML.T0051.001 | Juli 2025 | https://www.scworld.com/news/amazon-q-extension-for-vs-code-reportedly-injected-with-wiper-prompt | | EchoLeak (M365 Copilot, LLM Scope Violation) | Indirekt – E-Mail | | | Microsoft 365 Copilot | Forscher: Aim Labs (Aim Security) | Forschung / Red-Team | Bestätigt | CVE-2025-32711 (CVSS 9.3): Eine einzige präparierte E-Mail brachte die RAG-Engine von M365 Copilot dazu, Angreiferanweisungen zusammen mit privilegierten Daten in den Kontext zu ziehen („LLM Scope Violation") und sie ohne jegliche Nutzerinteraktion zu exfiltrieren, wobei der XPIA-Klassifikator sowie Link- und Bildredaktion umgangen wurden; serverseitig gepatcht. | AML.T0051.001; AML.T0057 | Juni 2025 | https://www.aim.security/lp/aim-labs-echoleak-m365 | | GitHub MCP Toxic Agent Flow | Code / Repository-Inhalt; MCP-Server / Verbindung | | Bewegt sich durch Tool-Aufrufkette | Claude 4 Opus (Claude Desktop + GitHub MCP) | Forscher: Invariant Labs | Forschung / Red-Team | Bestätigt | Eine Prompt-Injection, die in einem öffentlichen GitHub-Issue platziert und über den GitHub-MCP-Server erreicht wurde, zwingt den Agenten, Daten aus privaten Repositories in den Kontext zu ziehen und sie in einem autonom erstellten öffentlichen Pull Request preiszugeben; keine Komponente versagt. | AML.T0051.001; AML.T0057; AML.T0053 | Mai 2025 | https://invariantlabs.ai/blog/mcp-github-vulnerability | | Zeichen-Injection zur Guardrail-Umgehung | Direkter Prompt | Zero-Width-Zeichen; Homoglyphen; Emoji- / Variation-Selector-Schmuggel; Mehrschichtig | | Azure Prompt Shield; Meta Prompt Guard; ProtectAI Prompt Injection v1/v2; NVIDIA NeMo Guard; Vijil | Forscher: Mindgard / Lancaster University (Hackett et al.) | Forschung / Red-Team | Bestätigt | Systematische Studie: Nicht druckbare Zero-Width-Zeichen, Homoglyphen-Substitution und Emoji-Variation-Selector-Schmuggel umgehen kommerzielle Klassifikatoren für Prompt-Injection-/Jailbreak-Guardrails (die bestätigten Ziele sind die Erkennungssysteme, nicht die LLMs); Zero-Width erreichte durchschnittlich 44–76 % Umgehung, Emoji-Schmuggel am höchsten. | AML.T0068; AML.T0051 | Apr. 2025 | https://arxiv.org/html/2504.11168v1 | | MCP Tool Poisoning | MCP-Server / Verbindung | | Bewegt sich durch Tool-Aufrufkette | Cursor | Forscher: Invariant Labs | Forschung / Red-Team | Bestätigt | Bösartige Anweisungen, die in einer MCP-Tool-Beschreibung eingebettet sind, sind für den Nutzer unsichtbar, werden aber vom Modell gelesen; ein vergiftetes „add"-Tool brachte Cursor still dazu, den SSH-Schlüssel des Entwicklers zu lesen und zu exfiltrieren, während es ein korrektes Ergebnis zurückgab. Anthropic, OpenAI und Zapier als betroffene Clients genannt. | AML.T0051.001; AML.T0053 | Apr. 2025 | https://invariantlabs.ai/blog/mcp-security-notification-tool-poisoning-attacks | | MCP Line Jumping | MCP-Server / Verbindung | | | Claude Desktop | Red Team: Trail of Bits | Forschung / Red-Team | Bestätigt | Da MCP-Clients jede Tool-Beschreibung in den Kontext des Modells laden, sobald ein Server gelistet ist, kann eine bösartige Beschreibung das Modellverhalten ändern, bevor irgendein Tool aufgerufen wird, wodurch der Genehmigungsschritt des Nutzers für Tool-Aufrufe umgangen wird. | AML.T0051.001; AML.T0053 | Apr. 2025 | https://blog.trailofbits.com/2025/04/21/jumping-the-line-how-mcp-servers-can-attack-you-before-you-ever-use-them/ | | MCP Rug Pull | MCP-Server / Verbindung | | | | Forscher: Invariant Labs | Forschung / Red-Team | Bestätigt | Ein bösartiger MCP-Server präsentiert ein harmloses Tool, um Genehmigung zu erhalten, und tauscht danach still vergiftete Anweisungen ein; Clients fragen nicht erneut nach, da die Tool-Identität unverändert bleibt. | AML.T0051.001; AML.T0053 | Apr. 2025 | https://invariantlabs.ai/blog/mcp-security-notification-tool-poisoning-attacks | | Rules File Backdoor (Cursor / Copilot) | Code / Repository-Inhalt | Zero-Width-Zeichen; Unicode-Tag-Zeichen (unsichtbar) | Verbreitet sich über geteilte Konfigurations- / Rules-Dateien | Cursor; GitHub Copilot | Forscher: Ziv Karliner (Pillar Security) | Forschung / Red-Team | Bestätigt | Unsichtbare Unicode-Anweisungen, die in KI-Coding-„Rules"/Konfigurationsdateien versteckt sind, steuern Cursor und GitHub Copilot still dazu, Backdoors in generierten Code einzufügen, wobei weder im Chat noch in Logs etwas angezeigt wird; die versteckten Zeichen sind selbst in der PR-Review-Ansicht von GitHub unsichtbar. | AML.T0051.001; AML.T0068 | März 2025 | https://www.pillar.security/blog/new-vulnerability-in-github-copilot-and-cursor-how-hackers-can-weaponize-code-agents | | Gemini Memory Persistence (verzögerter Tool-Aufruf) | Indirekt – Dokument / Datei | | Persistiert im Agenten- / Projektgedächtnis; Cross-Agent / Cross-Session | Gemini Advanced | Forscher: Johann Rehberger (Embrace The Red) | Forschung / Red-Team | Bestätigt | Ein bösartig hochgeladenes Dokument vergiftet den Chat so, dass Gemini, wenn der Nutzer später ein Auslösewort sagt, sein Memory-Tool „im Namen des Nutzers" aufruft („delayed tool invocation") und vom Angreifer gewählte falsche Langzeit-Erinnerungen schreibt, die über zukünftige Sitzungen hinweg bestehen bleiben. | AML.T0051.001; AML.T0053 | Feb. 2025 | https://embracethered.com/blog/posts/2025/gemini-memory-persistence-prompt-injection/ | | ZombAIs (Claude Computer Use C2) | Indirekt – Website / HTML | | | Claude Computer Use | Forscher: Johann Rehberger (Embrace The Red) | Forschung / Red-Team | Bestätigt | Eine bösartige Webseite injiziert Anweisungen, die Claude Computer Use dazu bringen, ein Binary herunterzuladen und auszuführen, das sich zurück zum Server des Forschers verbindet — eine vollständige Kette von Prompt-Injection zu Command-and-Control auf einem computerverwendenden Agenten. | AML.T0051.001; AML.T0053 | Okt. 2024 | https://embracethered.com/blog/posts/2024/claude-computer-use-c2-the-zombais-are-coming/ | | SpAIware (ChatGPT Memory) | Indirekt – Website / HTML; Indirekt – Dokument / Datei | | Persistiert im Agenten- / Projektgedächtnis; Cross-Agent / Cross-Session | ChatGPT (macOS-App) | Forscher: Johann Rehberger (Embrace The Red) | Forschung / Red-Team | Bestätigt | Eine Prompt-Injection aus nicht vertrauenswürdigem Web-/Dokumentinhalt schreibt eine persistente Anweisung in das Langzeitgedächtnis von ChatGPT, was zu kontinuierlicher Exfiltration (über dargestellte Bild-URLs) von allem führt, was der Nutzer in allen zukünftigen Sitzungen eingibt oder empfängt, bis die Erinnerung entfernt wird. | AML.T0051.001; AML.T0057 | Sept. 2024 | https://embracethered.com/blog/posts/2024/chatgpt-macos-app-persistent-data-exfiltration/ | | M365 Copilot ASCII-Schmuggel-Exfiltration | Indirekt – E-Mail; Indirekt – Dokument / Datei | Unicode-Tag-Zeichen (unsichtbar) | Bewegt sich durch Tool-Aufrufkette | Microsoft 365 Copilot | Forscher: Johann Rehberger (Embrace The Red) | Forschung / Red-Team | Bestätigt | Eine in einer bösartigen E-Mail oder einem geteilten Dokument versteckte Prompt-Injection brachte M365 Copilot dazu, automatisch andere E-Mails/Dokumente zu durchsuchen, und nutzte dann ASCII-Schmuggel (unsichtbare Unicode-Tags), um gesammelte Daten (z. B. MFA-Codes) in anklickbare Hyperlinks einzubetten, die dem Nutzer angezeigt wurden; gepatcht ~Juli 2024. | AML.T0051.001; AML.T0068; AML.T0057; AML.T0053 | Aug. 2024 | https://embracethered.com/blog/posts/2024/m365-copilot-prompt-injection-tool-invocation-and-data-exfil-using-ascii-smuggling/ | | Slack AI Indirekte-Injection-Exfiltration | Indirekt – RAG / abgerufener Inhalt | | Vergiftet gemeinsamen Datenspeicher / RAG | Slack AI | Red Team: PromptArmor | Forschung / Red-Team | Bestätigt | Ein Angreifer platziert Anweisungen in einem öffentlichen Slack-Kanal; Slack AI nimmt sie in seine RAG-Pipeline auf, und wenn ein Opfer später eine Anfrage stellt, stellt die injizierte Anweisung einen Markdown-Link dar, der Daten aus privaten Kanälen (z. B. einen API-Schlüssel) in der URL zum Angreifer schmuggelt. | AML.T0051.001; AML.T0057 | Aug. 2024 | https://www.promptarmor.com/resources/data-exfiltration-from-slack-ai-via-indirect-prompt-injection | | GitHub Copilot Chat Datenexfiltration | Code / Repository-Inhalt | | | GitHub Copilot Chat (GPT-4) | Forscher: Johann Rehberger (Embrace The Red) | Forschung / Red-Team | Bestätigt | Präparierte Anweisungen in einer Quellcodedatei brachten GitHub Copilot Chat dazu, ein Markdown-Bild auszugeben, dessen URL vorherige Konversationsdaten trug; bei automatischer Darstellung wurden die Daten zum Angreifer exfiltriert. | AML.T0051.001; AML.T0057 | Juni 2024 | https://embracethered.com/blog/posts/2024/github-copilot-chat-prompt-injection-data-exfiltration/ | | Morris II (selbstreplizierender GenAI-Wurm) | Indirekt – RAG / abgerufener Inhalt; Indirekt – E-Mail; Multimodal – Bild | | Selbstverbreitend / Wurm (KI-zu-KI); Vergiftet gemeinsamen Datenspeicher / RAG; Sendet ausgehende E-Mail / Nachricht mit weiteren Anweisungen; Cross-Agent / Cross-Session | Gemini Pro; ChatGPT 4.0; LLaVA | Forscher: Stav Cohen (Technion), Ron Bitton (Intuit), Ben Nassi (Cornell Tech) | Forschung / Red-Team | Bestätigt | Ein „adversarial self-replicating prompt" bringt einen RAG-basierten GenAI-E-Mail-Assistenten dazu, den Prompt in seine eigene Ausgabe zu kopieren und an weitere Agenten zu liefern, was eine wurmartige Kaskade indirekter Prompt-Injections auslöst, die Daten spammt und exfiltriert. Demonstriert mit Text- und Bild-Nutzlasten. | AML.T0051.001 | März 2024 | https://arxiv.org/abs/2403.02817 | | Versteckte Prompt-Injection gegen Claude (Unicode-Tags) | Direkter Prompt | Unicode-Tag-Zeichen (unsichtbar) | | Anthropic Claude | Forscher: Johann Rehberger (Embrace The Red) | Forschung / Red-Team | Bestätigt | Claude interpretierte unsichtbare Unicode-Tag-Codepunkte, die in seine Oberfläche eingefügt wurden — dasselbe Verhalten versteckter Anweisungen, das gegen ChatGPT gezeigt wurde. Anthropic prüfte es und stufte es als „Not Applicable" ein (keine identifizierte Sicherheitsauswirkung), aber das Interpretationsverhalten wurde demonstriert. | AML.T0051.000; AML.T0068 | Feb. 2024 | https://embracethered.com/blog/posts/2024/claude-hidden-prompt-injection-ascii-smuggling/ | | ASCII-Schmuggel / unsichtbare Unicode-Tags (grundlegend) | Indirekt – Website / HTML; Indirekt – Dokument / Datei; Direkter Prompt | Unicode-Tag-Zeichen (unsichtbar) | | ChatGPT (GPT-4 / DALL·E) | Forscher: Johann Rehberger (Embrace The Red) | Forschung / Red-Team | Bestätigt | Grundlegende Abhandlung und „ASCII Smuggler"-Tool: Codepunkte des Unicode-Tags-Blocks (U+E0000-Bereich) spiegeln ASCII, werden aber unsichtbar dargestellt, während LLMs sie weiterhin interpretieren; versteckte Anweisungen brachten ChatGPT dazu, DALL·E aufzurufen. Grundlage für die gesamte Klasse unsichtbarer Injection. | AML.T0051; AML.T0068 | Jan. 2024 | https://embracethered.com/blog/posts/2024/hiding-and-finding-text-with-unicode-tags/ | | DPD-Support-Chatbot-Übersteuerung | Direkter Prompt | | | | In-the-Wild: Ashley Beauchamp | In-the-Wild | Bestätigt | Ein Kunde wies den Support-Chatbot von DPD an, seine Regeln zu missachten, woraufhin dieser fluchte und ein Gedicht verfasste, das DPD herabsetzte — direkte Anweisungsübersteuerung; DPD deaktivierte den Bot am selben Tag. Das zugrunde liegende Modell wurde nicht offengelegt. (Nutzergetriebene Manipulation des Bots, mit dem er chattete; kein Dritt-Opfer oder Exfiltration.) | AML.T0051.000; AML.T0054 | Jan. 2024 | https://www.theregister.com/2024/01/23/dpd_chatbot_goes_rogue | | Chevrolet-Händler-Chatbot-Übersteuerung („$1 Tahoe") | Direkter Prompt | | | ChatGPT-basierter Händlerassistent | In-the-Wild: Chris Bakke | In-the-Wild | Bestätigt | Ein Nutzer injizierte Anweisungen, die einen ChatGPT-basierten Website-Assistenten eines Chevrolet-Händlers dazu brachten, „zuzustimmen", einen 2024er Tahoe für 1 $ zu verkaufen, und dies als rechtlich bindend zu bezeichnen — klassische direkte Anweisungsübersteuerung (in der Realität unverbindlich; nutzergetrieben, kein Dritt-Opfer). | AML.T0051.000 | Dez. 2023 | https://the-decoder.com/people-buy-brand-new-chevrolets-for-1-from-a-chatgpt-chatbot/ | | Google Bard Markdown-Bild-Exfiltration | Indirekt – Dokument / Datei; Indirekt – E-Mail | | | Google Bard | Forscher: Johann Rehberger (Embrace The Red) | Forschung / Red-Team | Bestätigt | Eine indirekte Prompt-Injection in einem geteilten Google Doc brachte Bard dazu, ein Markdown-Bild auszugeben, dessen URL die Chat-Daten des Nutzers einbettete; der Client lud das Bild automatisch und exfiltrierte die Daten ohne Nutzerinteraktion. Einer der ersten Zero-Click-LLM-Exfiltrationsfälle; behoben Okt. 2023. | AML.T0051.001; AML.T0057 | Nov. 2023 | https://embracethered.com/blog/posts/2023/google-bard-data-exfiltration/ | | Multimodale Bild-Prompt-Injection (GPT-4V) | Multimodal – Bild | | | GPT-4V | Forscher: Riley Goodside (via Simon Willison) | Forschung / Red-Team | Bestätigt | Ein Bild, das leer aussieht, trägt Anweisungen in cremeweißem Text auf weißem Hintergrund; die OCR von GPT-4V liest und befolgt sie (Goodsides Demo brachte das Modell dazu, seine Beschreibung zu unterdrücken und für einen gefälschten Sale zu werben). Frühe multimodale Prompt-Injection. | AML.T0051.001 | Okt. 2023 | https://simonwillison.net/2023/Oct/14/multi-modal-prompt-injection/ | | Base64-kodierter Prompt-Jailbreak | Direkter Prompt | Base64; Mehrschichtig | | GPT-4; Claude v1.3; GPT-3.5 Turbo | Forscher: Wei, Haghtalab, Steinhardt (UC Berkeley) | Forschung / Red-Team | Bestätigt | Das Kodieren einer verbotenen Anfrage in Base64 nutzt „mismatched generalization" aus — Modelle lernen im Pretraining, Base64 zu dekodieren, aber das Safety-Training deckte solche Eingaben nie ab — und umgeht so Guardrails; Kombinationsangriffe erreichten ~94 % Erfolg bei GPT-4. Veröffentlicht Juli 2023, kurz vor dem 2-Jahres-Fenster; kanonische Primärquelle für Jailbreaks mit kodierten Nutzlasten. | AML.T0054; AML.T0068; AML.T0051.000 | Juli 2023 | https://arxiv.org/abs/2307.02483 |


    Anhang A — Übermittlungsmethoden (kontrolliertes Vokabular)

    Wie die injizierten Anweisungen das Modell erreichen. Erweiterbar; fügen Sie hier einen neuen Begriff hinzu, wenn ein Bericht einen wirklich neuen Vektor beschreibt.- Direkter Prompt — vom Angreifer kontrollierter Text, der direkt in die Eingabe des Modells eingegeben wird.

    • Indirekt – Website / HTML — Anweisungen, die in eine Webseite eingebettet sind, die das Modell durchsucht oder zusammenfasst.
    • Indirekt – Dokument / Datei — Payload in einer PDF-, DOCX-, Tabellenkalkulations- oder anderen Datei, die das Modell aufnimmt.
    • Indirekt – E-Mail — Anweisungen in einer E-Mail, die ein Agent liest oder triagiert.
    • Indirekt – RAG / abgerufener Inhalt — Payload, der in einer Wissensdatenbank, einem Vektorspeicher oder einem Suchergebnis platziert wurde, das das Modell abruft.
    • Tool-Aufruf / Funktionsergebnis — Anweisungen, die in der Ausgabe eines Tools/einer Funktion zurückgegeben werden, das/der vom Agenten aufgerufen wird.
    • MCP-Server / Verbindung — Payload, der von einem Model Context Protocol-Server oder einer Tool-Beschreibung bereitgestellt wird.
    • Multimodal – Bild — Anweisungen in einem Bild (sichtbarer Text, kontrastarmer Text oder Pixel-/Metadaten-Payload).
    • Multimodal – Audio — Anweisungen, die in einer Audioeingabe transportiert werden.
    • Code / Repository-Inhalt — Payload in Quellcode, Kommentaren, Issues oder CI-Logs, die ein Agent liest.
    • Kalender / Einladung — Anweisungen in einem Kalendereintrag, einer Einladung oder einer Besprechungsnotiz.

    Anhang B — Kodierungen (kontrolliertes Vokabular)

    Verschleierung, die auf den Payload angewendet wird. Leer in der Tabelle bedeutet, dass der Payload Klartext war oder der Bericht keine Angabe gemacht hat.

    • Base64
    • Hex
    • ROT13
    • Leetspeak
    • Unicode-Tag-Zeichen (unsichtbar) — „Tag"-Glyphen im Bereich U+E0000, die unsichtbar gerendert werden.
    • Zero-Width-Zeichen — Zero-Width Space/Joiner, die verwendet werden, um Text zu verbergen oder aufzuteilen.
    • Homoglyphen — ähnlich aussehende Unicode-Ersetzungen für ASCII-Buchstaben.
    • Emoji-/Variation-Selector-Schmuggel
    • HTML-/Markdown-Kommentar — Payload, der in Kommentaren oder nicht gerendertem Markup versteckt ist.
    • Metadaten / EXIF — Anweisungen in Datei- oder Bildmetadaten.
    • Mehrschichtig — mehr als eine der oben genannten Techniken, gestapelt.

    Anhang C — Ausbreitungsverhalten (kontrolliertes Vokabular)

    Ob die Injection darauf ausgelegt ist, sich zu verbreiten oder zu persistieren. Leer in der Tabelle bedeutet, dass kein Ausbreitungsverhalten gemeldet wurde.

    • Selbstverbreitend / Wurm (KI-zu-KI) — die Ausgabe ist so gestaltet, dass sie zur injizierten Eingabe des nächsten Systems wird.
    • Persistiert im Agenten-/Projektgedächtnis — wird in das Langzeit- oder Projektgedächtnis geschrieben, sodass es bei späteren Sitzungen erneut ausgelöst wird.
    • Verbreitet sich über MCP auf Konnektoren — ein vergifteter MCP-Server liefert den Payload an jeden Client, der sich verbindet.
    • Bewegt sich durch die Tool-Aufrufkette — wird über eine Abfolge von Tool-Aufrufen innerhalb eines Agentenlaufs weitergetragen.
    • Sendet ausgehende E-Mail / Nachricht mit weiteren Anweisungen — veranlasst den Agenten, eine Nachricht zu senden, die selbst die Injection trägt.
    • Vergiftet gemeinsamen Datenspeicher / RAG — platziert den Payload dort, wo Abrufe anderer Nutzer oder Agenten ihn aufnehmen werden.
    • Verbreitet sich über gemeinsame Konfigurations-/Regeldateien — bösartige Agentenregeln/-konfigurationen verbreiten sich über gemeinsame oder zentrale Regel-Repositories in abgeleitete Projekte (CREDIT: Rachel James, basierend auf dem Bericht „Rules File Backdoor" von Pillar Security).
    • Agentenübergreifend / sitzungsübergreifend — erreicht andere Agenten oder spätere Sitzungen über den ursprünglichen Kontext hinaus.

    Anhang D — MITRE-ATLAS-Crosswalk

    Techniken werden mit MITRE ATLAS-Technik-IDs gekennzeichnet, sofern eine zutrifft. Die IDs werden bei jedem Update gegen MITREs kanonische Quelle mitre-atlas/atlas-data validiert (die Daten, die die Live-Matrix generieren; die Website atlas.mitre.org ist eine JS-App, die automatisiertes Abrufen blockiert). Verhaltensweisen ohne saubere ATLAS-Zuordnung werden mit einem geprägten Label vermerkt (CREDIT: Rachel James, basierend auf dem zitierten Bericht). In diesem Tracker verwendete IDs:

    • AML.T0051 LLM Prompt Injection — AML.T0051.000 Direct, AML.T0051.001 Indirect
    • AML.T0053 AI Agent Tool Invocation (ersetzt den zurückgezogenen Titel „LLM Plugin Compromise")
    • AML.T0054 LLM Jailbreak
    • AML.T0057 LLM Data Leakage
    • AML.T0068 LLM Prompt Obfuscation

    Beiträge willkommen — siehe CONTRIBUTING.md oder reiche direkt eine Technik ein. Jede vorgeschlagene Zeile muss für jedes nicht leere Feld eine explizite Quelle angeben; unklare Einträge werden als „Not fully vetted" markiert statt verworfen.

    Tool herunterladen