Skip to content
KitploitKITPLOIT
ИнструментыЭксплойтыБлог
Log in
Отправить
ИнструментыЭксплойтыБлог
Отправить

Инструменты для хакинга, пентеста и кибербезопасности — ваш арсенал защиты!

Kitploit — это каталог инструментов для хакинга, кибербезопасности и пентестинга. Находите последние обновления проектов для поиска уязвимостей, анализа систем, автоматизации тестирования и усиления вашей безопасности.

··Ленты·Контакты·Конфиденциальность·© 2026 Kitploit

Каталог инструментов

Категории

Все категории
Loading categories
Prompt-Injection-in-the-Wild — Трекер публично зарегистрированных техник prompt-injection, разбитых по способу доставки, кодированию и поведению распространения, с подтверждёнными моделями, источниками и тегами MITRE ATLAS. | Kitploit
Инструменты/GitHubGitHub/cybershujin/prompt-injection-in-the-wild
Управление индикаторами компрометации (IOC)Фиды и агрегаторы угрозАнализ уязвимостейРазведка угрозСтатьи и ИсследованияОбучение и ОбразованиеПодобранные РесурсыБезопасность ИИСостязательная Атака

Популярное

Смотреть все →

Откройте для себя самые используемые инструменты нашего сообщества.

Изучить все инструменты

Просмотрите нашу коллекцию инструментов

Смотреть все инструменты →
GitHubcybershujin/prompt-injection-in-the-wild

Prompt-Injection-in-the-Wild

Трекер публично зарегистрированных техник prompt-injection, разбитых по способу доставки, кодированию и поведению распространения, с подтверждёнными моделями, источниками и тегами MITRE ATLAS.

Репозиторий
22612 дней назадЕщё не проверено
Поделиться

Prompt Injection в реальных условиях

Трекер публично задокументированных техник prompt injection примерно за последние два года, поддерживаемый Rachel James (cybershujin).

Каждая техника разбита на три элемента prompt injection:

  1. Способ доставки — как внедрённые инструкции достигают модели (результат вызова инструмента, внешний веб-сайт, соединение MCP, документ, электронное письмо, изображение и т. д.).
  2. Кодирование — обфускация, применённая к полезной нагрузке, если таковая имеется (Base64, leetspeak, невидимые Unicode-символы тегов, гомоглифы, …). Пусто, если полезная нагрузка представляет собой обычный текст или в отчёте это не указано.
  3. Поведение при распространении — предназначена ли инъекция для распространения или сохранения (доставляется любому, кто подключается к отравленному MCP-серверу, сохраняется в долговременной/проектной памяти агента, переносится по цепочке вызовов инструментов, заставляет отправлять электронное письмо с дальнейшими инструкциями, …). Пусто, если распространение отсутствует.

Каждая запись также фиксирует модели, против которых подтверждена работоспособность (если таковые имеются), ссылку на источник отчёта и — где известно — источник атаки (исследователь, red team или реальный злоумышленник, от которого она исходит).

Живая панель управления: https://cybershujin.github.io/Prompt-Injection-in-the-Wild/


Область охвата и методология

  • Входит в охват: техники внедрения состязательных инструкций в LLM или агента на базе LLM, которые были публично задокументированы — исследователями безопасности, red team, вендорами или в виде наблюдаемой активности в реальных условиях. Включены как прямой, так и косвенный (передаваемый через данные) prompt injection.
| Техника | Способ доставки | Кодирование | Распространение | Подтверждённые модели | Источник атаки | Доказательство | Проверка | Краткое описание | ATLAS | Дата сообщения | Ссылка |
  • Не входит в охват: обобщённые списки слов для jailbreak без механизма доставки/распространения, чистые жалобы на выравнивание моделей и маркетинг без технической сути.
  • Никогда не додумывается. Каждая непустая ячейка взята из явного утверждения в цитируемом источнике. Если в отчёте не указано кодирование, поведение при распространении, подтверждённые модели или источник атаки, эта ячейка остаётся пустой — пустая ячейка означает «не указано», а не выведенное «отсутствует».
  • Проверка. Каждая запись помечена как Confirmed или Not fully vetted. «Not fully vetted» отмечает запись, источник которой расплывчат, не подтверждён или механизм которой неясен — она выносится на обозрение, а не отбрасывается, чтобы рецензент мог её оценить.
  • Класс доказательств — in-the-wild vs. research. Каждая запись помечена как In-the-wild (наблюдаемое реальное злоупотребление или реальный инцидент в продакшене), Research / red-team (демонстрация исследователя безопасности или red team / ответственное раскрытие — реальная работающая техника, но не наблюдаемая в злоупотреблении со стороны атакующего), Vendor advisory или Unclear. Это отдельная ось от проверки: техника может быть Confirmed (проверена и работает), но при этом демонстрироваться только в лаборатории. Учтите: подлинный in-the-wild вредоносный prompt injection всё ещё редко документируется публично, поэтому подавляющее большинство записей здесь — это раскрытия research / red-team — на момент первоначального заполнения 29 из 32 были research/red-team и только 3 были in-the-wild. Используйте фильтр Evidence на панели управления, чтобы выделить случаи из реального мира.
  • Обновления. Новые отчёты собираются ежемесячно (Perplexity sonar-deep-research, широкий охват) и предлагаются в виде чернового pull request для рассмотрения мейнтейнером. Ничего не сливается автоматически. См. родственный трекер Threat-Actors-use-of-Artifical-Intelligence с тем же рабочим процессом, применённым к использованию ИИ угрожающими субъектами.
  • Как строятся данные

    Данные находятся только в таблице ниже (этот файл — единственный источник истины). Детерминированный генератор без зависимостей (tools/build_exports.py) компилирует их при каждом коммите в:

    • index.html — интерактивная панель управления (обслуживается через GitHub Pages),
    • tracker.json — нормализованные машиночитаемые данные,
    • stix/prompt-injection-stix2.1.json — пакет STIX 2.1 (каждая техника как attack-pattern, помеченная своим MITRE ATLAS ID и отображением Not fully vetted → низкая достоверность).

    Не редактируйте эти три файла вручную; редактируйте таблицу и позвольте CI пересобрать их.


    Техники

    |---|---|---|---|---|---|---|---|---|---|---|---| | ASCII-контрабанда в различных LLM (FireTail) | Календарь / приглашение; Косвенно – электронная почта | Символы Unicode-тегов (невидимые) | | Google Gemini; Grok; DeepSeek | Исследователь: Viktor Markopoulos (FireTail) | Исследование / red-team | Подтверждено | Невидимые символы Unicode-тегов, скрытые в обычных приглашениях календаря и письмах, были интерпретированы Gemini, Grok и DeepSeek, но не показаны пользователю; ChatGPT, Copilot и Claude, как выяснилось, их вычищают. Google ответила «никаких действий». | AML.T0051.001; AML.T0068 | Окт 2025 | https://www.firetail.ai/blog/ghosts-in-the-machine-ascii-smuggling-across-various-llms | | CamoLeak (GitHub Copilot Chat) | Код / содержимое репозитория | HTML / комментарий Markdown | | GitHub Copilot Chat | Исследователь: Omer Mayraz (Legit Security) | Исследование / red-team | Подтверждено | CVE-2025-59145 (CVSS 9.6): невидимая инъекция промпта в HTML-комментарии в pull request заставила Copilot Chat искать секреты в приватном репозитории и эксфильтрировать их посимвольно через предварительно сгенерированные злоумышленником URL-адреса изображений GitHub Camo; исправлено отключением отображения изображений. | AML.T0051.001; AML.T0068; AML.T0057 | Окт 2025 | https://www.legitsecurity.com/blog/camoleak-critical-github-copilot-vulnerability-leaks-private-source-code | | Невидимая инъекция через OCR скриншота | Мультимодально – изображение | | | Perplexity Comet; Fellou; Opera Neon | Исследователь: Artem Chaikin, Shivan Kaul Sahib (Brave) | Исследование / red-team | Подтверждено | Инструкции инъекции промпта, отрисованные как почти невидимый низкоконтрастный текст внутри изображений на странице, распознаются OCR ИИ-браузера при обработке скриншота, поэтому человек ничего не видит, а агент подчиняется. Продемонстрировано на нескольких агентных браузерах. | AML.T0051.001; AML.T0068 | Окт 2025 | https://brave.com/blog/unseeable-prompt-injections/ | | Инъекция в омнибокс ChatGPT Atlas | Прямой промпт; Косвенно – веб-сайт / HTML | | | ChatGPT Atlas | Исследователь: NeuralTrust | Исследование / red-team | Подтверждено | Строка, похожая на URL, но не проходящая парсинг URL, заставляет омнибокс Atlas воспринимать встроенный текст как доверенный промпт; вставленная или доставленная через кнопку «Copy link», она может заставить агента посетить сайты злоумышленника или удалить файлы Google Drive в аутентифицированной сессии пользователя. | AML.T0051.000; AML.T0051.001 | Окт 2025 | https://neuraltrust.ai/blog/openai-atlas-omnibox-prompt-injection | | Invitation Is All You Need (Gemini) | Календарь / приглашение; Косвенно – электронная почта | | Сохраняется в памяти агента / проекта; Перемещается по цепочке вызовов инструментов; Кросс-агентно / кросс-сессионно | Google Gemini (веб, мобильное приложение, ассистент Android) | Исследователь: Or Yair, Ben Nassi, Stav Cohen (SafeBreach / Technion) | Исследование / red-team | Подтверждено | Приглашение в Google Calendar (или письмо), поля которого несут косвенную инъекцию промпта, перехватывает управление Gemini, когда пользователь взаимодействует со своим календарём; 14 продемонстрированных атак охватывают отравление краткосрочной/долгосрочной памяти, злоупотребление инструментами и автоматический вызов агента/приложения, достигая подключённых приложений и устройств умного дома. | AML.T0051.001; AML.T0053 | Авг 2025 | https://www.safebreach.com/blog/invitation-is-all-you-need-hacking-gemini/ | | MCPoison (rug-pull в Cursor MCP) | MCP-сервер / соединение; Код / содержимое репозитория | | | Cursor IDE (< v1.3) | Исследователь: Check Point Research | Исследование / red-team | Подтверждено | CVE-2025-54136: Cursor доверял одобренной конфигурации MCP бессрочно, поэтому злоумышленник, добившийся одобрения безобидного mcp.json в общем репозитории, может позже подменить его на вредоносную команду, которая незаметно выполняется при каждом последующем открытии проекта. | AML.T0051.001; AML.T0053 | Авг 2025 | https://research.checkpoint.com/2025/cursor-vulnerability-mcpoison/ | | RCE в GitHub Copilot / «YOLO mode» | Косвенно – веб-сайт / HTML; Код / содержимое репозитория; Результат вызова инструмента / функции | Символы Unicode-тегов (невидимые) | | GitHub Copilot (VS Code — Windows, macOS, Linux) | Исследователь: Johann Rehberger (Embrace The Red) | Исследование / red-team | Подтверждено | CVE-2025-53773: внедрённая инструкция заставляет Copilot отредактировать .vscode/settings.json, чтобы включить chat.tools.autoApprove («YOLO mode»), убирая запросы подтверждения команд и открывая возможность выполнения произвольного кода; один из вариантов использовал невидимые Unicode-теги. | AML.T0051.001; AML.T0053 | Авг 2025 | https://embracethered.com/blog/posts/2025/github-copilot-remote-code-execution-via-prompt-injection/ | | CurXecute (RCE в Cursor через MCP) | Результат вызова инструмента / функции | | Перемещается по цепочке вызовов инструментов | Cursor (исправлено в v1.3) | Исследователь: Aim Labs (Aim Security) | Исследование / red-team | Не полностью проверено | CVE-2025-54135: инъекция промпта, доставленная через внешний источник данных MCP (например, сообщение Slack, возвращённое через инструмент), заставляет Cursor перезаписать собственный mcp.json, и автозапуск выполняет команду злоумышленника без подтверждения. Основная страница Aim Labs была недоступна при проверке; подтверждено вторичными сообщениями. | AML.T0051.001; AML.T0053 | Авг 2025 | https://www.catonetworks.com/blog/curxecute-rce/ | | AgentFlayer (ChatGPT Connectors) | Косвенно – документ / файл | | | ChatGPT (Connectors) | Исследователь: Tamir Ishay Sharbat (Zenity Labs) | Исследование / red-team | Подтверждено | Невидимая полезная нагрузка, скрытая в общем документе, инструктирует ChatGPT — через Connectors, такие как Google Drive, — отрисовать изображение markdown, параметры URL которого несут украденные данные; отрисовка запускает запрос без клика. | AML.T0051.001; AML.T0057 | Авг 2025 | https://labs.zenity.io/post/agentflayer-chatgpt-connectors-0click-attack-5b41 | | Инъекция через Reddit в Perplexity Comet | Косвенно – веб-сайт / HTML | | | Perplexity Comet | Исследователь: Artem Chaikin, Shivan Kaul Sahib (Brave) | Исследование / red-team | Подтверждено | Суммирование страницы Reddit, в комментарии которой инструкции были скрыты за тегом спойлера, заставило браузер Comet прочитать электронную почту пользователя и OTP из Gmail из аутентифицированных сессий и эксфильтрировать их, ответив на комментарий. | AML.T0051.001; AML.T0057 | Авг 2025 | https://brave.com/blog/comet-prompt-injection/ | | Промпт-вайпер в Amazon Q Developer | Код / содержимое репозитория | | | Amazon Q Developer (расширение VS Code) | В реальных условиях: актор «lkmanka58» | В реальных условиях | Не полностью проверено | Злоумышленник влил PR в расширение Amazon Q Developer, внедрив промпт, инструктирующий ассистента уничтожить локальные файлы и ресурсы AWS; он вышел в v1.84.0 до удаления (по сообщениям, не выполнился бы из-за форматирования). Подтверждено через агрегированные сообщения; первоисточник напрямую не подтверждён. | AML.T0051.001 | Июл 2025 | https://www.scworld.com/news/amazon-q-extension-for-vs-code-reportedly-injected-with-wiper-prompt | | EchoLeak (M365 Copilot, нарушение области видимости LLM) | Косвенно – электронная почта | | | Microsoft 365 Copilot | Исследователь: Aim Labs (Aim Security) | Исследование / red-team | Подтверждено | CVE-2025-32711 (CVSS 9.3): одно специально составленное письмо заставило RAG-движок M365 Copilot подтянуть инструкции злоумышленника в контекст вместе с привилегированными данными («нарушение области видимости LLM») и эксфильтрировать их без какого-либо взаимодействия с пользователем, обойдя классификатор XPIA и редактирование ссылок/изображений; исправлено на стороне сервера. | AML.T0051.001; AML.T0057 | Июн 2025 | https://www.aim.security/lp/aim-labs-echoleak-m365 | | Токсичный поток агента GitHub MCP | Код / содержимое репозитория; MCP-сервер / соединение | | Перемещается по цепочке вызовов инструментов | Claude 4 Opus (Claude Desktop + GitHub MCP) | Исследователь: Invariant Labs | Исследование / red-team | Подтверждено | Инъекция промпта, внедрённая в публичный issue на GitHub и достигнутая через MCP-сервер GitHub, принуждает агента подтянуть данные приватного репозитория в контекст и утечь их в автономно созданном публичном pull request; ни один компонент не даёт сбоя. | AML.T0051.001; AML.T0057; AML.T0053 | Май 2025 | https://invariantlabs.ai/blog/mcp-github-vulnerability | | Обход гардрейлов через инъекцию символов | Прямой промпт | Символы нулевой ширины; Гомоглифы; Контрабанда эмодзи / селекторов вариаций; Многослойно | | Azure Prompt Shield; Meta Prompt Guard; ProtectAI Prompt Injection v1/v2; NVIDIA NeMo Guard; Vijil | Исследователь: Mindgard / Lancaster University (Hackett et al.) | Исследование / red-team | Подтверждено | Систематическое исследование: непечатаемые символы нулевой ширины, подстановка гомоглифов и контрабанда селекторов вариаций эмодзи обходят коммерческие классификаторы гардрейлов инъекций промптов/джейлбрейков (подтверждённые цели — это системы обнаружения, а не сами LLM); нулевая ширина в среднем давала 44–76% обхода, контрабанда эмодзи — наивысший результат. | AML.T0068; AML.T0051 | Апр 2025 | https://arxiv.org/html/2504.11168v1 | | Отравление инструментов MCP | MCP-сервер / соединение | | Перемещается по цепочке вызовов инструментов | Cursor | Исследователь: Invariant Labs | Исследование / red-team | Подтверждено | Вредоносные инструкции, встроенные в описание инструмента MCP, невидимы пользователю, но читаются моделью; отравленный инструмент «add» незаметно заставил Cursor прочитать и эксфильтрировать SSH-ключ разработчика, вернув при этом корректный результат. Anthropic, OpenAI и Zapier названы затронутыми клиентами. | AML.T0051.001; AML.T0053 | Апр 2025 | https://invariantlabs.ai/blog/mcp-security-notification-tool-poisoning-attacks | | Прыжок через очередь в MCP | MCP-сервер / соединение | | | Claude Desktop | Red team: Trail of Bits | Исследование / red-team | Подтверждено | Поскольку клиенты MCP загружают каждое описание инструмента в контекст модели, как только сервер указан, вредоносное описание может изменить поведение модели до вызова любого инструмента, обходя шаг подтверждения вызова инструмента пользователем. | AML.T0051.001; AML.T0053 | Апр 2025 | https://blog.trailofbits.com/2025/04/21/jumping-the-line-how-mcp-servers-can-attack-you-before-you-ever-use-them/ | | Rug pull в MCP | MCP-сервер / соединение | | | | Исследователь: Invariant Labs | Исследование / red-team | Подтверждено | Вредоносный MCP-сервер представляет безобидный инструмент для получения одобрения, а затем незаметно подменяет его отравленными инструкциями; клиенты не запрашивают повторно, поскольку идентичность инструмента не изменилась. | AML.T0051.001; AML.T0053 | Апр 2025 | https://invariantlabs.ai/blog/mcp-security-notification-tool-poisoning-attacks | | Бэкдор в файлах правил (Cursor / Copilot) | Код / содержимое репозитория | Символы нулевой ширины; Символы Unicode-тегов (невидимые) | Распространяется через общие конфигурационные / файлы правил | Cursor; GitHub Copilot | Исследователь: Ziv Karliner (Pillar Security) | Исследование / red-team | Подтверждено | Инструкции в невидимом Unicode, скрытые в файлах «правил»/конфигурации ИИ-кодинга, незаметно направляют Cursor и GitHub Copilot на вставку бэкдоров в генерируемый код, при этом ничего не отображается в чате или логах; скрытые символы невидимы даже в представлении PR-ревью GitHub. | AML.T0051.001; AML.T0068 | Мар 2025 | https://www.pillar.security/blog/new-vulnerability-in-github-copilot-and-cursor-how-hackers-can-weaponize-code-agents | | Сохранение памяти Gemini (отложенный вызов инструмента) | Косвенно – документ / файл | | Сохраняется в памяти агента / проекта; Кросс-агентно / кросс-сессионно | Gemini Advanced | Исследователь: Johann Rehberger (Embrace The Red) | Исследование / red-team | Подтверждено | Вредоносный загруженный документ отравляет чат так, что когда пользователь позже произносит слово-триггер, Gemini вызывает свой инструмент памяти «от имени пользователя» («отложенный вызов инструмента») и записывает выбранные злоумышленником ложные долгосрочные воспоминания, которые сохраняются в будущих сессиях. | AML.T0051.001; AML.T0053 | Фев 2025 | https://embracethered.com/blog/posts/2025/gemini-memory-persistence-prompt-injection/ | | ZombAIs (C2 через Claude Computer Use) | Косвенно – веб-сайт / HTML | | | Claude Computer Use | Исследователь: Johann Rehberger (Embrace The Red) | Исследование / red-team | Подтверждено | Вредоносная веб-страница внедряет инструкции, заставляющие Claude Computer Use скачать и запустить бинарный файл, который устанавливает соединение с сервером исследователя — полная цепочка от инъекции промпта до командного управления на агенте, использующем компьютер. | AML.T0051.001; AML.T0053 | Окт 2024 | https://embracethered.com/blog/posts/2024/claude-computer-use-c2-the-zombais-are-coming/ | | SpAIware (память ChatGPT) | Косвенно – веб-сайт / HTML; Косвенно – документ / файл | | Сохраняется в памяти агента / проекта; Кросс-агентно / кросс-сессионно | ChatGPT (приложение для macOS) | Исследователь: Johann Rehberger (Embrace The Red) | Исследование / red-team | Подтверждено | Инъекция промпта из недоверенного веб-контента/документа записывает постоянную инструкцию в долгосрочную память ChatGPT, вызывая непрерывную эксфильтрацию (через URL отрисованных изображений) всего, что пользователь вводит или получает во всех будущих сессиях, пока память не будет удалена. | AML.T0051.001; AML.T0057 | Сен 2024 | https://embracethered.com/blog/posts/2024/chatgpt-macos-app-persistent-data-exfiltration/ | | Эксфильтрация через ASCII-контрабанду в M365 Copilot | Косвенно – электронная почта; Косвенно – документ / файл | Символы Unicode-тегов (невидимые) | Перемещается по цепочке вызовов инструментов | Microsoft 365 Copilot | Исследователь: Johann Rehberger (Embrace The Red) | Исследование / red-team | Подтверждено | Инъекция промпта, скрытая во вредоносном письме или общем документе, заставила M365 Copilot автоматически искать другие письма/документы, а затем использовала ASCII-контрабанду (невидимые Unicode-теги) для встраивания собранных данных (например, кодов MFA) в кликабельные гиперссылки, отображаемые пользователю; исправлено ~июл 2024. | AML.T0051.001; AML.T0068; AML.T0057; AML.T0053 | Авг 2024 | https://embracethered.com/blog/posts/2024/m365-copilot-prompt-injection-tool-invocation-and-data-exfil-using-ascii-smuggling/ | | Эксфильтрация через косвенную инъекцию в Slack AI | Косвенно – RAG / извлечённый контент | | Отравляет общее хранилище данных / RAG | Slack AI | Red team: PromptArmor | Исследование / red-team | Подтверждено | Злоумышленник внедряет инструкции в публичный канал Slack; Slack AI поглощает их в свой RAG-конвейер, и когда жертва позже делает запрос, внедрённая инструкция отрисовывает ссылку markdown, контрабандой переносящую данные приватного канала (например, API-ключ) в URL к злоумышленнику. | AML.T0051.001; AML.T0057 | Авг 2024 | https://www.promptarmor.com/resources/data-exfiltration-from-slack-ai-via-indirect-prompt-injection | | Эксфильтрация данных из GitHub Copilot Chat | Код / содержимое репозитория | | | GitHub Copilot Chat (GPT-4) | Исследователь: Johann Rehberger (Embrace The Red) | Исследование / red-team | Подтверждено | Специально составленные инструкции в файле исходного кода заставили GitHub Copilot Chat выдать изображение markdown, URL которого нёс данные предыдущей беседы; при автоматической отрисовке данные были эксфильтрированы злоумышленнику. | AML.T0051.001; AML.T0057 | Июн 2024 | https://embracethered.com/blog/posts/2024/github-copilot-chat-prompt-injection-data-exfiltration/ | | Morris II (самореплицирующийся червь GenAI) | Косвенно – RAG / извлечённый контент; Косвенно – электронная почта; Мультимодально – изображение | | Самораспространяющийся / червь (ИИ-к-ИИ); Отравляет общее хранилище данных / RAG; Отправляет исходящее письмо / сообщение с дальнейшими инструкциями; Кросс-агентно / кросс-сессионно | Gemini Pro; ChatGPT 4.0; LLaVA | Исследователь: Stav Cohen (Technion), Ron Bitton (Intuit), Ben Nassi (Cornell Tech) | Исследование / red-team | Подтверждено | «Составленный противником самореплицирующийся промпт» заставляет основанного на RAG ИИ-ассистента электронной почты копировать промпт в собственный вывод и доставлять его дальнейшим агентам, вызывая червеобразный каскад косвенных инъекций промптов, который спамит и эксфильтрирует данные. Продемонстрировано с текстовыми и графическими полезными нагрузками. | AML.T0051.001 | Мар 2024 | https://arxiv.org/abs/2403.02817 | | Скрытая инъекция промпта против Claude (Unicode-теги) | Прямой промпт | Символы Unicode-тегов (невидимые) | | Anthropic Claude | Исследователь: Johann Rehberger (Embrace The Red) | Исследование / red-team | Подтверждено | Claude интерпретировал невидимые кодовые точки Unicode-тегов, вставленные в его интерфейс — то же поведение со скрытыми инструкциями, что было показано против ChatGPT. Anthropic рассмотрела и пометила это как «Not Applicable» (не выявлено влияния на безопасность), но поведение интерпретации было продемонстрировано. | AML.T0051.000; AML.T0068 | Фев 2024 | https://embracethered.com/blog/posts/2024/claude-hidden-prompt-injection-ascii-smuggling/ | | ASCII-контрабанда / невидимые Unicode-теги (основополагающее) | Косвенно – веб-сайт / HTML; Косвенно – документ / файл; Прямой промпт | Символы Unicode-тегов (невидимые) | | ChatGPT (GPT-4 / DALL·E) | Исследователь: Johann Rehberger (Embrace The Red) | Исследование / red-team | Подтверждено | Основополагающая статья и инструмент «ASCII Smuggler»: кодовые точки блока Unicode Tags (диапазон U+E0000) зеркалят ASCII, но отображаются невидимо, при этом LLM всё равно их интерпретируют; скрытые инструкции заставили ChatGPT вызвать DALL·E. Основа для всего класса невидимых инъекций. | AML.T0051; AML.T0068 | Янв 2024 | https://embracethered.com/blog/posts/2024/hiding-and-finding-text-with-unicode-tags/ | | Перехват управления чат-ботом поддержки DPD | Прямой промпт | | | | В реальных условиях: Ashley Beauchamp | В реальных условиях | Подтверждено | Клиент проинструктировал чат-бот поддержки DPD игнорировать свои правила, заставив его ругаться и написать стихотворение, порочащее DPD — прямое переопределение инструкций; DPD отключила бота в тот же день. Базовая модель не раскрыта. (Управляемое пользователем манипулирование ботом, с которым он общался; нет сторонней жертвы или эксфильтрации.) | AML.T0051.000; AML.T0054 | Янв 2024 | https://www.theregister.com/2024/01/23/dpd_chatbot_goes_rogue | | Перехват управления чат-ботом автосалона Chevrolet («Tahoe за $1») | Прямой промпт | | | Ассистент автосалона на базе ChatGPT | В реальных условиях: Chris Bakke | В реальных условиях | Подтверждено | Пользователь внедрил инструкции, заставившие веб-ассистента автосалона Chevrolet на базе ChatGPT «согласиться» продать Tahoe 2024 года за $1 и назвать это юридически обязывающим — классическое прямое переопределение инструкций (в реальности не имеет силы; управляемое пользователем, нет сторонней жертвы). | AML.T0051.000 | Дек 2023 | https://the-decoder.com/people-buy-brand-new-chevrolets-for-1-from-a-chatgpt-chatbot/ | | Эксфильтрация через markdown-изображение в Google Bard | Косвенно – документ / файл; Косвенно – электронная почта | | | Google Bard | Исследователь: Johann Rehberger (Embrace The Red) | Исследование / red-team | Подтверждено | Косвенная инъекция промпта в общем Google Doc заставила Bard выдать изображение markdown, URL которого содержал данные чата пользователя; клиент автоматически загрузил изображение, эксфильтрировав данные без взаимодействия с пользователем. Один из первых случаев zero-click эксфильтрации в LLM; исправлено в окт 2023. | AML.T0051.001; AML.T0057 | Ноя 2023 | https://embracethered.com/blog/posts/2023/google-bard-data-exfiltration/ | | Мультимодальная инъекция промпта через изображение (GPT-4V) | Мультимодально – изображение | | | GPT-4V | Исследователь: Riley Goodside (через Simon Willison) | Исследование / red-team | Подтверждено | Изображение, выглядящее пустым, несёт инструкции почти белым текстом на белом фоне; OCR GPT-4V читает и выполняет их (демонстрация Goodside заставила модель подавить своё описание и рекламировать фальшивую распродажу). Ранняя мультимодальная инъекция промпта. | AML.T0051.001 | Окт 2023 | https://simonwillison.net/2023/Oct/14/multi-modal-prompt-injection/ | | Джейлбрейк через промпт в кодировке Base64 | Прямой промпт | Base64; Многослойно | | GPT-4; Claude v1.3; GPT-3.5 Turbo | Исследователь: Wei, Haghtalab, Steinhardt (UC Berkeley) | Исследование / red-team | Подтверждено | Кодирование запрещённого запроса в Base64 эксплуатирует «несогласованное обобщение» — модели учатся декодировать Base64 на этапе предобучения, но обучение безопасности никогда не охватывало такие входные данные — обходя гардрейлы; комбинированные атаки достигали ~94% успеха на GPT-4. Опубликовано в июл 2023, непосредственно перед двухлетним окном; канонический первоисточник для джейлбрейков с закодированными полезными нагрузками. | AML.T0054; AML.T0068; AML.T0051.000 | Июл 2023 | https://arxiv.org/abs/2307.02483 |


    Приложение A — Способы доставки (контролируемый словарь)

    Как внедрённые инструкции достигают модели. Расширяемо; добавляйте новый термин здесь, когда отчёт описывает действительно новый вектор.- Прямой промпт — текст, контролируемый злоумышленником, введённый непосредственно во входные данные модели.

    • Косвенный — веб-сайт / HTML — инструкции, встроенные в веб-страницу, которую модель просматривает или обобщает.
    • Косвенный — документ / файл — полезная нагрузка внутри PDF, DOCX, электронной таблицы или другого файла, который обрабатывает модель.
    • Косвенный — электронная почта — инструкции внутри письма, которое читает или обрабатывает агент.
    • Косвенный — RAG / извлечённый контент — полезная нагрузка, внедрённая в базу знаний, векторное хранилище или результат поиска, извлекаемый моделью.
    • Вызов инструмента / результат функции — инструкции, возвращаемые в выводе инструмента/функции, вызываемой агентом.
    • MCP-сервер / соединение — полезная нагрузка, передаваемая сервером Model Context Protocol или описанием инструмента.
    • Мультимодальный — изображение — инструкции в изображении (видимый текст, низкоконтрастный текст или полезная нагрузка в пикселях/метаданных).
    • Мультимодальный — аудио — инструкции, передаваемые в аудиовходе.
    • Код / содержимое репозитория — полезная нагрузка в исходном коде, комментариях, issue или логах CI, которые читает агент.
    • Календарь / приглашение — инструкции внутри события календаря, приглашения или заметки о встрече.

    Приложение B — Кодировки (контролируемый словарь)

    Обфускация, применённая к полезной нагрузке. Пустая ячейка в таблице означает, что полезная нагрузка была открытым текстом или отчёт не уточнял.

    • Base64
    • Hex
    • ROT13
    • Leetspeak
    • Unicode tag characters (невидимые) — «теговые» глифы диапазона U+E0000, отображаемые невидимо.
    • Zero-width characters — нулевой пробел/соединитель, используемый для сокрытия или разрыва текста.
    • Homoglyphs — похожие Unicode-заменители ASCII-букв.
    • Emoji / variation-selector smuggling
    • HTML / Markdown comment — полезная нагрузка, скрытая в комментариях или неотображаемой разметке.
    • Metadata / EXIF — инструкции в метаданных файла или изображения.
    • Multi-layer — более одного из перечисленного, наложенных друг на друга.

    Приложение C — Поведение при распространении (контролируемый словарь)

    Предназначена ли инъекция для распространения или сохранения. Пустая ячейка в таблице означает, что поведение распространения не было зафиксировано.

    • Self-propagating / worm (AI-to-AI) — вывод сконструирован так, чтобы стать инъецированным входом следующей системы.
    • Persists in agent / project memory — записывается в долговременную или проектную память, чтобы повторно срабатывать в последующих сессиях.
    • Spreads via MCP to connectors — отравленный MCP-сервер доставляет полезную нагрузку каждому подключающемуся клиенту.
    • Moves through tool-call chain — переносится через последовательность вызовов инструментов в рамках одного запуска агента.
    • Emits outbound email / message with further instructions — заставляет агента отправить сообщение, которое само несёт инъекцию.
    • Poisons shared data store / RAG — внедряет полезную нагрузку туда, где её подхватят при извлечении другие пользователи или агенты.
    • Spreads via shared config / rules files — вредоносные правила/конфигурация агента распространяются через общие или центральные репозитории правил в производные проекты (CREDIT: Rachel James, на основе отчёта Pillar Security «Rules File Backdoor»).
    • Cross-agent / cross-session — достигает других агентов или последующих сессий за пределами исходного контекста.

    Приложение D — Сопоставление с MITRE ATLAS

    Техники помечены идентификаторами техник MITRE ATLAS, где таковой применим. Идентификаторы проверяются при каждом обновлении по каноническому источнику MITRE mitre-atlas/atlas-data (данные, генерирующие живую матрицу; сайт atlas.mitre.org — это JS-приложение, блокирующее автоматическую выборку). Поведения без чёткого сопоставления с ATLAS отмечены придуманной меткой (CREDIT: Rachel James, на основе цитируемого отчёта). Идентификаторы, используемые в этом трекере:

    • AML.T0051 LLM Prompt Injection — AML.T0051.000 Direct, AML.T0051.001 Indirect
    • AML.T0053 AI Agent Tool Invocation (заменяет вышедшее из употребления название «LLM Plugin Compromise»)
    • AML.T0054 LLM Jailbreak
    • AML.T0057 LLM Data Leakage
    • AML.T0068 LLM Prompt Obfuscation

    Вклад приветствуется — см. CONTRIBUTING.md или предложите технику напрямую. Каждая предлагаемая строка должна ссылаться на явный источник для каждого непустого поля; неясные записи помечаются «Not fully vetted», а не удаляются.

    Скачать инструмент