
Трекер публично зарегистрированных техник prompt-injection, разбитых по способу доставки, кодированию и поведению распространения, с подтверждёнными моделями, источниками и тегами MITRE ATLAS.
Трекер публично задокументированных техник prompt injection примерно за последние два года, поддерживаемый Rachel James (cybershujin).
Каждая техника разбита на три элемента prompt injection:
Каждая запись также фиксирует модели, против которых подтверждена работоспособность (если таковые имеются), ссылку на источник отчёта и — где известно — источник атаки (исследователь, red team или реальный злоумышленник, от которого она исходит).
Живая панель управления: https://cybershujin.github.io/Prompt-Injection-in-the-Wild/
Confirmed или Not fully vetted. «Not fully vetted» отмечает запись, источник которой расплывчат, не подтверждён или механизм которой неясен — она выносится на обозрение, а не отбрасывается, чтобы рецензент мог её оценить.Confirmed (проверена и работает), но при этом демонстрироваться только в лаборатории. Учтите: подлинный in-the-wild вредоносный prompt injection всё ещё редко документируется публично, поэтому подавляющее большинство записей здесь — это раскрытия research / red-team — на момент первоначального заполнения 29 из 32 были research/red-team и только 3 были in-the-wild. Используйте фильтр Evidence на панели управления, чтобы выделить случаи из реального мира.sonar-deep-research, широкий охват) и предлагаются в виде чернового pull request для рассмотрения мейнтейнером. Ничего не сливается автоматически. См. родственный трекер Threat-Actors-use-of-Artifical-Intelligence с тем же рабочим процессом, применённым к использованию ИИ угрожающими субъектами.Данные находятся только в таблице ниже (этот файл — единственный источник истины). Детерминированный генератор без зависимостей (tools/build_exports.py) компилирует их при каждом коммите в:
index.html — интерактивная панель управления (обслуживается через GitHub Pages),tracker.json — нормализованные машиночитаемые данные,stix/prompt-injection-stix2.1.json — пакет STIX 2.1 (каждая техника как attack-pattern, помеченная своим MITRE ATLAS ID и отображением Not fully vetted → низкая достоверность).Не редактируйте эти три файла вручную; редактируйте таблицу и позвольте CI пересобрать их.
|---|---|---|---|---|---|---|---|---|---|---|---| | ASCII-контрабанда в различных LLM (FireTail) | Календарь / приглашение; Косвенно – электронная почта | Символы Unicode-тегов (невидимые) | | Google Gemini; Grok; DeepSeek | Исследователь: Viktor Markopoulos (FireTail) | Исследование / red-team | Подтверждено | Невидимые символы Unicode-тегов, скрытые в обычных приглашениях календаря и письмах, были интерпретированы Gemini, Grok и DeepSeek, но не показаны пользователю; ChatGPT, Copilot и Claude, как выяснилось, их вычищают. Google ответила «никаких действий». | AML.T0051.001; AML.T0068 | Окт 2025 | https://www.firetail.ai/blog/ghosts-in-the-machine-ascii-smuggling-across-various-llms | | CamoLeak (GitHub Copilot Chat) | Код / содержимое репозитория | HTML / комментарий Markdown | | GitHub Copilot Chat | Исследователь: Omer Mayraz (Legit Security) | Исследование / red-team | Подтверждено | CVE-2025-59145 (CVSS 9.6): невидимая инъекция промпта в HTML-комментарии в pull request заставила Copilot Chat искать секреты в приватном репозитории и эксфильтрировать их посимвольно через предварительно сгенерированные злоумышленником URL-адреса изображений GitHub Camo; исправлено отключением отображения изображений. | AML.T0051.001; AML.T0068; AML.T0057 | Окт 2025 | https://www.legitsecurity.com/blog/camoleak-critical-github-copilot-vulnerability-leaks-private-source-code | | Невидимая инъекция через OCR скриншота | Мультимодально – изображение | | | Perplexity Comet; Fellou; Opera Neon | Исследователь: Artem Chaikin, Shivan Kaul Sahib (Brave) | Исследование / red-team | Подтверждено | Инструкции инъекции промпта, отрисованные как почти невидимый низкоконтрастный текст внутри изображений на странице, распознаются OCR ИИ-браузера при обработке скриншота, поэтому человек ничего не видит, а агент подчиняется. Продемонстрировано на нескольких агентных браузерах. | AML.T0051.001; AML.T0068 | Окт 2025 | https://brave.com/blog/unseeable-prompt-injections/ | | Инъекция в омнибокс ChatGPT Atlas | Прямой промпт; Косвенно – веб-сайт / HTML | | | ChatGPT Atlas | Исследователь: NeuralTrust | Исследование / red-team | Подтверждено | Строка, похожая на URL, но не проходящая парсинг URL, заставляет омнибокс Atlas воспринимать встроенный текст как доверенный промпт; вставленная или доставленная через кнопку «Copy link», она может заставить агента посетить сайты злоумышленника или удалить файлы Google Drive в аутентифицированной сессии пользователя. | AML.T0051.000; AML.T0051.001 | Окт 2025 | https://neuraltrust.ai/blog/openai-atlas-omnibox-prompt-injection | | Invitation Is All You Need (Gemini) | Календарь / приглашение; Косвенно – электронная почта | | Сохраняется в памяти агента / проекта; Перемещается по цепочке вызовов инструментов; Кросс-агентно / кросс-сессионно | Google Gemini (веб, мобильное приложение, ассистент Android) | Исследователь: Or Yair, Ben Nassi, Stav Cohen (SafeBreach / Technion) | Исследование / red-team | Подтверждено | Приглашение в Google Calendar (или письмо), поля которого несут косвенную инъекцию промпта, перехватывает управление Gemini, когда пользователь взаимодействует со своим календарём; 14 продемонстрированных атак охватывают отравление краткосрочной/долгосрочной памяти, злоупотребление инструментами и автоматический вызов агента/приложения, достигая подключённых приложений и устройств умного дома. | AML.T0051.001; AML.T0053 | Авг 2025 | https://www.safebreach.com/blog/invitation-is-all-you-need-hacking-gemini/ | | MCPoison (rug-pull в Cursor MCP) | MCP-сервер / соединение; Код / содержимое репозитория | | | Cursor IDE (< v1.3) | Исследователь: Check Point Research | Исследование / red-team | Подтверждено | CVE-2025-54136: Cursor доверял одобренной конфигурации MCP бессрочно, поэтому злоумышленник, добившийся одобрения безобидного mcp.json в общем репозитории, может позже подменить его на вредоносную команду, которая незаметно выполняется при каждом последующем открытии проекта. | AML.T0051.001; AML.T0053 | Авг 2025 | https://research.checkpoint.com/2025/cursor-vulnerability-mcpoison/ | | RCE в GitHub Copilot / «YOLO mode» | Косвенно – веб-сайт / HTML; Код / содержимое репозитория; Результат вызова инструмента / функции | Символы Unicode-тегов (невидимые) | | GitHub Copilot (VS Code — Windows, macOS, Linux) | Исследователь: Johann Rehberger (Embrace The Red) | Исследование / red-team | Подтверждено | CVE-2025-53773: внедрённая инструкция заставляет Copilot отредактировать .vscode/settings.json, чтобы включить chat.tools.autoApprove («YOLO mode»), убирая запросы подтверждения команд и открывая возможность выполнения произвольного кода; один из вариантов использовал невидимые Unicode-теги. | AML.T0051.001; AML.T0053 | Авг 2025 | https://embracethered.com/blog/posts/2025/github-copilot-remote-code-execution-via-prompt-injection/ | | CurXecute (RCE в Cursor через MCP) | Результат вызова инструмента / функции | | Перемещается по цепочке вызовов инструментов | Cursor (исправлено в v1.3) | Исследователь: Aim Labs (Aim Security) | Исследование / red-team | Не полностью проверено | CVE-2025-54135: инъекция промпта, доставленная через внешний источник данных MCP (например, сообщение Slack, возвращённое через инструмент), заставляет Cursor перезаписать собственный mcp.json, и автозапуск выполняет команду злоумышленника без подтверждения. Основная страница Aim Labs была недоступна при проверке; подтверждено вторичными сообщениями. | AML.T0051.001; AML.T0053 | Авг 2025 | https://www.catonetworks.com/blog/curxecute-rce/ | | AgentFlayer (ChatGPT Connectors) | Косвенно – документ / файл | | | ChatGPT (Connectors) | Исследователь: Tamir Ishay Sharbat (Zenity Labs) | Исследование / red-team | Подтверждено | Невидимая полезная нагрузка, скрытая в общем документе, инструктирует ChatGPT — через Connectors, такие как Google Drive, — отрисовать изображение markdown, параметры URL которого несут украденные данные; отрисовка запускает запрос без клика. | AML.T0051.001; AML.T0057 | Авг 2025 | https://labs.zenity.io/post/agentflayer-chatgpt-connectors-0click-attack-5b41 | | Инъекция через Reddit в Perplexity Comet | Косвенно – веб-сайт / HTML | | | Perplexity Comet | Исследователь: Artem Chaikin, Shivan Kaul Sahib (Brave) | Исследование / red-team | Подтверждено | Суммирование страницы Reddit, в комментарии которой инструкции были скрыты за тегом спойлера, заставило браузер Comet прочитать электронную почту пользователя и OTP из Gmail из аутентифицированных сессий и эксфильтрировать их, ответив на комментарий. | AML.T0051.001; AML.T0057 | Авг 2025 | https://brave.com/blog/comet-prompt-injection/ | | Промпт-вайпер в Amazon Q Developer | Код / содержимое репозитория | | | Amazon Q Developer (расширение VS Code) | В реальных условиях: актор «lkmanka58» | В реальных условиях | Не полностью проверено | Злоумышленник влил PR в расширение Amazon Q Developer, внедрив промпт, инструктирующий ассистента уничтожить локальные файлы и ресурсы AWS; он вышел в v1.84.0 до удаления (по сообщениям, не выполнился бы из-за форматирования). Подтверждено через агрегированные сообщения; первоисточник напрямую не подтверждён. | AML.T0051.001 | Июл 2025 | https://www.scworld.com/news/amazon-q-extension-for-vs-code-reportedly-injected-with-wiper-prompt | | EchoLeak (M365 Copilot, нарушение области видимости LLM) | Косвенно – электронная почта | | | Microsoft 365 Copilot | Исследователь: Aim Labs (Aim Security) | Исследование / red-team | Подтверждено | CVE-2025-32711 (CVSS 9.3): одно специально составленное письмо заставило RAG-движок M365 Copilot подтянуть инструкции злоумышленника в контекст вместе с привилегированными данными («нарушение области видимости LLM») и эксфильтрировать их без какого-либо взаимодействия с пользователем, обойдя классификатор XPIA и редактирование ссылок/изображений; исправлено на стороне сервера. | AML.T0051.001; AML.T0057 | Июн 2025 | https://www.aim.security/lp/aim-labs-echoleak-m365 | | Токсичный поток агента GitHub MCP | Код / содержимое репозитория; MCP-сервер / соединение | | Перемещается по цепочке вызовов инструментов | Claude 4 Opus (Claude Desktop + GitHub MCP) | Исследователь: Invariant Labs | Исследование / red-team | Подтверждено | Инъекция промпта, внедрённая в публичный issue на GitHub и достигнутая через MCP-сервер GitHub, принуждает агента подтянуть данные приватного репозитория в контекст и утечь их в автономно созданном публичном pull request; ни один компонент не даёт сбоя. | AML.T0051.001; AML.T0057; AML.T0053 | Май 2025 | https://invariantlabs.ai/blog/mcp-github-vulnerability | | Обход гардрейлов через инъекцию символов | Прямой промпт | Символы нулевой ширины; Гомоглифы; Контрабанда эмодзи / селекторов вариаций; Многослойно | | Azure Prompt Shield; Meta Prompt Guard; ProtectAI Prompt Injection v1/v2; NVIDIA NeMo Guard; Vijil | Исследователь: Mindgard / Lancaster University (Hackett et al.) | Исследование / red-team | Подтверждено | Систематическое исследование: непечатаемые символы нулевой ширины, подстановка гомоглифов и контрабанда селекторов вариаций эмодзи обходят коммерческие классификаторы гардрейлов инъекций промптов/джейлбрейков (подтверждённые цели — это системы обнаружения, а не сами LLM); нулевая ширина в среднем давала 44–76% обхода, контрабанда эмодзи — наивысший результат. | AML.T0068; AML.T0051 | Апр 2025 | https://arxiv.org/html/2504.11168v1 | | Отравление инструментов MCP | MCP-сервер / соединение | | Перемещается по цепочке вызовов инструментов | Cursor | Исследователь: Invariant Labs | Исследование / red-team | Подтверждено | Вредоносные инструкции, встроенные в описание инструмента MCP, невидимы пользователю, но читаются моделью; отравленный инструмент «add» незаметно заставил Cursor прочитать и эксфильтрировать SSH-ключ разработчика, вернув при этом корректный результат. Anthropic, OpenAI и Zapier названы затронутыми клиентами. | AML.T0051.001; AML.T0053 | Апр 2025 | https://invariantlabs.ai/blog/mcp-security-notification-tool-poisoning-attacks | | Прыжок через очередь в MCP | MCP-сервер / соединение | | | Claude Desktop | Red team: Trail of Bits | Исследование / red-team | Подтверждено | Поскольку клиенты MCP загружают каждое описание инструмента в контекст модели, как только сервер указан, вредоносное описание может изменить поведение модели до вызова любого инструмента, обходя шаг подтверждения вызова инструмента пользователем. | AML.T0051.001; AML.T0053 | Апр 2025 | https://blog.trailofbits.com/2025/04/21/jumping-the-line-how-mcp-servers-can-attack-you-before-you-ever-use-them/ | | Rug pull в MCP | MCP-сервер / соединение | | | | Исследователь: Invariant Labs | Исследование / red-team | Подтверждено | Вредоносный MCP-сервер представляет безобидный инструмент для получения одобрения, а затем незаметно подменяет его отравленными инструкциями; клиенты не запрашивают повторно, поскольку идентичность инструмента не изменилась. | AML.T0051.001; AML.T0053 | Апр 2025 | https://invariantlabs.ai/blog/mcp-security-notification-tool-poisoning-attacks | | Бэкдор в файлах правил (Cursor / Copilot) | Код / содержимое репозитория | Символы нулевой ширины; Символы Unicode-тегов (невидимые) | Распространяется через общие конфигурационные / файлы правил | Cursor; GitHub Copilot | Исследователь: Ziv Karliner (Pillar Security) | Исследование / red-team | Подтверждено | Инструкции в невидимом Unicode, скрытые в файлах «правил»/конфигурации ИИ-кодинга, незаметно направляют Cursor и GitHub Copilot на вставку бэкдоров в генерируемый код, при этом ничего не отображается в чате или логах; скрытые символы невидимы даже в представлении PR-ревью GitHub. | AML.T0051.001; AML.T0068 | Мар 2025 | https://www.pillar.security/blog/new-vulnerability-in-github-copilot-and-cursor-how-hackers-can-weaponize-code-agents | | Сохранение памяти Gemini (отложенный вызов инструмента) | Косвенно – документ / файл | | Сохраняется в памяти агента / проекта; Кросс-агентно / кросс-сессионно | Gemini Advanced | Исследователь: Johann Rehberger (Embrace The Red) | Исследование / red-team | Подтверждено | Вредоносный загруженный документ отравляет чат так, что когда пользователь позже произносит слово-триггер, Gemini вызывает свой инструмент памяти «от имени пользователя» («отложенный вызов инструмента») и записывает выбранные злоумышленником ложные долгосрочные воспоминания, которые сохраняются в будущих сессиях. | AML.T0051.001; AML.T0053 | Фев 2025 | https://embracethered.com/blog/posts/2025/gemini-memory-persistence-prompt-injection/ | | ZombAIs (C2 через Claude Computer Use) | Косвенно – веб-сайт / HTML | | | Claude Computer Use | Исследователь: Johann Rehberger (Embrace The Red) | Исследование / red-team | Подтверждено | Вредоносная веб-страница внедряет инструкции, заставляющие Claude Computer Use скачать и запустить бинарный файл, который устанавливает соединение с сервером исследователя — полная цепочка от инъекции промпта до командного управления на агенте, использующем компьютер. | AML.T0051.001; AML.T0053 | Окт 2024 | https://embracethered.com/blog/posts/2024/claude-computer-use-c2-the-zombais-are-coming/ | | SpAIware (память ChatGPT) | Косвенно – веб-сайт / HTML; Косвенно – документ / файл | | Сохраняется в памяти агента / проекта; Кросс-агентно / кросс-сессионно | ChatGPT (приложение для macOS) | Исследователь: Johann Rehberger (Embrace The Red) | Исследование / red-team | Подтверждено | Инъекция промпта из недоверенного веб-контента/документа записывает постоянную инструкцию в долгосрочную память ChatGPT, вызывая непрерывную эксфильтрацию (через URL отрисованных изображений) всего, что пользователь вводит или получает во всех будущих сессиях, пока память не будет удалена. | AML.T0051.001; AML.T0057 | Сен 2024 | https://embracethered.com/blog/posts/2024/chatgpt-macos-app-persistent-data-exfiltration/ | | Эксфильтрация через ASCII-контрабанду в M365 Copilot | Косвенно – электронная почта; Косвенно – документ / файл | Символы Unicode-тегов (невидимые) | Перемещается по цепочке вызовов инструментов | Microsoft 365 Copilot | Исследователь: Johann Rehberger (Embrace The Red) | Исследование / red-team | Подтверждено | Инъекция промпта, скрытая во вредоносном письме или общем документе, заставила M365 Copilot автоматически искать другие письма/документы, а затем использовала ASCII-контрабанду (невидимые Unicode-теги) для встраивания собранных данных (например, кодов MFA) в кликабельные гиперссылки, отображаемые пользователю; исправлено ~июл 2024. | AML.T0051.001; AML.T0068; AML.T0057; AML.T0053 | Авг 2024 | https://embracethered.com/blog/posts/2024/m365-copilot-prompt-injection-tool-invocation-and-data-exfil-using-ascii-smuggling/ | | Эксфильтрация через косвенную инъекцию в Slack AI | Косвенно – RAG / извлечённый контент | | Отравляет общее хранилище данных / RAG | Slack AI | Red team: PromptArmor | Исследование / red-team | Подтверждено | Злоумышленник внедряет инструкции в публичный канал Slack; Slack AI поглощает их в свой RAG-конвейер, и когда жертва позже делает запрос, внедрённая инструкция отрисовывает ссылку markdown, контрабандой переносящую данные приватного канала (например, API-ключ) в URL к злоумышленнику. | AML.T0051.001; AML.T0057 | Авг 2024 | https://www.promptarmor.com/resources/data-exfiltration-from-slack-ai-via-indirect-prompt-injection | | Эксфильтрация данных из GitHub Copilot Chat | Код / содержимое репозитория | | | GitHub Copilot Chat (GPT-4) | Исследователь: Johann Rehberger (Embrace The Red) | Исследование / red-team | Подтверждено | Специально составленные инструкции в файле исходного кода заставили GitHub Copilot Chat выдать изображение markdown, URL которого нёс данные предыдущей беседы; при автоматической отрисовке данные были эксфильтрированы злоумышленнику. | AML.T0051.001; AML.T0057 | Июн 2024 | https://embracethered.com/blog/posts/2024/github-copilot-chat-prompt-injection-data-exfiltration/ | | Morris II (самореплицирующийся червь GenAI) | Косвенно – RAG / извлечённый контент; Косвенно – электронная почта; Мультимодально – изображение | | Самораспространяющийся / червь (ИИ-к-ИИ); Отравляет общее хранилище данных / RAG; Отправляет исходящее письмо / сообщение с дальнейшими инструкциями; Кросс-агентно / кросс-сессионно | Gemini Pro; ChatGPT 4.0; LLaVA | Исследователь: Stav Cohen (Technion), Ron Bitton (Intuit), Ben Nassi (Cornell Tech) | Исследование / red-team | Подтверждено | «Составленный противником самореплицирующийся промпт» заставляет основанного на RAG ИИ-ассистента электронной почты копировать промпт в собственный вывод и доставлять его дальнейшим агентам, вызывая червеобразный каскад косвенных инъекций промптов, который спамит и эксфильтрирует данные. Продемонстрировано с текстовыми и графическими полезными нагрузками. | AML.T0051.001 | Мар 2024 | https://arxiv.org/abs/2403.02817 | | Скрытая инъекция промпта против Claude (Unicode-теги) | Прямой промпт | Символы Unicode-тегов (невидимые) | | Anthropic Claude | Исследователь: Johann Rehberger (Embrace The Red) | Исследование / red-team | Подтверждено | Claude интерпретировал невидимые кодовые точки Unicode-тегов, вставленные в его интерфейс — то же поведение со скрытыми инструкциями, что было показано против ChatGPT. Anthropic рассмотрела и пометила это как «Not Applicable» (не выявлено влияния на безопасность), но поведение интерпретации было продемонстрировано. | AML.T0051.000; AML.T0068 | Фев 2024 | https://embracethered.com/blog/posts/2024/claude-hidden-prompt-injection-ascii-smuggling/ | | ASCII-контрабанда / невидимые Unicode-теги (основополагающее) | Косвенно – веб-сайт / HTML; Косвенно – документ / файл; Прямой промпт | Символы Unicode-тегов (невидимые) | | ChatGPT (GPT-4 / DALL·E) | Исследователь: Johann Rehberger (Embrace The Red) | Исследование / red-team | Подтверждено | Основополагающая статья и инструмент «ASCII Smuggler»: кодовые точки блока Unicode Tags (диапазон U+E0000) зеркалят ASCII, но отображаются невидимо, при этом LLM всё равно их интерпретируют; скрытые инструкции заставили ChatGPT вызвать DALL·E. Основа для всего класса невидимых инъекций. | AML.T0051; AML.T0068 | Янв 2024 | https://embracethered.com/blog/posts/2024/hiding-and-finding-text-with-unicode-tags/ | | Перехват управления чат-ботом поддержки DPD | Прямой промпт | | | | В реальных условиях: Ashley Beauchamp | В реальных условиях | Подтверждено | Клиент проинструктировал чат-бот поддержки DPD игнорировать свои правила, заставив его ругаться и написать стихотворение, порочащее DPD — прямое переопределение инструкций; DPD отключила бота в тот же день. Базовая модель не раскрыта. (Управляемое пользователем манипулирование ботом, с которым он общался; нет сторонней жертвы или эксфильтрации.) | AML.T0051.000; AML.T0054 | Янв 2024 | https://www.theregister.com/2024/01/23/dpd_chatbot_goes_rogue | | Перехват управления чат-ботом автосалона Chevrolet («Tahoe за $1») | Прямой промпт | | | Ассистент автосалона на базе ChatGPT | В реальных условиях: Chris Bakke | В реальных условиях | Подтверждено | Пользователь внедрил инструкции, заставившие веб-ассистента автосалона Chevrolet на базе ChatGPT «согласиться» продать Tahoe 2024 года за $1 и назвать это юридически обязывающим — классическое прямое переопределение инструкций (в реальности не имеет силы; управляемое пользователем, нет сторонней жертвы). | AML.T0051.000 | Дек 2023 | https://the-decoder.com/people-buy-brand-new-chevrolets-for-1-from-a-chatgpt-chatbot/ | | Эксфильтрация через markdown-изображение в Google Bard | Косвенно – документ / файл; Косвенно – электронная почта | | | Google Bard | Исследователь: Johann Rehberger (Embrace The Red) | Исследование / red-team | Подтверждено | Косвенная инъекция промпта в общем Google Doc заставила Bard выдать изображение markdown, URL которого содержал данные чата пользователя; клиент автоматически загрузил изображение, эксфильтрировав данные без взаимодействия с пользователем. Один из первых случаев zero-click эксфильтрации в LLM; исправлено в окт 2023. | AML.T0051.001; AML.T0057 | Ноя 2023 | https://embracethered.com/blog/posts/2023/google-bard-data-exfiltration/ | | Мультимодальная инъекция промпта через изображение (GPT-4V) | Мультимодально – изображение | | | GPT-4V | Исследователь: Riley Goodside (через Simon Willison) | Исследование / red-team | Подтверждено | Изображение, выглядящее пустым, несёт инструкции почти белым текстом на белом фоне; OCR GPT-4V читает и выполняет их (демонстрация Goodside заставила модель подавить своё описание и рекламировать фальшивую распродажу). Ранняя мультимодальная инъекция промпта. | AML.T0051.001 | Окт 2023 | https://simonwillison.net/2023/Oct/14/multi-modal-prompt-injection/ | | Джейлбрейк через промпт в кодировке Base64 | Прямой промпт | Base64; Многослойно | | GPT-4; Claude v1.3; GPT-3.5 Turbo | Исследователь: Wei, Haghtalab, Steinhardt (UC Berkeley) | Исследование / red-team | Подтверждено | Кодирование запрещённого запроса в Base64 эксплуатирует «несогласованное обобщение» — модели учатся декодировать Base64 на этапе предобучения, но обучение безопасности никогда не охватывало такие входные данные — обходя гардрейлы; комбинированные атаки достигали ~94% успеха на GPT-4. Опубликовано в июл 2023, непосредственно перед двухлетним окном; канонический первоисточник для джейлбрейков с закодированными полезными нагрузками. | AML.T0054; AML.T0068; AML.T0051.000 | Июл 2023 | https://arxiv.org/abs/2307.02483 |
Как внедрённые инструкции достигают модели. Расширяемо; добавляйте новый термин здесь, когда отчёт описывает действительно новый вектор.- Прямой промпт — текст, контролируемый злоумышленником, введённый непосредственно во входные данные модели.
Обфускация, применённая к полезной нагрузке. Пустая ячейка в таблице означает, что полезная нагрузка была открытым текстом или отчёт не уточнял.
Предназначена ли инъекция для распространения или сохранения. Пустая ячейка в таблице означает, что поведение распространения не было зафиксировано.
Техники помечены идентификаторами техник MITRE ATLAS, где таковой применим. Идентификаторы проверяются при каждом обновлении по каноническому источнику MITRE mitre-atlas/atlas-data (данные, генерирующие живую матрицу; сайт atlas.mitre.org — это JS-приложение, блокирующее автоматическую выборку). Поведения без чёткого сопоставления с ATLAS отмечены придуманной меткой (CREDIT: Rachel James, на основе цитируемого отчёта). Идентификаторы, используемые в этом трекере:
AML.T0051 LLM Prompt Injection — AML.T0051.000 Direct, AML.T0051.001 IndirectAML.T0053 AI Agent Tool Invocation (заменяет вышедшее из употребления название «LLM Plugin Compromise»)AML.T0054 LLM JailbreakAML.T0057 LLM Data LeakageAML.T0068 LLM Prompt ObfuscationВклад приветствуется — см. CONTRIBUTING.md или предложите технику напрямую. Каждая предлагаемая строка должна ссылаться на явный источник для каждого непустого поля; неясные записи помечаются «Not fully vetted», а не удаляются.