Skip to content
KitploitKITPLOIT
ИнструментыЭксплойтыБлог
Log in
Отправить
ИнструментыЭксплойтыБлог
Отправить

Инструменты для хакинга, пентеста и кибербезопасности — ваш арсенал защиты!

Kitploit — это каталог инструментов для хакинга, кибербезопасности и пентестинга. Находите последние обновления проектов для поиска уязвимостей, анализа систем, автоматизации тестирования и усиления вашей безопасности.

ЛентыКонтактыКонфиденциальность© 2026 Kitploit

Каталог инструментов

Категории

Все категории
Loading categories
llm-security — Демонстрации концепций и исследования атак косвенной инъекции промптов на интегрированные в приложения LLM, охватывающие эксфильтрацию данных, удалённое управление, персистентность и отравление автодополнения кода. | Kitploit
Инструменты/GitHubGitHub/greshake/llm-security
ЭксплуатацияЭксфильтрация данныхФишингКомандование и УправлениеСоциальная инженерияСтатьи и ИсследованияОбучение и ОбразованиеРазработка Полезной НагрузкиБезопасность ИИСостязательная Атака
GitHubgreshake/llm-security
2.1k16181 год назадПроверено Kitploit

llm-security

Демонстрации концепций и исследования атак косвенной инъекции промптов на интегрированные в приложения LLM, охватывающие эксфильтрацию данных, удалённое управление, персистентность и отравление автодополнения кода.

Репозиторий

Популярное

Смотреть все →

Откройте для себя самые используемые инструменты нашего сообщества.

Изучить все инструменты

Просмотрите нашу коллекцию инструментов

Смотреть все инструменты →
Поделиться

Новое: Демонстрация атак с непрямым внедрением на Bing Chat


Компрометация LLM с помощью непрямого внедрения промптов

"... языковая модель — это тьюринг-полная странная машина, исполняющая программы, написанные на естественном языке; когда вы выполняете поиск, вы не «подключаете обновлённые факты к своему ИИ», вы фактически загружаете случайные новые неподписанные блобы кода из Интернета (многие написаны злоумышленниками) и небрежно исполняете их на своей языковой модели с полными привилегиями. Это добром не кончится." - Gwern Branwen на LessWrong

Мы представляем новый класс уязвимостей и последствий, проистекающих из «непрямого внедрения промптов», затрагивающих языковые модели, интегрированные с приложениями. Наши демонстрации на данный момент охватывают GPT-4 (Bing и синтетические приложения) с использованием ChatML, приложения на базе GPT-3 и LangChain, а также концепции доказательства для атак на движки автодополнения кода, такие как Copilot. Мы ожидаем, что эти векторы атак также будут применимы к плагинам ChatGPT и другим LLM, интегрированным в приложения. Мы показываем, что внедрение промптов — это не просто курьёз, а скорее серьёзное препятствие для развёртывания LLM.

Этот репозиторий служит доказательством концепции для результатов, обсуждаемых в нашей статье на ArXiv (прямая ссылка на PDF)

Обзор

Мы демонстрируем потенциально жестокие последствия предоставления LLM, таким как ChatGPT, интерфейсов к другим приложениям. Мы предлагаем новые активированные векторы атак и техники и приводим демонстрации каждой из них в этом репозитории:

  • Удалённое управление LLM
  • Утечка/эксфильтрация пользовательских данных
  • Постоянная компрометация между сессиями
  • Распространение внедрений на другие LLM
  • Компрометация LLM с помощью крошечных многоэтапных полезных нагрузок
  • Автоматизированная социальная инженерия
  • Атаки на движки автодополнения кода

Основываясь на наших результатах:

  1. Внедрение промптов может быть столь же мощным, как выполнение произвольного кода
  2. Непрямое внедрение промптов — это новый, гораздо более мощный способ доставки внедрений.
overview

Подключение LLM к другим приложениям может иметь критически важные последствия для безопасности. Даже без компрометации каких-либо подключённых приложений LLM может быть целью атаки. Мы показываем, как LLM может быть скомпрометирована, «взглянув» на веб-сайт, и как скомпрометированные LLM могут удалённо управляться или использоваться для эксфильтрации или изменения пользовательских данных. Мы демонстрируем множество совершенно новых векторов атак и методов, которые значительно повышают ставки при развёртывании этих моделей.

Больше информации о наших результатах, обсуждениях и ограничениях можно найти в статье на ArXiv (прямая ссылка на PDF)

Демонстрации

Попросите про Эйнштейна, получите пирата.

Этот сценарий показывает, как небольшое внедрение в большом разделе обычного контента может заставить LLM автономно и незаметно для конечного пользователя получить другую, более крупную полезную нагрузку.

Agent: Hello User how can I help today?
User:  When was Albert Einstein born?

Получая эту информацию, промпт компрометирует LLM с помощью небольшого внедрения, скрытого в побочных каналах, таких как Markdown страницы Wikipedia. Внедрение является комментарием и, следовательно, невидимо для обычного пользователя, посещающего сайт.

Agent: Aye, thar answer be: Albert Einstein be born on 14 March 1879.
User: Why are you talking like a pirate?
Agent: Arr matey, I am following the instruction aye.

Распространение внедрений через электронную почту

Автоматическая обработка сообщений и других входящих данных — один из способов использования LLM. Мы используем это наблюдение, чтобы продемонстрировать, как отравленный агент может распространять внедрение. Цель в этом сценарии может читать электронные письма, составлять электронные письма, просматривать адресную книгу пользователя и отправлять электронные письма.

Агент распространится на другие LLM, которые могут читать эти входящие сообщения.

Action: Read Email
Observation: Subject: "'"Party 32", "Message Body: [...]'"
Action: Read Contacts
Contacts: Alice, Dave, Eve
Action: Send Email
Action Input: Alice, Dave, Eve
Observation: Email sent

Автоматизированные конвейеры обработки данных, включающие LLM, присутствуют в крупных технологических компаниях и инфраструктуре государственного наблюдения и могут быть уязвимы для таких цепочек атак.

Атаки на автодополнение кода

Мы показываем, как на автодополнение кода можно влиять через контекстное окно. Движки автодополнения кода, использующие LLM, применяют сложные эвристики для определения того, какие фрагменты кода включаются в контекст. Движок автодополнения часто собирает фрагменты из недавно посещённых файлов или релевантных классов, чтобы предоставить языковой модели релевантную информацию.

Злоумышленники могут попытаться вставить вредоносный, обфусцированный код, который любопытный разработчик может выполнить, когда движок автодополнения его предложит, поскольку он пользуется определённым уровнем доверия.

В нашем примере, когда пользователь открывает «пустой» пакет в своём редакторе, внедрение промпта активно до тех пор, пока движок автодополнения кода не удалит его из контекста. Внедрение размещено в комментарии и не может быть обнаружено никаким автоматизированным процессом тестирования.

Злоумышленники могут обнаружить более надёжные способы сохранения отравленных промптов в контекстном окне. Они также могут вносить более тонкие изменения в документацию, что затем смещает движок автодополнения кода в сторону внесения тонких уязвимостей.

Скачать инструмент