AI Security Newsletter - Ежемесячный дайджест исследований в области безопасности ИИ, инсайтов, отчетов, предстоящих событий, а также инструментов и ресурсов.
Дайджест исследований в области безопасности ИИ, идей, отчетов, предстоящих событий, инструментов и ресурсов. Подписывайтесь на сообщество AISecHub и нашу группу в LinkedIn для дополнительных обновлений. Также ознакомьтесь с нашим проектом Awesome AI Security.
При поддержке InnovGuard.com - Консультирование по технологическим рискам и кибербезопасности - Инновируйте и инвестируйте с уверенностью, действуйте с гарантией.
📌 Обновление таксономии: Режимы сбоев в агентных системах ИИ Microsoft расширяет свою таксономию режимов сбоев агентного ИИ на основе работы red team, предоставляя командам безопасности более понятный способ анализа неправильного использования инструментов, чрезмерной автономии, загрязнения памяти, границ идентичности и пробелов в ручном переопределении в развернутых агентных системах.
📌 Miasma Worm снова атакует Microsoft: Действие Azure Functions и 72 других репозитория отключены после атаки на цепочку поставок, нацеленной на ИИ-агентов кодирования StepSecurity документирует кампанию по атаке на цепочку поставок, направленную на рабочие процессы ИИ-агентов кодирования и репозитории GitHub, с акцентом на защиту от доверия к зависимостям, происхождению действий, путей записи в репозитории и видимых для агента учетных данных в средах CI/CD.
📌 Печальное состояние распределения навыков Исследователи Trail of Bits обошли проверки ClawHub, Cisco skill-scanner и skills.sh с помощью пакетов навыков, использующих усечение, косвенность архива, отравление байт-кодом и фрейминг с инъекцией промптов, показывая, почему публичные маркетплейсы навыков агентов нуждаются в курировании и контроле происхождения, а не только в доверии к сканерам.
📌 Codex CLI RCE: Смягчение инъекции промптов Cymulate разбирает риск инъекции промптов в агентах кодирования командной строки, где непроверенный текст может управлять записью файлов или выполнением инструментов, если изоляция, границы утверждения и ограничения команд не применяются вне модели.
📌 Agentjacking: MCP-инъекция перехватывает ИИ-агентов кодирования Cloud Security Alliance обобщает паттерн «agentjacking» от Sentry к MCP, где телеметрия или содержимое проблем, контролируемые извне, становятся доверенным контекстом для агентов кодирования. Полезная защитная рамка — рассматривать данные наблюдения, отчетов об ошибках и интеграции как непроверенный ввод агента, а не как нейтральные метаданные разработки.
📌 SearchLeak: Как мы превратили M365 Copilot в оружие одношаговой кражи данных Varonis описывает цепочку атак на Microsoft 365 Copilot Enterprise, которая сочетает инъекцию параметра в промпт, поведение рендеринга HTML и злоупотребление путями поиска для утечки конфиденциальных данных M365 через одношаговый рабочий процесс.
📌 AutoJack: Как одна страница может выполнить RCE на хосте, запускающем вашего ИИ-агента Microsoft показывает, как вредоносная веб-страница, просмотренная ИИ-агентом просмотра, может достичь локального сервиса AutoGen Studio и инициировать выполнение процесса на хосте через небезопасное доверие к localhost и обработку действий агента.
📌 Атака на цепочку поставок Mastra npm: 140+ пакетов с бэкдором через тайпсквот easy-day-js StepSecurity сообщает о компрометации экосистемы npm Mastra через тайпсквот зависимость с обфусцированным дроппером postinstall, затрагивающую пакеты агентов, RAG, MCP и рабочих процессов, используемые в стеках приложений ИИ.
📌 Взлом LiteLLM: От пользователя с низкими привилегиями до администратора и RCE Obsidian документирует цепочку повышения привилегий и RCE в LiteLLM, показывая, как доступ с низкими привилегиями к шлюзу ИИ может стать административным контролем над секретами провайдеров, политикой прокси и функциями агента во время выполнения.
📌 Уязвимость Amazon Q: Компрометация через автоматическое выполнение MCP Wiz анализирует проблему расширения VS Code Amazon Q, где доверенная конфигурация MCP в рабочей области из клонированного репозитория может автоматически загружать поведение, контролируемое атакующим, и раскрывать пути выполнения разработчика и облачные учетные данные.
📌 macOS.Gaslight: Rust-бэкдор превращает инъекцию промптов против аналитика, а не песочницы SentinelOne документирует бэкдор на Rust, который внедряет содержимое инъекции промптов для аналитиков и инструментов на базе ИИ, смещая атаку с побега из песочницы на манипуляцию человеком и моделью, просматривающими вредоносное ПО.
📌 Использование компьютера и TOCTOU: То, на что вы нажимаете — не то, что получаете! Johann Rehberger демонстрирует состояние гонки в агенте компьютерного использования, где экран изменяется после того, как модель его увидела, но до того, как произошел клик, превращая безобидное взаимодействие в действие отправки Outlook и делая повторную проверку состояния пикселей или экрана до действия ключевым контролем.
📌 Спектральный подход vibe coding к разработке ПО с помощью ИИ Великобританский NCSC представляет помощь ИИ в кодировании как спектр риска, отделяя низкорисковые прототипы от сгенерированного кода, который затрагивает аутентификацию, авторизацию, конфиденциальные данные, критически важное для безопасности поведение или критическую инфраструктуру.
📌 Инъекция промптов и безопасность среды выполнения агентов: Практическая модель угроз TMLS рассматривает инъекцию промптов как проблему безопасности среды выполнения, отображая атаки через посредничество инструментов, хранилища памяти, исходящие каналы и пробелы в утверждении человеком. Практический вывод — перенести контроли в брокеры возможностей, изолированное выполнение, белые списки и пути аудита вместо того, чтобы рассматривать текст промпта как границу безопасности.
📌 Что произошло после того, как 2000 человек попытались взломать моего ИИ-ассистента Fernando Irarrázaval сообщает о задаче по инъекции промптов в почтового агента OpenClaw с более чем 6000 попытками и ни одной успешной утечкой секрета, одновременно выявляя практические проблемы развертывания: заражение памяти агента, пакетный контекст, стоимость API, блокировку учетной записи и выбор модели.
🧰 AgentStalker - Бенчмарк и набор инструментов анализа уязвимостей агентов с отслеживанием потока данных, анализом AST, аудитом кода и воспроизведением в изолированной среде для путей атак агентов. ⭐️115
🧰 darknet-mcp-server - MCP-сервер, предоставляющий инструменты для утечек, программ-вымогателей, вредоносного ПО, эксплойтов, логов стилеров и разведки угроз для ИИ-агентов в контролируемых исследовательских рабочих процессах безопасности. ⭐️67
🧰 mcp-trust-plane - Компонуемая плоскость безопасности данных и защиты для провайдеров протокола контекста модели (MCP), ориентированная на политики контроля вокруг инструментов и данных, подключенных к MCP. ⭐️60
🧰 prompt-gate - Локальный контроль DLP и уровня DNS для блокировки несанкционированных ИИ-инструментов и проверки исходящих промптов на наличие секретов или конфиденциальных данных перед их выходом с конечной точки. ⭐️28
🧰 claude-ai-cyber-security-skills - Коллекция навыков Claude Code для рабочих процессов безопасности, включая тестирование на проникновение, защитный анализ и шаблоны расследований с помощью инструментов. ⭐️17
🧰 talos - Сервис API-ключей и токенов возможностей для людей, сервисов и ИИ-агентов, которым нужна разграниченная авторизация между машинами. ⭐️14
🧰 SkillsGuard - Статический сканер для вредоносных или небезопасных пакетов навыков ИИ-агентов, файлов SKILL.md и встроенных скриптов. ⭐️13
🧰 tamga - Самостоятельно размещаемый прокси безопасности LLM для редактирования PII, защиты от инъекций промптов и контроля соответствия вокруг трафика модели. ⭐️11
🧰 llm-sec-range - Диапазон атак и защиты LLM, охватывающий CTF по инъекции промптов, OWASP LLM Top 10, уязвимых агентов и локальные целевые модели. ⭐️9
🧰 aka-claude-tools - Утилиты для укрепления Claude Code: чистый контекст, изолированные профили, заблокированные учетные данные, контролируемый исходящий трафик и более безопасные локальные настройки по умолчанию. ⭐️9
🧰 agent-jackstop - Уровень защиты для Cursor и Claude Code от инъекции промптов через непроверенный вывод инструментов, также описываемый как agentjacking. ⭐️8
🧰 LLM-Safety-platform - Платформа для red-teaming ИИ, предназначенная для оценки уязвимостей LLM, атак инъекцией промптов, обфускации и анализа стабильности выборки. ⭐️6
Июньское обновление OWASP превращает безопасность агентного ИИ в карту управления и инженерии, охватывающую автономные рабочие процессы, категории рисков агентов, средства контроля и практический разрыв между ранними моделями угроз и инцидентами в production.
Cloud Security Alliance публикует 247 целей контроля ИИ в 18 областях безопасности с сопоставлениями с фреймворками assurance и соответствия, такими как ISO 42001, ISO 27001, BSI AIC4 и управление, ориентированное на Закон ЕС об ИИ.
CSA превращает Матрицу контроля ИИ в руководство по внедрению для облачных провайдеров в области планирования аудита, исправлений, управления уязвимостями, надзора за партнерами, обнаружения угроз и практик assurance, специфичных для ИИ.
Великобританский NCSC и партнеры Five Eyes предупреждают, что ИИ снижает барьеры для атакующих и сжимает окно от уязвимости до эксплуатации, отображая сдвиг риска на безопасные по умолчанию настройки, сокращение поверхности, скорость исправлений, сильную аутентификацию, готовность к инцидентам и использование ИИ в защите.
NSA и международные партнеры публикуют рекомендации по безопасности MCP для автоматизации на основе ИИ, охватывающие аутентификацию, авторизацию, доверие к серверу, транспортные контроли, раскрытие инструментов и мониторинг для экосистем агентов, переходящих от экспериментов к production.
🛡️ CVE-2026-49257: mcp-pinot раскрывает неаутентифицированный вызов инструмента MCP Критический 10.0. mcp-pinot может привязать HTTP MCP сервер к 0.0.0.0 с отключенным OAuth по умолчанию, раскрывая инструменты SQL, схем и мутации таблиц через серверные учетные данные Apache Pinot.
🛡️ CVE-2026-54309: Транспорт MCP Browser в n8n принимает неаутентифицированные вызовы инструментов Критический 10.0. HTTP-транспорт MCP Browser в n8n может принимать инициализацию сессии и вызовы инструментов без аутентификации, раскрывая автоматизацию управления браузером для доступных клиентов.
🛡️ CVE-2026-56274: Инъекция команд в Custom MCP Server Flowise Критический 9.9. Обработка флагов команд и ограничения доступа к файлам в Custom MCP Server Flowise могут быть обойдены для инъекции команд ОС внутри платформы рабочих процессов LLM.
🛡️ CVE-2026-55255: IDOR выполнения flow в Langflow Критический 9.9. API ответов Langflow может позволить аутентифицированному атакующему выполнить flow другого пользователя, указав ID flow жертвы, нарушая изоляцию арендаторов для выполнения рабочих процессов ИИ.
🛡️ CVE-2026-50548: Побег из песочницы терминала агента Cursor Критический 9.8. Песочница терминала агента Cursor может быть обойдена путем изменения параметров рабочего каталога, позволяя действиям терминала, управляемым агентом, выполняться за пределами предполагаемой границы рабочей области.
🛡️ CVE-2026-50549: Побег из песочницы записи файла агента Cursor Критический 9.8. Песочница записи файлов Cursor может некорректно вернуться к резервному варианту после сбоя канонизации, создавая путь для записи файлов агентом за пределами предполагаемой границы проекта.
🛡️ CVE-2026-49468: Обход авторизации через заголовок host в прокси LiteLLM Критический 9.8. Парсинг заголовка host в прокси LiteLLM может позволить неаутентифицированный доступ к защищенным маршрутам управления при определенных условиях развертывания, ставя под угрозу контроли шлюза и секреты провайдера.
🛡️ CVE-2026-7664: Обход авторизации Streamable MCP в IBM Langflow Критический 9.8. Транспорт Streamable MCP в IBM Langflow может раскрыть защищенные ресурсы и операции MCP для неаутентифицированных атакующих в затронутых версиях с открытым исходным кодом.
🛡️ CVE-2026-55743: Обход белого списка оболочки настольного агента OpenHuman Критический 9.6. Белый список оболочки настольного агента OpenHuman может быть обойден с помощью флагов выполнения find и трюков с окружением, превращая косвенные пути инъекции промптов в выполнение команд на хосте.
📅 IEEE CSR GenXSec 2026 - 3–5 августа 2026 · Лиссабон, Португалия · Организатор: IEEE CSR
📅 Black Hat USA 2026 - Саммит по ИИ - 4 августа 2026 · Лас-Вегас, Невада, США · Организатор: Black Hat
📅 CAMLIS 2026 - 21–23 октября 2026 · Арлингтон, Вирджиния, США · Организатор: CAMLIS
📅 GAISS 2026 - 28–30 октября 2026 · Остин, Техас, США · Организатор: IEEE
📅 ACM AISec 2026 - 15–19 ноября 2026 · Гаага, Нидерланды · Организатор: ACM AISec
📖 AgentRedBench: Динамический Redteaming и защита с учетом интеграции для LLM-агентов через SaaS-интеграции
Оценивает косвенную инъекцию промптов против агентов, использующих инструменты, подключенных к SaaS-интеграциям, таким как Gmail, Salesforce и Jira, делая поверхность атаки ближе к рабочим процессам агентов в production, чем тесты инъекции промптов только в чате. arXiv
📖 SkillGuard: Фреймворк разрешений для навыков агентов
Рассматривает сторонние навыки агентов как программные артефакты с разрешениями, отображая, что навык может внедрить в контекст агента, и что это может заставить агента сделать во время выполнения. arXiv
📖 Несоответствие описания и кода в реальных MCP-серверах: Измерение, обнаружение и последствия для безопасности
Измеряет 19 200 пар описания и кода из 2 214 MCP-серверов и обнаруживает, что описания инструментов часто расходятся с фактическим поведением реализации, создавая слепую зону для агентов, выбирающих инструменты на основе описаний на естественном языке. arXiv
📖 GitInject: Атаки инъекцией промптов в реальном мире в пайплайнах CI/CD на основе ИИ
Показывает, как ИИ-агенты, встроенные в CI/CD и рабочие процессы pull-request, могут поглощать содержимое репозитория, контролируемое атакующим, при наличии повышенных разрешений, превращая инъекцию промптов в риск для цепочки поставок ПО. arXiv
📖 На пути к безопасным LLM-агентам: Поверхности угроз, атаки, защиты и оценка
Синтезирует 247 статей в системно-ориентированную карту безопасности агентов, центрируя поток информации, делегированные полномочия, постоянное состояние, перехват потока управления через инструменты и слабость некомпозиционных защит. arXiv
📖 Политика одного источника для агентных браузеров
Показывает, что агентные браузеры могут стать автоматизированными каналами межсайтового потока данных, затем предлагает SOPGuard для принудительного соблюдения границ происхождения браузера при сохранении полезности задач. arXiv
📖 Безвредные по отдельности, вредные в комбинации: Риски безопасности в экосистемах навыков агентов
Вводит риск композиции навыков, когда по отдельности безвредные навыки становятся вредными, когда их вывод, сигналы доверия, подсказки авторизации или побочные эффекты влияют на последующие вызовы инструментов в общем контексте агента. arXiv
📖 SafeClawBench: Разделение семантического, аудитного и песочничного вреда в LLM-агентах, использующих инструменты
Вводит поэтапный бенчмарк для безопасности агентов, использующих инструменты, охватывающий прямую и косвенную инъекцию промптов, инъекцию возвращаемых значений инструментов, отравление памяти, извлечение памяти и небезопасный вывод, разделяя согласие модели от видимого аудитом и наблюдаемого в песочнице вреда. arXiv
📖 «Что происходит локально, утекает глобально»: Обнаружение рисков утечки конфиденциальности в MCP-серверах
Рассматривает утечку MCP как проблему конфиденциальности, вызванную протоколом, где учетные данные, ключи API или PII пересекают границу локального и LLM через возвращаемые значения, логи или ошибки обработчиков инструментов. arXiv
📖 ShareLock: Скрытая атака порогового отравления несколькими инструментами против MCP
Вводит атаку отравления MCP несколькими инструментами, где вредоносные инструкции разделяются между безвредными описаниями инструментов и реконструируются только после триггера, снижая обнаруживаемость по сравнению с отравлением одним инструментом. arXiv
💬 Чистый репозиторий GitHub заставляет ИИ-агентов кодирования запускать вредоносное ПО r/cybersecurity · оценка Reddit 183 · 19 комментариев Практики рассматривали тему как случай границы доверия для агентов кодирования: промпты репозитория, файлы конфигурации, скрипты установки и контекст вывода инструментов могут влиять на выполнение до того, как рецензент увидит обычную вредоносную нагрузку.
💬 Бэкдор macOS Gaslight использует инъекцию промптов против аналитиков безопасности r/cybersecurity · оценка Reddit 202 · 11 комментариев Обсуждение представило инъекцию промптов как злоупотребление рабочим процессом анализа вредоносного ПО: вредоносные образцы могут внедрять инструкции для аналитиков и их ИИ-инструментов, поэтому среда рецензирования, заметки аналитика и контекст модели становятся частью поверхности атаки.
💬 Внедрение Copilot - Насколько я должен беспокоиться о косвенной инъекции промптов? r/cybersecurity · оценка Reddit 48 · 31 комментарий Команды безопасности сравнивали контроли внедрения Copilot для косвенной инъекции промптов, сосредоточившись на непроверенных документах и электронной почте, унаследованных разрешениях пользователей, избыточно расшаренных данных, области действия коннекторов и том, достаточно ли минимальных привилегий для помощников с дополненным поиском.💬 Как команды справляются с экспозицией поверхности инструментов MCP? r/cybersecurity · Оценка Reddit 13 · 19 комментариев Обсуждение было сосредоточено на MCP как границе экспозиции инструментов: команды обсуждали доступность серверов, доверие к описаниям инструментов, шлюзы утверждения, авторизацию для каждого инструмента и вопрос о том, следует ли моделировать доступ агента к инструментам ближе к доступу через API или к локальному выполнению кода.
💬 Готова ли чья-либо политика безопасности на самом деле к AI-агентам, или мы все просто притворяемся? r/cybersecurity · Оценка Reddit 47 · 73 комментария Практики соотнесли AI-агентов с пробелами в управлении существующей политики: кто отвечает за автоматизированные действия, что требует одобрения человека, как регистрируются делегированные разрешения и как меняется реагирование на инциденты, когда оператор рабочего процесса частично автоматизирован.
1️⃣ RCE в кодирующих агентах LLM: Уроки из недавно раскрытых уязвимостей Claude Code Сессия Cloud Native San Francisco об уроках RCE в кодирующих агентах, полезная для команд, оценивающих, как prompt injection, локальные инструменты и среды разработки могут объединиться в риск выполнения на стороне хоста.
2️⃣ Будущее безопасного корпоративного AI: создание надежных агентов с MCP Доклад на конференции Xpand о проектировании корпоративных агентов на основе MCP с практическим акцентом на надежную инфраструктуру агентов, раскрытие данных и меры безопасности вокруг подключенных инструментов.
3️⃣ Конференция по национальной безопасности CNAS 2026: Установление правил для AI-войны Сессия CNAS о нормах AI-войны и политике национальной безопасности, актуальная для команд безопасности, отслеживающих, как AI-активные кибероперации переходят в доктрину и управление государственного сектора.
4️⃣ Руководство HitchHacker по созданию безопасных агентов Доклад на NDC Conferences о создании безопасных агентов, охватывающий инженерные риски, которые возникают, когда агенты получают инструменты, учетные данные, состояние и автономию внутри реальных программных систем.
5️⃣ Атака на AI-системы Сессия CodeValue по атаке на AI-системы, полезная как практическое руководство по тому, как AI-функции расширяют модели угроз приложений за пределы обычной обработки prompt и API.
6️⃣ BlueHat 2026: От доверенных агентов к противникам: Обеспечение безопасности агентного AI в эпоху prompt injection Доклад BlueHat 2026 о том, как доверенные рабочие процессы агентов становятся враждебными, когда выходы инструментов, извлеченный контент и делегированные действия пересекают границы доверия.
7️⃣ Взлом приложений на базе LLM: Преодоление проблем безопасности и конфиденциальности Сессия Spring I/O от Брайана Вермеера, охватывающая практические пути атак на приложения на базе LLM, включая prompt injection, утечку конфиденциальности, риски интеграции приложений и архитектурные меры смягчения.
8️⃣ ContinuumCon 2026 - Охота за prompt injection Доклад ContinuumCon от Маккензи Джексона о поиске, тестировании и анализе поведения prompt-injection в AI-системах как операционной проблемы безопасности.
9️⃣ Обеспечение безопасности AI-агентов с помощью MCP и Zero Trust Identity Сессия DZone Events об обеспечении безопасности агентов, подключенных через MCP, с концепциями zero-trust identity, ограниченным доступом, авторизацией инструментов и более безопасными делегированными рабочими процессами.
🔟 Практическая безопасность MCP в действии Техническая сессия Bulgarian Java User Group от Виллема Яна Глерума о компромиссах безопасности MCP, экспозиции серверов и инструментов, рисках конфигурации и средствах контроля для интеграций агентов.
Если вы основатель, создающий что-то новое, или инвестор, оценивающий возможности на ранней стадии — давайте свяжемся.
💬 Прочитали что-то интересное? Поделитесь своими мыслями в комментариях.