
Правила обнаружения Sigma для мониторинга безопасности AI-агентов
Этот репозиторий содержит правила обнаружения, которые помогают выявить, когда AI-агент подвергается атаке или манипуляции. Представьте это как библиотеку «сигнатур угроз» — каждое правило описывает шаблон, при совпадении с лог-данными агента сигнализирующий о возможном подозрительном событии.
AgentShield — это open-source слой безопасности для AI-агентов. Он мониторит поведение агента в реальном времени и использует эти правила Sigma для обнаружения атак, таких как инъекция промптов, кража данных, отравление инструментов и повышение привилегий, прежде чем они причинят вред.
Sigma — это открытый стандарт, используемый в индустрии кибербезопасности для написания правил обнаружения. Если сигнатуры антивируса говорят вашему компьютеру «этот файл вредоносен», то правила Sigma сообщают вашей системе безопасности «этот шаблон активности в логах подозрителен».
Правило Sigma — это короткий YAML-файл, который гласит: «Если вы видите этот шаблон в логах, поднимите тревогу». Например, упрощённое правило может выглядеть так:
ЕСЛИ лог-событие является user_input
И сообщение содержит "игнорировать предыдущие инструкции"
ТО поднять критическую тревогу для инъекции промптов
Поскольку Sigma является вендорно-нейтральным стандартом, эти правила работают с любым совместимым с Sigma движком обнаружения — не только с AgentShield. Это означает, что команды безопасности могут интегрировать их в свой существующий инструментарий без привязки к вендору.
Когда кто-то пытается переопределить инструкции агента — либо напрямую (набирая «игнорировать предыдущие инструкции»), либо косвенно (скрывая инструкции в документах, которые читает агент).
Когда агент обманом заставляют отправлять конфиденциальные данные злоумышленнику — через HTTP-загрузки, DNS-туннелирование, скрытые markdown-изображения или стеганографические методы.
Когда вредоносные метаданные скрыты в описаниях MCP-инструментов, или инструменты меняют своё поведение после того, как им доверились (атаки «rug pull»).
Когда агент получает доступ к конфиденциальным файлам, таким как SSH-ключи, токены API, облачные учётные данные или переменные окружения, содержащие секреты.
Когда агент пытается получить больше доступа, чем предполагалось — через sudo, эскалацию контейнера, манипуляции с облачным IAM или подделку системных файлов.
Когда злоумышленник пытается сохранить долгосрочный доступ — через задания cron, модификации профиля оболочки, launch agents или отравление памяти агента.
Когда агента обманом заставляют скачать и запустить вредоносные скрипты, установить обратные оболочки или выполнить обфусцированные команды.
Когда агент выполняет сканирование сети или DNS-перечисление для составления карты целевой среды.
Когда агент изменяет конфигурационные файлы, чувствительные к безопасности, чтобы ослабить защиту — настройки автоматического утверждения, конфигурации MCP или файлы правил AI-ассистента.
Когда пакеты или навыки устанавливаются из ненадёжных источников — прямых URL, репозиториев GitHub или tarball-архивов.
rules/
└── ai_agent/
├── ai_agent_prompt_injection_direct.yml
├── ai_agent_credential_access.yml
├── ai_agent_mcp_tool_poisoning.yml
└── ... (все правила в одном плоском каталоге)
Правила организованы по продукту (ai_agent) в соответствии с соглашениями SigmaHQ. Конкретная категория угроз для каждого правила указана в метаданных YAML правила (через теги MITRE ATT&CK и поля logsource), а не в структуре каталогов. Такая плоская структура сохраняет репозиторий простым и избегает неоднозначности, когда правило охватывает несколько категорий атак.
# Клонировать репозиторий правил
git clone https://github.com/agentshield-ai/sigma-ai.git
# Использовать с движком AgentShield
export AGENTSHIELD_AUTH_TOKEN="replace-with-at-least-32-characters"
agentshield serve --rules ./sigma-ai/rules --port 8433
# Проверить правила
agentshield rules validate --path ./sigma-ai/rules
Эти правила следуют стандартному формату Sigma и могут использоваться с любым совместимым с Sigma инструментом:
# Проверить с помощью sigma-cli
sigma check rules/
# Преобразовать в другие форматы
sigma convert -t <target> rules/ai_agent/
Ниже приведён полностью аннотированный пример, показывающий анатомию правила Sigma. Каждое поле объяснено простым языком.
title: Direct Prompt Injection Attempt # Human-readable name
id: eddcdc94-698c-577f-900d-28b1b5491a80 # Unique identifier (UUID v5)
related: # Links to related rules
- id: agent-prompt-injection-direct-001 # Previous ID this replaces
type: obsoletes
status: stable # Maturity level (see below)
description: | # What this rule detects
Detects direct prompt injection attempts in AI agent inputs containing
common jailbreak phrases, system override commands, and policy manipulation
structures. These patterns indicate attempts to compromise agent behaviour
through malicious instructions.
references: # Further reading
- https://owasp.org/www-project-top-10-for-large-language-model-applications/
author: AgentShield # Who wrote this rule
date: "2026-02-16" # When it was first written
modified: "2026-02-24" # When it was last changed
tags: # MITRE ATT&CK mappings
- attack.initial_access
- attack.t1190
logsource: # What log format to expect
product: ai_agent
category: agent_events
detection: # The matching logic
selection_jailbreak_keywords:
event_type: user_input
message|contains:
- 'ignore previous instructions'
- 'developer mode'
condition: selection_jailbreak_keywords
falsepositives: # Known benign triggers
- Legitimate AI safety research
level: critical # Severity (critical/high/medium/low)
Вот что делает каждый раздел: