
Regras de detecção Sigma para monitoramento de segurança de agentes de IA
Este repositório contém regras de deteção que ajudam a identificar quando um agente de IA está a ser atacado ou manipulado. Pense nisso como uma biblioteca de "assinaturas de ameaças" – cada regra descreve um padrão que, quando correspondido nos dados de registo (logs) de um agente, sinaliza que algo suspeito pode estar a acontecer.
O AgentShield é uma camada de segurança open-source para agentes de IA. Monitoriza o comportamento do agente em tempo real e utiliza estas regras Sigma para detetar ataques adversários como injeção de instruções (prompt injection), roubo de dados, envenenamento de ferramentas e escalada de privilégios – antes que causem danos.
Sigma é um padrão aberto utilizado em toda a indústria de cibersegurança para escrever regras de deteção. Se as assinaturas de antivírus dizem ao seu computador "este ficheiro é malicioso", as regras Sigma dizem à sua plataforma de segurança "este padrão de atividade nos registos é suspeito".
Uma regra Sigma é um ficheiro YAML curto que diz: "Se vires este padrão nos registos, levanta um alerta." Por exemplo, uma regra simplificada poderia ser:
SE o evento de registo é user_input
E a mensagem contém "ignore previous instructions"
ENTÃO levanta um alerta crítico para injeção de instruções
Como Sigma é um padrão independente de fornecedor, estas regras funcionam com qualquer motor de deteção compatível com Sigma – não apenas com o AgentShield. Isto significa que as equipas de segurança podem integrá-las nas suas ferramentas existentes sem dependência de um fornecedor específico.
Quando alguém tenta sobrepor as instruções de um agente – diretamente (escrevendo "ignore previous instructions") ou indiretamente (escondendo instruções em documentos que o agente lê).
Quando um agente é enganado para enviar dados sensíveis para um atacante – através de uploads HTTP, DNS tunnelling, imagens Markdown ocultas ou técnicas esteganográficas.
Quando metadados maliciosos estão escondidos em descrições de ferramentas MCP, ou quando ferramentas mudam de comportamento depois de serem confiadas (ataques de "rug pull").
Quando um agente acede a ficheiros sensíveis como chaves SSH, tokens de API, credenciais cloud ou variáveis de ambiente que contêm segredos.
Quando um agente tenta obter mais acesso do que o pretendido – através de sudo, escapes de contentores, manipulação de IAM cloud ou adulteração de ficheiros do sistema.
Quando um atacante tenta manter acesso a longo prazo – através de cron jobs, modificações de perfis de shell, agentes de inicialização ou envenenamento da memória do agente.
Quando um agente é enganado para descarregar e executar scripts maliciosos, estabelecer reverse shells ou executar comandos ofuscados.
Quando um agente realiza scanning de rede ou enumeração DNS para mapear um ambiente alvo.
Quando um agente modifica ficheiros de configuração sensíveis à segurança para enfraquecer defesas – definições de aprovação automática, configurações MCP ou ficheiros de regras de assistente de IA.
Quando pacotes ou skills são instalados a partir de fontes não confiáveis – URLs diretos, repositórios GitHub ou arquivos tarball.
rules/
└── ai_agent/
├── ai_agent_prompt_injection_direct.yml
├── ai_agent_credential_access.yml
├── ai_agent_mcp_tool_poisoning.yml
└── ... (todas as regras num único diretório plano)
As regras estão organizadas por produto (ai_agent) seguindo as convenções do SigmaHQ. A categoria de ameaça específica de cada regra é capturada nos metadados YAML da regra (através de tags MITRE ATT&CK e dos campos logsource), não na estrutura de diretórios. Esta estrutura plana mantém o repositório simples e evita ambiguidades quando uma regra abrange múltiplas categorias de ataque.
# Clonar o repositório de regras
git clone https://github.com/agentshield-ai/sigma-ai.git
# Usar com o motor AgentShield
export AGENTSHIELD_AUTH_TOKEN="substituir-por-pelo-menos-32-caracteres"
agentshield serve --rules ./sigma-ai/rules --port 8433
# Validar regras
agentshield rules validate --path ./sigma-ai/rules
Estas regras seguem o formato Sigma padrão e podem ser usadas com qualquer ferramenta compatível com Sigma:
# Validar com sigma-cli
sigma check rules/
# Converter para outros formatos
sigma convert -t <target> rules/ai_agent/
Abaixo está um exemplo completamente anotado mostrando a anatomia de uma regra Sigma. Cada campo é explicado em linguagem simples.
title: Direct Prompt Injection Attempt # Nome legível por humanos
id: eddcdc94-698c-577f-900d-28b1b5491a80 # Identificador único (UUID v5)
related: # Ligações a regras relacionadas
- id: agent-prompt-injection-direct-001 # ID anterior que esta substitui
type: obsoletes
status: stable # Nível de maturidade (ver abaixo)
description: | # O que esta regra deteta
Detects direct prompt injection attempts in AI agent inputs containing
common jailbreak phrases, system override commands, and policy manipulation
structures. These patterns indicate attempts to compromise agent behaviour
through malicious instructions.
references: # Leituras adicionais
- https://owasp.org/www-project-top-10-for-large-language-model-applications/
author: AgentShield # Quem escreveu esta regra
date: "2026-02-16" # Quando foi escrita pela primeira vez
modified: "2026-02-24" # Quando foi alterada pela última vez
tags: # Mapeamentos MITRE ATT&CK
- attack.initial_access
- attack.t1190
logsource: # Que formato de registo esperar
product: ai_agent
category: agent_events
detection: # A lógica de correspondência
selection_jailbreak_keywords:
event_type: user_input
message|contains:
- 'ignore previous instructions'
- 'developer mode'
condition: selection_jailbreak_keywords
falsepositives: # Gatilhos benignos conhecidos
- Legitimate AI safety research
level: critical # Severidade (critical/high/medium/low)
Aqui está o que cada secção faz: