
Reglas de detección Sigma para la monitorización de seguridad de agentes de IA
Este repositorio contiene reglas de detección que ayudan a identificar cuándo un agente de IA está siendo atacado o manipulado. Piense en ello como una biblioteca de "firmas de amenazas": cada regla describe un patrón que, al coincidir con los datos de registro de un agente, indica que puede estar ocurriendo algo sospechoso.
AgentShield es una capa de seguridad de código abierto para agentes de IA. Supervisa el comportamiento del agente en tiempo real y utiliza estas reglas Sigma para detectar ataques adversariales como inyección de instrucciones, robo de datos, envenenamiento de herramientas y escalada de privilegios, antes de que causen daños.
Sigma es un estándar abierto utilizado en toda la industria de ciberseguridad para escribir reglas de detección. Si las firmas antivirus le dicen a su computadora "este archivo es malicioso", las reglas Sigma le dicen a su plataforma de seguridad "este patrón de actividad en los registros es sospechoso".
Una regla Sigma es un archivo YAML corto que dice: "Si ves este patrón en los registros, genera una alerta." Por ejemplo, una regla simplificada podría verse así:
SI el evento de registro es user_input
Y el mensaje contiene "ignora las instrucciones anteriores"
ENTONCES genera una alerta crítica de inyección de instrucciones
Debido a que Sigma es un estándar independiente del proveedor, estas reglas funcionan con cualquier motor de detección compatible con Sigma, no solo con AgentShield. Esto significa que los equipos de seguridad pueden integrarlas en sus herramientas existentes sin dependencia de un proveedor.
Cuando alguien intenta anular las instrucciones de un agente, ya sea directamente (escribiendo "ignora las instrucciones anteriores") o indirectamente (ocultando instrucciones en documentos que el agente lee).
Cuando un agente es engañado para enviar datos sensibles a un atacante, mediante cargas HTTP, túneles DNS, imágenes ocultas en Markdown o técnicas esteganográficas.
Cuando se ocultan metadatos maliciosos en descripciones de herramientas MCP, o las herramientas cambian su comportamiento después de haber sido confiadas (ataques "rug pull").
Cuando un agente accede a archivos sensibles como claves SSH, tokens de API, credenciales en la nube o variables de entorno que contienen secretos.
Cuando un agente intenta obtener más acceso del previsto, mediante sudo, escapes de contenedores, manipulación de IAM en la nube o alteración de archivos del sistema.
Cuando un atacante intenta mantener acceso a largo plazo, mediante tareas cron, modificaciones de perfiles de shell, agentes de lanzamiento o envenenamiento de la memoria del agente.
Cuando un agente es engañado para descargar y ejecutar scripts maliciosos, establecer shells reversos o ejecutar comandos ofuscados.
Cuando un agente realiza escaneos de red o enumeración de DNS para mapear un entorno objetivo.
Cuando un agente modifica archivos de configuración de seguridad para debilitar las defensas: configuraciones de autoaprobación, configuraciones MCP o archivos de reglas del asistente de IA.
Cuando se instalan paquetes o skills desde fuentes no confiables: URLs directas, repositorios de GitHub o archivos tarball.
rules/
└── ai_agent/
├── ai_agent_prompt_injection_direct.yml
├── ai_agent_credential_access.yml
├── ai_agent_mcp_tool_poisoning.yml
└── ... (todas las reglas en un único directorio plano)
Las reglas están organizadas por producto (ai_agent) siguiendo las convenciones de SigmaHQ. La categoría de amenaza específica de cada regla se captura en los metadatos YAML de la regla (mediante etiquetas MITRE ATT&CK y los campos logsource), no en la estructura de directorios. Este diseño plano mantiene el repositorio simple y evita ambigüedades cuando una regla abarca múltiples categorías de ataque.
# Clonar el repositorio de reglas
git clone https://github.com/agentshield-ai/sigma-ai.git
# Usar con el motor AgentShield
export AGENTSHIELD_AUTH_TOKEN="reemplazar-con-al-menos-32-caracteres"
agentshield serve --rules ./sigma-ai/rules --port 8433
# Validar reglas
agentshield rules validate --path ./sigma-ai/rules
Estas reglas siguen el formato Sigma estándar y pueden usarse con cualquier herramienta compatible con Sigma:
# Validar con sigma-cli
sigma check rules/
# Convertir a otros formatos
sigma convert -t <destino> rules/ai_agent/
A continuación se muestra un ejemplo completamente anotado que muestra la anatomía de una regla Sigma. Cada campo se explica en lenguaje sencillo.
title: Intento directo de inyección de instrucciones # Nombre legible
id: eddcdc94-698c-577f-900d-28b1b5491a80 # Identificador único (UUID v5)
related: # Enlaces a reglas relacionadas
- id: agent-prompt-injection-direct-001 # ID anterior que esta reemplaza
type: obsoletes
status: stable # Nivel de madurez (ver más abajo)
description: | # Qué detecta esta regla
Detecta intentos directos de inyección de instrucciones en entradas de agentes de IA
que contienen frases comunes de jailbreak, comandos de anulación del sistema y
estructuras de manipulación de políticas. Estos patrones indican intentos de comprometer
el comportamiento del agente mediante instrucciones maliciosas.
references: # Lecturas adicionales
- https://owasp.org/www-project-top-10-for-large-language-model-applications/
author: AgentShield # Quién escribió esta regla
date: "2026-02-16" # Cuándo se escribió por primera vez
modified: "2026-02-24" # Cuándo se modificó por última vez
tags: # Mapeos MITRE ATT&CK
- attack.initial_access
- attack.t1190
logsource: # Qué formato de registro esperar
product: ai_agent
category: agent_events
detection: # La lógica de coincidencia
selection_jailbreak_keywords:
event_type: user_input
message|contains:
- 'ignore previous instructions'
- 'developer mode'
condition: selection_jailbreak_keywords
falsepositives: # Disparadores benignos conocidos
- Investigación legítima de seguridad en IA
level: critical # Gravedad (critical/high/medium/low)
Esto es lo que hace cada sección: