Volver a actualizaciones
ActualizadaJul 31, 2026

Securekit — Actualizado!

Securekit es un núcleo de seguridad independiente del protocolo que aplica la ejecución en entorno aislado (sandbox) y de confianza cero para el uso de herramientas por parte de la IA. Se sitúa entre cualquier LLM o sistema de agentes y sus herramientas, validando, aislando y auditando cada acción para prevenir la ejecución insegura en MCP, herramientas de OpenAI y protocolos de IA personalizados. https://roxanneardary.com/securekit/

Compartir

Securekit

Securekit protege lo que tus modelos ejecutan—en cualquier sistema de IA.

Securekit es un núcleo de seguridad agnóstico de protocolo para la ejecución de herramientas de IA.
Se sitúa entre cualquier sistema LLM o de agentes y las herramientas que utilizan, imponiendo ejecución de confianza cero, aislamiento en sandbox y control basado en políticas.

Está diseñado para ser directamente integrable, modular y extensible, funcionando con MCP, llamadas a herramientas de OpenAI y marcos de agentes personalizados.


🧠 Por qué existe Securekit

Los sistemas de IA modernos ya no solo generan texto—están ejecutando acciones:

  • leyendo y escribiendo archivos
  • llamando a APIs externas
  • ejecutando código
  • activando flujos de trabajo
  • interactuando con sistemas y redes

Esto introduce un riesgo crítico:

Cada llamada a una herramienta es una superficie de ataque potencial.

Securekit introduce una capa de seguridad de ejecución universal que impone control antes de que se ejecute cualquier acción.


🧱 Descripción general de la arquitectura

LLM / Agent System
        ↓
Protocol Adapter Layer
(MCP / OpenAI / Custom / Future Protocols)
        ↓
Securekit Core
- Policy Engine
- Capability System
- Prompt Firewall
- Risk Scoring Engine
- Intent Classifier
- Data-Flow Firewall
- Audit & Receipts
        ↓
Sandbox Orchestrator
(gVisor / Firecracker / Docker / WASM)
        ↓
Controlled Execution Layer
(Filesystem / Network / System Boundaries)

⚙️ Lista completa de funciones

🔌 Diseño agnóstico de protocolo

  • Funciona con cualquier sistema de IA o marco de agentes
  • Capa de adaptador compatible con MCP
  • Soporte para llamadas a herramientas/funciones de OpenAI
  • Interfaz de adaptador de protocolo personalizado
  • Capa de abstracción de protocolo preparada para el futuro

🛡️ Motor de políticas de confianza cero

  • Cada llamada a una herramienta se valida antes de su ejecución
  • Reglas de política declarativas
  • Herencia de políticas multicapa (global, organización, proyecto, sesión)
  • Modelo de seguridad de denegación por defecto

🧩 Sistema de capacidades

  • Permisos limitados en el tiempo (acceso basado en TTL)
  • Capacidades de herramientas con alcance definido
  • Derechos de ejecución revocables
  • Control de acceso fino a las herramientas

🧠 Cortafuegos de inyección de prompts

  • Detecta intentos de anulación de instrucciones
  • Neutraliza comandos ocultos o maliciosos en las salidas de las herramientas
  • Protege contra cadenas indirectas de inyección de prompts
  • Sanea contenido no confiable generado por el modelo

🌐 Cortafuegos de flujo de datos

  • Controla cómo se mueven los datos entre herramientas
  • Previene el encadenamiento inseguro de salidas
  • Bloquea patrones de exfiltración entre herramientas
  • Aplica reglas de enrutamiento de datos basadas en riesgo

🧪 Motor de simulación de ejecución

  • Simula la ejecución de la herramienta antes de ejecutarla
  • Predice violaciones de políticas
  • Evita acciones inseguras antes de la ejecución
  • Modo de prueba en seco para operaciones de alto riesgo

📊 Sistema de confianza y reputación

  • Puntuación de confianza dinámica por herramienta
  • Análisis de comportamiento a lo largo del tiempo
  • Degradación automática de riesgo para herramientas sospechosas
  • Restricciones de ejecución adaptativas basadas en confianza

🧯 Interruptor de emergencia y modo de contención

  • Detención instantánea de la ejecución ante la detección de anomalías
  • Modo de aislamiento de sesión
  • Revocación automática de privilegios
  • Ejecución de respaldo en estado seguro

🧾 Recibos de ejecución (sistema de auditoría)

  • Registros de ejecución trazables criptográficamente
  • Hash de entradas/salidas
  • Seguimiento de decisiones de políticas
  • Metadatos de ejecución en sandbox
  • Trazabilidad forense completa

🔐 Capa de ejecución en sandbox

  • Soporte de sandbox gVisor (predeterminado)
  • Aislamiento de VM Firecracker (modo de alta seguridad)
  • Ejecución en contenedores Docker (modo de compatibilidad)
  • Soporte de runtime WASM (ejecución ligera)
  • Entornos de sistema de archivos y red totalmente aislados

🧭 Sistema de clasificación de intenciones

  • Clasifica la intención de uso de la herramienta:
    • recuperación de datos
    • modificación del sistema
    • comunicación externa
    • comportamiento desconocido
  • Aplicación de políticas según el tipo de intención

Módulo del sistema de clasificación de intenciones

Habilita seguridad inteligente basada en intenciones mediante análisis multiagente coordinado que evalúa por qué se invoca una herramienta antes de que se ejecute. En lugar de depender únicamente de los nombres de las herramientas o de las acciones solicitadas, agentes especializados colaboran para clasificar la intención de ejecución, evaluar el riesgo y aplicar políticas de seguridad según el resultado previsto.

Funciones

  • Clasificación de intenciones multiagente
  • Detección de recuperación de datos
  • Detección de modificación del sistema
  • Detección de comunicación externa
  • Detección de comportamiento desconocido o ambiguo
  • Puntuación de confianza de la intención
  • Análisis de intenciones consciente del contexto
  • Validación de consenso entre agentes
  • Aplicación de políticas según la intención clasificada
  • Verificación de capacidades específicas de la intención
  • Escalamiento automático para intenciones inciertas
  • Detección de anomalías de intención
  • Comparación histórica de intenciones
  • Registro de auditoría de intenciones
  • Taxonomías de intenciones configurables
  • Plugins personalizados de clasificación de intenciones
  • Soporte de intenciones multietiqueta
  • Resolución de conflictos de intenciones
  • Ganchos de aprendizaje adaptativo para futuros clasificadores
  • Monitorización de intenciones en tiempo real
  • Decisiones de clasificación explicables
  • Integración con el motor de políticas y los controles de sandbox

Flujo de trabajo multiagente

  1. Agente de análisis de solicitudes

    • Analiza la solicitud entrante de la herramienta.
    • Extrae metadatos contextuales y objetivos de ejecución.
  2. Agente de clasificación de intenciones

    • Determina la intención de ejecución más probable.
    • Asigna puntuaciones de confianza a una o más categorías de intención.
  3. Agente de validación de contexto

    • Revisa el historial de conversación, el estado del flujo de trabajo y las acciones anteriores.
    • Detecta inconsistencias o contextos sospechosos.
  4. Agente de evaluación de riesgos

    • Evalúa las implicaciones de seguridad de la intención clasificada.
    • Identifica comportamientos de alto riesgo o inesperados.
  5. Agente de aplicación de políticas

    • Aplica políticas de seguridad específicas de la intención.
    • Valida permisos, capacidades y restricciones de ejecución.
  6. Agente de consenso

    • Resuelve discrepancias entre los agentes de clasificación y validación.
    • Produce una decisión final verificada de intención.
  7. Agente de auditoría

    • Registra resultados de clasificación, niveles de confianza, decisiones de políticas y resultados de ejecución para el análisis forense.

Categorías de intención admitidas

  • Recuperación de datos
  • Modificación del sistema
  • Comunicación externa
  • Comportamiento desconocido
  • Intenciones personalizadas definidas por el administrador

Beneficios

  • Evita la ejecución basada únicamente en suposiciones generadas por el modelo
  • Detecta patrones de comportamiento maliciosos o inesperados
  • Mejora la toma de decisiones de confianza cero
  • Reduce el impacto de los ataques de inyección de prompts
  • Permite una aplicación granular de políticas
  • Proporciona decisiones de seguridad explicables
  • Mejora la auditabilidad y el cumplimiento normativo
  • Admite seguridad de IA agnóstica de protocolo en cualquier LLM o marco de agentes

Categorías