
Securekit — Updated!
Securekit é um kernel de segurança agnóstico de protocolo que impõe execução com zero trust e em sandbox para o uso de ferramentas por IA. Ele se posiciona entre qualquer LLM ou sistema de agente e suas ferramentas, validando, isolando e auditando cada ação para evitar execução insegura em MCP, ferramentas OpenAI e protocolos de IA personalizados. https://roxanneardary.com/securekit/
Securekit
O Securekit protege o que seus modelos executam—em qualquer sistema de IA.
O Securekit é um kernel de segurança agnóstico de protocolo para execução de ferramentas de IA.
Ele se posiciona entre qualquer sistema de LLM ou agente e as ferramentas que eles utilizam, aplicando execução de confiança zero, isolamento em sandbox e controle baseado em políticas.
Ele foi projetado para ser plug-and-play, modular e extensível, funcionando com MCP, chamadas de ferramentas da OpenAI e frameworks de agentes personalizados.
🧠 Por que o Securekit existe
Os sistemas de IA modernos não estão mais apenas gerando texto—eles estão executando ações:
- lendo e escrevendo arquivos
- chamando APIs externas
- executando código
- acionando fluxos de trabalho
- interagindo com sistemas e redes
Isso introduz um risco crítico:
Cada chamada de ferramenta é uma superfície de ataque em potencial.
O Securekit introduz uma camada universal de segurança de execução que aplica controle antes que qualquer ação seja executada.
🧱 Visão Geral da Arquitetura
Sistema de LLM / Agente
↓
Camada de Adaptador de Protocolo
(MCP / OpenAI / Personalizado / Protocolos Futuros)
↓
Núcleo do Securekit
- Mecanismo de Políticas
- Sistema de Capacidades
- Firewall de Injeção de Prompts
- Mecanismo de Pontuação de Risco
- Classificador de Intenção
- Firewall de Fluxo de Dados
- Auditoria e Recibos
↓
Orquestrador de Sandbox
(gVisor / Firecracker / Docker / WASM)
↓
Camada de Execução Controlada
(Fronteiras de Sistema de Arquivos / Rede / Sistema)
⚙️ Lista Completa de Recursos
🔌 Design Agnóstico de Protocolo
- Funciona com qualquer sistema de IA ou framework de agentes
- Camada de adaptador compatível com MCP
- Suporte a chamadas de ferramentas/funções da OpenAI
- Interface de adaptador de protocolo personalizado
- Camada de abstração de protocolo à prova de futuro
🛡️ Mecanismo de Políticas de Confiança Zero
- Cada chamada de ferramenta é validada antes da execução
- Regras de política declarativas
- Herança de políticas em múltiplas camadas (global, organização, projeto, sessão)
- Modelo de segurança de negação por padrão
🧩 Sistema de Capacidades
- Permissões com limite de tempo (acesso baseado em TTL)
- Capacidades de ferramentas com escopo
- Direitos de execução revogáveis
- Controle de acesso granular a ferramentas
🧠 Firewall de Injeção de Prompts
- Detecta tentativas de sobrescrita de instruções
- Neutraliza comandos ocultos ou maliciosos em saídas de ferramentas
- Protege contra cadeias de injeção indireta de prompts
- Sanitiza conteúdo gerado por modelos não confiável
🌐 Firewall de Fluxo de Dados
- Controla como os dados se movem entre ferramentas
- Previne encadeamento inseguro de saídas
- Bloqueia padrões de exfiltração entre ferramentas
- Aplica regras de roteamento de dados baseadas em risco
🧪 Mecanismo de Simulação de Execução
- Simula a execução da ferramenta antes de executá-la
- Prevê violações de políticas
- Previne ações inseguras antes da execução
- Modo de execução simulada (dry-run) para operações de alto risco
📊 Sistema de Confiança e Reputação
- Pontuação de confiança dinâmica por ferramenta
- Análise comportamental ao longo do tempo
- Degradação automática de risco para ferramentas suspeitas
- Restrições de execução adaptativas baseadas em confiança
🧯 Interruptor de Emergência e Modo de Contenção
- Interrupção instantânea da execução na detecção de anomalias
- Modo de isolamento de sessão
- Revogação automática de privilégios
- Execução de fallback em estado seguro
🧾 Recibos de Execução (Sistema de Auditoria)
- Logs de execução rastreáveis criptograficamente
- Hash de entradas/saídas
- Rastreamento de decisões de políticas
- Metadados de execução em sandbox
- Rastreabilidade forense completa
🔐 Camada de Execução em Sandbox
- Suporte a sandbox gVisor (padrão)
- Isolamento em VM Firecracker (modo de alta segurança)
- Execução em contêiner Docker (modo de compatibilidade)
- Suporte a runtime WASM (execução leve)
- Ambientes de sistema de arquivos e rede totalmente isolados
🧭 Sistema de Classificação de Intenção
- Classifica a intenção de uso da ferramenta:
- recuperação de dados
- modificação do sistema
- comunicação externa
- comportamento desconhecido
- Aplicação de políticas com base no tipo de intenção
Módulo do Sistema de Classificação de Intenção
Habilite segurança inteligente e consciente de intenção por meio de análise multiagente coordenada que avalia por que uma ferramenta está sendo invocada antes de ser executada. Em vez de depender apenas de nomes de ferramentas ou ações solicitadas, agentes especializados colaboram para classificar a intenção de execução, avaliar o risco e aplicar políticas de segurança com base no resultado pretendido.
Recursos
- Classificação de intenção multiagente
- Detecção de recuperação de dados
- Detecção de modificação do sistema
- Detecção de comunicação externa
- Detecção de comportamento desconhecido ou ambíguo
- Pontuação de confiança da intenção
- Análise de intenção consciente do contexto
- Validação de consenso entre agentes
- Aplicação de políticas com base na intenção classificada
- Verificação de capacidades específicas da intenção
- Escalonamento automático para intenção incerta
- Detecção de anomalias de intenção
- Comparação histórica de intenções
- Registro de auditoria de intenções
- Taxonomias de intenção configuráveis
- Plugins personalizados de classificação de intenção
- Suporte a intenção multirrótulo
- Resolução de conflitos de intenção
- Ganchos de aprendizado adaptativo para classificadores futuros
- Monitoramento de intenção em tempo real
- Decisões de classificação explicáveis
- Integração com o mecanismo de políticas e controles de sandbox
Fluxo de Trabalho Multiagente
-
Agente de Análise de Solicitação
- Analisa a solicitação de ferramenta recebida.
- Extrai metadados contextuais e objetivos de execução.
-
Agente de Classificação de Intenção
- Determina a intenção de execução mais provável.
- Atribui pontuações de confiança a uma ou mais categorias de intenção.
-
Agente de Validação de Contexto
- Revisa o histórico da conversa, o estado do fluxo de trabalho e as ações anteriores.
- Detecta inconsistências ou contexto suspeito.
-
Agente de Avaliação de Risco
- Avalia as implicações de segurança da intenção classificada.
- Identifica comportamento de alto risco ou inesperado.
-
Agente de Aplicação de Políticas
- Aplica políticas de segurança específicas da intenção.
- Valida permissões, capacidades e restrições de execução.
-
Agente de Consenso
- Resolve divergências entre os agentes de classificação e validação.
- Produz uma decisão final de intenção verificada.
-
Agente de Auditoria
- Registra resultados de classificação, níveis de confiança, decisões de políticas e resultados de execução para análise forense.
Categorias de Intenção Suportadas
- Recuperação de Dados
- Modificação do Sistema
- Comunicação Externa
- Comportamento Desconhecido
- Intenções personalizadas definidas pelo administrador
Benefícios
- Previne execução baseada apenas em suposições geradas pelo modelo
- Detecta padrões comportamentais maliciosos ou inesperados
- Melhora a tomada de decisão de confiança zero
- Reduz o impacto de ataques de injeção de prompts
- Permite aplicação granular de políticas
- Fornece decisões de segurança explicáveis
- Melhora a auditabilidade e conformidade
- Suporta segurança de IA agnóstica de protocolo em qualquer framework de LLM ou agente