
Securekit — Updated!
Securekit è un kernel di sicurezza agnostico rispetto al protocollo che applica l'esecuzione in sandbox con zero-trust per l'uso di strumenti AI. Si colloca tra qualsiasi sistema LLM o agente e i suoi strumenti, validando, isolando e sottoponendo ad audit ogni azione per prevenire l'esecuzione non sicura su MCP, strumenti OpenAI e protocolli AI personalizzati. https://roxanneardary.com/securekit/
Securekit
Securekit protegge ciò che i tuoi modelli eseguono—in qualsiasi sistema di IA.
Securekit è un kernel di sicurezza agnostico rispetto al protocollo per l'esecuzione degli strumenti di IA.
Si colloca tra qualsiasi sistema LLM o agente e gli strumenti che utilizzano, applicando esecuzione zero-trust, isolamento in sandbox e controllo basato su policy.
È progettato per essere drop-in, modulare ed estensibile, funzionando con MCP, tool calling di OpenAI e framework per agenti personalizzati.
🧠 Perché esiste Securekit
I moderni sistemi di IA non si limitano più a generare testo: eseguono azioni:
- leggere e scrivere file
- chiamare API esterne
- eseguire codice
- attivare flussi di lavoro
- interagire con sistemi e reti
Questo introduce un rischio critico:
Ogni chiamata a uno strumento è una potenziale superficie d'attacco.
Securekit introduce un livello di sicurezza universale per l'esecuzione che impone il controllo prima che qualsiasi azione venga eseguita.
🧱 Panoramica dell'architettura
LLM / Agent System
↓
Protocol Adapter Layer
(MCP / OpenAI / Custom / Future Protocols)
↓
Securekit Core
- Policy Engine
- Capability System
- Prompt Firewall
- Risk Scoring Engine
- Intent Classifier
- Data-Flow Firewall
- Audit & Receipts
↓
Sandbox Orchestrator
(gVisor / Firecracker / Docker / WASM)
↓
Controlled Execution Layer
(Filesystem / Network / System Boundaries)
⚙️ Elenco completo delle funzionalità
🔌 Progettazione agnostica rispetto al protocollo
- Funziona con qualsiasi sistema di IA o framework per agenti
- Livello adattatore compatibile con MCP
- Supporto per il tool/function calling di OpenAI
- Interfaccia adattatore di protocollo personalizzata
- Livello di astrazione del protocollo a prova di futuro
🛡️ Motore di policy Zero-Trust
- Ogni chiamata a uno strumento viene validata prima dell'esecuzione
- Regole di policy dichiarative
- Ereditarietà delle policy a più livelli (globale, organizzazione, progetto, sessione)
- Modello di sicurezza a negazione predefinita (default-deny)
🧩 Sistema di capability
- Permessi con scadenza temporale (accesso basato su TTL)
- Capability degli strumenti con ambito definito
- Diritti di esecuzione revocabili
- Controllo granulare degli accessi agli strumenti
🧠 Firewall contro l'iniezione di prompt
- Rileva i tentativi di sovrascrittura delle istruzioni
- Neutralizza i comandi nascosti o dannosi negli output degli strumenti
- Protegge dalle catene di iniezione indiretta di prompt
- Igienizza i contenuti non attendibili generati dal modello
🌐 Firewall del flusso di dati
- Controlla come i dati si spostano tra gli strumenti
- Previene la concatenazione non sicura degli output
- Blocca i pattern di esfiltrazione tra strumenti
- Applica regole di instradamento dei dati basate sul rischio
🧪 Motore di simulazione dell'esecuzione
- Simula l'esecuzione dello strumento prima di eseguirlo
- Prevede le violazioni delle policy
- Previene azioni non sicure prima dell'esecuzione
- Modalità dry-run per operazioni ad alto rischio
📊 Sistema di fiducia e reputazione
- Punteggio di fiducia dinamico per strumento
- Analisi comportamentale nel tempo
- Degradazione automatica del rischio per strumenti sospetti
- Vincoli di esecuzione adattivi basati sulla fiducia
🧯 Kill Switch e modalità di contenimento
- Arresto immediato dell'esecuzione al rilevamento di anomalie
- Modalità di isolamento della sessione
- Revoca automatica dei privilegi
- Esecuzione di fallback in stato sicuro
🧾 Ricevute di esecuzione (sistema di audit)
- Log di esecuzione tracciabili crittograficamente
- Hashing di input/output
- Tracciamento delle decisioni di policy
- Metadati di esecuzione della sandbox
- Tracciabilità forense completa
🔐 Livello di esecuzione in sandbox
- Supporto sandbox gVisor (predefinito)
- Isolamento VM Firecracker (modalità ad alta sicurezza)
- Esecuzione in container Docker (modalità di compatibilità)
- Supporto runtime WASM (esecuzione leggera)
- Ambienti filesystem e di rete completamente isolati
🧭 Sistema di classificazione dell'intento
- Classifica l'intento di utilizzo dello strumento:
- recupero dati
- modifica del sistema
- comunicazione esterna
- comportamento sconosciuto
- Applicazione delle policy in base al tipo di intento
Modulo del sistema di classificazione dell'intento
Abilita una sicurezza intelligente basata sull'intento attraverso un'analisi multi-agente coordinata che valuta perché uno strumento viene invocato prima che venga eseguito. Invece di affidarsi esclusivamente ai nomi degli strumenti o alle azioni richieste, agenti specializzati collaborano per classificare l'intento di esecuzione, valutare il rischio e applicare policy di sicurezza in base al risultato previsto.
Funzionalità
- Classificazione dell'intento multi-agente
- Rilevamento del recupero dati
- Rilevamento della modifica del sistema
- Rilevamento della comunicazione esterna
- Rilevamento di comportamenti sconosciuti o ambigui
- Punteggio di confidenza dell'intento
- Analisi dell'intento sensibile al contesto
- Validazione del consenso tra agenti
- Applicazione delle policy in base all'intento classificato
- Verifica delle capability specifiche dell'intento
- Escalation automatica per intenti incerti
- Rilevamento di anomalie dell'intento
- Confronto storico degli intenti
- Registrazione di audit degli intenti
- Tassonomie di intento configurabili
- Plugin personalizzati per la classificazione degli intenti
- Supporto per intenti multi-etichetta
- Risoluzione dei conflitti di intento
- Hook di apprendimento adattivo per futuri classificatori
- Monitoraggio degli intenti in tempo reale
- Decisioni di classificazione spiegabili
- Integrazione con il motore di policy e i controlli della sandbox
Flusso di lavoro multi-agente
-
Agente di analisi delle richieste
- Analizza la richiesta di strumento in arrivo.
- Estrae i metadati contestuali e gli obiettivi di esecuzione.
-
Agente di classificazione dell'intento
- Determina l'intento di esecuzione più probabile.
- Assegna punteggi di confidenza a una o più categorie di intento.
-
Agente di validazione del contesto
- Esamina la cronologia della conversazione, lo stato del flusso di lavoro e le azioni precedenti.
- Rileva incoerenze o contesti sospetti.
-
Agente di valutazione del rischio
- Valuta le implicazioni di sicurezza dell'intento classificato.
- Identifica comportamenti ad alto rischio o inattesi.
-
Agente di applicazione delle policy
- Applica policy di sicurezza specifiche per l'intento.
- Valida permessi, capability e vincoli di esecuzione.
-
Agente di consenso
- Risolve i disaccordi tra gli agenti di classificazione e validazione.
- Produce una decisione finale verificata sull'intento.
-
Agente di audit
- Registra i risultati di classificazione, i livelli di confidenza, le decisioni di policy e gli esiti di esecuzione per l'analisi forense.
Categorie di intento supportate
- Recupero dati
- Modifica del sistema
- Comunicazione esterna
- Comportamento sconosciuto
- Intenti personalizzati definiti dall'amministratore
Vantaggi
- Previene l'esecuzione basata esclusivamente su presupposti generati dal modello
- Rileva pattern comportamentali dannosi o inattesi
- Migliora il processo decisionale zero-trust
- Riduce l'impatto degli attacchi di iniezione di prompt
- Consente un'applicazione granulare delle policy
- Fornisce decisioni di sicurezza spiegabili
- Migliora l'auditabilità e la conformità
- Supporta la sicurezza IA agnostica rispetto al protocollo in qualsiasi framework LLM o per agenti