Awesome AI Security

Una lista curata di fantastiche risorse relative alla sicurezza dell'AI: framework, standard, materiali di apprendimento e strumenti open source.
Se vuoi contribuire, crea una PR o contattami @ottosulin.
Indice dei contenuti
Risorse di apprendimento
Letture e guide
Corsi, laboratori e CTF
- Damn Vulnerable MCP Server - Un'implementazione deliberatamente vulnerabile del Model Context Protocol (MCP) a scopo didattico.
- otto-support - Un'implementazione vulnerabile di un server MCP che utilizza mcp-go con autenticazione a livelli (4 ruoli), 19 strumenti e un container sandbox integrato con Claude Code per esercitarsi nell'escalation dei privilegi e nell'uso improprio degli strumenti.
- OWASP WrongSecrets LLM exercise
- vulnerable-mcp-servers-lab - Una raccolta di server deliberatamente vulnerabili per imparare il pentesting dei server MCP.
- FinBot Agentic AI Capture The Flag (CTF) Application - FinBot è una piattaforma interattiva CTF (Capture The Flag) per la sicurezza agentica che simula vulnerabilità reali nei sistemi AI agentici utilizzando un'applicazione simulata focalizzata sui servizi finanziari.
- AI-Red-Teaming-Playground-Labs - Laboratori didattici per il red teaming dell'AI, inclusa l'infrastruttura per condurre sessioni di formazione.
- Damn Vulnerable LLM Agent - Agente LLM intenzionalmente vulnerabile per imparare l'iniezione di prompt, l'uso improprio degli strumenti e la sicurezza degli agenti.
-
- LLMVault - Un laboratorio di sicurezza LLM open source in stile CTF per apprendere l'OWASP LLM Top 10 attraverso esercizi pratici vulnerabili che coprono iniezione di prompt, attacchi RAG, perdita del system prompt, uso improprio degli strumenti e sicurezza degli agenti.
Podcast
Governance e gestione del rischio
Framework
Standard e verifica
Tassonomie, terminologia e database dei rischi
Checklist e guide pratiche
Tecniche di attacco e red teaming
ML avversariale e modelli classici
- Adversarial Robustness Toolkit - ART si concentra sulle minacce di Evasione (modifica del comportamento del modello con modifiche all'input), Avvelenamento (controllo del modello con modifiche ai dati di addestramento), Estrazione (sottrazione del modello tramite query) e Inferenza (attacco alla privacy dei dati di addestramento)
- cleverhans - Una libreria di esempi avversariali per costruire attacchi, creare difese e confrontare entrambi
- foolbox - Un toolkit Python per creare esempi avversariali che ingannano le reti neurali in PyTorch, TensorFlow e JAX
- TextAttack - Un framework Python per attacchi avversariali, data augmentation e addestramento di modelli in NLP
- Counterfit - Livello di automazione generico per valutare la sicurezza dei sistemi di machine learning
- OffsecML Playbook - Una raccolta di TTP offensivi e avversariali con proof of concept
- BadDiffusion - Repo ufficiale per riprodurre l'articolo "How to Backdoor Diffusion Models?" pubblicato a CVPR 2023
- secml-torch - SecML-Torch: una libreria per la valutazione della robustezza dei modelli di deep learning
Red teaming per LLM e GenAI
- garak - Strumento di probing della sicurezza per LLM
- ai-scanner - Applicazione web open source per la valutazione della sicurezza dei modelli AI, basata su NVIDIA garak. Include 179 probe, scansione multi-target, scansioni programmate, punteggio ASR e integrazione SIEM.
- promptfoo - Testa i tuoi prompt, agenti e RAG. Red teaming, penetration testing e scansione delle vulnerabilità per LLM. Confronta le prestazioni di GPT, Claude, Gemini, Llama e altri. Configurazioni dichiarative semplici con integrazione da riga di comando e CI/CD.
- PyRIT - Il Python Risk Identification Tool per l'AI generativa (PyRIT) è un framework open source creato per consentire a professionisti della sicurezza e ingegneri di identificare proattivamente i rischi nei sistemi di AI generativa.
- PurpleLlama - Set di strumenti per valutare e migliorare la sicurezza degli LLM.
- augustus - Framework di test della sicurezza per LLM per rilevare iniezioni di prompt, jailbreak e attacchi avversariali. 190+ probe, 28 provider, singolo binario Go. Pronto per la produzione con scansione concorrente, limitazione della velocità e logica di retry.
- FuzzyAI - Un potente strumento per il fuzzing automatico degli LLM. Progettato per aiutare sviluppatori e ricercatori di sicurezza a identificare e mitigare potenziali jailbreak nelle loro API LLM.
- EasyJailbreak - Un framework Python facile da usare per generare prompt di jailbreak avversariali.
- gptfuzz - Repo ufficiale per GPTFUZZER: Red Teaming di grandi modelli linguistici con prompt di jailbreak generati automaticamente
- llamator - Framework per testare le vulnerabilità dei grandi modelli linguistici (LLM).
- agentic_security - Scanner di vulnerabilità LLM agentico / kit per il red teaming dell'AI
AI agentica e strumenti di attacco MCP
- RAMPART - Framework di test per la sicurezza e la protezione nativo di pytest per applicazioni AI agentiche.
- AI-Infra-Guard - Una piattaforma completa, intelligente e facile da usare per il red teaming dell'AI sviluppata dal Tencent Zhuque Lab. Integra moduli per Infra Scan, MCP Scan e Jailbreak Evaluation, fornendo un'interfaccia web con un clic, API REST e distribuzione basata su Docker per una valutazione completa della sicurezza dell'AI.
- OpenPromptInjection - Un benchmark per attacchi e difese di iniezione di prompt
- AIMap - Piattaforma di scoperta e test di sicurezza su scala Internet per infrastrutture di agenti AI esposte. Interroga Shodan per server MCP, istanze Ollama, proxy vLLM/LiteLLM e altro, quindi identifica, valuta il rischio e lancia suite di attacco specifiche per protocollo con risultati in streaming in tempo reale.### Sicurezza Offensiva Assistita dall'IA
- PentestGPT - Uno strumento di penetration testing potenziato da GPT
- HackingBuddyGPT - Aiutare gli ethical hacker a usare LLM in 50 righe di codice o meno
- cai - Cybersecurity AI (CAI), un'Intelligenza Artificiale open source pronta per Bug Bounty (paper)
- shannon - Pentester AI completamente autonomo per app web e API di Keygraph. Test di sicurezza white-box che analizza il codice sorgente, identifica vettori d'attacco ed esegue exploit reali. Tasso di successo del 96.15% (100/104 exploit) sul benchmark XBOW.
- strix - Strix sono agenti AI autonomi che agiscono esattamente come veri hacker: eseguono il tuo codice dinamicamente, trovano vulnerabilità e le convalidano tramite proof-of-concept reali
- redamon - Framework red team basato su agenti potenziato dall'IA che automatizza le operazioni di sicurezza offensiva, dalla ricognizione allo sfruttamento alla post-esplorazione, senza intervento umano.
Steganografia e Canali Nascosti
- ST3GG - Suite di steganografia tutto-in-uno con codifica multi-livello, steganografia di immagini e audio, e strumenti di steganalisi per rilevare dati nascosti in media generati dall'IA.
Benchmark e Valutazioni
- ISC-Bench - Internal Safety Collapse: jailbreak qualsiasi LLM all'avanguardia (Claude Opus 4.6, GPT-5.4) in pass@3 tramite completamento normale di attività — nessun prompt avversario. Black-box, cross-dominio, cross-scienza. Nuova modalità di fallimento. [Paper]
- jailbreakbench - JailbreakBench: Un Benchmark Aperto di Robustezza per il Jailbreak di Modelli Linguistici [NeurIPS 2024 Datasets and Benchmarks Track]
- AgentDojo - Un Ambiente Dinamico per Valutare Attacchi e Difese per Agenti LLM.
- AIRTBench - Repository del codice per: AIRTBench: Misurare le capacità autonome di Red Teaming AI nei modelli linguistici
- HackingBuddyGPT benchmark dataset - Dataset di benchmark per il pentesting automatizzato
- AgentDoG - AgentDoG è un framework di valutazione e protezione sensibile al rischio per agenti autonomi. Si concentra sulla valutazione del rischio a livello di traiettoria, con l'obiettivo di determinare se la traiettoria di esecuzione di un agente contiene rischi per la sicurezza in diversi scenari applicativi.
- AICGSecEval - Benchmark di valutazione completo di Tencent per la sicurezza della generazione di codice AI, che copre 10 categorie CWE con test automatizzati
- Inspect - Framework per valutazioni di modelli linguistici di grandi dimensioni dell'UK AI Security Institute. Oltre 200 valutazioni predefinite che coprono ingegneria dei prompt, uso di strumenti, dialoghi multi-turno e punteggio graduato dal modello.
- sec-code-bench - Benchmark di Alibaba per valutare le capacità di sicurezza del codice degli LLM in 17 categorie di vulnerabilità e 4 linguaggi di programmazione
Controlli di Difesa e Sicurezza
- NeMo-Guardrails - NeMo Guardrails è un toolkit open-source per aggiungere facilmente guardrail programmabili a sistemi conversazionali basati su LLM.
- LlamaFirewall - LlamaFirewall è un framework progettato per rilevare e mitigare i rischi di sicurezza incentrati sull'IA, supportando molteplici livelli di input e output, come la tipica chat LLM e operazioni agentiche multistep più avanzate.
- llm-guard - LLM Guard di Protect AI è uno strumento completo progettato per rafforzare la sicurezza dei Large Language Models (LLM).
- Guardrails.ai - Guardrails è un pacchetto Python che consente all'utente di aggiungere garanzie di struttura, tipo e qualità agli output dei modelli linguistici di grandi dimensioni (LLM)
- TrustGate - Generative Application Firewall (GAF) per rilevare, prevenire e bloccare attacchi contro applicazioni GenAI
- ZenGuard AI - Il livello di fiducia più veloce per agenti AI
- LocalMod - API di moderazione dei contenuti auto-ospitata con rilevamento di prompt injection, filtraggio della tossicità, rilevamento PII e classificazione NSFW. Funziona completamente offline.
- DynaGuard - Un modello di guardrail dinamico con policy definite dall'utente
- AprielGuard - Modello di salvaguardia sicurezza–protezione da 8 miliardi di parametri
- Safe Zone - Safe Zone è un motore open-source di rilevamento PII e guardrail che impedisce la fuga di dati sensibili verso LLM e API di terze parti.
- superagent - Superagent fornisce guardrail addestrati per uno scopo specifico che rendono gli agenti AI sicuri e conformi.
- ShellWard -
Sicurezza del Runtime degli Agenti e Sandboxing
- OpenShell - OpenShell è il runtime sicuro e privato per agenti AI autonomi. Fornisce ambienti di esecuzione sandboxati governati da policy YAML dichiarative che impediscono l'accesso non autorizzato ai file, l'esfiltrazione di dati e l'attività di rete incontrollata.
- OpenSandbox - Runtime sandbox sicuro, veloce ed estensibile per agenti AI. SDK multi-linguaggio, runtime Docker/Kubernetes, isolamento gVisor/Kata Containers/Firecracker. Progetto CNCF Landscape.
- CubeSandbox - Sandbox istantanea, concorrente, sicura e leggera per agenti AI di Tencent Cloud. Avvio a freddo inferiore a 60ms, overhead di memoria <5 MB, compatibile con SDK E2B. Costruita su RustVMM e KVM con isolamento estremo (kernel dedicato + eBPF).
- Aegis - EDR open-source per agenti AI di Antropos. Monitora in tempo reale processi, file, rete e comportamento di agenti AI autonomi. Nessuna telemetria, nessun cloud, tutto rimane locale.
- Microsoft Agent Governance Toolkit - AI Agent Governance Toolkit di Microsoft — Applicazione delle policy, identità zero-trust, sandboxing dell'esecuzione e ingegneria dell'affidabilità per agenti AI autonomi. Copre 10/10 OWASP Agentic Top 10.
- agentfield - Piano di controllo open-source per sistemi di agenti con identità crittografica, applicazione delle policy e osservabilità adatta al controllo.
- leash - Leash avvolge gli agenti di codifica AI in contenitori e monitora la loro attività.
- vibekit - Esegui Claude Code, Gemini, Codex — o qualsiasi agente di codifica — in una sandbox pulita e isolata con oscuramento dei dati sensibili e osservabilità integrata.
- pipelock - Fornitura di sicurezza per agenti AI — proxy di uscita con scansione DLP, protezione SSRF, scansione delle risposte MCP e monitoraggio dell'integrità dell'area di lavoro
- skill-scanner - Uno scanner di sicurezza per le Skill degli Agenti AI che rileva prompt injection, esfiltrazione di dati e pattern di codice dannoso. Combina rilevamento basato su pattern (YAML + YARA), LLM-as-a-judge e analisi del flusso di dati comportamentale per un rilevamento completo delle minacce.
Sicurezza MCP
- MCP-Security-Checklist - Una checklist di sicurezza completa per strumenti AI basati su MCP. Realizzata da SlowMist per salvaguardare gli ecosistemi di plugin LLM.
- Awesome-MCP-Security - Tutto ciò che devi sapere sulla sicurezza del Model Context Protocol (MCP).
- secure-mcp-gateway - Questo Secure MCP Gateway è costruito con autenticazione, scoperta automatica degli strumenti, caching e applicazione dei guardrail.
- mcp-context-protector - context-protector è un wrapper di sicurezza per server MCP che affronta i rischi associati all'esecuzione di server MCP non fidati, inclusi line jumping, modifiche impreviste alla configurazione del server e altri attacchi di prompt injection
- mcp-guardian - MCP Guardian gestisce l'accesso del tuo assistente LLM ai server MCP, dandoti il controllo in tempo reale dell'attività del tuo LLM.
- MCP Audit VSCode Extension - Controlla e registra centralmente tutte le chiamate agli strumenti MCP di GitHub Copilot in VSCode con facilità.
- MCP-Scan - Uno strumento di scansione della sicurezza per server MCP
- ATR (Agent Threat Rules) - Regole di rilevamento open-source per minacce agli agenti AI. 108 regole regex che coprono prompt injection, avvelenamento degli strumenti, esfiltrazione di credenziali in 9 categorie. Utilizzate da Cisco AI Defense. Licenza MIT.
- MCPProxy - Proxy MCP local-first con quarantena SHA-256 per strumento per rilevare avvelenamento degli strumenti e attacchi rug-pull, scansione automatica di dati sensibili e segreti delle chiamate agli strumenti, isolamento sandbox Docker per server MCP non fidati e OAuth 2.1. Licenza MIT.
Scansione di Modelli e Artefatti
- modelscan - ModelScan è un progetto open source di Protect AI che scansiona i modelli per determinare se contengono codice non sicuro.
- picklescan - Scanner di sicurezza che rileva file Python Pickle che eseguono azioni sospette
- fickling - Un decompilatore e analizzatore statico di pickling Python
- medusa - Scanner di sicurezza AI-first con oltre 74 analizzatori, oltre 180 regole di sicurezza per agenti AI, riduzione intelligente dei falsi positivi. Supporta tutti i linguaggi. Rilevamento CVE per React2Shell, mcp-remote RCE.
- julius - Strumento di fingerprinting dei servizi LLM per professionisti della sicurezza. Rileva oltre 32 servizi AI (Ollama, vLLM, LiteLLM, Hugging Face TGI, ecc.) durante i penetration test e la scoperta della superficie d'attacco. Utilizza il fingerprinting dei servizi basato su HTTP per identificare l'infrastruttura del server.
- a2a-scanner - Scansiona gli agenti A2A per potenziali minacce e problemi di sicurezza### Sicurezza Difensiva Assistita dall'IA
- Claude Code Security Review - Un'azione GitHub per revisioni di sicurezza alimentata dall'IA che utilizza Claude per analizzare le modifiche al codice alla ricerca di vulnerabilità.
- deepsec - Scanner di vulnerabilità basato su agenti di Vercel Labs per individuare problemi difficili da individuare in grandi basi di codice utilizzando agenti di codifica. Supporta scansione parallela, revisione delle differenze delle PR e integrazione CI/CD.
- defending-code-reference-harness - Implementazione di riferimento per la scoperta e la correzione autonoma delle vulnerabilità utilizzando Claude. Include competenze di threat modeling, scansione, triage e patching.
- Visa Vulnerability Agentic Harness - Pipeline SAST agentica con 11 fasi dalla rilevazione alla correzione tramite LLM e validazione avversaria. Produce output SARIF, si integra con Claude Code, Copilot e Gemini.
Privacy e Calcolo Confidenziale
- Python Differential Privacy Library
- Diffprivlib - La libreria di privacy differenziale di IBM
- TenSEAL - Una libreria per eseguire operazioni di crittografia omomorfica su tensori
- SyMPC - Una libreria di calcolo multipartito sicuro compagna per Syft
- Cloaked AI - Crittografia open-source che preserva le proprietà per embedding vettoriali
- dstack - Framework AI confidenziale open-source per il deployment sicuro di ML/LLM con isolamento imposto dall'hardware e privacy dei dati
- PrivacyRaven - libreria di test della privacy per sistemi di deep learning
- PLOT4ai - Libreria di minacce per la privacy nell'intelligenza artificiale — Una libreria di threat modeling per aiutarti a costruire un'IA responsabile
- OpenDP - Libreria principale per algoritmi di privacy differenziale del progetto OpenDP — utilizzata per costruire pipeline di addestramento ML che preservano la privacy
Sicurezza dei Dati e della Supply Chain
- datasig - Impronta digitale dei dataset per AIBOM
- OWASP AIBOM - Distinta base dell'IA (AI Bill of Materials)
- Trusera ai-bom - Distinta base dell'IA (AI Bill of Materials) — scopri ogni agente, modello e API di IA nella tua infrastruttura
Competenze di Sicurezza Agentica per l'IA
- Elastic Agent Skills - Raccolta di competenze per l'assistente IA di Elastic, che consente indagini di sicurezza in linguaggio naturale su log, trace e threat intelligence
- Ghost Security Skills - Competenze e strumenti di sicurezza delle applicazioni (appsec) per agenti per Claude Code
- tm_skills - Competenze per agenti per aiutare con il Continuous Threat Modeling
- Trail of Bits Skills Marketplace - Competenze di Trail of Bits per Claude Code per ricerca sulla sicurezza, rilevamento di vulnerabilità e flussi di lavoro di audit
- Semgrep Skills - Competenze ufficiali di Semgrep per Claude Code e altri assistenti di codifica IA. Fornisce capacità di scansione di sicurezza, analisi del codice e rilevamento di vulnerabilità direttamente nel tuo flusso di lavoro di sviluppo assistito dall'IA.
- claude-bug-bounty - Competenza per Claude Code per la caccia ai bug assistita dall'IA. Automatizza ricognizione, test IDOR, XSS, SSRF, OAuth, GraphQL e injection LLM con checklist di validazione a 4 fasi e generazione di report.
- Anthropic Cybersecurity Skills - Oltre 734 competenze strutturate di cybersecurity per agenti IA. Mappate su MITRE ATT&CK, standard agentskills.io. Compatibile con Claude Code, Copilot, Codex CLI, Cursor e Gemini CLI.
- llm-sast-scanner - Competenza SAST per agenti di codifica IA (Claude Code, Codex, ecc.) con rilevamento strutturato delle vulnerabilità su 34 classi. Caratterizza analisi taint source-to-sink, verifica Judge per la riduzione dei falsi positivi e precision/recall superiori al 99% sui benchmark.
- sast-skills - Raccolta di competenze per agenti che trasformano il tuo codificatore IA in uno scanner SAST
- pentest-ai-agents - 31 subagenti per Claude Code per la sicurezza offensiva. Subagenti IA specializzati per ricognizione, web, Active Directory, cloud, mobile, wireless, ingegneria sociale, creazione di payload, reverse engineering, concatenamento di exploit, ingegneria del rilevamento, forensics e generazione di report. Gli agenti di livello 2 possono eseguire direttamente gli strumenti con gate di approvazione.
Modelli IA Focalizzati sulla Sicurezza
- VulnLLM-R-7B - LLM di ragionamento specializzato per il rilevamento delle vulnerabilità. Utilizza il ragionamento Chain-of-Thought per analizzare il flusso dei dati, il flusso di controllo e il contesto di sicurezza. Supera Claude-3.7-Sonnet e CodeQL nei benchmark di rilevamento delle vulnerabilità. Solo 7 miliardi di parametri, rendendolo efficiente e veloce.
- Foundation-Sec-8B-Reasoning - Llama-3.1-FoundationAI-SecurityLLM-8B-Reasoning è un modello linguistico open-weight da 8 miliardi di parametri ottimizzato per le istruzioni, specializzato in applicazioni di cybersecurity. Estende il modello base Foundation-Sec-8B con capacità di seguire istruzioni e ragionamento.
- Antares (1B & 350M) - Modelli agentici per la localizzazione delle vulnerabilità di fdtn-ai. Disponibili in varianti da 2B e 0.4B parametri, progettati per identificare e localizzare autonomamente le vulnerabilità nel codice.
- CyberSecQwen-4B - _Specialista CTI da 4B parametri ottimizzato da Qwen3-4B-Instruct-2507 per threat intelligence sulla cybersecurity.
- Meta-SecAlign-8B / Meta-SecAlign-70B - Modelli Llama allineati alla sicurezza ottimizzati per resistere agli attacchi di prompt injection, mantenendo la gerarchia delle istruzioni anche sotto input avversari
- Lily-Cybersecurity-7B - Modello chat da 7B ottimizzato per la cybersecurity, ottimizzato per analisi di sicurezza, spiegazione delle vulnerabilità e attività di threat intelligence.
Classificatori di Sicurezza e Rilevamento di Prompt Injection
- Llama-Guard-4-12B - L'ultimo classificatore di sicurezza multimodale di Meta per rilevare contenuti dannosi negli input e output degli LLM in modalità testo e immagine.
- Llama-Prompt-Guard-2-86M - Modello leggero da 86M parametri di Meta per rilevare tentativi di prompt injection e jailbreak nelle pipeline LLM di produzione.
- ShieldGemma-2B - Classificatore di sicurezza testuale da 2B parametri di Google per rilevare contenuti dannosi, basato sull'architettura Gemma.
- DeBERTa Prompt Injection Detector v2 - DeBERTa-v3-base di Protect AI ottimizzato per il rilevamento di prompt injection, ampiamente utilizzato nelle pipeline di guardrail LLM in produzione.
- Prompt Injection Sentinel - Modello ModernBERT-large ottimizzato per la classificazione di prompt injection e jailbreak con basso tasso di falsi positivi.
- Nemotron 3.5 Content Safety - Modello di sicurezza dei contenuti multimodale da 4B parametri di NVIDIA che unifica guardrail per input testo+immagine, supporto multilingua (oltre 35 lingue), applicazione di policy aziendali personalizzabili e ragionamento verificabile in una singola chiamata di inferenza. Successore di Nemotron 3 Content Safety.
- BrowseSafe - Modello di sicurezza specializzato per rilevare attacchi di prompt injection negli agenti browser IA. Raggiunge un punteggio F1 del 90,4% su BrowseSafe-Bench, ottimizzato per la classificazione asincrona in tempo reale di contenuti HTML grezzi.
Modelli Linguistici di Sicurezza Adattati al Dominio
- ATTACK-BERT - Modello sentence-transformer per mappare il testo di sicurezza alle tecniche MITRE ATT&CK.
- CySecBERT - Modello BERT adattato per attività di cybersecurity e CTI tramite pre-training specifico del dominio.
Dataset
- SafetyPrompts - Raccolta curata di prompt rilevanti per la sicurezza per valutare le proprietà di safety e security degli LLM.
- Do-Not-Answer - Dataset di prompt a cui gli LLM responsabili non dovrebbero rispondere, per valutazione della sicurezza e red teaming.
- JailBreakV-28K - Dataset su larga scala di 28.000 prompt di jailbreak per il benchmarking della sicurezza degli LLM.
- CL4R1T4S - Prompt di sistema trapelati da ChatGPT, Claude, Gemini, Grok, Perplexity, Cursor, Lovable, Replit e altri strumenti IA importanti. La più grande collezione conosciuta di prompt di sistema di produzione per trasparenza e ricerca sulla superficie d'attacco.
- LEAKHUB - Classifica delle fughe di prompt di sistema — piattaforma comunitaria per tracciare e classificare le fughe di prompt di sistema tra i prodotti IA.
- Leaked System Prompts - Raccolta di prompt di sistema trapelati da strumenti IA commerciali — utile per comprendere l'ingegneria dei prompt nel mondo reale e le superfici d'attacco.