Awesome AI Security

Uma lista com curadoria de frameworks, padrões, recursos de aprendizado e ferramentas de código aberto relacionados à segurança de IA.
Se quiser contribuir, crie um PR ou entre em contato comigo @ottosulin.
Índice
Recursos de Aprendizado
Leitura e Guias
Cursos, Laboratórios e CTFs
- Damn Vulnerable MCP Server - Uma implementação deliberadamente vulnerável do Model Context Protocol (MCP) para fins educacionais.
- otto-support - Uma implementação de servidor MCP vulnerável usando mcp-go com autenticação em camadas (4 papéis), 19 ferramentas e contêiner sandbox integrado com Claude Code para praticar escalonamento de privilégios e uso indevido de ferramentas.
- OWASP WrongSecrets LLM exercise
- vulnerable-mcp-servers-lab - Uma coleção de servidores deliberadamente vulneráveis para aprender a fazer pentest em servidores MCP.
- FinBot Agentic AI Capture The Flag (CTF) Application - O FinBot é uma plataforma interativa de Capture The Flag (CTF) de Segurança Agentica que simula vulnerabilidades do mundo real em sistemas de IA agenticos usando um aplicativo simulado focado em serviços financeiros.
- AI-Red-Teaming-Playground-Labs - Laboratórios de playground de Red Teaming de IA para executar treinamentos de Red Teaming de IA, incluindo infraestrutura.
- Damn Vulnerable LLM Agent - Agente LLM intencionalmente vulnerável para aprender sobre injeção de prompt, uso indevido de ferramentas e segurança de agentes
-
- LLMVault - Um laboratório de segurança de LLM estilo CTF de código aberto para aprender o OWASP LLM Top 10 por meio de exercícios vulneráveis práticos que cobrem injeção de prompt, ataques de RAG, vazamento de prompt do sistema, uso indevido de ferramentas e segurança de agentes.
Podcasts
Governança e Gestão de Riscos
Frameworks
Padrões e Verificação
Taxonomias, Terminologia e Bancos de Dados de Riscos
Checklists e Orientações Práticas
Técnicas de Ataque e Red Teaming
ML Adversarial e Modelos Clássicos
- Adversarial Robustness Toolkit - A ART foca nas ameaças de Evasão (alterar o comportamento do modelo com modificações na entrada), Envenenamento (controlar um modelo com modificações nos dados de treinamento), Extração (roubar um modelo por meio de consultas) e Inferência (atacar a privacidade dos dados de treinamento)
- cleverhans - Uma biblioteca de exemplos adversariais para construir ataques, desenvolver defesas e fazer benchmark de ambos
- foolbox - Um toolbox em Python para criar exemplos adversariais que enganam redes neurais em PyTorch, TensorFlow e JAX
- TextAttack - Um framework em Python para ataques adversariais, aumento de dados e treinamento de modelo em PLN
- Counterfit - camada de automação genérica para avaliar a segurança de sistemas de aprendizado de máquina
- OffsecML Playbook - Uma coleção de TTPs ofensivos e adversariais com provas de conceito
- BadDiffusion - Repositório oficial para reproduzir o artigo "How to Backdoor Diffusion Models?" publicado no CVPR 2023
- secml-torch - SecML-Torch: uma biblioteca para avaliação da robustez de modelos de aprendizado profundo
Red Teaming de LLM e GenAI
- garak - ferramenta de sondagem de segurança para LLMs
- ai-scanner - Aplicação web de código aberto para avaliações de segurança de modelos de IA, construída sobre o NVIDIA garak. Possui 179 sondas, varredura de múltiplos alvos, varreduras agendadas, pontuação ASR e integração com SIEM.
- promptfoo - Teste seus prompts, agentes e RAGs. Red teaming, pentest e varredura de vulnerabilidades para LLMs. Compare o desempenho de GPT, Claude, Gemini, Llama e outros. Configurações declarativas simples com integração de linha de comando e CI/CD.
- PyRIT - O Python Risk Identification Tool para IA generativa (PyRIT) é um framework de código aberto criado para capacitar profissionais de segurança e engenheiros a identificar proativamente riscos em sistemas de IA generativa.
- PurpleLlama - Conjunto de ferramentas para avaliar e melhorar a segurança de LLMs.
- augustus - Framework de teste de segurança de LLM para detecção de injeção de prompt, jailbreaks e ataques adversariais. Mais de 190 sondas, 28 provedores, um único binário Go. Pronto para produção, com varredura concorrente, limitação de taxa e lógica de repetição.
- FuzzyAI - Uma ferramenta poderosa para fuzzing automatizado de LLMs. Projetada para ajudar desenvolvedores e pesquisadores de segurança a identificar e mitigar jailbreaks potenciais em suas APIs de LLM.
- EasyJailbreak - Um framework Python fácil de usar para gerar prompts de jailbreak adversariais.
- gptfuzz - Repositório oficial do GPTFUZZER: Red Teaming de Modelos de Linguagem Grandes com Prompts de Jailbreak Gerados Automaticamente
- llamator - Framework para testar vulnerabilidades de grandes modelos de linguagem (LLM).
- agentic_security - Scanner de vulnerabilidades de LLM agêntico / kit de red teaming de IA
IA Agêntica e Ferramentas de Ataque a MCP
- RAMPART - framework de testes de segurança e proteção nativo de pytest para aplicações de IA agenticas.
- AI-Infra-Guard - Uma plataforma abrangente, inteligente e fácil de usar de Red Teaming de IA desenvolvida pelo Tencent Zhuque Lab. Integra módulos de Infra Scan, MCP Scan e Avaliação de Jailbreak, oferecendo interface web com um clique, APIs REST e implantação baseada em Docker para avaliação abrangente de segurança de IA.
- OpenPromptInjection - Um benchmark para ataques e defesas de injeção de prompt
- AIMap - Plataforma de descoberta e testes de segurança em escala de internet para infraestrutura exposta de agentes de IA. Consulta o Shodan por servidores MCP, instâncias Ollama, proxies vLLM/LiteLLM e muito mais — depois gera fingerprints, pontua o risco e lança suítes de ataque específicas de protocolo com resultados em streaming em tempo real.### Segurança Ofensiva Assistida por IA
- PentestGPT - Uma ferramenta de teste de penetração habilitada por GPT
- HackingBuddyGPT - Ajudando hackers éticos a usar LLMs em 50 linhas de código ou menos
- cai - IA de Cibersegurança (CAI), uma inteligência artificial aberta pronta para Bug Bounty (paper)
- shannon - Pentester de IA totalmente autônomo para aplicações web e APIs da Keygraph. Testes de segurança white-box que analisam código-fonte, identificam vetores de ataque e executam exploits reais. Taxa de sucesso de 96.15% (100/104 exploits) no benchmark XBOW.
- strix - Strix são agentes de IA autônomos que agem exatamente como hackers reais - eles executam seu código dinamicamente, encontram vulnerabilidades e as validam por meio de proof-of-concepts reais
- redamon - Framework de red team agêntico alimentado por IA que automatiza operações ofensivas de segurança, desde reconhecimento até exploração e pós-exploração, com zero intervenção humana.
Esteganografia e Canais Encobertos
- ST3GG - Suíte de esteganografia tudo-em-um com codificação em múltiplas camadas, esteganografia de imagem e áudio e ferramentas de esteganálise para detectar dados ocultos em mídia gerada por IA.
Benchmarks e Avaliações
- ISC-Bench - Colapso de Segurança Interna: faz jailbreak em qualquer LLM de ponta (Claude Opus 4.6, GPT-5.4) em pass@3 por meio da conclusão normal de tarefas — sem prompting adversarial. Black-box, entre domínios, entre ciências. Modo de falha inédito. [Paper]
- jailbreakbench - JailbreakBench: Um benchmark aberto de robustez para jailbreak de modelos de linguagem [NeurIPS 2024 Datasets and Benchmarks Track]
- AgentDojo - Um ambiente dinâmico para avaliar ataques e defesas para agentes de LLM.
- AIRTBench - Repositório de código para: AIRTBench: Medindo as capacidades autônomas de red teaming de IA em modelos de linguagem
- HackingBuddyGPT benchmark dataset - Conjunto de dados de benchmark para pentesting automatizado
- AgentDoG - AgentDoG é um framework de avaliação e proteção ciente de riscos para agentes autônomos. Ele se concentra na avaliação de riscos no nível da trajetória, visando determinar se a trajetória de execução de um agente contém riscos de segurança em diversos cenários de aplicação.
- AICGSecEval - Benchmark abrangente de avaliação da Tencent para segurança na geração de código por IA, cobrindo 10 categorias CWE com harness de teste automatizado
- Inspect - Framework para avaliações de modelos de linguagem grandes do Instituto de Segurança de IA do Reino Unido. 200+ avaliações pré-construídas cobrindo engenharia de prompt, uso de ferramentas, diálogo multi-turn e pontuação avaliada por modelo.
- sec-code-bench - Benchmark da Alibaba para avaliar as capacidades de segurança de código de LLMs em 17 categorias de vulnerabilidades e 4 linguagens de programação
Defesa e Controles de Segurança
Guardrails de Entrada/Saída
- NeMo-Guardrails - NeMo Guardrails é um kit de ferramentas de código aberto para adicionar facilmente guardrails programáveis a sistemas conversacionais baseados em LLM.
- LlamaFirewall - LlamaFirewall é um framework projetado para detectar e mitigar riscos de segurança centrados em IA, suportando múltiplas camadas de entradas e saídas, como chat LLM típico e operações agênticas multi-etapa mais avançadas.
- llm-guard - O LLM Guard da Protect AI é uma ferramenta abrangente projetada para fortalecer a segurança de Modelos de Linguagem Grandes (LLMs).
- Guardrails.ai - Guardrails é um pacote Python que permite ao usuário adicionar garantias de estrutura, tipo e qualidade às saídas de modelos de linguagem grandes (LLMs)
- TrustGate - Firewall de Aplicações Generativas (GAF) para detectar, prevenir e bloquear ataques contra aplicações GenAI
- ZenGuard AI - A camada de confiança mais rápida para agentes de IA
- LocalMod - API de moderação de conteúdo auto-hospedada com detecção de injeção de prompt, filtragem de toxicidade, detecção de PII e classificação NSFW. Funciona 100% offline.
- DynaGuard - Um modelo de guardrail dinâmico com políticas definidas pelo usuário
- AprielGuard - Modelo de salvaguarda de segurança com 8B parâmetros
- Safe Zone - Safe Zone é um mecanismo de código aberto de detecção de PII e guardrails que impede que dados confidenciais vazem para LLMs e APIs de terceiros.
- superagent - O Superagent fornece guardrails treinados especificamente para tornar os agentes de IA seguros e em conformidade.
- ShellWard -
Segurança de Runtime de Agentes e Sandboxing
- OpenShell - OpenShell é o runtime seguro e privado para agentes de IA autônomos. Ele fornece ambientes de execução em sandbox regidos por políticas YAML declarativas que impedem acesso não autorizado a arquivos, exfiltração de dados e atividade de rede não controlada.
- OpenSandbox - Runtime de sandbox seguro, rápido e extensível para agentes de IA. SDKs em várias linguagens, runtimes Docker/Kubernetes, isolamento com gVisor/Kata Containers/Firecracker. Projeto do CNCF Landscape.
- CubeSandbox - Sandbox instantâneo, concorrente, seguro e leve para agentes de IA da Tencent Cloud. Cold start abaixo de 60ms, sobrecarga de memória <5MB, compatível com SDK E2B. Construído sobre RustVMM e KVM com isolamento extremo (kernel dedicado + eBPF).
- Aegis - EDR de código aberto para agentes de IA da Antropos. Monitore processos, arquivos, rede e comportamento de agentes de IA autônomos em tempo real. Sem telemetria, sem nuvem, tudo permanece local.
- Microsoft Agent Governance Toolkit - Kit de governança de agentes de IA da Microsoft — aplicação de políticas, identidade zero-trust, sandbox de execução e engenharia de confiabilidade para agentes de IA autônomos. Cobre 10/10 do OWASP Agentic Top 10.
- agentfield - Plano de controle de código aberto para sistemas de agentes com identidade criptográfica, aplicação de políticas e observabilidade amigável à auditoria.
- leash - O Leash envolve agentes de codificação de IA em contêineres e monitora sua atividade.
- vibekit - Execute Claude Code, Gemini, Codex — ou qualquer agente de codificação — em um sandbox limpo e isolado, com redação de dados confidenciais e observabilidade incorporadas.
- pipelock - Harness de segurança para agentes de IA — proxy de egresso com varredura DLP, proteção SSRF, varredura de respostas MCP e monitoramento de integridade do workspace
- skill-scanner - Um scanner de segurança para habilidades de agentes de IA que detecta injeção de prompt, exfiltração de dados e padrões de código malicioso. Combina detecção baseada em padrões (YAML + YARA), LLM-como-juiz e análise comportamental de fluxo de dados para detecção abrangente de ameaças.
Segurança MCP
- MCP-Security-Checklist - Uma lista de verificação de segurança abrangente para ferramentas de IA baseadas em MCP. Criada pela SlowMist para proteger ecossistemas de plugins de LLM.
- Awesome-MCP-Security - Tudo o que você precisa saber sobre a segurança do Model Context Protocol (MCP).
- secure-mcp-gateway - Este gateway MCP seguro é construído com autenticação, descoberta automática de ferramentas, cache e aplicação de guardrails.
- mcp-context-protector - context-protector é um wrapper de segurança para servidores MCP que aborda os riscos associados à execução de servidores MCP não confiáveis, incluindo line jumping, mudanças inesperadas na configuração do servidor e outros ataques de injeção de prompt
- mcp-guardian - O MCP Guardian gerencia o acesso do seu assistente LLM a servidores MCP, dando a você controle em tempo real da atividade do seu LLM.
- MCP Audit VSCode Extension - Audite e registre centralmente todas as chamadas de ferramentas MCP do GitHub Copilot no VSCode com facilidade.
- MCP-Scan - Uma ferramenta de varredura de segurança para servidores MCP
- ATR (Agent Threat Rules) - Regras de detecção de código aberto para ameaças a agentes de IA. 108 regras regex cobrindo injeção de prompt, envenenamento de ferramentas e exfiltração de credenciais em 9 categorias. Usadas pela Cisco AI Defense. Licenciado sob MIT.
- MCPProxy - Proxy MCP local-first com quarentena SHA-256 por ferramenta para detectar ataques de envenenamento de ferramentas e rug-pull, varredura automática de dados confidenciais e segredos em chamadas de ferramentas, isolamento em sandbox Docker para servidores MCP não confiáveis e OAuth 2.1. Licenciado sob MIT.
Varredura de Modelos e Artefatos
- modelscan - ModelScan é um projeto de código aberto da Protect AI que varre modelos para determinar se contêm código inseguro.
- picklescan - Scanner de segurança que detecta arquivos Python Pickle realizando ações suspeitas
- fickling - Um decompilador e analisador estático de pickling Python
- medusa - Scanner de segurança AI-first com 74+ analisadores, 180+ regras de segurança para agentes de IA e redução inteligente de falsos positivos. Suporta todas as linguagens. Detecção de CVE para React2Shell e RCE em mcp-remote.
- julius - Ferramenta de fingerprinting de serviços LLM para profissionais de segurança. Detecta 32+ serviços de IA (Ollama, vLLM, LiteLLM, Hugging Face TGI, etc.) durante testes de penetração e descoberta de superfície de ataque. Usa fingerprinting de serviços baseado em HTTP para identificar a infraestrutura do servidor.
- a2a-scanner - Varra agentes A2A em busca de ameaças potenciais e problemas de segurança### Segurança Defensiva Assistida por IA
- Claude Code Security Review - Uma GitHub Action de revisão de segurança alimentada por IA que usa o Claude para analisar alterações de código em busca de vulnerabilidades de segurança.
- deepsec - Scanner de vulnerabilidades baseado em agentes da Vercel Labs para encontrar problemas difíceis de detectar em grandes bases de código usando agentes de codificação. Suporta varredura paralela, revisão de diffs de PR e integração com CI/CD.
- defending-code-reference-harness - Implementação de referência para descoberta e remediação autônoma de vulnerabilidades usando o Claude. Inclui habilidades de modelagem de ameaças, varredura, triagem e correção de patches.
- Visa Vulnerability Agentic Harness - Pipeline SAST agêntico com 11 estágios, da detecção à remediação com LLM e validação adversarial. Gera SARIF, integra-se com Claude Code, Copilot e Gemini.
Privacidade e Computação Confidencial
- Python Differential Privacy Library
- Diffprivlib - A Biblioteca de Privacidade Diferencial da IBM
- TenSEAL - Uma biblioteca para realizar operações de criptografia homomórfica em tensores
- SyMPC - Uma biblioteca complementar de Computação Multiparte Segura para o Syft
- Cloaked AI - Criptografia open-source que preserva propriedades para embeddings vetoriais
- dstack - Framework de IA confidencial open-source para implantação segura de ML/LLM com isolamento reforçado por hardware e privacidade de dados
- PrivacyRaven - biblioteca de teste de privacidade para sistemas de deep learning
- PLOT4ai - Biblioteca de Privacidade de Ameaças para Inteligência Artificial — Uma biblioteca de modelagem de ameaças para ajudar você a construir IA responsável
- OpenDP - Biblioteca principal para algoritmos de privacidade diferencial do projeto OpenDP — usada para construir pipelines de treinamento de ML que preservam a privacidade
Segurança de Dados e Cadeia de Suprimentos
- datasig - Fingerprinting de conjuntos de dados para AIBOM
- OWASP AIBOM - Lista de Materiais de IA
- Trusera ai-bom - Lista de Materiais de IA — descubra todos os agentes, modelos e APIs de IA em sua infraestrutura
Habilidades de Segurança de IA Agêntica
- Elastic Agent Skills - Coleção de habilidades para o assistente de IA da Elastic, permitindo investigações de segurança em linguagem natural em logs, traces e inteligência de ameaças
- Ghost Security Skills - Habilidades e ferramentas de segurança de aplicativos (appsec) para agentes e Claude Code
- tm_skills - Habilidades de agente para auxiliar na Modelagem Contínua de Ameaças
- Trail of Bits Skills Marketplace - Habilidades do Trail of Bits para Claude Code em pesquisa de segurança, detecção de vulnerabilidades e fluxos de trabalho de auditoria
- Semgrep Skills - Habilidades oficiais do Semgrep para Claude Code e outros assistentes de codificação com IA. Fornece recursos de varredura de segurança, análise de código e detecção de vulnerabilidades diretamente no seu fluxo de desenvolvimento assistido por IA.
- claude-bug-bounty - Habilidade do Claude Code para caça a bug bounty assistida por IA. Automatiza reconhecimento e testes de IDOR, XSS, SSRF, OAuth, GraphQL e injeção em LLM com checklist de validação de 4 portões e geração de relatórios.
- Anthropic Cybersecurity Skills - Mais de 734 habilidades estruturadas de cibersegurança para agentes de IA. Mapeadas para MITRE ATT&CK, padrão agentskills.io. Compatíveis com Claude Code, Copilot, Codex CLI, Cursor e Gemini CLI.
- llm-sast-scanner - Habilidade SAST para agentes de codificação com IA (Claude Code, Codex, etc.) com detecção estruturada de vulnerabilidades em 34 classes. Inclui análise de taint source-to-sink, verificação por Judge para redução de falsos positivos e precisão/recall acima de 99% em benchmarks.
- sast-skills - Coleção de habilidades de agente que transformam seu codificador de IA em um scanner SAST
- pentest-ai-agents - 31 subagentes do Claude Code para segurança ofensiva. Subagentes de IA especializados em reconhecimento (recon), web, AD, nuvem, mobile, wireless, engenharia social, criação de payloads, engenharia reversa, encadeamento de exploits, engenharia de detecção, forense e geração de relatórios. Agentes de nível 2 podem executar ferramentas diretamente com portões de aprovação.
Modelos de IA Focados em Segurança
- VulnLLM-R-7B - LLM de raciocínio especializado para detecção de vulnerabilidades. Usa raciocínio Chain-of-Thought para analisar fluxo de dados, fluxo de controle e contexto de segurança. Supera Claude-3.7-Sonnet e CodeQL em benchmarks de detecção de vulnerabilidades. Apenas 7B de parâmetros, sendo eficiente e rápido.
- Foundation-Sec-8B-Reasoning - Llama-3.1-FoundationAI-SecurityLLM-8B-Reasoning é um modelo de linguagem de pesos abertos com 8 bilhões de parâmetros, ajustado por instruções e especializado em aplicações de cibersegurança. Ele estende o modelo base Foundation-Sec-8B com capacidades de seguir instruções e raciocínio.
- Antares (1B & 350M) - Modelos agênticos para localização de vulnerabilidades da fdtn-ai. Disponíveis em variantes de 2B e 0.4B parâmetros, projetados para identificar e localizar vulnerabilidades em código de forma autônoma.
- CyberSecQwen-4B - _Especialista em CTI com 4B de parâmetros, ajustado a partir do Qwen3-4B-Instruct-2507 para inteligência de ameaças cibernéticas.
- Meta-SecAlign-8B / Meta-SecAlign-70B - Modelos Llama alinhados à segurança, ajustados para resistir a ataques de injeção de prompt, mantendo a hierarquia de instruções mesmo sob entradas adversárias
- Lily-Cybersecurity-7B - Modelo de chat de 7B ajustado para cibersegurança, otimizado para análise de segurança, explicação de vulnerabilidades e tarefas de inteligência de ameaças.
Classificadores de Segurança e Detecção de Injeção de Prompt
- Llama-Guard-4-12B - O mais recente classificador multimodal de segurança da Meta para detectar conteúdo nocivo em entradas e saídas de LLMs, nas modalidades de texto e imagem.
- Llama-Prompt-Guard-2-86M - Modelo leve de 86M de parâmetros da Meta para detectar tentativas de injeção de prompt e jailbreak em pipelines de LLM em produção.
- ShieldGemma-2B - Classificador de segurança de texto com 2B de parâmetros do Google para detectar conteúdo nocivo, construído sobre a arquitetura Gemma.
- DeBERTa Prompt Injection Detector v2 - DeBERTa-v3-base da Protect AI ajustado para detecção de injeção de prompt, amplamente usado em pipelines de proteção de LLMs em produção.
- Prompt Injection Sentinel - Modelo ModernBERT-large ajustado para classificação de injeção de prompt e jailbreak com baixa taxa de falsos positivos.
- Nemotron 3.5 Content Safety - Modelo multimodal de segurança de conteúdo com 4B de parâmetros da NVIDIA que unifica proteções de entrada de texto+imagem, suporte multilíngue (mais de 35 idiomas), aplicação de políticas empresariais personalizáveis e raciocínio auditável em uma única chamada de inferência. Sucessor do Nemotron 3 Content Safety.
- BrowseSafe - Modelo de segurança especializado para detectar ataques de injeção de prompt em agentes de navegador com IA. Alcança 90,4% de F1 no BrowseSafe-Bench, otimizado para classificação assíncrona em tempo real de conteúdo HTML bruto.
Modelos de Linguagem de Segurança Adaptados por Domínio
- ATTACK-BERT - Modelo sentence-transformer para mapear textos de segurança para técnicas MITRE ATT&CK.
- CySecBERT - Modelo BERT adaptado para tarefas de cibersegurança e CTI por meio de pré-treinamento específico de domínio.
Conjuntos de Dados
- SafetyPrompts - Coleção selecionada de prompts relevantes para segurança, usada para avaliar propriedades de segurança e proteção de LLMs.
- Do-Not-Answer - Conjunto de dados de prompts que LLMs responsáveis não devem responder, para avaliação de segurança e red teaming.
- JailBreakV-28K - Conjunto de dados em larga escala com 28.000 prompts de jailbreak para benchmarking de segurança de LLMs.
- CL4R1T4S - Prompts de sistema vazados do ChatGPT, Claude, Gemini, Grok, Perplexity, Cursor, Lovable, Replit e outras ferramentas de IA importantes. A maior coleção conhecida de prompts de sistema de produção para pesquisa de transparência e superfície de ataque.
- LEAKHUB - Leaderboard de vazamentos de prompts de sistema — plataforma comunitária para acompanhar e classificar vazamentos de prompts de sistema em produtos de IA.
- Leaked System Prompts - Coleção de prompts de sistema vazados de ferramentas de IA comerciais — útil para entender engenharia de prompt do mundo real e superfícies de ataque.