Skip to content
KitploitKITPLOIT
FerramentasBlog
Enviar
FerramentasBlog
Enviar

Ferramentas de Hacking, PenTest e Cibersegurança para o seu Arsenal de Segurança!

Kitploit é um diretório de ferramentas de hacking, cibersegurança e pentesting. Descubra as últimas atualizações de projetos para encontrar vulnerabilidades, analisar sistemas, automatizar testes e fortalecer sua segurança.

··Feeds·Contato·Privacidade·© 2026 Kitploit

Diretório de Ferramentas

Categorias

Ver todas as categorias
Loading categories
awesome-ai-security — Uma coleção de recursos incríveis relacionados à segurança de IA | Kitploit
Ferramentas/GitHubGitHub/ottosulin/awesome-ai-security
Scanners de VulnerabilidadesTestes de PenetraçãoPrivacidadeSegurança da Cadeia de SuprimentosAprendizado e EducaçãoRed TeamingRecursos CuradosSegurança de IAAtaque Adversário
GitHubottosulin/awesome-ai-security

awesome-ai-security

Uma coleção de recursos incríveis relacionados à segurança de IA

1.4k352há 1 diaRevisado pelo Kitploit

Mais Populares

Ver todos →

Descubra as ferramentas mais usadas pela nossa comunidade.

Explore todas as ferramentas

Navegue pela nossa coleção de ferramentas

Ver todas as ferramentas →
Compartilhar
Ver Repositório

Awesome AI Security Awesome Track Awesome List

Uma lista com curadoria de frameworks, padrões, recursos de aprendizado e ferramentas de código aberto relacionados à segurança de IA.

Se quiser contribuir, crie um PR ou entre em contato comigo @ottosulin.

Índice

  • Recursos de Aprendizado
    • Leitura e Guias
    • Cursos, Laboratórios e CTFs
    • Podcasts
  • Governança e Gestão de Riscos
    • Frameworks
    • Padrões e Verificação
    • Taxonomias, Terminologia e Bancos de Dados de Riscos
    • Checklists e Orientações Práticas
  • Técnicas de Ataque e Red Teaming
    • ML Adversarial e Modelos Clássicos
    • Red Teaming de LLM e GenAI
    • IA Agêntica e Ferramentas de Ataque a MCP
    • Segurança Ofensiva Assistida por IA
    • Esteganografia e Canais Encobertos
  • Benchmarks e Avaliações
  • Defesa e Controles de Segurança
    • Guardrails de Entrada/Saída
    • Segurança de Runtime de Agentes e Sandboxing
    • Segurança de MCP
    • Varredura de Modelos e Artefatos
    • Segurança Defensiva Assistida por IA
    • Privacidade e Computação Confidencial
    • Segurança de Dados e da Cadeia de Suprimentos
  • Habilidades de Segurança para IA Agêntica
  • Modelos de IA Voltados para Segurança

Recursos de Aprendizado

Leitura e Guias

  • OWASP ML TOP 10
  • OWASP LLM TOP 10
  • OWASP AI Security and Privacy Guide
  • NIST AIRC - Centro de Recursos de IA Confiável e Responsável do NIST
  • The MLSecOps Top 10 by Institute for Ethical AI & Machine Learning
  • OWASP Multi-Agentic System Threat Modeling
  • OWASP: CheatSheet – A Practical Guide for Securely Using Third-Party MCP Servers 1.0
  • OWASP GenAI Threat & Defense Compass - Guia de referência que mapeia ameaças de GenAI para os controles defensivos correspondentes.
  • NCSC Guidelines for Secure AI System Development - Diretrizes práticas coescritas pelo NCSC (Reino Unido) e pela CISA para o desenvolvimento seguro de IA, cobrindo design, desenvolvimento, implantação e operação.

Cursos, Laboratórios e CTFs

  • Damn Vulnerable MCP Server - Uma implementação deliberadamente vulnerável do Model Context Protocol (MCP) para fins educacionais.
  • otto-support - Uma implementação de servidor MCP vulnerável usando mcp-go com autenticação em camadas (4 papéis), 19 ferramentas e contêiner sandbox integrado com Claude Code para praticar escalonamento de privilégios e uso indevido de ferramentas.
  • OWASP WrongSecrets LLM exercise
  • vulnerable-mcp-servers-lab - Uma coleção de servidores deliberadamente vulneráveis para aprender a fazer pentest em servidores MCP.
  • FinBot Agentic AI Capture The Flag (CTF) Application - O FinBot é uma plataforma interativa de Capture The Flag (CTF) de Segurança Agentica que simula vulnerabilidades do mundo real em sistemas de IA agenticos usando um aplicativo simulado focado em serviços financeiros.
  • AI-Red-Teaming-Playground-Labs - Laboratórios de playground de Red Teaming de IA para executar treinamentos de Red Teaming de IA, incluindo infraestrutura.
  • Damn Vulnerable LLM Agent - Agente LLM intencionalmente vulnerável para aprender sobre injeção de prompt, uso indevido de ferramentas e segurança de agentes
    • LLMVault - Um laboratório de segurança de LLM estilo CTF de código aberto para aprender o OWASP LLM Top 10 por meio de exercícios vulneráveis práticos que cobrem injeção de prompt, ataques de RAG, vazamento de prompt do sistema, uso indevido de ferramentas e segurança de agentes.

Podcasts

  • MLSecOps podcast
  • AI Security Podcast
  • AI Security Ops - Podcasts semanais da Black Hills Information Security explorando como a IA transforma a cibersegurança—cobrindo ameaças emergentes, ferramentas e tendências com conhecimento prático e acionável.
  • GenAI Security podcast

Governança e Gestão de Riscos

Frameworks

  • NIST AI Risk Management Framework
  • ISO/IEC 42001 Artificial Intelligence Management System
  • ISO/IEC 23894:2023 Information technology — Artificial intelligence — Guidance on risk management
  • Google Secure AI Framework (SAIF)
  • ENISA Multilayer Framework for Good Cybersecurity Practices for AI
  • OWASP Artificial Intelligence Maturity Assessment
  • CSA AI Model Risk Framework
  • CSA Maestro AI Threat Modeling Framework
  • CSA AI Controls Matrix - Matriz de controles abrangente para sistemas de IA cobrindo governança, risco e conformidade.
  • OWASP Agentic AI Top 10 - Top 10 para IA Agentica que serve como base para o red teaming do OWASP e da CSA.

Padrões e Verificação

  • OWASP AI Security Verification Standard
  • OWASP Agent Name Service
  • OWASP Agent Observability Standard
  • AI Verify - Framework e toolkit de teste de IA apoiados pelo governo de Singapura para verificar propriedades de sistemas de IA em relação a frameworks de governança.

Taxonomias, Terminologia e Bancos de Dados de Riscos

  • NIST AI 100-2e2023 - Taxonomia e terminologia de aprendizado de máquina adversarial
  • MITRE ATLAS
    • ATLAS Knowledge Base Agent - Assistente de IA de código aberto para explorar a base de conhecimento do ATLAS com linguagem natural, acesso a servidor MCP e fluxos de trabalho de agente personalizáveis.
  • AVIDML
  • MIT AI Risk Repository
  • AI Incident Database
  • ISO/IEC 22989:2022 Information technology — Artificial intelligence — Artificial intelligence concepts and terminology
  • NIST AI Glossary
  • The Arcanum Prompt Injection Taxonomy - Sistema abrangente de classificação de ataques de injeção de prompt que cobre intenções de ataque, técnicas, evasões e vetores de entrada. Categoriza objetivos, métodos, técnicas de ofuscação e superfícies de ataque para ataques de injeção de prompt.
  • CSA LLM Threats Taxonomy
  • OWASP AI Vulnerability Scoring System (AIVSS) - Sistema de pontuação para vulnerabilidades específicas de IA, estendendo os conceitos de CVSS às dimensões de risco de IA.

Checklists e Orientações Práticas

  • OWASP LLM Applications Cybersecurity and Governance Checklist
  • OWASP AI Security and Privacy Guide
  • OWASP LLM and Generative AI Security Center of Excellence Guide
  • OWASP Agentic AI – Threats and Mitigations
  • OWASP AI Security Solutions Landscape
  • OWASP GenAI Incident Response Guide
  • OWASP LLM and GenAI Data Security Best Practices
  • OWASP Securing Agentic AI Applications
  • OWASP GenAI Red Teaming Guide

Técnicas de Ataque e Red Teaming

ML Adversarial e Modelos Clássicos

  • Adversarial Robustness Toolkit - A ART foca nas ameaças de Evasão (alterar o comportamento do modelo com modificações na entrada), Envenenamento (controlar um modelo com modificações nos dados de treinamento), Extração (roubar um modelo por meio de consultas) e Inferência (atacar a privacidade dos dados de treinamento)
  • cleverhans - Uma biblioteca de exemplos adversariais para construir ataques, desenvolver defesas e fazer benchmark de ambos
  • foolbox - Um toolbox em Python para criar exemplos adversariais que enganam redes neurais em PyTorch, TensorFlow e JAX
  • TextAttack - Um framework em Python para ataques adversariais, aumento de dados e treinamento de modelo em PLN
  • Counterfit - camada de automação genérica para avaliar a segurança de sistemas de aprendizado de máquina
  • OffsecML Playbook - Uma coleção de TTPs ofensivos e adversariais com provas de conceito
  • BadDiffusion - Repositório oficial para reproduzir o artigo "How to Backdoor Diffusion Models?" publicado no CVPR 2023
  • secml-torch - SecML-Torch: uma biblioteca para avaliação da robustez de modelos de aprendizado profundo

Red Teaming de LLM e GenAI

  • garak - ferramenta de sondagem de segurança para LLMs
  • ai-scanner - Aplicação web de código aberto para avaliações de segurança de modelos de IA, construída sobre o NVIDIA garak. Possui 179 sondas, varredura de múltiplos alvos, varreduras agendadas, pontuação ASR e integração com SIEM.
  • promptfoo - Teste seus prompts, agentes e RAGs. Red teaming, pentest e varredura de vulnerabilidades para LLMs. Compare o desempenho de GPT, Claude, Gemini, Llama e outros. Configurações declarativas simples com integração de linha de comando e CI/CD.
  • PyRIT - O Python Risk Identification Tool para IA generativa (PyRIT) é um framework de código aberto criado para capacitar profissionais de segurança e engenheiros a identificar proativamente riscos em sistemas de IA generativa.
  • PurpleLlama - Conjunto de ferramentas para avaliar e melhorar a segurança de LLMs.
  • augustus - Framework de teste de segurança de LLM para detecção de injeção de prompt, jailbreaks e ataques adversariais. Mais de 190 sondas, 28 provedores, um único binário Go. Pronto para produção, com varredura concorrente, limitação de taxa e lógica de repetição.
  • FuzzyAI - Uma ferramenta poderosa para fuzzing automatizado de LLMs. Projetada para ajudar desenvolvedores e pesquisadores de segurança a identificar e mitigar jailbreaks potenciais em suas APIs de LLM.
  • EasyJailbreak - Um framework Python fácil de usar para gerar prompts de jailbreak adversariais.
  • gptfuzz - Repositório oficial do GPTFUZZER: Red Teaming de Modelos de Linguagem Grandes com Prompts de Jailbreak Gerados Automaticamente
  • llamator - Framework para testar vulnerabilidades de grandes modelos de linguagem (LLM).
  • agentic_security - Scanner de vulnerabilidades de LLM agêntico / kit de red teaming de IA

IA Agêntica e Ferramentas de Ataque a MCP

  • RAMPART - framework de testes de segurança e proteção nativo de pytest para aplicações de IA agenticas.
  • AI-Infra-Guard - Uma plataforma abrangente, inteligente e fácil de usar de Red Teaming de IA desenvolvida pelo Tencent Zhuque Lab. Integra módulos de Infra Scan, MCP Scan e Avaliação de Jailbreak, oferecendo interface web com um clique, APIs REST e implantação baseada em Docker para avaliação abrangente de segurança de IA.
  • OpenPromptInjection - Um benchmark para ataques e defesas de injeção de prompt
  • AIMap - Plataforma de descoberta e testes de segurança em escala de internet para infraestrutura exposta de agentes de IA. Consulta o Shodan por servidores MCP, instâncias Ollama, proxies vLLM/LiteLLM e muito mais — depois gera fingerprints, pontua o risco e lança suítes de ataque específicas de protocolo com resultados em streaming em tempo real.### Segurança Ofensiva Assistida por IA
  • PentestGPT - Uma ferramenta de teste de penetração habilitada por GPT
  • HackingBuddyGPT - Ajudando hackers éticos a usar LLMs em 50 linhas de código ou menos
  • cai - IA de Cibersegurança (CAI), uma inteligência artificial aberta pronta para Bug Bounty (paper)
  • shannon - Pentester de IA totalmente autônomo para aplicações web e APIs da Keygraph. Testes de segurança white-box que analisam código-fonte, identificam vetores de ataque e executam exploits reais. Taxa de sucesso de 96.15% (100/104 exploits) no benchmark XBOW.
  • strix - Strix são agentes de IA autônomos que agem exatamente como hackers reais - eles executam seu código dinamicamente, encontram vulnerabilidades e as validam por meio de proof-of-concepts reais
  • redamon - Framework de red team agêntico alimentado por IA que automatiza operações ofensivas de segurança, desde reconhecimento até exploração e pós-exploração, com zero intervenção humana.

Esteganografia e Canais Encobertos

  • ST3GG - Suíte de esteganografia tudo-em-um com codificação em múltiplas camadas, esteganografia de imagem e áudio e ferramentas de esteganálise para detectar dados ocultos em mídia gerada por IA.

Benchmarks e Avaliações

  • ISC-Bench - Colapso de Segurança Interna: faz jailbreak em qualquer LLM de ponta (Claude Opus 4.6, GPT-5.4) em pass@3 por meio da conclusão normal de tarefas — sem prompting adversarial. Black-box, entre domínios, entre ciências. Modo de falha inédito. [Paper]
  • jailbreakbench - JailbreakBench: Um benchmark aberto de robustez para jailbreak de modelos de linguagem [NeurIPS 2024 Datasets and Benchmarks Track]
  • AgentDojo - Um ambiente dinâmico para avaliar ataques e defesas para agentes de LLM.
  • AIRTBench - Repositório de código para: AIRTBench: Medindo as capacidades autônomas de red teaming de IA em modelos de linguagem
  • HackingBuddyGPT benchmark dataset - Conjunto de dados de benchmark para pentesting automatizado
  • AgentDoG - AgentDoG é um framework de avaliação e proteção ciente de riscos para agentes autônomos. Ele se concentra na avaliação de riscos no nível da trajetória, visando determinar se a trajetória de execução de um agente contém riscos de segurança em diversos cenários de aplicação.
  • AICGSecEval - Benchmark abrangente de avaliação da Tencent para segurança na geração de código por IA, cobrindo 10 categorias CWE com harness de teste automatizado
  • Inspect - Framework para avaliações de modelos de linguagem grandes do Instituto de Segurança de IA do Reino Unido. 200+ avaliações pré-construídas cobrindo engenharia de prompt, uso de ferramentas, diálogo multi-turn e pontuação avaliada por modelo.
  • sec-code-bench - Benchmark da Alibaba para avaliar as capacidades de segurança de código de LLMs em 17 categorias de vulnerabilidades e 4 linguagens de programação

Defesa e Controles de Segurança

Guardrails de Entrada/Saída

  • NeMo-Guardrails - NeMo Guardrails é um kit de ferramentas de código aberto para adicionar facilmente guardrails programáveis a sistemas conversacionais baseados em LLM.
  • LlamaFirewall - LlamaFirewall é um framework projetado para detectar e mitigar riscos de segurança centrados em IA, suportando múltiplas camadas de entradas e saídas, como chat LLM típico e operações agênticas multi-etapa mais avançadas.
  • llm-guard - O LLM Guard da Protect AI é uma ferramenta abrangente projetada para fortalecer a segurança de Modelos de Linguagem Grandes (LLMs).
  • Guardrails.ai - Guardrails é um pacote Python que permite ao usuário adicionar garantias de estrutura, tipo e qualidade às saídas de modelos de linguagem grandes (LLMs)
  • TrustGate - Firewall de Aplicações Generativas (GAF) para detectar, prevenir e bloquear ataques contra aplicações GenAI
  • ZenGuard AI - A camada de confiança mais rápida para agentes de IA
  • LocalMod - API de moderação de conteúdo auto-hospedada com detecção de injeção de prompt, filtragem de toxicidade, detecção de PII e classificação NSFW. Funciona 100% offline.
  • DynaGuard - Um modelo de guardrail dinâmico com políticas definidas pelo usuário
  • AprielGuard - Modelo de salvaguarda de segurança com 8B parâmetros
  • Safe Zone - Safe Zone é um mecanismo de código aberto de detecção de PII e guardrails que impede que dados confidenciais vazem para LLMs e APIs de terceiros.
  • superagent - O Superagent fornece guardrails treinados especificamente para tornar os agentes de IA seguros e em conformidade.
  • ShellWard -

Segurança de Runtime de Agentes e Sandboxing

  • OpenShell - OpenShell é o runtime seguro e privado para agentes de IA autônomos. Ele fornece ambientes de execução em sandbox regidos por políticas YAML declarativas que impedem acesso não autorizado a arquivos, exfiltração de dados e atividade de rede não controlada.
  • OpenSandbox - Runtime de sandbox seguro, rápido e extensível para agentes de IA. SDKs em várias linguagens, runtimes Docker/Kubernetes, isolamento com gVisor/Kata Containers/Firecracker. Projeto do CNCF Landscape.
  • CubeSandbox - Sandbox instantâneo, concorrente, seguro e leve para agentes de IA da Tencent Cloud. Cold start abaixo de 60ms, sobrecarga de memória <5MB, compatível com SDK E2B. Construído sobre RustVMM e KVM com isolamento extremo (kernel dedicado + eBPF).
  • Aegis - EDR de código aberto para agentes de IA da Antropos. Monitore processos, arquivos, rede e comportamento de agentes de IA autônomos em tempo real. Sem telemetria, sem nuvem, tudo permanece local.
  • Microsoft Agent Governance Toolkit - Kit de governança de agentes de IA da Microsoft — aplicação de políticas, identidade zero-trust, sandbox de execução e engenharia de confiabilidade para agentes de IA autônomos. Cobre 10/10 do OWASP Agentic Top 10.
  • agentfield - Plano de controle de código aberto para sistemas de agentes com identidade criptográfica, aplicação de políticas e observabilidade amigável à auditoria.
  • leash - O Leash envolve agentes de codificação de IA em contêineres e monitora sua atividade.
  • vibekit - Execute Claude Code, Gemini, Codex — ou qualquer agente de codificação — em um sandbox limpo e isolado, com redação de dados confidenciais e observabilidade incorporadas.
  • pipelock - Harness de segurança para agentes de IA — proxy de egresso com varredura DLP, proteção SSRF, varredura de respostas MCP e monitoramento de integridade do workspace
  • skill-scanner - Um scanner de segurança para habilidades de agentes de IA que detecta injeção de prompt, exfiltração de dados e padrões de código malicioso. Combina detecção baseada em padrões (YAML + YARA), LLM-como-juiz e análise comportamental de fluxo de dados para detecção abrangente de ameaças.

Segurança MCP

  • MCP-Security-Checklist - Uma lista de verificação de segurança abrangente para ferramentas de IA baseadas em MCP. Criada pela SlowMist para proteger ecossistemas de plugins de LLM.
  • Awesome-MCP-Security - Tudo o que você precisa saber sobre a segurança do Model Context Protocol (MCP).
  • secure-mcp-gateway - Este gateway MCP seguro é construído com autenticação, descoberta automática de ferramentas, cache e aplicação de guardrails.
  • mcp-context-protector - context-protector é um wrapper de segurança para servidores MCP que aborda os riscos associados à execução de servidores MCP não confiáveis, incluindo line jumping, mudanças inesperadas na configuração do servidor e outros ataques de injeção de prompt
  • mcp-guardian - O MCP Guardian gerencia o acesso do seu assistente LLM a servidores MCP, dando a você controle em tempo real da atividade do seu LLM.
  • MCP Audit VSCode Extension - Audite e registre centralmente todas as chamadas de ferramentas MCP do GitHub Copilot no VSCode com facilidade.
  • MCP-Scan - Uma ferramenta de varredura de segurança para servidores MCP
  • ATR (Agent Threat Rules) - Regras de detecção de código aberto para ameaças a agentes de IA. 108 regras regex cobrindo injeção de prompt, envenenamento de ferramentas e exfiltração de credenciais em 9 categorias. Usadas pela Cisco AI Defense. Licenciado sob MIT.
  • MCPProxy - Proxy MCP local-first com quarentena SHA-256 por ferramenta para detectar ataques de envenenamento de ferramentas e rug-pull, varredura automática de dados confidenciais e segredos em chamadas de ferramentas, isolamento em sandbox Docker para servidores MCP não confiáveis e OAuth 2.1. Licenciado sob MIT.

Varredura de Modelos e Artefatos

  • modelscan - ModelScan é um projeto de código aberto da Protect AI que varre modelos para determinar se contêm código inseguro.
  • picklescan - Scanner de segurança que detecta arquivos Python Pickle realizando ações suspeitas
  • fickling - Um decompilador e analisador estático de pickling Python
  • medusa - Scanner de segurança AI-first com 74+ analisadores, 180+ regras de segurança para agentes de IA e redução inteligente de falsos positivos. Suporta todas as linguagens. Detecção de CVE para React2Shell e RCE em mcp-remote.
  • julius - Ferramenta de fingerprinting de serviços LLM para profissionais de segurança. Detecta 32+ serviços de IA (Ollama, vLLM, LiteLLM, Hugging Face TGI, etc.) durante testes de penetração e descoberta de superfície de ataque. Usa fingerprinting de serviços baseado em HTTP para identificar a infraestrutura do servidor.
  • a2a-scanner - Varra agentes A2A em busca de ameaças potenciais e problemas de segurança### Segurança Defensiva Assistida por IA
  • Claude Code Security Review - Uma GitHub Action de revisão de segurança alimentada por IA que usa o Claude para analisar alterações de código em busca de vulnerabilidades de segurança.
  • deepsec - Scanner de vulnerabilidades baseado em agentes da Vercel Labs para encontrar problemas difíceis de detectar em grandes bases de código usando agentes de codificação. Suporta varredura paralela, revisão de diffs de PR e integração com CI/CD.
  • defending-code-reference-harness - Implementação de referência para descoberta e remediação autônoma de vulnerabilidades usando o Claude. Inclui habilidades de modelagem de ameaças, varredura, triagem e correção de patches.
  • Visa Vulnerability Agentic Harness - Pipeline SAST agêntico com 11 estágios, da detecção à remediação com LLM e validação adversarial. Gera SARIF, integra-se com Claude Code, Copilot e Gemini.

Privacidade e Computação Confidencial

  • Python Differential Privacy Library
  • Diffprivlib - A Biblioteca de Privacidade Diferencial da IBM
  • TenSEAL - Uma biblioteca para realizar operações de criptografia homomórfica em tensores
  • SyMPC - Uma biblioteca complementar de Computação Multiparte Segura para o Syft
  • Cloaked AI - Criptografia open-source que preserva propriedades para embeddings vetoriais
  • dstack - Framework de IA confidencial open-source para implantação segura de ML/LLM com isolamento reforçado por hardware e privacidade de dados
  • PrivacyRaven - biblioteca de teste de privacidade para sistemas de deep learning
  • PLOT4ai - Biblioteca de Privacidade de Ameaças para Inteligência Artificial — Uma biblioteca de modelagem de ameaças para ajudar você a construir IA responsável
  • OpenDP - Biblioteca principal para algoritmos de privacidade diferencial do projeto OpenDP — usada para construir pipelines de treinamento de ML que preservam a privacidade

Segurança de Dados e Cadeia de Suprimentos

  • datasig - Fingerprinting de conjuntos de dados para AIBOM
  • OWASP AIBOM - Lista de Materiais de IA
  • Trusera ai-bom - Lista de Materiais de IA — descubra todos os agentes, modelos e APIs de IA em sua infraestrutura

Habilidades de Segurança de IA Agêntica

  • Elastic Agent Skills - Coleção de habilidades para o assistente de IA da Elastic, permitindo investigações de segurança em linguagem natural em logs, traces e inteligência de ameaças
  • Ghost Security Skills - Habilidades e ferramentas de segurança de aplicativos (appsec) para agentes e Claude Code
  • tm_skills - Habilidades de agente para auxiliar na Modelagem Contínua de Ameaças
  • Trail of Bits Skills Marketplace - Habilidades do Trail of Bits para Claude Code em pesquisa de segurança, detecção de vulnerabilidades e fluxos de trabalho de auditoria
  • Semgrep Skills - Habilidades oficiais do Semgrep para Claude Code e outros assistentes de codificação com IA. Fornece recursos de varredura de segurança, análise de código e detecção de vulnerabilidades diretamente no seu fluxo de desenvolvimento assistido por IA.
  • claude-bug-bounty - Habilidade do Claude Code para caça a bug bounty assistida por IA. Automatiza reconhecimento e testes de IDOR, XSS, SSRF, OAuth, GraphQL e injeção em LLM com checklist de validação de 4 portões e geração de relatórios.
  • Anthropic Cybersecurity Skills - Mais de 734 habilidades estruturadas de cibersegurança para agentes de IA. Mapeadas para MITRE ATT&CK, padrão agentskills.io. Compatíveis com Claude Code, Copilot, Codex CLI, Cursor e Gemini CLI.
  • llm-sast-scanner - Habilidade SAST para agentes de codificação com IA (Claude Code, Codex, etc.) com detecção estruturada de vulnerabilidades em 34 classes. Inclui análise de taint source-to-sink, verificação por Judge para redução de falsos positivos e precisão/recall acima de 99% em benchmarks.
  • sast-skills - Coleção de habilidades de agente que transformam seu codificador de IA em um scanner SAST
  • pentest-ai-agents - 31 subagentes do Claude Code para segurança ofensiva. Subagentes de IA especializados em reconhecimento (recon), web, AD, nuvem, mobile, wireless, engenharia social, criação de payloads, engenharia reversa, encadeamento de exploits, engenharia de detecção, forense e geração de relatórios. Agentes de nível 2 podem executar ferramentas diretamente com portões de aprovação.

Modelos de IA Focados em Segurança

  • VulnLLM-R-7B - LLM de raciocínio especializado para detecção de vulnerabilidades. Usa raciocínio Chain-of-Thought para analisar fluxo de dados, fluxo de controle e contexto de segurança. Supera Claude-3.7-Sonnet e CodeQL em benchmarks de detecção de vulnerabilidades. Apenas 7B de parâmetros, sendo eficiente e rápido.
  • Foundation-Sec-8B-Reasoning - Llama-3.1-FoundationAI-SecurityLLM-8B-Reasoning é um modelo de linguagem de pesos abertos com 8 bilhões de parâmetros, ajustado por instruções e especializado em aplicações de cibersegurança. Ele estende o modelo base Foundation-Sec-8B com capacidades de seguir instruções e raciocínio.
  • Antares (1B & 350M) - Modelos agênticos para localização de vulnerabilidades da fdtn-ai. Disponíveis em variantes de 2B e 0.4B parâmetros, projetados para identificar e localizar vulnerabilidades em código de forma autônoma.
  • CyberSecQwen-4B - _Especialista em CTI com 4B de parâmetros, ajustado a partir do Qwen3-4B-Instruct-2507 para inteligência de ameaças cibernéticas.
  • Meta-SecAlign-8B / Meta-SecAlign-70B - Modelos Llama alinhados à segurança, ajustados para resistir a ataques de injeção de prompt, mantendo a hierarquia de instruções mesmo sob entradas adversárias
  • Lily-Cybersecurity-7B - Modelo de chat de 7B ajustado para cibersegurança, otimizado para análise de segurança, explicação de vulnerabilidades e tarefas de inteligência de ameaças.

Classificadores de Segurança e Detecção de Injeção de Prompt

  • Llama-Guard-4-12B - O mais recente classificador multimodal de segurança da Meta para detectar conteúdo nocivo em entradas e saídas de LLMs, nas modalidades de texto e imagem.
  • Llama-Prompt-Guard-2-86M - Modelo leve de 86M de parâmetros da Meta para detectar tentativas de injeção de prompt e jailbreak em pipelines de LLM em produção.
  • ShieldGemma-2B - Classificador de segurança de texto com 2B de parâmetros do Google para detectar conteúdo nocivo, construído sobre a arquitetura Gemma.
  • DeBERTa Prompt Injection Detector v2 - DeBERTa-v3-base da Protect AI ajustado para detecção de injeção de prompt, amplamente usado em pipelines de proteção de LLMs em produção.
  • Prompt Injection Sentinel - Modelo ModernBERT-large ajustado para classificação de injeção de prompt e jailbreak com baixa taxa de falsos positivos.
  • Nemotron 3.5 Content Safety - Modelo multimodal de segurança de conteúdo com 4B de parâmetros da NVIDIA que unifica proteções de entrada de texto+imagem, suporte multilíngue (mais de 35 idiomas), aplicação de políticas empresariais personalizáveis e raciocínio auditável em uma única chamada de inferência. Sucessor do Nemotron 3 Content Safety.
  • BrowseSafe - Modelo de segurança especializado para detectar ataques de injeção de prompt em agentes de navegador com IA. Alcança 90,4% de F1 no BrowseSafe-Bench, otimizado para classificação assíncrona em tempo real de conteúdo HTML bruto.

Modelos de Linguagem de Segurança Adaptados por Domínio

  • ATTACK-BERT - Modelo sentence-transformer para mapear textos de segurança para técnicas MITRE ATT&CK.
  • CySecBERT - Modelo BERT adaptado para tarefas de cibersegurança e CTI por meio de pré-treinamento específico de domínio.

Conjuntos de Dados

  • SafetyPrompts - Coleção selecionada de prompts relevantes para segurança, usada para avaliar propriedades de segurança e proteção de LLMs.
  • Do-Not-Answer - Conjunto de dados de prompts que LLMs responsáveis não devem responder, para avaliação de segurança e red teaming.
  • JailBreakV-28K - Conjunto de dados em larga escala com 28.000 prompts de jailbreak para benchmarking de segurança de LLMs.
  • CL4R1T4S - Prompts de sistema vazados do ChatGPT, Claude, Gemini, Grok, Perplexity, Cursor, Lovable, Replit e outras ferramentas de IA importantes. A maior coleção conhecida de prompts de sistema de produção para pesquisa de transparência e superfície de ataque.
  • LEAKHUB - Leaderboard de vazamentos de prompts de sistema — plataforma comunitária para acompanhar e classificar vazamentos de prompts de sistema em produtos de IA.
  • Leaked System Prompts - Coleção de prompts de sistema vazados de ferramentas de IA comerciais — útil para entender engenharia de prompt do mundo real e superfícies de ataque.
Baixar ferramenta
  • Agentic Radar - Scanner de segurança CLI de código aberto para fluxos de trabalho agenticos.
  • RAPTOR - Framework autônomo de pesquisa em segurança ofensiva/defensiva construído sobre o Claude Code. Encadeia análise estática (Semgrep, CodeQL), análise binária, validação de vulnerabilidades com tecnologia LLM, geração de exploits e escrita de patches. Orquestração multimodelo com análise de viabilidade baseada em Z3.
  • whistleblower - Ferramenta de segurança ofensiva para testar vazamento de prompt do sistema e descoberta de capacidades de uma aplicação de IA exposta por meio de API
  • promptmap - um scanner de injeção de prompt para aplicações LLM personalizadas
  • spikee - Kit simples de injeção de prompt para avaliação e exploração
  • ps-fuzz - Deixe seus aplicativos GenAI seguros e protegidos — Teste e reforce seu prompt do sistema
  • EasyEdit - Modifique as ground truths de um LLM
  • llm-attacks - Ataques Universais e Transferíveis em Modelos de Linguagem Alinhados
  • llm-security - Novas formas de quebrar LLMs integrados a aplicativos
  • Plexiglass - Um toolkit para detectar e proteger contra vulnerabilidades em Grandes Modelos de Linguagem (LLMs).
  • Prompt Hacking Resources - Uma lista de recursos selecionados para pessoas interessadas em Red Teaming de IA, Jailbreaking e Injeção de Prompt
  • Giskard - Avaliação e Testes de código aberto para sistemas de IA e LLM
  • blackice - O BlackIce é um toolkit containerizado de código aberto projetado para red teaming de modelos de IA, incluindo Grandes Modelos de Linguagem (LLMs) e modelos clássicos de aprendizado de máquina (ML). Inspirado pela conveniência e padronização do Kali Linux no teste de penetração tradicional, o BlackIce simplifica avaliações de segurança de IA ao fornecer uma imagem de contêiner reproduzível pré-configurada com ferramentas de avaliação especializadas.
  • ai-best-practices - Regras do Semgrep Pro para garantir que o código que usa LLMs siga as melhores práticas. 58 regras e 102 sub-regras cobrindo 6 provedores + MCP + hooks do Claude Code e do Cursor + LangChain. Detecta chaves de API embutidas no código (hardcoded), riscos de injeção de prompt, verificações de segurança ausentes e erros não tratados em 7 linguagens.
  • G0DM0D3 - Interface de chat multimodelo de código aberto para red teaming com mais de 50 modelos via OpenRouter. Inclui GODMODE CLASSIC (5 combinações de jailbreak), avaliação multimodelo ULTRAPLINIAN, mecanismo de perturbação de entrada Parseltongue com 33 técnicas de red team e amostragem adaptativa AutoTune para pesquisa de segurança de IA.
  • L1B3RT4S - Coleção de prompts de jailbreak e liberação para os principais LLMs. Biblioteca selecionada de prompts adversariais projetados para testar e avaliar os guardrails de segurança de IA no ChatGPT, Claude, Gemini e em outros modelos de fronteira.
  • OBLITERATUS - Toolkit de abliteração que remove comportamentos de recusa de LLMs de código aberto sem retreinamento. Modifica pesos do modelo para eliminar respostas de recusa alinhadas à segurança, permitindo pesquisa irrestrita do comportamento do modelo.
  • T3MP3ST - Plataforma autônoma de red teaming e meta-harness de segurança ofensiva multiagente. Coordena enxames de agentes de IA para testes adversariais coordenados de sistemas de IA de fronteira.
  • P4RS3LT0NGV3 - Toolkit universal de transformação de texto e criação de prompts. Suporta tradução, mutação, codificação/decodificação e engenharia adversarial de prompts para construção de payloads de jailbreak.
  • claude-secure-coding-rules - Regras de segurança de código aberto que orientam o Claude Code a gerar código seguro por padrão.
  • DeepTeam - Framework de red teaming de LLM com mais de 40 métodos de ataque, incluindo injeção de prompt, jailbreaking e envenenamento de RAG. Integra-se a pipelines de CI/CD.
  • CyberStrikeAI - Plataforma de testes de segurança nativa de IA construída em Go. Integra 100+ ferramentas de segurança com um mecanismo de orquestração inteligente, testes baseados em papéis com funções de segurança predefinidas, sistema de habilidades e gerenciamento abrangente do ciclo de vida. Usa o protocolo MCP e agentes de IA para automação de ponta a ponta, desde comandos conversacionais até a descoberta de vulnerabilidades.
  • HexStrikeAI - HexStrike AI MCP Agents é um servidor MCP avançado que permite que agentes de IA (Claude, GPT, Copilot, etc.) executem autonomamente 150+ ferramentas de cibersegurança para pentesting automatizado, descoberta de vulnerabilidades, automação de bug bounty e pesquisa de segurança.
  • mcp-for-security - Uma coleção de servidores Model Context Protocol para ferramentas de segurança populares como SQLMap, FFUF, NMAP, Masscan e outras. Integre testes de segurança e testes de penetração em fluxos de trabalho de IA.
  • mcp-security-hub - Uma coleção crescente de servidores MCP que levam ferramentas de segurança ofensiva para assistentes de IA. Nmap, Ghidra, Nuclei, SQLMap, Hashcat e outros.
  • Burp MCP Server - Servidor MCP para Burp
  • burpgpt - Uma extensão do Burp Suite que integra o GPT da OpenAI para realizar uma varredura passiva adicional para descobrir vulnerabilidades altamente específicas e permite executar análises baseadas em tráfego de qualquer tipo.
  • guardian-cli - Testes de segurança e scanner de vulnerabilidades alimentados por IA. O Guardian CLI é uma ferramenta inteligente de teste de segurança que aproveita a IA para automatizar testes de penetração, avaliação de vulnerabilidades e auditoria de segurança.
  • AutoPentestX - AutoPentestX – Ferramenta de pentesting automatizado e relatório de vulnerabilidades para Linux
  • HackGPT - Uma ferramenta que usa ChatGPT para hacking
  • nano-analyzer - Um scanner mínimo de vulnerabilidades zero-day alimentado por LLM, da AISLE.
  • clearwing - Scanner autônomo de vulnerabilidades e caçador de código-fonte construído sobre LangGraph.
  • Zen-AI-Pentest - Framework de teste de penetração alimentado por IA com varredura automatizada de vulnerabilidades, sistema multiagente e relatórios de conformidade. 72+ ferramentas de segurança, sandbox Docker, agentes ReAct, análise de caminhos de ataque.
  • Violin - Perfil de pentest agêntico e supervisionado do Hermes Agent: 31 playbooks baseados em habilidades (OWASP Top 10, API Top 10, LLM Top 10) com definição de escopo interativa, validação de escopo e portões de aprovação para reconhecimento autorizado, validação de exploits e relatórios.
  • NeuroSploit - Arcabouço de pentesting autônomo multimodelo em Rust. O pool de LLMs conduz reconhecimento, seleção de agentes, encadeamento de exploits e votação de validação entre modelos nos modos de engajamento black-box, white-box, grey-box e nuvem.
  • OpenHack - Scanner multiagente alimentado por IA que encontra autonomamente SQLi, XSS, IDOR e bypass de autenticação na sua base de código e, em seguida, verifica cada descoberta por meio de execução em sandbox e replay no navegador. No mesmo nível do Claude Opus 4.6 a um custo aproximadamente 40x menor.
  • PentAGI - Sistema multiagente totalmente autônomo para tarefas complexas de teste de penetração. Execução em sandbox Docker, suporte a múltiplos provedores de LLM (OpenAI, Anthropic, Gemini, Ollama, DeepSeek), integração com grafo de conhecimento e supervisão de agentes em tempo real.
  • V3SP3R - Companheiro de hacking de hardware alimentado por IA para o Flipper Zero. Interface em linguagem natural para controlar ataques de hardware, com integração com óculos inteligentes para operação mãos-livres.
  • Middleware de segurança para agentes de IA com defesa em 8 camadas contra injeção de prompt, exfiltração de dados e comandos perigosos. Zero dependências.
  • CodeGate - Um projeto de código aberto focado em privacidade que atua como uma camada de segurança no fluxo de trabalho de geração de código por IA de um desenvolvedor
  • Future AGI - Plataforma de código aberto auto-hospedável com guardrails em tempo real integrados para saídas inseguras (jailbreak, PII, injeção, toxicidade), avaliações, rastreamento, simulações e gateway para aplicações de LLM e agentes.
  • SkillSpector - Scanner de segurança para habilidades de agentes de IA. Detecta 64 padrões de vulnerabilidade em 16 categorias com análise estática + avaliação semântica opcional por LLM. Saída em vários formatos (JSON, Markdown, SARIF).
  • Project CodeGuard - Projeto de código aberto da CoSAI para proteger fluxos de trabalho de desenvolvimento assistido por IA. O CodeGuard fornece controles de segurança e guardrails para assistentes de codificação de IA, a fim de evitar que vulnerabilidades sejam introduzidas durante o desenvolvimento de código gerado por IA.
  • AgentLens - Ferramentas de observabilidade e replay de agentes para pesquisa de segurança e interpretabilidade de IA. Harness para executar trajetórias de agentes em múltiplas sessões, capturá-las no formato ATIF e rastrear mudanças de estado de arquivos entre sessões. Construído para estudar o comportamento de agentes LLM em interações multi-turn, multi-sessão e multiagente.
  • claude-code-devcontainer - Devcontainer em sandbox para executar Claude Code em modo bypass com segurança. Construído para auditorias de segurança e revisão de código não confiável.
  • claude-code-safety-net - Um plugin do Claude Code que atua como uma rede de segurança, capturando comandos destrutivos de git e filesystem antes que sejam executados
  • OneCLI - Cofre de credenciais de código aberto para agentes de IA. O gateway HTTP em Rust intercepta as requisições dos agentes e injeta credenciais de API de forma transparente, para que os agentes nunca detenham chaves brutas. Criptografia AES-256-GCM, escopo por agente, trilha de auditoria completa.
  • OpenSandbox - Runtime de sandbox seguro, rápido e extensível para agentes de IA. SDKs em várias linguagens, runtimes Docker/Kubernetes, isolamento com gVisor/Kata Containers/Firecracker. Projeto do CNCF Landscape.
  • openclaw-shield - Plugin de segurança para agentes OpenClaw - evita vazamento de segredos, exposição de PII e execução de comandos destrutivos
  • clawsec - Scanner de segurança e ferramenta de hardening para implantações OpenClaw. Fornece avaliações de segurança, auditoria de configuração e detecção de vulnerabilidades especificamente para configurações de gateway e agentes OpenClaw.
  • nanoclaw - Alternativa leve ao OpenClaw que roda em contêineres por segurança. Conecta-se ao WhatsApp, tem memória, tarefas agendadas e roda diretamente no Agents SDK da Anthropic. Primeiro assistente de IA a suportar Agent Swarms para equipes de agentes colaborativos.
  • secureclaw - Hardening automatizado de segurança para agentes de IA OpenClaw da Adversa AI. 51 verificações de auditoria, 12 regras comportamentais, 9 scripts, 4 bancos de dados de padrões. Cobertura completa do OWASP ASI Top 10. Protege contra injeção de prompt, roubo de credenciais, ataques à cadeia de suprimentos e vazamentos de privacidade.
  • defenseclaw - Camada de governança empresarial para OpenClaw da Cisco AI Defense. Varre habilidades, servidores MCP e plugins com CodeGuard SAST integrado, mecanismo de inspeção de chamadas de ferramentas, proxy de guardrails de LLM e integração com SIEM. Bloqueia automaticamente descobertas HIGH/CRITICAL.
  • microsandbox - Sandbox microVM leve para executar código gerado por IA não confiável com segurança e fortes garantias de isolamento
  • Adrian - Mecanismo de código aberto, alinhado à AARM, de monitoramento e controle de segurança em tempo de execução para agentes de IA da Secure Agentics. Analisa logs de atividade dos agentes (chamadas de ferramentas, ações, saídas) e rastros de raciocínio para detectar comportamento malicioso, desalinhado ou fora do escopo, com intervenção opcional durante a execução (modo auditoria vs bloqueio). SDKs em Python (LangChain/LangGraph) e TypeScript, totalmente auto-hospedável offline. Apache-2.0.
  • HOL Guard - Harness de segurança local-first que intercepta chamadas de ferramentas em agentes de codificação de IA (Codex, Claude Code, Cursor, Gemini, Copilot, Hermes, OpenCode) antes que arquivos sejam alterados ou a rede seja contatada. Hooks pré-ferramenta, central de aprovações, varredura consultiva da cadeia de suprimentos e sincronização opcional com Guard Cloud.
  • GhidraGPT - Integra modelos GPT ao Ghidra para análise automatizada de código, renomeação de variáveis, detecção de vulnerabilidades e geração de explicações.
  • IDAssist - Plugin de engenharia reversa alimentado por IA para IDA Pro. Integra análise com LLM à interface do IDA com grafos de conhecimento semântico, busca de documentos RAG e suporte a múltiplos provedores de LLM (OpenAI, Anthropic, Ollama, LiteLLM). Analisa funções, sugere renomeações e responde perguntas sobre o código.
  • ThreatForest - Plataforma agêntica de modelagem de ameaças construída sobre o framework Strands. Gera autonomamente árvores de ataque a partir de repositórios, mapeia etapas de ataque para técnicas MITRE ATT&CK e produz recomendações acionáveis de mitigação.
  • claude-grc-plugin - Plugin do Claude Code que transforma o Claude em um analista sênior de GRC. Mais de 72 arquivos de referência cobrindo 15 frameworks (NIST 800-53, FedRAMP, ISO 27001, SOC 2, etc.), 24 comandos de barra e conhecimento profundo de domínio para trabalho de conformidade federal e comercial.
  • Vigil SOC - Uma plataforma abrangente de operações de segurança open-source para agentes de IA, permitindo monitoramento em tempo real, detecção de ameaças e resposta a incidentes para ambientes alimentados por IA.
  • AiSOC - SOC open-source, auto-hospedável e alimentado por IA que ingere eventos de segurança, correlaciona-os, executa investigações autônomas orientadas por IA via LangGraph e apresenta resultados em um console unificado. Inclui trilha de auditoria completa das decisões do agente, harness público de avaliação no CI e 52 conectores próprios. Licenciado sob MIT.
  • Mantis Skills - Pipeline desacoplado, sequencial e focado em segurança do Google, composto por habilidades de IA agênticas para revisar, deduplicar, validar, reproduzir e corrigir vulnerabilidades autonomamente em bases de código de qualquer escala. Inclui um pipeline de múltiplos estágios (análise de arquitetura → modelagem de ameaças → pesquisa → revisão → reprodução → correção → calibração → reflexão), sandboxing integrado e um ciclo de aprendizado contínuo que se adapta em execuções iterativas. Suporta hardware RTL, IaC, pipelines de ML e binários compilados.