Skip to content
KitploitKITPLOIT
HerramientasBlog
Enviar
HerramientasBlog
Enviar

¡Herramientas de Hacking, PenTest y Ciberseguridad para tu Arsenal de Seguridad!

Kitploit es un directorio de herramientas de hacking, ciberseguridad y pentesting. Descubre las últimas actualizaciones de proyectos para encontrar vulnerabilidades, analizar sistemas, automatizar pruebas y fortalecer tu seguridad.

··Feeds·Contacto·Privacidad·© 2026 Kitploit

Directorio de Herramientas

Categorías

Ver todas las categorías
Loading categories
Herramientas/GitHubGitHub/ottosulin/awesome-ai-security
Escáneres de VulnerabilidadesPruebas de PenetraciónPrivacidadSeguridad de Cadena de SuministroAprendizaje y EducaciónRed TeamingRecursos CuradosSeguridad de IAAtaque Adversario
GitHubottosulin/awesome-ai-security

awesome-ai-security

Una colección de recursos increíbles relacionados con la seguridad de la IA

1.4k352hace 1 díaRevisado por Kitploit

Más Populares

Ver todos →

Descubre las herramientas más usadas por nuestra comunidad.

Explora todas las herramientas

Explora nuestra colección de herramientas

Ver todas las herramientas →
Compartir
Ver Repositorio

Awesome AI Security Awesome Track Awesome List

Una lista seleccionada de frameworks, estándares, recursos de aprendizaje y herramientas de código abierto relacionados con la seguridad en IA.

Si quieres contribuir, crea un PR o contacta conmigo @ottosulin.

Tabla de contenidos

  • Recursos de aprendizaje
    • Lecturas y guías
    • Cursos, laboratorios y CTFs
    • Podcasts
  • Gobernanza y gestión de riesgos
    • Frameworks
    • Estándares y verificación
    • Taxonomías, terminología y bases de datos de riesgos
    • Listas de comprobación y guías prácticas
  • Técnicas de ataque y red teaming
    • ML adversarial y modelos clásicos
    • Red teaming de LLM y GenAI
    • IA agéntica y herramientas de ataque MCP
    • Seguridad ofensiva asistida por IA
    • Esteganografía y canales encubiertos
  • Benchmarks y evaluaciones
  • Defensa y controles de seguridad
    • Salvaguardas de entrada/salida
    • Seguridad del runtime de agentes y sandboxing
    • Seguridad MCP
    • Escaneo de modelos y artefactos
    • Seguridad defensiva asistida por IA
    • Privacidad y computación confidencial
    • Seguridad de datos y cadena de suministro
  • Habilidades de seguridad para IA agéntica
  • Modelos de IA centrados en seguridad

Recursos de aprendizaje

Lecturas y guías

  • OWASP ML TOP 10
  • OWASP LLM TOP 10
  • OWASP AI Security and Privacy Guide
  • NIST AIRC - Centro de recursos de NIST para una IA fiable y responsable
  • The MLSecOps Top 10 by Institute for Ethical AI & Machine Learning
  • OWASP Multi-Agentic System Threat Modeling
  • OWASP: CheatSheet – A Practical Guide for Securely Using Third-Party MCP Servers 1.0
  • OWASP GenAI Threat & Defense Compass - Guía de referencia que mapea las amenazas de GenAI con los controles defensivos correspondientes.
  • NCSC Guidelines for Secure AI System Development - Guías prácticas coescritas por el NCSC (Reino Unido) y la CISA para el desarrollo seguro de IA, que cubren el diseño, el desarrollo, la implementación y la operación.

Cursos, laboratorios y CTFs

  • Damn Vulnerable MCP Server - Una implementación deliberadamente vulnerable del Protocolo de Contexto de Modelo (MCP) con fines educativos.
  • otto-support - Una implementación vulnerable de servidor MCP que usa mcp-go con autenticación por niveles (4 roles), 19 herramientas y un contenedor sandbox integrado con Claude Code para practicar la escalada de privilegios y el uso indebido de herramientas.
  • OWASP WrongSecrets LLM exercise
  • vulnerable-mcp-servers-lab - Una colección de servidores deliberadamente vulnerables para aprender a realizar pentesting de servidores MCP.
  • FinBot Agentic AI Capture The Flag (CTF) Application - FinBot es una plataforma interactiva de Capture The Flag (CTF) de seguridad agéntica que simula vulnerabilidades del mundo real en sistemas de IA agéntica mediante una aplicación simulada centrada en servicios financieros.
  • AI-Red-Teaming-Playground-Labs - Laboratorios de práctica de red teaming de IA para impartir entrenamientos de red teaming de IA, incluida la infraestructura.
  • Damn Vulnerable LLM Agent - Agente LLM intencionalmente vulnerable para aprender sobre inyección de prompts, uso indebido de herramientas y seguridad de agentes
    • LLMVault - Un laboratorio de seguridad de LLM de código abierto estilo CTF para aprender el OWASP LLM Top 10 mediante ejercicios prácticos vulnerables que cubren inyección de prompts, ataques RAG, fuga del prompt del sistema, uso indebido de herramientas y seguridad de agentes.

Podcasts

  • MLSecOps podcast
  • AI Security Podcast
  • AI Security Ops - Podcasts semanales de Black Hills Information Security que exploran cómo la IA transforma la ciberseguridad, cubriendo amenazas emergentes, herramientas y tendencias con conocimiento práctico y accionable.
  • GenAI Security podcast

Gobernanza y gestión de riesgos

Frameworks

  • NIST AI Risk Management Framework
  • ISO/IEC 42001 Artificial Intelligence Management System
  • ISO/IEC 23894:2023 Information technology — Artificial intelligence — Guidance on risk management
  • Google Secure AI Framework (SAIF)
  • ENISA Multilayer Framework for Good Cybersecurity Practices for AI
  • OWASP Artificial Intelligence Maturity Assessment
  • CSA AI Model Risk Framework
  • CSA Maestro AI Threat Modeling Framework
  • CSA AI Controls Matrix - Matriz de controles integral para sistemas de IA que cubre gobernanza, riesgo y cumplimiento.
  • OWASP Agentic AI Top 10 - Top 10 para IA agéntica que sirve como núcleo para el red teaming de OWASP y CSA.

Estándares y verificación

  • OWASP AI Security Verification Standard
  • OWASP Agent Name Service
  • OWASP Agent Observability Standard
  • AI Verify - Framework y kit de herramientas de pruebas de IA respaldado por el gobierno de Singapur para verificar las propiedades de los sistemas de IA frente a marcos de gobernanza.

Taxonomías, terminología y bases de datos de riesgos

  • NIST AI 100-2e2023 - Taxonomía y terminología del aprendizaje automático adversarial
  • MITRE ATLAS
    • ATLAS Knowledge Base Agent - Asistente de IA de código abierto para explorar la base de conocimiento de ATLAS con lenguaje natural, acceso a servidores MCP y flujos de trabajo de agentes personalizables.
  • AVIDML
  • MIT AI Risk Repository
  • AI Incident Database
  • ISO/IEC 22989:2022 Information technology — Artificial intelligence — Artificial intelligence concepts and terminology
  • NIST AI Glossary
  • The Arcanum Prompt Injection Taxonomy - Sistema integral de clasificación de ataques de inyección de prompts que cubre intenciones de ataque, técnicas, evasiones y vectores de entrada. Categoriza objetivos, métodos, técnicas de ofuscación y superficies de ataque para los ataques de inyección de prompts.
  • CSA LLM Threats Taxonomy
  • OWASP AI Vulnerability Scoring System (AIVSS) - Sistema de puntuación para vulnerabilidades específicas de IA que extiende los conceptos de CVSS a las dimensiones de riesgo de la IA.

Listas de comprobación y guías prácticas

  • OWASP LLM Applications Cybersecurity and Governance Checklist
  • OWASP AI Security and Privacy Guide
  • OWASP LLM and Generative AI Security Center of Excellence Guide
  • OWASP Agentic AI – Threats and Mitigations
  • OWASP AI Security Solutions Landscape
  • OWASP GenAI Incident Response Guide
  • OWASP LLM and GenAI Data Security Best Practices
  • OWASP Securing Agentic AI Applications
  • OWASP GenAI Red Teaming Guide

Técnicas de ataque y red teaming

ML adversarial y modelos clásicos

  • Adversarial Robustness Toolkit - ART se centra en las amenazas de Evasión (cambiar el comportamiento del modelo mediante modificaciones de entrada), Envenenamiento (controlar un modelo mediante modificaciones de los datos de entrenamiento), Extracción (robar un modelo mediante consultas) e Inferencia (atacar la privacidad de los datos de entrenamiento)
  • cleverhans - Una biblioteca de ejemplos adversariales para construir ataques, desarrollar defensas y comparar ambos
  • foolbox - Un conjunto de herramientas de Python para crear ejemplos adversariales que engañan a las redes neuronales en PyTorch, TensorFlow y JAX
  • TextAttack - Un framework de Python para ataques adversariales, aumento de datos y entrenamiento de modelos en PLN
  • Counterfit - Capa de automatización genérica para evaluar la seguridad de los sistemas de aprendizaje automático
  • OffsecML Playbook - Una colección de TTP ofensivos y adversariales con pruebas de concepto
  • BadDiffusion - Repositorio oficial para reproducir el artículo "How to Backdoor Diffusion Models?" publicado en CVPR 2023
  • secml-torch - SecML-Torch: una biblioteca para la evaluación de la robustez de los modelos de aprendizaje profundo

Red teaming de LLM y GenAI

  • garak - herramienta de sondeo de seguridad para LLMs
  • ai-scanner - Aplicación web de código abierto para evaluaciones de seguridad de modelos de IA, construida sobre NVIDIA garak. Incluye 179 sondas, escaneo multiobjetivo, escaneos programados, puntuación ASR e integración con SIEM.
  • promptfoo - Prueba tus prompts, agentes y RAGs. Red teaming, pentesting y escaneo de vulnerabilidades para LLMs. Compara el rendimiento de GPT, Claude, Gemini, Llama y más. Configuraciones declarativas simples con integración en línea de comandos y CI/CD.
  • PyRIT - Python Risk Identification Tool para IA generativa (PyRIT) es un framework de código abierto creado para capacitar a profesionales e ingenieros de seguridad a identificar de forma proactiva los riesgos en los sistemas de IA generativa.
  • PurpleLlama - Conjunto de herramientas para evaluar y mejorar la seguridad de los LLMs.
  • augustus - Framework de pruebas de seguridad para LLMs que detecta inyección de prompts, jailbreaks y ataques adversariales. Más de 190 sondas, 28 proveedores, un único binario de Go. Listo para producción con escaneo concurrente, limitación de tasa y lógica de reintentos.
  • FuzzyAI - Una potente herramienta para fuzzing automatizado de LLMs. Está diseñada para ayudar a desarrolladores e investigadores de seguridad a identificar y mitigar posibles jailbreaks en sus API de LLM.
  • EasyJailbreak - Un framework de Python fácil de usar para generar prompts adversariales de jailbreak.
  • gptfuzz - Repositorio oficial de GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts
  • llamator - Framework para probar vulnerabilidades de los modelos de lenguaje grandes (LLM).
  • agentic_security - Escáner de vulnerabilidades de LLM agénticos / kit de red teaming de IA

IA agéntica y herramientas de ataque MCP

  • RAMPART - Framework de pruebas de seguridad nativo de pytest para aplicaciones de IA agéntica.
  • AI-Infra-Guard - Una plataforma de red teaming de IA integral, inteligente y fácil de usar desarrollada por Tencent Zhuque Lab. Integra módulos de Infra Scan, MCP Scan y Jailbreak Evaluation, y ofrece una interfaz web con un clic, API REST e implementación basada en Docker para una evaluación integral de la seguridad de la IA.
  • OpenPromptInjection - Un benchmark para ataques y defensas de inyección de prompts
  • AIMap - Plataforma de descubrimiento y pruebas de seguridad a escala de internet para infraestructura expuesta de agentes de IA. Consulta Shodan en busca de servidores MCP, instancias de Ollama, proxies vLLM/LiteLLM y más; luego toma huellas, puntúa el riesgo y lanza suites de ataque específicas del protocolo con resultados en streaming en tiempo real.### Seguridad Ofensiva Asistida por IA
  • PentestGPT - Una herramienta de pruebas de penetración impulsada por GPT
  • HackingBuddyGPT - Ayudando a los hackers éticos a usar LLMs en 50 líneas de código o menos
  • cai - IA de ciberseguridad (CAI), una inteligencia artificial de código abierto lista para Bug Bounty (paper)
  • shannon - Pentester de IA totalmente autónomo para aplicaciones web y APIs de Keygraph. Pruebas de seguridad de caja blanca que analizan el código fuente, identifican vectores de ataque y ejecutan exploits reales. 96.15% de tasa de éxito (100/104 exploits) en el benchmark XBOW.
  • strix - Strix son agentes de IA autónomos que actúan igual que hackers reales: ejecutan tu código dinámicamente, encuentran vulnerabilidades y las validan mediante pruebas de concepto reales
  • redamon - Framework de red team agéntico impulsado por IA que automatiza operaciones de seguridad ofensiva, desde el reconocimiento hasta la explotación y la post-explotación, sin intervención humana.

Esteganografía y Canales Encubiertos

  • ST3GG - Suite de esteganografía todo-en-uno con codificación multicapa, esteganografía de imagen y audio, y herramientas de esteganálisis para detectar datos ocultos en medios generados por IA.

Benchmarks y Evaluaciones

  • ISC-Bench - Colapso de Seguridad Interna: jailbreak de cualquier LLM de frontera (Claude Opus 4.6, GPT-5.4) en pass@3 mediante finalización de tareas normales — sin prompting adversarial. Caja negra, transversal a dominios y ciencias. Nuevo modo de fallo. [Paper]
  • jailbreakbench - JailbreakBench: Un benchmark abierto de robustez para el jailbreak de modelos de lenguaje [NeurIPS 2024 Datasets and Benchmarks Track]
  • AgentDojo - Un entorno dinámico para evaluar ataques y defensas para agentes LLM.
  • AIRTBench - Repositorio de código para: AIRTBench: Midiendo las capacidades autónomas de red teaming de IA en modelos de lenguaje
  • HackingBuddyGPT benchmark dataset - Dataset de benchmark para pentesting automatizado
  • AgentDoG - AgentDoG es un framework de evaluación y protección consciente del riesgo para agentes autónomos. Se centra en la evaluación de riesgos a nivel de trayectoria, con el objetivo de determinar si la trayectoria de ejecución de un agente contiene riesgos de seguridad en diversos escenarios de aplicación.
  • AICGSecEval - El benchmark integral de evaluación de Tencent para la seguridad en la generación de código por IA, que cubre 10 categorías CWE con un arnés de pruebas automatizado
  • Inspect - Framework para evaluaciones de grandes modelos de lenguaje del Instituto de Seguridad de IA del Reino Unido. Más de 200 evaluaciones preconstruidas que cubren ingeniería de prompts, uso de herramientas, diálogo multiturno y puntuación calificada por modelos.
  • sec-code-bench - El benchmark de Alibaba para evaluar las capacidades de seguridad de código de los LLM en 17 categorías de vulnerabilidades y 4 lenguajes de programación

Defensa y Controles de Seguridad

Guardarraíles de Entrada/Salida

  • NeMo-Guardrails - NeMo Guardrails es un kit de herramientas de código abierto para añadir fácilmente guardarraíles programables a sistemas conversacionales basados en LLM.
  • LlamaFirewall - LlamaFirewall es un framework diseñado para detectar y mitigar riesgos de seguridad centrados en IA, con soporte para múltiples capas de entradas y salidas, como el chat típico de LLM y operaciones agénticas de múltiples pasos más avanzadas.
  • llm-guard - LLM Guard de Protect AI es una herramienta integral diseñada para fortalecer la seguridad de los Grandes Modelos de Lenguaje (LLMs).
  • Guardrails.ai - Guardrails es un paquete de Python que permite al usuario añadir garantías de estructura, tipo y calidad a las salidas de los grandes modelos de lenguaje (LLMs)
  • TrustGate - Firewall de Aplicaciones Generativas (GAF) para detectar, prevenir y bloquear ataques contra aplicaciones GenAI
  • ZenGuard AI - La capa de confianza más rápida para agentes de IA
  • LocalMod - API de moderación de contenido autoalojada con detección de inyección de prompts, filtrado de toxicidad, detección de PII y clasificación NSFW. Funciona 100% sin conexión.
  • DynaGuard - Un modelo de guardarraíl dinámico con políticas definidas por el usuario
  • AprielGuard - Modelo de salvaguarda de seguridad de 8B parámetros
  • Safe Zone - Safe Zone es un motor de código abierto de detección de PII y guardarraíles que evita que los datos sensibles se filtren a los LLM y a APIs de terceros.
  • superagent - Superagent proporciona guardarraíles entrenados específicamente que hacen que los agentes de IA sean seguros y cumplan las normativas.
  • ShellWard -

Seguridad del Runtime de Agentes y Sandboxing

  • OpenShell - OpenShell es el runtime seguro y privado para agentes de IA autónomos. Proporciona entornos de ejecución en sandbox regidos por políticas YAML declarativas que impiden el acceso no autorizado a archivos, la exfiltración de datos y la actividad de red no controlada.
  • OpenSandbox - Runtime de sandbox seguro, rápido y extensible para agentes de IA. SDKs multiidioma, runtimes Docker/Kubernetes, aislamiento con gVisor/Kata Containers/Firecracker. Proyecto CNCF Landscape.
  • CubeSandbox - Sandbox instantáneo, concurrente, seguro y ligero para agentes de IA de Tencent Cloud. Arranque en frío inferior a 60 ms, sobrecarga de memoria <5MB, compatible con SDK E2B. Construido sobre RustVMM y KVM con aislamiento extremo (kernel dedicado + eBPF).
  • Aegis - EDR de código abierto para agentes de IA de Antropos. Supervisa procesos, archivos, red y comportamiento de agentes de IA autónomos en tiempo real. Sin telemetría, sin nube, todo permanece local.
  • Microsoft Agent Governance Toolkit - AI Agent Governance Toolkit de Microsoft: aplicación de políticas, identidad de confianza cero, sandboxing de ejecución e ingeniería de fiabilidad para agentes de IA autónomos. Cubre 10/10 del OWASP Agentic Top 10.
  • agentfield - Plano de control de código abierto para sistemas de agentes con identidad criptográfica, aplicación de políticas y observabilidad apta para auditorías.
  • leash - Leash envuelve a los agentes de codificación de IA en contenedores y supervisa su actividad.
  • vibekit - Ejecuta Claude Code, Gemini, Codex — o cualquier agente de codificación — en un sandbox limpio y aislado con redacción de datos sensibles y observabilidad integradas.
  • pipelock - Arnés de seguridad para agentes de IA: proxy de salida con escaneo DLP, protección SSRF, escaneo de respuestas MCP y monitoreo de integridad del espacio de trabajo
  • skill-scanner -

Seguridad de MCP

  • MCP-Security-Checklist - Una lista de verificación de seguridad integral para herramientas de IA basadas en MCP. Creada por SlowMist para proteger los ecosistemas de plugins de LLM.
  • Awesome-MCP-Security - Todo lo que necesitas saber sobre la seguridad del Model Context Protocol (MCP).
  • secure-mcp-gateway - Esta pasarela MCP segura está construida con autenticación, descubrimiento automático de herramientas, caché y aplicación de guardarraíles.
  • mcp-context-protector - context-protector es un envoltorio de seguridad para servidores MCP que aborda los riesgos asociados con la ejecución de servidores MCP no confiables, incluidos los saltos de línea, los cambios inesperados en la configuración del servidor y otros ataques de inyección de prompts
  • mcp-guardian - MCP Guardian gestiona el acceso de tu asistente LLM a los servidores MCP, dándote control en tiempo real de la actividad de tu LLM.
  • MCP Audit VSCode Extension - Audita y registra centralizadamente todas las llamadas a herramientas MCP de GitHub Copilot en VSCode con facilidad.
  • MCP-Scan - Una herramienta de escaneo de seguridad para servidores MCP
  • ATR (Agent Threat Rules) - Reglas de detección de código abierto para amenazas a agentes de IA. 108 reglas regex que cubren inyección de prompts, envenenamiento de herramientas y exfiltración de credenciales en 9 categorías. Usadas por Cisco AI Defense. Licencia MIT.
  • MCPProxy - Proxy MCP local-first con cuarentena SHA-256 por herramienta para detectar ataques de envenenamiento de herramientas y rug-pull, escaneo automático de datos sensibles y secretos en las llamadas a herramientas, aislamiento en sandbox Docker para servidores MCP no confiables y OAuth 2.1. Licencia MIT.

Escaneo de Modelos y Artefactos

  • modelscan - ModelScan es un proyecto de código abierto de Protect AI que escanea modelos para determinar si contienen código inseguro.
  • picklescan - Escáner de seguridad que detecta archivos Python Pickle que realizan acciones sospechosas
  • fickling - Un descompilador y analizador estático de pickling de Python
  • medusa - Escáner de seguridad AI-first con más de 74 analizadores, más de 180 reglas de seguridad para agentes de IA y reducción inteligente de falsos positivos. Compatible con todos los lenguajes. Detección de CVE para React2Shell y RCE en mcp-remote.
  • julius - Herramienta de fingerprinting de servicios LLM para profesionales de la seguridad. Detecta más de 32 servicios de IA (Ollama, vLLM, LiteLLM, Hugging Face TGI, etc.) durante pruebas de penetración y descubrimiento de superficie de ataque. Utiliza fingerprinting de servicios basado en HTTP para identificar la infraestructura del servidor.
  • a2a-scanner - Escanea agentes A2A en busca de posibles amenazas y problemas de seguridad### Seguridad Defensiva Asistida por IA
  • Claude Code Security Review - Una GitHub Action de revisión de seguridad impulsada por IA que utiliza Claude para analizar los cambios de código en busca de vulnerabilidades de seguridad.
  • deepsec - Escáner de vulnerabilidades impulsado por agentes de Vercel Labs para encontrar problemas difíciles de detectar en bases de código grandes mediante agentes de codificación. Admite escaneo en paralelo, revisión de diffs de PR e integración con CI/CD.
  • defending-code-reference-harness - Implementación de referencia para el descubrimiento y la remediación autónomos de vulnerabilidades mediante Claude. Incluye habilidades de modelado de amenazas, escaneo, triaje y aplicación de parches.
  • Visa Vulnerability Agentic Harness - Pipeline SAST agéntico con 11 etapas, desde la detección hasta la remediación impulsada por LLM y la validación adversarial. Genera SARIF y se integra con Claude Code, Copilot y Gemini.

Privacidad y Computación Confidencial

  • Python Differential Privacy Library
  • Diffprivlib - La biblioteca de privacidad diferencial de IBM
  • TenSEAL - Una biblioteca para realizar operaciones de cifrado homomórfico sobre tensores
  • SyMPC - Una biblioteca complementaria de computación multiparte segura para Syft
  • Cloaked AI - Cifrado de código abierto que preserva propiedades para embeddings vectoriales
  • dstack - Framework de IA confidencial de código abierto para el despliegue seguro de ML/LLM con aislamiento reforzado por hardware y privacidad de datos
  • PrivacyRaven - biblioteca de pruebas de privacidad para sistemas de aprendizaje profundo
  • PLOT4ai - Biblioteca de privacidad de amenazas para inteligencia artificial — Una biblioteca de modelado de amenazas para ayudarte a construir IA responsable
  • OpenDP - Biblioteca central para algoritmos de privacidad diferencial del proyecto OpenDP — utilizada para construir pipelines de entrenamiento de ML que preservan la privacidad

Seguridad de Datos y Cadena de Suministro

  • datasig - Huella digital de conjuntos de datos para AIBOM
  • OWASP AIBOM - Lista de materiales de IA
  • Trusera ai-bom - Lista de materiales de IA — descubre cada agente de IA, modelo y API en tu infraestructura

Habilidades de Seguridad para IA Agéntica

  • Elastic Agent Skills - Colección de habilidades para el asistente de IA de Elastic, que permite realizar investigaciones de seguridad en lenguaje natural en logs, trazas e inteligencia de amenazas
  • Ghost Security Skills - Habilidades y herramientas de seguridad de aplicaciones para agentes (appsec) para Claude Code
  • tm_skills - Habilidades de agente para ayudar con el modelado continuo de amenazas
  • Trail of Bits Skills Marketplace - Habilidades de Trail of Bits para Claude Code orientadas a la investigación de seguridad, la detección de vulnerabilidades y los flujos de trabajo de auditoría
  • Semgrep Skills - Habilidades oficiales de Semgrep para Claude Code y otros asistentes de codificación con IA. Aporta capacidades de escaneo de seguridad, análisis de código y detección de vulnerabilidades directamente en tu flujo de trabajo de desarrollo asistido por IA.
  • claude-bug-bounty - Habilidad de Claude Code para la caza de bug bounties asistida por IA. Automatiza las pruebas de reconocimiento, IDOR, XSS, SSRF, OAuth, GraphQL e inyección de LLM con una lista de verificación de validación de 4 compuertas y generación de informes.
  • Anthropic Cybersecurity Skills - Más de 734 habilidades de ciberseguridad estructuradas para agentes de IA. Mapeadas a MITRE ATT&CK, estándar agentskills.io. Compatibles con Claude Code, Copilot, Codex CLI, Cursor y Gemini CLI.
  • llm-sast-scanner - Habilidad SAST para agentes de codificación con IA (Claude Code, Codex, etc.) con detección estructurada de vulnerabilidades en 34 clases. Incluye análisis de taint source-to-sink, verificación Judge para reducir falsos positivos y precisión/recall superior al 99% en benchmarks.
  • sast-skills - Colección de habilidades de agente que convierten tu codificador de IA en un escáner SAST
  • pentest-ai-agents - 31 subagentes de Claude Code para seguridad ofensiva. Subagentes de IA especializados en reconocimiento, web, AD, nube, móvil, redes inalámbricas, ingeniería social, creación de payloads, ingeniería inversa, encadenamiento de exploits, ingeniería de detección, forense y generación de informes. Los agentes de nivel 2 pueden ejecutar herramientas directamente con compuertas de aprobación.

Modelos de IA Centrados en Seguridad

  • VulnLLM-R-7B - LLM de razonamiento especializado para la detección de vulnerabilidades. Utiliza razonamiento Chain-of-Thought para analizar el flujo de datos, el flujo de control y el contexto de seguridad. Supera a Claude-3.7-Sonnet y CodeQL en benchmarks de detección de vulnerabilidades. Con solo 7B de parámetros, resulta eficiente y rápido.
  • Foundation-Sec-8B-Reasoning - Llama-3.1-FoundationAI-SecurityLLM-8B-Reasoning es un modelo de lenguaje de pesos abiertos, de 8 mil millones de parámetros, ajustado por instrucciones y especializado en aplicaciones de ciberseguridad. Extiende el modelo base Foundation-Sec-8B con capacidades de seguimiento de instrucciones y razonamiento.
  • Antares (1B & 350M) - Modelos agénticos para la localización de vulnerabilidades de fdtn-ai. Disponibles en variantes de 2B y 0.4B de parámetros, diseñados para identificar y localizar vulnerabilidades en el código de forma autónoma.
  • CyberSecQwen-4B - _Especialista en CTI de 4B de parámetros, ajustado a partir de Qwen3-4B-Instruct-2507 para inteligencia de amenazas de ciberseguridad.
  • Meta-SecAlign-8B / Meta-SecAlign-70B - Modelos Llama alineados con la seguridad, ajustados para resistir ataques de inyección de prompts y mantener la jerarquía de instrucciones incluso bajo entradas adversariales
  • Lily-Cybersecurity-7B - Modelo de chat de 7B ajustado para ciberseguridad, optimizado para el análisis de seguridad, la explicación de vulnerabilidades y las tareas de inteligencia de amenazas.

Clasificadores de Seguridad y Detección de Inyección de Prompts

  • Llama-Guard-4-12B - El clasificador de seguridad multimodal más reciente de Meta para detectar contenido dañino en las entradas y salidas de LLM en las modalidades de texto e imagen.
  • Llama-Prompt-Guard-2-86M - Modelo ligero de 86M de parámetros de Meta para detectar intentos de inyección de prompts y jailbreak en pipelines de LLM en producción.
  • ShieldGemma-2B - Clasificador de seguridad de texto de 2B de parámetros de Google para detectar contenido dañino, construido sobre la arquitectura Gemma.
  • DeBERTa Prompt Injection Detector v2 - DeBERTa-v3-base de Protect AI ajustado para la detección de inyección de prompts, ampliamente utilizado en pipelines de salvaguarda de LLM en producción.
  • Prompt Injection Sentinel - Modelo ModernBERT-large ajustado para la clasificación de inyección de prompts y jailbreaks con una baja tasa de falsos positivos.
  • Nemotron 3.5 Content Safety - El modelo multimodal de seguridad de contenido de 4B de parámetros de NVIDIA que unifica salvaguardas de entrada de texto+imagen, soporte multilingüe (más de 35 idiomas), aplicación personalizable de políticas empresariales y razonamiento auditable en una única llamada de inferencia. Sucesor de Nemotron 3 Content Safety.
  • BrowseSafe - Modelo de seguridad especializado para detectar ataques de inyección de prompts en agentes de navegador de IA. Alcanza una puntuación F1 del 90,4% en BrowseSafe-Bench, optimizado para la clasificación asíncrona en tiempo real de contenido HTML sin procesar.

Modelos de Lenguaje de Seguridad Adaptados al Dominio

  • ATTACK-BERT - Modelo sentence-transformer para mapear texto de seguridad a técnicas MITRE ATT&CK.
  • CySecBERT - Modelo BERT adaptado para tareas de ciberseguridad y CTI mediante preentrenamiento específico del dominio.

Conjuntos de Datos

  • SafetyPrompts - Colección curada de prompts relevantes para la seguridad, destinada a evaluar las propiedades de seguridad y protección de los LLM.
  • Do-Not-Answer - Conjunto de datos de prompts que los LLM responsables no deberían responder, para la evaluación de seguridad y el red teaming.
  • JailBreakV-28K - Conjunto de datos a gran escala de 28.000 prompts de jailbreak para evaluar comparativamente la seguridad de los LLM.
  • CL4R1T4S - Prompts de sistema filtrados de ChatGPT, Claude, Gemini, Grok, Perplexity, Cursor, Lovable, Replit y otras herramientas de IA importantes. La mayor colección conocida de prompts de sistema de producción para la investigación de la transparencia y la superficie de ataque.
  • LEAKHUB - Leaderboard de fugas de prompts de sistema — plataforma comunitaria para rastrear y clasificar las fugas de prompts de sistema en los productos de IA.
  • Leaked System Prompts - Colección de prompts de sistema filtrados de herramientas de IA comerciales — útil para comprender la ingeniería de prompts del mundo real y las superficies de ataque.
Descargar herramienta
  • Agentic Radar - Escáner de seguridad CLI de código abierto para flujos de trabajo agénticos.
  • RAPTOR - Framework autónomo de investigación de seguridad ofensiva/defensiva construido sobre Claude Code. Encadena análisis estático (Semgrep, CodeQL), análisis binario, validación de vulnerabilidades impulsada por LLM, generación de exploits y escritura de parches. Orquestación multimodelo con análisis de viabilidad basado en Z3.
  • whistleblower - Herramienta de seguridad ofensiva para probar la fuga del prompt del sistema y el descubrimiento de capacidades de una aplicación de IA expuesta a través de una API
  • promptmap - un escáner de inyección de prompts para aplicaciones LLM personalizadas
  • spikee - Kit simple de inyección de prompts para evaluación y explotación
  • ps-fuzz - Haz que tus aplicaciones GenAI sean seguras — prueba y refuerza tu prompt del sistema
  • EasyEdit - Modifica las verdades fundamentales de un LLM
  • llm-attacks - Ataques universales y transferibles contra modelos de lenguaje alineados
  • llm-security - Nuevas formas de romper LLMs integrados en aplicaciones
  • Plexiglass - Un kit de herramientas para detectar vulnerabilidades en los modelos de lenguaje grandes (LLMs) y proteger contra ellas.
  • Prompt Hacking Resources - Una lista de recursos seleccionados para personas interesadas en red teaming de IA, jailbreaking e inyección de prompts
  • Giskard - Evaluación y pruebas de código abierto para sistemas de IA y LLM
  • blackice - BlackIce es un kit de herramientas contenerizado de código abierto diseñado para el red teaming de modelos de IA, incluidos los modelos de lenguaje grandes (LLMs) y los modelos clásicos de aprendizaje automático (ML). Inspirado en la comodidad y estandarización de Kali Linux en el pentesting tradicional, BlackIce simplifica las evaluaciones de seguridad de la IA al proporcionar una imagen de contenedor reproducible y preconfigurada con herramientas de evaluación especializadas.
  • ai-best-practices - Reglas de Semgrep Pro para garantizar que el código que usa LLMs siga las mejores prácticas. 58 reglas y 102 subreglas que cubren 6 proveedores + MCP + hooks de Claude Code y Cursor + LangChain. Detecta claves API hardcodeadas, riesgos de inyección de prompts, comprobaciones de seguridad faltantes y errores no controlados en 7 lenguajes.
  • G0DM0D3 - Interfaz de chat multimodelo de código abierto para red teaming con más de 50 modelos a través de OpenRouter. Incluye GODMODE CLASSIC (5 combos de jailbreak), evaluación multimodelo ULTRAPLINIAN, motor de perturbación de entrada Parseltongue con 33 técnicas de red teaming y muestreo adaptativo AutoTune para la investigación de la seguridad de la IA.
  • L1B3RT4S - Colección de prompts de jailbreak y liberación para los principales LLMs. Biblioteca seleccionada de prompts adversariales diseñados para probar y evaluar las salvaguardas de seguridad de la IA en ChatGPT, Claude, Gemini y otros modelos de vanguardia.
  • OBLITERATUS - Kit de herramientas de abliteración que elimina los comportamientos de rechazo de los LLMs de código abierto sin necesidad de reentrenamiento. Modifica los pesos del modelo para eliminar las respuestas de rechazo alineadas con la seguridad, lo que permite investigar el comportamiento del modelo sin restricciones.
  • T3MP3ST - Plataforma autónoma de red teaming y meta-harness de seguridad ofensiva multiagente. Coordina enjambres de agentes de IA para realizar pruebas adversariales coordinadas de sistemas de IA de vanguardia.
  • P4RS3LT0NGV3 - Kit de herramientas universal de transformación de texto y creación de prompts. Admite traducción, mutación, codificación/decodificación e ingeniería adversarial de prompts para la construcción de payloads de jailbreak.
  • claude-secure-coding-rules - Reglas de seguridad de código abierto que guían a Claude Code para generar código seguro por defecto.
  • DeepTeam - Framework de red teaming para LLMs con más de 40 métodos de ataque, incluidos inyección de prompts, jailbreaking y envenenamiento de RAG. Se integra con pipelines de CI/CD.
  • CyberStrikeAI - Plataforma de pruebas de seguridad nativa de IA construida en Go. Integra más de 100 herramientas de seguridad con un motor de orquestación inteligente, pruebas basadas en roles con roles de seguridad predefinidos, sistema de habilidades y gestión integral del ciclo de vida. Utiliza el protocolo MCP y agentes de IA para la automatización de extremo a extremo, desde comandos conversacionales hasta el descubrimiento de vulnerabilidades.
  • HexStrikeAI - HexStrike AI MCP Agents es un servidor MCP avanzado que permite a los agentes de IA (Claude, GPT, Copilot, etc.) ejecutar autónomamente más de 150 herramientas de ciberseguridad para pentesting automatizado, descubrimiento de vulnerabilidades, automatización de bug bounty e investigación de seguridad.
  • mcp-for-security - Una colección de servidores Model Context Protocol para herramientas de seguridad populares como SQLMap, FFUF, NMAP, Masscan y más. Integra pruebas de seguridad y pruebas de penetración en flujos de trabajo de IA.
  • mcp-security-hub - Una colección creciente de servidores MCP que acerca herramientas de seguridad ofensiva a los asistentes de IA. Nmap, Ghidra, Nuclei, SQLMap, Hashcat y más.
  • Burp MCP Server - Servidor MCP para Burp
  • burpgpt - Una extensión de Burp Suite que integra GPT de OpenAI para realizar un escaneo pasivo adicional y descubrir vulnerabilidades altamente personalizadas, y que permite ejecutar análisis basados en tráfico de cualquier tipo.
  • guardian-cli - Escáner de vulnerabilidades y pruebas de seguridad impulsado por IA. Guardian CLI es una herramienta inteligente de pruebas de seguridad que aprovecha la IA para automatizar pruebas de penetración, evaluación de vulnerabilidades y auditoría de seguridad.
  • AutoPentestX - AutoPentestX – Herramienta automatizada de pentesting y reporte de vulnerabilidades para Linux
  • HackGPT - Una herramienta que usa ChatGPT para hackear
  • nano-analyzer - Un escáner de vulnerabilidades zero-day mínimo impulsado por LLM de AISLE.
  • clearwing - Escáner de vulnerabilidades autónomo y buscador de código fuente construido sobre LangGraph.
  • Zen-AI-Pentest - Framework de pruebas de penetración impulsado por IA con escaneo automatizado de vulnerabilidades, sistema multiagente y reporte de cumplimiento. Más de 72 herramientas de seguridad, sandbox Docker, agentes ReAct, análisis de rutas de ataque.
  • Violin - Perfil de pentest agéntico y supervisado de Hermes Agent: 31 playbooks basados en habilidades (OWASP Top 10, API Top 10, LLM Top 10) con alcance interactivo, validación de alcance y compuertas de aprobación para reconocimiento autorizado, validación de exploits y reportes.
  • NeuroSploit - Arnés de pentesting autónomo multimodelo en Rust. El pool de LLM impulsa el reconocimiento, la selección de agentes, el encadenamiento de exploits y la votación de validación entre modelos en modos de engagement de caja negra, caja blanca, caja gris y nube.
  • OpenHack - Escáner multiagente impulsado por IA que encuentra autónomamente SQLi, XSS, IDOR y bypass de autenticación en tu código, y luego verifica cada hallazgo mediante ejecución en sandbox y reproducción en navegador. A la par de Claude Opus 4.6 con un costo aproximadamente 40 veces menor.
  • PentAGI - Sistema multiagente totalmente autónomo para tareas complejas de pruebas de penetración. Ejecución en sandbox Docker, soporte de LLM multiproveedor (OpenAI, Anthropic, Gemini, Ollama, DeepSeek), integración de grafo de conocimiento y supervisión de agentes en tiempo real.
  • V3SP3R - Compañero de hacking de hardware impulsado por IA para el Flipper Zero. Interfaz de lenguaje natural para controlar ataques de hardware, con integración de gafas inteligentes para operación sin manos.
  • Middleware de seguridad para agentes de IA con defensa de 8 capas contra inyección de prompts, exfiltración de datos y comandos peligrosos. Cero dependencias.
  • CodeGate - Un proyecto de código abierto centrado en la privacidad que actúa como capa de seguridad dentro del flujo de trabajo de generación de código con IA de un desarrollador
  • Future AGI - Plataforma de código abierto autoalojable con guardarraíles integrados en tiempo real para salidas inseguras (jailbreak, PII, inyección, toxicidad), evaluaciones, trazabilidad, simulaciones y pasarela para aplicaciones de LLM y agentes.
  • Un escáner de seguridad para AI Agent Skills que detecta inyección de prompts, exfiltración de datos y patrones de código malicioso. Combina detección basada en patrones (YAML + YARA), LLM como juez y análisis de flujo de datos conductual para una detección integral de amenazas.
  • SkillSpector - Escáner de seguridad para habilidades de agentes de IA. Detecta 64 patrones de vulnerabilidad en 16 categorías con análisis estático + evaluación semántica opcional con LLM. Salida en múltiples formatos (JSON, Markdown, SARIF).
  • Project CodeGuard - Proyecto de código abierto de CoSAI para asegurar flujos de trabajo de desarrollo asistido por IA. CodeGuard proporciona controles de seguridad y guardarraíles para asistentes de codificación con IA, a fin de evitar que se introduzcan vulnerabilidades durante el desarrollo de código generado por IA.
  • AgentLens - Herramientas de observabilidad y reproducción de agentes para la investigación de seguridad e interpretabilidad de la IA. Arnés para ejecutar trayectorias de agentes multisestión, capturarlas en formato ATIF y rastrear cambios de estado de archivos entre sesiones. Diseñado para estudiar el comportamiento de agentes LLM en interacciones multiturno, multisestión y multiagente.
  • claude-code-devcontainer - Devcontainer en sandbox para ejecutar Claude Code en modo bypass de forma segura. Diseñado para auditorías de seguridad y revisión de código no confiable.
  • claude-code-safety-net - Un plugin de Claude Code que actúa como red de seguridad, detectando comandos destructivos de git y del sistema de archivos antes de que se ejecuten
  • OneCLI - Bóveda de credenciales de código abierto para agentes de IA. La pasarela HTTP en Rust intercepta las solicitudes de los agentes e inyecta credenciales de API de forma transparente para que los agentes nunca manejen claves en claro. Cifrado AES-256-GCM, alcance por agente, registro de auditoría completo.
  • OpenSandbox - Runtime de sandbox seguro, rápido y extensible para agentes de IA. SDKs multiidioma, runtimes Docker/Kubernetes, aislamiento con gVisor/Kata Containers/Firecracker. Proyecto CNCF Landscape.
  • openclaw-shield - Plugin de seguridad para agentes OpenClaw: evita fugas de secretos, exposición de PII y ejecución de comandos destructivos
  • clawsec - Escáner de seguridad y herramienta de endurecimiento para despliegues de OpenClaw. Proporciona evaluaciones de seguridad, auditoría de configuración y detección de vulnerabilidades específicamente para la pasarela de OpenClaw y las configuraciones de agentes.
  • nanoclaw - Alternativa ligera a OpenClaw que se ejecuta en contenedores por seguridad. Se conecta a WhatsApp, tiene memoria, trabajos programados y se ejecuta directamente sobre el SDK de Agents de Anthropic. Primer asistente de IA compatible con Agent Swarms para equipos de agentes colaborativos.
  • secureclaw - Endurecimiento automatizado de seguridad para agentes de IA OpenClaw de Adversa AI. 51 comprobaciones de auditoría, 12 reglas de comportamiento, 9 scripts, 4 bases de datos de patrones. Cobertura completa del OWASP ASI Top 10. Protege contra inyección de prompts, robo de credenciales, ataques a la cadena de suministro y fugas de privacidad.
  • defenseclaw - Capa de gobernanza empresarial para OpenClaw de Cisco AI Defense. Escanea habilidades, servidores MCP y plugins con CodeGuard SAST integrado, motor de inspección de llamadas a herramientas, proxy de guardarraíles para LLM e integración con SIEM. Bloquea automáticamente los hallazgos HIGH/CRITICAL.
  • microsandbox - Sandbox microVM ligero para ejecutar código generado por IA no confiable de forma segura con fuertes garantías de aislamiento
  • Adrian - Motor de control y monitoreo de seguridad en tiempo de ejecución de código abierto, alineado con AARM, para agentes de IA de Secure Agentics. Analiza los registros de actividad de los agentes (llamadas a herramientas, acciones, salidas) y los rastros de razonamiento para detectar comportamientos maliciosos, desalineados o fuera de alcance, con intervención opcional en pleno vuelo (modo auditoría vs. bloqueo). SDKs de Python (LangChain/LangGraph) y TypeScript, totalmente autoalojable sin conexión. Apache-2.0.
  • HOL Guard - Arnés de seguridad local-first que intercepta las llamadas a herramientas en agentes de codificación de IA (Codex, Claude Code, Cursor, Gemini, Copilot, Hermes, OpenCode) antes de que los archivos cambien o se contacte la red. Hooks previos a herramientas, centro de aprobación, escaneo de asesoramiento de cadena de suministro y sincronización opcional con Guard Cloud.
  • GhidraGPT - Integra modelos GPT en Ghidra para análisis automatizado de código, renombrado de variables, detección de vulnerabilidades y generación de explicaciones.
  • IDAssist - Plugin de ingeniería inversa impulsado por IA para IDA Pro. Integra análisis basado en LLM en la interfaz de IDA con grafos de conocimiento semánticos, búsqueda de documentos RAG y soporte para múltiples proveedores de LLM (OpenAI, Anthropic, Ollama, LiteLLM). Analiza funciones, sugiere renombrados y responde preguntas sobre el código.
  • ThreatForest - Plataforma agéntica de modelado de amenazas construida sobre el framework Strands. Genera árboles de ataque de forma autónoma a partir de repositorios, asigna pasos de ataque a técnicas MITRE ATT&CK y produce recomendaciones de mitigación accionables.
  • claude-grc-plugin - Plugin de Claude Code que convierte a Claude en un analista GRC senior. Más de 72 archivos de referencia que cubren 15 frameworks (NIST 800-53, FedRAMP, ISO 27001, SOC 2, etc.), 24 comandos de barra y conocimiento profundo del dominio para el trabajo de cumplimiento federal y comercial.
  • Vigil SOC - Una plataforma integral de operaciones de seguridad de código abierto para agentes de IA, que permite la monitorización en tiempo real, la detección de amenazas y la respuesta a incidentes en entornos impulsados por IA.
  • AiSOC - SOC impulsado por IA, de código abierto y autoalojable, que ingiere eventos de seguridad, los correlaciona, ejecuta investigaciones autónomas impulsadas por IA mediante LangGraph y muestra los resultados en una consola unificada. Incluye un rastro de auditoría completo de las decisiones de los agentes, un banco de pruebas de evaluación público en CI y 52 conectores de primera parte. Con licencia MIT.
  • Mantis Skills - El pipeline desacoplado, secuencial y centrado en la seguridad de Google, compuesto por habilidades de IA agénticas para revisar, deduplicar, validar, reproducir y parchear vulnerabilidades de forma autónoma en bases de código de cualquier escala. Incluye un pipeline de múltiples etapas (análisis de arquitectura → modelado de amenazas → investigación → revisión → reproducción → parcheo → calibración → reflexión), sandboxing integrado y un bucle de aprendizaje continuo que se adapta en ejecuciones iterativas. Soporta hardware RTL, IaC, pipelines de ML y binarios compilados.