Awesome AI Security

Una lista seleccionada de frameworks, estándares, recursos de aprendizaje y herramientas de código abierto relacionados con la seguridad en IA.
Si quieres contribuir, crea un PR o contacta conmigo @ottosulin.
Tabla de contenidos
Recursos de aprendizaje
Lecturas y guías
Cursos, laboratorios y CTFs
- Damn Vulnerable MCP Server - Una implementación deliberadamente vulnerable del Protocolo de Contexto de Modelo (MCP) con fines educativos.
- otto-support - Una implementación vulnerable de servidor MCP que usa mcp-go con autenticación por niveles (4 roles), 19 herramientas y un contenedor sandbox integrado con Claude Code para practicar la escalada de privilegios y el uso indebido de herramientas.
- OWASP WrongSecrets LLM exercise
- vulnerable-mcp-servers-lab - Una colección de servidores deliberadamente vulnerables para aprender a realizar pentesting de servidores MCP.
- FinBot Agentic AI Capture The Flag (CTF) Application - FinBot es una plataforma interactiva de Capture The Flag (CTF) de seguridad agéntica que simula vulnerabilidades del mundo real en sistemas de IA agéntica mediante una aplicación simulada centrada en servicios financieros.
- AI-Red-Teaming-Playground-Labs - Laboratorios de práctica de red teaming de IA para impartir entrenamientos de red teaming de IA, incluida la infraestructura.
- Damn Vulnerable LLM Agent - Agente LLM intencionalmente vulnerable para aprender sobre inyección de prompts, uso indebido de herramientas y seguridad de agentes
-
- LLMVault - Un laboratorio de seguridad de LLM de código abierto estilo CTF para aprender el OWASP LLM Top 10 mediante ejercicios prácticos vulnerables que cubren inyección de prompts, ataques RAG, fuga del prompt del sistema, uso indebido de herramientas y seguridad de agentes.
Podcasts
Gobernanza y gestión de riesgos
Frameworks
Estándares y verificación
Taxonomías, terminología y bases de datos de riesgos
Listas de comprobación y guías prácticas
Técnicas de ataque y red teaming
ML adversarial y modelos clásicos
- Adversarial Robustness Toolkit - ART se centra en las amenazas de Evasión (cambiar el comportamiento del modelo mediante modificaciones de entrada), Envenenamiento (controlar un modelo mediante modificaciones de los datos de entrenamiento), Extracción (robar un modelo mediante consultas) e Inferencia (atacar la privacidad de los datos de entrenamiento)
- cleverhans - Una biblioteca de ejemplos adversariales para construir ataques, desarrollar defensas y comparar ambos
- foolbox - Un conjunto de herramientas de Python para crear ejemplos adversariales que engañan a las redes neuronales en PyTorch, TensorFlow y JAX
- TextAttack - Un framework de Python para ataques adversariales, aumento de datos y entrenamiento de modelos en PLN
- Counterfit - Capa de automatización genérica para evaluar la seguridad de los sistemas de aprendizaje automático
- OffsecML Playbook - Una colección de TTP ofensivos y adversariales con pruebas de concepto
- BadDiffusion - Repositorio oficial para reproducir el artículo "How to Backdoor Diffusion Models?" publicado en CVPR 2023
- secml-torch - SecML-Torch: una biblioteca para la evaluación de la robustez de los modelos de aprendizaje profundo
Red teaming de LLM y GenAI
- garak - herramienta de sondeo de seguridad para LLMs
- ai-scanner - Aplicación web de código abierto para evaluaciones de seguridad de modelos de IA, construida sobre NVIDIA garak. Incluye 179 sondas, escaneo multiobjetivo, escaneos programados, puntuación ASR e integración con SIEM.
- promptfoo - Prueba tus prompts, agentes y RAGs. Red teaming, pentesting y escaneo de vulnerabilidades para LLMs. Compara el rendimiento de GPT, Claude, Gemini, Llama y más. Configuraciones declarativas simples con integración en línea de comandos y CI/CD.
- PyRIT - Python Risk Identification Tool para IA generativa (PyRIT) es un framework de código abierto creado para capacitar a profesionales e ingenieros de seguridad a identificar de forma proactiva los riesgos en los sistemas de IA generativa.
- PurpleLlama - Conjunto de herramientas para evaluar y mejorar la seguridad de los LLMs.
- augustus - Framework de pruebas de seguridad para LLMs que detecta inyección de prompts, jailbreaks y ataques adversariales. Más de 190 sondas, 28 proveedores, un único binario de Go. Listo para producción con escaneo concurrente, limitación de tasa y lógica de reintentos.
- FuzzyAI - Una potente herramienta para fuzzing automatizado de LLMs. Está diseñada para ayudar a desarrolladores e investigadores de seguridad a identificar y mitigar posibles jailbreaks en sus API de LLM.
- EasyJailbreak - Un framework de Python fácil de usar para generar prompts adversariales de jailbreak.
- gptfuzz - Repositorio oficial de GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts
- llamator - Framework para probar vulnerabilidades de los modelos de lenguaje grandes (LLM).
- agentic_security - Escáner de vulnerabilidades de LLM agénticos / kit de red teaming de IA
IA agéntica y herramientas de ataque MCP
- RAMPART - Framework de pruebas de seguridad nativo de pytest para aplicaciones de IA agéntica.
- AI-Infra-Guard - Una plataforma de red teaming de IA integral, inteligente y fácil de usar desarrollada por Tencent Zhuque Lab. Integra módulos de Infra Scan, MCP Scan y Jailbreak Evaluation, y ofrece una interfaz web con un clic, API REST e implementación basada en Docker para una evaluación integral de la seguridad de la IA.
- OpenPromptInjection - Un benchmark para ataques y defensas de inyección de prompts
- AIMap - Plataforma de descubrimiento y pruebas de seguridad a escala de internet para infraestructura expuesta de agentes de IA. Consulta Shodan en busca de servidores MCP, instancias de Ollama, proxies vLLM/LiteLLM y más; luego toma huellas, puntúa el riesgo y lanza suites de ataque específicas del protocolo con resultados en streaming en tiempo real.### Seguridad Ofensiva Asistida por IA
- PentestGPT - Una herramienta de pruebas de penetración impulsada por GPT
- HackingBuddyGPT - Ayudando a los hackers éticos a usar LLMs en 50 líneas de código o menos
- cai - IA de ciberseguridad (CAI), una inteligencia artificial de código abierto lista para Bug Bounty (paper)
- shannon - Pentester de IA totalmente autónomo para aplicaciones web y APIs de Keygraph. Pruebas de seguridad de caja blanca que analizan el código fuente, identifican vectores de ataque y ejecutan exploits reales. 96.15% de tasa de éxito (100/104 exploits) en el benchmark XBOW.
- strix - Strix son agentes de IA autónomos que actúan igual que hackers reales: ejecutan tu código dinámicamente, encuentran vulnerabilidades y las validan mediante pruebas de concepto reales
- redamon - Framework de red team agéntico impulsado por IA que automatiza operaciones de seguridad ofensiva, desde el reconocimiento hasta la explotación y la post-explotación, sin intervención humana.
Esteganografía y Canales Encubiertos
- ST3GG - Suite de esteganografía todo-en-uno con codificación multicapa, esteganografía de imagen y audio, y herramientas de esteganálisis para detectar datos ocultos en medios generados por IA.
Benchmarks y Evaluaciones
- ISC-Bench - Colapso de Seguridad Interna: jailbreak de cualquier LLM de frontera (Claude Opus 4.6, GPT-5.4) en pass@3 mediante finalización de tareas normales — sin prompting adversarial. Caja negra, transversal a dominios y ciencias. Nuevo modo de fallo. [Paper]
- jailbreakbench - JailbreakBench: Un benchmark abierto de robustez para el jailbreak de modelos de lenguaje [NeurIPS 2024 Datasets and Benchmarks Track]
- AgentDojo - Un entorno dinámico para evaluar ataques y defensas para agentes LLM.
- AIRTBench - Repositorio de código para: AIRTBench: Midiendo las capacidades autónomas de red teaming de IA en modelos de lenguaje
- HackingBuddyGPT benchmark dataset - Dataset de benchmark para pentesting automatizado
- AgentDoG - AgentDoG es un framework de evaluación y protección consciente del riesgo para agentes autónomos. Se centra en la evaluación de riesgos a nivel de trayectoria, con el objetivo de determinar si la trayectoria de ejecución de un agente contiene riesgos de seguridad en diversos escenarios de aplicación.
- AICGSecEval - El benchmark integral de evaluación de Tencent para la seguridad en la generación de código por IA, que cubre 10 categorías CWE con un arnés de pruebas automatizado
- Inspect - Framework para evaluaciones de grandes modelos de lenguaje del Instituto de Seguridad de IA del Reino Unido. Más de 200 evaluaciones preconstruidas que cubren ingeniería de prompts, uso de herramientas, diálogo multiturno y puntuación calificada por modelos.
- sec-code-bench - El benchmark de Alibaba para evaluar las capacidades de seguridad de código de los LLM en 17 categorías de vulnerabilidades y 4 lenguajes de programación
Defensa y Controles de Seguridad
Guardarraíles de Entrada/Salida
- NeMo-Guardrails - NeMo Guardrails es un kit de herramientas de código abierto para añadir fácilmente guardarraíles programables a sistemas conversacionales basados en LLM.
- LlamaFirewall - LlamaFirewall es un framework diseñado para detectar y mitigar riesgos de seguridad centrados en IA, con soporte para múltiples capas de entradas y salidas, como el chat típico de LLM y operaciones agénticas de múltiples pasos más avanzadas.
- llm-guard - LLM Guard de Protect AI es una herramienta integral diseñada para fortalecer la seguridad de los Grandes Modelos de Lenguaje (LLMs).
- Guardrails.ai - Guardrails es un paquete de Python que permite al usuario añadir garantías de estructura, tipo y calidad a las salidas de los grandes modelos de lenguaje (LLMs)
- TrustGate - Firewall de Aplicaciones Generativas (GAF) para detectar, prevenir y bloquear ataques contra aplicaciones GenAI
- ZenGuard AI - La capa de confianza más rápida para agentes de IA
- LocalMod - API de moderación de contenido autoalojada con detección de inyección de prompts, filtrado de toxicidad, detección de PII y clasificación NSFW. Funciona 100% sin conexión.
- DynaGuard - Un modelo de guardarraíl dinámico con políticas definidas por el usuario
- AprielGuard - Modelo de salvaguarda de seguridad de 8B parámetros
- Safe Zone - Safe Zone es un motor de código abierto de detección de PII y guardarraíles que evita que los datos sensibles se filtren a los LLM y a APIs de terceros.
- superagent - Superagent proporciona guardarraíles entrenados específicamente que hacen que los agentes de IA sean seguros y cumplan las normativas.
- ShellWard -
Seguridad del Runtime de Agentes y Sandboxing
- OpenShell - OpenShell es el runtime seguro y privado para agentes de IA autónomos. Proporciona entornos de ejecución en sandbox regidos por políticas YAML declarativas que impiden el acceso no autorizado a archivos, la exfiltración de datos y la actividad de red no controlada.
- OpenSandbox - Runtime de sandbox seguro, rápido y extensible para agentes de IA. SDKs multiidioma, runtimes Docker/Kubernetes, aislamiento con gVisor/Kata Containers/Firecracker. Proyecto CNCF Landscape.
- CubeSandbox - Sandbox instantáneo, concurrente, seguro y ligero para agentes de IA de Tencent Cloud. Arranque en frío inferior a 60 ms, sobrecarga de memoria <5MB, compatible con SDK E2B. Construido sobre RustVMM y KVM con aislamiento extremo (kernel dedicado + eBPF).
- Aegis - EDR de código abierto para agentes de IA de Antropos. Supervisa procesos, archivos, red y comportamiento de agentes de IA autónomos en tiempo real. Sin telemetría, sin nube, todo permanece local.
- Microsoft Agent Governance Toolkit - AI Agent Governance Toolkit de Microsoft: aplicación de políticas, identidad de confianza cero, sandboxing de ejecución e ingeniería de fiabilidad para agentes de IA autónomos. Cubre 10/10 del OWASP Agentic Top 10.
- agentfield - Plano de control de código abierto para sistemas de agentes con identidad criptográfica, aplicación de políticas y observabilidad apta para auditorías.
- leash - Leash envuelve a los agentes de codificación de IA en contenedores y supervisa su actividad.
- vibekit - Ejecuta Claude Code, Gemini, Codex — o cualquier agente de codificación — en un sandbox limpio y aislado con redacción de datos sensibles y observabilidad integradas.
- pipelock - Arnés de seguridad para agentes de IA: proxy de salida con escaneo DLP, protección SSRF, escaneo de respuestas MCP y monitoreo de integridad del espacio de trabajo
- skill-scanner -
Seguridad de MCP
- MCP-Security-Checklist - Una lista de verificación de seguridad integral para herramientas de IA basadas en MCP. Creada por SlowMist para proteger los ecosistemas de plugins de LLM.
- Awesome-MCP-Security - Todo lo que necesitas saber sobre la seguridad del Model Context Protocol (MCP).
- secure-mcp-gateway - Esta pasarela MCP segura está construida con autenticación, descubrimiento automático de herramientas, caché y aplicación de guardarraíles.
- mcp-context-protector - context-protector es un envoltorio de seguridad para servidores MCP que aborda los riesgos asociados con la ejecución de servidores MCP no confiables, incluidos los saltos de línea, los cambios inesperados en la configuración del servidor y otros ataques de inyección de prompts
- mcp-guardian - MCP Guardian gestiona el acceso de tu asistente LLM a los servidores MCP, dándote control en tiempo real de la actividad de tu LLM.
- MCP Audit VSCode Extension - Audita y registra centralizadamente todas las llamadas a herramientas MCP de GitHub Copilot en VSCode con facilidad.
- MCP-Scan - Una herramienta de escaneo de seguridad para servidores MCP
- ATR (Agent Threat Rules) - Reglas de detección de código abierto para amenazas a agentes de IA. 108 reglas regex que cubren inyección de prompts, envenenamiento de herramientas y exfiltración de credenciales en 9 categorías. Usadas por Cisco AI Defense. Licencia MIT.
- MCPProxy - Proxy MCP local-first con cuarentena SHA-256 por herramienta para detectar ataques de envenenamiento de herramientas y rug-pull, escaneo automático de datos sensibles y secretos en las llamadas a herramientas, aislamiento en sandbox Docker para servidores MCP no confiables y OAuth 2.1. Licencia MIT.
Escaneo de Modelos y Artefactos
- modelscan - ModelScan es un proyecto de código abierto de Protect AI que escanea modelos para determinar si contienen código inseguro.
- picklescan - Escáner de seguridad que detecta archivos Python Pickle que realizan acciones sospechosas
- fickling - Un descompilador y analizador estático de pickling de Python
- medusa - Escáner de seguridad AI-first con más de 74 analizadores, más de 180 reglas de seguridad para agentes de IA y reducción inteligente de falsos positivos. Compatible con todos los lenguajes. Detección de CVE para React2Shell y RCE en mcp-remote.
- julius - Herramienta de fingerprinting de servicios LLM para profesionales de la seguridad. Detecta más de 32 servicios de IA (Ollama, vLLM, LiteLLM, Hugging Face TGI, etc.) durante pruebas de penetración y descubrimiento de superficie de ataque. Utiliza fingerprinting de servicios basado en HTTP para identificar la infraestructura del servidor.
- a2a-scanner - Escanea agentes A2A en busca de posibles amenazas y problemas de seguridad### Seguridad Defensiva Asistida por IA
- Claude Code Security Review - Una GitHub Action de revisión de seguridad impulsada por IA que utiliza Claude para analizar los cambios de código en busca de vulnerabilidades de seguridad.
- deepsec - Escáner de vulnerabilidades impulsado por agentes de Vercel Labs para encontrar problemas difíciles de detectar en bases de código grandes mediante agentes de codificación. Admite escaneo en paralelo, revisión de diffs de PR e integración con CI/CD.
- defending-code-reference-harness - Implementación de referencia para el descubrimiento y la remediación autónomos de vulnerabilidades mediante Claude. Incluye habilidades de modelado de amenazas, escaneo, triaje y aplicación de parches.
- Visa Vulnerability Agentic Harness - Pipeline SAST agéntico con 11 etapas, desde la detección hasta la remediación impulsada por LLM y la validación adversarial. Genera SARIF y se integra con Claude Code, Copilot y Gemini.
Privacidad y Computación Confidencial
- Python Differential Privacy Library
- Diffprivlib - La biblioteca de privacidad diferencial de IBM
- TenSEAL - Una biblioteca para realizar operaciones de cifrado homomórfico sobre tensores
- SyMPC - Una biblioteca complementaria de computación multiparte segura para Syft
- Cloaked AI - Cifrado de código abierto que preserva propiedades para embeddings vectoriales
- dstack - Framework de IA confidencial de código abierto para el despliegue seguro de ML/LLM con aislamiento reforzado por hardware y privacidad de datos
- PrivacyRaven - biblioteca de pruebas de privacidad para sistemas de aprendizaje profundo
- PLOT4ai - Biblioteca de privacidad de amenazas para inteligencia artificial — Una biblioteca de modelado de amenazas para ayudarte a construir IA responsable
- OpenDP - Biblioteca central para algoritmos de privacidad diferencial del proyecto OpenDP — utilizada para construir pipelines de entrenamiento de ML que preservan la privacidad
Seguridad de Datos y Cadena de Suministro
- datasig - Huella digital de conjuntos de datos para AIBOM
- OWASP AIBOM - Lista de materiales de IA
- Trusera ai-bom - Lista de materiales de IA — descubre cada agente de IA, modelo y API en tu infraestructura
Habilidades de Seguridad para IA Agéntica
- Elastic Agent Skills - Colección de habilidades para el asistente de IA de Elastic, que permite realizar investigaciones de seguridad en lenguaje natural en logs, trazas e inteligencia de amenazas
- Ghost Security Skills - Habilidades y herramientas de seguridad de aplicaciones para agentes (appsec) para Claude Code
- tm_skills - Habilidades de agente para ayudar con el modelado continuo de amenazas
- Trail of Bits Skills Marketplace - Habilidades de Trail of Bits para Claude Code orientadas a la investigación de seguridad, la detección de vulnerabilidades y los flujos de trabajo de auditoría
- Semgrep Skills - Habilidades oficiales de Semgrep para Claude Code y otros asistentes de codificación con IA. Aporta capacidades de escaneo de seguridad, análisis de código y detección de vulnerabilidades directamente en tu flujo de trabajo de desarrollo asistido por IA.
- claude-bug-bounty - Habilidad de Claude Code para la caza de bug bounties asistida por IA. Automatiza las pruebas de reconocimiento, IDOR, XSS, SSRF, OAuth, GraphQL e inyección de LLM con una lista de verificación de validación de 4 compuertas y generación de informes.
- Anthropic Cybersecurity Skills - Más de 734 habilidades de ciberseguridad estructuradas para agentes de IA. Mapeadas a MITRE ATT&CK, estándar agentskills.io. Compatibles con Claude Code, Copilot, Codex CLI, Cursor y Gemini CLI.
- llm-sast-scanner - Habilidad SAST para agentes de codificación con IA (Claude Code, Codex, etc.) con detección estructurada de vulnerabilidades en 34 clases. Incluye análisis de taint source-to-sink, verificación Judge para reducir falsos positivos y precisión/recall superior al 99% en benchmarks.
- sast-skills - Colección de habilidades de agente que convierten tu codificador de IA en un escáner SAST
- pentest-ai-agents - 31 subagentes de Claude Code para seguridad ofensiva. Subagentes de IA especializados en reconocimiento, web, AD, nube, móvil, redes inalámbricas, ingeniería social, creación de payloads, ingeniería inversa, encadenamiento de exploits, ingeniería de detección, forense y generación de informes. Los agentes de nivel 2 pueden ejecutar herramientas directamente con compuertas de aprobación.
Modelos de IA Centrados en Seguridad
- VulnLLM-R-7B - LLM de razonamiento especializado para la detección de vulnerabilidades. Utiliza razonamiento Chain-of-Thought para analizar el flujo de datos, el flujo de control y el contexto de seguridad. Supera a Claude-3.7-Sonnet y CodeQL en benchmarks de detección de vulnerabilidades. Con solo 7B de parámetros, resulta eficiente y rápido.
- Foundation-Sec-8B-Reasoning - Llama-3.1-FoundationAI-SecurityLLM-8B-Reasoning es un modelo de lenguaje de pesos abiertos, de 8 mil millones de parámetros, ajustado por instrucciones y especializado en aplicaciones de ciberseguridad. Extiende el modelo base Foundation-Sec-8B con capacidades de seguimiento de instrucciones y razonamiento.
- Antares (1B & 350M) - Modelos agénticos para la localización de vulnerabilidades de fdtn-ai. Disponibles en variantes de 2B y 0.4B de parámetros, diseñados para identificar y localizar vulnerabilidades en el código de forma autónoma.
- CyberSecQwen-4B - _Especialista en CTI de 4B de parámetros, ajustado a partir de Qwen3-4B-Instruct-2507 para inteligencia de amenazas de ciberseguridad.
- Meta-SecAlign-8B / Meta-SecAlign-70B - Modelos Llama alineados con la seguridad, ajustados para resistir ataques de inyección de prompts y mantener la jerarquía de instrucciones incluso bajo entradas adversariales
- Lily-Cybersecurity-7B - Modelo de chat de 7B ajustado para ciberseguridad, optimizado para el análisis de seguridad, la explicación de vulnerabilidades y las tareas de inteligencia de amenazas.
Clasificadores de Seguridad y Detección de Inyección de Prompts
- Llama-Guard-4-12B - El clasificador de seguridad multimodal más reciente de Meta para detectar contenido dañino en las entradas y salidas de LLM en las modalidades de texto e imagen.
- Llama-Prompt-Guard-2-86M - Modelo ligero de 86M de parámetros de Meta para detectar intentos de inyección de prompts y jailbreak en pipelines de LLM en producción.
- ShieldGemma-2B - Clasificador de seguridad de texto de 2B de parámetros de Google para detectar contenido dañino, construido sobre la arquitectura Gemma.
- DeBERTa Prompt Injection Detector v2 - DeBERTa-v3-base de Protect AI ajustado para la detección de inyección de prompts, ampliamente utilizado en pipelines de salvaguarda de LLM en producción.
- Prompt Injection Sentinel - Modelo ModernBERT-large ajustado para la clasificación de inyección de prompts y jailbreaks con una baja tasa de falsos positivos.
- Nemotron 3.5 Content Safety - El modelo multimodal de seguridad de contenido de 4B de parámetros de NVIDIA que unifica salvaguardas de entrada de texto+imagen, soporte multilingüe (más de 35 idiomas), aplicación personalizable de políticas empresariales y razonamiento auditable en una única llamada de inferencia. Sucesor de Nemotron 3 Content Safety.
- BrowseSafe - Modelo de seguridad especializado para detectar ataques de inyección de prompts en agentes de navegador de IA. Alcanza una puntuación F1 del 90,4% en BrowseSafe-Bench, optimizado para la clasificación asíncrona en tiempo real de contenido HTML sin procesar.
Modelos de Lenguaje de Seguridad Adaptados al Dominio
- ATTACK-BERT - Modelo sentence-transformer para mapear texto de seguridad a técnicas MITRE ATT&CK.
- CySecBERT - Modelo BERT adaptado para tareas de ciberseguridad y CTI mediante preentrenamiento específico del dominio.
Conjuntos de Datos
- SafetyPrompts - Colección curada de prompts relevantes para la seguridad, destinada a evaluar las propiedades de seguridad y protección de los LLM.
- Do-Not-Answer - Conjunto de datos de prompts que los LLM responsables no deberían responder, para la evaluación de seguridad y el red teaming.
- JailBreakV-28K - Conjunto de datos a gran escala de 28.000 prompts de jailbreak para evaluar comparativamente la seguridad de los LLM.
- CL4R1T4S - Prompts de sistema filtrados de ChatGPT, Claude, Gemini, Grok, Perplexity, Cursor, Lovable, Replit y otras herramientas de IA importantes. La mayor colección conocida de prompts de sistema de producción para la investigación de la transparencia y la superficie de ataque.
- LEAKHUB - Leaderboard de fugas de prompts de sistema — plataforma comunitaria para rastrear y clasificar las fugas de prompts de sistema en los productos de IA.
- Leaked System Prompts - Colección de prompts de sistema filtrados de herramientas de IA comerciales — útil para comprender la ingeniería de prompts del mundo real y las superficies de ataque.