
AI Security Newsletter - Un resumen mensual de investigaciones, conocimientos, informes, próximos eventos y herramientas y recursos sobre seguridad en IA.
Un resumen de investigaciones, ideas, informes, próximos eventos y herramientas y recursos de seguridad de IA. Sigue a la comunidad AISecHub y a nuestro grupo de LinkedIn para obtener actualizaciones adicionales. También echa un vistazo a nuestro proyecto, Awesome AI Security.
Patrocinado por InnovGuard.com - Asesoría de Riesgo Tecnológico y Ciberseguridad - Innovar e Invertir con Confianza, Liderar con Garantía.
📌 Actualizando nuestra taxonomía: Modos de fallo en sistemas de IA agentiva Microsoft amplía su taxonomía de modos de fallo de IA agentiva a partir del trabajo de red team, proporcionando a los equipos de seguridad una forma más clara de razonar sobre el mal uso de herramientas, agencia excesiva, contaminación de memoria, límites de identidad y brechas de anulación humana en sistemas agentivos desplegados.
📌 El gusano Miasma golpea a Microsoft nuevamente: Azure Functions Action y otros 72 repositorios deshabilitados tras un ataque a la cadena de suministro dirigido a agentes de codificación de IA StepSecurity documenta una campaña de cadena de suministro dirigida a flujos de trabajo de agentes de codificación de IA y repositorios de GitHub, con el enfoque defensivo en la confianza en dependencias, procedencia de acciones, rutas de escritura de repositorios y credenciales visibles para agentes en entornos CI/CD.
📌 El lamentable estado de la distribución de habilidades Investigadores de Trail of Bits eludieron las verificaciones de ClawHub, Cisco skill-scanner y skills.sh con paquetes de habilidades que usaban truncamiento, indirección de archivos, envenenamiento de bytecode y enmarcado de inyección de indicaciones, mostrando por qué los mercados públicos de habilidades para agentes necesitan curación y controles de procedencia en lugar de solo confiar en escáneres.
📌 Codex CLI RCE: Mitigaciones de inyección de indicaciones Cymulate analiza el riesgo de inyección de indicaciones en agentes de codificación de línea de comandos, donde el texto no confiable puede dirigir escrituras de archivos o la ejecución de herramientas a menos que se apliquen sandboxing, límites de aprobación y restricciones de comandos fuera del modelo.
📌 Agentjacking: Inyección MCP secuestra agentes de codificación de IA Cloud Security Alliance resume el patrón "agentjacking" de Sentry a MCP, donde la telemetría o el contenido de incidencias controlados externamente se convierten en contexto confiable para los agentes de codificación. El marco defensivo útil es tratar los datos de observabilidad, informes de errores e integración como entrada de agente no confiable, no como metadatos de desarrollo neutrales.
📌 SearchLeak: Cómo convertimos M365 Copilot en un arma de exfiltración de datos con un solo clic Varonis describe una cadena de ataque de Microsoft 365 Copilot Enterprise que combina inyección de parámetros a indicaciones, comportamiento de renderizado HTML y abuso de rutas de búsqueda para filtrar datos sensibles de M365 a través de un flujo de trabajo de un solo clic.
📌 AutoJack: Cómo una sola página puede lograr RCE en el host que ejecuta tu agente de IA Microsoft muestra cómo una página web maliciosa vista por un agente de navegación de IA puede llegar a un servicio local de AutoGen Studio y desencadenar la ejecución de procesos del host a través de la confianza insegura en localhost y el manejo de acciones del agente.
📌 Ataque a la cadena de suministro de Mastra npm: Más de 140 paquetes con puerta trasera mediante el typo-squatting de easy-day-js StepSecurity informa de un compromiso del ecosistema npm de Mastra a través de una dependencia con typo-squatting que contenía un dropper postinstall ofuscado, afectando paquetes de agente, RAG, MCP y flujos de trabajo utilizados en pilas de aplicaciones de IA.
📌 Rompiendo LiteLLM: De usuario con pocos privilegios a administrador y RCE Obsidian documenta una ruta encadenada de escalada de privilegios y RCE en LiteLLM, mostrando cómo el acceso con pocos privilegios a una puerta de enlace de IA puede convertirse en control administrativo sobre secretos de proveedores, políticas de proxy y funciones de agentes en tiempo de ejecución.
📌 Vulnerabilidad en Amazon Q: Compromiso a través de la auto-ejecución de MCP Wiz analiza un problema en la extensión de VS Code de Amazon Q donde la configuración de MCP confiable en el espacio de trabajo de un repositorio clonado podría cargar automáticamente comportamiento controlado por un atacante y exponer rutas de ejecución del desarrollador y credenciales en la nube.
📌 macOS.Gaslight: Una puerta trasera en Rust convierte la inyección de indicaciones contra el analista, no contra el sandbox SentinelOne documenta una puerta trasera en Rust que introduce contenido de inyección de indicaciones para analistas y herramientas asistidas por IA, desplazando el ataque de la fuga del sandbox a la manipulación del humano y el modelo que revisan el malware.
📌 Uso de computadora y TOCTOU: ¡Lo que haces clic no es lo que obtienes! Johann Rehberger demuestra una condición de carrera en un agente de uso de computadora donde la pantalla cambia después de que el modelo la observa pero antes de que se realice el clic, convirtiendo una interacción de apariencia benigna en una acción de envío de Outlook y haciendo que la revalidación de píxeles o estado previo a la acción sea un control central.
📌 El enfoque del espectro de codificación "vibe" para el desarrollo de software asistido por IA El NCSC del Reino Unido enmarca la codificación asistida por IA como un espectro de riesgo, separando prototipos de bajo riesgo del código generado que toca autenticación, autorización, datos sensibles, comportamiento crítico para la seguridad o infraestructura crítica.
📌 Inyección de indicaciones y seguridad en tiempo de ejecución de agentes: Un modelo de amenazas práctico TMLS enmarca la inyección de indicaciones como un problema de seguridad en tiempo de ejecución, mapeando ataques a través de la mediación de herramientas, almacenes de memoria, canales de salida y brechas de aprobación humana. La conclusión práctica es trasladar los controles a intermediarios de capacidades, ejecución en sandbox, listas blancas y rutas de auditoría en lugar de tratar el texto de las indicaciones como el límite de seguridad.
📌 Qué sucedió después de que 2,000 personas intentaran hackear mi asistente de IA Fernando Irarrázaval informa sobre un desafío de inyección de indicaciones en el agente de correo electrónico OpenClaw con más de 6,000 intentos y ninguna filtración exitosa de secretos, mientras surfacen problemas prácticos de implementación como contaminación de memoria del agente, contexto por lotes, costo de API, suspensión de cuentas y elección de modelo.
🧰 AgentStalker - Benchmark de vulnerabilidades de agentes y kit de herramientas de análisis con seguimiento de manchas, análisis AST, auditoría de código y reproducción en sandbox para rutas de ataque agentivas. ⭐️115
🧰 darknet-mcp-server - Servidor MCP que expone brechas, ransomware, malware, exploits, registros de stealers y herramientas de inteligencia de amenazas a agentes de IA para flujos de trabajo controlados de investigación en seguridad. ⭐️67
🧰 mcp-trust-plane - Plano de seguridad de datos y protección componible para proveedores de Model Context Protocol, centrado en controles de políticas alrededor de herramientas y datos conectados a MCP. ⭐️60
🧰 prompt-gate - Control DLP local y a nivel de DNS para bloquear herramientas de IA no autorizadas e inspeccionar indicaciones salientes en busca de secretos o datos sensibles antes de que salgan del endpoint. ⭐️28
🧰 claude-ai-cyber-security-skills - Colección de habilidades para Claude Code para flujos de trabajo de seguridad, incluyendo pruebas ofensivas, análisis defensivo y patrones de investigación asistidos por herramientas. ⭐️17
🧰 talos - Servicio de claves API y tokens de capacidad para humanos, servicios y agentes de IA que necesitan autorización máquina a máquina con alcance. ⭐️14
🧰 SkillsGuard - Escáner estático para paquetes de habilidades de agentes de IA maliciosos o inseguros, archivos SKILL.md y scripts empaquetados. ⭐️13
🧰 tamga - Proxy de seguridad LLM autogestionado para redacción de PII, defensa contra inyección de indicaciones y controles de cumplimiento alrededor del tráfico de modelos. ⭐️11
🧰 llm-sec-range - Campo de ataque y defensa LLM que cubre CTF de inyección de indicaciones, OWASP LLM Top 10, agentes vulnerables y objetivos de modelos locales. ⭐️9
🧰 aka-claude-tools - Utilidades de endurecimiento para Claude Code con contexto limpio, perfiles aislados, credenciales bloqueadas,egreso controlado y configuraciones locales más seguras. ⭐️9
🧰 agent-jackstop - Capa de endurecimiento para Cursor y Claude Code contra inyección de indicaciones a través de salidas de herramientas no confiables, también descrito como agentjacking. ⭐️8
🧰 LLM-Safety-platform - Plataforma de red teaming de IA para evaluación de vulnerabilidades LLM, inyección de indicaciones, ataques de ofuscación y análisis de estabilidad de muestreo. ⭐️6
La actualización de junio de OWASP convierte la seguridad de la IA agentiva en un mapa de gobernanza e ingeniería, cubriendo flujos de trabajo autónomos, categorías de riesgo de agentes, controles y la brecha práctica entre los primeros modelos de amenazas y los incidentes de producción.
Cloud Security Alliance publica 247 objetivos de control de IA en 18 dominios de seguridad, con mapeos a marcos de aseguramiento y cumplimiento como ISO 42001, ISO 27001, BSI AIC4 y gobernanza orientada a la Ley de IA de la UE.
CSA convierte la Matriz de Controles de IA en una guía de implementación para proveedores de nube en áreas como planificación de auditorías, remediación, gestión de vulnerabilidades, supervisión de socios, detección de amenazas y prácticas de aseguramiento específicas de IA.
El NCSC del Reino Unido y los socios de Five Eyes advierten que la IA está reduciendo las barreras para los atacantes y comprimiendo la ventana de vulnerabilidad a explotación, mientras mapean el cambio de riesgo hacia configuraciones seguras por diseño, reducción de exposición, velocidad de parches, autenticación sólida, preparación para incidentes y uso defensivo de la IA.
📘 Model Context Protocol: Consideraciones de Diseño de Seguridad para Automatización Impulsada por IA
La NSA y socios internacionales publican una guía de diseño de seguridad para MCP en automatización impulsada por IA, cubriendo autenticación, autorización, confianza en servidores, controles de transporte, exposición de herramientas y monitoreo para ecosistemas de agentes que pasan de experimentos a producción.
🛡️ CVE-2026-49257: mcp-pinot expone invocación de herramientas MCP sin autenticación Crítico 10.0. mcp-pinot puede enlazar un servidor MCP HTTP a 0.0.0.0 con OAuth deshabilitado por defecto, exponiendo herramientas de mutación de SQL, esquemas y tablas a través de credenciales de Apache Pinot del lado del servidor.
🛡️ CVE-2026-54309: El transporte MCP Browser de n8n acepta llamadas a herramientas sin autenticación Crítico 10.0. El transporte HTTP MCP Browser de n8n puede aceptar inicialización de sesión y llamadas a herramientas sin autenticación, exponiendo la automatización de control del navegador a clientes alcanzables.
🛡️ CVE-2026-56274: Inyección de comandos en Flowise Custom MCP Server Crítico 9.9. El manejo de banderas de comando y las restricciones de acceso a archivos de Flowise Custom MCP Server pueden ser eludidos para inyección de comandos del sistema operativo dentro de una plataforma de flujo de trabajo LLM.
🛡️ CVE-2026-55255: IDOR en la ejecución de flujos de Langflow Crítico 9.9. La API de respuestas de Langflow puede permitir que un atacante autenticado ejecute el flujo de otro usuario proporcionando un ID de flujo víctima, rompiendo el aislamiento de inquilinos para la ejecución de flujos de trabajo de IA.
🛡️ CVE-2026-50548: Escape del sandbox de terminal de agente de Cursor Crítico 9.8. El sandbox de terminal del agente de Cursor puede ser eludido modificando los parámetros del directorio de trabajo, permitiendo acciones de terminal impulsadas por el agente fuera del límite del espacio de trabajo previsto.
🛡️ CVE-2026-50549: Escape del sandbox de escritura de archivos del agente de Cursor Crítico 9.8. El sandbox de escritura de archivos de Cursor puede fallar incorrectamente después de un fallo de canonicalización, creando una ruta para escrituras de archivos del agente fuera del límite del proyecto previsto.
🛡️ CVE-2026-49468: Bypass de autorización por cabecera de host en proxy de LiteLLM Crítico 9.8. El análisis de la cabecera de host del proxy de LiteLLM puede permitir acceso no autenticado a rutas de gestión protegidas bajo condiciones específicas de despliegue, arriesgando controles de puerta de enlace y secretos de proveedores.
🛡️ CVE-2026-7664: Bypass de autorización de IBM Langflow Streamable MCP Crítico 9.8. El transporte Streamable MCP de IBM Langflow puede exponer recursos y operaciones MCP protegidos a atacantes no autenticados en versiones de código abierto afectadas.
🛡️ CVE-2026-55743: Bypass de lista blanca de shell del agente de escritorio OpenHuman Crítico 9.6. La lista blanca de shell del agente de escritorio de OpenHuman puede ser eludida mediante banderas de ejecución y trucos de entorno, convirtiendo rutas indirectas de inyección de indicaciones en ejecución de comandos del host.
📅 IEEE CSR GenXSec 2026 - 3-5 de agosto de 2026 · Lisboa, Portugal · Organizador: IEEE CSR
📅 Black Hat USA 2026 - AI Summit - 4 de agosto de 2026 · Las Vegas, NV, EE. UU. · Organizador: Black Hat
📅 CAMLIS 2026 - 21-23 de octubre de 2026 · Arlington, VA, EE. UU. · Organizador: CAMLIS
📅 GAISS 2026 - 28-30 de octubre de 2026 · Austin, TX, EE. UU. · Organizador: IEEE
📅 ACM AISec 2026 - 15-19 de noviembre de 2026 · La Haya, Países Bajos · Organizador: ACM AISec
📖 AgentRedBench: Redteaming Dinámico y Defensa Consciente de Integración para Agentes LLM sobre Integraciones SaaS
Evalúa la inyección indirecta de indicaciones contra agentes que usan herramientas conectados a integraciones SaaS como Gmail, Salesforce y Jira, haciendo que la superficie de ataque se acerque más a los flujos de trabajo de agentes en producción que las pruebas de inyección de indicaciones solo en chat. arXiv
📖 SkillGuard: Un Marco de Permisos para Habilidades de Agentes
Trata las habilidades de agentes de terceros como artefactos de software con permisos, mapeando lo que una habilidad puede inyectar en el contexto del agente a lo que puede provocar que el agente haga en tiempo de ejecución. arXiv
📖 Inconsistencia Descripción-Código en Servidores MCP del Mundo Real: Medición, Detección e Implicaciones de Seguridad
Mide 19,200 pares descripción-código de 2,214 servidores MCP y encuentra que las descripciones de herramientas a menudo divergen del comportamiento de implementación real, creando un punto ciego para los agentes que eligen herramientas basándose en descripciones en lenguaje natural. arXiv
📖 GitInject: Ataques de Inyección de Indicaciones en el Mundo Real en Tuberías CI/CD Impulsadas por IA
Muestra cómo los agentes de IA integrados en flujos de trabajo CI/CD y de solicitudes de extracción pueden ingerir contenido de repositorios controlados por atacantes mientras tienen permisos elevados, convirtiendo la inyección de indicaciones en un riesgo de cadena de suministro de software. arXiv
📖 Hacia Agentes LLM Seguros: Superficies de Amenaza, Ataques, Defensas y Evaluación
Sintetiza 247 artículos en un mapa orientado a sistemas de la seguridad de agentes, centrándose en el flujo de información, la autoridad delegada, el estado persistente, el secuestro del flujo de control mediado por herramientas y la debilidad de las defensas no composicionales. arXiv
📖 Política del Mismo Origen para Navegadores Agentivos
Muestra que los navegadores agentivos pueden convertirse en canales automatizados de flujo de datos entre orígenes, y luego propone SOPGuard para hacer cumplir los límites de origen del navegador mientras se preserva la utilidad de la tarea. arXiv
📖 Benigno en Aislamiento, Dañino en Composición: Riesgos de Seguridad en Ecosistemas de Habilidades de Agentes
Introduce el Riesgo de Composición de Habilidades, donde habilidades individualmente benignas se vuelven dañinas cuando sus salidas, señales de confianza, señales de autorización o efectos secundarios influyen en llamadas posteriores a herramientas en un contexto de agente compartido. arXiv
📖 SafeClawBench: Separando el Daño Semántico, el de Evidencia de Auditoría y el de Sandbox en Agentes LLM que Usan Herramientas
Introduce un benchmark escalonado para la seguridad de agentes que usan herramientas en inyección directa e indirecta de indicaciones, inyección de retorno de herramientas, envenenamiento de memoria, extracción de memoria e inferencia insegura, separando el acuerdo del modelo del daño visible en auditoría y observado en sandbox. arXiv
📖 "Lo que Sucede Localmente, se Filtra Globalmente": Detectando Riesgos de Fuga de Privacidad en Servidores MCP
Enmarca la fuga de MCP como un problema de privacidad inducido por el protocolo donde credenciales, claves API o PII cruzan el límite local-LLM a través de valores devueltos, registros o errores del manejador de herramientas. arXiv
📖 ShareLock: Un Ataque Sigiloso de Envenenamiento por Umbral Multiherramienta contra MCP
Introduce un ataque de envenenamiento MCP multiherramienta donde las instrucciones maliciosas se dividen en descripciones de herramientas de apariencia benigna y se reconstruyen solo después de un disparador, reduciendo la detectabilidad en comparación con el envenenamiento de una sola herramienta. arXiv
💬 Un repositorio limpio de GitHub engaña a los agentes de codificación de IA para que ejecuten malware r/cybersecurity · Puntuación en Reddit 183 · 19 comentarios Los profesionales trataron el hilo como un caso de límite de confianza de agente de codificación: las indicaciones del repositorio, los archivos de configuración, los scripts de configuración y el contexto de salida de las herramientas pueden convertirse en influencia de ejecución antes de que un revisor vea una carga maliciosa convencional.
💬 La puerta trasera macOS Gaslight utiliza inyección de indicaciones contra analistas de seguridad r/cybersecurity · Puntuación en Reddit 202 · 11 comentarios La discusión enmarcó la inyección de indicaciones como abuso del flujo de trabajo de análisis de malware: las muestras maliciosas pueden plantar instrucciones para los analistas y sus herramientas de IA, por lo que el entorno de revisión, las notas del analista y el contexto del modelo pasan a formar parte de la superficie de ataque.
💬 Implementando Copilot: ¿Qué tan preocupado debería estar por la inyección indirecta de indicaciones? r/cybersecurity · Puntuación en Reddit 48 · 31 comentarios Los equipos de seguridad compararon los controles de implementación de Copilot para la inyección indirecta de indicaciones, centrándose en documentos y correos electrónicos no confiables, permisos de usuarios heredados, datos compartidos en exceso, alcance de conectores y si el principio de mínimo privilegio es suficiente por sí solo para asistentes de recuperación aumentada.💬 ¿Cómo manejan los equipos la exposición de la superficie de herramientas MCP? r/cybersecurity · Puntuación en Reddit 13 · 19 comentarios El hilo se centró en MCP como un límite de exposición de herramientas: los equipos debatieron sobre la accesibilidad del servidor, la confianza en las descripciones de herramientas, las puertas de aprobación, la autorización por herramienta y si el acceso a las herramientas del agente debería modelarse más cercano al acceso API o a la ejecución de código local.
💬 ¿La política de seguridad de alguien está realmente preparada para los agentes de IA, o todos estamos fingiendo? r/cybersecurity · Puntuación en Reddit 47 · 73 comentarios Los profesionales mapearon los agentes de IA a las brechas de gobernanza en las políticas existentes: quién es dueño de las acciones automatizadas, qué requiere aprobación humana, cómo se registran los permisos delegados y cómo cambia la respuesta a incidentes cuando un operador de flujo de trabajo está parcialmente automatizado.
1️⃣ RCE in LLM Coding Agents: Lessons from Newly Disclosed Claude Code Vulnerabilities Sesión de Cloud Native San Francisco sobre lecciones de RCE en agentes de codificación, útil para equipos que revisan cómo la inyección rápida, las herramientas locales y los entornos de desarrollador pueden combinarse en riesgo de ejecución del lado del host.
2️⃣ The Future of Secure Enterprise AI: Building Reliable Agents with MCP Charla de Xpand Conference sobre diseño de agentes empresariales basados en MCP, con énfasis práctico en infraestructura de agentes confiable, exposición de datos y controles de seguridad en torno a herramientas conectadas.
3️⃣ CNAS 2026 National Security Conference: Setting the Rules for AI Warfare Sesión de CNAS sobre normas de guerra de IA y política de seguridad nacional, relevante para equipos de seguridad que rastrean cómo las operaciones cibernéticas habilitadas por IA se están moviendo hacia la doctrina y gobernanza del sector público.
4️⃣ HitchHacker's Guide to Building Secure Agents Charlas de NDC Conferences sobre construcción de agentes seguros, cubriendo los riesgos de ingeniería que aparecen cuando los agentes reciben herramientas, credenciales, estado y autonomía dentro de sistemas de software reales.
5️⃣ Attacking AI Systems Sesión de CodeValue sobre ataque a sistemas de IA, útil como recorrido orientado a profesionales sobre cómo las características de IA expanden los modelos de amenaza de las aplicaciones más allá del manejo ordinario de prompts y API.
6️⃣ BlueHat 2026: From trusted agents to adversaries: Securing agentic AI in the age of prompt injection Charla de BlueHat 2026 sobre cómo los flujos de trabajo de agentes confiables se vuelven adversarios cuando las salidas de herramientas, el contenido recuperado y las acciones delegadas cruzan los límites de confianza.
7️⃣ Breaching LLM-Powered Applications: Overcoming Security and Privacy Challenges Sesión de Spring I/O por Brian Vermeer que cubre rutas de ataque prácticas contra aplicaciones impulsadas por LLM, incluyendo inyección rápida, fuga de privacidad, riesgo de integración de aplicaciones y mitigaciones arquitectónicas.
8️⃣ ContinuumCon 2026 - Hunting Prompt Injection Charla de ContinuumCon por Mackenzie Jackson sobre cómo encontrar, probar y razonar sobre el comportamiento de inyección rápida en sistemas de IA como un problema de seguridad operativa.
9️⃣ Securing AI Agents with MCP and Zero Trust Identity Sesión de DZone Events sobre aseguramiento de agentes conectados a MCP con conceptos de identidad de confianza cero, acceso con alcance, autorización de herramientas y flujos de trabajo delegados más seguros.
🔟 Practical MCP Security in Action Sesión técnica del Bulgarian Java User Group por Willem Jan Glerum sobre compensaciones de seguridad en MCP, exposición de servidores y herramientas, riesgo de configuración y controles para integraciones de agentes.
Si eres un fundador construyendo algo nuevo o un inversor evaluando oportunidades en etapa temprana - conectemos.
💬 ¿Leíste algo interesante? Comparte tus pensamientos en los comentarios.