Un marco práctico para identificar y priorizar los principales riesgos de seguridad en la infraestructura de centros de datos de IA, que abarca hardware, redes, planos de gestión y cadena de suministro, con estrategias de mitigación para proveedores y clientes.

FORGE - Endurece el metal debajo del modelo.
🌐 Sitio web: https://forge-framework.io
Los centros de datos de IA se están construyendo más rápido de lo que se están asegurando.
La rápida expansión de los centros de datos, las nubes de GPU y los entornos de cómputo especializado ha introducido riesgos de seguridad en el hardware, las redes, el almacenamiento, la orquestación, la identidad, los planos de gestión y las operaciones físicas. Muchos de estos riesgos se asemejan a problemas tradicionales de seguridad en centros de datos o en la nube, pero los centros de datos modernos y la infraestructura de IA cambian su gravedad: los sistemas diseñados originalmente para operadores de confianza ahora soportan cargas de trabajo de alto valor y multiinquilino de clientes no relacionados.
Los 10 Principales Riesgos de Seguridad en Centros de Datos e Infraestructura de IA proporcionan un marco práctico para identificar, priorizar y reducir los riesgos de seguridad más importantes en la capa de infraestructura que impulsa la IA. El marco define los modos de fallo más críticos en la infraestructura de IA y ayuda a traducirlos en requisitos de seguridad concretos.
Este marco se centra en la seguridad de la infraestructura de IA y de los centros de datos que la albergan: el hardware físico, las redes de interconexión, los planos de gestión, los sistemas de orquestación, los sistemas de almacenamiento y los entornos operativos en los que se ejecutan las cargas de trabajo de IA.
No se centra en los propios modelos de IA ni en los riesgos de la capa de aplicación, como la inyección de prompts, el comportamiento inseguro de los agentes, el abuso de modelos o la evaluación a nivel de modelo. Esos riesgos se abordan en marcos centrados en otras partes del stack de IA, incluidos el OWASP Top 10 para Aplicaciones LLM, MITRE ATLAS, el Marco de Gestión de Riesgos de IA del NIST e ISO/IEC 42001. En conjunto, estos recursos brindan a los profesionales una imagen más completa de la seguridad de la IA, desde la gobernanza y los riesgos de la capa de aplicación hasta la infraestructura de cómputo subyacente.
Algunos riesgos de este documento también existen en entornos tradicionales de centros de datos y nube. Se incluyen aquí porque la infraestructura de IA los hace materialmente más graves: el cómputo compartido de alto valor, los clústeres de aceleradores complejos, las capas de gestión densas y las operaciones multiinquilino pueden convertir debilidades ordinarias de infraestructura en riesgos de seguridad más severos, ya que la probabilidad y el impacto de cualquier incidente son mucho mayores que en los despliegues tradicionales de software y servicios a nivel empresarial.
Los proveedores de neo-nube pueden beneficiarse del marco como una guía práctica para el panorama de amenazas de la infraestructura de IA, la revisión de la superficie de ataque, el endurecimiento del entorno, la priorización de la seguridad y la demostración de madurez.
Los clientes de infraestructura de IA pueden beneficiarse del marco como una guía práctica para la adquisición, las revisiones de seguridad, los requisitos contractuales, la comparación de proveedores y la evaluación de la resiliencia frente a compromisos realistas de inquilino a infraestructura.
Los equipos de seguridad de nube híbrida pueden beneficiarse de este marco como una guía práctica para configurar, mantener y asegurar su huella local frente a ataques modernos, que pueden pivotar rápidamente entre entornos.
Construido para evolucionar con el campo y mantenido abierto para que toda la comunidad de IA y seguridad pueda usarlo, cuestionarlo y mejorarlo.
Queremos agradecer y reconocer a todos los expertos que participaron en la revisión y validación de este documento.
¿Tienes comentarios o quieres contribuir? [email protected]
Los dominios FORGE definen el lente de evaluación: las áreas de infraestructura donde reside el riesgo de seguridad de la IA. La Matriz de Riesgos a continuación mapea los riesgos individuales en estos dominios.
| Dominio | Nombre | Descripción |
|---|---|---|
| F | Integridad de la flota | Confianza en el hardware, firmware, artefactos de software, imágenes, dependencias y rutas de suministro que componen la flota de infraestructura de IA. |
| O | Operaciones y planos de gestión | Sistemas privilegiados utilizados para controlar, automatizar y administrar la infraestructura de IA, incluidos BMC, programadores, orquestación, automatización y herramientas de administración. |
| R | Aislamiento de recursos | Los límites que separan inquilinos, cargas de trabajo, entornos de ejecución e infraestructura reutilizada en sistemas de IA compartidos. |
| G | Red | Las redes de interconexión y los sistemas de instalaciones que conectan los clústeres de IA y los mantienen alimentados, refrigerados y operativos. |
| E | Gestión de evidencia y exposición | La evidencia que los clientes necesitan para comprender la madurez de seguridad del proveedor, el alcance arquitectónico, los servicios expuestos y la velocidad de parcheo. |
Los IDs FORGE están ordenados por gravedad, de mayor a menor. La matriz agrupa cada riesgo por dominio y muestra su probabilidad, impacto y dificultad de detección.
| ID | Dominio | Riesgo | Nivel de Riesgo | Probabilidad | Impacto | Dificultad de Detección |
|---|---|---|---|---|---|---|
| FORGE-01 | F | Compromiso de la Integridad del Hardware y Firmware | Crítico | Media | Grave | Alta |
| FORGE-02 | G | Vulnerabilidades de Red e Interconexión | Crítico | Media | Grave | Alta |
| FORGE-03 | R | Aislamiento Multiinquilino Inseguro y Reutilización de Recursos | Crítico | Baja | Grave | Muy Alta |
| FORGE-04 | O | Plano de Gestión Fuera de Banda Inseguro | Crítico | Media | Alto | Muy Alta |
| FORGE-05 | F | Compromiso de la Cadena de Suministro de Infraestructura de IA | Crítico | Alta | Alto | Alta |
| FORGE-06 | G | Sistemas de Gestión de Instalaciones y Centros de Datos Inseguros | Alto | Baja | Alto | Muy Alta |
| FORGE-07 | R | Manejo Inseguro de Datos y Artefactos | Alto | Alta | Alto | Media |
| FORGE-08 |
Cada riesgo sigue una estructura coherente: Definición, Descripción, Impacto y Modos de Fallo, Estrategias de Prevención y Mitigación (para proveedores y para clientes), Escenarios de Ataque y Referencias.
El ritmo al que se está construyendo el centro de datos moderno y la infraestructura de IA supera con creces la capacidad de asegurarlo. Cuando esta infraestructura, los clústeres de GPU, los pipelines de entrenamiento, las redes de alto rendimiento y los endpoints de inferencia, se ven comprometidos, el radio de explosión no se parece al del cómputo convencional. Los atacantes obtienen acceso a modelos propietarios que representan cientos de millones de dólares, el poder de envenenar datos de entrenamiento fundamentales y puntos de apoyo persistentes en los entornos más privilegiados disponibles.
Esta dinámica se ve reforzada por un desequilibrio estructural del mercado: la escasez de GPU otorga a los proveedores una influencia desproporcionada. Cuando la demanda de cómputo acelerado supera con creces la oferta, los clientes a menudo no pueden elegir a su proveedor en función de su postura de seguridad: toman lo que está disponible. Los proveedores enfrentan poca presión del mercado para invertir en madurez de seguridad, y los clientes aceptan riesgos que no tolerarían en la nube convencional. Este desequilibrio es el telón de fondo contra el cual debe leerse cada riesgo de este documento. Esta presión del mercado se está volviendo más peligrosa a medida que la investigación de seguridad y las capacidades de explotación habilitadas por IA comprimen el cronograma para los defensores. Las debilidades que antes podrían haber permanecido oscuras durante años ahora pueden descubrirse, encadenarse y operacionalizarse mucho más rápido.
Al mismo tiempo, la investigación de seguridad y las capacidades de explotación habilitadas por IA están comprimiendo el cronograma para los defensores: las debilidades que antes podrían haber permanecido oscuras durante años ahora pueden descubrirse, encadenarse y operacionalizarse mucho más rápido.
La infraestructura de IA se encuentra en la intersección de la computación en la nube, la computación de alto rendimiento y las operaciones físicas de centros de datos. Utiliza componentes familiares como servidores, almacenamiento, redes, programadores, planos de gestión y sistemas de identidad, pero los combina de maneras que cambian el modelo de seguridad.
Los entornos HPC tradicionales a menudo se diseñaban para usuarios de confianza, comunidades de investigación u operadores internos. La infraestructura de IA moderna soporta cada vez más cargas de trabajo comerciales, de alto valor y multiinquilino de clientes no relacionados. Como resultado, las suposiciones que eran aceptables en entornos de confianza o de una sola organización pueden convertirse en riesgos de seguridad graves cuando se aplican a infraestructura de IA compartida.
Asegurar la infraestructura de IA y los centros de datos requerirá colaboración entre proveedores de nube, proveedores de hardware y redes, empresas de seguridad, integradores de sistemas y clientes. Esto es especialmente importante en áreas como redes de alto rendimiento, visibilidad este-oeste, segmentación, protección del plano de gestión y controles de seguridad de infraestructura.
Los atacantes ya han comenzado a apuntar a la infraestructura, las cadenas de suministro y los ecosistemas de centros de datos que respaldan cargas de trabajo avanzadas de IA y HPC. En algunos casos, el objetivo es el robo directo de investigación sensible, modelos o datos de ingeniería; en otros, es espionaje, posicionamiento previo o la capacidad de interrumpir entornos de cómputo estratégicamente importantes. Los informes recientes ilustran ambos patrones:
Estos son ejemplos tempranos. Es probable que la superficie de ataque se expanda a medida que el stack madure, y este documento evolucionará junto con él.
El riesgo se comprende mejor observando a los posibles atacantes. El modelo de amenaza abarca mucho más que el clásico "atacante externo", y los controles de este documento están calibrados contra el conjunto completo:
Los riesgos de este marco se centran en modos de fallo específicos de la infraestructura de IA o amplificados por ella. No reemplazan la necesidad de controles sólidos de seguridad empresarial. En la práctica, muchos ataques contra la infraestructura de IA pueden comenzar a través de rutas familiares de compromiso empresarial, incluida la ausencia o debilidad de MFA, phishing, robo de credenciales, compromiso de SaaS y controles de identidad débiles.
Estas rutas deben tratarse como vectores de acceso inicial transversales. Una identidad comprometida, un endpoint, una cuenta SaaS, un sistema CI/CD o una credencial administrativa pueden proporcionar el punto de apoyo necesario para alcanzar varios de los riesgos descritos en este marco. Por lo tanto, estas secciones se centran en lo que puede suceder una vez que un atacante alcanza, o puede influir, en el propio entorno de infraestructura de IA.
Los riesgos candidatos se extrajeron de:
Cada candidato se evaluó contra cuatro dimensiones: Probabilidad, Impacto, Explotabilidad y Dificultad de Detección, seleccionándose para su inclusión los riesgos con mayor puntuación.
Este es un documento vivo. La infraestructura de IA está evolucionando rápidamente, y también los ataques contra ella. Las revisiones futuras agregarán nuevos riesgos, refinarán los existentes e incorporarán las lecciones aprendidas en el campo. Se agradecen los comentarios y las adiciones propuestas por los profesionales, y se acreditarán en la publicación de la nueva versión.
El contenido de este repositorio está licenciado bajo CC BY-NC-SA 4.0.
| E |
| Brechas de Certificación y Fallos de Transparencia del Proveedor |
| Alto |
| Media |
| Alto |
| Media |
| FORGE-09 | O | Servicios de Infraestructura Operativa Inseguros | Alto | Alta | Medio | Media |
| FORGE-10 | E | Brechas de Embargo del Proveedor y Fallos de Velocidad de Parcheo | Medio | Media | Medio | Baja |