一个实用框架,用于识别并优先处理AI数据中心基础设施中的主要安全风险,涵盖硬件、网络、管理平面和供应链,并为服务提供商和客户提供缓解策略。

FORGE - 加固模型之下的金属层。
AI数据中心的建设速度远超其安全防护速度。
数据中心、GPU云和专用计算环境的快速扩张,在硬件、网络、存储、编排、身份、管理平面和物理运维等方面引入了安全风险。其中许多风险与传统数据中心或云安全问题相似,但现代数据中心和AI基础设施改变了其严重程度:原本为可信运营商设计的系统,如今正在支撑来自无关客户的高价值、多租户工作负载。
数据中心与AI基础设施安全风险Top 10提供了一个实用框架,用于识别、优先排序并降低支撑AI的基础设施层中最重要的安全风险。该框架定义了AI基础设施中最关键的故障模式,并帮助将其转化为具体的安全需求。
本框架聚焦于AI基础设施及其所在数据中心的安全性:AI工作负载所依赖的物理硬件、网络架构、管理平面、编排系统、存储系统和运维环境。
本框架不关注AI模型本身或应用层风险,如提示注入、不安全的智能体行为、模型滥用或模型级评估。这些风险由聚焦于AI栈其他部分的框架解决,包括OWASP LLM应用Top 10、MITRE ATLAS、NIST AI风险管理框架和ISO/IEC 42001。这些资源共同为从业者提供了更完整的AI安全图景,从治理和应用层风险一直到底层计算基础设施。
本文档中的某些风险也存在于传统数据中心和云环境中。之所以将其纳入,是因为AI基础设施使其严重程度显著提升:共享的高价值计算资源、复杂的加速器集群、密集的管理层和多租户运营,可能将普通的基础设施弱点转化为更严重的安全风险,因为任何事件的可能性和影响都远高于传统企业级软件和服务部署。
新云(Neo-cloud)提供商可将本框架作为实用指南,用于了解AI基础设施威胁态势、攻击面审查、环境加固、安全优先级排序和成熟度展示。
AI基础设施客户可将本框架作为实用指南,用于采购、安全审查、合同要求、提供商比较,以及评估针对现实租户到基础设施入侵的韧性。
混合云安全团队可将本框架作为实用指南,用于配置、维护和保护其本地部署,以抵御可在不同环境间快速切换的现代攻击。
本框架旨在随领域发展而演进,并保持开放,以便整个AI和安全社区都能使用、挑战和改进它。
我们感谢并认可所有参与审阅和验证本文档的专家。
有反馈或想贡献?[email protected]
FORGE领域定义了评估视角:AI安全风险所在的基础设施区域。下方的风险矩阵将各个风险映射到这些领域中。
FORGE ID按严重程度从高到低排序。矩阵按领域对每个风险进行分组,并显示其可能性、影响和检测难度。
每个风险遵循一致的结构:定义、描述、影响与故障模式、预防与缓解策略(面向提供商和客户)、攻击场景和参考资料。
现代数据中心和AI基础设施的建设速度远远超过了对其的安全防护能力。当这些基础设施——GPU集群、训练管道、高性能网络和推理端点——被攻破时,其爆炸半径与传统计算截然不同。攻击者能够获取代表数亿美元价值的专有模型、拥有毒化基础训练数据的能力,并在最高特权环境中建立持久立足点。
这一动态因结构性市场失衡而加剧:GPU稀缺赋予提供商超常的议价能力。当加速计算的需求远超供给时,客户往往无法基于安全态势选择提供商——他们只能接受现有的选择。提供商面临很少的市场压力去投资安全成熟度,而客户则接受了在传统云环境中不会容忍的风险。这种失衡是理解本文档中每个风险的背景。随着AI驱动的安全研究和利用能力压缩防御者的响应时间,这种市场压力正变得更加危险。曾经可能多年不为人知的弱点,如今可能被更快地发现、串联和武器化。
与此同时,AI驱动的安全研究和利用能力正在压缩防御者的响应时间: 曾经可能多年不为人知的弱点,如今可能被更快地发现、串联和武器化。
AI基础设施处于云计算、高性能计算和物理数据中心运营的交汇点。它使用服务器、存储、网络、调度器、管理平面和身份系统等熟悉的组件,但以改变安全模型的方式组合它们。
传统HPC环境通常是为可信用户、研究社区或内部运营商设计的。现代AI基础设施越来越多地支撑来自无关客户的商业性、高价值、多租户工作负载。因此,在可信或单一组织环境中可接受的假设,在应用于共享AI基础设施时可能成为严重的安全风险。
保护AI基础设施和数据中心需要云提供商、硬件和网络供应商、安全公司、系统集成商和客户之间的协作。这在高性能网络、东西向可见性、分段、管理平面保护和基础设施安全控制等领域尤为重要。
攻击者已经开始针对支撑先进AI和HPC工作负载的基础设施、供应链和数据中心生态系统。在某些情况下,目标是直接窃取敏感研究、模型或工程数据;在其他情况下,则是间谍活动、预先部署或破坏具有战略重要性的计算环境的能力。近期报道说明了这两种模式:
这些只是早期案例。随着技术栈的成熟,攻击面可能会扩大,本文档也将随之演进。
通过审视潜在攻击者可以最好地理解风险。威胁模型远不止经典的"外部攻击者",本文档中的控制措施是针对完整威胁集合校准的:
本框架中的风险聚焦于AI基础设施特有或被AI基础设施放大的故障模式。它们不能替代强大的企业安全控制。在实践中,许多针对AI基础设施的攻击可能通过熟悉的企业入侵路径开始,包括弱或缺失的MFA、网络钓鱼、凭据窃取、SaaS入侵和薄弱的身份控制。
这些路径应被视为跨领域的初始访问向量。被入侵的身份、端点、SaaS账户、CI/CD系统或管理凭据,可能提供到达本框架中描述的多种风险所需的立足点。因此,这些章节聚焦于攻击者一旦到达或能够影响AI基础设施环境本身后可能发生的事情。
候选风险来源于:
每个候选风险均从四个维度进行评估:可能性、影响、可利用性和检测难度,得分最高的风险被选入。
这是一份活文档。AI基础设施正在快速发展,针对它的攻击也在快速发展。未来的修订将增加新风险、完善现有风险,并纳入来自实践的经验教训。欢迎从业者提供反馈和新增建议,并将在新版本发布时予以致谢。
本仓库中的内容根据CC BY-NC-SA 4.0许可。
| 领域 | 名称 | 描述 |
|---|
| F | 集群完整性(Fleet integrity) | 对构成AI基础设施集群的硬件、固件、软件制品、镜像、依赖项和供应链路径的信任。 |
| O | 运营与管理平面(Operations & management planes) | 用于控制、自动化和管理AI基础设施的特权系统,包括BMC、调度器、编排、自动化和管理工具。 |
| R | 资源隔离(Resource isolation) | 在共享AI系统中分隔租户、工作负载、执行环境和复用基础设施的边界。 |
| G | 网格(Grid) | 连接AI集群并维持其供电、冷却和运行的网络架构和设施系统。 |
| E | 证据与暴露管理(Evidence & exposure management) | 客户了解提供商安全成熟度、架构范围、暴露服务和补丁速度所需的证据。 |
| ID | 领域 | 风险 | 风险等级 | 可能性 | 影响 | 检测难度 |
|---|
| FORGE-01 | F | 硬件与固件完整性受损 | 严重 | 中等 | 严重 | 高 |
| FORGE-02 | G | 网络与互连漏洞 | 严重 | 中等 | 严重 | 高 |
| FORGE-03 | R | 不安全的多租户隔离与资源复用 | 严重 | 低 | 严重 | 极高 |
| FORGE-04 | O | 不安全的带外管理平面 | 严重 | 中等 | 高 | 极高 |
| FORGE-05 | F | AI基础设施供应链受损 | 严重 | 高 | 高 | 高 |
| FORGE-06 | G | 不安全的设施与数据中心管理系统 | 高 | 低 | 高 | 极高 |
| FORGE-07 | R | 不安全的数据与制品处理 | 高 | 高 | 高 | 中等 |
| FORGE-08 | E | 认证缺口与提供商透明度缺失 | 高 | 中等 | 高 | 中等 |
| FORGE-09 | O | 不安全的运营基础设施服务 | 高 | 高 | 中等 | 中等 |
| FORGE-10 | E | 供应商禁运缺口与补丁速度不足 | 中等 | 中等 | 中等 | 低 |