OWASP 框架,对 neocloud 和 AI 数据中心基础设施中的十大安全风险进行编目,涵盖硬件、网络、隔离、管理平面和供应链。

FORGE - 加固模型之下的金属底座。
Neocloud 与 AI 数据中心的建设速度,已经超过了它们被保护的速度。
Neocloud(GPU 云服务提供商)、AI 数据中心以及专用计算环境的快速扩张,在硬件、网络、存储、编排、身份、管理平面以及物理运营等层面引入了安全风险。其中许多风险与传统数据中心或云安全问题相似,但 Neocloud 与 AI 数据中心改变了它们的严重程度:原本为可信运维人员设计的系统,如今正在承载来自互不相关客户的高价值、多租户工作负载。
十大 Neocloud 与 AI 数据中心安全风险提供了一个实用框架,用于识别、排序并降低驱动 AI 的基础设施层中最重要的安全风险。该框架定义了 AI 基础设施中最关键的失效模式,并帮助将其转化为具体的安全要求。
本框架聚焦于 AI 基础设施以及承载它们的数据中心的安全:即 AI 工作负载所运行的物理硬件、网络结构、管理平面、编排系统、存储系统以及运营环境。
它不聚焦于 AI 模型本身或应用层风险,例如提示注入、不安全的智能体行为、模型滥用或模型层面的评估。这些风险由聚焦 AI 技术栈其他部分的框架来处理,包括 OWASP Top 10 for LLM Applications、MITRE ATLAS、NIST AI Risk Management Framework 以及 ISO/IEC 42001。这些资源共同为从业者提供了更完整的 AI 安全图景,从治理与应用层风险一直延伸到其下的计算基础设施。
本文档中的部分风险同样存在于传统数据中心和云环境中。之所以将其纳入,是因为 AI 基础设施使这些风险在实质上更为严重:共享的高价值算力、复杂的加速器集群、密集的管理层以及多租户运营,可能将普通的基础设施弱点转化为更严重的安全风险,因为任何事件发生的可能性与影响都远高于传统企业级软件和服务部署。
Neocloud 提供商与数据中心运营商可将本框架作为实用指南,用于了解 AI 基础设施威胁态势、审查攻击面、加固环境、确定安全优先级以及展示成熟度。
Neocloud 客户可将本框架作为实用指南,用于采购、安全审查、合同要求、提供商比较,以及评估针对现实中的租户到基础设施攻陷的韧性。
混合云安全团队可将本框架作为实用指南,用于配置、维护和保护其本地部署资产,以抵御可在不同环境之间快速横向转移的现代攻击。
本框架旨在随该领域共同演进,并保持开放,使整个 AI 与安全社区都能使用、质疑并改进它。
我们谨向所有参与审阅和验证本文档的专家致以感谢与认可。
有反馈或希望贡献?[email protected]
FORGE 领域定义了评估视角:即 AI 安全风险所在的基础设施领域。下方的风险矩阵将各项风险映射到这些领域中。
| 领域 | 名称 | 描述 |
|---|---|---|
| F | 资产群完整性 | 对构成 AI 基础设施资产群的硬件、固件、软件制品、镜像、依赖项以及供应链路的信任。 |
| O | 运营与管理平面 | 用于控制、自动化和管理 AI 基础设施的特权系统,包括 BMC、调度器、编排、自动化以及管理工具。 |
| R | 资源隔离 | 在共享 AI 系统中分隔租户、工作负载、执行环境以及被复用基础设施的边界。 |
| G | 电网与设施 | 连接 AI 集群并维持其供电、冷却和运行的网络结构与设施系统。 |
| E | 证据与暴露面管理 | 客户了解提供商安全成熟度、架构范围、暴露服务以及补丁速度所需的证据。 |
FORGE ID 按严重程度从高到低排序。矩阵按领域对每项风险进行分组,并展示其可能性、影响和检测难度。
| ID | 领域 | 风险 | 风险等级 | 可能性 | 影响 | 检测难度 |
|---|---|---|---|---|---|---|
| FORGE-01 | F | 硬件与固件完整性攻陷 | 严重 | 中 | 严重 | 高 |
| FORGE-02 | G | 网络与互连漏洞 | 严重 | 中 | 严重 | 高 |
| FORGE-03 | R | 不安全的多租户隔离与资源复用 | 严重 | 低 | 严重 | 极高 |
| FORGE-04 | O | 不安全的带外管理平面 | 严重 | 中 | 高 | 极高 |
| FORGE-05 | F | AI 基础设施供应链攻陷 | 严重 | 高 | 高 | 高 |
| FORGE-06 | G | 不安全的设施与数据中心管理系统 | 高 | 低 | 高 | 极高 |
| FORGE-07 | R | 不安全的数据与制品处理 | 高 | 高 | 高 | 中 |
| FORGE-08 | E | 认证缺口与提供商透明度缺失 | 高 | 中 | 高 | 中 |
| FORGE-09 | O | 不安全的运营基础设施服务 | 高 | 高 | 中 | 中 |
| FORGE-10 | E | 供应商禁运缺口与补丁速度缺失 | 中 | 中 | 中 | 低 |
每项风险都遵循一致的结构:定义、描述、影响与失效模式、预防与缓解策略(面向提供商和客户)、攻击场景以及参考资料。
现代数据中心与 AI 基础设施的建设速度,已远远超过对其加以保护的能力。当这些基础设施——GPU 集群、训练流水线、高性能网络以及推理端点——被攻陷时,其爆炸半径与传统计算截然不同。攻击者能够获取价值数亿美元的专有模型、获得污染基础训练数据的能力,并在可用的最高特权环境中建立持久立足点。
这种态势又被一种结构性的市场失衡所强化:GPU 稀缺性赋予 Neocloud 提供商过大的议价能力。当对加速计算的需求远超供给时,客户往往无法根据安全态势来选择提供商——他们只能接受现有可用资源。提供商几乎没有市场压力去投资安全成熟度,而客户则接受了他们在传统云中不会容忍的风险。这种失衡是阅读本文档中每一项风险时的背景。随着 AI 赋能的安全研究与漏洞利用能力压缩了防御者的时间窗口,这种市场压力正变得更加危险。曾经可能多年无人知晓的弱点,如今可能被更快地发现、串联并武器化。
**与此同时,AI 赋能的安全研究与漏洞利用能力正在压缩防御者的时间窗口:**曾经可能多年无人知晓的弱点,如今可能被更快地发现、串联并武器化。
AI 基础设施处于云计算、高性能计算与物理数据中心运营的交汇点。它使用服务器、存储、网络、调度器、管理平面和身份系统等熟悉的组件,但以改变安全模型的方式将它们组合在一起。
传统 HPC 环境通常是为可信用户、研究社区或内部运维人员设计的。现代 AI 基础设施则越来越多地承载来自互不相关客户的商业性、高价值、多租户工作负载。因此,在可信或单一组织环境中可以接受的假设,一旦应用于共享 AI 基础设施,就可能变成严重的安全风险。
保护 AI 基础设施和数据中心,需要 Neocloud、云提供商、硬件与网络供应商、安全公司、系统集成商以及客户之间的协作。这在高性能网络、东西向流量可见性、分段、管理平面保护以及基础设施安全控制等领域尤为重要。
攻击者已经开始瞄准支撑先进 AI 与 HPC 工作负载的基础设施、供应链和数据中心生态系统。在某些案例中,其目标是直接窃取敏感研究、模型或工程数据;在另一些案例中,则是间谍活动、预置立足点,或获得破坏具有战略重要性的计算环境的能力。近期报道展示了这两种模式:
这些只是早期案例。随着技术栈的成熟,攻击面很可能进一步扩大,本文档也将随之演进。
通过审视潜在攻击者,可以最好地理解这一风险。威胁模型远不止经典的“外部攻击者”,本文档中的控制措施是针对完整集合进行校准的:
本框架中的风险聚焦于 AI 基础设施特有或被 AI 基础设施放大的失效模式。它们并不取代对强大企业安全控制的需求。在实践中,许多针对 AI 基础设施的攻击可能始于熟悉的企业攻陷路径,包括 MFA 薄弱或缺失、网络钓鱼、凭据窃取、SaaS 攻陷以及身份控制薄弱。
这些路径应被视为贯穿性的初始访问途径。一个被攻陷的身份、端点、SaaS 账户、CI/CD 系统或管理凭据,都可能提供触及本框架所述多项风险所需的立足点。因此,这些章节聚焦于一旦攻击者到达或能够影响 AI 基础设施环境本身后可能发生的情况。
候选风险来自: