
AI 데이터센터 인프라의 주요 보안 위험을 식별하고 우선순위를 정하기 위한 실용적인 프레임워크로, 하드웨어, 네트워킹, 관리 평면, 공급망을 다루며 제공자와 고객을 위한 완화 전략을 포함합니다.

FORGE - 모델 아래의 메탈을 강화하세요.
🌐 웹사이트: https://forge-framework.io
AI 데이터센터는 보안이 확보되는 속도보다 더 빠르게 구축되고 있습니다.
데이터센터, GPU 클라우드, 특수 컴퓨팅 환경의 급속한 확장은 하드웨어, 네트워킹, 스토리지, 오케스트레이션, 아이덴티티, 관리 플레인, 물리적 운영 전반에 걸쳐 보안 위험을 초래했습니다. 이러한 위험 중 상당수는 기존 데이터센터 또는 클라우드 보안 문제와 유사하지만, 현대 데이터센터와 AI 인프라는 그 심각도를 변화시킵니다. 원래 신뢰할 수 있는 운영자를 위해 설계된 시스템이 이제는 무관한 고객의 고가치 다중 테넌트 워크로드를 지원하고 있습니다.
데이터센터 및 AI 인프라 보안 위험 Top 10은 AI를 구동하는 인프라 계층에서 가장 중요한 보안 위험을 식별, 우선순위화, 완화하기 위한 실용적인 프레임워크를 제공합니다. 이 프레임워크는 AI 인프라에서 가장 중요한 장애 모드를 정의하고 이를 구체적인 보안 요구사항으로 전환하는 데 도움을 줍니다.
이 프레임워크는 AI 인프라와 이를 수용하는 데이터센터의 보안에 초점을 맞춥니다: AI 워크로드가 실행되는 물리적 하드웨어, 네트워킹 패브릭, 관리 플레인, 오케스트레이션 시스템, 스토리지 시스템, 운영 환경.
AI 모델 자체나 프롬프트 인젝션, 안전하지 않은 에이전트 동작, 모델 남용, 모델 수준 평가와 같은 애플리케이션 계층 위험에는 초점을 맞추지 않습니다. 이러한 위험은 LLM 애플리케이션용 OWASP Top 10, MITRE ATLAS, NIST AI 위험 관리 프레임워크, ISO/IEC 42001 등 AI 스택의 다른 부분에 초점을 맞춘 프레임워크에서 다룹니다. 이러한 리소스는 함께 실무자에게 거버넌스 및 애플리케이션 계층 위험부터 기본 컴퓨팅 인프라까지 AI 보안에 대한 보다 완전한 그림을 제공합니다.
이 문서의 일부 위험은 기존 데이터센터 및 클라우드 환경에도 존재합니다. AI 인프라가 이를 실질적으로 더 심각하게 만들기 때문에 여기에 포함되었습니다: 공유 고가치 컴퓨팅, 복잡한 가속기 클러스터, 밀집된 관리 계층, 다중 테넌트 운영은 기존 엔터프라이즈급 소프트웨어 및 서비스 배포보다 사고의 가능성과 영향이 훨씬 높기 때문에 일반적인 인프라 약점을 더 심각한 보안 위험으로 전환할 수 있습니다.
네오클라우드 제공업체는 AI 인프라 위협 환경, 공격 표면 검토, 환경 강화, 보안 우선순위 설정, 성숙도 입증에 대한 실용적인 가이드로 이 프레임워크를 활용할 수 있습니다.
AI 인프라 고객은 조달, 보안 검토, 계약 요구사항, 제공업체 비교, 현실적인 테넌트-인프라 침해에 대한 복원력 평가를 위한 실용적인 가이드로 이 프레임워크를 활용할 수 있습니다.
하이브리드 클라우드 보안 팀은 환경 간에 빠르게 전환할 수 있는 현대적 공격에 대비하여 온프레미스 환경을 구성, 유지, 보호하기 위한 실용적인 가이드로 이 프레임워크를 활용할 수 있습니다.
현장과 함께 진화하도록 구축되었으며, 전체 AI 및 보안 커뮤니티가 사용하고, 도전하고, 개선할 수 있도록 공개로 유지됩니다.
이 문서를 검토하고 검증하는 데 참여한 모든 전문가에게 감사드립니다.
피드백이 있거나 기여하고 싶으신가요? [email protected]
FORGE 도메인은 평가 렌즈를 정의합니다: AI 보안 위험이 존재하는 인프라 영역. 아래 위험 매트릭스는 개별 위험을 이러한 도메인에 매핑합니다.
FORGE ID는 심각도가 높은 순서에서 낮은 순서로 정렬됩니다. 매트릭스는 각 위험을 도메인별로 그룹화하고 가능성, 영향, 탐지 난이도를 보여줍니다.
각 위험은 일관된 구조를 따릅니다: 정의, 설명, 영향 및 장애 모드, 예방 및 완화 전략 (제공업체 및 고객용), 공격 시나리오, 참고 자료.
현대 데이터센터와 AI 인프라가 구축되는 속도는 이를 보호할 수 있는 능력을 크게 앞지르고 있습니다. GPU 클러스터, 학습 파이프라인, 고성능 네트워킹, 추론 엔드포인트와 같은 이 인프라가 침해되면 폭발 반경은 기존 컴퓨팅과는 다릅니다. 공격자는 수억 달러에 달하는 독점 모델, 기초 학습 데이터를 오염시킬 수 있는 능력, 그리고 가장 높은 권한을 가진 환경에 대한 지속적인 발판을 확보하게 됩니다.
이러한 역학은 구조적 시장 불균형으로 인해 더욱 강화됩니다: GPU 희소성은 제공업체에게 비대한 협상력을 부여합니다. 가속 컴퓨팅에 대한 수요가 공급을 크게 초과할 때, 고객은 보안 태세에 따라 제공업체를 선택할 수 없는 경우가 많습니다 – 이용 가능한 것을 선택합니다. 제공업체는 보안 성숙도에 투자할 시장 압력을 거의 받지 않으며, 고객은 기존 클라우드에서는 용납하지 않을 위험을 수용합니다. 이러한 불균형은 이 문서의 모든 위험을 읽어야 하는 배경입니다. AI 기반 보안 연구와 악용 기능이 방어자의 대응 시간을 압축함에 따라 이러한 시장 압력은 더욱 위험해지고 있습니다. 한때 수년간 모호하게 남아 있었을 약점이 이제는 훨씬 더 빠르게 발견되고, 연결되고, 운영화될 수 있습니다.
동시에, AI 기반 보안 연구와 악용 기능은 방어자의 대응 시간을 압축하고 있습니다: 한때 수년간 모호하게 남아 있었을 약점이 이제는 훨씬 더 빠르게 발견되고, 연결되고, 운영화될 수 있습니다.
AI 인프라는 클라우드 컴퓨팅, 고성능 컴퓨팅, 물리적 데이터센터 운영의 교차점에 위치합니다. 서버, 스토리지, 네트워크, 스케줄러, 관리 플레인, 아이덴티티 시스템과 같은 친숙한 구성 요소를 사용하지만, 보안 모델을 변경하는 방식으로 결합합니다.
기존 HPC 환경은 종종 신뢰할 수 있는 사용자, 연구 커뮤니티, 내부 운영자를 위해 설계되었습니다. 현대 AI 인프라는 점점 더 무관한 고객의 상업적, 고가치, 다중 테넌트 워크로드를 지원합니다. 결과적으로 신뢰할 수 있는 환경이나 단일 조직 환경에서 허용되었던 가정은 공유 AI 인프라에 적용될 때 심각한 보안 위험이 될 수 있습니다.
AI 인프라와 데이터센터를 보호하려면 클라우드 제공업체, 하드웨어 및 네트워킹 벤더, 보안 회사, 시스템 통합업체, 고객 간의 협력이 필요합니다. 이는 고성능 네트워킹, 동서 방향 가시성, 세분화, 관리 플레인 보호, 인프라 보안 통제와 같은 영역에서 특히 중요합니다.
공격자들은 이미 고급 AI 및 HPC 워크로드를 지원하는 인프라, 공급망, 데이터센터 생태계를 표적으로 삼기 시작했습니다. 어떤 경우에는 민감한 연구, 모델, 엔지니어링 데이터의 직접적인 도용이 목적이고, 다른 경우에는 간첩 활동, 사전 배치, 전략적으로 중요한 컴퓨팅 환경을 교란할 수 있는 능력입니다. 최근 보도는 두 가지 패턴을 모두 보여줍니다:
이것들은 초기 사례입니다. 스택이 성숙함에 따라 공격 표면은 확장될 가능성이 높으며, 이 문서도 함께 진화할 것입니다.
위험은 잠재적 공격자를 살펴봄으로써 가장 잘 이해됩니다. 위협 모델은 고전적인 "외부 공격자"보다 훨씬 더 넓은 범위를 포함하며, 이 문서의 통제는 전체 집합에 맞게 조정됩니다:
이 프레임워크의 위험은 AI 인프라 특유의 또는 AI 인프라로 증폭된 장애 모드에 초점을 맞춥니다. 이는 강력한 엔터프라이즈 보안 통제의 필요성을 대체하지 않습니다. 실제로 AI 인프라에 대한 많은 공격은 약하거나 누락된 MFA, 피싱, 자격 증명 도용, SaaS 침해, 약한 아이덴티티 통제를 포함한 친숙한 엔터프라이즈 침해 경로를 통해 시작될 수 있습니다.
이러한 경로는 교차적인 초기 접근 벡터로 취급되어야 합니다. 침해된 아이덴티티, 엔드포인트, SaaS 계정, CI/CD 시스템 또는 관리 자격 증명은 이 프레임워크에 설명된 여러 위험에 도달하는 데 필요한 발판을 제공할 수 있습니다. 따라서 이 섹션들은 공격자가 AI 인프라 환경 자체에 도달하거나 영향을 미칠 수 있을 때 발생할 수 있는 일에 초점을 맞춥니다.
후보 위험은 다음에서 도출되었습니다:
각 후보는 가능성, 영향, 악용 가능성, 탐지 난이도의 네 가지 차원으로 평가되었으며, 가장 높은 점수를 받은 위험이 포함 대상으로 선정되었습니다.
이것은 살아있는 문서입니다. AI 인프라는 빠르게 진화하고 있으며, 이에 대한 공격도 마찬가지입니다. 향후 개정판에서는 새로운 위험을 추가하고, 기존 위험을 개선하며, 현장에서 얻은 교훈을 통합할 것입니다. 실무자의 피드백과 제안된 추가 사항을 환영하며, 새 버전 출판 시 출처를 표기할 것입니다.
이 저장소의 콘텐츠는 CC BY-NC-SA 4.0에 따라 라이선스가 부여됩니다.
| 도메인 | 이름 | 설명 |
|---|
| F | 플릿 무결성 | AI 인프라 플릿을 구성하는 하드웨어, 펌웨어, 소프트웨어 아티팩트, 이미지, 종속성, 공급 경로에 대한 신뢰. |
| O | 운영 및 관리 플레인 | BMC, 스케줄러, 오케스트레이션, 자동화, 관리 도구를 포함하여 AI 인프라를 제어, 자동화, 관리하는 데 사용되는 권한 있는 시스템. |
| R | 리소스 격리 | 공유 AI 시스템 전반에서 테넌트, 워크로드, 실행 환경, 재사용된 인프라를 분리하는 경계. |
| G | 그리드 | AI 클러스터를 연결하고 전원, 냉각, 운영을 유지하는 네트워킹 패브릭 및 시설 시스템. |
| E | 증거 및 노출 관리 | 고객이 제공업체의 보안 성숙도, 아키텍처 범위, 노출된 서비스, 패치 속도를 이해하는 데 필요한 증거. |
| ID | 도메인 | 위험 | 위험 수준 | 가능성 | 영향 | 탐지 난이도 |
|---|
| FORGE-01 | F | 하드웨어 및 펌웨어 무결성 침해 | 치명적 | 중간 | 심각 | 높음 |
| FORGE-02 | G | 네트워크 및 상호연결 취약점 | 치명적 | 중간 | 심각 | 높음 |
| FORGE-03 | R | 안전하지 않은 다중 테넌트 격리 및 리소스 재사용 | 치명적 | 낮음 | 심각 | 매우 높음 |
| FORGE-04 | O | 안전하지 않은 대역외 관리 플레인 | 치명적 | 중간 | 높음 | 매우 높음 |
| FORGE-05 | F | AI 인프라 공급망 침해 | 치명적 | 높음 | 높음 | 높음 |
| FORGE-06 | G | 안전하지 않은 시설 및 데이터센터 관리 시스템 | 높음 | 낮음 | 높음 | 매우 높음 |
| FORGE-07 | R | 안전하지 않은 데이터 및 아티팩트 처리 | 높음 | 높음 | 높음 | 중간 |
| FORGE-08 | E | 인증 공백 및 제공업체 투명성 실패 | 높음 | 중간 | 높음 | 중간 |
| FORGE-09 | O | 안전하지 않은 운영 인프라 서비스 | 높음 | 높음 | 중간 | 중간 |
| FORGE-10 | E | 벤더 엠바고 공백 및 패치 속도 실패 | 중간 | 중간 | 중간 | 낮음 |