[리포트 다운로드] AI DC 핵심 요소와 추진 전략 | 8월 MI리포트
2026.08.20

AI DC 경쟁력을 가르는 기준, 인프라 보유량이 아닌 토큰 생산 역량
본 리포트는 Out-Rack과 In-Rack을 축으로 AI DC의 핵심 설계 요소와 기술 트렌드를 짚고, GPU 인프라 아키텍처·운영 기술과 기업 고객을 위한 단계별 추진 전략을 제시합니다. 자세한 내용은 아래 리포트에서 확인할 수 있습니다.
리포트 핵심 내용 한눈에 보기
1. AI DC의 본질은 GPU 인프라가 아니라 토큰 생산 시스템– AI DC는 GPU를 많이 배치한 데이터센터가 아니라, 전력과 냉각이 허용하는 범위 안에서 GPU, 네트워크, 스토리지, 데이터, 모델, 운영 소프트웨어를 결합해 학습 Step, 추론 Token, Embedding, 자동화 결과를 지속적으로 생산하는 고밀도 컴퓨팅 시스템입니다.
2. AI DC는 전력·냉각과 Rack/POD 단위 플랫폼을 함께 설계– AI 인프라는 단일 GPU 서버 중심에서 벗어나 Rack-Scale Platform, POD-Scale Architecture, AI Factory 운영 모델로 이동하고 있습니다.
3. Out-Rack은 AI DC가 확장될 수 있는 물리적 상한을 결정– Out-Rack은 전력 확보, 부지, 냉각 플랜트, 네트워크 회선, 물 사용, 보안, 설비 운영 검증처럼 AI DC가 어느 규모까지 안정적으로 확장될 수 있는지를 결정합니다.
4. In-Rack은 AI DC의 실제 성능과 경제성을 결정하는 핵심 영역– In-Rack은 GPU/HBM, Scale-Up Fabric, Scale-Out Network, Storage/Data Path, 랙 전력·냉각, Scheduler, Observability가 결합되어 실제 연산 효율과 토큰 생산성을 만드는 영역입니다.
5. GPU 인프라는 평균 사용률보다 유효 생산성 중심으로 운영– 학습 인프라는 GPU 간 통신, 체크포인트 저장·복구, 느린 노드 발생, 스토리지 처리량이 전체 학습 시간을 좌우합니다.
6. 기업 고객은 AI Factory를 위한 실행형 운영 모델이 필요– AI DC 투자는 GPU 구매가 아니라 Workload Portfolio 정의, Reference Architecture, 벤치마크, 운영 KPI 설계 순서로 추진해야 합니다. |


[FAQ]
Q1. AI DC는 기존 데이터센터와 무엇이 다른가요?
기존 데이터센터는 범용 서버·스토리지·네트워크를 안정적으로 수용하는 CPU 중심 시설로, 가상화와 컨테이너, 스토리지 가용성, 네트워크 보안이 핵심 경쟁력이었습니다. 반면 AI DC는 수백에서 수만 개의 GPU가 하나의 계산 작업을 수행하는 구조를 전제로 설계됩니다. 이 때문에 GPU 간 통신, HBM 용량, 스토리지 처리량, 네트워크 지연시간, 냉각 능력 중 하나만 병목이 되어도 전체 클러스터 생산성이 급격히 낮아집니다. 핵심 KPI 역시 CPU 사용률이 아니라 유효 GPU 사용 시간, 전력당 토큰 생산량, Job 완료 시간, p95 추론 지연시간으로 바뀝니다.
Q2. Out-Rack과 In-Rack은 각각 무엇을 결정하나요?
Out-Rack은 전력 수전과 발전, 부지, 냉각 플랜트, 네트워크 회선, 물 사용, 보안, 설비 운영 검증 등 AI DC가 어느 규모까지 확장될 수 있는지를 결정하는 물리적 상한입니다. In-Rack은 GPU/HBM, Scale-Up Fabric, Scale-Out Network, Storage/Data Path, 랙 전력·냉각, 운영 소프트웨어가 결합되어 실제 성능과 경제성을 만들어내는 영역입니다. Out-Rack만 크게 준비하면 고가 설비가 유휴 자산이 될 수 있고, In-Rack만 앞서면 전력·냉각 한계로 GPU 생산성을 확보하기 어렵기 때문에 두 영역이 함께 맞물릴 때 투자 효율이 만들어집니다.
Q3. 학습과 추론은 같은 GPU를 쓰는데 왜 인프라 설계가 달라져야 하나요?
대규모 학습은 GPU 연산보다 GPU 간 통신이 병목이 되는 경우가 많고, 체크포인트 저장·복구와 느린 노드 발생, 스토리지 처리량이 전체 학습 시간을 좌우합니다. 반면 추론은 Prefill과 Decode의 병목이 다르고, KV Cache와 Tail Latency가 비용을 결정합니다. 따라서 같은 GPU를 사용하더라도 Scheduler, Network, Storage, Serving Runtime, Autoscaling 기준은 달라져야 하며, 이 차이를 구분하지 않으면 학습용 클러스터를 추론 서비스에 과도하게 쓰거나 추론 중심 인프라에서 대규모 학습을 무리하게 수행하는 문제가 생깁니다.
Q4. GPU 인프라 운영 성과는 어떤 지표로 판단해야 하나요?
평균 GPU 사용률만으로는 충분하지 않습니다. GPU 사용률은 단순 점유율이 아니라 실제 생산에 기여한 유효 사용률로 봐야 하며, 실제 GPU 가동 시간, 전력 대비 토큰 생산량, 작업 완료 시간, 장애 복구 시간을 함께 관리해야 합니다. 추론은 전력 대비 토큰 생산량과 토큰당 비용으로, 학습과 후학습은 작업 완료 시간과 체크포인트 복구 시간으로 관리하는 것이 적절합니다. 또한 Observability는 GPU Metric뿐 아니라 Network, Storage, Kubernetes·Slurm, Model Serving Metric을 하나의 Timeline으로 연결해야 실질적인 판단이 가능합니다.
Q5. 기업이 AI DC 도입을 추진할 때 어떤 순서로 접근해야 하나요?
GPU 구매부터 시작하면 실패 가능성이 높습니다. 먼저 학습, 후학습, RAG/Enterprise Search, Batch Inference, Real-Time Inference, Agent 실행으로 Workload Portfolio를 정의하고, 어떤 업무를 Private AI Cluster, Public Cloud GPU, GPUaaS, Edge 또는 CPU Inference에 둘지 판단해야 합니다. 이후 대표 워크로드를 기준으로 Reference Architecture와 벤치마크 계획을 수립하고, 운영 모델과 KPI를 함께 설계하는 순서가 필요합니다. SK AX는 AXgenticWire Core를 중심으로 GPUaaS, 모델 운영, 에이전트 실행, 평가, 운영 지능화를 연결해 AI DC를 실제 운영 가능한 플랫폼으로 전환할 수 있도록 지원하고 있습니다.
AX 컨설팅부터 비즈니스 모델 발굴까지
Global Top 10 AX Service Company|SK AX
#AIDC #AIDataCenter #AIFactory #GPU #GPUInfrastructure #GPUaaS #AIInfrastructure #AIWorkload #TokenEconomics #TokenProduction #OutRack #InRack #RackScale #PODScale #ScaleUp #ScaleOut #AIInference #AITraining #AgenticAI #AXgenticWire #AXgenticWireCore #AI인프라 #데이터센터 #AI데이터센터 #SKAX


![[리포트 다운로드] OT 취약점 증대와 제조 산업 생태계의 사이버 안전성 | 8월 MI리포트](https://www.skax.co.kr/wp-content/uploads/CS_썸네일_600x400.png)
![[리포트 다운로드] 글로벌 통신사 사례로 본 차세대 BSS 테스트 자동화 전략 | 8월 MI리포트](https://www.skax.co.kr/wp-content/uploads/통신_썸네일_600x400.png)
![[리포트 다운로드] ERP AI PI Framework: AI-Native ERP 구현을 위한 새로운 PI 접근법 | 8월 MI리포트](https://www.skax.co.kr/wp-content/uploads/ERP_썸네일_수정_600x400.png)
