사상 리더
AI 인프라의 다음 단계는 하이퍼스케일 데이터 센터 이상의 것을 요구할 것

인공지능은 인프라 전략이 모델 능력과 분리될 수 없는 시대로 진입하고 있습니다. 수년 동안 하이퍼스케일 데이터 센터는 대규모 트레이닝의 부흥을 강화하여 전선 모델을 수백만에서 수십억 개의 매개변수로 성장하게 하였습니다. 그러나 인공지능이 기업, 산업, 실시간 시스템 전반에 걸쳐 채택이 가속화됨에 따라, 추론이 트레이닝을 대체하여 지배적인 워크로드가 되고 있습니다. 추론에는 근본적으로 다른 요구 사항이 있습니다.
인공지능의 다음 시대는 하이퍼스케일 시설만으로 지원될 수 없습니다. 대신, 중앙 집중식 캠퍼스와 분산형, 전력 조정, 상업적 규모의 데이터 센터를 위한 하이브리드 모델이 등장하고 있습니다. 이러한 전환은 지연시간 제약, 데이터 주권 요구, 에너지 공급의 현실, 초대형 시설을 계속 확장하는 데 따르는 물리적 한계에 의해 주도되고 있습니다.
트레이닝과 추론의 분기
트레이닝은 여전히 중앙 집중식 활동입니다. 그것은 대규모 클러스터, 고속 데이터 파이프라인, 및 장기간의 작업을 요구하며 규모의 경제를 이익으로 합니다. 하이퍼스케일 캠퍼스는 이를 위해 최적화되어 있습니다. 그러나 추론은 다르게 작동합니다. 그것은 짧은 기간, 높은 볼륨, 지연 민감도, 및 지리 또는 기업 경계와 종종 연관되어 있습니다. Akamai의 최근 연구에 따르면 대부분의 조직은 현재 임계 AI 사용 사례에 대해 500 밀리초 이하의 종단 간 지연을 목표로 하고 있으며, 다중 에이전트 워크플로는 단순히 네트워크 전송 및 CPU 측면의 실행으로 인해 그 임계값을 초과합니다.
지연시간은 추상적인 지표가 아닙니다. 로봇과 자율 시스템의 제어 루프는 흔히 100~1,000Hz, 즉 1~10밀리초마다 실행됩니다. 장치 밖에서 제공하는 지능도 이 시간 제약을 지켜야 합니다. 먼 데이터센터까지 왕복하는 데 50밀리초가 걸리면 제어 체계가 성립하지 않습니다. 금융 거래와 사기 탐지에서는 밀리초가 경제적 결과를 좌우합니다. 산업 자동화에서 추론이 늦어지면 공정이 불안정해지거나 안전이 위협받을 수 있습니다. 게임, AR·VR, 실시간 AI 도우미 같은 상호작용 경험도 지연이 100~150밀리초를 넘으면 반응성이 크게 떨어집니다.
현대 AI 시스템은 수십 번의 순차 호출을 연결한 다중 에이전트 작업에 점점 더 의존합니다. Akamai 분석에 따르면 CPU 측 실행이 전체 지연의 대부분을 차지할 수 있으며, 네트워크 왕복마다 추가 지연이 생깁니다. 순차 호출이 50번인 작업을 먼 초대형 클라우드 리전으로 보내면 전송 지연만 수초가 될 수 있습니다. 같은 캠퍼스나 대도시권의 가까운 데이터센터에 배치하면 물리적 조건이 달라집니다. 로컬 추론의 왕복 지연은 1~5밀리초 수준이 될 수 있습니다. 먼 리전에서 수초 걸리는 50단계 작업을 로컬에서는 50~250밀리초 안에 끝내 기업의 허용 지연시간을 지킬 수 있다는 설명입니다.

데이터 주권 및 그리드 현실이 로컬 배포를 주도
지연시간은 문제의 일부일 뿐입니다. 보건의료, 금융, 공공부문처럼 규제를 받는 산업에서는 데이터 주권이 로컬 추론의 주된 도입 이유인 경우가 많습니다. 기업 방화벽 안에서 AI 작업을 실행하면 기존 보안 경계를 유지하고, 여러 고객이 인프라를 공유하면서 생기는 노출을 줄이며, 규정 준수를 단순화하고, 민감한 데이터를 공유 클라우드 밖에 둘 수 있습니다. 대형 클라우드 사업자도 강력한 보안을 제공하지만 공격 표면과 신뢰해야 하는 연결고리는 본질적으로 더 넓습니다. 기업들은 기존 보안 체계에 맞는 추론 아키텍처를 점점 더 선호합니다.
지연 및 보안에 대한 우려 외에도 전력 가용성은 동등하게 중요한 제약이 되고 있습니다. 대규모 하이퍼스케일 캠퍼스는 종종 전송 제약 및 인터커넥션 큐로 인해 수년간의 지연을 겪습니다. 특히 기존 부하 또는 분산 발전 근처에 위치한 더 작은 상업적 규모의 배치는 훨씬 더 빠르게 에너지화될 수 있습니다. 이것은 중요합니다. 인공지능 수요는 기이한 역설과 충돌합니다.
운영자가 새로운 그리드 연결을 확보하는 데 어려움을 겪는 동안, 엄청난 양의 재생 가능 에너지가 절단되고 있습니다. 전 세계적으로, 재생 가능 에너지 절단은 현재 연간 200테라와트시 이상을 초과합니다. 미국에서는 절단이 약 20테라와트시로 추정됩니다. ERCOT은 최근 1년 동안 풍력 및 태양광 발전의 9테라와트시 이상을 절단했습니다. 한편 CAISO는 2024년에 3.4테라와트시의 태양광 및 풍력을 폐기했습니다. 태양광은 절단된 출력의 93%를 차지했습니다. 에너지 시스템 조사에 따르면 태양광 및 풍력은 그리드 용량을 초과할 때 상당한 절단을 겪습니다. 태양광 절단은 특히 중간 강도 피크를 갖는 지역에서 일반적이며, 풍력 절단은 비피크 시간이나 제약된 구간에서 발생합니다. 발전 근처에 위치한 분산 데이터 센터, 특히 태양광 풍부한 지역은 유기된 에너지를 유용한 추론 능력으로 전환할 수 있습니다.
하이퍼스케일 캠퍼스는 여전히 트레이닝에 필수적이지만, 물리적 및 경제적 한계에 직면하고 있습니다. 전송 그리드에 연결하는 것은 긴 과정이며, 새로운 변전소, 전송 업그레이드, 다중 기관 허가, 및 커뮤니티 검토를 필요로 합니다. 이러한 과정은 일반적으로 수년이 걸립니다. 하이퍼스케일 시설은 대규모 토지 부지, 상당한 물 할당, 및 복잡한 환경 승인을 필요로 합니다. 커뮤니티는 소음, 물 사용, 및 토지 영향으로 인해 새로운 데이터 센터 개발에 반대하고 있습니다. 또한 중앙 집중식 캠퍼스는 위험을 집중시키므로 날씨 이벤트, 그리드 중단, 또는 지정학적 혼란으로 전 세계 연산 용량의 상당 부분이 영향을 받을 수 있습니다. 분산 아키텍처는 지리적 이중화와 운영 회복력을 제공합니다.
미래는 다층 인공지능 아키텍처
추론 컴퓨팅이 원활하게 실행되도록 보장하기 위해, 효율성은 원시 능력만큼 중요해질 수 있습니다. 추론은 지속적으로 에너지를 소비하며, 산업 분석가들은 추론이 궁극적으로 인공지능 관련 에너지 소비의 대부분을 차지할 수 있다고 제안합니다. 지역 재생에너지 연계, 송전 손실 감소, 적정 규모 배치, 발열 특성 개선, 이용률 향상에 따른 효율은 전 세계 AI 수요를 지속 가능한 방식으로 충족하는 데 필수적입니다. 분산된 상업 규모 데이터센터는 에너지가 풍부하거나 저렴하거나 충분히 활용되지 않는 곳에 들어설 수 있으므로 이런 이점을 제공하기에 유리합니다.
AI 인프라의 다음 단계는 학습을 주로 담당하는 초대형 캠퍼스, 추론을 처리하는 분산형 상업 규모 데이터센터, 사용자와 아주 가까운 작업을 수행하는 엣지 장치를 결합한 형태가 될 것입니다. 이 다계층 구조는 전력, 지연시간, 보안, 규모의 물리적 현실을 반영합니다. AI가 모든 산업의 실시간 시스템에 내장되면서 인프라도 추론을 실제로 활용하는 현장 가까이에 제공하도록 진화해야 합니다.












