사상 리더

AI 인프라의 다음 단계는 하이퍼스케일 데이터 센터 이상의 것을 요구할 것

mm
Unite.AI를 Google의 선호 소스에 추가

인공지능은 인프라 전략이 모델 능력과 분리될 수 없는 시대로 진입하고 있습니다. 수년 동안 하이퍼스케일 데이터 센터는 대규모 트레이닝의 부흥을 강화하여 전선 모델을 수백만에서 수십억 개의 매개변수로 성장하게 하였습니다. 그러나 인공지능이 기업, 산업, 실시간 시스템 전반에 걸쳐 채택이 가속화됨에 따라, 추론이 트레이닝을 대체하여 지배적인 워크로드가 되고 있습니다. 추론에는 근본적으로 다른 요구 사항이 있습니다.

인공지능의 다음 시대는 하이퍼스케일 시설만으로 지원될 수 없습니다. 대신, 중앙 집중식 캠퍼스와 분산형, 전력 조정, 상업적 규모의 데이터 센터를 위한 하이브리드 모델이 등장하고 있습니다. 이러한 전환은 지연 제약, 데이터 주권需求, 에너지 현실, 및 계속적인 하이퍼스케일 확장의 물리적 한계에 의해 주도되고 있습니다.

트레이닝과 추론의 분기

트레이닝은 여전히 중앙 집중식 활동입니다. 그것은 대규모 클러스터, 고속 데이터 파이프라인, 및 장기간의 작업을 요구하며 규모의 경제를 이익으로 합니다. 하이퍼스케일 캠퍼스는 이를 위해 최적화되어 있습니다. 그러나 추론은 다르게 작동합니다. 그것은 짧은 기간, 높은 볼륨, 지연 민감도, 및 지리 또는 기업 경계와 종종 연관되어 있습니다. Akamai의 최근 연구에 따르면 대부분의 조직은 현재 임계 AI 사용 사례에 대해 500 밀리초 이하의 종단 간 지연을 목표로 하고 있으며, 다중 에이전트 워크플로는 단순히 네트워크 전송 및 CPU 측면의 실행으로 인해 그 임계값을 초과합니다.

지연은 추상적인 지표가 아닙니다. 로봇공학 및 자율 시스템에서 제어 루프는 종종 100에서 1,000 헤르츠의 속도로 1에서 10 밀리초마다 실행됩니다. 任意의 지능은 이러한 타이밍 제약을 존중해야 합니다.遠方 데이터 센터로의 50 밀리초 왕복은 제어 체제를 완전히 파괴합니다. 금융 거래 및 사기 탐지에서 밀리초는 경제적 결과를 결정합니다. 산업 자동화에서 지연된 추론은 공정을 불안정하게 하거나 안전을 위협할 수 있습니다. 또한 게임, AR/VR, 및 실시간 조종사와 같은 상호작용 경험에서 반응성은 100에서 150 밀리초 이상으로 급격히 저하됩니다.

현대 인공지능 시스템은 점점 더 다중 에이전트 워크플로우에 의존하여 수십 개의 순차적 호출의 체인을 구성합니다. Akamai의 분석에 따르면 CPU 측면의 실행은 총 지연의 대부분을 차지할 수 있으며, 각 네트워크 왕복은 추가적인 지연을 추가합니다. 50개의 순차적 호출을 갖는 워크플로우는遠方 하이퍼스케일 지역으로 라우팅될 때 몇 초의 전송 지연을 초래할 수 있습니다. 동일한 워크플로우를 동일한 캠퍼스 또는 메트로 지역에 있는 超로컬 데이터 센터에 배치하면 물리학이 달라집니다. 로컬 추론은 1에서 5 밀리초의 왕복 지연을 제공할 수 있습니다. 원격 지역에서 몇 초가 걸리는 50 단계 워크플로우는 로컬에서 50에서 250 밀리초 내에 완료될 수 있으며, 기업의 지연 예산을 유지합니다.

데이터 주권 및 그리드 현실이 로컬 배포를 주도

지연은 이야기의 일부만입니다. 규제 산업의 경우, 데이터 주권은 종종 로컬 추론의 주요 동인이 됩니다. 기업 방화벽 뒤에서 인공지능 워크로드를 실행하면 기존의 보안 주변을 보존하고, 멀티 테넌트 노출을 줄이고, 규제를 단순화하며, 민감한 데이터를 공유 클라우드 인프라에서 유지할 수 있습니다. 하이퍼스케일 제공업체는 강력한 보안을 제공하지만, 공격 표면과 신뢰 체인은 본질적으로 더 넓습니다. 기업은 기존의 보안態勢와 일치하는 추론 아키텍처를 더 이상 선호합니다.

지연 및 보안에 대한 우려 외에도 전력 가용성은 동등하게 중요한 제약이 되고 있습니다. 대규모 하이퍼스케일 캠퍼스는 종종 전송 제약 및 인터커넥션 큐로 인해 수년간의 지연을 겪습니다. 특히 기존 부하 또는 분산 발전 근처에 위치한 더 작은 상업적 규모의 배치는 훨씬 더 빠르게 에너지화될 수 있습니다. 이것은 중요합니다. 인공지능 수요는 기이한 역설과 충돌합니다.

운영자가 새로운 그리드 연결을 확보하는 데 어려움을 겪는 동안, 엄청난 양의 재생 가능 에너지가 절단되고 있습니다. 전 세계적으로, 재생 가능 에너지 절단은 현재 연간 200테라와트시 이상을 초과합니다. 미국에서는 절단이 약 20테라와트시로 추정됩니다. ERCOT은 최근 1년 동안 풍력 및 태양광 발전의 9테라와트시 이상을 절단했습니다. 한편 CAISO는 2024년에 3.4테라와트시의 태양광 및 풍력을 폐기했습니다. 태양광은 절단된 출력의 93%를 차지했습니다. 에너지 시스템 조사에 따르면 태양광 및 풍력은 그리드 용량을 초과할 때 상당한 절단을 겪습니다. 태양광 절단은 특히 중간 강도 피크를 갖는 지역에서 일반적이며, 풍력 절단은 비피크 시간이나 제약된 구간에서 발생합니다. 발전 근처에 위치한 분산 데이터 센터, 특히 태양광 풍부한 지역은 유기된 에너지를 유용한 추론 능력으로 전환할 수 있습니다.

하이퍼스케일 캠퍼스는 여전히 트레이닝에 필수적이지만, 물리적 및 경제적 한계에 직면하고 있습니다. 전송 그리드에 연결하는 것은 긴 과정이며, 새로운 변전소, 전송 업그레이드, 다중 기관 허가, 및 커뮤니티 검토를 필요로 합니다. 이러한 과정은 일반적으로 수년이 걸립니다. 하이퍼스케일 시설은 대규모 토지 부지, 상당한 물 할당, 및 복잡한 환경 승인을 필요로 합니다. 커뮤니티는 소음, 물 사용, 및 토지 영향으로 인해 새로운 데이터 센터 개발에 반대하고 있습니다. 또한 중앙 집중식 캠퍼스는 위험을 집중시키므로 날씨 이벤트, 그리드 중단, 또는 지정학적 혼란으로 인해全球 컴퓨팅 능력의 큰 부분이 영향을 받을 수 있습니다. 분산 아키텍처는 지리적 중복성 및 운영 복원力を 제공합니다.

미래는 다층 인공지능 아키텍처

추론 컴퓨팅이 원활하게 실행되도록 보장하기 위해, 효율성은 원시 능력만큼 중요해질 수 있습니다. 추론은 지속적으로 에너지를 소비하며, 산업 분석가들은 추론이 궁극적으로 인공지능 관련 에너지 소비의 대부분을 차지할 수 있다고 제안합니다. 지역 재생 가능 에너지 통합, 전송 손실 감소, 적절한 배치, 개선된 열 프로파일, 및 높은 사용률로 인한 효율성은 지속 가능한 방식으로全球 인공지능 수요를 충족하기 위해 필수적입니다. 분산 상업적 규모의 데이터 센터는 에너지가 풍부하거나 저렴하거나 사용되지 않는 곳에 위치할 수 있으므로 이러한 이점을 제공할 수 있습니다.

인공지능 인프라의 다음 단계는 하이퍼스케일 캠퍼스를 지배하는 트레이닝, 분산 상업적 규모의 데이터 센터를 위한 추론, 및 초로컬 워크로드를 위한 에지 디바이스의 혼합입니다. 이러한 다층 아키텍처는 전력, 지연, 보안, 및 규모의 물리적 현실을 반영합니다. 인공지능이 모든 산업의 실시간 시스템에 내장됨에 따라, 인프라는 추론을 世界에 제공하기 위해 진화해야 합니다.

제프 트라만(Jeff Thramann), M.D.는 130개 이상의 특허에 이름을 올린 발명가이자 연속 기업가로 6개의 회사를 설립하고 매각하였다. LT350의 설립자이자 최고경영자로 그는 분산 컴퓨팅 아키텍처와 기존 인프라를 활용하여 데이터 센터의 영향을 최소화하는 차세대 데이터 센터 설계에 중점을 둔 의사-기업가이자 AI 인프라 전략가이다.