사상 리더

AI의 새로운 디지털 격차: 에지-레디, CPU-최초 모델이 비용 전쟁에서 승리할 이유

mm
Unite.AI를 Google의 선호 소스에 추가

전 세계 인공 지능(AI) 시장은驚人的 속도로 확장하고 있다. 2024년에 AI 시장은 257.68억 달러로 평가되었으며, 2025년 말까지 371.71억 달러로, 2032년까지 2.4조 달러로 급증할 것으로 예상된다. 이는 거의 10년 만에 10배 이상의 증가로, 현대 기술 발전의 역사에서 가장 변革적인 기술 붐 중 일부와 경쟁하는 속도이다.

過去 10년 동안, 약 1,500개의 신규 AI 회사가 각각 150만 달러 이상의 투자를 확보했으며, 이는 혁신의 물결을 나타내는 것만 아니라, 또한 강력한 경쟁의 존재를 나타낸다. 기존 회사들도 관망하지 않고 있다. 1월 McKinsey 산업 보고서에 따르면,驚人的 92%의 조직이 다음 3년 동안 AI 지출을 증가시킬 계획이다.

하지만 AI 채택이 가속화됨에 따라, 이를 지원하는 인프라는 균열을 보여주고 있다. 지난 2년 동안, AI는 눈에 띄는 데모에서 지속적인 실세계 워크로드로 전환되었다.

진정한 병목 현상은 모델 품질이 아니라, 모델이 실행되는 위치와 방법에 있다. 새로운 디지털 격차가 형성되고 있으며, 이는 데이터나 인재에 대한 접근과 관련이 아니라, 컴퓨팅 전략과 관련이 있다. 조직은 중요한 갈림길에 서 있다: GPU 중심의 클라우드 중심 시스템에 계속 의존하거나, 더 가벼운 에지-레디, CPU 최초 아키텍처를 채택하여 규모에 따라 더 저렴하게 실행할 수 있고, 다양한 환경에서 더 쉽게 배포할 수 있으며, 개인 정보 보호 및 대기 시간 요구 사항과 더 잘 일치하는 아키텍처를 채택할 수 있다.

이 아키텍처 선택은 중요하다. 모델을 구축하는 것이 아니라, 모델을 실행하는 것이 실제 부담이다. 이는 추론 비용이 빠르게 훈련 비용을 초과하고, 대규모 AI의 경제를 정의한다.

추론이 AI 예산을 먹고 있다

헤드라인은 종종 거대한 모델을 훈련시키는巨大한 비용을 강조하지만, 추론은 결코 멈추지 않는 비용이다. 스탠퍼드의 2025 AI 지수는 작은 모델의 급속한 발전이 2022년 말과 2024년 말 사이에 “GPT-3.5 수준”의 성능을 280배 이상 낮췄음을 나타낸다. 그러나 같은 보고서는 산업의 추론 효율성 최적화에 대한 집착을 강조한다.

클라우드 GPU 가격은 압력을 높였다. 고급 GPU 인스턴스를 대여하는 것은 3년에서 5년 사이에 동일한 하드웨어를 직접 구입하는 것보다 거의 두 배의 비용이 될 수 있다. 탄력성은 피크 워크로드에 유용하지만, 장기 실행 추론 “임대”는 조용히 예산을 소진한다. 심지어 NVIDIA도, 가속기에 의존하는 비즈니스에도 불구하고, 추론을 최적화하기 위해 지난 1년간 공격적으로 노력했다. 이는 실제 전투가 훈련 성능에서 서비스 경제학으로 이동하고 있음을 나타낸다.

이 새로운 비용 압박은 조직이 컴퓨팅 전략을 재고하지 않거나 재고할 수 없는 경우, 뒤처질 위험이 있다.

에지(Edge)와 CPU가 비용 곡선을 변경하는 이유

현실은 GPU 중심의 추론이 지속 불가능한 경제학을 tạo한다. 비싼 GPU에서 대규모 실시간 AI 워크로드를 실행하는 것은 비용을 증가시키고 하드웨어 감가상각을 가속한다. 혁신 주기는 thường 18개월 미만으로, 인프라 투자는 빠르게 가치가 떨어진다. 이는 AI 칩 구매와 관련된 감가상각 비용에 대한 분석가의 경고를 초래했다. 예를 들어, 알파벳은 2026년까지 280억 달러의 감가상각 비용을 흡수할 것으로 예상된다.

공장, 클리닉, 소매점, 모바일 장치는 AI가 점점 더 많이 작동해야 하는 곳이다. 모든 요청을 중앙 집중식 GPU 클러스터로 보내는 것은 종종 작업에 맞지 않는 도구이다. 왜냐하면 그것은 비싸고, 에너지 집약적이며, 대기 시간과 개인 정보 보호 문제에 취약하기 때문이다.

에지 환경은 동질적인 GPU 농장이다. 그것들은 다양한 CPU의 함대이다: 서버, 강화된 PC, 랩톱, 휴대폰이다. 이 다양성은 CPU를 비용 효율적인 AI 배포의 자연스러운 기반으로 만든다.

이 새로운 풍경에서, CPU는 후퇴가 아니다. 그것은 확장 가능하고 접근 가능한 AI를 위한 비용智能한 길이다.

GPU는 AI의 “개인 제트기”

모델이 더 크고 복잡해짐에 따라, 더 많은 GPU 파워를 필요로 한다. 이는 인프라와 에너지 비용을 증가시키고, 또한 고급 AI 기능을 소유할 수 있는 사람들의 손에 집중시킨다.

연구에 따르면, 큰 일반적인 생성 모델은 작은 작업 특정 시스템보다 훨씬 더 많은 에너지를 사용하고, 1,000회 추론당 훨씬 더 많은 탄소 배출량을 생성한다. 심지어 매개 변수 수를 제어할 때도, GPU 중시 아키텍처는 금전적 및 운영상의 장벽을 증폭한다. 시간이 지남에 따라, 이는 병목 현상을 생성하며, 스타트업, 연구자, 및 자원 부족한 커뮤니티가 최첨단 AI 도구에 접근하는 것을 불균형하게 어렵게 만든다.

이것은 배타성 문제이다: GPU는 AI의 개인 제트기와 같다. 빠르고 강력하지만, 소수 잘资본化된 조직만이 접근할 수 있다.

그러나 이러한 제한을 인정한다고 해서 GPU를 완전히 거부하는 것은 아니다. 특정 모델 클래스와 처리 패턴에 대해서는 여전히 예외적이다. CPU 최초 전략은 반-GPU가 아니다. 그것은 비용智能한 해결책이다.

이 접근법은 접근성을 넓히고, AI 배포가 효율성에 의해 주도되는 것을 보장한다. GPU 배타성의 미래가 아닌, CPU가 확장 가능하고, 지속 가능하며, 포용적인 AI 배포의 문을 연다.

CPU 주도 모델로의 필수적인 전환

AI 경제가 지속 가능하게 확장하기 위해서, 모델을 훈련하고 배포하는 방법을 재구상해야 한다. 하나의 접근법은 훈련 중에 높은 엔트로피 데이터와 에지 케이스를 우선시하는 것이다. 이러한 입력은 의미 있는 진행을 驅り하고, 거대한 데이터셋의 필요성을 줄일 수 있으며, 모델이 더 적은 매개 변수로 실행될 수 있게 하면서도 여전히 매우 효과적일 수 있다.

대량 CPU, 랩톱, 스마트폰, 서버 또는 사물 인터넷(IoT) 장치에서 작동할 수 있을 만큼 컴팩트한 모델은 추론 비용과 에너지 사용량을 크게 줄인다. 또한 장치에서 직접 실시간 처리를 가능하게 하여 대기 시간을 절약하고, 민감한 데이터를 로컬로 유지함으로써 개인 정보 보호를 강화한다.

이 전환은 비용에 관한 것이 아니다. 그것은 평등에 관한 것이다. 의료와 같은 분야에서 “사막”이 이미 존재하는 경우, 에지-레디 CPU 배포는 중앙 집중식 컴퓨팅에 의존하지 않고, 클리닉, 콜 센터 또는 필드 장치에 고급 AI 도구를 직접 제공함으로써 접근 격차를 메울 수 있다. 결과는 더广泛한 채택, 개선된 복원력, 및 AI 혜택의 더 포용적인 분배이다.

권력에서 접근으로: CPU는 AI의伟大 평등자

다음 몇 년은 가장 강력한 AI 모델을 구축하는 것이 아니라, 효율적으로, 지속 가능하게, 및 확장 가능하게 배포하는 것을 테스트할 것이다. 에지-레디, CPU 최적화 모델은 앞으로 나아갈 길을 제공한다. 대량 하드웨어에서 효과적으로 작동하도록 AI를 가능하게 함으로써, 그것은 스타트업과 연구자에게 장벽을 낮추고, 취약한 공급망에 대한 의존성을 줄이며, 중앙 집중식 GPU 클러스터가 실용적이지 않은 환경에서 고급 애플리케이션을 가져온다.

전체 비용 per 트랜스크립션 시간, 배포 가능성 점수, 에지 준비도를 포함한 지표를 통해 AI 인프라를 평가하면, 솔루션이 벤치마크 정확도에 의해 판단되는 것만 아니라, 실제 세계에서 확장 가능하게 및 포용적으로 확장할 수 있는 능력에 의해 판단된다.

높은 став이 있다. 산업이 GPU를 기본값으로 계속 취급한다면, 접근은 배타적일 것이며, 혁신은 집중될 것이며, 공공 서비스, 의료, 및 소외된 부문으로의 확산은 지연될 것이다. 그러나 CPU 최초, 에지-레디 전략이 지배한다면, AI는 더 복원력 있게, 사적으로, 및 지속 가능하게 될 수 있다. 이것은 단순히 경쟁을 평준화하는 것이 아니라, 그것을 재정의한다.

리투 메흐로트라, 슈냐 랩스 의 창립자이자 최고경영자 는 소비자 기술 및 AI 분야의 유능한 리더로, 북미, 아시아, 유럽에서 기업을 확장해왔다. 암 생존자로서, 그녀는 현재 접근성, 품질, 및 비용의 장벽을 허물어 글로벌 정신 건강을 개선하기 위해 헌신하고 있다.