사상 리더
AI 칩 경쟁에서 소프트웨어가 결정적 역할을 하는 이유

새로운 AI 가속기가 등장할 때마다 벤치마크 결과가 따라오는데, 이는 피크 처리량, 와트당 테라옵스, 놀라운 숫자들이 이 칩이 모든 것을 바꿀 것이라고 약속한다. 그러나 이러한 숫자들은 고객이 실제로 칩을 사용할 수 있는지 여부를 생략한다. 대부분의 경우, 고객은 칩을 사용할 수 없으며, 이것이 현재 AI 하드웨어 산업의 실제 이야기이다. 이 산업은 소프트웨어 성숙도 문제에 직면해 있으며, 대부분의 회사들은 아직 공개적으로 이를 인정하지 않는다.
누구도 말하지 않는 간격
실리콘 개발 주기는 2~4년으로 진행되며, AI 모델 랜드스케이프는 수주에서 수개월 단위로 진화하고 있다. 이를 기반으로 하는 가치 사슬 문제는, 차량, 공장, 병원, 기기 등 최종 사용 사례가 기능적으로 성숙하고 측정 가능한 수익을 창출하기 시작한다는 것이다. 이러한 성숙도는 소프트웨어 적응을 요구하며, 이는 다시 하드웨어 변경을 필요로 한다. 이러한 세 가지 계층은 근본적으로 다른 속도로 작동하며, 이러한 불일치는 시장 전반에 걸쳐 증가하는 마찰의 근본 원인이다. 대규모 언어 모델 추론을 실행하는 데 필요한 소프트웨어 스택은 이전 기계 학습 작업을 위해 구축된 것과 근본적으로 다르다. 하드웨어 개발 타임라인은 이러한 주기에 맞추어 압축되지 않았다. 현재 새 실리콘을 출하하는 회사들은 고객에게 칩의 능력을 완전히 해방할 수 없는 소프트웨어와 함께 실리콘을 제공한다. 이는 시장 전반에 걸쳐 반복되는 패턴을 생성한다. 즉, 인상적인 실리콘, 미성숙한 소프트웨어, 느린 채택, 그리고 손실된 수익이다. 칩은 설계된 대로 작동한다. 문제는 고객이 쉽게 칩을 사용할 수 없다는 것이다.
자동차 산업이 어떻게 되었는지 생각해 보라. 자동차 자체는 20세기 중반으로는 대부분 해결된 문제였다. 그러나 소프트웨어가 차별화 요소가 되었을 때, 가장 오랜 제조 유산을 가진 회사들이 가장 많이 어려움을 겪었다. 포드와 GM은 엔진을 구축하는 방법을 알았지만, 운영 체제를 구축하는 방법에는 무릎을 꿇었다. AI 하드웨어 산업은 현재 동일한 전환을 겪고 있으며, 이 평행선은 불편하게도 정확하다. NVIDIA (NVDA ) 는 소프트웨어 네이티브 디스럽터의 역할을 수행하며, 전통적인 반도체 회사들은 아직 개발자 에코시스템을 실리콘과 함께 판매하는 방법을 배우고 있다.
NVIDIA의 지배력은 거의 최고의 칩을 보유한 것이 아니다. CUDA(Compute Unified Device Architecture)는 20년 된 기술로, 이는 기술 부채를 의미한다. 그러나 NVIDIA가 실제로 구축한 것은 AI 컴퓨팅의 운영 체제이다. 즉, 개발자와 OEM이 생산에서 신뢰할 수 있는 예측 가능한 성숙한 에코시스템이다.
고객은 소프트웨어 성숙도와 통합 위험에 따라 플랫폼을 선택한다. 따라서 새로운 가속기가 생산급 소프트웨어 스택 없이 도착하면 상업적 대화는 시작되기 전에 끝난다.
첫 번째 모델까지의 시간, 즉 고객이 특정 가속기에 실제 AI 작업을 실행하는 데 걸리는 시간은, 피크 처리량보다 훨씬 더 의미 있는 상업적 지표이다. 이것이 하드웨어 회사들이 가장 준비가 안 된 대화이다.
추론이 실제 시장이다
비즈니스 언어는 수익과 손실이다. 모든 AI를 배포하는 회사는 동일한 질문에 답해야 한다. 즉, 돈은 어디에 있으며, 이를 획득하지 못하는 이유는 무엇인가? 훈련은 필수적인 단계이지만, 상업적인 AI는 추론에서 살고 있으며, 이 시장은 거의 시작되지 않았다.
여기에는 대칭성이 있다. 훈련은 하나의 사용 사례를 다루지만, 추론은 무한한 사용 사례를 다룬다. 자동차, 공장, 병원, 전화기 또는 창고에서 AI를 적용하는 모든 응용 프로그램은 추론을 필요로 한다. 자동차의 안전 시스템을 실행하는 칩은 데이터 센터 전력을 사용할 수 없으며, 공장에서 실시간 추론을 실행하는 장치는 높은 지연을 허용할 수 없다. 에지 추론 시장은 전력 효율성, 물리적 제약 및 산업의 안전 및 신뢰성 요구 사항에 특화된 실리콘을 필요로 한다.
구글이 최근 8세대 TPU를 훈련과 추론을 위한 두 개의 별도 칩으로 분리한 결정은 주목할 만하다. 이 아키텍처 선택은 두 가지 워크로드가 너무 많이 분리되어 단일 디자인에서 둘 다를 최적화하는 것이 더 이상 의미가 없음을 인정한다. 가장 큰 AI 인프라를 운영하는 회사之一가 워크로드를 분리하는 것이 더 중요하다고 결정했을 때, 이는 시장의 방향을 나타낸다. 즉, 에지에서 대량으로 배포되는 목적을 위한 추론 실리콘으로 향하는 것이다.
우리는 추론 랜드 그랩에서 대부분의 시장은 여전히 훈련을 중심으로 조직되어 있다.
레거시의 구조적 한계
대량 생산에 가장 잘 위치한 회사들은 구조적으로 추론에서 살고 있는 시장에 서비스를 제공할 수 없다. 자동차 고객은 공급업체가 10년 동안 구성 요소 가용성을 보장해야 한다. 인텔과 같은 일반적인 반도체 회사는 이를 약속하지 않는다. 이러한 구조적 제약으로 인해 전체 산업이 서비스를 받지 못하게 된다. 협상으로는 이것을 변경할 수 없다.
NVIDIA의 에지 AI 플랫폼은 이미 소프트웨어 스택에 변경을 요구하지 않는 PIN 호환 대안으로부터 도전을 받고 있다. 이는 와트당 성능을 개선하는 것으로, 고객은 칩을 교체하고 모든 것을 유지할 수 있다. 이것은 NVIDIA의 에지 위치의 가장 방어 가능한 부분에 대한 직접적인 상업적 공격이다.
CUDA에서概念을 증명한 회사는 경제적으로 대량 배포를 요구하는 저전력 실리콘으로 재구성하는 것을 발견한다. 조직이 수만 대의 장치를 롤아웃할 때, 단위당 비용과 전력 소비가 결정적인 요소가 된다. 추론 시장에서 발생하는 순서는 간단하다. 즉, 작동하는 것을 사용하고, 테스트하고, 경제적으로 배포하는 방법을 찾는 것이다. AI를 채택하는 속도에 따라, 소프트웨어와 에코시스템의 우위를 확립하는 창은 분기 단위로 측정된다.
대부분의 회사들이 건너뛰는 엔지니어링 투자
AI 하드웨어 회사는 강력한 칩을 출하하지만, 소프트웨어는 칩을 완전히 실행할 수 없다. 생산급 시스템 소프트웨어, 즉 추론 런타임, 컴파일러 최적화 및 워크로드 활성화는 깊은 전문 엔지니어링을 필요로 하는데, 대부분의 하드웨어 회사가 이를 내부에 가지고 있지 않다.
이러한 능력을 구축하는 것은 컴파일러 엔지니어와 런타임 아키텍트를 고용하여 칩이 이론적으로 가능하지만 고객이 실제로 배포할 수 있는 간격을 닫는 것을 의미한다. 회사는 또한 수익이 정당화되기 전에 도구를 투자해야 한다. 수익이 도착할 때까지 창이 닫히기 때문이다. 이 투자를 건너뛰는 회사는 단지 뒤처지지 않는다. 계약을 잃는다.
대량으로 배포되는 칩은 가장 배포 가능한 칩이다. 배포 가능성은 소프트웨어 품질의 함수이다. 주요 다운스트림 구매자, 즉 OEM, 하이퍼스케일러, 엔터프라이즈 고객은 이전에 벤치마크가 잘되지만 통합이 잘되지 않는 실리콘에 의해 피해를 입었다. 그들은 에코시스템 성숙도와 통합 위험에 따라 선택한다. 소프트웨어를 1등급 엔지니어링 우선순위로 다루는 회사는 더 많은 파일럿을 생산 계약으로 전환하고 수익을 더 빠르게 달성한다. 소프트웨어를 출하 후 생각하는 회사는 기술적으로 우수한 실리콘을 보유하고 있지만, 더 성숙한 스택을 지원하는 하위 실리콘에 패한다.
시계는 이미 작동하고 있다
다음 단계에서 상당한 시장 점유율을 획득할 수 있는 AI 하드웨어 회사는 현재 에코시스템 우위를 구축하고 있다. 이는 나중에 입장하는 회사가 복제하기 어려울 것이다. 소프트웨어 유연성, 즉 다음 테이프 아웃을 기다리지 않고 새로운 모델 아키텍처에 적응할 수 있는 능력은 상업적으로 관련성이 있는 실리콘과 수익을 생성하기에 충분한 자금을 조달하기 위해 다음 세대를 주기적으로 반복하는 실리콘을 구분한다.
현재 AI 하드웨어 랜드스케이프에서 엔지니어링 팀, 파트너십 계약, 상업적 파일럿에서 이루어지는 결정은 2028년에 어느 회사가 여전히 관련이 있는지 결정할 것이다. CUDA의 20년 간격은 에코시스템의 깊이를 기반으로 구축된 방어선이다. 그러나 소프트웨어를 지속적인 엔지니어링 우선순위로 다루는 회사는 시간이 지남에 따라 동일한 깊이를 구축할 수 있다.
산업이 답해야 할 질문은 어느 회사가 다른 회사의 것이 너무 깊이 자리 잡아서 대체하기 어렵게 되기 전에 에코시스템의 깊이를 구축하기에 충분한 속도로 이동하는지이다.
(INTC )











