인터뷰

코어웨이브의 Corey Sanders, Senior Vice President Product – 인터뷰 시리즈

mm
Unite.AI를 Google의 선호 소스에 추가

코리 샌더스, 코어웨이브의 Senior Vice President Product는, 가장 빠르게 성장하는 AI 중심 클라우드 플랫폼 중 하나에서 제품 전략과 실행을 책임지고 있습니다. 그는 혁신을 확대하고, 고객과 함께 목적에 맞춘 솔루션을 구축하며, 코어웨이브의 AI 인프라 시장에서의 입지를 강화하는 역할을 담당합니다. 코어웨이브에 합류하기 전, 샌더스는 마이크로소프트에서 20년 동안 클라우드 엔지니어링, 산업별 플랫폼, 상업적 솔루션 전략, 대규모 기업 파트너십 등 다양한 분야에서 선임 리더십 역할을 수행했으며, 기술 실행과 시장 전략을 연결하는 경험을 쌓았습니다.

(CRWV ) (MSFT )

코어웨이브는 고성능 컴퓨팅과 대규모 인공 지능 워크로드를 위해 특별히 설계된 AI 네이티브 클라우드 제공업체입니다. 이 회사는 미국과 유럽 전역에 걸쳐 데이터 센터를 신속하게 확장하고 있으며, AI 훈련, 추론, 고급 컴퓨팅 사용 사례를 위해 설계된 GPU 가속 인프라와 소프트웨어를 제공합니다. 일반적인 클라우드 대신 목적에 맞춘 아키텍처에 초점을 맞춤으로써, 코어웨이브는 성능, 확장성, 대규모 효율성을 추구하는 AI 연구소와 기업들을 위한 중요한 인프라 파트너가 되었습니다.

마이크로소프트에서 20년 이상 동안 윈도우 엔지니어링, 클라우드 판매 전략, 마이크로소프트 클라우드 สำหร 산업 등 다양한 분야에서 일했습니다. 이 경험이 기업의 채택에真正한驱动力を 가르쳐주었습니다. 그리고 코어웨이브에서 어떻게 이러한 교훈을 적용하고 계시는지 알려주세요.

기업의 채택은 특정 고객 문제를 해결하는 것으로 시작됩니다. 혁신 자체는 기업에게 그다지 중요하지 않습니다. 고객의 입장에서 그들이真正로 고민하는 문제를 이해하는 것이 중요합니다. 비용, 운영 복잡성, 고객과의 연결, 글로벌 팀 및 새로운 제품 라인의 관리 등입니다. 고객은 혁신적인 접근 방식을 취할 의향이 있지만, 가장 중요한 것은 그들의 문제를 해결하는 것입니다. 제품 설계에서 가장 빈번하게 하는 실수는 제품의 멋지음에 너무 집착하는 것입니다. 소비자 시장에서는 이것이 중요할 수 있지만, 기업 고객은 궁극적으로 유틸리티보다 멋지음에 더 관심이 있습니다.

코어웨이브는 종종 목적에 맞춘 AI 인프라를 제공한다고 설명됩니다. 실제로 목적에 맞춘다는 것은 제품 관점에서 무엇을 의미하며, 일반적인 클라우드 플랫폼은 AI 워크로드에서 어떤 어려움을 겪는가요?

목적에 맞춘 가장 큰 이점은 모든 일반적인 사용 사례를 해결할 필요 없이 서비스를 제공하고 전달할 수 있는 능력입니다. 소프트웨어와 하드웨어의 두 가지 예를 들어보겠습니다.

소프트웨어 측면에서, 우리의 Object Storage 오퍼링은 LOTA 캐시를 통해 AI 워크로드에 특화되어 있습니다. 이것은 GPU 노드에 직접 배포되고, 애플리케이션에 대한 S3 엔드포인트를 제공하며, 여러 노드에 걸쳐 캐시를 확장하여 GPU 요청에 응답합니다. 이것은 GPU까지의 처리량을 7 GB/s까지 증가시켜, 일반적인 클라우드가 제공하는 것을 훨씬 초과합니다. 우리는 AI 특정 워크로드, 읽기/쓰기 분할, 클러스터 레이아웃에 대한 설계 가정으로 인해 이를 달성할 수 있습니다. 고객이 이것을 데이터베이스 또는 전자 상거래 사이트에 호스팅하는 데 사용한다면, 동일한 영향을 미치지 않을 것입니다. 이것이 목적에 맞춘 소프트웨어의 정의입니다.

하드웨어 예는 유사합니다. 최신 NVIDIA (NVDA ) SKU의 광범위한 배포, 많은 경우 액체 냉각이 필요한 경우, 코어웨이브는 이러한 요구 사항을 지원하기 위한 특정 전문 지식과 데이터 센터 설계를 구축했습니다. 더 큰 클라우드가 가역성에 맞춰서 구축한 다음 액체 냉각을 후에 추가하는 것과는 달리, 코어웨이브는 AI를 위한 데이터 센터를 처음부터 구축합니다. 이것은 최신 SKU 유형에 대한 비용을 절감하고 가용성을 높입니다.

아래는 언급된 LOTA 캐시의 그림입니다.

고객이 처음으로 AI를 확장할 때, 많은 경우에 그들은 오직 GPU에 접근할 수만 있다고 생각합니다. 하지만 모델을 대규모로 훈련하거나 제공할 때, 그들은 실제로 무엇을 놓치고 있는지 깨닫게 됩니다.

대규모 GPU 클러스터에서 워크로드를 실행하는 복잡성으로 인해, 주변 서비스가真正한 성공의 원동력이 됩니다. 이것은 명백한 것들, 즉 스토리지와 네트워킹뿐만 아니라, 관측 가능성, 오케스트레이션, 보안과 같은 중요한 운영 서비스도 포함합니다. 이것이 코어웨이브의 Mission Control 오퍼링이真正로 빛나는 부분입니다. 고객에게 노드 상태와 런타임에 대한 깊은 인식을 제공하고, 이를 오케스트레이션 엔진에 직접 통합합니다. 이것은 고객이 인프라를 1,000개의 개별 GPU로 보지 않고, 하나의 일관된 작업 实体로 취급할 수 있도록 합니다.

현재 고객의 결과를 개선하기 위한 상위 제품 우선순위를 무엇으로 설정하고 계시는가요? 성능, 신뢰성, 비용 예측 가능성, 개발자 경험 등입니다.

코어 플랫폼에서 우리는 항상 성능, 신뢰성, 관측 가능성을 중점적으로 다루고 있습니다. 고객이 반복 가능하고 예측 가능한 방식으로 작업을 실행할 수 있도록 하면서, 모든 GPU의 모든 TFLOP를 최대한 활용할 수 있도록 해야 합니다. 이를 넘어서, 우리는 SLURM과 같은 도구에서 온보딩을 단순화하는 데 집중하고 있습니다. 현재는 실험하기가意外로 어렵습니다. 용량 제한, 3년간의 약정, 시작하기 위해 전문가가 필요하기 때문입니다. 우리는 AI 플랫폼에서 혁신의 용이함을 다시 가져오고 싶습니다.

AI 워크로드가 훈련 중심에서 추론 중심으로 이동함에 따라, 이것이 인프라 설계와 제품 로드맵 결정에 어떻게 영향을 미치나요?

코어웨이브의 기존 차별화를 추론 요구 사항에 적용할 수 있는 중요한 기회가 있습니다. 예를 들어, 훈련을 위한 LOTA 캐시를 언급했지만, 이것을 KVCache와 통합하여 추론을 위한 강력한 차별점으로 만들 수 있습니다. 또한, Mission Control과 같은 도구는 추론에 더욱 중요해집니다. GPU 상태를 관찰하는 것이 고가용성의 에이전트 애플리케이션을 실행하는 데 중요하기 때문입니다.

다음 1~2년 동안, AI 클라우드 시장에서 리더십을 정의하는 것은 무엇일까요? 그리고 고객에게 가장 중요한 능력은 무엇일까요?

리더십은 두 가지로 정의될 것입니다. 첫째, 훈련을 위한不断 성장하는 규모 요구 사항을 제공하는 것입니다. 이것은 관측 가능성, 건강 모니터링, 자동 복구의 발전을 필요로 합니다. 수백 개에서 수만 개의 GPU로 분산된 글로벌 환경으로 이동할 때, 수동으로 실패에 응답하는 것은 불가능합니다.

둘째, 추론 및 에이전트 워크로드를 위한 올바른 서비스를 제공하는 것입니다. 이것은 글로벌 배포 능력과 실험을鼓励하는 비즈니스 모델을 필요로 합니다. 이것은 원래 클라우드가 성장한 사용 패턴이었습니다. 그리고 우리는 이것을 더好的 플랫폼 지원, 멀티 클라우드 기능, 멀티 리전의易用성으로 다시 가져오고 싶습니다.

以前, 산업별 클라우드 이니셔티브를 이끌었으며, 헬스케어, 소매, 금융 서비스, 제조, 주권 클라우드 등 다양한 분야에서 일했습니다. 이러한 垂直 분야에서 어떤 교훈이 AI 인프라에 직접적으로 적용되나요? 그리고 어떤 교훈은 적용되지 않나요?

GPU의 世代별 전환은 새로운 복잡성을 계속해서 도입합니다. 각 새로운 릴리스는 증가된 상호 연결성, 더 높은 메모리, 더 큰 전력 필요로 인해, 우리는 노드가 연결되는 방식과 소프트웨어가 제공되는 방식에 대한 가정을 다시 검토해야 합니다. 우리는 여기서 리더십을 유지하기 위해 이러한 작업에 집요하게 집중해야 합니다. 반면에, 가장 빠르게 개선되는 분야는 고객이 대규모 컴퓨팅 환경에서 달성할 수 있는 것입니다. 그들이 더 큰 컴퓨팅 풋프린트에 적응하는 속도는 ấn tượng적입니다.

AI 데이터 센터와 클러스터가 계속 확장함에 따라, 현재 가장 어려운 운영적인 도전은 무엇이며, 어떤 것들이 가장 빠르게 개선되고 있나요?

GPU의 世代별 전환은 설계와 소프트웨어에 새로운 복잡성을 계속해서 도입합니다. 각 새로운 GPU 릴리스는 증가된 상호 연결성, 더 높은 메모리, 더 큰 전력 필요로 인해, 우리는 노드가 연결되는 방식과 소프트웨어가 제공되는 방식에 대한 가정을 다시 검토해야 합니다. 우리는 리더십을 유지하기 위해 이러한 작업에 집요하게 집중해야 합니다. 가장 빠르게 개선되는 것은 고객이 대규모 컴퓨팅 환경에서 달성할 수 있는 것입니다.

AI 인프라에서 신뢰성은 단순히 업타임을 넘어섭니다. 코어웨이브는 신뢰성을 어떻게 정의하며, 고객의 관점에서 성공을 반영하는 지표는 무엇인가요?

대규모 운영에서 고객에게 가장 중요한 고려 사항은 단순히 작업을 완료하는 것입니다. 개별 실패 또는 느림은 예상됩니다. 핵심은 이러한 문제에 자동으로检测하고 응답하는 우리의 능력입니다. 이를 통해 작업이 이러한 도전에도 불구하고 완료될 수 있습니다. 이것이 우리가 Mission Control을 더 높은 수준의 서비스로 통합하는 이유입니다. 고객이 자동으로 실패에 응답할 수 있도록 해줍니다. 우리에게 성공은 노드 업타임에 관한 것이 아닙니다. 작업 성공에 관한 것입니다.

앞으로, AI 인프라에서 아직 과소평가된 주요 전환은 무엇인가요? 하드웨어 진화, 스택의 전문성, 주권 요구 사항, 또는 새로운 배포 모델과 관련이 있나요?

강화 학습(RL)의 AI 스택의 부흥은 아직 과소평가된 분야입니다. 초기 LLM 개발의 물결 동안에는 상대적으로 가시성이 낮았지만, RL은 사용자 환경의 변화를 더 잘 반영하는 AI 서비스를 만들기 위한 핵심 역할을 할 것입니다. 따라서 우리는 오늘날 제공하는 서버리스 RL 오퍼링에 대해 매우 흥奋합니다.

위대한 인터뷰에 감사드립니다. 더 많은 정보를 원하는 독자는 코어웨이브를 방문하시기 바랍니다.

앙투안은 유나이트.AI의 비전적인 리더이자 공동 설립자로서 AI와 로봇공학의 미래를 형성하고 촉진하는 데 대한 불변의 열정을 가지고 있습니다. 연속적인 기업가로서, 그는 AI가 사회에 전기와 같은 변화를 가져올 것이라고 믿으며, 종종 파괴적인 기술과 AGI의 잠재력에 대해 열광합니다.

作为 미래학자로서, 그는 이러한 혁신이 우리 세계를 어떻게 형성할지 탐구하는 데 헌신하고 있습니다. 또한, 그는 Securities.io의 설립자로서, 미래를 재정의하고 전체 부문을 재구성하는 최첨단 기술에 투자하는 플랫폼을 운영하고 있습니다.