인터뷰
켄 클래피, VDURA의 CEO – 인터뷰 시리즈: 다시 돌아온 대화

켄 클래피, VDURA의 CEO이자 사장은 고객 중심의 비즈니스와 제품 리더로서 클라우드 및 엔터프라이즈 인프라, 하드웨어 및 소프트웨어 개발, 전략적 성장 추진에 대한 전문적인 지식을 갖춘 전문가입니다. 그의 경력 동안 그는 높은 성과를 보이는 글로벌 팀을 구축하고 이끌었으며, 기업 전략을 수행하고, 수익성 있는 매출 성장과 제품 혁신을 추진하며, 성과가 저조한 비즈니스를 회생시켰습니다. VDURA의 지휘를 맡기 전에, 클래피는 시게이트 테크놀로지에서 선임 리더십 역할을 맡았으며, 여기서 그는 엔터프라이즈 시스템과 P&L을 담당하는 선임 부사장으로서 활동했으며, 이전에는 자이라텍스, 아답텍, 유로로직에서 리더십을 맡았습니다. 그는 엔터프라이즈 스토리지와 고성능 컴퓨팅에 대한 수십 년간의 경험을 가지고 있습니다.
(STX )VDURA는 “속도와 내구성”이라는 모토 아래 인공 지능과 고성능 컴퓨팅 워크로드를 최적화한 현대적인 스토리지 솔루션을 제공하는 소프트웨어 정의 데이터 인프라 회사입니다. 회사의 플래그십 VDURA 데이터 플랫폼은 유니파이드 아키텍처에서 플래시 첫 번째 병렬 파일 시스템 성능과 객체 스토리지 내구성을 결합하여 수천 개의 클라이언트와 노드에 걸쳐 선형적으로 확장되며, 동시에 운영을 단순화하고 총 소유 비용을 낮춥니다. 원래 파나사스에서 설립되어 2024년에 브랜드를 변경한 VDURA의 플랫폼은 온프레미스, 클라우드, 하이브리드 환경에서 고급 자동화, 메타데이터 가속, 확장 가능한 성능을 제공하며, 엔터프라이즈, 연구, 미션 크리티컬 AI 및 HPC 사용 사례에서 GPU 클러스터를 공급하고 데이터를 보호하기 위한 설계입니다.
고성능 컴퓨팅과 엔터프라이즈 스토리지 분야에서의 경험은 인공 지능 인프라에서 스토리지가 제한 요소가 되는您的 관점을 어떻게 형성했나요?
세계에서 가장 요구되는 컴퓨팅 환경을 위한 스토리지 시스템을 구축하면서, 실제 병목 현상이 어디에 있는지에 대한 직관을 개발하게 됩니다. 자이라텍스와 시게이트의 클러스터 스토어 작업에서, 우리는 슈퍼컴퓨터를 위한 스토리지 문제를 해결했습니다. 여기서 물리학은 용서가 없습니다. 컴퓨팅을 공급하거나 공급하지 않습니다.
현재 인공 지능 인프라에서 내가 보는 것은 동일한 근본적인 제약입니다.只是 다른 경제학적 상황에서 나타납니다. 네오클라우드 시장에서 GPU에 대한 집착은 이해할 수 있습니다. NVIDIA는 희귀하고 변革적인 자원을 만들었습니다. 그러나 스토리지가 쉽게 확장할 것이라는 가정은 언제나 깨질 수밖에 없었습니다. 그것은 깨졌습니다. 스토리지 비용은 모든 플래시 배포에서 인공 지능 인프라 예산의 20~30%로 증가하고 있으며, 다른 구성 요소보다 더 빠르게 증가하고 있습니다. 대규모 컴퓨팅 환경에서 스토리지가 결합 제약이 되는 것을 지켜보면서, 시장의 다른 부분이 그 현실에 도달하는 것을 놀라지 않습니다.
네오클라우드 인프라 랜드 그랩期间에 스토리지 계획이 우선순위에서 밀려난 이유는 무엇인가?
구조적인 가정들이 정확히 잘못된 시점에 결합했습니다. 첫째, 플래시 가격이暂时적으로 유리했습니다. NVMe SSD는 충분히 저렴하고 풍부하여 모든 플래시로 가는 것이 합리적인 기본값으로 느껴졌습니다. 그것은 건축적인 지혜가 아니었습니다. 그것은暂时적인 경제적 창구의産物이었으며, 운영자는 그것을 영구적인 조건으로 착각했습니다.
둘째, 경쟁적 역학은 다른 모든 것보다 GPU 수를 상위에 두었습니다. 네오클라우드 시장은 랙에 얼마나 많은 NVIDIA (NVDA ) 칩을 넣을 수 있는지에 따라 평가되었습니다. 스토리지 비용은 약 10%의 항목으로, 심각한 검토 없이 조달을 통과할 수 있었습니다. 셋째, 모든 플래시 결정은 복잡성을 제거했습니다. 하나의 계층, 하나의 미디어 유형, 조달 및 운영이 간단했습니다. 문제는 “간단한” 것과 “경제적으로 지속 가능한” 것이 더 이상 같은 것이 아니라는 것입니다. NAND 공급이 긴장하고 가격이 급등한 순간, 인프라 결정은 이미 잠겨있었습니다.
운영자가 스토리지가 GPU 활용에 미치는 영향을 보았을 때 가장 놀라는 점은 무엇인가?
관계는 대부분의 운영자들이 직접적으로 보지 못하는 Idle GPU까지 더 직접적입니다.頻繁한 체크포인트 생성으로 인한 버스트 쓰기 요구는 스토리지 계층이 충분히 빠르게 흡수하지 못하면 컴퓨팅을 중단시킬 수 있습니다. 전처리 및 데이터 파이프라인을 위한 지속적인 읽기 처리량 요구는, 충족되지 않으면, GPU에 작업을 공급하지 못합니다.
NVIDIA의 자체 DGX 가이드는 이를 정량화합니다. 텍스트 기반 LLM 훈련에는 약 0.5 GB/s의 읽기 처리량이 필요합니다. 물리적 AI 및 시각화 워크로드에는 약 4 GB/s의 읽기 및 2 GB/s의 쓰기 처리량이 필요합니다. 스토리지 아키텍처가 이를 제공할 수 없으면, GPU를 최대 용량으로 실행하지 못합니다. 스토리지가 허용하는 분수만큼 실행합니다.
아키텍처는 클러스터 규모에서 엄청나게 중요합니다. 중간자 없이 드라이브와 클라이언트 사이에 중간자를 두는 스토리지 시스템은 단일 드라이브에서 비교할 수 있는 헤드라인 처리량을 보여줄 수 있지만, 규모에서 동일한 GPU 플릿을 포화시키기 위해 3배 더 많은 드라이브가 필요할 수 있습니다. 3배 더 많은 SSD, 3배 더 많은 전력, 3배 더 많은 랙 공간입니다. 사용률 수학은 빠르게 복합됩니다.
SSD 선택과 아키텍처 디자인으로 인해 비용 차이가 발생할 수 있는지, 그리고 헤드라인 처리량 지표가 유사해 보이더라도?
이것은 운영자가 심각한 문제에 직면하는 곳입니다. 헤드라인 숫자는 진정으로 ввод될 수 있습니다. 대표적인 예를 들어보겠습니다. 122.88 TB QLC NVMe SSD의 가격은 약 27,000달러입니다. 동일한世代의 7.68 TB 드라이브는 약 1,800달러입니다. NVIDIA의 Enhanced 사양에 따라 4,096개의 GPU 클러스터를 위한 플래시 비용은 약 600,000달러에서 9.6백만 달러까지입니다. 처리량은 사실상 동일합니다. 유일한 변수는 프리미엄 미디어에 얼마나 많은冷データ를 주차할 것인지입니다.
그 위에, 아키텍처 디자인은 클러스터 규모에서 드라이브 수를 결정합니다. 약 5.8 GB/s의 측정된 읽기 처리량을 제공하는 아키텍처는 약 353개의 드라이브가 필요합니다. 약 1.9 GB/s의 중간자 오버헤드가 있는 아키텍처는 1,000개 이상의 드라이브가 필요합니다. 30 TB 드라이브당 12,000달러의 경우, 이는 라운드 오차가 아닙니다. 그것은 비즈니스 모델 질문입니다.
플래시 가격이 상승하고 NAND 공급이 제한되는 경우, 운영자는 모든 플래시 대 티어드 스토리지에 대해 어떻게 다시 생각해야 합니까?
시작점은 모든 플래시 AI 인프라의 경제적 전제가 항상 조건부였으며, 근본적인 것은 아니라는 것을 인정하는 것입니다. 피슨의 CEO는 NAND 생산 능력이 사실상 2026년까지 할당되었다고 설명했습니다. 골드만 삭스 프로젝트는 DRAM 가격이 같은 기간 동안 쿼터당 2자릿수 증가할 것으로 예상합니다. 모든 플래시 기본값은 플래시가 저렴하고 풍부할 때 합리적이었습니다. 더 이상 그렇지 않습니다.
(GS )올바른 프레임워크는 플래시가 실제로 무엇을 위한지 묻는 것입니다. 플래시は 성능 매체입니다. GPU 처리량 요구를 포화시키기 위해 크기 조정되어야 합니다. 다른 모든 것은, 활발하게 읽히지 않는 체크포인트, 보관된 훈련 세트를 포함하여, 높은 밀도 HDD에 속합니다. 높은 밀도 HDD는 TB당 몇십 배 더 저렴합니다.
운영자가 빠지는 함정은 티어링을 볼트온으로 취급하는 것입니다. 모든 플래시 기본 계층을 구입하고,冷データ를 위한 별도의 오브젝트 스토리를 추가하고, 외부 데이터 무버로 연결합니다. 이것은 두 번째 소프트웨어 스택, 두 번째 데이터 플레인, 네트워킹 복잡성, 운영 오버헤드를 도입합니다. 하이퍼스케일러 접근 방식은 동일한 소프트웨어 스택에서 SSD와 HDD를 실행하고, 네이티브 고성능 티어링을 제공하고, 외부 데이터 무버가 없기 때문에, 스토리지를 인프라 예산의 10%로 유지하면서 모든 GPU를 포화시키는 것입니다.
네오클라우드 계층이 하이퍼스케일러 스토리지 디자인 선택에서 어떤 교훈을 얻을 수 있나요?
가장 중요한 교훈은 구글, 메타, 마이크로소프트가 모두 모든 플래시를 사용하지 않는다는 것입니다. 그리고 그들은 누구보다도 더 많은 AI 워크로드 경험을 가지고 있습니다. 그들은 충분한 NVMe 플래시를 사용하여 GPU 처리량을 포화시키고, 높은 밀도 HDD로 빠르게 배출하는 혼합 티어 아키텍처를 배포합니다. 이것은 철학적인 선호도가 아닙니다. 이것은 명확한 AI 워크로드 물리학 이해에 의해 추동되는 경제적 임파티브입니다.
두 번째 교훈은 아키텍처 통합입니다. 하이퍼스케일러는 별도의 시스템을 결합하여 티어링을 해결하지 않습니다. 그들은 동일한 소프트웨어 스택, 동일한 데이터 플레인에서 SSD와 HDD를 실행하고, 티어링을 스토리지 시스템 내부의 첫 번째 클래스 작업으로 제공합니다. 그것은 별도의 도구에 의해 관리되는 배치 작업이 아닙니다. 이러한 통합은 하이퍼스케일러가巨大한 규모에서 스토리지를 경제적으로 유지하면서 GPU 플릿에 필요한 성능 보장을 유지할 수 있도록 합니다.
인프라 팀은 GPU 플릿에 대한 스토리지 가용성의 경제적 영향을 어떻게 계량화해야 합니까?
수치는诚实하게 계산했을 때 심각합니다. 공유 스토리지 실패는比例的な SLA 부족을 생성하지 않습니다. 그것은 연결된 모든 GPU 랙에 걸친 동시적인 위반을 생성합니다. 98%의 스토리지 가용성을 갖는 5,000개의 GPU 클러스터는 2%의 성능 부족을 생성하지 않습니다. 그것은 매년 876,000개의 GPU 시간의 손실 컴퓨팅을 생성합니다. 대표적인 GPU 시간 비용으로 계산했을 때,それは 수백만 달러의闲置 컴퓨팅으로 번역됩니다. 그리고 동시에 영향을 받는 모든 랙에 대한 SLA 신용이 부과됩니다.
파워 제한 환경에서 다양한 스토리지 아키텍처는 와트당 성능으로 비교하면 어떻게 됩니까?
그것은 거의 모든 심각한 인프라 대화에서 나타납니다. 그리고 차이는 주목할 만합니다. 약 1,340 GB/s의 읽기 처리량을 제공하는 아키텍처는 55 kW를 소모합니다. 다른 아키텍처는 유사한 출력을 약 16 kW에서 달성합니다. 그것은 와트당 성능의 3.4배 차이입니다. 데이터 센터에서 AI 워크로드가 40~250 kW의 랙당 고정 그리드 연결을 사용하고 있을 때,浪費된 스토리지 와트는 배포할 수 없는 GPU입니다. NVIDIA의 자체 BlueField-4 문서는 명시적으로 파워 가용성이 AI 팩토리의 확장성을 위한 주요 제약이라고述합니다.
스토리지 아키텍처는 SLA 경쟁력에 직접적으로 영향을 미치는 방법은 무엇인가?
스토리지는 GPU 클러스터에서 가장 큰 블래스트 반경입니다. 이것은 스토리지가 가장 중요한 변수가 되며, 이는 모든 정직한 SLA 약속에서 가장 중요합니다. SemiAnalysis ClusterMAX 2.0 등급 시스템은 네오클라우드 조달에서 영향력 있는 벤치마크가 되고 있으며, SLA를 가격 협상에서 명시적인 요소로 만듭니다. 경쟁적인 SLA가 없는 제공자는 현재 거래를 잃고 있습니다.
네오클라우드의 장기적인 생존을 결정하는 스토리지 기능은 무엇인가?
생존할 운영자는 전체 인프라 스택에 걸쳐 총 소유 비용 방정식을 해결한 것입니다. 즉, GPU 조달 방정식만이 아닙니다. 이것은 몇 가지 특정 기능을 의미합니다.
첫째, 유니파이드 소프트웨어 정의 아키텍처는 플래시와 디스크를 단일 데이터 플레인에서 실행하고, 네이티브 고성능 티어링을 제공하며, 외부 데이터 무버, 두 번째 소프트웨어 스택, 운영 복잡성이 없습니다. 둘째, 스토리지는 플래시와 디스크의 독립적인 비용 곡선을 따라 가며, 이러한 시장은 서로 독립적으로 움직입니다. 셋째, 자가 치유 시스템은 특수한 관리자가 수동으로 복구하지 않고도 높은 가용성을 유지합니다. 운영적으로 복잡한 스토리지는 규모에서 복합되는 보이지 않는 비용입니다. 넷째, 하이퍼스케일러 벤치마크에 대한 SLA에서 신뢰할 수 있는 내구성을 제공합니다.
현재 스토리지 전략을 평가하는 네오클라우드 운영자에게您的 메시지는 무엇인가?
스토리지 결정이 기본적으로 이루어지는 결정이 되지 않도록 하십시오. 인프라 스택의 다른 모든 부분은 엄격한 엔지니어링과 재정적 검토를 받습니다. 스토리지도 다를 바 없습니다. 3년 후에도 여전히 존재할 운영자는 실제로 유용한 컴퓨팅의 真正한 비용을 조사하고, 실제 가용성 태세를 이해하고, 워크로드에 맞게 크기 조정했으며, 조달 단축으로 결정하지 않은 스토리지에 대한 것입니다.
이것을 올바르게 하는 창은 좁아지고 있습니다. 통합은 이미 진행 중이며, 경제학은 무자비합니다. 그러나 스토리지 계층을 GPU 선택과 동일한 엄격성으로 재고하는 운영자에게, 기회는重大합니다. 스토리지를 올바르게 하는 것은 비용을 줄이는 것만이 아닙니다. 그것은 랙의 모든 GPU의 真正한 가치를 解放합니다.
이 인터뷰에 감사드립니다. 이 기술 스택에 대해 더 알고 싶은 독자는 VDURA를 방문할 수 있습니다. 또한 켄 클래피와의 이전 인터뷰를 읽을 수 있습니다.












