Wawancara

Corey Sanders, Wakil Presiden Senior Produk di CoreWeave – Seri Wawancara

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Corey Sanders, Wakil Presiden Senior Produk di CoreWeave (CRWV ), memimpin strategi dan eksekusi produk untuk salah satu platform cloud yang berfokus pada AI dengan pertumbuhan tercepat. Ia bertanggung jawab untuk meningkatkan inovasi, membentuk solusi yang dirancang khusus untuk pelanggan, dan memperkuat posisi CoreWeave di pasar infrastruktur AI. Sebelum bergabung dengan CoreWeave, Sanders menghabiskan dua dekade di Microsoft (MSFT ) dalam peran kepemimpinan senior yang meliputi teknik cloud, platform industri spesifik, strategi solusi komersial, dan kemitraan perusahaan besar, dengan pengalaman mendalam dalam menghubungkan eksekusi teknis dan strategi go-to-market.

CoreWeave adalah penyedia cloud yang asli AI yang dibangun khusus untuk komputasi kinerja tinggi dan beban kerja AI skala besar. Perusahaan ini mengoperasikan jejak data center yang berkembang pesat di seluruh Amerika Serikat dan Eropa, menyediakan infrastruktur dan perangkat lunak yang dipercepat GPU yang dirancang untuk pelatihan AI, inferensi, dan kasus penggunaan komputasi lanjutan. Dengan fokus pada arsitektur yang dirancang khusus daripada cloud umum, CoreWeave telah menjadi mitra infrastruktur kritis untuk laboratorium AI dan perusahaan yang mencari kinerja, skalabilitas, dan efisiensi pada skala besar.

Anda menghabiskan lebih dari 20 tahun di Microsoft bekerja di bidang teknik Windows, strategi penjualan cloud, dan Microsoft Cloud untuk Industri. Apa yang diajarkan oleh proses tersebut tentang apa yang benar-benar mengarahkan adopsi perusahaan, dan bagaimana Anda menerapkan pelajaran tersebut hari ini di CoreWeave?

Adopsi perusahaan dimulai dengan memecahkan masalah pelanggan tertentu. Inovasi untuk kepentingan inovasi saja sebenarnya tidak terlalu penting bagi perusahaan. Ini tentang memposisikan diri Anda dalam sepatu mereka untuk memahami apa yang benar-benar mengganggu mereka—apakah itu biaya dukungan, kompleksitas operasional, menghubungkan dengan pelanggan, atau mengelola tim global dan lini produk baru—dan kemudian menyediakan layanan yang membantu. Mereka sering bersedia untuk berinovasi dalam pendekatan mereka, tetapi pertimbangan paling penting adalah membantu mereka memecahkan masalah mereka. Kesalahan paling umum yang saya lihat dalam desain produk adalah terlalu terjebak dalam kekaguman terhadap produk. Sementara itu memiliki bobot dalam ruang konsumen, pelanggan perusahaan, pada akhirnya, lebih peduli dengan utilitas daripada kekaguman.

CoreWeave sering digambarkan sebagai menawarkan infrastruktur AI yang dirancang khusus. Dalam istilah praktis, apa yang dimaksud dengan dirancang khusus dari perspektif produk, dan di mana platform cloud umum mengalami kesulitan dengan beban kerja AI?

Manfaat terbesar dari dirancang khusus adalah kemampuan untuk fokus dan menyediakan layanan tanpa perlu memecahkan setiap kasus umum. Saya akan memberikan dua contoh: satu di perangkat lunak dan satu di perangkat keras.

Di sisi perangkat lunak, penawaran Object Storage kami dengan LOTA cache difokuskan secara khusus pada caching untuk beban kerja AI. Ini diterapkan langsung pada node GPU, menyediakan titik akhir S3 untuk aplikasi, dan merespons permintaan GPU dengan menyebar cache di seluruh node. Ini meningkatkan throughput ke GPU hingga 7 GB/s, jauh melebihi apa yang ditawarkan cloud umum. Kami dapat mencapai ini karena kami membuat asumsi desain seputar beban kerja AI, split baca/tulis, dan tata letak klaster. Jika pelanggan menggunakan ini untuk hosting database atau situs e-commerce, itu tidak akan memiliki dampak yang sama. Itulah definisi dari perangkat lunak yang dirancang khusus.

Contoh perangkat keras serupa. Dengan penerapan NVIDIA (NVDA ) SKU terbaru yang luas—banyak di antaranya memerlukan pendinginan cair—CoreWeave telah membangun keahlian dan desain pusat data khusus untuk mendukung kebutuhan tersebut. Tidak seperti cloud yang lebih besar yang membangun untuk fleksibilitas dan kemudian harus menambahkan pendinginan cair secara retrospektif, CoreWeave membangun pusat data yang difokuskan pada AI dari awal. Ini menghasilkan biaya yang lebih rendah dan ketersediaan yang lebih tinggi untuk jenis SKU terbaru.

Di bawah ini adalah gambar dari LOTA cache yang disebutkan.

Ketika pelanggan pertama kali memikirkan tentang penskalaan AI, banyak yang percaya mereka hanya perlu akses ke GPU. Apa yang mereka biasanya sadari bahwa mereka kurang setelah mereka mulai melatih atau melayani model pada skala besar?

Diberikan kompleksitas menjalankan beban kerja di seluruh klaster GPU besar, layanan yang mengelilingi menjadi penggerak keberhasilan yang sebenarnya. Ini termasuk yang jelas, seperti penyimpanan dan jaringan, tetapi juga layanan operasional kritis seperti observabilitas, orkestrasi, dan keamanan. Ini adalah tempat di mana CoreWeave benar-benar bersinar dengan penawaran Mission Control kami. Ini menyediakan pelanggan dengan kesadaran yang mendalam tentang kesehatan node dan runtime di seluruh armada mereka, mengintegrasikan pengetahuan tersebut langsung ke mesin orkestrasi. Ini memungkinkan pelanggan untuk memperlakukan infrastruktur mereka tidak sebagai 1.000 GPU individual, tetapi sebagai satu entitas pekerjaan yang kohesif.

Apa yang menjadi prioritas produk utama Anda saat ini untuk meningkatkan hasil pelanggan, apakah itu kinerja, keandalan, prediktabilitas biaya, atau pengalaman pengembang?

Di platform inti, kami terus fokus pada kinerja, keandalan, dan observabilitas. Kami harus memastikan pelanggan dapat menjalankan pekerjaan dengan cara yang dapat diulang dan diprediksi sambil memanfaatkan setiap TFLOP di setiap GPU. Di luar itu, kami bekerja untuk menyederhanakan papan untuk pelanggan yang mungkin tidak terbiasa dengan setiap lonceng dan peluit dalam alat seperti SLURM (yang digunakan semua orang, tetapi hampir semua orang membencinya). Akhirnya, kami mengembangkan layanan dan model penagihan tambahan untuk membuatnya lebih mudah untuk berinovasi dan memulai dari skala kecil. Saat ini, bereksperimen sangat sulit karena hambatan masuk yang tinggi, seperti keterbatasan kapasitas, komitmen tiga tahun, dan kebutuhan akan ahli khusus hanya untuk memulai. Kami ingin mengembalikan kemudahan inovasi ke platform AI.

Seiring dengan semakin banyak beban kerja AI yang beralih dari pelatihan yang berat ke inferensi yang berat, bagaimana transisi ini mempengaruhi desain infrastruktur dan keputusan peta produk?

Ini menciptakan peluang besar untuk menerapkan diferensiasi CoreWeave yang ada ke persyaratan inferensi. Sebagai contoh, LOTA cache yang saya sebutkan sebelumnya difokuskan pada memberi makan GPU selama pelatihan; namun, kami dapat mengambil teknologi yang sama, mengintegrasikannya ke dalam hal-hal seperti KVCache, dan mengubahnya menjadi diferensiator inferensi yang kuat. Demikian pula, alat seperti Mission Control menjadi sangat vital untuk inferensi, karena mengamati kesehatan GPU sangat penting untuk menjalankan aplikasi agenik yang sangat tersedia.

Di masa depan satu hingga dua tahun, apa yang akan mendefinisikan kepemimpinan di pasar cloud AI, dan kemampuan apa yang akan paling berarti bagi pelanggan?

Saya pikir kepemimpinan akan ditentukan oleh dua hal. Yang pertama adalah menyediakan skala yang terus berkembang untuk pelatihan. Ini akan memerlukan kemajuan dalam observabilitas, pemantauan kesehatan, dan pemulihan otomatis. Ketika Anda beralih dari ratusan ke puluhan ribu GPU yang didistribusikan secara global, respons manual terhadap kegagalan bukanlah pilihan.

Yang kedua adalah menyediakan layanan yang tepat untuk beban kerja inferensi dan agenik. Ini memerlukan kemampuan penerapan global dan model bisnis yang mendorong eksperimen. Pola penggunaan ini adalah apa yang membantu cloud tumbuh awalnya, dan itu telah sedikit hilang di era AI. Kami perlu mengembalikannya melalui dukungan platform yang lebih baik, kemampuan multi-cloud, dan kemudahan penggunaan multi-wilayah.

Anda sebelumnya memimpin inisiatif cloud spesifik industri di bidang kesehatan, ritel, layanan keuangan, manufaktur, dan cloud berdaulat. Apa pelajaran dari vertikal tersebut yang dapat diterapkan langsung ke infrastruktur AI, dan mana yang tidak?

Pergeseran generasi GPU terus memperkenalkan kompleksitas baru. Setiap rilis baru membawa interkoneksi yang meningkat, memori yang lebih tinggi, dan kebutuhan daya yang lebih besar, semuanya memerlukan kami untuk mengunjungi kembali asumsi kami tentang bagaimana node dihubungkan dan bagaimana perangkat lunak disampaikan. Kami harus tetap gigih di sini untuk mempertahankan posisi kepemimpinan kami. Di sisi lain, area yang membaik dengan cepat adalah skala apa yang dapat dicapai pelanggan; kecepatan di mana mereka beradaptasi dengan jejak komputasi yang lebih besar sangat mengesankan.

Seiring dengan pusat data dan klaster AI terus berkembang, tantangan operasional apa yang paling sulit dipecahkan saat ini, dan mana yang membaik dengan cepat?

Perubahan generasi GPU terus menciptakan kompleksitas baru dalam desain dan perangkat lunak. Setiap rilis GPU baru datang dengan kemampuan interkoneksi yang meningkat, memori yang lebih tinggi, kebutuhan daya yang lebih besar, dll., yang memerlukan kami untuk mengunjungi kembali asumsi kami tentang bagaimana node dihubungkan, bagaimana rak diatur, dan bagaimana perangkat lunak disampaikan. Kami akan terus fokus pada pekerjaan ini untuk memastikan kami mempertahankan posisi kepemimpinan kami. Yang membaik dengan cepat adalah apa yang dapat dicapai pelanggan dengan skala komputasi yang tumbuh.

Dalam infrastruktur AI, keandalan melampaui waktu aktif. Bagaimana CoreWeave mendefinisikan keandalan, dan indikator apa yang paling mencerminkan keberhasilan dari perspektif pelanggan?

Pada skala besar, pertimbangan terbesar bagi pelanggan adalah sekadar menyelesaikan pekerjaan. Dalam operasi besar, kegagalan atau perlambatan individual diharapkan. Kunci adalah bagaimana kami mendeteksi dan merespons secara otomatis masalah tersebut untuk memastikan pekerjaan selesai meskipun tantangan. Ini adalah mengapa kami mengintegrasikan Mission Control ke layanan yang lebih tinggi seperti SUNK (Slurm pada Kubernetes). Ini memungkinkan pelanggan untuk merespons kegagalan secara otomatis tanpa kehilangan jam atau minggu kerja. Bagi kami, keberhasilan bukan hanya tentang waktu aktif node; itu tentang keberhasilan pekerjaan.

Menghadap ke depan, apa pergeseran besar dalam infrastruktur AI yang masih kurang dihargai, apakah terkait dengan evolusi perangkat keras, spesialisasi tumpukan, persyaratan kedaulatan, atau model penerapan baru?

Saya percaya bahwa kedatangan Pembelajaran Penguatan (RL) sebagai bagian yang diperbarui dari tumpukan AI masih kurang dihargai. Sementara tidak merupakan bidang studi baru, itu sebagian besar tertutupi selama gelombang awal pengembangan LLM. RL membuat comeback dan akan memainkan peran vital dalam membuat layanan AI lebih responsif terhadap lanskap yang berubah dari penggunanya. Karena itu, kami sangat bersemangat tentang penawaran RL tanpa server yang kami miliki hari ini.

Terima kasih atas wawancara yang luar biasa, pembaca yang ingin mempelajari lebih lanjut dapat mengunjungi CoreWeave.

Antoine adalah seorang pemimpin visioner dan rekan pendiri Unite.AI, yang dipandu oleh semangat tak tergoyahkan untuk membentuk dan mempromosikan masa depan AI dan robotika. Sebagai seorang wirausaha serial, ia percaya bahwa AI akan menjadi sangat mengganggu masyarakat seperti listrik, dan sering tertangkap berbicara tentang potensi teknologi disruptif dan AGI.

Sebagai seorang futuris, ia berdedikasi untuk mengeksplorasi bagaimana inovasi ini akan membentuk dunia kita. Selain itu, ia adalah pendiri Securities.io, sebuah platform yang berfokus pada investasi di teknologi-teknologi canggih yang mendefinisikan kembali masa depan dan membentuk kembali seluruh sektor.