Wawancara

Christian Stano, Field CTO di Anyscale – Seri Wawancara

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Christian Stano, Field CTO di Anyscale, telah membangun karir di persimpangan infrastruktur AI skala besar, platform pembelajaran mesin, dan komputasi terdistribusi. Sebelum bergabung dengan Anyscale, ia memimpin organisasi Platform AI/ML di Attentive, di mana ia menskalakan infrastruktur yang mendukung personalisasi untuk lebih dari setengah miliar pelanggan dan membantu mengadopsi sistem komputasi unifikasi berbasis Ray yang meningkatkan kecepatan pengembangan sambil mengurangi biaya operasional. Pada awal karirnya, ia bekerja di berbagai bidang, termasuk keamanan siber, arsitektur cloud, dan inisiatif AI sektor publik di perusahaan seperti Coalfire dan Deloitte, di mana ia berkontribusi pada salah satu platform pembelajaran mesin pertama Departemen Pertahanan AS. Latar belakangnya mencakup teknik platform AI, MLOps, infrastruktur cloud-native, pengembangan pengembang, dan penskalaan organisasi, memberinya pengalaman mendalam dalam membantu perusahaan mengoperasikan AI pada skala produksi.

Anyscale adalah perusahaan di balik Ray, kerangka komputasi terdistribusi open-source yang secara luas digunakan untuk menskalakan beban kerja AI dan Python di seluruh klaster CPU dan GPU. Didirikan oleh tim asli pembuat Ray dari UC Berkeley’s RISELab, perusahaan ini fokus pada menyederhanakan penerapan, orkestrasi, dan manajemen infrastruktur AI skala besar untuk pelatihan, inferensi, pemrosesan data, dan beban kerja AI agen. Platformnya memungkinkan organisasi untuk menjalankan sistem AI terdistribusi di seluruh lingkungan cloud dan on-premise sambil menyediakan observabilitas, tata kelola, dan optimasi kinerja yang dirancang untuk aplikasi AI modern. Ray telah menjadi lapisan inti dalam tumpukan infrastruktur AI yang muncul, membantu pengembang menskalakan beban kerja dari satu mesin ke ribuan node dengan perubahan minimal pada kode Python yang ada.

Anda telah bekerja di berbagai bidang, termasuk keamanan siber, platform ML sektor publik, dan sistem personalisasi hiperskala. Apa pola yang secara konsisten Anda lihat ketika organisasi mencoba pindah dari proyek AI ke produksi?

Di seluruh industri, tiga pola muncul secara rutin. Pertama, tim tidak memiliki jalur yang dapat diandalkan dari pengembangan ke produksi. Mereka dapat membangun model di notebook, tetapi tidak ada cara baku untuk menjalankannya di produksi. Setiap penerapan menjadi satu kali, dan setiap kegagalan adalah kejutan. Kedua, infrastruktur tidak dapat menskalakan kebutuhan. Sistem yang bekerja di proyek gagal ketika diberi volume data nyata atau lalu lintas nyata. Ketiga, tim terbang buta. Mereka kekurangan observabilitas untuk mengetahui bagaimana sistem mereka sebenarnya berperforma, di mana mereka akan gagal, dan kapan harus campur tangan.

Apa yang menghubungkan ketiganya adalah tantangan akar yang sama — tim tidak memiliki model mental yang solid untuk menskalakan. Mereka mencoba memecahkan semuanya sekaligus alih-alih bersikap sadar tentang urutan. Saya memikirkannya sebagai tiga fase: membuatnya bekerja, membuatnya benar, membuatnya cepat. Fase-fase ini tidak hanya satu kali — fase-fase ini berulang. Anda secara terus-menerus memprioritaskan apa yang rusak sekarang dan apa yang akan rusak selanjutnya. Tim yang sukses tahu fase mana mereka dan tetap disiplin tentang tidak melompati sebelum fondasinya solid.

Di Anyscale, kami melihat tim datang pada setiap tahap. Beberapa masih mencoba membuatnya bekerja — mereka membutuhkan jalur yang dapat diandalkan dari pengembangan ke produksi. Yang lain memiliki itu tetapi tenggelam dalam kompleksitas operasional dan membutuhkan membuatnya benar. Dan banyak datang kepada kami karena mereka telah membangun sesuatu yang bekerja, tetapi tidak dapat mendorongnya ke skala yang dibutuhkan bisnis. Lapisan komputasi unifikasi membantu pada setiap fase, tetapi titik masuk tergantung pada di mana rasa sakit paling tajam.

Di Attentive, Anda membantu menskalakan sistem AI yang mendukung ratusan juta pengguna. Apa yang menjadi bottleneck arsitektur atau organisasi terbesar yang Anda harus atasi untuk mencapai tingkat skala tersebut?

Bottleneck terbesar adalah kurva-S kompleksitas infrastruktur. Ketika kami mendorong model kami untuk menggabungkan lebih banyak data dan melayani lebih banyak pelanggan, kami mencapai titik infleksi komputasi di mana bahkan node yang paling besar secara vertikal mengeluarkan kesalahan out-of-memory, dan penskalaan horizontal yang naif tidak cukup. Komputasi kami tidak dapat mengikuti skala data kami.

Respon alami adalah menambahkan lebih banyak alat untuk bekerja di sekitar keterbatasan. Ini adalah playbook internal saya dari pengalaman sebelumnya. Setiap alat memecahkan masalah yang sempit tetapi menambah kompleksitas operasional. Pipa ML kami menghadapi menjadi patchwork integrasi, dan setiap kasus penggunaan baru berarti lebih banyak jahitan, lebih banyak mode kegagalan, biaya lebih tinggi, dan lebih banyak overhead untuk tim platform.

Apa yang akhirnya membuka skala bagi kami adalah menyatukan pemrosesan data, pelatihan, inferensi, dan pelayanan ke Ray dan Anyscale. Dampaknya segera terlihat: dengan biaya infrastruktur yang jauh lebih rendah, siklus pelatihan yang jauh lebih cepat bahkan ketika volume data tumbuh, dan kemampuan untuk menskalakan model ke beberapa pesanan besar lebih banyak pelanggan.

Apa yang memotivasi keputusan Anda untuk bergabung dengan Anyscale pada tahap ini, dan bagaimana Anda melihat peran Field CTO dalam mengadopsi AI perusahaan?

Pengalaman saya membawa Anyscale ke Attentive secara fundamental mengubah playbook saya untuk membangun platform ML. Sebelum itu, sebagian besar teknik platform engineering adalah biaya menjahit sistem yang terfragmentasi. Dengan Anyscale, kami dapat menghilangkan sebagian besar overhead itu dan sebaliknya fokus pada pengalaman pengembang, keandalan, dan kinerja. Perubahan itu memiliki dampak besar pada produktivitas tim dan hasil sistem. Bergabung dengan Anyscale adalah kesempatan untuk bekerja pada masalah itu secara penuh waktu dan membantu organisasi lain mengatasi transisi yang sama. Sebagai Field CTO, peran saya benar-benar tentang mengambil pelajaran dunia nyata dan mengubahnya menjadi pola yang dapat diulangi yang pelanggan kami dapat terapkan saat mereka menskalakan AI.

Banyak perusahaan masih terjebak dalam fase “pilot” AI. Dari perspektif Anda, apa yang secara khusus rusak ketika perusahaan mencoba menskalakan eksperimen awal ke sistem produksi?

Ketika perusahaan pindah dari eksperimen AI ke produksi, apa yang rusak jarang hanya model — itu adalah sistem dan operasi sekitarnya. Dalam beberapa kasus, tim mencapai batas infrastruktur lebih awal dan tidak dapat melatih atau melayani pada skala yang diinginkan. Mereka harus membatasi jumlah pelanggan atau kasus penggunaan yang dilayani model sebagai hasilnya. Lebih sering, masalah muncul di produksi melalui kasus tepi yang tidak terduga atau perubahan data. Salah satu titik kegagalan paling umum adalah memori: ketika ukuran data, distribusi, atau modalitas bergeser, pekerjaan kehabisan memori dan gagal. Masalah-masalah ini sulit untuk diprediksi dan bahkan lebih sulit untuk pulih secara otomatis. Kenyataannya adalah kegagalan tidak dapat dihindari dalam produksi AI. Tujuannya bukan untuk menghindarinya sepenuhnya, tetapi untuk mendeteksi dengan cepat, memahami, dan membangun sistem self-healing untuk menyelesaikannya sebelum itu mempengaruhi bisnis.

Ray, kerangka komputasi terdistribusi yang dibuat oleh tim di balik Anyscale, mendapatkan traksi sebagai fondasi untuk beban kerja AI. Mengapa eksekusi terdistribusi menjadi lapisan kritis dalam infrastruktur AI modern?

Eksekusi terdistribusi dan manajemen beban kerja telah menjadi syarat wajib untuk pipa AI. Bekerja AI modern secara inheren paralel dan intensif sumber daya. Pelatihan, inferensi, dan pemrosesan data semua memerlukan koordinasi tugas besar di seluruh CPU dan GPU, sering secara dinamis. Dalam lanskap komputasi saat ini, kompleksitas manajemen beban kerja ini adalah beban operasional besar. Sistem tradisional tidak dirancang untuk tingkat kompleksitas atau skala ini. Kerangka kerja seperti Ray kritis karena memungkinkan tim untuk menskalakan beban kerja secara mulus dari satu mesin ke ribuan node dengan mengotomatisasi koordinasi yang mendasarinya. Perubahan ini mencerminkan pergeseran yang lebih luas menuju komputasi AI-asli, di mana infrastruktur dirancang khusus untuk pola beban kerja AI daripada disesuaikan dari paradigma yang lebih lama.

Seiring lebih banyak perusahaan mengadopsi Ray melalui platform Anyscale, apa perbedaan yang Anda lihat antara organisasi yang memstandarkan pada pendekatan unifikasi versus mereka yang menjahit alat yang terfragmentasi?

Perbedaan antara platform unifikasi dan alat yang terfragmentasi pada akhirnya berkaitan dengan fokus dan efisiensi. Ketika tim bergantung pada sistem yang terputus-putus, mereka menghabiskan sejumlah besar waktu untuk menjahit sistem-sistem tersebut, mengelola inkonsistensi, dan merespons kegagalan di seluruh lingkungan yang berbeda. Ini menciptakan overhead operasional dan memperlambat eksperimen. Sebaliknya, pendekatan unifikasi memungkinkan tim untuk mengonsentrasikan upaya mereka pada memperbaiki satu sistem, yang mengarah pada keandalan yang lebih baik, kinerja yang lebih kuat, dan pengalaman pengembang yang lebih lancar. Ini juga menyederhanakan proses on-call dan debugging karena pola konsisten dan lebih mudah dipahami. Hasilnya bukan hanya efisiensi teknis, tetapi juga kejelasan organisasi.

Berdasarkan pengalaman Anda membangun platform ML ujung-ke-ujung, seberapa pentingkah pengalaman pengembang (DevEx) dalam mempercepat adopsi AI di seluruh tim?

Pengalaman pengembang adalah salah satu area dengan pengaruh tertinggi untuk mempercepat adopsi AI. Ketika tim platform berinvestasi dalam membuat sistem lebih mudah digunakan melalui alur kerja yang distandarisasi, template, dan gesekan infrastruktur yang berkurang, mereka memperkuat produktivitas setiap insinyur di organisasi. Ini sangat penting dalam AI di mana kecepatan perubahan sangat cepat dan tim perlu beriterasi dengan cepat untuk tetap kompetitif. Perbaikan dalam pengalaman pengembang secara langsung diterjemahkan menjadi eksperimen yang lebih cepat, waktu ke produksi yang lebih cepat, dan dampak bisnis yang lebih besar. Alat coding AI memperkuat fundamental DevEx ini. Dalam banyak cara, ini adalah cara paling efektif untuk meningkatkan kecepatan di seluruh organisasi.

Efisiensi biaya menjadi perhatian utama saat beban kerja AI menskalakan. Apa saja cara yang paling diabaikan yang dapat digunakan perusahaan untuk mengurangi biaya infrastruktur tanpa mengorbankan kinerja?

Saat beban kerja AI menskalakan, manajemen biaya menjadi lebih penting dan lebih kompleks. Salah satu tantangan yang paling diabaikan adalah bagaimana biaya dapat melonjak dengan cepat karena ketidakefisienan, terutama dengan infrastruktur berbasis GPU. Klaster besar dapat memulai ribuan node, dan jika sumber daya tidak dikelola atau dimatikan dengan benar, biaya akan menumpuk dengan cepat. Ini menciptakan bentuk sprawl AI khusus, di mana penggunaan komputasi tumbuh lebih cepat daripada tim dapat melacak atau mengendalikan. Mengatasi ini memerlukan kombinasi tata kelola yang kuat, visibilitas, dan otomatisasi, seperti autoscaling, auto-termination, dan manajemen sumber daya terpusat. Pada skala besar, efisiensi biaya tidak hanya menjadi perhatian operasional, tetapi juga menjadi bagian fundamental dari desain sistem.

Anda telah bekerja pada semua, dari toko fitur hingga sistem inferensi waktu nyata. Bagaimana Anda pikir keseimbangan antara beban kerja AI batch dan waktu nyata berkembang?

Keseimbangan antara beban kerja AI batch dan waktu nyata belum berubah secara fundamental — itu tetap menjadi pertanyaan tentang persyaratan bisnis. Pemrosesan batch biasanya lebih efektif biaya dan lebih mudah dioperasikan, membuatnya cocok untuk banyak kasus penggunaan. Sistem waktu nyata penting ketika latensi langsung mempengaruhi pengalaman pengguna atau hasil bisnis, seperti dalam aplikasi obrolan atau deteksi penipuan. Kedua pendekatan ini akan terus coexist, dan kunci untuk organisasi adalah membangun platform yang dapat mendukung keduanya secara efektif. Keputusan akhirnya bergantung pada trade-off antara biaya, latensi, dan keandalan.

Menghadap ke depan, apa yang terlihat seperti platform AI perusahaan yang “matang” dalam 2-3 tahun — dan bagaimana alat seperti Ray dan platform seperti Anyscale memasuki masa depan itu?

Dalam beberapa tahun ke depan, platform AI perusahaan yang matang akan ditandai dengan beberapa karakteristik kunci. Mereka akan bergantung pada infrastruktur unifikasi yang mendukung seluruh siklus hidup AI, dari pemrosesan data ke pelatihan ke inferensi, bukan koleksi alat yang terputus-putus. Mereka akan memiliki operasi Hari 2 yang kuat, dengan kemampuan observabilitas, keandalan, dan debugging yang cepat. Manajemen biaya akan dapat diprediksi dan dikelola, memungkinkan organisasi untuk menskalakan secara berkelanjutan. Dan mungkin yang paling penting, mereka akan memungkinkan kecepatan pengembang yang tinggi, membuatnya mudah bagi tim untuk berpindah dari ide ke produksi dengan cepat. Platform seperti Ray dan Anyscale memainkan peran sentral dalam masa depan ini dengan menyediakan fondasi AI-asli yang membuat tingkat skala dan efisiensi ini memungkinkan.

Terima kasih atas wawancara yang luar biasa, pembaca yang ingin mempelajari lebih lanjut dapat mengunjungi Anyscale.

Antoine adalah seorang pemimpin visioner dan rekan pendiri Unite.AI, yang dipandu oleh semangat tak tergoyahkan untuk membentuk dan mempromosikan masa depan AI dan robotika. Sebagai seorang wirausaha serial, ia percaya bahwa AI akan menjadi sangat mengganggu masyarakat seperti listrik, dan sering tertangkap berbicara tentang potensi teknologi disruptif dan AGI.

Sebagai seorang futuris, ia berdedikasi untuk mengeksplorasi bagaimana inovasi ini akan membentuk dunia kita. Selain itu, ia adalah pendiri Securities.io, sebuah platform yang berfokus pada investasi di teknologi-teknologi canggih yang mendefinisikan kembali masa depan dan membentuk kembali seluruh sektor.