Röportajlar

Anyscale’in Alan CTO’su Christian Stano ile Röportaj Serisi

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Christian Stano, Anyscale’in Alan CTO’su, büyük ölçekli AI altyapısı, makine öğrenimi platformları ve dağıtılmış hesaplama arasındaki kesişme noktalarında bir kariyer inşa etti. Anyscale’e katılmadan önce, Attentive’de AI/ML Platform organizasyonunun liderliğini yaptı ve burada kişiselleştirme için destek altyapısını yarım milyardan fazla aboneye ölçeklendirdi ve geliştirme hızını artırırken operasyonel maliyetleri azaltan Ray tabanlı birleşik hesaplama sistemlerinin benimsenmesine yardımcı oldu. Kariyerinin erken döneminde, Coalfire ve Deloitte gibi organizasyonlarda siber güvenlik, bulut mimarisi ve kamu sektörü AI girişimlerinde çalıştı ve ABD Savunma Bakanlığı’nın ilk makine öğrenimi platformlarından birine katkıda bulundu. Arka planı, AI platform mühendisliği, MLOps, bulut yerel altyapısı, geliştirici etkinleştirme ve organizasyonel ölçeklendirme içerir ve bu da onu üretim ölçeğinde AI’yi işletmelere operationalize etmelerine yardımcı olmak için derin bir deneyim sağlar.

Anyscale, geniş olarak AI ve Python iş yüklerini CPU ve GPU kümeleri boyunca ölçeklendirmek için kullanılan açık kaynaklı dağıtılmış hesap framework’ü Ray‘in arkasındaki şirkettir. UC Berkeley’nin RISELab’dan Ray’in orijinal yaratıcıları tarafından kurulan şirket, büyük ölçekli AI altyapısının dağıtımı, orkestrasyonu ve yönetimini basitleştirmeye odaklanıyor. Eğitim, çıkarım, veri işleme ve ajentik AI iş yükleri için şirketin platformu, organizasyonların bulut ve şirket içi ortamlarda dağıtılmış AI sistemlerini çalıştırmasına olanak tanır ve modern AI uygulamaları için tasarlanan gözlemleme, yönetim ve performans optimizasyonları sağlar. Ray, ortaya çıkan AI altyapısı yığınının temel bir katmanına dönüşmüştür ve geliştiricilerin mevcut Python kodunda minimal değişikliklerle iş yüklerini tek bir makineden binlerce düğümüne ölçeklendirmelerine yardımcı olur.

Siber güvenlik, kamu sektörü ML platformları ve hiper-ölçek kişiselleştirme sistemleri gibi çeşitli alanlarda çalıştınız. Organizasyonlar AI pilotlarını üretim aşamasına taşımaya çalıştıklarında tutarlı olarak hangi kalıpları gördünüz?

Endüstriler boyunca, üç kalıp düzenli olarak ortaya çıkar. İlk olarak, ekiplerin geliştirme ve üretim arasında güvenilir bir yol haritası yoktur. Bir modeli bir defterde oluşturabilirler, ancak üretim aşamasında çalıştırmak için standart bir yol yoktur. Her dağıtım benzersizdir ve her başarısızlık bir sürprizdir. İkincisi, altyapı ihtiyaçlarla ölçeklenemez. Pilot aşamasında çalışan sistem, gerçek veri hacimleri veya gerçek trafiğe maruz kaldığında çöker. Üçüncüsü, ekipler kör uçuyor. Sistemlerinin nasıl performans gösterdiğini, nerede kırılacağını ve müdahale etmesi gerektiğini bilmeleri için gözlemleme yeteneklerinden yoksundurlar.

Tüm bunları bağlayan şey, aynı kök zorluğun farklı yönleridir — ekipler ölçeklendirirken dikkatli olmayı bilmiyorlar. Her şeyi aynı anda çözmeye çalışıyorlar, yerine dizi halinde çözme konusunda bilinçli davranmıyorlar. Bunu üç aşama olarak düşünüyorum: çalışsın, doğru olsun, hızlı olsun. Bu aşamalar bir defaya mahsus değildir — bunlar sürekli olarak önceliklendirilir. Şu an neyin kırıldığını ve neyin bir sonraki kırılma noktası olacağını sürekli olarak önceliklendirmek zorundasınız. Başarılı olan ekipler hangi aşamanın içinde olduklarını bilirler ve temelin sağlam olana kadar ileriye atlamaktan kaçınmak için disiplinli kalırlar.

Anyscale’de, ekiplerin her aşamada gelmesini görüyoruz. Bazıları hala çalışmasını sağlamaya çalışıyorlar — güvenilir bir geliştirme ve üretim yolu gerekiyor. Diğerleri bunu başarmış ancak operasyonel karmaşıklıkta boğuluyorlar ve doğru olması gerekiyor. Ve birçokları, bir şeyler inşa etmiş ancak işin talep ettiği ölçeğe ulaşamadıkları için bize geliyor. Birleştirilmiş bir hesap katmanı her aşamada yardımcı olur, ancak giriş noktası en çok ağrı veren noktaya bağlıdır.

Attentive’de, yüz milyonlarca kullanıcının desteklediği AI sistemlerini ölçeklendirmeye yardımcı oldunuz. Bu ölçek seviyesine ulaşmak için hangi büyük mimari veya organizasyonel tıkanıklıkları aşmak zorunda kaldınız?

En büyük tıkanıklık, altyapı karmaşıklığının S-eğrisiydi. Modellerimizi daha fazla veri içerecek ve daha fazla müşteriye hizmet verecek şekilde ölçeklendirdikçe, en büyük dikey olarak ölçeklenen düğümler bile bellek dışı hataları veriyordu ve naif yatay ölçeklendirme de yeterli değildi. Hesaplamamız verimizin ölçeğiyle başa çıkamıyordu.

Doğal tepki, sınırları aşmak için daha fazla araç katmanını eklemekti. Bu, önceki deneyimimden içsel bir oyun kitabımdı. Her araç dar bir problemi çözdü, ancak operasyonel karmaşıklık ekledi. ML pipeline’miz, entegrasyonların yama işine dönüşme tehlikesiyle karşı karşıyaydı ve her yeni kullanım durumu daha fazla dikim, daha fazla başarısızlık modu, daha yüksek maliyetler ve platform ekibi için daha fazla yük anlamına geliyordu.

Bize ölçek kazandıran şey, sonunda verilerin işlenmesini, eğitimi, çıkarımı ve hizmetini Ray ve Anyscale üzerine birleştirmekti. Etkisi hemen oldu: Dramatik olarak daha düşük altyapı maliyetleri, veri hacimlerinin büyümesi rağmen önemli ölçüde daha hızlı eğitim döngüleri ve müşterilere hizmet verebilen modellerin ölçeğinin büyümesi.

Anyscale’e bu aşamada katılma kararınızı ne motive etti ve Field CTO olarak AI’nin işletme benimsemesini nasıl görüyorsunuz?

Anyscale’i benim kariyerime getiren deneyim, benim ML platformları inşa etme oyun kitabımı temelinden değiştirdi. Öncesinde, platform mühendisliğinin önemli bir kısmı, parçalı sistemleri birleştirmenin maliyetiydi. Anyscale ile bu fazla yükü elimine edebildik ve yerine geliştirici deneyimine, güvenilirliğe ve performansa odaklanabildik. Bu, hem ekip üretkenliği hem de sistem sonuçları üzerinde büyük bir etkiye sahipti. Anyscale’e katılmak, bu problemi tam zamanlı olarak çalışmak ve diğer organizasyonların aynı geçişi navigasyonu için yardımcı olmak için bir fırsattı. Field CTO olarak, benim rolüm gerçekten bu gerçek dünya derslerini tekrar edilebilir kalıplara dönüştürmek ve müşterilerimizin AI’yi ölçeklendirirken uygulayabilecekleri.

Çok sayıda işletme hala AI’nin “pilot aşamasında” sıkışmış durumda. AI deneylerini üretim sistemlerine ölçeklendirmeye çalıştıklarında, şirketlerin neyin kırıldığını düşünüyorsunuz?

Şirketler AI deneylerinden üretim sistemlerine geçmeye çalıştıklarında, kırılan şey genellikle sadece model değildir — çevreleyen sistem ve operasyonlardır. Bazı durumlarda, ekipler altyapı sınırlarına erken ulaşır ve istedikleri ölçekte eğitebilir veya hizmet verebilirler. Müşterilere hizmet verebilecek model sayısını sınırlamak veya kullanım durumlarını kısıtlamak zorunda kalırlar. Daha sık olarak, üretim aşamasında beklenmedik kenar durumları veya veri değişiklikleriyle ilgili sorunlar ortaya çıkar. En yaygın başarısızlık noktalarından biri bellektir: Veri boyutu, dağılımı veya modu değiştiğinde, işler bellek dışı hatalar verir ve başarısız olur. Bu sorunlar zor önsezidir ve otomatik olarak kurtarmak daha da zordur. Gerçeklik, üretim AI’sinde başarısızlığın kaçınılmaz olduğudur. Hedef, bunu tamamen önlemek değildir, sondern hızlı bir şekilde tespit etmek, anlamak ve self-iyileştirme sistemleri inşa etmek ve bunu iş üzerinde bir etkiye sahip olmadan önce çözmektir.

Anyscale ekibinin arkasındaki dağıtılmış hesap framework’ü Ray, AI iş yükleri için bir temel olarak kabul görmeye başladı. Modern AI altyapısında dağıtılmış yürütme neden bu kadar kritik bir katman haline geldi?

Dağıtılmış yürütme ve iş yükü yönetimi, AI pipeline’ları için temel haline geldi. Modern AI iş yükleri doğası gereği paralel ve kaynak yoğundur. Eğitim, çıkarım ve veri işleme, genellikle dinamik olarak, CPU’lar ve GPU’lar boyunca büyük görevler koordine etmeyi gerektirir. Bugünün hesaplamalı manzarasında, bu iş yüklerini kıt kaynaklar boyunca yönetmenin karmaşıklığı bir operasyonel yük haline geldi. Geleneksel sistemler bu düzeyde karmaşıklık ve ölçek için tasarlanmamıştı. Ray gibi framework’ler kritiktir, çünkü ekiplere, mevcut Python kodunda minimal değişikliklerle iş yüklerini tek bir makineden binlerce düğüme ölçeklendirmelerine olanak tanır.

Anyscale’in platformu aracılığıyla Ray’i benimseyen şirketler arasında, birleştirilmiş bir yaklaşımı standardize edenler ile parçalı araçları birleştirenler arasında ne gibi farklar görüyorsunuz?

Birleştirilmiş platformlar ve parçalı araçlar arasındaki fark, odak ve verimlilik meselesine gelir. Ekipler birden fazla ayrı sistemlere güvenirse, bu sistemleri birleştirmek, tutarlılıkları yönetmek ve farklı ortamlarda başarısızlıklara yanıt vermek için önemli zaman harcarlar. Bu, operasyonel bir yük oluşturur ve deneyimi yavaşlatır. Karşıt olarak, birleştirilmiş bir yaklaşım, ekiplere tek bir sistemi geliştirmeye odaklanmalarını sağlar, bu da daha iyi güvenilirlik, daha güçlü performans ve daha akıcı bir geliştirici deneyimi sağlar. Ayrıca, tutarlı kalıplar nedeniyle on-call ve hata ayıklama süreçlerini basitleştirir. Sonuç, teknik verimlilik değil, organizasyonel açıklıktır.

Uçtan uca ML platformları inşa etme deneyimine dayanarak, AI benimsemesini hızlandırmak için geliştirici deneyimi (DevEx) ne kadar önemlidir?

Geliştirici deneyimi, AI benimsemesini hızlandırmak için en yüksek etkiye sahip alanlardan biridir. Platform ekipleri, standartlaştırılmış iş akışları, şablonlar ve altyapı sürtünmesiyle sistemleri kullanmayı kolaylaştırdığında, organizasyon içindeki her mühendisin üretkenliğini artırır. Bu, özellikle AI’de, değişim hızı çok hızlı ve ekiplerin rekabetçi kalabilmek için hızlı bir şekilde iterasyon yapmaları gerektiğinde önemlidir. Geliştirici deneyimi migliorlamaları, doğrudan daha hızlı deneyime, daha hızlı üretime ve nihayetinde daha fazla iş etkisine çevirir. AI kodlama araçları, bu DevEx temelini amplifiye eder. Birçok yönden, bu, bir organizasyon genelinde hızı artırmak için en ölçeklenebilir yoldur.

AI iş yükleri ölçeklenirken, maliyet verimliliği önemli bir endişe haline geliyor. AI üretim sistemlerini ölçeklendirmek için en çok gözden kaçan yollardan bazıları nelerdir?

AI iş yükleri ölçeklenirken, maliyet yönetimi hem daha önemli hem de daha karmaşık hale gelir. En çok gözden kaçan zorluklardan biri, özellikle GPU tabanlı altyapıda, verimsizliklerin nasıl nhanh bir şekilde maliyetleri artırabileceğidir. Büyük kümeler binlerce düğüm başlatabilir ve kaynaklar doğru bir şekilde yönetilmezse veya sonlandırılmazsa, maliyetler hızla birikir. Bu, AI’ye özgü bir dağılma yaratır, burada hesaplamalı kullanım, ekiplerin takip edebileceğinden daha hızlı büyür. Bunu ele almak, güçlü bir yönetim, görünürlük ve otomasyon kombinasyonunu gerektirir, örneğin otomatik ölçeklendirme, otomatik sonlandırma ve merkezi kaynak yönetimi. Ölçeklendirilirken, maliyet verimliliği sadece operasyonel bir endişe değil, aynı zamanda sistem tasarımı için temel bir parçadır.

Özellik depolarından gerçek zamanlı çıkarım sistemlerine kadar birçok şeyi çalıştınız. Toplu ve gerçek zamanlı AI iş yükleri arasındaki denge nasıl evrimleşiyor?

Toplu ve gerçek zamanlı AI iş yükleri arasındaki denge temel olarak değişmedi — iş gereksinimlerine bağlı kalır. Toplu işleme genellikle daha maliyet etkin ve daha kolay operasyondur, bu da birçok kullanım durumu için uygundur. Gerçek zamanlı sistemler, gecikme doğrudan kullanıcı deneyimini veya iş sonucunu etkilediğinde, sohbet uygulamaları veya dolandırıcılık tespiti gibi durumlarda zorunludur. Her iki yaklaşım da devam edecektir ve organizasyonlar için anahtar, her birini etkili bir şekilde destekleyebilecek platformlar inşa etmektir. Karar, sonunda maliyet, gecikme ve güvenilirlik arasında bir ticaret haline gelir.

İleriye bakıldığında, 2-3 yıl içinde bir “olgun” işletme AI platformu nasıl görünür ve Ray ve Anyscale gibi araçlar bu gelecekte nasıl bir rol oynar?

Gelecek birkaç yıl içinde, olgun işletme AI platformları birkaç ana özelliklerle tanımlanacaktır. AI yaşam döngüsünün tamamını, veri işlemeden eğitime ve çıkarıma kadar, bir dizi ayrı araç yerine birleştirilmiş altyapıya dayanacaktır. Güçlü 2. gün operasyonlarına sahip olacaklar, ajan-otomatik gözlemleme, güvenilirlik ve hızlı hata ayıklama yeteneklerine sahip olacaklar. Maliyet yönetimi öngörülebilir ve yönetilen olacaktır, bu da organizasyonların sürdürülebilir bir şekilde ölçeklenmesine olanak tanıyacaktır. Ve belki de en önemlisi, yüksek geliştirici hızını sağlayacaklar, ekiplerin fikirlerinden üretime hızlı bir şekilde geçmelerine olanak tanıyacaklar. Ray ve Anyscale gibi platformlar, bu düzeyde ölçek ve verimliliği mümkün kılan AI’ye özgü bir temel sağlar.

Harika röportaj için teşekkür ederiz, okuyucuların daha fazla bilgi edinmek istedikleri Anyscale’i ziyaret etmelerini öneririz Anyscale.

Antoine, Unite.AI'nin vizyoner lideri ve kurucu ortağı, AI ve robotik geleceğini şekillendirmeye ve tanıtmaya yönelik sarsılmaz bir tutkuya sahiptir. Bir seri girişimci olarak, AI'nin toplum için elektrik kadar yıkıcı olacağına inanmaktadır ve sık sık yıkıcı teknolojiler ve AGI'nin potansiyeli hakkında konuşmaktadır.

Bir gelecekçi olarak, bu yeniliklerin dünyamızı nasıl şekillendireceğini keşfetmeye adanmıştır. Ayrıca, Securities.io kurucusudur, bu platform geleceği yeniden tanımlayan ve tüm sektörleri yeniden şekillendiren teknolojilere yatırım yapmayı hedeflemektedir.