Röportajlar
Ben Koska, SF Tensor’ın Kurucusu ve CEO’su – Röportaj Serisi

Ben Koska, SF Tensor’ın kurucusu ve CEO’su, yüksek performanslı hesaplamalar, çekirdek optimizasyonu ve verimli model eğitimi konularında çalışan bir AI araştırmacısı ve sistem mühendisidir. Geçmişi, düşük seviyeli AI altyapısı geliştirme, eğitim verimliliğini artırma ve gelişmiş model geliştirme için ağır mühendislik yükü olmadan erişilebilir araçlar tasarlamayı içermektedir. Heterojen donanım boyunca hız, taşınabilirlik ve güvenilirlik sınırlarını zorlayan sistemler oluşturmaya odaklanmaktadır.
SF Tensor, bu felsefeyi pratik bir platforma dönüştürmek için liderlik ettiği şirkettir. Birleştirilmiş bir programlama modeli, bir çekirdek optimizatörü ve dağıtılmış AI iş yüklerinin karmaşıklığını ortadan kaldırmak için tasarlanmış bir bulut arası yönetim katmanı sunar. Platform, mühendislerin temiz, donanım-agnostic bir ortamda yazma, her yerde dağıtma ve otomatik olarak yüksek performans elde etme imkanını sunmayı amaçlamaktadır. SF Tensor’ın misyonu, AI hesabını dramatik olarak daha hızlı, daha kolay yönetilebilir ve satıcı kilidinden özgür hale getirmektir.
19 yaşında birden fazla startup’ta mühendislik liderliği yaptıktan sonra SF Tensor’ı kurdunuz. Kariyerinizin bu erken aşamasında AI altyapısını yeniden inşa etme challenge’ını neden aldınız?
Çözümünü sağladığımız sorun, benim için çok önemli bir sorundur, çünkü bu sorunla ben de karşılaştım. SF Tensor’ın çekirdek yığınını geliştirdiğimizde, ticari bir proje üzerinde çalışmıyorduk, aslında bir akademik girişimdi. Bazı ilginç araştırmalar yapmak için bir hibe almıştık, ancak zamanımızın büyük çoğunluğunu altyapı ve optimizasyonlarla uğraşarak, araştırma yapmak yerine harcadık. İnsanların evrensel olarak altyapı teknolojimize, araştırma projemize değil, ilgi gösterdiklerini fark ettik.
SF Tensor, AI’deki en zorlu sorunlardan biri olan NVIDIA’nın CUDA hakimiyetini kırmaya çalışıyor. Performansı bozmadan donanım taşınabilirliğini sağlamak için bir sistem tasarırken nasıl bir yaklaşım izlediniz?
Her şeyden önce, AI’nin temelinde basit matematik vardır. Her model temel olarak hesaplanması gereken matematiksel operasyonlar setidir. Bunu öncelikle bir matematik problemi olarak değil, bir bilgisayar bilimi problemi olarak ele alırsak, hesaplamaların en küçük setini tanımlayabilir ve milyonlarca farklı şekilde bu hesaplamaları makine koduna dönüştürebilir, en hızlı olanını bulabiliriz. Bu kolayca söylenen bir şeydir, ancak milyonlarca farklı programı çalıştırarak en hızlı olanını bulamayız, bu nedenle arama alanımızı daraltmak için hesaplanmış bir programın belirli bir donanım için ne kadar hızlı olacağını tahmin eden bir matematiksel model geliştirmek zorunda kaldık, bu da bugün yaptığımız şeyin temel yeniliklerinden biridir.
Şirketin blog’u, derleyici optimizasyonu ve bulut arası yönetim konularında yenilikleri vurgulamaktadır. SF Tensor’ın yaklaşımı PyTorch veya JAX gibi mevcut çerçevelerden nasıl farklıdır?
Henüz teknik bir blog yazmadık, ancak PyTorch ve JAX gibi çerçeveleri destekleyerek, bu çerçevelerde yazılmış kodların bizim yığınımız tarafından optimize edilmesini sağlıyoruz. JAX ve PyTorch’un bizim yığınımızdan farklılaştıran beberapa mimari kararları vardır, ancak en önemli olanı, biz bir modeli tek bir hesaplama olarak ele alırken, onlar ayrı ayrı modüller olarak ele alır ve sonra birlikte optimize ederler. Bu nedenle, geleneksel derleyici optimizasyon tekniklerini uygulamak ve her bir optimizasyonu ayrı ayrı uygulamak yerine, milyonlarca veya bazen milyarlarca potansiyel çekirdek oluşturur ve hiçbir insanın bu kadar çok kuralı yazılmış kodu en hızlıya dönüştüremeyeceğini iddia ederiz, bu nedenle sadece her birini oluşturup en hızlı olanını bulmak zorundayız.
Çok sayıda startup eğitim verimliliğine odaklanırken, siz “altyapı vergisi” – araştırmacıların inovasyon yerine hesaplamaları yönetmek için harcadıkları zaman – vurguladınız. SF Tensor bu dengesizliği nasıl ele alır?
Her iki sorunun da ele alınması gerektiğini düşünüyoruz ve bizim çok fazla çalışmamız eğitim verimliliğini ele almaya yöneliktir, ancak şu anda gelecekteki herhangi bir yeniliğe bağlı olmadan çözülebilecek en acil sorun, already bizim için çözülmüş olan altyapı vergisidir.
Eğitim maliyetlerinde %80’e varan giảmüşler elde ettiğinizi söylediniz. Bu optimizasyonları veya mimari yenilikleri mümkün kılan nedir?
Bütün yazılım yığınımız, arama tabanlı bir derleyicinin insan tarafından oluşturulmuş kurallardan her zaman daha iyi olacağı fikrine dayanmaktadır. Şimdiye kadar bu derleyicilerin en büyük kısıtlaması, milyonlarca veya hatta milyarlarca çekirdeği benchmark ve sıralayamama olmiştir. Bu nedenle, bir hesap veya hesap setinin belirli bir donanım için ne kadar zaman alacağını tahmin edebilen bir matematiksel model oluşturmamız gerekliydi. Bunu yaparak, arama alanımızı genişletebilir ve sonra daraltabiliriz, bu da en hızlı çekirdekleri tutarlı bir şekilde bulmak için bir zorunluluktur.
Emma programlama dilini inşa etme geçmişiniz, SF Tensor’ın mimarisini ve performansına yönelik felsefenizi nasıl etkiledi?
Yatırımcılarıma söylemeyin, ancak ben hala bir derleyici mühendisiyim. Her zaman şeyleri biraz daha hızlı yapmanın yollarını bulmaya çalıştım. Emma’yı geliştirirken, derleyiciyi 4 veya 5 kez completely yeniden yazdık; her defasında, optimize edemeyeceğimiz bir optimizasyonla karşılaştığımız için, sistemi daha genel hale getirmek ve en düşük seviyedeki optimizasyona izin vermek için yeniden tasarlamak zorunda kaldık. Bu öğrenmeler ve ortaya çıkan mimari, yaklaşık iki yıllık gibi görünen küçük optimizasyonlar ve yanlış bahislerin bir bileşimi, şimdi daha hızlı ilerlememizi ve daha iyi optimize etmemizi sağlayan bir sistem haline geldi.
4.000’den fazla GPU üzerinde büyük ölçekli eğitim çalıştırdınız – bu ölçekte hesaplamaları yönetirken en büyük dersler nelerdi?
Birincisi, donanım arızalarının çok daha yaygın ve çok daha problemli olduğu gerçeğidir. Geleneksel programlar ve derleyicilerle çalışırken, bir bilgisayar genellikle size söylenenleri yapar ve bir şey yanlış giderse, bu genellikle kodu yazan kişinin hatasıdır. Öte yandan, GPU’lar donanım arızalarının oldukça yaygın olduğu ve özellikle büyük kümeler üzerindeki dağıtılmış eğitim çalıştırılmasında sorunlara neden olabileceği görülmüştür. Buna paralel olarak, CPU’lar genellikle deterministik ve öngörülebilir bir şekilde davranırken, GPU’lar bazen neden olduğu belli olmayan nedenlerle saat hızlarını düşürebilir ve tüm eğitim sürecini yavaşlatabilir.
Y Combinator, teknolojinin en dönüştürücü altyapı şirketlerinden bazılarını destekledi. Bu deneyim, SF Tensor’ın ürününü ve vizyonunu ölçeklendirme yaklaşımınızı nasıl etkiledi?
Y Combinator’a girerken, o zaman yapmak istediğimiz bahislerin iddialı olduğunu düşündüm. Ancak birkaç hafta sonra, bizim için iddialı olan tanımımız çok daha değişti ve daha büyük bir bahse odaklandık. Bir diğeri, topluluk ve öğrenme hissi, neredeyse herhangi bir şirket veya kişiye telefon açıp veya e-posta gönderip birkaç saat veya gün içinde cevap ve tavsiye alabilmem, sorunlara yaklaşımımızı değiştirdi ve çok daha işbirlikçi bir yaklaşımı benimsedi.
İleriye bakarken, non-LLM modelleri, robotik ve sentetik veri konularına ilgi duyduğunuzu belirttiniz. Bu alanlar şirketin uzun vadeli vizyonuna nasıl uyum sağlar?
LLM’ler kesinlikle ilginç bir teknolojidir ve gelecekte dünyanın nasıl görüneceğinde önemli bir rol oynayacaktır, ancak bu kadar ileride olmalarının nedeni, bu teknolojiye yatırım yapan çok fazla para ve bu problem üzerinde işbirliği yapan çok fazla insanın olmasıdır. Eğer girişin engelini düşürerek, araştırmacıların ülke ve gezegen çapında, sınırlı kaynaklarla ve optimizasyon konusunda little-to-no bilgiye sahip olarak nghiênmasını möglich kılabilirsek, LLM’lerin uygun olmadığı problemleri çözebilecek yeni bir model neslinin ortaya çıkacağına inanıyorum.
AI altyapı yığınının beş yıl içinde nasıl görüneceğini düşünüyorsunuz ve SF Tensor bu yapı içinde hangi role sahip olacak?
Beş yıl içinde, birçok şirketin kendi özel çiplerini geliştireceğini ve araştırmacıların bu çipleri, kod yazmadan veya varlıklarından haberdar olmadan kullanabileceğini umuyorum. İşte bizim çalıştığımız ve önemli bir rol oynayacağımıza inandığımız gelecek.
Harika röportaj için teşekkür ederiz, daha fazla bilgi edinmek isteyen okuyucular SF Tensor‘ı ziyaret edebilir.












