Röportajlar
Kismat Singh, MachGen AI’nin Kurucu Ortağı ve CEO’su – Röportaj Serisi

Kismat Singh, MachGen AI’nin Kurucu Ortağı ve CEO’su, yüksek performanslı bilgi işlem ve makine öğrenimi sistemleri inşa etme konusunda yirmiden fazla yıllık deneyime sahip bir AI altyapısı ve mühendislik yöneticisidir. MachGen AI’yi kurmadan önce Singh, Intel’de AI Çerçeveleri için Mühendislik Başkan Yardımcısı olarak görev yaptı ve daha önce NVIDIA, AMD, HP ve diğer teknoloji şirketlerinde kıdemli mühendislik pozisyonlarında bulundu. Çalışmaları, derin öğrenme kütüphaneleri ve derleyicilerine katkılar, AI çerçeve optimizasyonu ve büyük ölçekli eğitim dayanıklılığındaki iyileştirmeleri içeriyor. Intel’de, şirketin PyTorch girişimlerine yakından katıldı ve AI çerçevelerini farklı donanım platformları arasında daha erişilebilir hâle getirmek üzerine kamuoyu önünde konuşmalar yaptı.
MachGen AI, üretken görüntü ve video modellerini çok daha hızlı ve daha ekonomik çalıştırmaya odaklanan bir AI altyapı şirketidir. Kismat Singh ve Manoj Krishnan tarafından kurulan şirket, büyük dil modelleri için inşa edilen altyapıyı uyarlamaktan ziyade difüzyon modelleri için özel olarak tasarlanmış yüksek performanslı çıkarım ve ince ayar yığını geliştirmektedir. MachGen, dikkat hesaplaması, önbellekleme, GPU çekirdekleri, bellek yönetimi, paralellik, zamanlama ve dağıtım gibi alanları optimize ederek model kalitesini korurken üretim gecikmesini azaltır. Platformu, metinden-görüntü, görüntüden-görüntü, metinden-video, görüntüden-video ve referanstan-video üretimi için API’ler sunar; temel teknoloji, etkileşimli içerik oluşturma, gerçek zamanlı avatarlar, oyun ve kişiselleştirilmiş reklamcılık gibi düşük gecikmeli uygulamaları mümkün kılmayı hedefler.
Video, GPU hesaplama ve AI performansı üzerine, NVIDIA’da TensorRT, Intel’de AI yazılımı, AMD’de GPU optimizasyonu ve daha önce gerçek zamanlı video kodlaması gibi alanlarda yirmiden fazla yıl çalıştınız. Bu yıllar içinde ne gördünüz ki büyük teknoloji şirketlerini bırakıp MachGen’i kurmaya ikna etti ve neden difüzyon çıkarımını bir şirket kurmaya değer bir altyapı sorunu olarak düşündünüz?
Ortak kurucum Manoj ve ben aynı spor salonunda neredeyse 10 yıl badminton oynadık. Bu sürenin büyük bir kısmında birbirimizi işe almaya çalışıyorduk. Sonunda, birbirimizi işe almaya devam etmektense birlikte çalışmanın daha kolay olduğuna karar verdik.
Bu problemi seçmemizin nedeni, ikimizin de bir çıkarım yığınının içten olgunlaşışını izlememizdir. NVIDIA’nın çıkarım platform ekibini kurmaya yardımcı oldum ve ardından Intel’de AI yazılımını yönettim. Manoj, Meta’da PyTorch’un arkasındaki büyük model eğitim altyapısını inşa etti. Önbellekleme, toplu işleme, zamanlama ve çekirdekler üzerine yıllarca süren çalışmaları izleyerek erken LLM araştırma sistemlerini trilyonlarca token hizmet eden üretim altyapısına dönüştürdük.
Difüzyon, LLM çıkarımının üç yıl önce bulunduğu noktaya yaklaşık olarak eşdeğerdir. Görüntü ve video modelleri hızla ilerledi, ancak onları hizmet veren sistemler hâlâ yavaş, maliyetli ve ölçeklendirmesi zor. Mevcut altyapıların çoğu LLM’ler için tasarlanmış, difüzyon ise sonradan eklenmiştir.
Zamanlamayı doğru kılan üç şey: modeller gerçek ürünler inşa edecek kadar iyi hale geldi, sorun tam da kariyerlerimiz boyunca geliştirdiğimiz becerileri gerektirdi ve etki, nesil bir şirket kurmaya yetecek kadar büyük. Bir zamanlar birkaç dakika süren bir video, saniyeler içinde maliyetin bir kısmıyla üretilebildiğinde, etkileşimli üretim, kişiselleştirilmiş reklamcılık, gerçek zamanlı avatarlar ve tamamen yeni yaratıcı ürünler mümkün hâle gelir.
MachGen, büyük dil modeli çıkarımını dönüştüren birçok tekniğin difüzyon modellerine temiz bir şekilde aktarılmadığını savunuyor. Görüntü ve video modellerine hizmet vermede temel olarak ne farklıdır ve geleneksel AI altyapısının genellikle kaçırdığı en büyük performans darboğazları nerelerdir?
LLM’ler ve difüzyon modelleri temel olarak farklı hesaplama desenlerine sahiptir. LLM’ler otoregresiftir; yoğun bir ön doldurma (prefill) işleminden sonra bellek sınırlı, token‑token çözümleme (decode) gerçekleşir. KV önbellekleme ve ön doldurma/çözümleme ayrıştırması gibi teknikler bu yapıya göre tasarlanmıştır.
Difüzyon modelleri otoregresif değildir ve gürültü giderme süreci boyunca hesaplama ağırlıklı kalır. Video üretimi ayrıca büyük miktarda uzamsal ve zamansal veri içerir; bu da dikkat, bellek, iletişim ve paralellik açısından farklı gereksinimler ortaya çıkarır.
Sonuç olarak, LLM’ler için geliştirilen birçok optimizasyon temiz bir şekilde aktarılmaz. Geleneksel KV önbellekleme aynı sorunu çözmez, standart paralellik önemli iletişim yükü getirebilir ve mevcut açık kaynak çekirdekler çok daha olgun değildir. Zamanlayıcı, bellek modeli, önbellekleme stratejisi, çekirdekler ve paralellik tümü difüzyon etrafında tasarlanmalıdır. Bu yüzden MachGen’i difüzyonu birinci sınıf bir varlık olarak inşa ettik.
MachGen, bazı görüntü modellerinde yaklaşık 4–6 kat daha düşük gecikme ve birkaç video modelinde orijinal, damıtılmamış modelleri çalıştırırken yaklaşık 6 kat iyileşme rapor ediyor. Bu kazanımları sağlayan en önemli teknik atılımlar nelerdir ve performans iyileştirmelerinin çıktı kalitesine zarar vermediğinden nasıl emin oluyorsunuz?
Kazançlar, yığının birkaç bölümünün birlikte çalışmasından geliyor. Dikkat, birçok video modelinde hesaplama bütçesini domine ediyor, bu yüzden daha düşük hassasiyetli tariflere, seyrek dikkate ve ilgili tekniklere odaklanıyoruz. Ayrıca, uzamsal ve zamansal tekrarı kullanan önbellekleme yöntemleri, difüzyon mimarileri için yüksek derecede optimize edilmiş çekirdekler ve iletişim gecikmesini azaltan paralellik teknikleri geliştirdik.
Bu iyileştirmeler, MachGen’in HiDream’i bir saniyede, altı saniyeye kıyasla ve Flux’u 1,5 saniyede, 6,2 saniyeye kıyasla sunmasını sağlıyor. Video için Wan 2.2, 98 saniyeye kıyasla 16,5 saniyede çalışırken, LTX 2.3, 67 saniyeye kıyasla 10,7 saniyede çalışıyor. Çıkarım maliyetleri de görüntü modelleri için 2–4 kat, video için 2–3 kat daha düşük.
Bu sonuçlar, orijinal, damıtılmamış modelleri kullanıyor. Çıktı kalitesinden ödün vermeden modellerin nasıl çalıştığını iyileştiriyoruz. Üretim benimsenmesi için hız, maliyet ve kalite hepsi birlikte çalışmalı.
Trusted TV, üretimi dakikalardan saniyelere indirmek sadece altyapı maliyetini değiştirmekten daha fazlasını etkilediği için ilginç bir örnek. Video üretimi, binlerce kampanya ve kişiselleştirilmiş yaratıcı varyasyonlar üretecek kadar hızlı hale geldiğinde, daha önce mümkün olmayan yeni iş modelleri veya ürün deneyimleri ortaya çıkıyor.
TrustedTV, işletmelerin AI ile yayın hazır reklamlar oluşturmasına ve bunları Prime Video, Roku ve DirecTV gibi bağlı TV platformlarında yayınlamasına yardımcı oluyor. Müşterilerinin çoğu küçük işletmeler. Geleneksel bir TV reklamı yapmak, film ve kurgu ekibi gerektiriyor ve maliyetler binlerce dolardan on binlerce dolara kadar çıkıyor. Trusted TV bunu sıfıra indiriyor. Küçük bir işletme sahibi, bir akıllı telefondan yaklaşık beş dakikada tam bir reklam oluşturup, hiçbir şey ödemeden görebiliyor. Platformda 10.000’den fazla kampanya oluşturuldu.
Ian, Trusted TV’nin CEO’su, MachGen’in Artificial Analysis üzerindeki gecikme ölçümünü gördü ve inanmadı. Kendisi test etmek için kaydoldu. İlk renderi yaklaşık 25 saniye sürdü ve kalite kaybı yaşamadı; aynı zamanda eşzamanlılık testlerinde iyileştirmeler ölçeklendikçe de korundu. Tüm üretim iş akışlarını 48 saatten kısa bir sürede MachGen’e taşıdılar ve MachGen artık yeni video üretimlerinin tamamını güçlendiriyor. En son dağıtımda, bu modelde 10 ya da 11 saniyeye yaklaşıyoruz ve geliştirmeye devam edeceğiz.
Ürün etkisi, reklamverenlerin bir ya da iki genel reklam üretmeyi bırakmasıdır. Kullanıcıları haftada iki ya da üç yeni reklamla döndürür, farklı izleyici segmentlerinde yaratıcıları test eder ve taahhüt etmek yerine yinelemeler yapar. Sonraki adım, çok milyon dolarlık bütçelere sahip şirketlere özgü olan coğrafi ve izleyici seviyesinde kişiselleştirmeyi, ölçekli bir şekilde sunmaktır.
Kişisel olarak düşündüğüm bir versiyon: Bugün, Manhattan’da bir sokakta çekilmiş bir sneaker reklamı alıyorum. Bay Area’da yaşıyorum, bu benim için hiçbir anlam ifade etmiyor. İstediğim, arka planda Mission Peak’in olduğu aynı reklam. Bu daha ucuz bir reklam değil; farklı bir reklamcılık türü ve sadece nesil hızlı ve ucuz olduğunda, binlerce varyant üretilebildiğinde ekonomik olarak mümkün oluyor.
Ürünlerine doğrudan görüntü veya video üretimini entegre eden şirketler, çıkarım ekonomisini nasıl düşünmelidir? Hangi ölçeklerde GPU kullanımını optimize etmek, her üretim için bir API sağlayıcısına ödeme yapmaktan daha stratejik bir önem kazanır?
Eğim noktası, çıkarımın ya müşteri deneyimini ya da şirketin marjlarını etkilemeye başladığında ortaya çıkar.
Bir ürün doğrulama aşamasında bir ekip için genel amaçlı bir API mantıklı olabilir. Üretim o ürünün merkezine yerleştiğinde, ekipler çıktı başına listelenen fiyatın ötesine bakmalı. Gecikme, eşzamanlılık, kalite, güvenilirlik ve GPU kullanımı da ekonominin bir parçası haline gelir.
Bir üretim ucuz görünebilir, ancak kullanıcıların birkaç dakika beklemesi ve iş akışını terk etmesi bir iş sorunu yaratır. Kullanım arttıkça GPU kapasitesinin aynı oranda büyümesini gerektiren bir mimari, marjlar üzerinde artan bir baskı oluşturur.
Tek bir istek hacmi eşiği yoktur çünkü 540p kısa bir klip için gereken hesaplama, daha uzun bir 1080p video için gereken hesaplamadan çok farklıdır. Kullanım artışı maliyetleri neredeyse aynı oranda artırdığında, tepe talep kuyruklar oluşturduğunda veya gecikme ürün deneyimini sınırlamaya başladığında optimizasyon stratejik hâle gelir.
MachGen, özel GPU çekirdekleri, önbellekleme, hassasiyet optimizasyonu, zamanlama ve paralellik dahil olmak üzere birkaç katmanda çalışıyor. Modeller hızla evrimleşirken, çıkarım yığınının hangi katmanının hız ve maliyet açısından en büyük kalan fırsatı sunduğunu düşünüyorsunuz?
Video üretiminde, dikkat birçok modelde hesaplama bütçesini domine ettiği için en büyük kalan fırsatlardan biridir. Daha düşük hassasiyetli tarifleri, seyrek dikkati ve difüzyon‑spesifik dikkat çekirdeklerini iyileştirmek için hâlâ önemli bir boşluk var.
Dikkat, fırsatın sadece bir parçası. En büyük genel kazançlar, yığının tüm katmanlarındaki iyileştirmelerin birleştirilmesinden gelecektir. Önbellekleme buna bir örnek. LLM’lerde kullanılan KV önbellekleme teknikleri doğrudan aktarılmaz, ancak difüzyon modelleri, doğru yaklaşımla kullanılabilecek uzamsal ve zamansal tekrarlara sahiptir.
Paralellik başka bir fırsat sunar. GPU eklemek, iletişim gecikmesi faydayı dengeleyebileceği için otomatik olarak orantılı bir hız artışı sağlamaz. İletişimi veri bağımsız hesaplamalarla örtüştüren ve bunu veri bağımlı işlerle birleştiren özelleştirilmiş çekirdekler geliştiriyoruz.
Dikkat, önbellekleme, çekirdekler, paralellik, bellek ve zamanlama birbirini etkiler. Yalnızca bir katmanı optimize etmek sonunda başka bir yerde bir darboğaz oluşturur. En büyük iyileştirmeler, yığını difüzyonun hesaplama profiline göre tasarlanmış tam bir sistem olarak ele alındığında ortaya çıkacaktır.
Yeni video modelleri üretim sürelerini gerçek zamanlıya daha da yaklaştırdıkça, gerçekten etkileşimli üretken video ne kadar yakın ve gerçek zamanlı video üretiminin yaygınlaşması için hangi teknik engellerin hâlâ aşılması gerekiyor?
Bazı uygulamalarda zaten etkileşimli hızlara ulaşıyoruz. MachGen, beş saniyelik bir Vidu Q3 Turbo videosunu 720p’de yaklaşık altı saniyede ve 540p’de üç saniyeden kısa bir sürede oluşturuyor. Bu, hızlı yaratıcı yinelemeler için yeterince hızlı ve yanıt veren avatarlar ile etkileşimli videoyu erişilebilir kılıyor.
Etkileşimli demek istediğim şeyin bir örneği. Bir hikaye izlediğinizi hayal edin ve sonun nereye gittiğini görebiliyorsunuz, ama beğenmiyorsunuz. Pasif bir şekilde oturmak yerine yönlendiriyorsunuz: o iki karakter üçüncüsünün neyi sakladığını bulmalı ve onu yüzleşmeli, sadece olayın gerçekleşmesine izin vermemeli. Aldığınız içerik yerine yönlendirdiğiniz içerik. İşte hızlı, ucuz üretimin mümkün kıldığı şey bu ve tükettiğimiz neredeyse her şeyi değiştiriyor.
Oraya ulaşmak genellikle birden fazla güçlü gecikme ölçütü gerektirir. Tüm deneyim, üretim trafiği altında yanıt verebilir kalmalı ve görsel kalite, kare‑kare tutarlılık ve öngörülebilir maliyeti korumalıdır. Daha uzun videolar, daha yüksek çözünürlükler ve eşzamanlı istekler altyapı yükünü artırır ve sistem hâlâ kapasite tahsis etmeli, istekleri yönlendirmeli ve donanım arızalarından kullanıcıyı haberdar etmeden kurtulmalıdır.
Bu, kullanım durumuna göre gelecek. Kısa klipler, avatarlar, oyunlar ve yaratıcı araçlar muhtemelen ilk gelenler olacak çünkü saniyeler içinde ölçülen üretim zaten onlar için yeterli. Model kalitesi ve çıkarım performansı birlikte iyileştikçe, daha fazla uygulama bu eşiği aşacak.
AI ajanları giderek görüntü ve videoları insanın bir düğmeye basmasını beklemeden otonom olarak ürettiğinde, altyapı gereksinimleri nasıl değişir? Ajan‑tabanlı iş yükleri gecikme, eşzamanlılık, maliyet ve güvenilirlik açısından temelde farklı talepler yaratır mı?
Bir ajan tek bir kullanıcı isteğini onlarca ya da yüzlerce üretim işine dönüştürür. Birkaç seçenek oluşturur, bunları değerlendirir, istemi revize eder ve süreci tekrarlar; adımlar arasında insan müdahalesi yoktur.
Bu, gecikme, eşzamanlılık, maliyet ve güvenilirliği çok daha önemli hâle getirir. Her üretim dakikalar sürüyorsa, ajanın iş akışı faydalı olacak kadar yavaş olur. Her deneme pahalıysa, otonom yineleme ekonomik olarak uygulanamaz. Sistem ayrıca birçok eşzamanlı isteği güvenilir bir şekilde yönetebilmelidir; çünkü tek bir hata tüm iş zincirini kesintiye uğratabilir.
İşte bu noktada GPU tahsisi, otomatik ölçekleme ve yönlendirme gibi yetenekler, model‑seviyesi optimizasyonu kadar önem kazanır. Ajan talebi, bir kişinin bir düğmeye tıkladığı yaratıcı bir uygulamadan çok daha patlayıcıdır.
İlgili iş birimi artık tek bir görüntü ya da video değildir. İçerik üretme, değerlendirme ve iyileştirme döngüsünün tamamıdır. Altyapı bu tüm döngüyü hızlı, uygun maliyetli ve güvenilir hâle getirmelidir.
GPU sağlayıcıları, çıkarım bulutları, model geliştiricileri ve optimizasyon platformları arasında yoğun bir rekabet var. Donanım kendisi daha hızlı hale geldikçe, şirketlerin NVIDIA, AMD, bulut sağlayıcıları ya da model geliştiricilerinin iyileştirmelerine güvenmek yerine MachGen gibi özel bir çıkarım katmanına hâlâ ihtiyaç duymalarının nedeni nedir?
Daha hızlı donanım tavanı yükseltir. Yazılım, bu tavanın ne kadarına ulaşılacağını belirler.
Bunu LLM’lerde gördük. Yeni hızlandırıcılar her nesilde ham performansı artırdı, ancak sürekli toplu işleme, KV‑önbellek yönetimi, spekülatif kod çözme ve özelleştirilmiş çekirdekler hâlâ endüstriyi üretim‑seviyesi verimlilik ve ekonomi seviyesine taşıyan unsurlardı. Bunların hiçbiri donanımdan gelmedi.
Görüntü ve video üretimi için tam üretim yolunu sürekli optimize etmek, donanım satıcıları, bulut sağlayıcıları ve model geliştiricilerinin yaptığı işten farklı bir görevdir ve bunların hiçbiri için temel bir öncelik değildir.
Bu işe birkaç yaklaşım var. Birisi, modellerin toplandığı ve isteklerin yönlendirildiği pazar yeri modelidir. Uzun vadede savunulabilir olmadığını düşünüyoruz, çünkü performansın bulunduğu katman üzerinde kontrol yok. Yığını kendimiz inşa edip yerel olarak barındırmayı seçtik; bu, gördüğümüz gecikme ve maliyet rakamlarını elde etmenin tek yoludur.
Bu, model ve hızlandırıcı başına dikkat, önbellekleme, çekirdekler, hassasiyet, bellek ve paralellik ayarlamaları yapmayı ve yönetilen API’leri, özel bulutu ve kendi kendine barındırılan dağıtımı desteklemeyi gerektirir. Model sayısı ve donanım seçenekleri arttıkça karmaşıklık da artar. Bizim görevimiz bunu absorbe ederek müşterilerimizin ürünlerini farklı kılan şeylere zaman ayırabilmelerini sağlamaktır.
MachGen’in uzun vadeli vizyonunun bir parçası olarak dünya modellerini tanımladınız; bunların birçok hesaplama özelliği difüzyon iş yüklerine benziyor. Üretim ölçeğindeki dünya modelleri için altyapı nasıl olmalı ve görsel ortamların üretilmesi ve simüle edilmesi sonunda metin üretimi kadar ucuz ve duyarlı hâle gelirse hangi uygulamalar mümkün olur?
Platformumuzu düşünmenin bir yolu, genel amaçlı bir LLM’ye benzer olmasıdır. Aynı model bir yasal sözleşme taslağı hazırlar ve restoranlarla ilgili bir soruya yanıt verir. Bizim için aynı yığın video avatar şirketlerine, yapay zeka reklamcılığına, hikâye ve mikrodram üretimine ve nihayetinde dünya modellerine hizmet eder. Farklı dikeyler, aynı temel performans sorunları seti.
Dünya modelleri bugün temel işimiz değil, ancak yöneldiğimiz hedef ve üzerinde aktif olarak çalıştığımız şeylerdir. Üretim ölçeğindeki dünya modelleri, sürekli bir ortamı üretip güncellediği için tek bir çıktı üretmek yerine çok yüksek aktarım hızı ve çok düşük gecikme süresine ihtiyaç duyar. Ayrıca mekânsal ve zamansal tutarlılık, eylemlere yanıt verebilme ve çoğu zaman birden fazla olası sonucu aynı anda simüle edebilme yeteneğine de ihtiyaç duyarlar. Bu durum bellek, veri hareketi, paralellik ve güvenilirlik açısından zor problemler yaratır. Bir robotu veya oyunu yönlendiren bir dünya modeli, bir sonraki durumu üretmek için dakikalar harcayamaz. Performans, bu sistemlerin kullanılabilir olup olmadığını belirler.
Hesaplama açısından, günümüz dünya modelleri difüzyon modellerine çok benzer, bu yüzden şu anda inşa ettiğimiz yığın doğal bir temel oluşturur. Onlar için henüz LLM’lerde mevcut olanla kıyaslanabilecek olgun bir üretim sınıfı hizmet katmanı yok. Bunu inşa etmeyi planlıyoruz.
Simülasyon, şu anki metin üretimi kadar duyarlı ve uygun maliyetli hâle gelirse, robotlar nadir durumları karşılaşmadan önce prova yapabilir, oyunlar bireysel oyunculara yanıt veren ortamlar oluşturabilir ve tasarımcılar fiziksel dünyada inşa etmeden önce onlarca olasılığı test edebilir. Difüzyon, bugün geçimimizi sağladığımız alandır. Dünya modelleri bizim Kuzey Yıldızımızdır.
Harika röportaj için teşekkür ederiz, daha fazla bilgi edinmek isteyen okuyucular MachGen AI adresini ziyaret etmelidir.












