Röportajlar
Saurabh Vij, MonsterAPI’nin CEO’su ve Kurucu Ortağı – Röportaj Serisi

Saurabh Vij, MonsterAPI’nin CEO’su ve kurucu ortağıdır. Daha önce CERN’de bir parçacık fizikçisi olarak çalışmış ve LHC@home gibi projelerden merkezden uzaklaştırılmış hesaplama potansiyelini tanımıştır.
MonsterAPI, makine öğrenimi için ölçeklenebilir ve uygun fiyatlı GPU altyapısı sağlamak amacıyla kripto madenleri ve küçük boş veri merkezlerinden daha ucuz commodity GPU’ları kullanır. Bu sayede geliştiriciler, tek bir satır kod yazmadan AI modellerini önemli ölçüde azaltılmış maliyetlerle erişebilir, ince ayarlayabilir ve dağıtabilir.
MonsterAPI’den önce, Hindistan hükümeti ve IIT Delhi ile işbirliği içinde Hindistan’daki kadınlar için bir giyilebilir güvenlik cihazı geliştiren iki startup çalışması da dahil olmak üzere iki startup çalışması yaptı.
MonsterGPT’nin köken hikayesini paylaşabilir misiniz?
Misyonumuz her zaman “yazılım geliştiricilerin AI modellerini mümkün olan en hızlı ve en kolay şekilde ince ayarlayıp dağıtmalarına yardımcı olmak” olmuştur. Geliştiricilerin AI modellerini ince ayarlayıp dağıtmak istediklerinde karşılaştıkları birçok karmaşık sorunu fark ettik.
Kod ile uğraşmaktan, GPU’lar üzerinde Docker konteynırlarını kurmaya ve bunları talep üzerine ölçeklemeye kadar
Ekosistemin hareket ettiği hızda, sadece ince ayarlamak yetmez. Doğru şekilde yapılmalıdır: underfitting, overfitting, hiperparametre optimizasyonu, LORA ve Q-LORA gibi son yöntemleri kullanarak daha hızlı ve daha ekonomik ince ayar yapmak. İnce ayarlandıktan sonra, model verimli bir şekilde dağıtılmalıdır.
Bize, sadece pipeline’in küçük bir bölümü için bir araç sunmanın yeterli olmadığını fark ettirdi. Bir geliştirici, tüm optimize edilmiş pipeline’i, tanıdık bir arayüzle birlikte benötir. İnce ayarlamadan, değerlendirme ve nihai model dağıtımı.
Kendime bir soru sordum: Bir eski parçacık fizikçisi olarak, AI’nin bilimsel çalışmalarda nasıl bir etki yaratabileceğini anlıyorum, ancak nereden başlayacağımı bilmiyorum. İnovatif fikirlerim var, ancak makine öğrenimi ve altyapı hakkında tüm becerileri ve nüansları öğrenmeye zamanım yok.
Eğer sadece bir AI ile konuşabilseydim, gereksinimlerimi sağlayabilseydim ve tüm pipeline’i bana inşa edebilseydim, bu nasıl olurdu?
Bu, geliştiricilerin zahmetsizce ince ayarlayıp dağıtabilmeleri için bir sohbet tabanlı sistem fikrine yol açtı.
MonsterGPT, bu yolculuğun ilk adımı.
Bizim gibi milyonlarca yazılım geliştiricisi, yenilikçi ve bilim insanı, projeleri için daha fazla alan özgü domaine özgü modeller oluşturmak için bu yaklaşımdan yararlanabilir.
Monster API’nin GPT tabanlı dağıtım aracının arkasındaki temel teknolojiyi açıklar mısınız?
MonsterGPT, açık kaynaklı Büyük Dil Modellerini (LLM) verimli bir şekilde dağıtmak ve ince ayarlamak için gelişmiş teknolojileri kullanır. Microsoft’un Phi3 ve Meta’nın Llama 3 gibi LLM’ler örneklerindendir.
- RAG ile Bağlam Yapılandırması: LLM’leri ince ayarlamak veya MonsterAPI’nin ölçeklenebilir REST API’lerini kullanarak modelleri dağıtmak için doğru hiperparametrelerle yapılandırmaları otomatik olarak hazırlar.
- LoRA (Düşük Rütbeli Uyum): LLM’leri ince ayarlamak için yalnızca parametrelerin bir alt kümesini güncelleyerek, hesaplama yükünü ve bellek gereksinimlerini azaltır.
- Quantization Teknikleri: GPT-Q ve AWQ’yi kullanarak model performansını optimize eder, bu da bellek izini azaltır ve önemli bir doğruluk kaybı olmadan çıkarımı hızlandırır.
- vLLM Motoru: Yüksek verimli LLM hizmetini, sürekli toplu işleme, optimize edilmiş CUDA çekirdekleri ve paralel decoding algoritmaları ile birlikte sunar.
- Merkezden Uzaklaştırılmış GPU’lar için Ölçeklenebilirlik ve Ucuzluk: İnce ayarlanma ve dağıtım iş yükleri, düşük maliyetli GPU’lardan oluşan bir ağ üzerinde çalışır. Bu, küçük veri merkezlerinden ortaya çıkan GPU bulutlarına kadar çeşitli satıcılar için daha düşük maliyetler, yüksek seçeneklilik ve GPU’lara erişim sağlar.
MonsterGPT kullanarak Llama 3 dağıtımı hakkında son blogumuzu inceleyin;
İnce ayarlanma ve dağıtım sürecini nasıl basitleştirir?
MonsterGPT, doğal dilde komutları anlama yeteneğine sahip bir sohbet arayüzü sağlar. Bu, birçok karmaşık adımı soyutlar:
- Veri pipeline’ı oluşturma
- İş için doğru GPU altyapısını belirleme
- Uygun hiperparametreleri yapılandırma
- ML ortamını uyumlu çerçeveler ve kütüphaneler ile kurma
- LoRA/QLoRA ile verimli ince ayar için fine-tuning betikleri uygulama
- Çoklu düğüm otomatik ölçekleme ve yüksek verimli hizmet motorları gibi hataları giderme
Geliştiriciler, Monster API’nin sohbet arayüzü ile nasıl bir kullanıcı arayüzü ve komutlar bekleyebilir?
Kullanıcı arayüzü, kullanıcıların LLM’yi belirli bir görev için (örneğin, özetleme, sohbet tamamlama, kod oluşturma, blog yazma) ince ayarlayıp dağıtmak için ajanı yönlendirebilecekleri basit bir sohbet arayüzüdür. Bazı komut örnekleri:
- X veri kümesi için kod oluşturma için LLM’yi ince ayarla
- Blog yazma için ince ayarlanmış bir model istiyorum
- Llama 3 modeli için bir API uç noktası verin.
- Blog yazma kullanım durumu için küçük bir modeli dağıtın
Bu, özellikle yeni modellerin ortaya çıkmasıyla birlikte doğru modeli bulmanın zaman alıcı bir iş olabileceği durumlarda çok faydalıdır.
Monster API’nin çözümü, geleneksel AI modeli dağıtım yöntemlerine kıyasla kullanım kolaylığı ve verimlilik açısından nasıl karşılaştırılır?
Monster API’nin çözümü, geleneksel AI modeli dağıtım yöntemlerine kıyasla kullanım kolaylığı ve verimliliği önemli ölçüde artırır.
Kullanım Kolaylığı Açısından:
- Otomatik Yapılandırma: Geleneksel yöntemler genellikle hiperparametrelerin ve yapılandırmaların kapsamlı bir şekilde el ile kurulmasını gerektirir, bu da hata eğilimlidir ve zaman alıcı olabilir. MonsterAPI, bu süreci RAG ile basitleştirir ve hataların olasılığını azaltır.
- Ölçeklenebilir REST API’leri: MonsterAPI, dağıtım ve ince ayar için sezgisel REST API’leri sunar, bu da sınırlı makine öğrenimi uzmanlığına sahip kullanıcılar için erişilebilir hale getirir. Geleneksel yöntemler genellikle dağıtım için karmaşık kodlama ve derin teknik bilgi gerektirir.
- Birleşik Platform: Tüm iş akışını, ince ayarlamadan dağıtıma kadar, tek bir platformda entegre eder. Geleneksel yaklaşımlar, genellikle çeşitli araçlar ve platformlar içerir, bu da verimsizliklere ve entegrasyon sorunlarına yol açar.
Verimlilik Açısından:
MonsterAPI, LoRA ile ince ayarlamayı ve model performansı için GPT-Q ve AWQ gibi kuantizasyon tekniklerini optimize ederek, düşük maliyetli ve ölçeklenebilir bir merkezi olmayan GPU bulutu üzerinde çalışan bir dizi işlemin basitleştirilmiş bir pipeline’ini sunar.
Bu tüm pipeline, geliştirici verimliliğini, üretim sınıfı özel LLM uygulamalarının oluşturulmasını sağlayarak ve karmaşık teknik becerilere olan ihtiyacı azaltarak artırır.
Monster API, model dağıtımı için gereken zamanı ve kaynakları önemli ölçüde azalttığı kullanım örneklerini sağlayabilir mi?
Bir IT danışmanlık şirketi, Llama 3 modelini müşterilerinin iş ihtiyaçlarını karşılamak için ince ayarlayıp dağıtmak istedi. MonsterAPI olmadan, bu, MLOps mühendislerinden oluşan bir ekibi, modelin kalitesini geliştirmek için hiperparametre ayarlamaları yapmak, sonra da modeli ölçeklenebilir bir REST API uç noktası olarak barındırmak için gereken teknik becerilere sahip olmaları gerekecekti.
MonsterAPI ile, birden fazla ince ayar çalışması deneyebildiler ve en iyi değerlendirme puanına sahip ince ayarlanmış modeli birkaç saat içinde barındırabildiler, bu da derin MLOps becerilerine sahip çoklu mühendislik kaynaklarına gerek kalmadan gerçekleşti.
Monster API’nin yaklaşımı, küçük geliştiriciler ve startup’lar için üretken AI modellerine erişimi nasıl demokratikleştirir?
Küçük geliştiriciler ve startup’lar genellikle yüksek kaliteli AI modelleri üretmek ve kullanmak için gerekli sermaye ve teknik becerilere sahip değildir. Çözümlerimiz, maliyetleri düşürerek, süreçleri basitleştirerek ve üretim sınıfı AI pipeline’lerini uygulamak için düşük kodlu araçlar sağlayarak onları güçlendirir.
Merkezi olmayan GPU bulutumuzu kullanarak, yüksek performanslı model dağıtımı için maliyet bariyerini önemli ölçüde azaltırız. Otomatik yapılandırma ve hiperparametre ayarlaması, süreci basitleştirir ve derin teknik uzmanlık gereksinimini ortadan kaldırır.
Kullanıcı dostu REST API’lerimiz ve entegre iş akışımız, ince ayarlamayı ve dağıtımı tek bir işleve dönüştürür, bu da gelişmiş AI teknolojilerini sınırlı deneyimlere sahip olanlar için bile erişilebilir hale getirir. Ayrıca, verimli LoRA ince ayarlaması ve GPT-Q ve AWQ gibi kuantizasyon tekniklerinin kullanılması, daha ucuz donanım üzerinde optimal performansı sağlar ve girişimdeki maliyetleri daha da düşürür.
Bu yaklaşım, küçük geliştiricilerin ve startup’ların gelişmiş üretken AI modellerini verimli ve etkili bir şekilde uygulamalarına ve yönetmelerine olanak tanır.
Monster API için teknoloji geliştirme ve pazar erişimi açısından uzun vadeli hedefler nelerdir?
Uzun vadeli olarak, 30 milyonluk bir yazılım mühendisi kitlesini, MLops geliştiricileri olarak yetiştirmek istiyoruz.
Bunun için, yalnızca bir ajan değil, aynı zamanda optimizasyon çerçeveleri, konteynırlaştırma yöntemleri ve orkestrasyon gibi temel teknolojiler geliştirmemiz gerekecek.
İnanıyoruz ki, harika, basit arayüzlerin, 10 kat daha fazla verimlilik ve düşük maliyetli merkezi olmayan GPU’ların bir bileşimi, bir geliştiricinin verimliliğini dönüştürebilir ve GenAI benimsemesini hızlandırabilir.
Tüm araştırmalarımız ve çabalarımız bu yöndedir.
Harika bir röportaj için teşekkür ederiz, daha fazla bilgi edinmek isteyen okuyucular MonsterAPI‘yi ziyaret edebilir.












