Wawancara
Saurabh Vij, CEO & Co-Founder of MonsterAPI – Seri Wawancara

Saurabh Vij adalah CEO dan co-founder dari MonsterAPI. Sebelumnya, ia bekerja sebagai fisikawan partikel di CERN dan mengenali potensi komputasi terdesentralisasi dari proyek-proyek seperti LHC@home.
MonsterAPI memanfaatkan GPU komoditas dengan biaya rendah dari pertambangan kripto ke pusat data yang lebih kecil untuk menyediakan infrastruktur GPU yang dapat diskalakan dan terjangkau untuk pembelajaran mesin, memungkinkan pengembang untuk mengakses, memperbarui, dan mengirimkan model AI dengan biaya yang jauh lebih rendah tanpa menulis satu baris kode.
Sebelum MonsterAPI, ia menjalankan dua startup, termasuk satu yang mengembangkan perangkat keamanan wearable untuk wanita di India, dalam kolaborasi dengan Pemerintah India dan IIT Delhi.
Apakah Anda dapat membagikan cerita di balik MonsterGPT?
Misi kami selalu “untuk membantu pengembang perangkat lunak memperbarui dan mengirimkan model AI lebih cepat dan dengan cara yang paling mudah mungkin.” Kami menyadari bahwa ada banyak tantangan kompleks yang mereka hadapi ketika mereka ingin memperbarui dan mengirimkan model AI.
Dari menghadapi kode hingga mengatur kontainer Docker pada GPU dan menskalakan pada permintaan
Dan kecepatan di mana ekosistem bergerak, hanya memperbarui tidak cukup. Ini harus dilakukan dengan cara yang benar: Menghindari underfitting, overfitting, optimasi hiperparameter, mengintegrasikan metode terbaru seperti LORA dan Q-LORA untuk melakukan pembaruan yang lebih cepat dan lebih ekonomis. Setelah pembaruan, model tersebut perlu diimplementasikan secara efisien.
Ini membuat kami menyadari bahwa menawarkan hanya alat untuk bagian kecil dari pipeline tidak cukup. Pengembang memerlukan pipeline yang dioptimalkan secara keseluruhan dengan antarmuka yang hebat yang mereka kenal. Dari pembaruan hingga evaluasi dan implementasi akhir dari model mereka.
Saya bertanya pada diri sendiri: Sebagai seorang fisikawan partikel sebelumnya, saya memahami dampak mendalam yang AI bisa miliki pada pekerjaan ilmiah, tetapi saya tidak tahu dari mana harus memulai. Saya memiliki ide inovatif tetapi kekurangan waktu untuk mempelajari semua keterampilan dan nuansa pembelajaran mesin dan infrastruktur.
Bagaimana jika saya bisa berbicara dengan AI, memberikan persyaratan saya, dan memiliki AI membangun pipeline keseluruhan untuk saya, mengirimkan titik akhir API yang diperlukan?
Ini mengarah pada ide sistem berbasis obrolan untuk membantu pengembang memperbarui dan mengirimkan dengan mudah.
MonsterGPT adalah langkah pertama kami menuju perjalanan ini.
Ada jutaan pengembang perangkat lunak, inovator, dan ilmuwan seperti kami yang bisa memanfaatkan pendekatan ini untuk membangun model domain-spesifik lebih banyak untuk proyek mereka.
Bagaimana teknologi di balik agen pengiriman GPT-based Monster API?
MonsterGPT memanfaatkan teknologi canggih untuk mengirimkan dan memperbarui model bahasa besar (LLM) sumber terbuka seperti Phi3 dari Microsoft dan Llama 3 dari Meta secara efisien.
- RAG dengan Konfigurasi Konteks: Secara otomatis menyiapkan konfigurasi dengan hiperparameter yang tepat untuk memperbarui LLM atau mengirimkan model menggunakan REST API yang dapat diskalakan dari MonsterAPI.
- LoRA (Low-Rank Adaptation): Memungkinkan pembaruan yang efisien dengan memperbarui hanya subset parameter, mengurangi overhead komputasi dan kebutuhan memori.
- Teknik Kuantisasi: Menggunakan GPT-Q dan AWQ untuk mengoptimalkan kinerja model dengan mengurangi presisi, yang menurunkan jejak memori dan mempercepat inferensi tanpa kehilangan akurasi yang signifikan.
- Engine vLLM: Menyediakan layanan LLM dengan throughput tinggi dengan fitur seperti batching terus menerus, kernel CUDA yang dioptimalkan, dan algoritma dekoding paralel untuk inferensi skala besar yang efisien.
- GPU Terdesentralisasi untuk Skalabilitas dan Biaya Rendah: Pekerjaan pembaruan dan pengiriman kami berjalan pada jaringan GPU dengan biaya rendah dari beberapa vendor dari pusat data kecil hingga awan GPU yang muncul seperti coreweave untuk menyediakan biaya yang lebih rendah, opsi yang lebih banyak, dan ketersediaan GPU untuk memastikan pemrosesan yang efisien dan skalabel.
Periksa blog terbaru untuk pengiriman Llama 3 menggunakan MonsterGPT:
Bagaimana MonsterGPT menyederhanakan proses pembaruan dan pengiriman?
MonsterGPT menyediakan antarmuka obrolan dengan kemampuan untuk memahami instruksi dalam bahasa alami untuk meluncurkan, melacak, dan mengelola pekerjaan pembaruan dan pengiriman yang lengkap. Kemampuan ini mengabstraksi banyak langkah kompleks seperti:
- Membangun pipeline data
- Menentukan infrastruktur GPU yang tepat untuk pekerjaan
- Mengonfigurasi hiperparameter yang tepat
- Mengatur lingkungan ML dengan kerangka kerja dan perpustakaan yang kompatibel
- Mengimplementasikan skrip pembaruan untuk pembaruan LoRA/QLoRA yang efisien dengan strategi kuantisasi.
- Mengatasi masalah seperti kehabisan memori dan kesalahan kode.
- Mendesain dan mengimplementasikan auto-scaling multi-node dengan mesin pengiriman vLLM untuk pengiriman LLM.
Apa jenis antarmuka pengguna dan perintah yang dapat pengembang harapkan saat berinteraksi dengan antarmuka obrolan Monster API?
Antarmuka pengguna adalah antarmuka obrolan sederhana di mana pengguna dapat meminta agen untuk memperbarui LLM untuk tugas tertentu seperti ringkasan, pengisian obrolan, generasi kode, penulisan blog, dan lain-lain, dan kemudian, setelah pembaruan, GPT dapat diinstruksikan untuk mengirimkan LLM dan mengquery model yang diterapkan dari antarmuka GPT itu sendiri. Beberapa contoh perintah termasuk:
- Perbarui LLM untuk generasi kode pada dataset X
- Saya ingin model yang diperbarui untuk penulisan blog
- Beri saya titik akhir API untuk model Llama 3.
- Kirimkan model kecil untuk kasus penggunaan penulisan blog
Ini sangat berguna karena menemukan model yang tepat untuk proyek Anda dapat menjadi tugas yang memakan waktu. Dengan model baru muncul setiap hari, ini dapat menyebabkan banyak kebingungan.
Bagaimana solusi Monster API membandingkan dalam hal kemudahan penggunaan dan efisiensi dengan metode tradisional pengiriman model AI?
Solusi Monster API secara signifikan meningkatkan kemudahan penggunaan dan efisiensi dibandingkan dengan metode tradisional pengiriman model AI.
Untuk Kemudahan Penggunaan:
- Konfigurasi Otomatis: Metode tradisional sering memerlukan pengaturan manual ekstensif hiperparameter dan konfigurasi, yang dapat berbahaya dan memakan waktu. MonsterAPI mengotomatisasi proses ini menggunakan RAG dengan konteks, menyederhanakan pengaturan dan mengurangi kemungkinan kesalahan.
- REST API yang Dapat Diskalakan: MonsterAPI menyediakan REST API yang intuitif untuk mengirimkan dan memperbarui model, membuatnya dapat diakses bahkan oleh pengguna dengan pengetahuan mesin pembelajaran yang terbatas. Metode tradisional sering memerlukan pengetahuan teknis yang mendalam dan pengkodean yang kompleks untuk pengiriman.
- Platform Terpadu: Ini mengintegrasikan seluruh alur kerja, dari pembaruan hingga pengiriman, dalam satu platform. Pendekatan tradisional mungkin melibatkan alat dan platform yang berbeda, yang dapat menyebabkan ketidakefisienan dan tantangan integrasi.
Untuk Efisiensi:
MonsterAPI menawarkan pipeline yang disederhanakan untuk Pembaruan LoRA dengan Kuantisasi yang terintegrasi untuk utilisasi memori yang efisien dan mesin pengiriman vLLM yang ditenagai untuk mencapai throughput tinggi dengan batching terus menerus dan kernel CUDA yang dioptimalkan, di atas awan GPU terdesentralisasi yang biaya-efektif, skalabel, dan sangat tersedia untuk memastikan pemrosesan yang efisien dan skalabel.
Pipeline keseluruhan ini meningkatkan produktivitas pengembang dengan memungkinkan pembuatan aplikasi LLM kustom produksi-siaga sambil mengurangi kebutuhan akan keterampilan teknis yang kompleks.
Apakah Anda dapat memberikan contoh kasus penggunaan di mana Monster API secara signifikan mengurangi waktu dan sumber daya yang diperlukan untuk pengiriman model?
Sebuah perusahaan konsultan IT perlu memperbarui dan mengirimkan model Llama 3 untuk memenuhi kebutuhan bisnis klien mereka. Tanpa MonsterAPI, mereka akan memerlukan tim 2-3 insinyur MLOps dengan pemahaman yang mendalam tentang pengoptimalan hiperparameter untuk meningkatkan kualitas model pada dataset yang diberikan, dan kemudian menghosting model yang diperbarui sebagai titik akhir REST API yang dapat diskalakan menggunakan auto-scaling dan orkestrasi, kemungkinan pada Kubernetes. Selain itu, untuk mengoptimalkan ekonomi pengiriman model, mereka ingin menggunakan kerangka kerja seperti LoRA untuk pembaruan dan vLLM untuk pengiriman model untuk meningkatkan metrik biaya sambil mengurangi konsumsi memori. Ini dapat menjadi tantangan yang kompleks bagi banyak pengembang dan dapat memakan waktu beberapa minggu atau bahkan bulan untuk mencapai solusi yang siap produksi. Dengan MonsterAPI, mereka dapat bereksperimen dengan beberapa kali pembaruan dalam satu hari dan menghosting model yang diperbarui dengan skor evaluasi terbaik dalam beberapa jam, tanpa memerlukan sumber daya insinyur dengan keterampilan MLOps yang mendalam.
Bagaimana pendekatan Monster API mendemokratisasikan akses ke model AI generatif untuk pengembang yang lebih kecil dan startup?
Pengembang yang lebih kecil dan startup sering mengalami kesulitan untuk menghasilkan dan menggunakan model AI berkualitas tinggi karena kekurangan modal dan keterampilan teknis. Solusi kami memungkinkan mereka dengan menurunkan biaya, menyederhanakan proses, dan menyediakan alat no-code/low-code yang kuat untuk mengimplementasikan pipeline AI yang siap produksi.
Dengan memanfaatkan awan GPU terdesentralisasi kami, kami menawarkan sumber daya GPU yang terjangkau dan skalabel, secara signifikan mengurangi hambatan biaya untuk pengiriman model berkinerja tinggi. Konfigurasi dan pengoptimalan hiperparameter yang otomatis menyederhanakan proses, menghilangkan kebutuhan akan keahlian teknis yang mendalam.
API REST kami yang terintegrasi dan alur kerja yang menyatu memadukan pembaruan dan pengiriman menjadi satu proses kohesif, membuat teknologi AI canggih dapat diakses bahkan oleh mereka dengan pengalaman terbatas. Selain itu, penggunaan teknik pembaruan LoRA yang efisien dan kuantisasi seperti GPT-Q dan AWQ memastikan kinerja optimal pada perangkat keras yang kurang mahal, lebih lanjut menurunkan biaya masuk.
Pendekatan ini memungkinkan pengembang yang lebih kecil dan startup untuk mengimplementasikan dan mengelola model AI generatif canggih secara efisien dan efektif.
Apa yang Anda bayangkan sebagai kemajuan besar atau fitur berikutnya yang Monster API akan bawa ke komunitas pengembangan AI?
Kami bekerja pada beberapa produk inovatif untuk lebih maju dalam tesis kami: Membantu pengembang mengkustomisasi dan mengirimkan model lebih cepat, lebih mudah, dan dengan cara yang paling ekonomis.
Langkah berikutnya adalah Asisten AI MLOps yang melakukan penelitian pada strategi optimasi baru untuk LLMOps dan mengintegrasikannya ke dalam alur kerja yang ada untuk mengurangi upaya pengembang dalam membangun model baru dan lebih baik sambil juga memungkinkan kustomisasi dan pengiriman pipeline LLM produksi yang lengkap.
Bayangkan Anda perlu menghasilkan 1 juta gambar per menit untuk kasus penggunaan Anda. Ini bisa sangat mahal. Secara tradisional, Anda akan menggunakan model Stable Diffusion dan menghabiskan jam-jam mencari dan menguji kerangka kerja optimasi seperti TensorRT untuk meningkatkan throughput tanpa mengorbankan kualitas dan latensi output.
Namun, dengan agen MLOps MonsterAPI, Anda tidak perlu membuang semua sumber daya itu. Agen akan menemukan kerangka kerja terbaik untuk kebutuhan Anda, memanfaatkan optimasi seperti TensorRT yang disesuaikan dengan kasus penggunaan spesifik Anda.
Bagaimana Monster API berencana untuk terus mendukung dan mengintegrasikan model sumber terbuka baru saat mereka muncul?
Dalam 3 cara utama:
- Membawa Akses ke Model Sumber Terbuka Terbaru
- Menyediakan Antarmuka Paling Sederhana untuk Pembaruan dan Pengiriman
- Mengoptimalkan Seluruh Tumpukan untuk Kecepatan dan Biaya dengan Kerangka Kerja dan Perpustakaan Paling Canggih dan Kuat
Misi kami adalah membantu pengembang dari semua tingkat keterampilan untuk mengadopsi Gen AI lebih cepat, mengurangi waktu dari ide hingga titik akhir API yang siap digunakan.
Kami akan terus berupaya untuk menyediakan akses ke kerangka kerja dan perpustakaan terbaru dan paling kuat, terintegrasi ke dalam alur kerja yang lancar untuk implementasi LLMOps ujung-ke-ujung. Kami berkomitmen untuk mengurangi kompleksitas bagi pengembang dengan alat no-code kami, sehingga meningkatkan produktivitas mereka dalam membangun dan mengirimkan model AI.
Untuk mencapai ini, kami terus mendukung dan mengintegrasikan model sumber terbuka baru, kerangka kerja optimasi, dan perpustakaan dengan memantau kemajuan di komunitas AI. Kami mempertahankan awan GPU terdesentralisasi yang skalabel dan secara aktif berinteraksi dengan pengembang untuk akses awal dan umpan balik. Dengan memanfaatkan pipeline otomatis untuk integrasi yang lancar, meningkatkan API yang fleksibel, dan membentuk kemitraan strategis dengan organisasi penelitian AI, kami memastikan platform kami tetap canggih.
Tambahnya, kami menyediakan dokumentasi komprehensif dan dukungan teknis yang kuat, memungkinkan pengembang untuk dengan cepat mengadopsi dan memanfaatkan model terbaru. MonsterAPI menjaga pengembang di garis depan teknologi AI generatif, memungkinkan mereka untuk berinovasi dan sukses.
Apa tujuan jangka panjang untuk Monster API dalam hal pengembangan teknologi dan jangkauan pasar?
Dalam jangka panjang, kami ingin membantu 30 juta insinyur perangkat lunak menjadi pengembang MLOps dengan bantuan agen MLOps kami dan semua alat yang kami bangun.
Ini akan memerlukan kami untuk membangun tidak hanya agen yang lengkap tetapi juga banyak teknologi fundamental yang propietary sekitar kerangka kerja optimasi, metode kontainerisasi, dan orkestrasi.
Kami percaya bahwa kombinasi antarmuka yang hebat, 10x lebih banyak throughput, dan GPU terdesentralisasi dengan biaya rendah memiliki potensi untuk mengubah produktivitas pengembang dan dengan demikian mempercepat adopsi GenAI.
Semua penelitian dan upaya kami ada di arah ini.
Terima kasih atas wawancara yang luar biasa, pembaca yang ingin mempelajari lebih lanjut harus mengunjungi MonsterAPI.












