Wawancara
Kismat Singh, Co-Founder dan CEO MachGen AI – Seri Wawancara

Kismat Singh, Co-Founder dan CEO MachGen AI, adalah eksekutif infrastruktur AI dan teknik dengan pengalaman lebih dari dua dekade membangun sistem komputasi berkinerja tinggi dan pembelajaran mesin. Sebelum mendirikan MachGen AI, Singh menjabat sebagai VP Engineering untuk AI Frameworks di Intel dan sebelumnya memegang peran senior di bidang teknik di NVIDIA, AMD, HP, dan perusahaan teknologi lainnya. Karyanya mencakup kontribusi pada pustaka deep learning dan kompiler, optimisasi kerangka kerja AI, serta perbaikan ketahanan pelatihan hyperscale. Di Intel, ia terlibat erat dengan inisiatif PyTorch perusahaan dan secara publik berbicara tentang membuat kerangka kerja AI lebih mudah diakses di berbagai platform perangkat keras.
MachGen AI adalah perusahaan infrastruktur AI yang berfokus pada membuat model gambar dan video generatif jauh lebih cepat dan lebih ekonomis untuk dijalankan. Didirikan oleh Kismat Singh dan Manoj Krishnan, perusahaan ini mengembangkan stack inferensi dan fine-tuning berkinerja tinggi yang dirancang khusus untuk model difusi, bukan menyesuaikan infrastruktur yang awalnya dibangun untuk model bahasa besar. MachGen mengoptimalkan area termasuk perhitungan attention, caching, kernel GPU, manajemen memori, paralelisme, penjadwalan, dan penyebaran untuk mengurangi latensi generasi sambil mempertahankan kualitas model. Platformnya menyediakan API untuk generasi teks-ke-gambar, gambar-ke-gambar, teks-ke-video, gambar-ke-video, dan referensi-ke-video, dengan teknologi dasar yang ditujukan untuk memungkinkan aplikasi latensi rendah seperti pembuatan konten interaktif, avatar waktu nyata, game, dan iklan yang dipersonalisasi.
Anda telah menghabiskan lebih dari dua dekade bekerja pada video, komputasi GPU, dan kinerja AI, termasuk TensorRT di NVIDIA, perangkat lunak AI di Intel, optimisasi GPU di AMD, serta pekerjaan sebelumnya pada enkoding video waktu nyata. Apa yang Anda lihat selama tahun‑tahun itu yang pada akhirnya meyakinkan Anda untuk meninggalkan perusahaan teknologi besar dan mendirikan MachGen, serta mengapa Anda percaya bahwa inferensi difusi adalah masalah infrastruktur yang layak dibangun menjadi sebuah perusahaan?
Rekan pendiri saya, Manoj, dan saya bermain bulu tangkis di gym yang sama selama hampir 10 tahun. Selama sebagian besar waktu itu, kami berusaha merekrut satu sama lain. Akhirnya kami memutuskan bahwa lebih mudah bekerja bersama daripada terus merekrut satu sama lain.
Alasan kami memilih masalah ini adalah karena kami berdua telah menyaksikan stack inferensi berkembang dari dalam. Saya membantu membangun tim platform inferensi NVIDIA dan kemudian memimpin perangkat lunak AI di Intel. Manoj membangun infrastruktur pelatihan model besar di balik PyTorch di Meta. Kami menyaksikan bertahun‑tahun kerja pada caching, batching, penjadwalan, dan kernel mengubah sistem riset LLM awal menjadi infrastruktur produksi yang melayani triliunan token.
Difusi kira‑kira berada pada posisi inferensi LLM tiga tahun yang lalu. Model gambar dan video telah berkembang pesat, namun sistem yang melayaninya tetap lambat, mahal, dan sulit diskalakan. Sebagian besar infrastruktur yang ada dirancang untuk LLM, dengan difusi ditambahkan belakangan.
Tiga hal yang membuat timing tepat: model menjadi cukup baik untuk dibangun menjadi produk nyata, masalah tersebut membutuhkan tepat keterampilan yang telah kami kembangkan sepanjang karier, dan dampaknya cukup besar untuk membangun perusahaan generasi. Ketika video yang sebelumnya memerlukan beberapa menit dapat dihasilkan dalam hitungan detik dengan sebagian kecil biaya, generasi interaktif, iklan yang dipersonalisasi, avatar waktu nyata, dan produk kreatif baru sepenuhnya menjadi memungkinkan.
MachGen berpendapat bahwa banyak teknik yang mengubah inferensi model bahasa besar tidak dapat diterapkan secara bersih pada model difusi. Apa yang secara fundamental berbeda dalam melayani model gambar dan video, dan di mana bottleneck kinerja terbesar yang sering terlewat oleh infrastruktur AI konvensional?
LLM dan model difusi memiliki pola komputasi yang secara fundamental berbeda. LLM bersifat autoregresif, dengan tahap prefill yang berat secara komputasi diikuti oleh dekode token demi token yang terbatas memori. Teknik seperti KV caching dan pemisahan prefill/decode dirancang berdasarkan struktur tersebut.
Model difusi tidak bersifat autoregresif dan tetap terbatas komputasi sepanjang proses denoising. Generasi video juga melibatkan sejumlah besar data spasial dan temporal, menciptakan kebutuhan berbeda terkait attention, memori, komunikasi, dan paralelisme.
Akibatnya, banyak optimisasi yang dikembangkan untuk LLM tidak dapat diterapkan secara bersih. KV caching konvensional tidak menyelesaikan masalah yang sama, paralelisme standar dapat menimbulkan overhead komunikasi yang signifikan, dan kernel open‑source yang tersedia jauh kurang matang. Scheduler, model memori, strategi caching, kernel, dan paralelisme semuanya perlu dirancang khusus untuk difusi itu sendiri. Itulah mengapa kami membangun MachGen dengan difusi sebagai komponen utama.
MachGen melaporkan latensi sekitar 4–6 kali lebih rendah pada beberapa model gambar dan peningkatan sekitar 6 kali pada beberapa model video sambil menjalankan model asli yang tidak didistilasi. Apa terobosan teknis paling penting di balik peningkatan tersebut, dan bagaimana Anda memastikan bahwa peningkatan kinerja tidak mengorbankan kualitas output?
Keuntungan tersebut berasal dari beberapa bagian stack yang bekerja bersama. Attention mendominasi anggaran komputasi pada banyak model video, sehingga kami fokus pada resep presisi lebih rendah, sparse attention, dan teknik terkait. Kami juga telah mengembangkan metode caching yang memanfaatkan redundansi spasial dan temporal, kernel yang sangat dioptimalkan untuk arsitektur difusi, serta teknik paralelisme yang mengurangi overhead komunikasi.
Bersama-sama, perbaikan tersebut memungkinkan MachGen menghasilkan HiDream dalam satu detik dibandingkan enam detik dan Flux dalam 1,5 detik dibandingkan 6,2 detik. Untuk video, Wan 2.2 berjalan dalam 16,5 detik dibandingkan 98 detik, sementara LTX 2.3 berjalan dalam 10,7 detik dibandingkan 67 detik. Biaya inferensi juga 2–4× lebih rendah untuk model gambar dan 2–3× lebih rendah untuk video.
Hasil ini menggunakan model asli yang tidak didistilasi. Kami meningkatkan cara model berjalan tanpa mengorbankan kualitas output. Untuk adopsi produksi, kecepatan, biaya, dan kualitas harus bekerja bersama.
Trusted TV adalah contoh menarik karena mengurangi waktu generasi dari menit menjadi detik mengubah lebih dari sekadar tagihan infrastruktur. Setelah generasi video cukup cepat untuk menghasilkan ribuan kampanye dan variasi kreatif yang dipersonalisasi, model bisnis atau pengalaman produk baru apa yang menjadi memungkinkan yang sebelumnya tidak layak?
TrustedTV membantu bisnis membuat iklan siap siar dengan AI dan menempatkannya di platform TV terhubung seperti Prime Video, Roku, dan DirecTV. Banyak pelanggannya adalah usaha kecil. Membuat iklan TV secara tradisional memerlukan tim film dan penyuntingan, dengan biaya mulai dari ribuan dolar dan biasanya mencapai puluhan ribu dolar. Trusted TV menurunkannya menjadi nol. Seorang pemilik usaha kecil dapat membuat iklan lengkap dari smartphone dalam sekitar lima menit dan melihatnya sebelum membayar apa pun. Lebih dari 10.000 kampanye telah dibuat di platform ini.
Ian, CEO Trusted TV, melihat benchmark latensi MachGen pada Artificial Analysis dan tidak mempercayainya. Ia mendaftar untuk mengujinya sendiri. Render pertamanya kembali dalam sekitar 25 detik tanpa kehilangan kualitas, dan ketika ia melakukan tes konkruensi, perbaikan tersebut tetap bertahan pada skala besar. Mereka memindahkan seluruh alur kerja produksi ke MachGen dalam waktu kurang dari 48 jam, dan MachGen kini mendukung semua pembuatan video baru mereka. Pada penyebaran terbaru, kami mendekati 10 atau 11 detik pada model itu, dan kami akan terus meningkatkannya.
Dampak produk ini adalah pengiklan berhenti membuat satu atau dua iklan umum. Pengguna mereka mengganti dua atau tiga iklan baru setiap minggu, menguji kreativitas di berbagai segmen audiens, dan melakukan iterasi alih-alih berkomitmen. Selanjutnya adalah personalisasi tingkat geografis dan audiens pada skala besar, yang sebelumnya hanya tersedia bagi perusahaan dengan anggaran multi-juta dolar.
Sebuah versi yang saya pikirkan secara pribadi: Hari ini, saya melihat iklan sepatu yang diambil di sebuah jalan di Manhattan. Saya tinggal di Bay Area, jadi iklan itu tidak berarti bagi saya. Yang saya inginkan adalah iklan yang sama dengan latar belakang Mission Peak. Itu bukan iklan yang lebih murah; itu adalah jenis periklanan yang berbeda, dan hanya menjadi layak secara ekonomi ketika generasi cukup cepat dan murah untuk membuat ribuan varian.
Untuk perusahaan yang menyematkan generasi gambar atau video langsung ke dalam produk, bagaimana mereka harus memikirkan ekonomi inferensi? Pada skala apa mengoptimalkan pemanfaatan GPU menjadi penting secara strategis daripada sekadar membayar penyedia API untuk setiap generasi?
Titik balik muncul ketika inferensi mulai memengaruhi pengalaman pelanggan atau margin perusahaan.
API serbaguna dapat masuk akal saat tim sedang memvalidasi produk. Setelah generasi menjadi inti produk tersebut, tim harus melihat lebih jauh dari harga per output yang tercantum. Latensi, konkruensi, kualitas, keandalan, dan pemanfaatan GPU semuanya menjadi bagian dari ekonomi.
Sebuah generasi mungkin tampak murah, tetapi tetap menimbulkan masalah bisnis jika pengguna harus menunggu beberapa menit dan meninggalkan alur kerja. Arsitektur yang memerlukan kapasitas GPU tumbuh seiring dengan penggunaan juga akan menambah tekanan pada margin.
Tidak ada ambang batas volume permintaan tunggal karena komputasi yang dibutuhkan untuk klip 540p pendek sangat berbeda dari video 1080p yang lebih panjang. Optimasi menjadi strategis ketika peningkatan penggunaan menyebabkan biaya naik hampir pada tingkat yang sama, permintaan puncak menciptakan antrean, atau latensi mulai membatasi pengalaman produk.
MachGen bekerja di beberapa lapisan, termasuk kernel GPU khusus, caching, optimasi presisi, penjadwalan, dan paralelisme. Seiring model terus berkembang dengan cepat, lapisan mana dari stack inferensi yang Anda percaya menawarkan peluang terbesar yang tersisa untuk peningkatan dramatis dalam kecepatan dan biaya?
Untuk generasi video, attention merupakan salah satu peluang terbesar yang tersisa karena mendominasi anggaran komputasi pada banyak model. Masih ada ruang signifikan untuk memperbaiki resep presisi lebih rendah, sparse attention, dan kernel attention khusus difusi.
Attention hanyalah satu bagian dari peluang tersebut. Keuntungan keseluruhan terbesar akan datang dari menggabungkan perbaikan di seluruh stack. Caching adalah salah satu contohnya. Teknik KV caching yang digunakan dalam LLM tidak dapat langsung diterapkan, tetapi model difusi mengandung redundansi spasial dan temporal yang dapat dimanfaatkan dengan pendekatan yang tepat.
Paralelisme menawarkan peluang lain. Menambahkan GPU tidak serta-merta menghasilkan percepatan yang proporsional karena overhead komunikasi dapat mengimbangi manfaatnya. Kami mengembangkan kernel yang disesuaikan yang menumpang komunikasi dengan komputasi yang tidak bergantung pada data dan menyalurkannya bersama pekerjaan yang bergantung pada data.
Perhatian, caching, kernel, paralelisme, memori, dan penjadwalan semuanya saling memengaruhi satu sama lain. Mengoptimalkan hanya satu lapisan pada akhirnya menciptakan bottleneck di tempat lain. Peningkatan terbesar akan datang dari memperlakukan stack sebagai sistem lengkap yang dirancang untuk profil komputasi difusi.
Dengan model video yang lebih baru memperpendek waktu generasi mendekati waktu nyata, seberapa dekat kita dengan video generatif yang benar-benar interaktif, dan hambatan teknis apa yang masih perlu diatasi sebelum generasi video waktu nyata menjadi hal yang umum?
Kami sudah mencapai kecepatan interaktif untuk beberapa aplikasi. MachGen menghasilkan video Vidu Q3 Turbo berdurasi lima detik pada 720p dalam sekitar enam detik dan pada 540p dalam kurang dari tiga detik. Kecepatan itu cukup cepat untuk iterasi kreatif yang cepat dan membuat avatar responsif serta video interaktif dapat dicapai.
Contoh apa yang saya anggap interaktif. Bayangkan Anda sedang menonton sebuah cerita, dan Anda dapat melihat ke mana akhir cerita akan pergi, namun Anda tidak menyukainya. Alih-alih duduk pasif, Anda mengarahkan ulang cerita: dua karakter tersebut harus mencari tahu apa yang disembunyikan oleh karakter ketiga, dan menghadapi dia daripada membiarkannya berlanjut. Konten yang Anda kendalikan alih-alih konten yang Anda terima. Itulah yang memungkinkan dengan generasi yang cepat dan murah, dan hal itu mengubah hampir semua yang kita konsumsi.
Mencapainya biasanya memerlukan lebih dari satu tolok ukur latensi yang kuat. Seluruh pengalaman harus tetap responsif di bawah beban lalu lintas produksi sambil mempertahankan kualitas visual, konsistensi antar frame, dan biaya yang dapat diprediksi. Video yang lebih panjang, resolusi yang lebih tinggi, dan permintaan bersamaan semuanya meningkatkan beban infrastruktur, dan sistem tetap harus menyediakan kapasitas, mengarahkan permintaan, serta memulihkan diri dari kegagalan perangkat keras tanpa pengguna menyadarinya.
Itu akan tiba secara bertahap per kasus penggunaan. Klip pendek, avatar, game, dan alat kreatif kemungkinan akan menjadi yang pertama karena generasi yang diukur dalam hitungan detik sudah cukup bagi mereka. Seiring kualitas model dan performa inferensi meningkat bersamaan, lebih banyak aplikasi akan melewati ambang batas tersebut.
Seiring agen AI semakin banyak menghasilkan gambar dan video secara otonom tanpa menunggu manusia menekan tombol, bagaimana hal itu mengubah kebutuhan infrastruktur? Apakah beban kerja yang digerakkan oleh agen menciptakan tuntutan yang secara fundamental berbeda terkait latensi, konkruensi, biaya, dan keandalan?
Sebuah agen mengubah satu permintaan pengguna menjadi puluhan atau ratusan pekerjaan generasi. Ia membuat beberapa opsi, mengevaluasinya, merevisi prompt, dan mengulangi proses tersebut, tanpa intervensi manusia di antara langkah-langkahnya.
Hal itu membuat latensi, konkruensi, biaya, dan keandalan menjadi jauh lebih penting. Jika setiap generasi memakan menit, alur kerja agen terlalu lambat untuk berguna. Jika setiap percobaan mahal, iterasi otonom menjadi tidak praktis secara ekonomi. Sistem juga harus dapat menangani banyak permintaan simultan secara andal karena satu kegagalan dapat mengganggu seluruh rangkaian pekerjaan.
Di sinilah kemampuan seperti penyediaan GPU, autoscaling, dan routing menjadi penting setara dengan optimasi pada tingkat model. Permintaan agen jauh lebih berlonjakan dibandingkan permintaan dari aplikasi kreatif di mana seseorang hanya menekan tombol.
Unit kerja yang relevan tidak lagi berupa satu gambar atau video. Itu adalah siklus penuh menghasilkan, mengevaluasi, dan menyempurnakan konten. Infrastruktur harus membuat seluruh siklus itu cepat, terjangkau, dan andal.
Ada persaingan sengit di antara penyedia GPU, layanan cloud inferensi, pengembang model, dan platform optimasi. Karena perangkat keras itu sendiri menjadi lebih cepat, mengapa perusahaan masih membutuhkan lapisan inferensi khusus seperti MachGen alih-alih mengandalkan perbaikan dari NVIDIA, AMD, penyedia cloud, atau pengembang model itu sendiri?
Perangkat keras yang lebih cepat menaikkan batas atas. Perangkat lunak menentukan seberapa banyak batas itu yang dapat dicapai.
Kami telah menyaksikannya pada LLM. Akselerator baru meningkatkan kinerja mentah setiap generasi, dan batching kontinu, manajemen KV‑cache, decoding spekulatif, serta kernel khusus tetap menjadi faktor yang membawa industri ke tingkat throughput dan ekonomi produksi. Semua itu tidak berasal dari perangkat keras.
Mengoptimalkan secara berkelanjutan jalur produksi penuh untuk generasi gambar dan video adalah pekerjaan yang berbeda dari apa yang dilakukan vendor perangkat keras, penyedia cloud, dan pengembang model, dan hal itu bukan prioritas utama bagi mereka mana pun.
Ada beberapa pendekatan untuk pekerjaan itu. Salah satunya adalah model pasar, di mana model‑model digabungkan dan permintaan diarahkan. Kami tidak berpikir itu dapat dipertahankan dalam jangka panjang, karena tidak ada kontrol atas lapisan tempat kinerja berada. Kami memilih untuk membangun stack sendiri dan menampungnya secara native, yang merupakan satu‑satunya cara untuk mencapai angka latensi dan biaya yang kami lihat.
Itu berarti menyesuaikan attention, caching, kernel, presisi, memori, dan paralelisme per model dan per akselerator, serta mendukung API yang dikelola, cloud khusus, dan penyebaran mandiri. Seiring bertambahnya jumlah model dan opsi perangkat keras, kompleksitas juga meningkat. Peran kami adalah menyerapnya sehingga pelanggan kami dapat menghabiskan waktu mereka pada hal yang membedakan produk mereka.
Anda telah menggambarkan world models sebagai bagian dari visi jangka panjang MachGen, dengan banyak karakteristik komputasinya menyerupai beban kerja difusi. Seperti apa infrastruktur untuk world models berskala produksi, dan aplikasi apa yang menjadi mungkin jika menghasilkan serta mensimulasikan lingkungan visual pada akhirnya menjadi semurah dan secepat menghasilkan teks saat ini?
Salah satu cara memikirkan platform kami adalah menyerupai LLM tujuan umum. Model yang sama menyusun perjanjian hukum dan menjawab pertanyaan tentang restoran. Bagi kami, tumpukan yang sama melayani perusahaan avatar video, iklan AI, pembuatan cerita dan mikrodrama, dan pada akhirnya world models. Berbagai vertikal, satu set masalah kinerja mendasar.
World models bukanlah bisnis inti kami saat ini, tetapi itulah yang kami bangun, dan kami aktif mengerjakannya. World models berskala produksi akan membutuhkan throughput yang sangat tinggi dan latensi yang sangat rendah karena mereka terus-menerus menghasilkan dan memperbarui lingkungan alih-alih menghasilkan satu output saja. Mereka juga memerlukan konsistensi spasial dan temporal, kemampuan merespons tindakan, dan seringkali kemampuan mensimulasikan beberapa kemungkinan hasil secara bersamaan. Hal itu menimbulkan masalah berat dalam memori, pergerakan data, paralelisme, dan keandalan. World model yang mengendalikan robot atau game tidak dapat memakan menit untuk menghasilkan status berikutnya. Kinerja menentukan apakah sistem ini dapat digunakan sama sekali.
Secara komputasi, world models saat ini sangat mirip dengan model difusi, sehingga tumpukan yang kami bangun sekarang menjadi fondasi alami. Belum ada lapisan layanan produksi yang matang untuk mereka, yang sebanding dengan yang ada untuk LLM. Kami berencana untuk membangunnya.
Jika simulasi menjadi seresponsif dan terjangkau seperti generasi teks saat ini, robot dapat melatih situasi langka sebelum mengalaminya, game dapat menghasilkan lingkungan yang merespons pemain secara individual, dan desainer dapat menguji puluhan kemungkinan sebelum membangun di dunia fisik. Diffusion adalah bidang di mana kami menghasilkan pendapatan hari ini. World models adalah Bintang Utara kami.
Terima kasih atas wawancara yang luar biasa, pembaca yang ingin mempelajari lebih lanjut sebaiknya mengunjungi MachGen AI.












