साक्षात्कार

Kismat Singh, सह-संस्थापक और CEO of MachGen AI – साक्षात्कार श्रृंखला

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

Kismat Singh, MachGen AI के सह-संस्थापक और CEO, दो दशकों से अधिक के अनुभव के साथ एक AI इन्फ्रास्ट्रक्चर और इंजीनियरिंग कार्यकारी हैं, जिन्होंने हाई‑परफ़ॉर्मेंस कंप्यूटिंग और मशीन लर्निंग सिस्टम बनाए हैं। MachGen AI की सह-स्थापना से पहले, Singh ने Intel में AI फ्रेमवर्क्स के लिए इंजीनियरिंग के उपाध्यक्ष के रूप में कार्य किया और पहले NVIDIA, AMD, HP और अन्य प्रौद्योगिकी कंपनियों में वरिष्ठ इंजीनियरिंग पदों पर रहे। उनका काम डीप लर्निंग लाइब्रेरीज़ और कंपाइलर्स, AI फ्रेमवर्क अनुकूलन, तथा हाइपरस्केल प्रशिक्षण की लचीलापन में सुधार शामिल रहा है। Intel में, वे कंपनी की PyTorch पहलों में निकटता से जुड़े रहे और विभिन्न हार्डवेयर प्लेटफ़ॉर्म पर AI फ्रेमवर्क को अधिक सुलभ बनाने के बारे में सार्वजनिक रूप से बात की।

MachGen AI एक AI इन्फ्रास्ट्रक्चर कंपनी है जो जनरेटिव इमेज और वीडियो मॉडल को अत्यधिक तेज़ और अधिक किफायती बनाने पर केंद्रित है। Kismat Singh और Manoj Krishnan द्वारा स्थापित, कंपनी एक हाई‑परफ़ॉर्मेंस इनफ़रेंस और फाइन‑ट्यूनिंग स्टैक विकसित कर रही है, जो विशेष रूप से डिफ्यूज़न मॉडल के लिए डिज़ाइन किया गया है, न कि बड़े भाषा मॉडल के लिए बनाई गई इन्फ्रास्ट्रक्चर को अनुकूलित करने के लिए। MachGen ध्यान (attention) गणना, कैशिंग, GPU kernels, मेमोरी मैनेजमेंट, पैरललिज़्म, शेड्यूलिंग और डिप्लॉयमेंट जैसे क्षेत्रों को अनुकूलित करता है ताकि जनरेशन लेटेंसी को घटाया जा सके जबकि मॉडल की गुणवत्ता बनी रहे। इसका प्लेटफ़ॉर्म टेक्स्ट‑टू‑इमेज, इमेज‑टू‑इमेज, टेक्स्ट‑टू‑वीडियो, इमेज‑टू‑वीडियो, और रेफ़रेंस‑टू‑वीडियो जनरेशन के लिए API प्रदान करता है, और अंतर्निहित तकनीक इंटरैक्टिव कंटेंट निर्माण, रियल‑टाइम अवतार, गेमिंग, और व्यक्तिगत विज्ञापन जैसी कम‑लेटेंसी एप्लिकेशन को सक्षम करने के उद्देश्य से है।

आपने दो दशकों से अधिक समय तक वीडियो, GPU कंप्यूट, और AI प्रदर्शन पर काम किया है, जिसमें NVIDIA में TensorRT, Intel में AI सॉफ़्टवेयर, AMD में GPU अनुकूलन, और पहले रियल‑टाइम वीडियो एन्कोडिंग पर काम शामिल है। इन वर्षों में आपने क्या देखा जिसने अंततः आपको बड़े प्रौद्योगिकी कंपनियों को छोड़कर MachGen की सह-स्थापना करने के लिए प्रेरित किया, और क्यों आपको लगा कि डिफ्यूज़न इनफ़रेंस वह इन्फ्रास्ट्रक्चर समस्या है जिसके लिए कंपनी बनाना योग्य है?

मेरे सह-संस्थापक Manoj और मैं लगभग 10 वर्षों तक एक ही जिम में बैडमिंटन खेलते रहे। अधिकांश समय हम एक‑दूसरे को नियुक्त करने की कोशिश करते रहे। अंत में हमने तय किया कि एक‑दूसरे को लगातार भर्ती करने की बजाय साथ काम करना आसान है।

हमने इस समस्या को चुनने का कारण यह है कि हमने दोनों ने इन्फरेंस स्टैक को अंदर से विकसित होते देखा है। मैंने NVIDIA की इन्फरेंस प्लेटफ़ॉर्म टीम बनाने में मदद की और फिर Intel में AI सॉफ़्टवेयर का नेतृत्व किया। Manoj ने Meta में PyTorch के पीछे बड़े‑मॉडल प्रशिक्षण इन्फ्रास्ट्रक्चर का निर्माण किया। हमने कैशिंग, बैचिंग, शेड्यूलिंग और kernels पर कई वर्षों के कार्य को देखा, जिसने शुरुआती LLM शोध प्रणालियों को ट्रिलियन‑टोकन सर्व करने वाले उत्पादन इन्फ्रास्ट्रक्चर में बदल दिया।

डिफ्यूज़न लगभग उसी स्तर पर है जहाँ तीन साल पहले LLM इन्फरेंस था। इमेज और वीडियो मॉडल तेज़ी से विकसित हुए हैं, लेकिन उन्हें सर्व करने वाली प्रणालियाँ अभी भी धीमी, महंगी और स्केल करने में कठिन हैं। अधिकांश मौजूदा इन्फ्रास्ट्रक्चर LLM के लिए डिज़ाइन किया गया था, और डिफ्यूज़न बाद में जोड़ा गया।

समय सही होने के तीन कारण थे: मॉडल इतने सक्षम हो गए कि वास्तविक उत्पाद बनाए जा सकें, समस्या को ठीक वही कौशल चाहिए थे जो हमने अपने करियर में विकसित किए थे, और प्रभाव इतना बड़ा है कि एक पीढ़ीगत कंपनी बनाई जा सके। जब एक वीडियो जो पहले कई मिनट लेता था, सेकंड में ही कम लागत पर उत्पन्न हो सकता है, तो इंटरैक्टिव जनरेशन, व्यक्तिगत विज्ञापन, रियल‑टाइम अवतार, और पूरी तरह नए रचनात्मक उत्पाद संभव हो जाते हैं।

MachGen का तर्क है कि बड़े भाषा मॉडल इन्फरेंस को बदलने वाली कई तकनीकें डिफ्यूज़न मॉडल में साफ़‑साफ़ नहीं ट्रांसफ़र होतीं। इमेज और वीडियो मॉडल को सर्व करने में मूलतः क्या अलग है, और पारंपरिक AI इन्फ्रास्ट्रक्चर किन सबसे बड़े प्रदर्शन बाधाओं को अक्सर नजरअंदाज़ करता है?

LLM और डिफ्यूज़न मॉडल की कम्प्यूटेशनल पैटर्न मूलतः अलग हैं। LLM ऑटो‑रेग्रेसिव होते हैं, जिसमें भारी कम्प्यूट वाला प्रीफ़िल होता है, उसके बाद मेमोरी‑बाउंड टोकन‑दर‑टोकन डिकोडिंग आती है। KV कैशिंग और प्रीफ़िल/डिकोड डिसएग्रेगेशन जैसी तकनीकें उसी संरचना के अनुसार डिज़ाइन की गई थीं।

डिफ्यूज़न मॉडल गैर‑ऑटो‑रेग्रेसिव होते हैं और डीनॉइज़िंग प्रक्रिया के दौरान लगातार कम्प्यूट‑बाउंड रहते हैं। वीडियो जनरेशन में बड़े पैमाने पर स्पैशियल और टेम्पोरल डेटा शामिल होता है, जिससे ध्यान, मेमोरी, कम्युनिकेशन और पैरललिज़्म के संबंध में अलग‑अलग मांगें उत्पन्न होती हैं।

परिणामस्वरूप, LLM के लिए विकसित कई अनुकूलन डिफ्यूज़न में साफ़‑साफ़ नहीं ट्रांसफ़र होते। पारंपरिक KV कैशिंग वही समस्या नहीं हल करती, मानक पैरललिज़्म महत्वपूर्ण कम्युनिकेशन ओवरहेड पैदा कर सकता है, और उपलब्ध ओपन‑सोर्स kernels काफी कम परिपक्व हैं। शेड्यूलर, मेमोरी मॉडल, कैशिंग स्ट्रैटेजी, kernels, और पैरललिज़्म को सभी को डिफ्यूज़न को केंद्र में रखकर डिजाइन करना आवश्यक है। यही कारण है कि हमने MachGen को डिफ्यूज़न को प्रथम‑श्रेणी के घटक के रूप में बनाकर विकसित किया।

MachGen रिपोर्ट करता है कि कुछ इमेज मॉडल पर लगभग 4–6 गुना कम लेटेंसी और कई वीडियो मॉडल पर लगभग 6 गुना सुधार प्राप्त हुआ है, जबकि मूल, अनडिस्टिल्ड मॉडल चल रहे हैं। इन सुधारों के पीछे सबसे महत्वपूर्ण तकनीकी breakthroughs क्या हैं, और आप कैसे सुनिश्चित करते हैं कि प्रदर्शन में सुधार आउटपुट गुणवत्ता की कीमत पर न हो?

इन लाभों का कारण स्टैक के कई भागों का एक साथ काम करना है। कई वीडियो मॉडलों में ध्यान (Attention) कंप्यूट बजट पर हावी रहता है, इसलिए हम कम-प्रिसिशन रेसिपी, स्पार्स अटेंशन और संबंधित तकनीकों पर ध्यान केंद्रित करते हैं। हमने ऐसी कैशिंग विधियाँ भी विकसित की हैं जो स्थानिक और कालिक पुनरावृत्ति का उपयोग करती हैं, डिफ्यूज़न आर्किटेक्चर के लिए अत्यधिक अनुकूलित कर्नेल, और संचार ओवरहेड को कम करने वाली समानांतरता तकनीकें।

इन सुधारों के साथ, MachGen HiDream को एक सेकंड में, जबकि पहले छह सेकंड लगते थे, और Flux को 1.5 सेकंड में, जबकि पहले 6.2 सेकंड लगते थे, प्रदान कर सकता है। वीडियो के लिए, Wan 2.2 16.5 सेकंड में चलता है, जबकि पहले 98 सेकंड लगते थे, और LTX 2.3 10.7 सेकंड में चलता है, जबकि पहले 67 सेकंड लगते थे। इन्फ़रेंस लागत भी इमेज मॉडलों के लिए 2–4 गुना और वीडियो के लिए 2–3 गुना कम है।

ये परिणाम मूल, बिना डिस्टिल किए गए मॉडलों का उपयोग करके प्राप्त किए गए हैं। हम मॉडल के चलने के तरीके को सुधार रहे हैं, बिना आउटपुट गुणवत्ता का बलिदान किए। उत्पादन में अपनाने के लिए, गति, लागत और गुणवत्ता सभी को साथ-साथ काम करना आवश्यक है।

Trusted TV एक दिलचस्प उदाहरण है क्योंकि पीढ़ी को मिनटों से सेकंडों में घटाने से केवल बुनियादी ढांचे के बिल में ही नहीं, बल्कि कई अन्य पहलुओं में परिवर्तन आता है। जब वीडियो पीढ़ी इतनी तेज़ हो जाती है कि हजारों अभियान और व्यक्तिगत रचनात्मक विविधताएँ बन सकें, तो कौन से नए व्यापार मॉडल या उत्पाद अनुभव संभव हो जाते हैं जो पहले व्यावहारिक नहीं थे?

TrustedTV व्यवसायों को AI के साथ प्रसारण-तैयार विज्ञापन बनाने और उन्हें Prime Video, Roku, और DirecTV जैसे कनेक्टेड टीवी प्लेटफ़ॉर्म पर रखने में मदद करता है। इसके कई ग्राहक छोटे व्यवसाय हैं। पारंपरिक तरीके से टीवी विज्ञापन बनाना एक फिल्म और संपादन टीम की आवश्यकता रखता था, जिसकी लागत हजारों डॉलर से शुरू होकर अक्सर दसियों हजार डॉलर तक पहुँचती थी। Trusted TV इसे शून्य तक ले जाता है। एक छोटा व्यवसाय मालिक लगभग पाँच मिनट में स्मार्टफ़ोन से पूर्ण विज्ञापन बना सकता है और भुगतान करने से पहले देख सकता है। प्लेटफ़ॉर्म पर 10,000 से अधिक अभियान बनाए जा चुके हैं।

Ian, Trusted TV के CEO, ने Artificial Analysis पर MachGen की लेटेंसी बेंचमार्क देखी और उस पर विश्वास नहीं किया। उन्होंने स्वयं इसे परीक्षण करने के लिए साइन अप किया। उनका पहला रेंडर लगभग 25 सेकंड में वापस आया, बिना गुणवत्ता में कोई कमी के, और जब उन्होंने समवर्ती परीक्षण किए, तो सुधार बड़े पैमाने पर भी बरकरार रहे। उन्होंने अपने पूरे उत्पादन वर्कफ़्लो को 48 घंटे से कम समय में MachGen पर स्थानांतरित कर दिया, और अब MachGen उनके सभी नए वीडियो निर्माण को शक्ति प्रदान करता है। नवीनतम डिप्लॉयमेंट में, हम उस मॉडल पर 10 या 11 सेकंड के करीब हैं, और हम इसे लगातार सुधारते रहेंगे।

उत्पाद प्रभाव यह है कि विज्ञापनदाता एक या दो सामान्य विज्ञापन बनाना बंद कर देते हैं। उनके उपयोगकर्ता प्रति सप्ताह दो या तीन नए विज्ञापन देखते हैं, विभिन्न दर्शक वर्गों में रचनात्मकता का परीक्षण करते हैं, और प्रतिबद्ध होने के बजाय दोहराते हैं। अगला कदम भूगोल और दर्शक-स्तर की वैयक्तिकरण है, जो पहले केवल कई मिलियन डॉलर बजट वाली कंपनियों के लिए संभव था।

एक संस्करण जो मैं व्यक्तिगत रूप से सोचता हूँ: आज, मुझे एक स्नीकर विज्ञापन मिला जो मैनहट्टन की सड़क पर शूट किया गया है। मैं बे एरिया में रहता हूँ, इसलिए यह मेरे लिए कोई मतलब नहीं रखता। मैं वही विज्ञापन चाहता हूँ जिसमें पृष्ठभूमि में मिशन पीक हो। यह सस्ता विज्ञापन नहीं है; यह विज्ञापन का एक अलग प्रकार है, और यह केवल तब आर्थिक रूप से व्यावहारिक बनता है जब पीढ़ी इतनी तेज़ और सस्ती हो कि हजारों वैरिएंट बनाए जा सकें।

उत्पादों में सीधे इमेज या वीडियो जनरेशन को एम्बेड करने वाली कंपनियों को इन्फ़रेंस की अर्थव्यवस्था के बारे में कैसे सोचना चाहिए? किस पैमाने पर GPU उपयोगिता का अनुकूलन रणनीतिक रूप से महत्वपूर्ण हो जाता है, बजाय प्रत्येक जनरेशन के लिए API प्रदाता को भुगतान करने के?

इन्फ्लेक्शन पॉइंट तब आता है जब इन्फ़रेंस ग्राहक अनुभव या कंपनी के मार्जिन को प्रभावित करना शुरू कर देता है।

एक सामान्य-उद्देश्य API तब समझ में आती है जब कोई टीम उत्पाद को वैध कर रही हो। एक बार जनरेशन उस उत्पाद का केंद्रीय भाग बन जाने पर, टीमों को आउटपुट की सूचीबद्ध कीमत से आगे देखना पड़ता है। लेटेंसी, समवर्तीता, गुणवत्ता, विश्वसनीयता और GPU उपयोगिता सभी अर्थव्यवस्था का हिस्सा बन जाते हैं।

जनरेशन सस्ती लग सकती है, लेकिन यदि उपयोगकर्ताओं को कई मिनट इंतजार करना पड़े और वे कार्यप्रवाह छोड़ दें, तो यह अभी भी एक व्यावसायिक समस्या बन जाती है। ऐसी आर्किटेक्चर जो उपयोग के साथ GPU क्षमता को समान दर से बढ़ाने की आवश्यकता रखती है, वह मार्जिन पर बढ़ता दबाव भी डालती है।

कोई एकल अनुरोध-आयतन सीमा नहीं है क्योंकि 540p क्लिप के लिए आवश्यक कंप्यूट 1080p लंबी वीडियो से बहुत अलग होता है। अनुकूलन रणनीतिक तब हो जाता है जब बढ़ते उपयोग से लागत लगभग समान दर से बढ़ती है, पीक मांग कतारें बनाती है, या लेटेंसी उत्पाद अनुभव को सीमित करना शुरू कर देती है।

MachGen कई परतों में काम करता है, जिसमें कस्टम GPU कर्नेल, कैशिंग, प्रिसिशन अनुकूलन, शेड्यूलिंग और समानांतरता शामिल हैं। जैसे-जैसे मॉडल तेज़ी से विकसित होते हैं, आप किस इन्फ़रेंस स्टैक की परत को सबसे बड़े शेष अवसर के रूप में देखते हैं जो गति और लागत में नाटकीय सुधार लाने की क्षमता रखती है?

वीडियो जनरेशन के लिए, अटेंशन सबसे बड़े शेष अवसरों में से एक है क्योंकि यह कई मॉडलों में कंप्यूट बजट पर हावी रहता है। कम-प्रिसिशन रेसिपी, स्पार्स अटेंशन और डिफ्यूज़न-विशिष्ट अटेंशन कर्नेल में सुधार के लिए अभी भी काफी जगह है।

अटेंशन केवल अवसर का एक भाग है। कुल मिलाकर सबसे बड़े लाभ स्टैक भर में सुधारों को मिलाकर आएंगे। कैशिंग इसका एक उदाहरण है। LLM में उपयोग की जाने वाली KV कैशिंग तकनीकें सीधे लागू नहीं होतीं, लेकिन डिफ्यूज़न मॉडल में स्थानिक और कालिक पुनरावृत्ति होती है जिसे सही दृष्टिकोण से उपयोग किया जा सकता है।

समांतरता एक और अवसर प्रस्तुत करती है। GPUs जोड़ने से स्वचालित रूप से अनुपातिक गति वृद्धि नहीं होती क्योंकि संचार ओवरहेड लाभ को संतुलित कर सकता है। हम ऐसे अनुकूलित कर्नेल विकसित करते हैं जो संचार को डेटा‑स्वतंत्र गणना के साथ ओवरलैप करते हैं और इसे डेटा‑निर्भर कार्य के साथ पाइपलाइन करते हैं।

ध्यान, कैशिंग, कर्नेल, समांतरता, मेमोरी और शेड्यूलिंग सभी एक‑दूसरे को प्रभावित करते हैं। केवल एक परत को अनुकूलित करने से अंततः कहीं न कहीं बाधा उत्पन्न हो जाती है। सबसे बड़े सुधार तब आएंगे जब स्टैक को डिफ्यूजन की गणनात्मक प्रोफ़ाइल के लिए डिज़ाइन की गई पूर्ण प्रणाली के रूप में माना जाएगा।

नए वीडियो मॉडलों के साथ जो जनरेशन समय को वास्तविक समय के करीब ले जा रहे हैं, हम वास्तव में इंटरैक्टिव जेनरेटिव वीडियो के कितने निकट हैं, और वास्तविक‑समय वीडियो जनरेशन के सामान्य हो जाने से पहले किन तकनीकी बाधाओं को अभी भी पार करना बाकी है?

हम पहले ही कुछ अनुप्रयोगों के लिए इंटरैक्टिव गति हासिल कर रहे हैं। MachGen पाँच‑सेकंड का Vidu Q3 Turbo वीडियो 720p पर लगभग छह सेकंड में और 540p पर तीन सेकंड से कम में उत्पन्न करता है। यह तेज़ रचनात्मक पुनरावृत्ति के लिए पर्याप्त है और प्रतिक्रियाशील अवतार तथा इंटरैक्टिव वीडियो को पहुँच योग्य बनाता है।

इंटरैक्टिव का मेरा अर्थ क्या है, इसका एक उदाहरण। कल्पना करें आप एक कहानी देख रहे हैं, और आप देख सकते हैं कि अंत कहाँ जा रहा है, और आपको वह पसंद नहीं है। निष्क्रिय बैठने के बजाय, आप उसे पुनः दिशा देते हैं: उन दो पात्रों को जाना चाहिए कि तीसरा क्या छिपा रहा है, और उसे सामना करना चाहिए बजाय इसके कि कहानी आगे चलती रहे। ऐसी सामग्री जिसे आप नियंत्रित करते हैं, न कि केवल प्राप्त करते हैं। यही तेज़ और सस्ती जनरेशन संभव बनाती है, और यह लगभग सभी उपभोग की जाने वाली चीज़ों को बदल देती है।

उस स्तर तक पहुँचने के लिए आमतौर पर एक से अधिक मजबूत लेटेंसी बेंचमार्क की आवश्यकता होती है। पूरे अनुभव को उत्पादन ट्रैफ़िक के तहत भी प्रतिक्रियाशील रहना चाहिए, साथ ही दृश्य गुणवत्ता, फ्रेम‑से‑फ्रेम स्थिरता और पूर्वानुमेय लागत को बनाए रखना चाहिए। लंबी वीडियो, उच्च रिज़ॉल्यूशन और समवर्ती अनुरोध सभी इन्फ्रास्ट्रक्चर पर बोझ बढ़ाते हैं, और सिस्टम को फिर भी क्षमता प्रदान करनी, अनुरोधों को रूट करना और हार्डवेयर विफलताओं से उपयोगकर्ता को बिना पता चले पुनः प्राप्त करना पड़ता है।

यह उपयोग‑केस दर उपयोग‑केस आएगा। छोटे क्लिप, अवतार, गेमिंग और रचनात्मक उपकरण पहले आएँगे क्योंकि सेकंड में मापी जाने वाली जनरेशन उनके लिए पहले से ही पर्याप्त है। जैसे-जैसे मॉडल की गुणवत्ता और इन्फ़रेंस प्रदर्शन साथ‑साथ सुधरते हैं, अधिक अनुप्रयोग इस सीमा को पार करेंगे।

जैसे‑जैसे AI एजेंट स्वचालित रूप से छवियों और वीडियो का निर्माण करते हैं, बजाय इसके कि मानव बटन दबाए, इससे इन्फ्रास्ट्रक्चर की आवश्यकताएँ कैसे बदलती हैं? क्या एजेंट‑प्रेरित कार्यभार लेटेंसी, समवर्तीता, लागत और विश्वसनीयता के संदर्भ में मूलभूत रूप से अलग मांगें उत्पन्न करते हैं?

एक एजेंट एकल उपयोगकर्ता अनुरोध को दर्जनों या सैकड़ों जनरेशन कार्यों में बदल देता है। यह कई विकल्प बनाता है, उनका मूल्यांकन करता है, प्रॉम्प्ट को संशोधित करता है, और प्रक्रिया को दोहराता है, बीच में किसी मानव इनपुट के बिना।

यह लेटेंसी, समवर्तीता, लागत और विश्वसनीयता को बहुत अधिक महत्वपूर्ण बना देता है। यदि प्रत्येक जनरेशन में मिनट लगते हैं, तो एजेंट की कार्यप्रवाह उपयोगी होने के लिए बहुत धीमी हो जाती है। यदि प्रत्येक प्रयास महंगा है, तो स्वायत्त पुनरावृत्ति आर्थिक रूप से अव्यावहारिक हो जाती है। सिस्टम को कई समवर्ती अनुरोधों को विश्वसनीय रूप से संभालना भी आवश्यक है क्योंकि एक विफलता पूरी कार्य श्रृंखला को बाधित कर सकती है।

यहीं पर GPU प्रोविजनिंग, ऑटो‑स्केलिंग और रूटिंग जैसी क्षमताएँ मॉडल‑स्तर के अनुकूलन जितनी ही महत्वपूर्ण होती हैं। एजेंट की मांग रचनात्मक अनुप्रयोग की तुलना में बहुत अधिक उछाल वाली होती है जहाँ उपयोगकर्ता बटन क्लिक करता है।

संबंधित कार्य इकाई अब एकल छवि या वीडियो नहीं रही। यह सामग्री को उत्पन्न करने, मूल्यांकन करने और परिष्कृत करने की पूरी लूप है। इन्फ्रास्ट्रक्चर को इस पूरी लूप को तेज़, किफायती और विश्वसनीय बनाना होगा।

GPU प्रदाताओं, इन्फ़रेंस क्लाउड्स, मॉडल डेवलपर्स और ऑप्टिमाइज़ेशन प्लेटफ़ॉर्म के बीच तीव्र प्रतिस्पर्धा है। जैसे-जैसे हार्डवेयर स्वयं तेज़ होता है, कंपनियों को फिर भी MachGen जैसे विशेष इन्फ़रेंस लेयर की आवश्यकता क्यों होगी, बजाय NVIDIA, AMD, क्लाउड प्रदाताओं या स्वयं मॉडल डेवलपर्स के सुधारों पर निर्भर रहने के?

तेज़ हार्डवेयर सीमा को बढ़ाता है। सॉफ़्टवेयर तय करता है कि उस सीमा का कितना हिस्सा हासिल किया जाएगा।

हमने यह LLMs के साथ देखा। नए एक्सेलेरेटर प्रत्येक पीढ़ी में कच्चे प्रदर्शन को सुधारते रहे, और निरंतर बैचिंग, KV‑कैश प्रबंधन, सट्टा डिकोडिंग और विशेष कर्नेल ही वह चीज़ थी जिसने उद्योग को उत्पादन‑स्तर की थ्रूपुट और आर्थिकता तक पहुँचाया। इन सबका स्रोत हार्डवेयर नहीं था।

छवि और वीडियो जनरेशन के पूर्ण उत्पादन पथ को निरंतर अनुकूलित करना हार्डवेयर विक्रेताओं, क्लाउड प्रदाताओं और मॉडल डेवलपर्स के काम से अलग कार्य है, और यह उनमें से किसी के लिए भी मुख्य प्राथमिकता नहीं है।

उस कार्य के लिए कुछ दृष्टिकोण हैं। एक है मार्केटप्लेस मॉडल, जहाँ मॉडल एकत्रित होते हैं और अनुरोधों को रूट किया जाता है। हम नहीं मानते कि यह दीर्घकालिक रूप से टिकाऊ है, क्योंकि प्रदर्शन वाले लेयर पर नियंत्रण नहीं है। हमने स्टैक को स्वयं बनाकर मूल रूप से होस्ट करने का चयन किया, जो हमें देखे गए लेटेंसी और लागत संख्याओं को प्राप्त करने का एकमात्र तरीका है।

इसका मतलब है प्रत्येक मॉडल और प्रत्येक एक्सेलेरेटर के लिए ध्यान, कैशिंग, कर्नेल, सटीकता, मेमोरी और समानांतरता को ट्यून करना, तथा प्रबंधित API, समर्पित क्लाउड और स्वयं‑होस्टेड डिप्लॉयमेंट का समर्थन करना। जैसे-जैसे मॉडलों और हार्डवेयर विकल्पों की संख्या बढ़ती है, जटिलता भी बढ़ती है। हमारा काम इसे संभालना है ताकि हमारे ग्राहक अपने उत्पादों को अलग बनाने वाले पहलुओं पर अपना समय खर्च कर सकें।

आपने MachGen की दीर्घकालिक दृष्टि के हिस्से के रूप में विश्व मॉडल का वर्णन किया है, जिनकी कई गणनात्मक विशेषताएँ डिफ्यूज़न वर्कलोड के समान हैं। उत्पादन‑स्तर के विश्व मॉडलों के लिए बुनियादी ढांचा कैसा दिखना चाहिए, और यदि दृश्य वातावरण का निर्माण और सिमुलेशन अंततः आज के टेक्स्ट जनरेशन जितना सस्ता और प्रतिक्रियाशील हो जाए तो कौन‑से अनुप्रयोग संभव हो सकते हैं?

हमारे प्लेटफ़ॉर्म के बारे में सोचने का एक तरीका इसे सामान्य‑उद्देश्य LLM के समान देखना है। वही मॉडल एक कानूनी समझौता तैयार करता है और रेस्तरां से संबंधित प्रश्न का उत्तर देता है। हमारे लिए, वही स्टैक वीडियो अवतार कंपनियों, AI विज्ञापन, कहानी और माइक्रोड्रामा जनरेशन, और अंततः विश्व मॉडलों को सेवा प्रदान करता है। विभिन्न उद्योग, लेकिन अंतर्निहित प्रदर्शन समस्याओं का एक ही सेट।

विश्व मॉडल आज हमारा मुख्य व्यवसाय नहीं हैं, लेकिन वे वही हैं जिनकी ओर हम निर्माण कर रहे हैं, और हम सक्रिय रूप से उन पर काम कर रहे हैं। उत्पादन‑स्तर के विश्व मॉडलों को बहुत उच्च थ्रूपुट और बहुत कम लेटेंसी की आवश्यकता होगी क्योंकि वे निरंतर एक वातावरण उत्पन्न और अपडेट करते हैं, न कि केवल एक आउटपुट बनाते हैं। उन्हें स्थानिक और कालिक स्थिरता, क्रियाओं पर प्रतिक्रिया देने की क्षमता, और अक्सर कई संभावित परिणामों को एक साथ सिमुलेट करने की क्षमता की भी जरूरत होती है। इससे मेमोरी, डेटा मूवमेंट, समानांतरता और विश्वसनीयता में कठिन समस्याएँ उत्पन्न होती हैं। रोबोट या गेम को चलाने वाला विश्व मॉडल अगले स्थिति को उत्पन्न करने में मिनट नहीं ले सकता। प्रदर्शन तय करता है कि ये सिस्टम बिल्कुल भी उपयोगी हैं या नहीं।

गणनात्मक रूप से, आज के विश्व मॉडल डिफ्यूज़न मॉडलों की तरह दिखते हैं, इसलिए हम अभी जो स्टैक बना रहे हैं वह स्वाभाविक आधार है। अभी तक उनके लिए कोई परिपक्व उत्पादन‑ग्रेड सर्विंग लेयर नहीं है, जो LLMs के लिए मौजूद है उसके समान। हम इसे बनाने का इरादा रखते हैं।

यदि सिमुलेशन आज के टेक्स्ट जनरेशन जितना प्रतिक्रियाशील और किफायती हो जाता है, तो रोबोट दुर्लभ स्थितियों का अभ्यास कर सकते हैं इससे पहले कि वे उनका सामना करें, गेम व्यक्तिगत खिलाड़ियों के अनुसार प्रतिक्रिया देने वाले वातावरण उत्पन्न कर सकते हैं, और डिज़ाइनर भौतिक दुनिया में निर्माण करने से पहले दर्जनों संभावनाओं का परीक्षण कर सकते हैं। डिफ्यूज़न वह क्षेत्र है जहाँ हम आज अपना काम कमाते हैं। विश्व मॉडल हमारा उत्तरदायी लक्ष्य (नॉर्थ स्टार) हैं।

उत्कृष्ट साक्षात्कार के लिए धन्यवाद, जो पाठक अधिक जानना चाहते हैं उन्हें MachGen AI पर जाना चाहिए।

एंटोनी एक दूरदर्शी नेता और यूनाइट.एआई के संस्थापक भागीदार हैं, जो कि एआई और रोबोटिक्स के भविष्य को आकार देने और बढ़ावा देने के लिए एक अटूट जुनून से प्रेरित हैं। एक连续 उद्यमी, वह मानता है कि एआई समाज के लिए उतना ही विघटनकारी होगा जितना कि बिजली, और अक्सर विघटनकारी प्रौद्योगिकियों और एजीआई की संभावना के बारे में उत्साहित होता है।

एक भविष्यवाणी के रूप में, वह इन नवाचारों के बारे में जानने के लिए समर्पित है कि वे हमारी दुनिया को कैसे आकार देंगे। इसके अलावा, वह सिक्योरिटीज़.io के संस्थापक हैं, जो एक मंच है जो भविष्य को फिर से परिभाषित करने और पूरे क्षेत्रों को पुनः आकार देने वाली नवीनतम प्रौद्योगिकियों में निवेश पर केंद्रित है।