एआई मॉडल और प्लेटफ़ॉर्म

Cerebras ने डिसएग्रीगेशन से 5X इनफ़रेंस थ्रूपुट वृद्धि की रिपोर्ट की

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

Cerebras Systems ने 1 अक्टूबर, 2026 को कहा कि उसने डिसएग्रीगेशन नामक तकनीक का उपयोग करके प्रारंभिक परिणामों में इनफ़रेंस थ्रूपुट को 5 गुना बढ़ा दिया, वही संख्या में Cerebras सिस्टम्स के साथ और टोकन जनरेशन गति में कोई कमी नहीं हुई। यह खुलासा बुनियादी स्तर से डिसएग्रीगेटेड इनफ़रेंस में आया, जो Isaac Tai और Zhenwei Gao द्वारा लिखा गया कंपनी ब्लॉग पोस्ट है और विषय पर एक नियोजित श्रृंखला की शुरुआत करता है।

यह पोस्ट उन पाठकों के लिए श्रृंखला को प्रस्तुत करती है जिन्होंने डिसएग्रीगेशन शब्द या यह दावा सुना है कि प्रीफ़िल कंप्यूट-बंधित है और डिकोड मेमोरी-बंधित है, और यह जानना चाहते हैं कि इनका वास्तविक अर्थ क्या है। यह व्याख्या को बुनियादी स्तर से बनाती है, शुरू में यह बताती है कि एक्सेलेरेटर कैसे अंकगणितीय संचालन को डेटा आंदोलन के साथ संतुलित करते हैं।

प्रीफ़िल और डिकोड हार्डवेयर पर विभिन्न मांगें रखते हैं

पोस्ट अंकगणितीय तीव्रता को इस प्रकार परिभाषित करती है: फ्लोटिंग पॉइंट ऑपरेशनों की संख्या को मेमोरी और एक्सेलेरेटर के कंप्यूट यूनिट्स के बीच स्थानांतरित बाइट्स की संख्या से विभाजित किया जाता है। अपने एक उदाहरण में, दो मैट्रिसेज़ को जोड़ने पर प्रत्येक 6 बाइट्स के स्थानांतरण पर 1 FLOP किया जाता है, अर्थात 0.167 FLOP प्रति बाइट की अंकगणितीय तीव्रता, और यह अनुपात मैट्रिसेज़ के बढ़ने पर स्थिर रहता है। मैट्रिक्स गुणा अलग व्यवहार करता है: प्रत्येक आउटपुट मान एक इनपुट की पूरी पंक्ति और दूसरे इनपुट के पूरे कॉलम से निर्मित होता है, इसलिए लोड किए गए मान अधिक आउटपुट में योगदान देते हैं और इनपुट आकार के साथ अंकगणितीय तीव्रता बढ़ती है।

पोस्ट के अनुसार, इनफ़रेंस मॉडल के स्थिर वज़न और उसके इनपुट टोकन के बीच ऐसे मैट्रिक्स गुणा की श्रृंखला है, और यह दो चरणों में विभिन्न तीव्रता प्रोफ़ाइल के साथ चलता है। प्रीफ़िल के दौरान, पूरी प्रॉम्प्ट को समानांतर रूप से एक बड़े मैट्रिक्स ऑपरेशन के रूप में प्रोसेस किया जाता है, और वास्तविक दुनिया के प्रॉम्प्ट में हजारों या यहाँ तक कि लाखों टोकन हो सकते हैं। डिकोड के दौरान, टोकन एक-एक करके उत्पन्न होते हैं, और मॉडल KV कैश पर निर्भर करता है, जो पहले के टोकन के लिए गणना किए गए कुंजियों और मानों को संग्रहीत करता है ताकि उन्हें पुनः गणना करने के बजाय पुनः उपयोग किया जा सके।

दोनों चरणों को प्रत्येक उत्पन्न टोकन के लिए मॉडल के सभी वज़न, जो संभावित रूप से सैकड़ों गीगाबाइट या टेराबाइट हो सकते हैं, कंप्यूट यूनिट्स तक ले जाना पड़ता है। पोस्ट दिखाती है कि मेमोरी मूवमेंट लगभग स्थिर रहता है जबकि प्रीफ़िल के बाद अंकगणितीय तीव्रता घटती है, और यह अंतर इस कारण के रूप में उद्धृत करती है कि शुद्ध कंप्यूट क्षमता जोड़ने से डिकोड के दौरान टोकन तेज़ी से नहीं पहुँचते।

डिसएग्रीगेशन इनफ़रेंस को अलग-अलग पूलों में विभाजित करता है

उत्पादन में, एक इनफ़रेंस सर्वर आमतौर पर कई अनुरोधों को एक साथ संभालता है, और जब प्रीफ़िल और डिकोड एक ही हार्डवेयर पर चलते हैं, तो कंप्यूट-गहन प्रीफ़िल सक्रिय डिकोड अनुरोधों को रोक सकता है। शेड्यूलर को तब यह चुनना पड़ता है कि नए अनुरोधों को उनके पहले टोकन तक जल्दी पहुंचाना, सक्रिय प्रतिक्रियाओं को सुचारू रूप से स्ट्रीम करना, या कुल थ्रूपुट को अधिकतम करना। बैचिंग समवर्ती अनुरोधों को मॉडल वज़न पढ़ने का काम साझा करने देती है, लेकिन बड़े बैच प्रत्येक डिकोड चरण को अधिक समय ले सकते हैं, इसलिए कुल थ्रूपुट बढ़ सकता है जबकि प्रत्येक उपयोगकर्ता को टोकन धीरे-धीरे मिलते हैं।

पोस्ट डिसएग्रीगेशन को एक सिस्टम डिज़ाइन पैटर्न के रूप में वर्णित करती है जो दो चरणों को अलग-अलग हार्डवेयर पूलों में चलाता है। एक बार चरण अलग हो जाने पर, ऑपरेटर हार्डवेयर आवंटित कर सकते हैं, बैचिंग नीतियां सेट कर सकते हैं, और प्रत्येक चरण के लिए विलंब या थ्रूपुट को स्वतंत्र रूप से प्राथमिकता दे सकते हैं: एक सिस्टम जिसमें प्रथम-टोकन समय के कठोर लक्ष्य होते हैं, प्रीफ़िल के लिए अधिक क्षमता आरक्षित कर सकता है, जबकि सुचारू स्ट्रीमिंग पर आधारित सिस्टम डिकोड को बड़ा या अधिक सघन शेड्यूल किया हुआ पूल दे सकता है। इन पूलों को व्यक्तिगत रूप से भी स्केल किया जा सकता है।

विभाजन एक नई आवश्यकता पेश करता है। प्रीफ़िल के बाद KV कैश बन जाने के बाद, उस अनुरोध-विशिष्ट स्थिति को डिकोड पूल में स्थानांतरित करना पड़ता है, जहाँ इसे जनरेशन जारी रखने से पहले मेमोरी में लोड किया जाता है, जबकि मॉडल वज़न दोनों पूलों में पहले से लोड होते हैं। पोस्ट नोट करती है कि इस हैंडऑफ़ से नेटवर्क और समन्वय ओवरहेड बढ़ता है, यदि क्षमता मांग के अनुरूप नहीं है तो कोई भी पूल निष्क्रिय रह सकता है, और अतिरिक्त विलंब इस पर निर्भर करता है कि कैश को-लोकेटेड मशीनों के बीच या क्षेत्रों के बीच स्थानांतरित होता है या नहीं। यह तर्क देती है कि डिसएग्रीगेशन बड़े पैमाने पर सबसे प्रभावशाली है, जहाँ पूलों को स्वतंत्र रूप से आकार देने और शेड्यूल करने से मिलने वाले लाभ ट्रांसफ़र और संचालन लागत से अधिक हो सकते हैं, और यह सर्विंग सिस्टम के नियंत्रण इंटरफ़ेस को बदलता है न कि केवल स्ट्रीमिंग को स्मूद बनाता है।

विविध हार्डवेयर, प्रारंभिक परिणाम, और साझेदारियाँ

Cerebras ने कहा कि वह विविध डिसएग्रीगेशन के विकास में अग्रणी है, जिसमें एक इनफ़रेंस सिस्टम में कई प्रकार के चिप्स को मिलाया जाता है और मेमोरी-बंधित या कंप्यूट-बंधित खंडों को अलग-अलग हार्डवेयर सौंपा जाता है। पोस्ट कंपनी के वेफ़र-स्केल डिज़ाइन की तुलना करती है, जो पूरे वेफ़र में कंप्यूट के साथ SRAM वितरित करता है, जबकि GPUs मॉडल डेटा को हाई-बैंडविड्थ मेमोरी से छोटे ऑन-चिप मेमोरी और कैशेज़ के माध्यम से स्टेज करते हैं।

पोस्ट में प्रकाशित पीक मेमोरी-बैंडविड्थ चार्ट, जिसकी तिथि 10 सितंबर, 2026 है, Cerebras WSE-3 ऑन-चिप SRAM को प्रति वेफ़र 21,000 TB/s पर सूचीबद्ध करता है, साथ ही एक अनाम ऑन-चिप SRAM एक्सेलेरेटर को 150 TB/s और HBM4 GPUs को क्रमशः 23.3 और 22 TB/s पर। चार्ट चेतावनी देता है कि SRAM आँकड़े प्रोसेसर भर में स्थानीय मेमोरी बैंडविड्थ को जोड़ते हैं जबकि HBM आँकड़े ऑफ-चिप मेमोरी से ट्रैफ़िक मापते हैं, इसलिए ये आँकड़े विभिन्न मेमोरी स्तरों को दर्शाते हैं न कि मापी गई टोकन गति को।

इस पोस्ट में 10 सितंबर, 2026 की Artificial Analysis डेटा को भी पुनः प्रस्तुत किया गया है, जिसमें GPT-oss-120B ने 10,000 इनपुट टोकन के साथ उच्च तर्क चलाया। यह Cerebras को 1,669 आउटपुट टोकन प्रति सेकंड, SambaNova को 708, Groq को 475, Microsoft Azure को 319, Nebius को 294, और Baseten को 293 के रूप में सूचीबद्ध करता है।

Cerebras ने कहा कि पारंपरिक एकीकृत प्रणाली में क्षमता बढ़ाने का मतलब अधिक हार्डवेयर तैनात करना था, और भागीदार त्वरक का उपयोग करके प्रॉम्प्ट प्रोसेसिंग को संभालने से उसी WSE फुटप्रिंट के साथ प्रारंभिक परीक्षणों में क्षमता 5 गुना बढ़ गई। कंपनी ने बताया कि उसने कई हार्डवेयर भागीदारों के साथ साझेदारी की घोषणा की है ताकि अधिक अल्ट्रा‑फास्ट टोकन बाजार में लाए जा सकें, और पोस्ट में एक आरेख दिखाता है कि AWS Trainium और AMD Helios Instinct GPU सिस्टम प्रीफ़िल हार्डवेयर विकल्पों में शामिल हैं जो Cerebras डिकोड पूल को फ़ीड करते हैं।

पोस्ट ने एजेंटिक एप्लिकेशनों को विषम विखंडन के लिए एक आकर्षक उपयुक्तता के रूप में पहचाना है, क्योंकि ये अक्सर लंबी, बहु‑टर्न वार्तालापों में शामिल होते हैं जहाँ संदर्भ मॉडल कॉल्स के बीच बढ़ता है और प्रत्येक चरण में देरी संचित होती है। Cerebras ने कहा कि आगामी भागों में शामिल हार्डवेयर और सॉफ़्टवेयर स्टैक तथा विखंडित निष्कर्षण को बड़े पैमाने पर लागू करने के आर्थिक समझौते को कवर किया जाएगा।

Theo Nash एक AI-जनित विशेषज्ञ हैं Unite.AI में, जो AI इन्फ्रास्ट्रक्चर, कंप्यूट, और आधुनिक कृत्रिम बुद्धिमत्ता को शक्ति देने वाले हार्डवेयर सिस्टम को कवर करते हैं। उनका काम बड़े पैमाने पर AI वर्कलोड्स के तकनीकी आधार पर केंद्रित है, जिसमें डेटा सेंटर, एक्सेलेरेटर, नेटवर्किंग, और उन्हें जोड़ने वाले सॉफ्टवेयर स्टैक शामिल हैं।

एक विश्लेषणात्मक और इंजीनियरिंग-उन्मुख दृष्टिकोण के साथ, Theo यह जांचते हैं कि GPUs, कस्टम सिलिकॉन, मेमोरी आर्किटेक्चर, और वितरित सिस्टम में प्रगति नई पीढ़ियों के AI मॉडल को कैसे सक्षम बनाती है। वे प्रदर्शन समझौते, ऊर्जा दक्षता, स्केलेबिलिटी, और व्यावहारिक प्रतिबंधों पर विशेष ध्यान देते हैं जो वास्तविक दुनिया में AI इन्फ्रास्ट्रक्चर की तैनाती को आकार देते हैं।

Theo Nash द्वारा लिखे गए लेख AI-जनित हैं और Unite.AI की संपादकीय टीम द्वारा तकनीकी शुद्धता, स्पष्टता, और तेजी से विकसित हो रहे AI कंप्यूट परिदृश्य की जिम्मेदार कवरेज सुनिश्चित करने के लिए समीक्षा किए जाते हैं।