एआई मॉडल और प्लेटफ़ॉर्म

Cerebras ने OpenAI के GPT-5.6 Sol को 750 टोकन प्रति सेकंड की गति से नई Ultrafast टियर में चलाया

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

Cerebras (CBRS ) अब OpenAI के प्रमुख मॉडल को ऐसी गति से चला रहा है जो किसी भी GPU क्लाउड ने सार्वजनिक रूप से नहीं हासिल की है। 13 अगस्त 2026 को, वेफ़र-स्केल चिप निर्माता ने घोषणा की कि वह GPT-5.6 Sol को Ultrafast नामक नई OpenAI सेवा टियर पर चलाता है, जो प्रति सेकंड अधिकतम 750 आउटपुट टोकन प्रदान करता है और, OpenAI के अनुसार, मॉडल को मानक प्रोसेसिंग की तुलना में 14 गुना तेज़ चलाता है। Ultrafast पहले OpenAI API में एक सीमित प्रीव्यू के रूप में चयनित ग्राहकों के समूह के लिए लॉन्च किया गया है, और क्षमता बढ़ने के साथ पहुंच विस्तारित होगी।

मुख्य दावा स्पष्ट है: गति गंवाए बिना अग्रणी स्तर की बुद्धिमत्ता। GPT-5.6 Sol, OpenAI का सबसे सक्षम मॉडल है और Cerebras की चिप पर इतनी तेजी से टोकन बनाता है कि उसे रात भर चलने वाले बैच कार्य के बजाय रीयल-टाइम उत्पादों में शामिल किया जा सकता है। दोनों कंपनियां इसे ऐसे समझौते को समाप्त करने के रूप में पेश करती हैं जिसमें महत्वपूर्ण काम के लिए पर्याप्त बुद्धिमान मॉडल और काम चलते समय उपयोग करने लायक तेज मॉडल में से एक चुनना पड़ता था।

Ultrafast के पीछे के गति आंकड़े

प्रति सेकंड 750 आउटपुट टोकन का आंकड़ा सुर्खियों में है, लेकिन Cerebras की प्रकाशित सीधी तुलनाएं अधिक स्पष्ट तस्वीर देती हैं। Artificial Analysis की बताई आउटपुट गति से तुलना करते हुए कंपनी का कहना है कि Ultrafast पर GPT-5.6 Sol, Claude Fable 5 से 11 गुना और Fast मोड में Opus 4.8 से पांच गुना तेज चलता है।

Cerebras ने टियर को Humanity’s Last Exam, एक 2,500 प्रश्नों वाला बेंचमार्क जो पीएचडी‑स्तर की कठिनाई पर सेट है, पर भी परीक्षण किया। Ultrafast पर GPT-5.6 Sol ने सभी 2,500 प्रश्नों के उत्तर 11 घंटे 11 मिनट में दिए; Claude Fable 5 को तुलनीय निष्कर्ष तक पहुँचने में 78 घंटे 27 मिनट लगे — Cerebras के अनुसार लगभग 7 गुना धीमा। GDP‑Val, आर्थिक रूप से मूल्यवान ज्ञान कार्य के लिए एक बेंचमार्क, पर कंपनी ने Standard प्रोसेसिंग की तुलना में 5.6× एंड‑टू‑एंड गति वृद्धि की रिपोर्ट दी, बिना गुणवत्ता में गिरावट के।

ये मूल्यांकन स्वयं विक्रेता ने किए हैं और Cerebras ने इसे स्पष्ट किया है: Humanity’s Last Exam की तुलना 10 जुलाई और 13–15 जुलाई 2026 को Cerebras ने की थी, जबकि GDP-Val का आंकड़ा 31 जुलाई 2026 के उसके अपने परीक्षणों से आया है। इन्हें कंपनी के अपने माप समझना चाहिए, स्वतंत्र परिणाम नहीं।

Wafer‑Scale चिप लेटेंसी में क्यों जीतती है

यह तंत्र महत्वपूर्ण है, क्योंकि यह समझाता है कि अपेक्षाकृत छोटी चिप निर्माता कंपनी OpenAI के सबसे बड़े मॉडल को उस गति से कैसे चला रही है जिसकी बराबरी स्थापित GPU आपूर्तिकर्ता नहीं कर पाए हैं। बड़े मॉडल का तेज इनफ़रेंस मूलतः डेटा स्थानांतरण की समस्या है: हर अगला टोकन बनाने के लिए GPU पर मॉडल के वज़न बार-बार चिप की मेमोरी और बाहरी स्टोरेज के बीच ले जाने पड़ते हैं। इस कारण मेमोरी की बैंडविड्थ बाधा बन जाती है।
Cerebras का समाधान डेटा के इस स्थानांतरण को समाप्त करना है। उसका Wafer-Scale Engine एक पूरी वेफ़र के आकार की चिप पर 44 GB SRAM रखता है। इससे मॉडल के वज़न चिप पर ही रहते हैं और टोकन अलग-अलग वेफ़र पर श्रृंखलाबद्ध परतों से बिना रुकावट गुजरते हैं। वज़न सिलिकॉन से बाहर नहीं जाते, इसलिए यह तरीका मॉडल के आकार के साथ बढ़ सकता है। कंपनी का तर्क है कि इसी वजह से अग्रणी मॉडल बड़े होने पर भी गति का लाभ बना रहेगा। इनफ़रेंस की लागत के लिहाज से यही निर्णायक बात है: मॉडल चलाने की लागत और देरी काफी हद तक इस पर निर्भर करती है कि गणना इकाइयों तक वज़न कितनी तेजी से पहुंचते हैं। एक ही चिप पर 44 GB बनाए रखना सीधे इसी समस्या को संबोधित करता है।

10 बिलियन डॉलर की साझेदारी ने फ़्लैगशिप तक पहुँच बनाई

Ultrafast वह सबसे स्पष्ट उत्पाद है जो कई महीनों से चल रही साझेदारी का परिणाम है। OpenAI ने 2026 की शुरुआत में Cerebras को कम‑लेटेंसी कंप्यूट के लिए 10 बिलियन डॉलर की प्रतिबद्धता दी, और यह लॉन्च उस क्षमता को कंपनी के शीर्ष मॉडल के पीछे रखता है, न कि किसी छोटे या विशिष्ट मॉडल के पीछे। OpenAI Ultrafast को “साझेदारी में अगला कदम” के रूप में वर्णित करता है, जिससे उसके प्लेटफ़ॉर्म पर अल्ट्रा‑लो‑लेटेंसी इनफ़रेंस लाया जा सके।
Cerebras के लिए यह महत्वपूर्ण उपलब्धि है। स्टार्टअप लंबे समय से कहता रहा है कि उसका वेफ़र-स्केल आर्किटेक्चर इनफ़रेंस के लिए उपयुक्त है, भले ही बाजार का केंद्र GPU आपूर्तिकर्ता हों। यह प्रतिस्पर्धा पूरे एक्सेलेरेटर क्षेत्र में चल रही है, जहां स्थापित कंपनियां मॉडल को सीधे अपने सिलिकॉन में एम्बेड करने की दिशा में बढ़ रहे हैं। OpenAI के फ़्लैगशिप मॉडल के सर्विंग लेयर को हासिल करके Cerebras को बाजार के शीर्ष पर एक प्रोडक्शन रेफ़रेंस अकाउंट मिल जाता है। मॉडल स्वयं GPT‑5.6 परिवार को आधार बनाता है (Sol फ़्लैगशिप के रूप में, साथ में संतुलित Terra और लागत‑प्रभावी Luna), इसलिए Ultrafast Cerebras को उस लाइन‑अप के अग्रभाग में जोड़ता है।

कौन इसे प्राप्त करेगा और यह किसके लिए है

OpenAI इस टियर को समय‑संवेदनशील, उच्च‑दांव वाले कार्यों के लिए स्थित कर रहा है: आउटेज के दौरान घटना प्रतिक्रिया, बाजार स्थितियों के बदलने पर वित्तीय अनुसंधान, रीयल‑टाइम ग्राहक समर्थन और आवाज़, ई‑कॉमर्स, तथा लाइव रिसर्च लूप्स जो पहले रात भर चलते थे। प्रारंभिक एक्सेस कोडिंग, कॉमर्स और फ़ाइनेंस क्षेत्रों की कंपनियों को दिया गया है, जिनमें Jane Street, Podium, Basis, और Rogo शामिल हैं।

“Cerebras द्वारा लाई गई गति वृद्धि प्रभावशाली है,” John Crepezzi, Jane Street में AI Assistants ने OpenAI की घोषणा में कहा। “यह मॉडलों के उपयोग के विभिन्न तरीकों को सक्षम करता है, और डेवलपर्स को उनके साथ अधिक केंद्रित और उत्पादक तरीके से काम करना व्यावहारिक बनाता है।”

OpenAI जानबूझकर उपलब्धता सीमित रख रहा है। कंपनी का कहना है कि वह इस पूर्वावलोकन अवधि में यह समझना चाहती है कि गति में लगभग दस गुना जैसा बदलाव कहां सबसे अधिक मूल्य पैदा करता है। क्षमता बढ़ने के साथ पहुंच का विस्तार होगा। OpenAI और Cerebras दोनों पूर्वावलोकन के विस्तार की जानकारी पाने के लिए पंजीकरण स्वीकार कर रहे हैं।

आगे क्या होगा

निकट अवधि में देखने वाली चीज उपलब्ध कंप्यूटिंग क्षमता है, मॉडल की नई योग्यता नहीं। Ultrafast अभी सीमित पूर्वावलोकन है और दोनों कंपनियां व्यापक उपलब्धता को किसी निश्चित तारीख के बजाय क्षमता बढ़ने से जोड़ती हैं। इसलिए विस्तार की गति पर नजर रखनी होगी। लंबी अवधि का सवाल यह है कि OpenAI के मॉडल बड़े होने पर Cerebras की चिप पर स्थित मेमोरी का लाभ कायम रहता है या नहीं। वेफर-स्केल आर्किटेक्चर का दांव ठीक इसी पर है।

थियो नैश यूनाइट.एआई में एक एआई-जनरेटेड विशेषज्ञ है, जो एआई इंफ्रास्ट्रक्चर, कंप्यूट, और आधुनिक कृत्रिम बुद्धिमत्ता को शक्ति प्रदान करने वाले हार्डवेयर सिस्टम को कवर करता है। उनका काम बड़े पैमाने पर एआई कार्यभार के पीछे के तकनीकी आधारों पर केंद्रित है, जिसमें डेटा सेंटर, एक्सेलरेटर, नेटवर्किंग, और सॉफ्टवेयर स्टैक शामिल हैं जो उन्हें एक साथ जोड़ते हैं।
एक विश्लेषणात्मक और इंजीनियरिंग-चालित दृष्टिकोण के साथ, थियो जीपीयू, कस्टम सिलिकॉन, मेमोरी आर्किटेक्चर, और वितरित प्रणालियों में प्रगति का अध्ययन करता है कि वे नए पीढ़ी के एआई मॉडल को कैसे सक्षम बनाते हैं। वह प्रदर्शन व्यापार-ऑफ, ऊर्जा दक्षता, स्केलेबिलिटी, और व्यावहारिक प्रतिबंधों पर विशेष ध्यान देता है जो एआई इंफ्रास्ट्रक्चर के वास्तविक दुनिया के तैनाती को आकार देते हैं।
थियो नैश द्वारा लिखित लेख एआई-जनरेटेड हैं और यूनाइट.एआई की संपादकीय टीम द्वारा तकनीकी सटीकता, स्पष्टता, और तेजी से विकसित हो रहे एआई कंप्यूट लैंडस्केप के जिम्मेदार कवरेज को सुनिश्चित करने के लिए समीक्षा की जाती है।