एआई मॉडल और प्लेटफ़ॉर्म

Ai2 ने Olmo-Core 3 जारी किया, ट्रिलियन-परामीटर MoE के लिए खुला प्रशिक्षण स्टैक

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

Allen Institute for AI ने Olmo-core 3 को 1 अक्टूबर 2026 को जारी किया, जो उसके बड़े भाषा मॉडल विकास फ्रेमवर्क का एक अपग्रेड है, जो पुनः डिज़ाइन किए गए खुले मिश्रण-ऑफ़-एक्सपर्ट्स प्रशिक्षण प्रणाली के चारों ओर बना है, जिसे Ai2 ने कहा है कि उसने एक ट्रिलियन से अधिक कुल पैरामीटर पर बेंचमार्क किया है।

Ai2 ने कहा कि Olmo-core 3 को MoE प्रशिक्षण को ट्रिलियन-परामीटर रेंज तक स्केल करने के लिए डिज़ाइन किया गया है, जबकि गणनात्मक दक्षता को बनाए रखता है, और इसे Olmo की अगली पीढ़ी के पीछे के मुख्य सिस्टमों में से एक बताया। इस रिलीज़ के साथ एक तकनीकी रिपोर्ट, एक इंटरैक्टिव डेमो, और ओपन कोड भी उपलब्ध है।

MoE मॉडल कई अधिक पैरामीटर रख सकते हैं बिना यह आवश्यक किए कि हर इनपुट सभी का उपयोग करे, लेकिन पूर्ण मॉडल को अभी भी GPU मेमोरी में संग्रहीत करना पड़ता है और प्रशिक्षण के दौरान अपडेट किया जाता है, और क्लस्टर में सही विशेषज्ञों को इनपुट रूट करने से अपनी संचार और समन्वय लागत उत्पन्न होती है। Ai2 ने कहा कि ये लागतें MoE के बढ़ने पर गणनात्मक लाभ का बहुत हिस्सा घटा सकती हैं, और Olmo-core 3 को इस अंतर को पाटने के लिए बनाया गया है। एक Ai2 बेंचमार्क में, विशेषज्ञ पूल 8 से 128 तक बढ़ा जबकि प्रत्येक टोकन के लिए चार विशेषज्ञों का चयन जारी रहा, सक्रिय पैरामीटर लगभग 3.2 बिलियन पर स्थिर रहे जबकि कुल पैरामीटर क्षमता 4.6 बिलियन से बढ़कर 47 बिलियन हो गई, और प्रशिक्षण थ्रूपुट 5% से कम गिरा।

FSDP से DDP-आधारित प्रशिक्षण स्टैक तक

Ai2 की पहले की MoE कार्यान्वयन Olmo-core में पूरी तरह से शार्डेड डेटा पैरललिज़्म का उपयोग किया गया था, जिसे प्रत्येक छोटे प्रशिक्षण डेटा बैच के लिए मॉडल वज़न को इकट्ठा करने और फिर से शार्ड करने के लिए कॉन्फ़िगर किया गया था। Olmo-core 3 एक वितरित डेटा पैरललिज़्म पर आधारित प्रणाली में बदलता है जो विशेषज्ञों को GPU पर स्थायी रखता है और संबंधित डेटा को उनके पास रूट करता है, जिससे बार‑बार वज़न इकट्ठा करने से बचा जाता है। आठ NVIDIA B300 GPU पर एक प्रारंभिक परीक्षण में, Ai2 ने रिपोर्ट किया कि 47‑बिलियन‑पैरामीटर MoE ने नई स्टैक के साथ प्रति GPU 52,000 टोकन प्रति सेकंड प्रोसेस किए, जबकि पहले की कार्यान्वयन के साथ 19,400 थे, जिसे Ai2 लगभग 2.7 गुना थ्रूपुट के रूप में वर्णित करता है।

Ai2 का स्पार्स मॉडल्स पर काम OlmoE तक जाता है, जिसने 64 रूटेड विशेषज्ञों के साथ एक MoE आर्किटेक्चर का उपयोग किया, जबकि Olmo 3 ने एक डेंस आर्किटेक्चर अपनाया जिसमें लगभग सभी मॉडल प्रत्येक टोकन के लिए सक्रिय थे। Olmo-core 3 फ्रेमवर्क को एक प्रशिक्षण प्रणाली के साथ विस्तारित करता है जो बहुत बड़े MoE मॉडलों के लिए डिज़ाइन की गई है। Ai2 ने नोट किया कि NVIDIA का Megatron-Core बड़े MoE को प्रशिक्षित करने का स्थापित विकल्प है, और Olmo-core 3 को Olmo के पीछे के फ्रेमवर्क में एकीकृत MoE प्रशिक्षण स्टैक लाते हुए वर्णित किया।

पैरालेलिज़्म, प्रिसीजन, और मेमोरी तकनीकें

तीन तकनीकें निर्धारित करती हैं कि मॉडल और उसका प्रशिक्षण स्थिति हार्डवेयर में कैसे विभाजित होती है: विशेषज्ञ पैरालेलिज़्म विशेषज्ञों को GPU में फैलाता है, पाइपलाइन पैरालेलिज़्म मॉडल की परतों को GPU समूहों में विभाजित करता है, और एक वितरित ऑप्टिमाइज़र ऑप्टिमाइज़र स्थिति को सभी GPU पर पूर्ण प्रतिलिपि संग्रहीत करने के बजाय GPU में वितरित करता है। Olmo-core 3 भी सही विशेषज्ञों को डेटा रूट करने की लागत को कम करता है: रो‑वाइज़ विशेषज्ञ पैरालेलिज़्म रूटेड डेटा को सीधे विशेषज्ञ इनपुट बफ़र में रखता है, GPU‑रेसिडेंट रूटिंग रूटिंग मेटाडेटा को GPU पर रखती है जिससे CPU काम को कतारबद्ध कर सकता है बिना इसे वापस कॉपी होने की प्रतीक्षा किए, और समूहित GEMM कई छोटे विशेषज्ञ गणनाओं को मिलाकर GPU को उन्हें अधिक कुशलता से चलाने देता है। तकनीकी रिपोर्ट एक NVSHMEM‑आधारित रो‑वाइज़ विशेषज्ञ पैरालेलिज़्म डिज़ाइन का वर्णन करती है जो प्रत्येक टोकन को सीधे उसके विशेषज्ञ के बफ़र में लिखती है, डिवाइस‑शेड्यूल्ड समूहित मैट्रिक्स गुणन के साथ जो विशेषज्ञ पैरालेलिज़्म को पूरी तरह सिंक्रोनाइज़ेशन‑फ्री बनाता है।

Olmo-core 3 MXFP8 को समर्थन देता है, जो एक कम‑प्रिसीजन संख्या प्रारूप है। चार NVIDIA B300 GPU पर एक नियंत्रित बेंचमार्क में, जहाँ काम को विशेषज्ञों में समान रूप से वितरित किया गया, Ai2 ने रिपोर्ट किया कि प्रशिक्षण थ्रूपुट BF16 बेसलाइन की तुलना में लगभग 21% अधिक है, जबकि अधिकतम सक्रिय मेमोरी 103 GiB से घटकर 95 GiB हो गई, जिसमें अधिकांश लाभ फीड‑फ़ॉरवर्ड गणना और विशेषज्ञों के बीच डेटा स्थानांतरण से आया। रिपोर्ट यह भी जोड़ती है कि टोपोलॉजी‑अज्ञेय चेकपॉइंट्स ग्लोबल FP32 टेन्सर को पैरालेल लेआउट से स्वतंत्र रूप से रिकॉर्ड करते हैं, इसलिए एक रन अलग टोपोलॉजी पर फिर से शुरू किया जा सकता है, और उसके नियंत्रित तुलना में एक्टिवेशन री‑कम्प्यूट ने लगभग दो‑तिहाई एक्टिवेशन मेमोरी हटा दी और अधिकतम मेमोरी को लगभग एक‑चौथाई तक घटा दिया, लेकिन थ्रूपुट में लगभग एक‑पाँचवाँ हिस्सा कम हो गया।

ट्रिलियन-परामीटर बेंचमार्क और घोषित सीमाएँ

Ai2 ने कहा कि उसने Olmo-core 3 को NVIDIA B300 GPU पर विभिन्न कॉन्फ़िगरेशन में बेंचमार्क किया, जिसमें 512 GPU पर 58.36 बिलियन पैरामीटर प्रति टोकन सक्रिय के साथ 1.2‑ट्रिलियन‑परामीटर मॉडल शामिल था, जहाँ सबसे अधिक देखी गई थ्रूपुट प्रति GPU 858 TFLOP/s थी। Ai2 ने बताया कि ये परीक्षण सिस्टम प्रदर्शन को मापने के लिए रैंडम रूटिंग का उपयोग करते हैं, न कि प्रशिक्षित मॉडल की गुणवत्ता को। तकनीकी रिपोर्ट 16 GPU पर 12.9‑बिलियन‑परामीटर मॉडल से लेकर 512 GPU पर 1.2‑ट्रिलियन‑परामीटर मॉडल तक मापे गए ऑपरेटिंग पॉइंट्स की सूची देती है, और बताती है कि प्रमुख दरें रैंडम रूटिंग के तहत मापे गए सिस्टम संदर्भ हैं, न कि नियंत्रित स्केलिंग कर्व या समय‑से‑गुणवत्ता दावा।

Ai2 ने DeepEP v2 के साथ भी प्रयोग किया, जो GPUs के बीच विशेषज्ञों के बीच संचार के लिए एक वैकल्पिक बैकएंड है, और 2.38 ट्रिलियन कुल पैरामीटर वाले कॉन्फ़िगरेशन तक पहुँचा। Ai2 इस परिणाम को एक अल्प‑क्षमता परीक्षण के रूप में वर्णित करता है जो Olmo-core 3 के स्केल को दर्शाता है, न कि सतत प्रशिक्षण प्रदर्शन को। तकनीकी रिपोर्ट, जिसका शीर्षक “Supercharging Olmo-core for Efficient and Scalable MoE Training” है, अक्टूबर 2026 की है; इसके लेखक Allen Institute for AI और University of Washington से हैं, जिसमें Tianhua Tao को मुख्य लेखक और प्रमुख डेवलपर के रूप में सूचीबद्ध किया गया है।

दस्तावेज़ीकृत निष्कर्ष और अगली पीढ़ी के Olmo की योजनाएँ

रिपोर्ट एक विफलता पैटर्न को दस्तावेज़ करती है जिसे Ai2 टोकन जेरिमैंडरिंग कहता है, जिसमें संतुलित रूटिंग को प्रोत्साहित करने के लिए निर्धारित स्कोर में सुधार हो सकता है जबकि वास्तविक कार्यभार कम संतुलित हो जाता है। अन्य दस्तावेज़ीकृत निष्कर्षों में शामिल हैं: विशेषज्ञों की लर्निंग रेट को कम करना क्योंकि वे कम टोकन प्रोसेस करते हैं, परीक्षण किए गए मॉडल परिवार में परिणामों में सुधार नहीं लाया; GPU गणनाएँ विभिन्न समय लेती थीं जब प्रोसेस किए जा रहे मान बदलते थे, भले ही मैट्रिक्स आयाम समान हों; और अलग-अलग GPU स्ट्रीम पर संचार और गणना का ओवरलैप हमेशा प्रशिक्षण को तेज़ नहीं करता और कुछ परीक्षणों में अंत‑से‑अंत निष्पादन को धीमा कर देता है। रिपोर्ट उन दृष्टिकोणों का भी वर्णन करती है जो परीक्षण किए गए लेकिन अपनाए नहीं गए, जिनमें सक्रियताओं का CPU पर ऑफलोड शामिल है जिसे होस्ट लिंक वहन नहीं कर सका और दो ओवरलैप योजनाएँ जो विशेषज्ञ गणना के लिए GPU संसाधनों के साथ प्रतिस्पर्धा करती थीं।

Ai2 ने कहा कि उसकी अगली पीढ़ी का Olmo MoE आर्किटेक्चर का उपयोग करेगा, और यह लक्ष्य रखता है कि यह अब तक का सबसे सक्षम Olmo हो, जो अपने सबसे बड़े डेटासेट और सबसे लंबी कॉन्टेक्स्ट विंडो पर प्रशिक्षित हो। संगठन ने कहा कि Olmo-core 3 पूरी तरह से खुला है, इसलिए शोधकर्ता और डेवलपर इसे अपने स्वयं के MoE को प्रशिक्षित करने, विभिन्न हार्डवेयर के अनुसार अनुकूलित करने, और रूटिंग, समानांतरता तथा सिस्टम के अन्य भागों के साथ प्रयोग करने के लिए उपयोग कर सकते हैं। Olmo-core GitHub रिपॉज़िटरी परियोजना को OLMo इकोसिस्टम के लिए PyTorch बिल्डिंग ब्लॉक्स के रूप में वर्णित करती है, इसमें Apache-2.0 लाइसेंस है, और इसे स्रोत से या PyPI से ai2-olmo-core के रूप में स्थापित किया जा सकता है।

Jonas Reeve एक AI-जनित विश्लेषक हैं Unite.AI में, जो संज्ञानात्मक AI, कृत्रिम सामान्य बुद्धिमत्ता (AGI), और मशीन इंटेलिजेंस की सैद्धांतिक नींव पर केंद्रित हैं। उनका कार्य यह जांचता है कि सीखना, तर्क, स्मृति और सारांश दोनों जैविक और कृत्रिम प्रणालियों में कैसे उभरते हैं, और आधुनिक AI आर्किटेक्चर को संज्ञानात्मक विज्ञान और मन की दार्शनिक प्रश्नों के दीर्घकालिक सवालों से जोड़ता है।

एक वैचारिक और प्रतिबिंबात्मक दृष्टिकोण के साथ, Jonas तर्क मॉडल, एजेंटिक सिस्टम, उद्भवित संज्ञान, और संरेखण सिद्धांत जैसे ढाँचों की जांच करते हैं, जिसका उद्देश्य AGI की ओर प्रगति का वास्तविक अर्थ—और क्या नहीं—स्पष्ट करना है। समयसीमा या प्रचार का पीछा करने के बजाय, वे मूल सिद्धांतों, वैचारिक कठोरता, और वर्तमान मॉडलों की सीमाओं पर जोर देते हैं।

Jonas Reeve द्वारा लिखे गए लेख AI-जनित हैं और Unite.AI की संपादकीय टीम द्वारा सटीकता, स्पष्टता, और उन्नत AI अवधारणाओं की जिम्मेदार चर्चा सुनिश्चित करने के लिए समीक्षा किए जाते हैं।