एआई मॉडल और प्लेटफ़ॉर्म

Reflection AI ने Beam को प्रस्तुत किया, एक 501 बिलियन पैरामीटर वाला ओपन‑वेट मॉडल

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

Reflection AI ने परिचय कराया Beam 5 अक्टूबर 2026 को, अपना पहला ओपन‑वेट मॉडल: 501 बिलियन कुल पैरामीटर और 23 बिलियन सक्रिय के साथ एक विरल Mixture-of-Experts प्रणाली, जो कोडिंग, तर्क और एजेंटिक कार्यभार के लिए बनाई गई है।

Beam अंतिम रेड‑टीमिंग और मूल्यांकन चरण में है, और एक प्रारंभिक संस्करण चयनित उपयोगकर्ताओं के समूह को वेटलिस्ट के माध्यम से पेश किया जा रहा है। Reflection ने Beam को श्रृंखला का पहला मॉडल बताया और कहा कि यह पहले ही अगला मॉडल प्रशिक्षण दे रहा है।

क्षमता और दक्षता के दावे

Reflection ने कहा कि उसने Beam को कोडिंग और एजेंटिक प्रदर्शन पर विशेष ध्यान देकर प्रशिक्षित किया। कंपनी ने मॉडल को GLM 5.2 जैसे बड़े ओपन मॉडलों के साथ प्रतिस्पर्धी बताया और कोडिंग और एजेंटिक कार्यों में Qwen 3.8‑Max के करीब पहुँचते हुए कहा, जबकि यह स्वीकार किया कि Kimi K3 कच्ची क्षमता में आगे है; इसने Beam के लाभ को इन्फ़रेंस‑समय दक्षता के रूप में वर्णित किया और कहा कि मॉडल वह पश्चिमी ओपन‑वेट फ्रंटियर को आगे बढ़ाता है।

Reflection द्वारा रिपोर्ट किए गए मूल्यांकन सूट के स्कोर में Terminal Bench v2.1 पर 80.1, SWEBench Verified पर 80.9, SWE Bench Pro v2‑Hard पर 77.2, AIME 2026 पर 97.8, Humanity’s Last Exam (बिना टूल्स) पर 36.2, और GPQA Diamond पर 90.5 शामिल हैं।

दक्षता के संबंध में, कंपनी ने बताया कि Beam उन्नत तर्क बेंचमार्क पर GLM‑5.2 के तुलनीय स्कोर प्राप्त करता है जबकि इन्फ़रेंस कंप्यूट को तीन से चार गुना कम उपयोग करता है, और दो ट्रिलियन से अधिक पैरामीटर वाले मॉडलों जैसे Qwen 3.8‑Max के मुकाबले अधिक लाभ देता है। पोस्ट के अनुसार, ये अनुमान Artificial Analysis और DataCurve डेटा पर आधारित हैं और जनरेशन कंप्यूट को सक्रिय पैरामीटर गिनती के दो गुना को औसत उत्पन्न टोकन प्रति प्रयास से गुणा करके अनुमानित किया गया है; क्योंकि ये आंकड़े प्रॉम्प्ट प्री‑फ़िल, अटेंशन ऑपरेशन्स, और सर्विंग ओवरहेड को बाहर रखते हैं, Reflection ने इन्हें मापी गई इन्फ़रेंस लागत के बजाय एक अनुमानित कंप्यूट तुलना के रूप में वर्णित किया।

Reflection ने कहा कि उसने Beam को एक नियंत्रित लंबाई दंड के साथ भी प्रशिक्षित किया जो सफल समाधान को पुरस्कृत करता है जबकि अनावश्यक टोकन को हतोत्साहित करता है, और एक उपयोगकर्ता‑मुख्य तर्क‑प्रयास पैरामीटर प्रदान किया जो उपयोगकर्ताओं को टोकन उपयोग को प्रदर्शन के विरुद्ध बदलने की अनुमति देता है, जहाँ कम सेटिंग्स छोटे उत्तरों को प्राथमिकता देती हैं और उच्च सेटिंग्स कठिन कार्यों में लंबी तर्क प्रक्रिया की अनुमति देती हैं।

घोषणा रिपोर्ट करती है कि क्षमताएँ प्रशिक्षण मिश्रण से परे सामान्यीकृत हुईं: तर्क, सॉफ़्टवेयर इंजीनियरिंग और टर्मिनल कार्यों पर रिइन्फोर्समेंट लर्निंग के दौरान, ब्राउज़िंग कार्यों की अनुपस्थिति के बावजूद ब्राउज़िंग प्रदर्शन सुधरा, और वेब एक्सेस के साथ मॉडल ने स्वयं अन्य बड़े भाषा मॉडलों को क्वेरी करने और दस्तावेज़ पढ़ने के लिए OCR API का उपयोग करना सीखा। प्रदर्शनों में सार्वजनिक MTA डेटा से निर्मित एक लाइव‑अपडेटिंग न्यूयॉर्क सिटी सबवे मानचित्र, p5.js में लिखा गया एक 3D अंतरिक्ष यात्री गेम, और एक लैंड‑ऑर‑वॉटर पहेली शामिल है जिसमें Beam ने 16,200 बिंदुओं वाले वैश्विक निर्देशांक ग्रिड पर बिंदुओं को 95.5 प्रतिशत कवरेज के साथ वर्गीकृत किया, जिसे पोस्ट ने Opus 5 के 92.5 प्रतिशत और Fable 5 के 97.8 प्रतिशत के बीच रखा। चौथे प्रदर्शन में, Beam ने सबसे छोटे Gemma‑4 मॉडल को Text2SQL कार्य पर फाइन‑ट्यून करने के लिए एक नोटबुक तैयार किया, जिसे Reflection ने बताया कि इसने Gemma की होल्ड‑आउट टेस्ट सटीकता को 66.5 प्रतिशत बढ़ा दिया।

प्रशिक्षण पाइपलाइन

पूर्व‑प्रशिक्षण और डेटा क्यूरेशन

Reflection ने कहा कि उसने Beam को वेब, सार्वजनिक स्रोतों और स्वामित्व वाले लाइसेंस्ड डेटासेट्स से प्राप्त 23.8 ट्रिलियन टोकन पर पूर्व‑प्रशिक्षित किया, और 6,144 NVIDIA GB300 NVL72 GPUs पर चार सप्ताह से कम समय में अंत‑से‑अंत रन पूरा किया। कंपनी ने नौ अर्ध‑स्वचालित रीविंड्स की रिपोर्ट की, जिन्हें ग्रेडिएंट‑नॉर्म स्पाइक या संभावित साइलेंट डेटा करप्शन को कारण बताया, और कहा कि गूडपुट, जिसे अंतिम मॉडल में रखे गए प्रशिक्षण चरणों के लिए खर्च किए गए वॉल‑क्लॉक समय के हिस्से के रूप में परिभाषित किया गया है, 92.3 प्रतिशत तक पहुँचा।

डेटा पाइपलाइन ने पार्सिंग, डेडुप्लिकेशन और क्यूरेशन के माध्यम से लगभग 95 प्रतिशत कच्चे इंटरनेट टोकन को हटा दिया, जबकि Reflection ने कहा कि पारंपरिक फ़िल्टरिंग तकनीकों से लगभग 1.8 ट्रिलियन उच्च‑गुणवत्ता वाले टोकन, जिसमें उसके क्यूरेटेड वेब‑कोड टोकन का 87 प्रतिशत शामिल है, छूट जाते। एक अलग पाइपलाइन ने हजारों GPUs पर इन‑हाउस क्वालिटी क्लासिफ़ायर के साथ एक विज़न‑लैंग्वेज OCR मॉडल का उपयोग करके PDF आर्टिफैक्ट्स को प्रोसेस किया, और मध्य‑प्रशिक्षण चरण ने Beam की प्रभावी संदर्भ लंबाई को एक मिलियन टोकन तक बढ़ाया।

पोस्ट एक ऐसी आर्किटेक्चर का वर्णन करती है जो इंटरलीव्ड लोकल और ग्लोबल अटेंशन, फाइन‑ग्रेन routed experts, और एक्स्ट्रा‑लॉस‑फ्री लोड बैलेंसिंग को कोसाइन डिके के साथ expert‑bias अपडेट्स के साथ जोड़ती है, साथ ही depth‑आधारित residual scaling, SandwichNorm, elementwise attention gating, और FP32 residual accumulation। Reflection ने लगभग समान expert उपयोगिता की रिपोर्ट की, जहाँ सबसे व्यस्त expert का लोड प्री‑ट्रेनिंग के अंत में औसत का 1.04 गुना था, और सभी 52 लेयर्स में residual‑stream नॉर्म्स सीमित रहे।

उच्च‑गणना रिइन्फोर्समेंट लर्निंग

रिइन्फोर्समेंट लर्निंग अभियान ने चार सप्ताह में 10,500 NVIDIA GB300 GPUs पर 100 मिलियन से अधिक रोलआउट उत्पन्न किए, अधिकतम संदर्भ लंबाई 256,000 टोकन और लगभग 1.3 बिलियन सैंडबॉक्स प्रशिक्षण और ग्रेडिंग के लिए उपयोग किए। Reflection ने बताया कि उसने लगभग एक मिलियन कोडिंग, एजेंटिक और STEM वातावरण मुख्यतः सिंथेटिक डेटा पाइपलाइनों के माध्यम से प्राप्त किए, और इस प्रयास को अब तक एक ओपन लैब द्वारा किए गए सबसे बड़े RL रन में से एक माना है।

कंपनी ने रिपोर्ट किया कि औसतन 110,000 समकालिक रोलआउट और अधिकतम 170,000 समकालिक सैंडबॉक्स बनाए रखे गए, 20 से अधिक क्लस्टर, दो क्लाउड और चार क्षेत्रों में एक अरब से अधिक सैंडबॉक्स निर्माण अनुरोध संसाधित किए गए। नए वज़न मध्य मान लगभग 12 सेकंड में इन्फ़रेंस फ़्लीट तक पहुँचे, 71 इन्फ़रेंस घटनाओं को प्रशिक्षण कार्य को समाप्त किए बिना संभाला गया, और डायनामिक पैकिंग ने प्रशिक्षण बैचों को औसतन 99.99 प्रतिशत पूर्ण रखा। Reflection ने कहा कि असिंक्रोनस सिस्टम स्थिर रहा यहाँ तक कि एक दिन के लगभग 107 वज़न संस्करणों के नमूनों से सीखते समय भी, वर्तमान नीति से पीछे।

सुरक्षा और संरेखण

संगति के लिए, Reflection ने समान प्री‑ट्रेंड चेकपॉइंट से एक दूसरा मॉडल प्रशिक्षित किया, जो एक अलग सुपरवाइज़्ड फाइन‑ट्यूनिंग और RL पाइपलाइन पर आधारित था जो व्यवहारिक सिद्धांतों को लक्षित करता था, फिर इसे बड़े‑पैमाने के RL शिक्षक के साथ मल्टी‑टीचर ऑन‑पॉलिसी डिस्टिलेशन के माध्यम से मिलाया। सिद्धांत तीन स्तरों में व्यवस्थित हैं: वे नियम जिन्हें मॉडल को नहीं तोड़ना चाहिए, वे गुण जो इसे लगातार पूरा करने चाहिए, और एक डिफ़ॉल्ट इंटरैक्शन शैली।

सुरक्षा डेटासेट को विरोधी रूप से और क्रमिक रूप से बनाया गया, जहाँ प्रत्येक दौर के सफल हमलों को अगले प्रशिक्षण दौर में वापस शामिल किया गया, और सुरक्षा RL ने सिंगल‑टर्न, मल्टी‑टर्न, जेलब्रेक और एजेंटिक परिदृश्यों को शामिल किया जिसमें एक सिम्युलेटेड विरोधी टूल‑उपयोग मॉडल पर दबाव डालता है। Reflection ने कहा कि वह RL लाभों की भविष्यवाणी Best‑of‑N सीमा से बेहतर कर सकता है, 0.79 का सहसंबंध रिपोर्ट किया जबकि सीमा के लिए 0.46 था। कंपनी ने कहा कि वह Beam की तकनीकी रिपोर्ट में अपनी सुरक्षा मूल्यांकन परिणाम प्रकाशित करेगा और विकसित किए गए आंतरिक सुरक्षा मूल्यांकन को ओपन‑सोर्स करेगा।

उपलब्धता और साझेदारियाँ

अपने के बारे में पृष्ठ पर, Reflection मॉडल वज़न जारी करने, अपने शोध को प्रकाशित करने, और सॉफ़्टवेयर को ओपन‑सोर्स करने के प्रतिबद्धताओं को रेखांकित करता है, जिसमें रिइन्फोर्समेंट लर्निंग टूल्स और वातावरण शामिल हैं। पृष्ठ में कहा गया है कि Reflection को Dell AI Factory के साथ NVIDIA द्वारा मान्य किया गया है, वह Department of Energy की Genesis Mission का प्रमाणित कंसोर्टियम सदस्य है, जो 17 अमेरिकी राष्ट्रीय प्रयोगशालाओं को अपने ओपन‑वेट मॉडल प्रदान करता है, और वह Shinsegae के साथ दक्षिण कोरिया में 250‑मेगावॉट का संप्रभु AI क्लाउड बना रहा है, जिसे अमेरिकी और कोरियाई सरकारों ने समर्थन दिया है।

Reflection ने कहा कि वह Beam के वज़न को अक्टूबर 2026 के अंत में Apache 2.0 लाइसेंस के तहत जारी करेगा, साथ में एक तकनीकी रिपोर्ट, मॉडल कार्ड, दस्तावेज़ीकरण, और मॉडल को चलाने, मूल्यांकन करने और फाइन‑ट्यून करने के लिए पूर्ण स्टैक प्रदान करेगा, जिसमें वितरण साझेदार और ओपन‑सोर्स लाइब्रेरी एवं हार्नेस के साथ एकीकरण लॉन्च के लिए नियोजित हैं।

Jonas Reeve एक AI-जनित विश्लेषक हैं Unite.AI में, जो संज्ञानात्मक AI, कृत्रिम सामान्य बुद्धिमत्ता (AGI), और मशीन इंटेलिजेंस की सैद्धांतिक नींव पर केंद्रित हैं। उनका कार्य यह जांचता है कि सीखना, तर्क, स्मृति और सारांश दोनों जैविक और कृत्रिम प्रणालियों में कैसे उभरते हैं, और आधुनिक AI आर्किटेक्चर को संज्ञानात्मक विज्ञान और मन की दार्शनिक प्रश्नों के दीर्घकालिक सवालों से जोड़ता है।

एक वैचारिक और प्रतिबिंबात्मक दृष्टिकोण के साथ, Jonas तर्क मॉडल, एजेंटिक सिस्टम, उद्भवित संज्ञान, और संरेखण सिद्धांत जैसे ढाँचों की जांच करते हैं, जिसका उद्देश्य AGI की ओर प्रगति का वास्तविक अर्थ—और क्या नहीं—स्पष्ट करना है। समयसीमा या प्रचार का पीछा करने के बजाय, वे मूल सिद्धांतों, वैचारिक कठोरता, और वर्तमान मॉडलों की सीमाओं पर जोर देते हैं।

Jonas Reeve द्वारा लिखे गए लेख AI-जनित हैं और Unite.AI की संपादकीय टीम द्वारा सटीकता, स्पष्टता, और उन्नत AI अवधारणाओं की जिम्मेदार चर्चा सुनिश्चित करने के लिए समीक्षा किए जाते हैं।