एआई मॉडल और प्लेटफ़ॉर्म

IBM के Granite 4.2 मॉडल पर्यावरण के भीतर सोचने और कार्य करने की क्षमता सीखते हैं

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

IBM ने Granite 4.2 जारी किया है, जो इसका पहला घना, केवल‑डिकोडर तर्कशील भाषा मॉडल परिवार है, जो तीन आकारों में उपलब्ध है: 3B, 8B और 30B पैरामीटर। 25 अगस्त 2026 को घोषित किया गया और वजन Apache 2.0 लाइसेंस के तहत प्रकाशित किए गए, इस रिलीज़ ने प्रत्येक Granite मॉडल को स्विचेबल थिंकिंग मोड प्रदान किया है और दो बड़े आकारों को वास्तविक सॉफ्टवेयर‑इंजीनियरिंग, टर्मिनल और वेब‑सर्च परिवेशों में रिइन्फोर्समेंट लर्निंग के माध्यम से भेजा है।

एक तकनीकी walkthrough में, IBM की Granite टीम एक पाइपलाइन का वर्णन करती है जो लगभग 15 ट्रिलियन टोकन पर शून्य से प्री‑ट्रेनिंग से शुरू होती है, जिसमें पाँच‑फेज़ शेड्यूल के साथ कॉन्टेक्स्ट विंडो को 512K टोकन तक विस्तारित किया जाता है। इसके बाद लगभग 7.2 मिलियन चेन‑ऑफ़‑थॉट, तर्क और एजेंटिक‑ट्रैजेक्टरी डेटा के नमूनों पर सुपरवाइज़्ड फाइन‑ट्यूनिंग की जाती है। हालांकि, इस रिलीज़ का मुख्य बिंदु वह है जो इसके बाद आता है: एक बहु‑स्तरीय रिइन्फोर्समेंट लर्निंग पाइपलाइन, जहाँ प्रत्येक चरण एक अलग प्रशिक्षण रन है जो एक क्षमता को लक्षित करता है, और पिछले चरण के चेकपॉइंट से वार्म‑स्टार्ट किया जाता है।

तीनों आकार बुनियादी RL को सत्यापन योग्य इनामों पर चलाते हैं — जाँच योग्य उत्तरों वाले गणितीय प्रश्न, छिपी यूनिट टेस्ट द्वारा ग्रेडेड कोड, फ़ॉर्मेट चेकर वाले निर्देश‑अनुपालन कार्य — तथा विशिष्ट कौशलों के लिए छोटे “बूस्टर” चरण। केवल 8B और 30B मॉडल एजेंटिक ब्लॉक में आगे बढ़ते हैं: तीन चरण जहाँ मॉडल वास्तविक पर्यावरण में कार्य करता है और कार्य के सफल समाधान पर इनाम प्राप्त करता है। सॉफ़्टवेयर‑इंजीनियरिंग चरण में, OpenHands हार्नेस द्वारा संचालित, मॉडल वास्तविक रिपॉज़िटरी को संपादित करता है और केवल तभी पास होता है जब छिपा टेस्ट सूट पास हो जाता है। टर्मिनल चरण मॉडल को एक लाइव शेल में डालता है जिसमें प्रति रोलआउट अधिकतम 64 पर्यावरण टर्न होते हैं। सर्च चरण में यह लाइव वेब‑सर्च कॉल के माध्यम से मल्टी‑हॉप प्रश्नों का उत्तर देता है, जिसे एक LLM जज द्वारा स्कोर किया जाता है।

प्रत्येक मॉडल अंत में प्राथमिकता और सुरक्षा के लिए RLHF के साथ समाप्त होता है, जो तर्क‑लंबाई दंड भी लागू करता है ताकि पहले के चरणों में उत्पन्न हो सकने वाली लंबी श्रृंखलाओं को हतोत्साहित किया जा सके।

व्यावहारिक रूप में स्विचेबल थिंकिंग कैसी दिखती है

प्रत्येक Granite 4.2 मॉडल अपने चैट टेम्प्लेट के माध्यम से तीन संचालन मोड प्रस्तुत करता है। थिंकिंग मोड, जो डिफ़ॉल्ट है, अंतिम उत्तर से पहले समर्पित टैग्स के भीतर पूरी सोच श्रृंखला उत्पन्न करता है। नॉन‑थिंकिंग मोड सीधे उत्तर देता है। एक लो‑इफ़र्ट सेटिंग दोनों के बीच स्थित होती है, जो आसान प्रश्नों पर छोटा तर्क बजट खर्च करती है। बहु‑टर्न संवादों में, संदर्भ बचाने के लिए पूर्व टर्न की सोच को डिफ़ॉल्ट रूप से हटाया जाता है।

नेटिव टूल कॉलिंग उसी टेम्प्लेट में निर्मित है: मॉडल यह तर्क करता है कि कौन सा टूल कॉल करना है और क्यों, कॉल जारी करने से पहले, OpenAI फ़ंक्शन‑कॉलिंग फ़ॉर्मेट में, जिससे यह vLLM या SGLang के माध्यम से प्रदान किए गए एजेंटिक हार्नेस में अतिरिक्त एडाप्टर के बिना जुड़ जाता है। Granite 4.2 मॉडल संग्रह के अनुसार, सभी तीन वज़न सार्वजनिक रूप से डाउनलोड योग्य हैं, और 30B मॉडल कार्ड पुष्टि करता है कि फ़्लैगशिप को Granite 4.1 30B बेस से पोस्ट‑ट्रेन किया गया था। मॉडल 12 भाषाओं में परीक्षण किए गए हैं, जिनमें अंग्रेज़ी, जर्मन, जापानी, अरबी, कोरियाई और चीनी शामिल हैं।

IBM द्वारा रिपोर्ट किए गए आँकड़े

IBM ने इस परिवार का मूल्यांकन एजेंटिक कोडिंग, सामान्य टूल उपयोग, तर्क, चैट और लंबी कॉन्टेक्स्ट पर किया, NeMo Evaluator SDK पर आधारित फ्रेमवर्क का उपयोग करके। नीचे दिए गए स्कोर कंपनी द्वारा स्वयं रिपोर्ट किए गए आंकड़े हैं।

  • SWE‑Bench सत्यापित: 57.00 (30B), 47.67 (8B)
  • Terminal‑Bench 2.1: 29.24 (30B), 20.56 (8B)
  • AIME25 गणित: 89.17 (30B), 86.67 (8B), 78.33 (3B)
  • GPQA विज्ञान: 66.41 (30B), 64.14 (8B), 54.80 (3B)
  • RULER लंबा कॉन्टेक्स्ट 128K पर: 81.38 (30B), 71.41 (8B), 55.30 (3B)

यह पैटर्न प्रशिक्षण डिज़ाइन से मेल खाता है। गणित, विज्ञान और कोड तर्क में आकार के साथ स्कोर लगातार बढ़ते हैं, और एजेंटिक‑कोडिंग बेंचमार्क जो 8B और 30B मॉडलों के विशिष्ट एजेंटिक‑RL ब्लॉक पर निर्भर हैं, आकारों के बीच सबसे बड़ा अंतर दिखाते हैं। 3B मॉडल, जो कोई भी पर्यावरण चरण नहीं चलाता, SWE‑Bench या Terminal‑Bench सूट में बिल्कुल भी रिपोर्ट नहीं किया गया है।

वैल्यू नेटवर्क के बिना एजेंट्स का प्रशिक्षण

RL मशीनरी को करीब से देखना मूल्यवान है क्योंकि यही वह जगह है जहाँ रिलीज़ की अधिकांश इंजीनियरिंग स्थित है। प्रत्येक चरण असिंक्रोनस GRPO के साथ प्रशिक्षित होता है, जो एक समूह‑सापेक्ष नीति अनुकूलन विधि है और प्रत्येक प्रतिक्रिया को उसी प्रॉम्प्ट के लिए लिये गए अन्य नमूनों के औसत इनाम के विरुद्ध स्कोर करती है, जिससे कई RL पाइपलाइन की आवश्यक अलग वैल्यू नेटवर्क समाप्त हो जाती है। जनरेशन और प्रशिक्षण अलग GPU पूलों पर चलते हैं जो कभी एक‑दूसरे को ब्लॉक नहीं करते: कार्यकर्ता ट्रैजेक्टरी को साझा बफ़र में सैंपल करते रहते हैं, और ट्रेनर मध्य‑रोलआउट में अपडेटेड वज़न वापस स्ट्रीम करता है। एक गार्डरेल जेनरेटर को एक अपडेट से अधिक पीछे ड्रिफ्ट होने से रोकता है, और ट्रंकेटेड इम्पोर्टेंस सैंपलिंग पुरानी टोकनों के प्रभाव को सीमित करती है।

पर्यावरण NeMo‑Gym के माध्यम से जुड़ते हैं, जो एक समान इंटरफ़ेस के पीछे वेरिफ़ायर, टूल और सैंडबॉक्स प्रस्तुत करता है, जबकि NeMo‑RL Megatron‑Core पर vLLM जनरेशन के साथ प्रशिक्षण लूप को चलाता है। व्यावहारिक परिणाम यह है कि नियम‑आधारित गणित चेकर और पूर्ण रिपॉज़िटरी सैंडबॉक्स प्रशिक्षण लूप में समान दिखते हैं, जो चरणबद्ध पाठ्यक्रम को चलाने योग्य बनाता है। IBM ने मॉडल को NVIDIA GB200 NVL72 क्लस्टर पर CoreWeave द्वारा होस्ट किया, जिसमें 72‑GPU NVLink डोमेन और 400 Gb/s InfiniBand फ़ैब्रिक है।

IBM ने परिवार के क्वांटाइज़्ड वेरिएंट भी जारी किए: कैलिब्रेशन के बिना FP8, SFT डेटासेट के 2,000 नमूनों पर कैलिब्रेटेड NVFP4 और MXFP4, तथा कम मेमोरी डिप्लॉयमेंट के लिए llama.cpp के माध्यम से चौदह GGUF फ़ॉर्मेट।

Granite 4.2 IBM की लाइन में कहाँ फिट होता है

यह रिलीज़ IBM की ओपन मॉडल रणनीति में एक जानबूझकर विभाजन को जारी रखती है। पहले के Granite पीढ़ियों को मजबूत निर्देश‑अनुपालन सहायक के रूप में स्थित किया गया था; कंपनी ने उसी दिन Granite Speech 5.0 को कवर किया, जो ट्रांसक्रिप्शन गति पर केंद्रित एक अलग घोषणा थी। Granite 4.2 भाषा‑मॉडल लाइन में स्पष्ट तर्क का चरण है, और यह पूर्ण प्रशिक्षण रेसिपी, डेटा‑मिक्सचर अनुपात, और प्रत्येक चरण के हाइपरपैरामीटर वज़न के साथ प्रकाशित करके आया है।

तीनों मॉडल, क्वांटाइज़्ड वेरिएंट, GitHub रिपॉज़िटरी और दस्तावेज़ Apache 2.0 के तहत उपलब्ध हैं, जहाँ 30B फ़्लैगशिप को एकल मल्टी‑GPU सर्विंग नोड के लिए आकार दिया गया है और 3B को हल्के डिप्लॉयमेंट के लिए लक्षित किया गया है जहाँ थिंकिंग स्विच अभी भी लागू होता है।

जोनस रीव यूनाइट.एआई में एक एआई-जनरेटेड विश्लेषक है, जो कॉग्निटिव एआई, आर्टिफिशियल जनरल इंटेलिजेंस (एजीआई), और मशीन इंटेलिजेंस के सैद्धांतिक आधारों पर ध्यान केंद्रित करता है। उनका काम यह देखता है कि जीवविज्ञान और कृत्रिम प्रणालियों दोनों में सीखने, तर्क, स्मृति, और अमूर्तता कैसे उत्पन्न होती है, आधुनिक एआई आर्किटेक्चर और संज्ञान विज्ञान और मन के दर्शन में लंबे समय से चली आ रही प्रश्नों के बीच संबंध बनाते हैं।
एक अवधारणात्मक और प्रतिबिंबात्मक दृष्टिकोण के साथ, जोनस तर्क मॉडल, एजेंटिक सिस्टम, उभरने वाली संज्ञान, और संरेखण सिद्धांत जैसे ढांचे की जांच करता है, एजीआई की ओर वास्तविक प्रगति का क्या अर्थ है - और क्या नहीं - स्पष्ट करने का लक्ष्य रखते हुए। समयसीमा या हाइप का पीछा करने के बजाय, वह पहले सिद्धांतों, अवधारणात्मक कठोरता, और वर्तमान मॉडलों की सीमाओं पर जोर देता है।
जोनस रीव द्वारा लिखित लेख एआई-जनरेटेड हैं और यूनाइट.एआई की संपादकीय टीम द्वारा उन्नत एआई अवधारणाओं की सटीकता, स्पष्टता, और जिम्मेदार चर्चा सुनिश्चित करने के लिए समीक्षा की जाती है।