एआई मॉडल और प्लेटफ़ॉर्म
IBM के Granite 4.2 मॉडल पर्यावरण के भीतर सोचने और कार्य करने की क्षमता सीखते हैं

IBM ने Granite 4.2 जारी किया है, जो इसका पहला घना, केवल‑डिकोडर तर्कशील भाषा मॉडल परिवार है, जो तीन आकारों में उपलब्ध है: 3B, 8B और 30B पैरामीटर। 25 अगस्त 2026 को घोषित किया गया और वजन Apache 2.0 लाइसेंस के तहत प्रकाशित किए गए, इस रिलीज़ ने प्रत्येक Granite मॉडल को स्विचेबल थिंकिंग मोड प्रदान किया है और दो बड़े आकारों को वास्तविक सॉफ्टवेयर‑इंजीनियरिंग, टर्मिनल और वेब‑सर्च परिवेशों में रिइन्फोर्समेंट लर्निंग के माध्यम से भेजा है।
एक तकनीकी walkthrough में, IBM की Granite टीम एक पाइपलाइन का वर्णन करती है जो लगभग 15 ट्रिलियन टोकन पर शून्य से प्री‑ट्रेनिंग से शुरू होती है, जिसमें पाँच‑फेज़ शेड्यूल के साथ कॉन्टेक्स्ट विंडो को 512K टोकन तक विस्तारित किया जाता है। इसके बाद लगभग 7.2 मिलियन चेन‑ऑफ़‑थॉट, तर्क और एजेंटिक‑ट्रैजेक्टरी डेटा के नमूनों पर सुपरवाइज़्ड फाइन‑ट्यूनिंग की जाती है। हालांकि, इस रिलीज़ का मुख्य बिंदु वह है जो इसके बाद आता है: एक बहु‑स्तरीय रिइन्फोर्समेंट लर्निंग पाइपलाइन, जहाँ प्रत्येक चरण एक अलग प्रशिक्षण रन है जो एक क्षमता को लक्षित करता है, और पिछले चरण के चेकपॉइंट से वार्म‑स्टार्ट किया जाता है।
तीनों आकार बुनियादी RL को सत्यापन योग्य इनामों पर चलाते हैं — जाँच योग्य उत्तरों वाले गणितीय प्रश्न, छिपी यूनिट टेस्ट द्वारा ग्रेडेड कोड, फ़ॉर्मेट चेकर वाले निर्देश‑अनुपालन कार्य — तथा विशिष्ट कौशलों के लिए छोटे “बूस्टर” चरण। केवल 8B और 30B मॉडल एजेंटिक ब्लॉक में आगे बढ़ते हैं: तीन चरण जहाँ मॉडल वास्तविक पर्यावरण में कार्य करता है और कार्य के सफल समाधान पर इनाम प्राप्त करता है। सॉफ़्टवेयर‑इंजीनियरिंग चरण में, OpenHands हार्नेस द्वारा संचालित, मॉडल वास्तविक रिपॉज़िटरी को संपादित करता है और केवल तभी पास होता है जब छिपा टेस्ट सूट पास हो जाता है। टर्मिनल चरण मॉडल को एक लाइव शेल में डालता है जिसमें प्रति रोलआउट अधिकतम 64 पर्यावरण टर्न होते हैं। सर्च चरण में यह लाइव वेब‑सर्च कॉल के माध्यम से मल्टी‑हॉप प्रश्नों का उत्तर देता है, जिसे एक LLM जज द्वारा स्कोर किया जाता है।
प्रत्येक मॉडल अंत में प्राथमिकता और सुरक्षा के लिए RLHF के साथ समाप्त होता है, जो तर्क‑लंबाई दंड भी लागू करता है ताकि पहले के चरणों में उत्पन्न हो सकने वाली लंबी श्रृंखलाओं को हतोत्साहित किया जा सके।
व्यावहारिक रूप में स्विचेबल थिंकिंग कैसी दिखती है
प्रत्येक Granite 4.2 मॉडल अपने चैट टेम्प्लेट के माध्यम से तीन संचालन मोड प्रस्तुत करता है। थिंकिंग मोड, जो डिफ़ॉल्ट है, अंतिम उत्तर से पहले समर्पित टैग्स के भीतर पूरी सोच श्रृंखला उत्पन्न करता है। नॉन‑थिंकिंग मोड सीधे उत्तर देता है। एक लो‑इफ़र्ट सेटिंग दोनों के बीच स्थित होती है, जो आसान प्रश्नों पर छोटा तर्क बजट खर्च करती है। बहु‑टर्न संवादों में, संदर्भ बचाने के लिए पूर्व टर्न की सोच को डिफ़ॉल्ट रूप से हटाया जाता है।
नेटिव टूल कॉलिंग उसी टेम्प्लेट में निर्मित है: मॉडल यह तर्क करता है कि कौन सा टूल कॉल करना है और क्यों, कॉल जारी करने से पहले, OpenAI फ़ंक्शन‑कॉलिंग फ़ॉर्मेट में, जिससे यह vLLM या SGLang के माध्यम से प्रदान किए गए एजेंटिक हार्नेस में अतिरिक्त एडाप्टर के बिना जुड़ जाता है। Granite 4.2 मॉडल संग्रह के अनुसार, सभी तीन वज़न सार्वजनिक रूप से डाउनलोड योग्य हैं, और 30B मॉडल कार्ड पुष्टि करता है कि फ़्लैगशिप को Granite 4.1 30B बेस से पोस्ट‑ट्रेन किया गया था। मॉडल 12 भाषाओं में परीक्षण किए गए हैं, जिनमें अंग्रेज़ी, जर्मन, जापानी, अरबी, कोरियाई और चीनी शामिल हैं।
IBM द्वारा रिपोर्ट किए गए आँकड़े
IBM ने इस परिवार का मूल्यांकन एजेंटिक कोडिंग, सामान्य टूल उपयोग, तर्क, चैट और लंबी कॉन्टेक्स्ट पर किया, NeMo Evaluator SDK पर आधारित फ्रेमवर्क का उपयोग करके। नीचे दिए गए स्कोर कंपनी द्वारा स्वयं रिपोर्ट किए गए आंकड़े हैं।
- SWE‑Bench सत्यापित: 57.00 (30B), 47.67 (8B)
- Terminal‑Bench 2.1: 29.24 (30B), 20.56 (8B)
- AIME25 गणित: 89.17 (30B), 86.67 (8B), 78.33 (3B)
- GPQA विज्ञान: 66.41 (30B), 64.14 (8B), 54.80 (3B)
- RULER लंबा कॉन्टेक्स्ट 128K पर: 81.38 (30B), 71.41 (8B), 55.30 (3B)
यह पैटर्न प्रशिक्षण डिज़ाइन से मेल खाता है। गणित, विज्ञान और कोड तर्क में आकार के साथ स्कोर लगातार बढ़ते हैं, और एजेंटिक‑कोडिंग बेंचमार्क जो 8B और 30B मॉडलों के विशिष्ट एजेंटिक‑RL ब्लॉक पर निर्भर हैं, आकारों के बीच सबसे बड़ा अंतर दिखाते हैं। 3B मॉडल, जो कोई भी पर्यावरण चरण नहीं चलाता, SWE‑Bench या Terminal‑Bench सूट में बिल्कुल भी रिपोर्ट नहीं किया गया है।
वैल्यू नेटवर्क के बिना एजेंट्स का प्रशिक्षण
RL मशीनरी को करीब से देखना मूल्यवान है क्योंकि यही वह जगह है जहाँ रिलीज़ की अधिकांश इंजीनियरिंग स्थित है। प्रत्येक चरण असिंक्रोनस GRPO के साथ प्रशिक्षित होता है, जो एक समूह‑सापेक्ष नीति अनुकूलन विधि है और प्रत्येक प्रतिक्रिया को उसी प्रॉम्प्ट के लिए लिये गए अन्य नमूनों के औसत इनाम के विरुद्ध स्कोर करती है, जिससे कई RL पाइपलाइन की आवश्यक अलग वैल्यू नेटवर्क समाप्त हो जाती है। जनरेशन और प्रशिक्षण अलग GPU पूलों पर चलते हैं जो कभी एक‑दूसरे को ब्लॉक नहीं करते: कार्यकर्ता ट्रैजेक्टरी को साझा बफ़र में सैंपल करते रहते हैं, और ट्रेनर मध्य‑रोलआउट में अपडेटेड वज़न वापस स्ट्रीम करता है। एक गार्डरेल जेनरेटर को एक अपडेट से अधिक पीछे ड्रिफ्ट होने से रोकता है, और ट्रंकेटेड इम्पोर्टेंस सैंपलिंग पुरानी टोकनों के प्रभाव को सीमित करती है।
पर्यावरण NeMo‑Gym के माध्यम से जुड़ते हैं, जो एक समान इंटरफ़ेस के पीछे वेरिफ़ायर, टूल और सैंडबॉक्स प्रस्तुत करता है, जबकि NeMo‑RL Megatron‑Core पर vLLM जनरेशन के साथ प्रशिक्षण लूप को चलाता है। व्यावहारिक परिणाम यह है कि नियम‑आधारित गणित चेकर और पूर्ण रिपॉज़िटरी सैंडबॉक्स प्रशिक्षण लूप में समान दिखते हैं, जो चरणबद्ध पाठ्यक्रम को चलाने योग्य बनाता है। IBM ने मॉडल को NVIDIA GB200 NVL72 क्लस्टर पर CoreWeave द्वारा होस्ट किया, जिसमें 72‑GPU NVLink डोमेन और 400 Gb/s InfiniBand फ़ैब्रिक है।
IBM ने परिवार के क्वांटाइज़्ड वेरिएंट भी जारी किए: कैलिब्रेशन के बिना FP8, SFT डेटासेट के 2,000 नमूनों पर कैलिब्रेटेड NVFP4 और MXFP4, तथा कम मेमोरी डिप्लॉयमेंट के लिए llama.cpp के माध्यम से चौदह GGUF फ़ॉर्मेट।
Granite 4.2 IBM की लाइन में कहाँ फिट होता है
यह रिलीज़ IBM की ओपन मॉडल रणनीति में एक जानबूझकर विभाजन को जारी रखती है। पहले के Granite पीढ़ियों को मजबूत निर्देश‑अनुपालन सहायक के रूप में स्थित किया गया था; कंपनी ने उसी दिन Granite Speech 5.0 को कवर किया, जो ट्रांसक्रिप्शन गति पर केंद्रित एक अलग घोषणा थी। Granite 4.2 भाषा‑मॉडल लाइन में स्पष्ट तर्क का चरण है, और यह पूर्ण प्रशिक्षण रेसिपी, डेटा‑मिक्सचर अनुपात, और प्रत्येक चरण के हाइपरपैरामीटर वज़न के साथ प्रकाशित करके आया है।
तीनों मॉडल, क्वांटाइज़्ड वेरिएंट, GitHub रिपॉज़िटरी और दस्तावेज़ Apache 2.0 के तहत उपलब्ध हैं, जहाँ 30B फ़्लैगशिप को एकल मल्टी‑GPU सर्विंग नोड के लिए आकार दिया गया है और 3B को हल्के डिप्लॉयमेंट के लिए लक्षित किया गया है जहाँ थिंकिंग स्विच अभी भी लागू होता है।












