نماذج ومنصات الذكاء الاصطناعي
نماذج Granite 4.2 من IBM تتعلم التفكير والعمل داخل البيئات

أصدرت IBM نموذج Granite 4.2، وهو أول عائلة من نماذج اللغة الكثيفة التي تعتمد على فك الترميز فقط للتفكير، بثلاث أحجام: 3 مليار، 8 مليار، و30 مليار معلمة. أعلن عنها في 25 أغسطس 2026 مع نشر الأوزان تحت رخصة Apache 2.0، وتمنح كل نموذج Granite وضع تفكير قابل للتبديل وتُرسل النسختين الأكبر عبر التعلم المعزز داخل بيئات حقيقية لهندسة البرمجيات، الطرفية، والبحث على الويب.
في دليل تقني لبناء النموذج، يصف فريق Granite في IBM خط أنابيب يبدأ بالتدريب المسبق من الصفر على نحو 15 تريليون رمز، وفق جدول من خمس مراحل يمد نافذة السياق إلى 512 ألف رمز. يتبع ذلك تحسين خاضع للإشراف على حوالي 7.2 مليون عينة من سلاسل التفكير، والاستدلال، وبيانات المسار الوكائني. ومع ذلك، فإن محور الإصدار هو ما يأتي بعد ذلك: خط أنابيب تعلم معزز متعدد المراحل حيث كل مرحلة تمثل تشغيل تدريب منفصل يهدف إلى قدرة واحدة، يبدأ من نقطة تفتيش المرحلة السابقة.
تشغل الأحجام الثلاثة جميعها تعلمًا معززًا أساسيًا على مكافآت قابلة للتحقق — مسائل رياضية بإجابات يمكن فحصها، شيفرة تُقيم باختبارات وحدة مخفية، مهام متابعة التعليمات مع مدققي الصيغة — بالإضافة إلى مراحل “معززة” قصيرة لمهارات محددة. تستمر نماذج 8 ب و30 ب فقط إلى الكتلة الوكائية: ثلاث مراحل يتصرف فيها النموذج داخل بيئة حية ويُكافأ بناءً على ما إذا كانت المهمة قد حُلت فعليًا. في مرحلة هندسة البرمجيات، وبالاستفادة من إطار OpenHands، يقوم النموذج بتحرير مستودعات حقيقية ولا يجتاز الاختبار إلا إذا نجح مجموعة الاختبارات المخفية. تُسقط مرحلة الطرفية النموذج في صدفة حية مع ما يصل إلى 64 دورة بيئية لكل تشغيل. وتُجّيب مرحلة البحث على أسئلة متعددة القفزات عبر استدعاءات بحث ويب حية، تُقَيَّم من قبل حكم LLM.
تنتهي كل نموذج بعد ذلك بعملية RLHF لتفضيلات المستخدم والسلامة، والتي تُطبق أيضًا عقوبة على طول سلاسل التفكير لتقليل السلاسل المطولة التي قد تنتجها المراحل السابقة.
ما هو شكل التفكير القابل للتبديل في الممارسة العملية
كل نموذج Granite 4.2 يُظهر ثلاث أوضاع تشغيل عبر قالب الدردشة الخاص به. وضع التفكير، وهو الوضع الافتراضي، ينتج سلسلة كاملة من التفكير داخل وسوم مخصصة قبل الإجابة النهائية. وضع غير التفكير يجيب مباشرة. وهناك إعداد منخفض الجهد يقع بينهما، يخصص ميزانية تفكير قصيرة للأسئلة السهلة. في المحادثات متعددة الأدوار، تُحذف سلاسل التفكير للأدوار السابقة افتراضيًا لتوفير السياق.
استدعاء الأدوات الأصلي مدمج في نفس القالب: يقرر النموذج أي أداة يستدعيها ولماذا قبل إصدار الاستدعاء، بصيغة استدعاء وظائف OpenAI، بحيث يمكن توصيله بأطر عمل وكائية تُقدَّم عبر vLLM أو SGLang دون حاجة إلى محولات إضافية. وفقًا لـ مجموعة نماذج Granite 4.2، جميع الأوزان الثلاثة قابلة للتحميل علنًا، وتؤكد بطاقة النموذج 30 ب أن النسخة الرائدة تم تدريبها لاحقًا من قاعدة Granite 4.1 30 ب. تم اختبار النماذج عبر 12 لغة، بما فيها الإنجليزية، الألمانية، اليابانية، العربية، الكورية، والصينية.
الأرقام التي نشرتها IBM
قامت IBM بتقييم العائلة عبر الترميز الوكائي، واستخدام الأدوات العامة، والاستدلال، والدردشة، والسياق الطويل، باستخدام إطار مبني على مجموعة أدوات NeMo Evaluator SDK. الأرقام أدناه هي الأرقام التي أبلغت عنها الشركة نفسها.
- SWE-Bench Verified: 57.00 (30B)، 47.67 (8B)
- Terminal-Bench 2.1: 29.24 (30B)، 20.56 (8B)
- AIME25 math: 89.17 (30B)، 86.67 (8B)، 78.33 (3B)
- GPQA science: 66.41 (30B)، 64.14 (8B)، 54.80 (3B)
- RULER long context at 128K: 81.38 (30B)، 71.41 (8B)، 55.30 (3B)
النمط يتطابق مع تصميم التدريب. ترتفع الدرجات باستمرار مع زيادة الحجم عبر الرياضيات، العلوم، واستدلال الشيفرة، وتُظهر معايير الترميز الوكائي التي تعتمد على كتلة RL الوكائية الحصرية للنماذج 8 ب و30 ب الفجوة الأكبر بين الأحجام. النموذج 3 ب، الذي لا يمر بأي من مراحل البيئة، لم يُذكر في مجموعات SWE-Bench أو Terminal-Bench على الإطلاق.
تدريب الوكلاء دون شبكة قيمة
آلية RL تستحق نظرة أقرب لأنها المكان الذي يتركز فيه معظم هندسة الإصدار. كل مرحلة تُدرب باستخدام GRPO غير المتزامن، وهو أسلوب تحسين سياسة جماعي نسبي يُقيّم كل استجابة مقابل متوسط المكافأة للعينات الأخرى المأخوذة لنفس المطالبة، مما يلغي الحاجة إلى شبكة قيمة منفصلة التي تتطلبها العديد من خطوط أنابيب RL. يتم تشغيل التوليد والتدريب على مجموعات GPU منفصلة لا تعيق بعضها البعض: يستمر العاملون في أخذ عينات من المسارات إلى مخزن مشترك، ويُعيد المدرب تدفق الأوزان المحدثة أثناء التنفيذ. تحافظ حواجز الحماية على عدم انحراف المولدات بأكثر من تحديث واحد، ويقيد أخذ العينات بأهمية مقطوعة تأثير الرموز القديمة.
تُرفق البيئات عبر NeMo-Gym، الذي يقدم المدققين، الأدوات، والصناديق الرملية من خلال واجهة موحدة، بينما يدير NeMo-RL حلقة التدريب على Megatron-Core مع توليد vLLM. النتيجة العملية هي أن مدقق رياضيات قائم على القواعد وصندوق ريبوزيتوري كامل يبدوان متطابقين في حلقة التدريب، وهو ما يجعل المنهج المتدرج قابلًا للتنفيذ. دربت IBM النماذج على مجموعة حوسبة NVIDIA GB200 NVL72 مستضافة من قبل CoreWeave، بمجال NVLink يضم 72 GPU وبُنية InfiniBand بسرعة 400 Gb/s.
كما وفرت IBM متغيرات مُكمَّسة للعائلة: FP8 بدون معايرة، NVFP4 وMXFP4 مُعاَيرة على 2,000 عينة من مجموعة بيانات SFT، وأربعة عشر صيغة GGUF عبر llama.cpp للنشر بذاكرة مخفضة.
مكان Granite 4.2 في خط IBM
يستمر الإصدار في تقسيم العمل المتعمد ضمن استراتيجية النماذج المفتوحة لـ IBM. كانت أجيال Granite السابقة تُصنَّف كمساعدين قويين يتبعون التعليمات؛ غطت الشركة Granite Speech 5.0، التي أُطلقت في نفس اليوم، في إعلان منفصل يركز على سرعة النسخ. Granite 4.2 هو دور خط نماذج اللغة في التفكير الصريح، ويأتي مع وصفة التدريب الكاملة، نسب خلط البيانات، ومعلمات كل مرحلة منشورة إلى جانب الأوزان.
جميع النماذج الثلاثة، والمتغيرات المُكمَّسة، ومستودع GitHub، والوثائق متاحة تحت رخصة Apache 2.0، حيث يُصمم النموذج الرائد 30 B ليتناسب مع عقدة خدمة متعددة GPU واحدة، بينما يُستهدف النموذج 3 B للنشر الأخف حيث يظل مفتاح التفكير فعالًا.












