Yapay zeka modelleri ve platformları

IBM’in Granite 4.2 Modelleri Ortamlarda Düşünmeyi ve Eyleme Geçmeyi Öğreniyor

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

IBM, yoğun, yalnızca kod çözücü akıl yürütme dil modelleri ailesi olan Granite 4.2’yi üç boyutta: 3B, 8B ve 30B parametre olarak yayınladı. 25 Ağustos 2026’da Apache 2.0 lisansı altında ağırlıklar yayınlanarak duyurulan bu sürüm, her Granite modeline geçiş yapılabilir bir düşünme modu sağlıyor ve iki büyük boyutu gerçek yazılım mühendisliği, terminal ve web arama ortamlarında pekiştirmeli öğrenmeye tabi tutuyor.

IBM’deki Granite Ekibi, yapının teknik incelemesinde, yaklaşık 15 trilyon token üzerinde sıfırdan ön‑eğitimle başlayan, bağlam penceresini 512K tokena çıkaran beş aşamalı bir takvime sahip bir işlem hattını anlatıyor. Yaklaşık 7,2 milyon zincir‑düşünce, akıl yürütme ve ajan‑trajektori verisi üzerinde denetimli ince ayar yapılır. Ancak bu sürümün ağırlık merkezi, sonraki aşamalarda gelen: her aşamanın ayrı bir yetenek hedefleyen, önceki aşamanın kontrol noktasından ısınarak (warm‑start) başlatıldığı çok‑aşamalı pekiştirmeli öğrenme işlem hattıdır.

Üç boyut da doğrulanabilir ödüller üzerine temel RL çalıştırır: kontrol edilebilir yanıtları olan matematik problemleri, gizli birim testleriyle değerlendirilen kod, format denetleyicileriyle talimat‑takip görevleri — ayrıca belirli beceriler için kısa “booster” aşamaları. Yalnızca 8B ve 30B modelleri ajan‑blokta devam eder: modelin canlı bir ortamda hareket ettiği ve görevin gerçekten çözülüp çözülmediği üzerine ödüllendirildiği üç aşama. Yazılım‑mühendisliği aşamasında, OpenHands harness tarafından yönlendirilen model gerçek depoları düzenler ve yalnızca gizli test süiti geçerse başarılı sayılır. Terminal aşaması modeli, her rollout başına en fazla 64 ortam dönüşüyle canlı bir kabuğa (shell) bırakır. Arama aşaması ise modeli, çok‑adımlı soruları canlı web‑arama çağrılarıyla yanıtlamaya yönlendirir ve bir LLM yargıcı tarafından puanlanır.

Her model daha sonra tercih ve güvenlik için RLHF ile sonlandırılır; bu aynı zamanda önceki aşamalarda ortaya çıkabilecek uzun zincirleri caydırmak için akıl yürütme‑uzunluğu cezası uygular.

Geçiş Yapılabilir Düşünmenin Pratikte Nasıl Göründüğü

Her Granite 4.2 modeli, sohbet şablonu aracılığıyla üç çalışma modu sunar. Varsayılan düşünme modu, nihai cevaptan önce özel etiketler içinde tam bir düşünce zinciri üretir. Düşünme dışı mod doğrudan yanıt verir. Düşük çaba ayarı iki mod arasında yer alır ve kolay sorulara kısa bir akıl yürütme bütçesi harcar. Çok‑turlu sohbetlerde, önceki turlardaki düşünme varsayılan olarak bağlamı korumak için kaldırılır.

Yerel araç çağrısı aynı şablona yerleştirilmiştir: model, hangi aracı çağıracağı ve nedenini, OpenAI fonksiyon‑çağrısı formatında, çağrıyı üretmeden önce akıl yürütür; böylece vLLM veya SGLang üzerinden sunulan ajan‑harness’lere ekstra adaptör olmadan bağlanabilir. Granite 4.2 model koleksiyonuna göre, üç ağırlık da halka açık olarak indirilebilir ve 30B model kartı, amiral gemisinin Granite 4.1 30B temelinden sonradan eğitildiğini doğrular. Modeller, İngilizce, Almanca, Japonca, Arapça, Korece ve Çince dahil olmak üzere 12 dilde test edilmiştir.

IBM’in Bildirdiği Sayılar

IBM, aileyi ajan‑kodlama, genel araç kullanımı, akıl yürütme, sohbet ve uzun bağlamda NeMo Evaluator SDK üzerine inşa edilmiş bir çerçeve kullanarak değerlendirdi. Aşağıdaki puanlar, şirketin kendi raporladığı rakamlardır.

  • SWE-Bench Verified: 57.00 (30B), 47.67 (8B)
  • Terminal-Bench 2.1: 29.24 (30B), 20.56 (8B)
  • AIME25 math: 89.17 (30B), 86.67 (8B), 78.33 (3B)
  • GPQA science: 66.41 (30B), 64.14 (8B), 54.80 (3B)
  • RULER long context at 128K: 81.38 (30B), 71.41 (8B), 55.30 (3B)

Bu desen, eğitim tasarımıyla uyumludur. Puanlar, matematik, bilim ve kod akıl yürütmesinde boyutla tutarlı bir şekilde artar ve 8B ve 30B modellerinin yalnızca ajan‑RL bloğuna sahip olduğu ajan‑kodlama ölçütleri, boyutlar arasındaki en geniş farkı gösterir. Ortam aşamalarını çalıştırmayan 3B model, SWE-Bench veya Terminal-Bench süitlerinde hiç rapor edilmemiştir.

Değer Ağı Olmadan Ajanları Eğitmek

RL altyapısı, sürümün mühendisliğinin büyük kısmının burada toplandığı için daha yakından incelenmeye değerdir. Her aşama, aynı istem için çekilen diğer örneklerin ortalama ödülüne karşı her yanıtı puanlayan, ayrı bir değer ağı gerektiren pek çok RL işlem hattını ortadan kaldıran, asenkron GRPO (grup‑göreli politika optimizasyonu) yöntemiyle eğitilir. Üretim ve eğitim, birbirini asla engellemeyen ayrı GPU havuzlarında çalışır: çalışanlar bir ortak tamponda yörüngeler örneklemeye devam eder ve eğitmen, rollout ortasında güncellenmiş ağırlıkları geri akıtır. Bir koruma hattı, üreticilerin bir güncellemenin gerisinde kalmasını önler ve kesilmiş önem örneklemesi, bayat tokenların etkisini sınırlamaya yardımcı olur.

Ortamlar, tek bir arayüzün arkasında doğrulayıcılar, araçlar ve sandbox’lar sunan NeMo-Gym aracılığıyla bağlanır; NeMo-RL ise Megatron-Core üzerinde vLLM üretimiyle eğitim döngüsünü sürdürür. Pratik sonuç, kural‑tabanlı bir matematik denetleyicisi ile tam bir depo sandbox’ının eğitim döngüsüyle aynı görünmesidir; bu da aşamalı müfredatın çalıştırılabilir olmasını sağlar. IBM, modelleri CoreWeave tarafından barındırılan bir NVIDIA GB200 NVL72 kümesinde, 72‑GPU NVLink alanı ve 400 Gb/s InfiniBand altyapısı ile eğitti.

IBM ayrıca aileye kuantize varyantlar da sundu: kalibrasyonsuz FP8, SFT veri kümesinden 2.000 örnekle kalibre edilmiş NVFP4 ve MXFP4, ve bellek‑tasarruflu dağıtım için llama.cpp üzerinden on dört GGUF formatı.

Granite 4.2 IBM’in Ürün Serisine Nasıl Uyum Sağlıyor

Bu sürüm, IBM’in açık model stratejisinde kasıtlı bir iş bölümü devamını temsil ediyor. Önceki Granite nesilleri güçlü talimat‑takip asistanları olarak konumlandırılmıştı; şirket aynı gün Granite Speech 5.0’ı, ayrı bir duyuruda transkripsiyon hızı odaklı olarak yayınlamıştı. Granite 4.2, dil‑model serisinin açık akıl yürütme aşamasıdır ve ağırlıklarla birlikte tam eğitim tarifesi, veri‑karışımı oranları ve aşama‑başına hiperparametreler yayınlanarak gelmiştir.

Üç model, kuantize varyantlar, GitHub deposu ve dokümantasyon Apache 2.0 altında mevcuttur; 30B amiral gemisi tek bir çok‑GPU hizmet düğümü için boyutlandırılmışken, 3B daha hafif dağıtımlar için tasarlanmıştır; burada düşünme anahtarı hâlâ geçerlidir.

Jonas Reeve bilişsel AI, yapay genel zeka (AGI) ve makine zekasının teorik temelleri üzerine odaklanan Unite.AI'de AI tarafından oluşturulan bir analisttir. Çalışmaları, öğrenme, akıl yürütme, bellek ve soyutlama gibi kavramların hem biyolojik hem de yapay sistemlerde nasıl ortaya çıktığını keşfederek, modern AI mimarileri ile bilişsel bilim ve zihin felsefesindeki uzun süredir devam eden sorular arasında bağlantılar kurar.
Kavramsal ve düşünceli bir yaklaşım benimseyen Jonas, akıl yürütme modelleri, ajan sistemleri, ortaya çıkan biliş ve hizalama teorisi gibi çerçeveleri inceleyerek, AGI'ye doğru ilerlemenin ne anlama geldiğini - ve ne anlamadığını - açıklamayı amaçlar. Zaman çizelgesi veya hırs peşinde koşmak yerine, ilk ilkeleri, kavramsal titizliği ve mevcut modellerin sınırlarını vurgular.
Jonas Reeve tarafından yazılan makaleler AI tarafından oluşturulur ve Unite.AI'nin editör ekibi tarafından advanced AI kavramlarının doğruluğu, açıklığı ve sorumlu tartışması için gözden geçirilir.