AI-modellen en platforms

IBM’s Granite 4.2-modellen leren te denken en te handelen in omgevingen

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

IBM heeft Granite 4.2 uitgebracht, de eerste familie van compacte, alleen‑decoder redeneer‑taalmodellen, in drie groottes: 3 B, 8 B en 30 B parameters. Aangekondigd op 25 augustus 2026 met gewichten gepubliceerd onder de Apache 2.0‑licentie, biedt de release elk Granite‑model een schakelbare denkmodus en onderwerpt de twee grotere groottes aan reinforcement learning in echte software‑engineer‑, terminal‑ en web‑zoekomgevingen.

In een technische doorloop van de bouw beschrijft het Granite‑team van IBM een pijplijn die begint met pre‑training vanaf nul op ongeveer 15 biljoen tokens, met een vijf‑fasen‑schema dat het contextvenster uitbreidt tot 512 K tokens. Vervolgens volgt supervised fine‑tuning op ongeveer 7,2 miljoen voorbeelden van chain‑of‑thought, redeneren en agent‑trajectgegevens. Het zwaartepunt van de release is echter wat daarna komt: een meer‑fasen reinforcement‑learning‑pijplijn waarbij elke fase een aparte training run is die op één capaciteit is gericht, warm‑gestart vanuit het checkpoint van de vorige fase.

Alle drie de groottes voeren fundamentele RL uit op verifieerbare beloningen — wiskundige problemen met controleerbare antwoorden, code beoordeeld door verborgen unittests, instructie‑volgende taken met format‑checkers — plus korte “booster”‑fasen voor specifieke vaardigheden. Alleen de 8 B‑ en 30 B‑modellen gaan door naar het agent‑blok: drie fasen waarin het model binnen een live‑omgeving handelt en wordt beloond op basis van of de taak daadwerkelijk is opgelost. In de software‑engineer‑fase, aangestuurd door de OpenHands‑harnas, bewerkt het model echte repositories en slaagt alleen als de verborgen test‑suite slaagt. De terminal‑fase plaatst het model in een live‑shell met tot 64 omgevingsbeurten per rollout. De zoek‑fase laat het model meer‑staps vragen beantwoorden via live web‑zoekaanvragen, beoordeeld door een LLM‑jurylid.

Elk model eindigt vervolgens met RLHF voor voorkeur en veiligheid, waarbij ook een straf voor de lengte van redeneringen wordt toegepast om de lange ketens die eerdere fasen kunnen produceren te ontmoedigen.

Hoe schakelbaar denken er in de praktijk uitziet

Elk Granite 4.2‑model biedt drie bedieningsmodi via zijn chatsjabloon. Denkmodus, de standaard, genereert een volledige gedachteketen binnen speciale tags vóór het uiteindelijke antwoord. Niet‑denkmode beantwoordt direct. Een low‑effort‑instelling zit tussen beide en besteedt een korte redeneringsbudget aan eenvoudige vragen. In gesprekken met meerdere beurten wordt het denken van eerdere beurten standaard verwijderd om context te besparen.

Native tool‑aanroepen zijn ingebouwd in dezelfde sjabloon: het model redeneert over welke tool aangeroepen moet worden en waarom voordat het de oproep uitgeeft, in het OpenAI‑function‑calling‑formaat, zodat het naadloos aansluit op agent‑harnessen die via vLLM of SGLang worden bediend zonder extra adapters. Volgens de Granite 4.2 model collection zijn alle drie de gewichten publiek downloadbaar, en bevestigt de 30B model card dat de vlaggenschip is natrained vanaf de Granite 4.1 30 B‑basis. De modellen zijn getest in 12 talen, waaronder Engels, Duits, Japans, Arabisch, Koreaans en Chinees.

De cijfers die IBM rapporteert

IBM evalueerde de familie op agent‑codering, algemeen toolgebruik, redeneren, chat en lange context, met behulp van een framework gebouwd op de NeMo Evaluator SDK. De onderstaande scores zijn de door het bedrijf gerapporteerde cijfers.

  • SWE‑Bench Verified: 57,00 (30B), 47,67 (8B)
  • Terminal‑Bench 2.1: 29,24 (30B), 20,56 (8B)
  • AIME25 wiskunde: 89,17 (30B), 86,67 (8B), 78,33 (3B)
  • GPQA wetenschap: 66,41 (30B), 64,14 (8B), 54,80 (3B)
  • RULER lange context bij 128K: 81,38 (30B), 71,41 (8B), 55,30 (3B)

Het patroon komt overeen met het trainingsontwerp. Scores stijgen consistent met de grootte bij wiskunde, wetenschap en code‑redeneren, en de agent‑coding benchmarks die afhankelijk zijn van het exclusieve agent‑RL‑blok van de 8 B‑ en 30 B‑modellen vertonen de grootste kloof tussen de groottes. Het 3 B‑model, dat geen van de omgevingsfasen doorloopt, wordt in de SWE‑Bench‑ of Terminal‑Bench‑sets helemaal niet gerapporteerd.

Agenten trainen zonder een waardenetwerk

De RL‑machinerie verdient een nadere beschouwing omdat daar het grootste deel van de engineering van de release plaatsvindt. Elke fase traint met asynchrone GRPO, een groeps‑relatieve beleidsoptimalisatiemethode die elke respons beoordeelt ten opzichte van de gemiddelde beloning van de andere monsters die voor dezelfde prompt zijn genomen, waardoor het aparte waardenetwerk dat veel RL‑pijplijnen vereisen, wordt geëlimineerd. Generatie en training draaien op gescheiden GPU‑pools die elkaar nooit blokkeren: workers blijven trajecten bemonsteren in een gedeelde buffer, en de trainer streamt bijgewerkte gewichten terug tijdens de rollout. Een beveiligingsmechanisme voorkomt dat generators meer dan één update achterlopen, en getrimde importance‑sampling beperkt het effect van verouderde tokens.

De omgevingen worden gekoppeld via NeMo‑Gym, dat verifiers, tools en sandboxes achter een uniforme interface presenteert, terwijl NeMo‑RL de trainingslus op Megatron‑Core met vLLM‑generatie aandrijft. Het praktische gevolg is dat een regelgebaseerde wiskundige checker en een volledige repository‑sandbox er identiek uitzien voor de trainingslus, wat de gefaseerde curriculum uitvoerbaar maakt. IBM trainde de modellen op een NVIDIA GB200 NVL72‑cluster gehost door CoreWeave, met een 72‑GPU‑NVLink‑domein en 400 Gb/s InfiniBand‑fabric.

IBM leverde ook gequantiseerde varianten van de familie: FP8 zonder calibratie, NVFP4 en MXFP4 gekalibreerd op 2.000 monsters uit de SFT‑dataset, en veertien GGUF‑formaten via llama.cpp voor implementaties met minder geheugen.

Waar Granite 4.2 in IBM’s portfolio past

De release zet een bewuste taakverdeling voort in IBM’s open‑modelstrategie. Eerdere Granite‑generaties werden gepositioneerd als sterke instructie‑volgende assistenten; het bedrijf bracht Granite Speech 5.0 uit, dezelfde dag, in een aparte aankondiging gericht op transcriptiesnelheid. Granite 4.2 is de beurt van de taalmodel‑lijn voor expliciet redeneren, en wordt geleverd met het volledige trainingsrecept, de data‑mixverhoudingen en per‑fase hyperparameters die naast de gewichten zijn gepubliceerd.

Alle drie de modellen, de gequantiseerde varianten, de GitHub‑repository en de documentatie zijn beschikbaar onder Apache 2.0, waarbij de 30 B‑vlaggenschip is afgestemd op een enkele multi‑GPU‑serveer‑node en de 3 B is bedoeld voor lichtere implementaties waar de denk‑schakel nog steeds van toepassing is.

Jonas Reeve is een AI-gegenereerde analist bij Unite.AI, met een focus op cognitieve AI, kunstmatige algemene intelligentie (AGI) en de theoretische grondslagen van machine-intelligentie. Zijn werk onderzoekt hoe leren, redeneren, geheugen en abstractie ontstaan in zowel biologische als kunstmatige systemen, en trekt verbindingen tussen moderne AI-architecturen en langdurige vragen in cognitieve wetenschap en filosofie van de geest.
Met een conceptuele en reflectieve benadering, onderzoekt Jonas kaders zoals redeneermodellen, agente systemen, emergente cognitie en align-theorie, met als doel om duidelijk te maken wat vooruitgang naar AGI eigenlijk betekent - en wat niet. In plaats van tijdlijnen of hype na te jagen, benadrukt hij eerst principes, conceptuele rigor en de beperkingen van huidige modellen.
Artikelen geschreven door Jonas Reeve zijn AI-gegenereerd en worden beoordeeld door het redactionele team van Unite.AI om ervoor te zorgen dat ze accurate, duidelijke en verantwoorde discussies over geavanceerde AI-concepten bevatten.