AI-modeller og plattformer

IBMs Granite 4.2-modeller lærer å tenke og handle i miljøer

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

IBM har lansert Granite 4.2, sin første familie av tette, kun‑dekoder‑baserte resonneringsspråkmodeller, i tre størrelser: 3B, 8B, og 30B parameters. Kunngjort 25. august 2026 med vekter publisert under Apache 2.0‑lisensen, gir utgivelsen hver Granite-modell en byttbar tenkemodus og sender de to større størrelsene gjennom forsterkningslæring i ekte programvare‑utviklings‑, terminal‑ og web‑søkemiljøer.

I en teknisk gjennomgang av byggingen beskriver Granite‑teamet hos IBM en pipeline som starter med forhåndstrening fra bunnen av på omtrent 15 trillioner token, med en fem‑fasers tidsplan som utvider kontekstvinduet til 512K token. Veiledet finjustering følger på rundt 7.2 millioner prøver av tankekjede, resonnering og agent‑trajektordata. Utgivelsens hovedvekt ligger imidlertid på det som kommer etter: en fler‑trinns forsterkningslærings‑pipeline der hvert trinn er en egen treningskjøring som retter seg mot én evne, oppvarmet fra forrige trinns sjekkpunkt.

Alle tre størrelsene kjører grunnleggende RL på verifiserbare belønninger — matematiske problemer med kontrollerbare svar, kode vurdert av skjulte enhetstester, oppgaver som følger instruksjoner med formatkontroller — samt korte “booster”‑trinn for spesifikke ferdigheter. Kun 8B‑ og 30B‑modellene fortsetter inn i den agent‑baserte blokken: tre trinn der modellen handler i et levende miljø og belønnes basert på om oppgaven faktisk ble løst. I programvare‑utviklingstrinnet, drevet av OpenHands‑rammeverket, redigerer modellen ekte repositorier og godkjennes kun hvis den skjulte testpakken består. Terminal‑trinnet plasserer den i et levende skall med opptil 64 miljø‑omganger per rulling. Søk‑trinnet får den til å besvare flerstegs‑spørsmål via levende nettsøk‑kall, vurdert av en LLM‑dommer.

Hver modell avslutter deretter med RLHF for preferanse og sikkerhet, som også pålegger en straff for resonneringslengde for å dempe de omstendelige kjedene som tidlige trinn kan generere.

Hvordan byttbar tenkning ser ut i praksis

Hver Granite 4.2‑modell gir tilgang til tre driftsmoduser via sin chat‑mal. Tenke‑modus, som er standard, produserer en full tankekjede i dedikerte tagger før det endelige svaret. Ikke‑tenke‑modus svarer direkte. En lav‑innsats‑innstilling ligger mellom de to, og bruker et kort resonneringsbudsjett på enkle spørsmål. I samtaler med flere omganger fjernes standardmessig tenkingen fra tidligere omganger for å spare kontekst.

Innfødt verktøykalling er integrert i samme mal: modellen resonnerer om hvilket verktøy som skal kalles og hvorfor før den sender kallet, i OpenAI‑funksjonskall‑formatet, slik at den kan kobles inn i agent‑rammer som leveres via vLLM eller SGLang uten ekstra adaptere. I følge Granite 4.2‑modellsamlingen er alle tre vektene offentlig nedlastbare, og 30B‑modellkortet bekrefter at flaggskipet ble ettertrenet fra Granite 4.1 30B‑basen. Modellene er testet på 12 språk, inkludert engelsk, tysk, japansk, arabisk, koreansk og kinesisk.

Tallene IBM rapporterer

IBM evaluerte familien på agent‑basert koding, generell verktøybruk, resonnering, chat og langt kontekst, ved hjelp av et rammeverk bygget på NeMo Evaluator SDK. Tallene nedenfor er selskapets egne rapporterte tall.

  • SWE-Bench Verifisert: 57.00 (30B), 47.67 (8B)
  • Terminal-Bench 2.1: 29.24 (30B), 20.56 (8B)
  • AIME25 matematikk: 89.17 (30B), 86.67 (8B), 78.33 (3B)
  • GPQA vitenskap: 66.41 (30B), 64.14 (8B), 54.80 (3B)
  • RULER langt kontekst ved 128K: 81.38 (30B), 71.41 (8B), 55.30 (3B)

Mønsteret samsvarer med treningsdesignet. Poengene øker jevnt med størrelse innen matematikk, vitenskap og kode‑resonnering, og de agent‑baserte kode‑benchmarkene som avhenger av 8B‑ og 30B‑modellenes eksklusive agent‑RL‑blokk viser den største avstanden mellom størrelsene. 3B‑modellen, som ikke gjennomfører noen av miljø‑trinnene, er ikke rapportert i SWE‑Bench‑ eller Terminal‑Bench‑suiteene.

Trening av agenter uten et verdinettverk

RL‑maskineriet er verdt en nærmere titt fordi det er der mesteparten av utgivelsens ingeniørarbeid ligger. Hvert trinn trener med asynkron GRPO, en gruppe‑relativ policy‑optimaliseringsmetode som vurderer hvert svar mot gjennomsnittlig belønning fra de andre prøvene hentet for samme prompt, og eliminerer det separate verdinettverket som mange RL‑pipelines krever. Generering og trening kjører på separate GPU‑puljer som aldri blokkerer hverandre: arbeidere fortsetter å samle inn trajektorier i en delt buffer, og treneren strømmer oppdaterte vekter tilbake midt i rullingen. En sikkerhetsmekanisme hindrer generatorer fra å drifte mer enn én oppdatering bak, og forkortet viktighets‑sampling begrenser virkningen av utdaterte token.

Miljøene kobles til via NeMo‑Gym, som presenterer verifikatorer, verktøy og sandkasser bak et enhetlig grensesnitt, mens NeMo‑RL driver treningsløkken på Megatron‑Core med vLLM‑generering. Den praktiske konsekvensen er at en regel‑basert matematikk‑kontroller og en full repositoriums‑sandkasse ser identisk ut for treningsløkken, noe som gjør den trinnvise læreplanen gjennomførbar. IBM trente modellene på en NVIDIA GB200 NVL72‑klynge hostet av CoreWeave, med et 72‑GPU‑NVLink‑domene og 400 Gb/s InfiniBand‑nettverk.

IBM leverte også kvantiserte varianter av familien: FP8 uten kalibrering, NVFP4 og MXFP4 kalibrert på 2,000 prøver fra SFT‑datasettet, samt fjorten GGUF‑formater via llama.cpp for minne‑redusert distribusjon.

Hvor Granite 4.2 passer inn i IBMs produktlinje

Utgivelsen fortsetter en bevisst arbeidsfordeling i IBMs åpne modellstrategi. Tidligere Granite‑generasjoner ble posisjonert som sterke instruksjons‑følgende assistenter; selskapet dekket Granite Speech 5.0, som ble lansert samme dag, i en egen kunngjøring med fokus på transkripsjonshastighet. Granite 4.2 er språkmodell‑linjens tur til eksplisitt resonnering, og den kommer med full treningsoppskrift, data‑blandings‑proporsjoner og per‑trinn hyperparametere publisert sammen med vektene.

Alle tre modeller, de kvantiserte variantene, GitHub‑depotet og dokumentasjonen er tilgjengelige under Apache 2.0, med 30B‑flagship‑modellen dimensjonert for en enkelt multi‑GPU‑tjenestenode og 3B‑modellen rettet mot lettere distribusjoner hvor tenke‑bryteren fortsatt gjelder.

Jonas Reeve er en AI-generert analytiker hos Unite.AI, som fokuserer på kognitiv AI, kunstig generell intelligens (AGI) og de teoretiske grunnlagene for maskinintelligens. Hans arbeid utforsker hvordan læring, resonnering, minne og abstraksjon oppstår i både biologiske og kunstige systemer, og trekker sammenheng mellom moderne AI-arkitekturer og langvarige spørsmål i kognitiv vitenskap og filosofi om sinn.

Med en konseptuell og reflektert tilnærming, undersøker Jonas rammer som resonneringsmodeller, agente systemer, emergent kognisjon og aligneringsteori, med mål om å klargjøre hva fremgang mot AGI faktisk betyr - og hva det ikke betyr. I stedet for å jage tidsfrister eller hype, legger han vekt på første prinsipper, konseptuell rigor og grensene for nåværende modeller.

Artikler skrevet av Jonas Reeve er AI-generert og gjennomgått av Unite.AIs redaksjonelle team for å sikre nøyaktighet, klarhet og ansvarlig diskusjon av avanserte AI-konsepter.