Modele și platforme AI
Modelele Granite 4.2 ale IBM învață să gândească și să acționeze în medii

IBM a lansat Granite 4.2, prima sa familie de modele de limbaj dense, cu decodor unic pentru raționament, în trei dimensiuni: 3B, 8B și 30B de parametri. Anunțat pe 25 august 2026, cu greutăți publicate sub licența Apache 2.0, lansarea oferă fiecărui model Granite un mod de gândire comutabil și supune cele două dimensiuni mai mari la învățare prin consolidare în medii reale de inginerie software, terminal și căutare pe web.
Într-un ghid tehnic al construcției, echipa Granite de la IBM descrie un flux de lucru care începe cu pre‑antrenarea de la zero pe aproximativ 15 trilioane de tokeni, cu un program în cinci faze care extinde fereastra de context la 512K de tokeni. Apoi urmează fine‑tuning supravegheat pe circa 7,2 milioane de mostre de date de tip lanț de gândire, raționament și traiectorii agențiale. Centrul de greutate al lansării, totuși, este ceea ce urmează: un pipeline de învățare prin consolidare în mai multe etape, în care fiecare etapă este o rulare de antrenament separată, vizând o capacitate, pornind de la punctul de control al etapei anterioare.
Toate cele trei dimensiuni rulează RL de bază pe recompense verificabile — probleme de matematică cu răspunsuri verificabile, cod evaluat prin teste unitare ascunse, sarcini de urmărire a instrucțiunilor cu verificatori de format — plus etape scurte de „booster” pentru abilități specifice. Doar modelele de 8B și 30B continuă în blocul agențial: trei etape în care modelul acționează într-un mediu live și este recompensat în funcție de rezolvarea efectivă a sarcinii. În etapa de inginerie software, condusă de harness‑ul OpenHands, modelul editează depozite reale și trece doar dacă suita de teste ascunsă este trecută. Etapa de terminal îl plasează într-un shell live cu până la 64 de ture de mediu per rulare. Etapa de căutare îl face să răspundă la întrebări în lanț prin apeluri de căutare web în timp real, evaluate de un judecător LLM.
Fiecare model se încheie apoi cu RLHF pentru preferință și siguranță, care aplică și o penalizare a lungimii raționamentului pentru a descuraja lanțurile verbose pe care le pot genera etapele anterioare.
Cum arată gândirea comutabilă în practică
Fiecare model Granite 4.2 expune trei moduri de operare prin șablonul său de chat. Modul de gândire, implicit, generează un lanț complet de gândire în interiorul unor etichete dedicate înainte de răspunsul final. Modul non‑gândire răspunde direct. O setare cu efort redus se situează între cele două, alocând un buget scurt de raționament pentru întrebări ușoare. În conversațiile cu mai multe ture, gândirea tururilor anterioare este eliminată implicit pentru a conserva contextul.
Apelarea nativă a instrumentelor este integrată în același șablon: modelul raționează despre ce instrument să apeleze și de ce înainte de a emite apelul, în formatul de apelare a funcțiilor OpenAI, astfel încât să se integreze în harness‑urile agențiale furnizate prin vLLM sau SGLang fără adaptoare suplimentare. Conform colecției de modele Granite 4.2, toate cele trei greutăți pot fi descărcate public, iar fișa modelului de 30B confirmă că flagship‑ul a fost post‑antrenat de la baza Granite 4.1 de 30B. Modelele au fost testate în 12 limbi, inclusiv engleză, germană, japoneză, arabă, coreeană și chineză.
Cifrele raportate de IBM
IBM a evaluat familia în domeniile codare agențială, utilizare generală a instrumentelor, raționament, chat și context lung, utilizând un cadru construit pe NeMo Evaluator SDK. Scorurile de mai jos sunt cifrele raportate de companie.
- SWE-Bench Verificat: 57.00 (30B), 47.67 (8B)
- Terminal-Bench 2.1: 29.24 (30B), 20.56 (8B)
- AIME25 matematică: 89.17 (30B), 86.67 (8B), 78.33 (3B)
- GPQA știință: 66.41 (30B), 64.14 (8B), 54.80 (3B)
- RULER context lung la 128K: 81.38 (30B), 71.41 (8B), 55.30 (3B)
Modelul se potrivește cu designul de antrenament. Scorurile cresc constant odată cu dimensiunea, în matematică, știință și raționament de cod, iar benchmark‑urile de codare agențială care depind de blocul exclusiv agentic‑RL al modelelor de 8B și 30B arată cea mai mare diferență între dimensiuni. Modelul de 3B, care nu rulează nicio etapă de mediu, nu este raportat în suitele SWE‑Bench sau Terminal‑Bench.
Antrenarea agenților fără o rețea de valori
Mecanismul RL merită o analiză mai detaliată, deoarece acolo se află cea mai mare parte a ingineriei lansării. Fiecare etapă se antrenează cu GRPO asincron, o metodă de optimizare a politicii relative grupului care evaluează fiecare răspuns în raport cu recompensa medie a celorlalte mostre generate pentru același prompt, eliminând nevoia de o rețea de valori separată pe care multe pipeline‑uri RL o cer. Generarea și antrenamentul rulează pe grupuri de GPU separate care nu se blochează reciproc: lucrătorii continuă să eșantioneze traiectorii într-un buffer comun, iar antrenorul transmite greutăți actualizate în timpul rulării. Un sistem de protecție împiedică generatorii să devieze cu mai mult de o actualizare în urmă, iar eșantionarea de importanță trunchiată limitează efectul token‑urilor învechite.
Mediile se conectează prin NeMo-Gym, care expune verificatori, instrumente și sandbox‑uri printr-o interfață uniformă, în timp ce NeMo-RL conduce bucla de antrenament pe Megatron-Core cu generare vLLM. Consecința practică este că un verificator de matematică bazat pe reguli și un sandbox complet de depozit arată identic în bucla de antrenament, ceea ce face ca curriculum‑ul etapizat să fie fezabil. IBM a antrenat modelele pe un cluster NVIDIA GB200 NVL72 găzduit de CoreWeave, cu un domeniu NVLink de 72 de GPU și o rețea InfiniBand de 400 Gb/s.
IBM a livrat, de asemenea, variante cuantizate ale familiei: FP8 fără calibrare, NVFP4 și MXFP4 calibrate pe 2.000 de mostre din setul de date SFT și paisprezece formate GGUF prin llama.cpp pentru implementări cu memorie redusă.
Unde se încadrează Granite 4.2 în portofoliul IBM
Lansarea continuă o diviziune deliberată a muncii în strategia de modele deschise a IBM. Generațiile anterioare Granite erau poziționate ca asistenți puternici în urmarea instrucțiunilor; compania a acoperit Granite Speech 5.0, lansat în aceeași zi, într-o anunțare separată concentrată pe viteza de transcriere. Granite 4.2 reprezintă momentul liniei de modele de limbaj pentru raționament explicit și vine cu rețeta completă de antrenament, proporțiile amestecului de date și hiperparametrii per‑etapă publicați alături de greutăți.
Toate cele trei modele, variantele cuantizate, depozitul GitHub și documentația sunt disponibile sub licența Apache 2.0, modelul flagship de 30B fiind dimensionat pentru un singur nod de servire multi‑GPU, iar cel de 3B vizat pentru implementări mai ușoare în care comutatorul de gândire este încă aplicabil.












