AI-mallit ja alustat

IBM:n Granite 4.2 -mallit oppivat ajatella ja toimia ympäristöissä

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

IBM on julkaissut Granite 4.2:n, ensimmäisen tiiviin, pelkästään dekoodereita hyödyntävän päättelykielimalliperheensä, kolmessa koossa: 3B, 8B ja 30B parametria. Julkaistu 25. elokuuta 2026, ja painot on julkaistu Apache 2.0 -lisenssin alaisina, julkaisu antaa jokaiselle Granite-mallille vaihdettavan ajattelutilan ja ohjaa kaksi suurempaa kokoa vahvistusoppimisen kautta todellisissa ohjelmistokehitys-, terminaali- ja verkkohakympäristöissä.

Teknisessä rakenteen läpikäynnissä IBM:n Granite-tiimi kuvaa putkiston, joka alkaa alusta alkaen esikoulutuksella noin 15 triljoonan tokenin määrällä, viiden vaiheen aikataululla, joka laajentaa kontekstin ikkunan 512 K tokeniin. Valvottua hienosäätöä seuraa noin 7,2 miljoonaa ketjuajatus‑, päättely‑ ja agentti‑trajektoriadataa. Julkaisun painopiste on kuitenkin se, mitä seuraa: monivaiheinen vahvistusoppimisen putki, jossa jokainen vaihe on erillinen koulutuskierros, joka kohdistuu yhteen kykyyn ja käynnistyy edellisen vaiheen tarkistuspisteestä.

Kaikki kolme kokoa suorittavat perus‑RL‑koulutuksen tarkistettavilla palkkioilla — matematiikkatehtäviä, joilla on tarkistettavat vastaukset, koodia, joka arvioidaan piilotetuilla yksikkötesteillä, sekä ohjeiden noudattamista tarkistavilla formaattitarkistimilla — sekä lyhyet “booster”‑vaiheet erityistaitojen kehittämiseen. Vain 8B‑ ja 30B‑mallit jatkavat agenttivaiheeseen: kolmeen vaiheeseen, joissa malli toimii elävässä ympäristössä ja saa palkkion sen perusteella, onko tehtävä todella ratkaistu. Ohjelmistokehitysvaiheessa, jonka ohjaa OpenHands‑harjoitus, malli muokkaa todellisia tietovarastoja ja läpäisee vain, jos piilotettu testisarja onnistuu. Terminaalivaihe sijoittaa sen elävään komentotulkkiin, jossa on enintään 64 ympäristövuoroa per suoritus. Hakuvaihe saa sen vastaamaan monivaiheisiin kysymyksiin suorien verkkohakujen avulla, ja sen suoritus arvioi LLM‑tuomari.

Jokainen malli päättää sitten RLHF‑menetelmällä mieltymyksen ja turvallisuuden osalta, mikä myös lisää päättelyn pituusrangaistuksen, jotta aikaisempien vaiheiden tuottamat pitkät ketjut eivät hallitse.

Miten vaihdettava ajattelu näyttää käytännössä

Jokainen Granite 4.2 malli tarjoaa kolme toimintatilaa chat‑mallinsa kautta. Ajattelutila, oletus, tuottaa täyden ajatusketjun omistetuissa tageissa ennen lopullista vastausta. Ei‑ajattelutila vastaa suoraan. Vähäisen vaivan asetus sijoittuu näiden väliin ja käyttää lyhyen päättelyn budjetin helppoihin kysymyksiin. Monivuorovaikutteisissa keskusteluissa aiempien vuorojen ajatusketjut poistetaan oletuksena kontekstin säästämiseksi.

Alkuperäinen työkalukutsu on sisäänrakennettu samaan malliin: malli pohtii, mitä työkalua kutsua ja miksi ennen kutsun lähettämistä OpenAI‑funktionkutsumuodossa, jolloin se liitetään agenttiharness‑ratkaisuihin vLLM:n tai SGLangin kautta ilman erillisiä sovittimia. Granite 4.2 mallikokoelman mukaan kaikki kolme painoa ovat julkisesti ladattavissa, ja 30B‑mallikortti vahvistaa, että lippulaiva on jälkikoulutettu Granite 4.1 30B‑pohjasta. Mallit on testattu 12 kielessä, mukaan lukien englanti, saksa, japani, arabia, korea ja kiina.

IBM:n raportoimat luvut

IBM arvioi perhettä agenttinen koodaus, yleinen työkalukäyttö, päättely, chat ja pitkä konteksti -alueilla käyttäen NeMo Evaluator SDK:lle rakennetun kehyksen avulla. Alla olevat pisteet ovat yrityksen itse raportoimia lukuja.

  • SWE-Bench Vahvistettu: 57.00 (30B), 47.67 (8B)
  • Terminal-Bench 2.1: 29.24 (30B), 20.56 (8B)
  • AIME25 matematiikka: 89.17 (30B), 86.67 (8B), 78.33 (3B)
  • GPQA tiede: 66.41 (30B), 64.14 (8B), 54.80 (3B)
  • RULER pitkä konteksti 128K: 81.38 (30B), 71.41 (8B), 55.30 (3B)

Kaava vastaa koulutussuunnitelmaa. Pisteet nousevat tasaisesti koon kasvaessa matematiikassa, tieteessä ja koodipäättelyssä, ja agenttinen koodaus‑benchmarkit, jotka riippuvat 8B‑ ja 30B‑mallien eksklusiivisesta agentti‑RL‑lohkosta, näyttävät suurimman eron mallien välillä. 3B‑malli, joka ei suorita yhtään ympäristövaihetta, ei ole raportoitu SWE-Bench‑ tai Terminal-Bench‑sarjoissa lainkaan.

Agenttien koulutus ilman arvoverkkoa

RL‑mekanismi ansaitsee tarkemman tarkastelun, koska se on paikka, jossa suurin osa julkaisun tekniikasta sijaitsee. Jokainen vaihe kouluttaa asynkronisella GRPO:lla, ryhmä‑suhteellisella politiikan optimointimenetelmällä, joka arvioi jokaisen vastauksen keskimääräistä palkkiota muihin samalle kehotteelle otettuihin otoksiin verrattuna, poistaen monien RL‑putkien vaatiman erillisen arvoverkon. Generointi ja koulutus toimivat erillisissä GPU‑varannoissa, jotka eivät koskaan estä toisiaan: työntekijät näyttelevät trajektioita ja tallettavat ne jaettuun puskuriin, ja kouluttaja lähettää päivitetyt painot takaisin kesken suorituksen. Suojaraja estää generaattoreita poikkeamasta enemmän kuin yksi päivitys takaa, ja lyhennetty tärkeys‑näytteenotto rajoittaa vanhentuneiden tokenien vaikutusta.

Ympäristöt liitetään NeMo‑Gym:n kautta, joka tarjoaa tarkistajat, työkalut ja hiekkalaatikot yhtenäisen rajapinnan takana, kun taas NeMo‑RL ohjaa koulutusloopin Megatron‑Core‑alustalla vLLM‑generoinnin avulla. Käytännön seurauksena sääntöperusteinen matemaattinen tarkistaja ja täysi tietovaraston hiekkalaatikko näyttävät identtisiltä koulutusloopissa, mikä tekee vaiheistetusta opetussuunnitelmasta toteutettavissa olevan. IBM koulutti malleja NVIDIA GB200 NVL72 -klusterissa, jonka isännöi CoreWeave, 72‑GPU‑NVLink‑alueella ja 400 Gb/s InfiniBand‑verkolla.

IBM julkaisi myös perheen kvantisoituja variantteja: FP8 ilman kalibrointia, NVFP4 ja MXFP4, jotka on kalibroitu 2 000 otoksella SFT‑datasta, sekä neljätoista GGUF‑muotoa llama.cpp:n kautta vähämuistiseen käyttöönottoon.

Mihin Granite 4.2 sopii IBM:n linjaan

Julkaisu jatkaa harkittua työnjakoa IBM:n avoimen mallistrategian sisällä. Aikaisemmat Granite‑sukupolvet asetettiin vahvoiksi ohjeiden noudattamiseen suunnatuiksi avustajiksi; yritys esitteli samana päivänä Granite Speech 5.0:n, erillisessä ilmoituksessa keskittyen transkriptio­nopeuteen. Granite 4.2 on kielimallisarjan vuoro eksplisiittiseen päättelyyn, ja se saapuu täydellisen koulutusreseptin, data‑sekoituksen osuuksien ja perusvaiheiden hyperparametrien kanssa, jotka on julkaistu painojen ohella.

Kaikki kolme mallia, kvantisoidut variantit, GitHub‑tietovarasto ja dokumentaatio ovat saatavilla Apache 2.0 -lisenssin alaisina, 30B‑lippulaiva on mitoitettu yhdelle monen‑GPU:n palvelusolmulle ja 3B‑malli on suunnattu kevyempiin käyttöönottoihin, joissa ajattelukytkin on edelleen voimassa.

Jonas Reeve on tekoälyanalyytikko Unite.AI:ssa, joka keskittyy kognitiiviseen tekoälyyn, tekoälyyn ja tekoälyjärjestelmien teoreettisiin perusteisiin. Hänen työnsä tutkii, miten oppiminen, päättely, muisti ja abstraktio ilmenevät sekä biologisissa että tekoälyjärjestelmissä, ja piirtää yhteyksiä modernien tekoälyarkkitehtuureiden ja kognitiivisen tieteen ja mielen filosofian pitkäaikaisiin kysymyksiin.
Konseptuaalisella ja refleksiivisellä lähestymistavalla Jonas tutkii kehyksiä, kuten päättelymalleja, agenteja, emergenttiä kognitiota ja suuntautumisteoriaa, pyrkien selventämään, mitä edistystä tekoälyssä tarkalleen ottaen tarkoittaa - ja mitä se ei tarkoita. Sen sijaan, että hän ajaisi aikatauluja tai hypeä, hän korostaa ensisijaisia periaatteita, konseptuaalista tarkkuutta ja nykyisten mallien rajoja.
Jonas Reeven kirjoittamat artikkelit ovat tekoälygeneroituja ja Unite.AI:n toimituksen tarkastamia, jotta varmistetaan ettei artikkeleissa käsitellä tekoälykonsepteja epätarkasti tai vastuuttomasti.