Modely a platformy AI

Modely IBM Granite 4.2 se učí myslet a jednat v prostředích

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

IBM vydala Granite 4.2, svou první rodinu hustých jazykových modelů pro uvažování založených pouze na dekodéru, ve třech velikostech: 3B, 8B a 30B parametrů. Oznámena 25. srpna 2026 s váhami publikovanými pod licencí Apache 2.0, tato verze poskytuje každému modelu Granite přepínatelný režim myšlení a dva větší modely podrobuje posilovacímu učení v reálných prostředích softwarového vývoje, terminálu a webového vyhledávání.

V technickém průvodci stavbou tým Granite v IBM popisuje pipeline, který začíná tréninkem od nuly na přibližně 15 bilionu tokenů, s pětifázovým plánem, jenž rozšiřuje okno kontextu na 512K tokenů. Následuje řízené doladění na zhruba 7,2 milionu vzorků řetězců myšlenek, uvažování a dat agenturních trajektorií. Středem pozornosti vydání je však to, co následuje: vícefázový pipeline posilovaného učení, kde každá fáze je samostatný trénink zaměřený na jednu schopnost, zahřátý z kontrolního bodu předchozí fáze.

Všechny tři velikosti provádějí základní RL na ověřitelných odměnách – matematické úlohy s kontrolovatelnými odpověďmi, kód hodnocený skrytými jednotkovými testy, úkoly následující instrukcím s kontroléry formátu – plus krátké „booster“ fáze pro konkrétní dovednosti. Pouze modely 8B a 30B pokračují do agenturního bloku: tři fáze, ve kterých model jedná v živém prostředí a je odměňován podle toho, zda byl úkol skutečně vyřešen. Ve fázi softwarového inženýrství, řízené harnessem OpenHands, model upravuje skutečná repozitáře a projde pouze pokud skrytý testovací soubor projde. Terminálová fáze ho vloží do živého shellu s až 64 tahy prostředí na jeden rollout. Vyhledávací fáze ho nechá odpovídat na víceúrovňové otázky prostřednictvím živých webových vyhledávacích volání, hodnocených LLM soudcem.

Každý model poté končí RLHF pro preference a bezpečnost, což také aplikuje penalizaci délky uvažování, aby odradilo od rozvláčných řetězců, které mohou dřívější fáze generovat.

Jak v praxi vypadá přepínatelné myšlení

Každý model Granite 4.2 nabízí tři provozní režimy prostřednictvím své chatové šablony. Režim myšlení, výchozí, vytváří úplný řetězec myšlenek v dedikovaných značkách před finální odpovědí. Režim bez myšlení odpovídá přímo. Nízká režimová úroveň leží mezi nimi a věnuje krátký rozpočet uvažování snadným otázkám. V konverzacích s více tahy je myšlení předchozích tahů ve výchozím nastavení odstraněno, aby se šetřil kontext.

Volání nativních nástrojů je zabudováno ve stejné šabloně: model uvažuje, který nástroj zavolat a proč, před tím než vygeneruje volání, ve formátu OpenAI function-calling, takže se snadno integruje do agenturních harnessů provozovaných přes vLLM nebo SGLang bez dalších adaptérů. Podle sbírky modelů Granite 4.2 jsou všechny tři váhy veřejně ke stažení a karta modelu 30B potvrzuje, že vlajková loď byla po-trénována z báze Granite 4.1 30B. Modely jsou testovány ve 12 jazycích, včetně angličtiny, němčiny, japonštiny, arabštiny, korejštiny a čínštiny.

Čísla, která IBM hlásí

IBM vyhodnotila rodinu v oblastech agenturního kódování, obecného používání nástrojů, uvažování, chatu a dlouhého kontextu, pomocí rámce postaveného na NeMo Evaluator SDK. Níže uvedené skóre jsou vlastními údaji společnosti.

  • SWE-Bench Verified: 57.00 (30B), 47.67 (8B)
  • Terminal-Bench 2.1: 29.24 (30B), 20.56 (8B)
  • AIME25 math: 89.17 (30B), 86.67 (8B), 78.33 (3B)
  • GPQA science: 66.41 (30B), 64.14 (8B), 54.80 (3B)
  • RULER long context at 128K: 81.38 (30B), 71.41 (8B), 55.30 (3B)

Vzor odpovídá návrhu tréninku. Skóre rostou konzistentně s velikostí u matematiky, vědy i kódového uvažování a benchmarky agenturního kódování, které závisí na exkluzivním agenturním RL bloku modelů 8B a 30B, vykazují největší rozdíl mezi velikostmi. Model 3B, který neprochází žádnými fázemi prostředí, není vůbec uveden v souborech SWE-Bench ani Terminal-Bench.

Trénování agentů bez hodnotové sítě

Mechanika RL si zaslouží bližší pohled, protože právě zde leží většina inženýrské práce vydání. Každá fáze trénuje asynchronní GRPO, metodu group-relative policy optimization, která hodnotí každou odpověď oproti průměrné odměně ostatních vzorků pro stejný prompt, čímž eliminuje potřebu samostatné hodnotové sítě, kterou vyžadují mnohé RL pipeline. Generování a trénink běží na oddělených GPU fondech, které se neblokují: pracovníci neustále sbírají trajektorie do sdíleného bufferu a trainer během rolloutu streamuje aktualizované váhy. Ochranný mechanismus zabraňuje generátorům, aby se odklonily o více než jednu aktualizaci, a zkrácené importance sampling omezuje vliv zastaralých tokenů.

Prostředí jsou připojena přes NeMo-Gym, který za jednotné rozhraní poskytuje ověřovatele, nástroje a sandboxy, zatímco NeMo-RL řídí tréninkovou smyčku na Megatron-Core s generováním přes vLLM. Praktickým důsledkem je, že pravidlový kontrolor matematiky a plný sandbox repozitáře vypadají pro tréninkovou smyčku identicky, což umožňuje realizaci fázovaného kurikula. IBM trénovala modely na clusteru NVIDIA GB200 NVL72 hostovaném CoreWeave, s 72‑GPU NVLink doménou a 400 Gb/s InfiniBand fabric.

IBM také vydala kvantované varianty rodiny: FP8 bez kalibrace, NVFP4 a MXFP4 kalibrované na 2 000 vzorcích ze SFT datasetu a čtrnáct formátů GGUF přes llama.cpp pro nasazení s omezenou pamětí.

Kde Granite 4.2 zapadá do řady IBM

Vydání pokračuje v úmyslném rozdělení úkolů v otevřené modelové strategii IBM. Dřívější generace Granite byly prezentovány jako silní asistenti pro plnění instrukcí; společnost představila Granite Speech 5.0, vydaný ve stejný den, v samostatném oznámení zaměřeném na rychlost transkripce. Granite 4.2 je řada jazykových modelů zaměřená na explicitní uvažování a přichází s kompletním tréninkovým receptem, poměry datových směsí a hyperparametry pro každou fázi publikovanými spolu s vahami.

Všechny tři modely, kvantované varianty, GitHub repozitář a dokumentace jsou k dispozici pod licencí Apache 2.0, přičemž vlajková loď 30B je dimenzována pro jeden multi‑GPU servisní uzel a 3B je určen pro lehčí nasazení, kde se stále uplatňuje přepínací myšlenkový režim.

Jonas Reeve je analytikum generovaným pomocí AI ve společnosti Unite.AI, zaměřujícím se na kognitivní AI, umělou obecnou inteligenci (AGI) a teoretické základy strojového učení. Jeho práce zkoumá, jak se učí, reasoning, paměť a abstrakce objevují v biologických i umělých systémech, a to tím, že spojuje moderní architektury AI s dlouholetými otázkami kognitivní vědy a filozofie mysli.
S konceptuálním a reflexivním přístupem Jonas zkoumá rámce, jako jsou modely uvažování, agentic systémy, emergentní kognice a teorie sladění, s cílem objasnit, co skutečně znamená pokrok směrem k AGI - a co ne. Místo toho, aby sledoval termíny nebo hype, zdůrazňuje první principy, konceptuální rigor a limity současných modelů.
Články napsané Jonasem Reeveem jsou generovány pomocí AI a recenzovány redakčním týmem Unite.AI, aby zajistily přesnost, jasnost a odpovědnou diskusi o pokročilých konceptech AI.