Моделі та платформи ШІ
Моделі Granite 4.2 компанії IBM навчаються мислити та діяти у середовищах

IBM випустила Granite 4.2, свою першу сімейство щільних, лише‑декодерних мовних моделей для розумової обробки, у трьох розмірах: 3B, 8B і 30B параметрів. Оголошено 25 серпня 2026 р., ваги опубліковано під ліцензією Apache 2.0, випуск додає кожній моделі Granite перемикаємий режим мислення та піддає два більші розміри підкріплювальному навчанню у реальних середовищах розробки програмного забезпечення, терміналу та веб‑пошуку.
У технічному огляді збірки команда Granite в IBM описує конвеєр, який починається з передтренування з нуля на приблизно 15 трильйонах токенів, з п’ятиетапним графіком, що розширює вікно контексту до 512K токенів. Далі слідує контрольоване донастроювання на близько 7,2 мільйонах зразків даних «ланцюжок мислення», розумової обробки та агентних траєкторій. Однак головна увага випуску зосереджена на тому, що йде після: багатоступеневий конвеєр підкріплювального навчання, у якому кожен етап — окремий запуск тренування, спрямований на одну можливість, і розпочинається з контрольної точки попереднього етапу.
Усі три розміри виконують базове підкріплювальне навчання на перевірних винагородах — математичні задачі з контрольованими відповідями, код, оцінений прихованими юніт‑тестами, завдання, що вимагають слідування інструкціям, з перевіркою формату — плюс короткі «booster»‑етапи для конкретних навичок. Тільки моделі 8B і 30B продовжують у агентному блоці: три етапи, під час яких модель діє у живому середовищі і отримує винагороду, якщо завдання дійсно розв’язано. На етапі програмної інженерії, керованому OpenHands, модель редагує реальні репозиторії і проходить лише при успішному проходженні прихованого набору тестів. На етапі терміналу її занурюють у живу оболонку з до 64 ходів середовища за один rollout. На етапі пошуку вона відповідає на багатокрокові питання через живі веб‑пошукові запити, оцінювані суддею‑LLM.
Кожна модель завершує навчання RLHF для уподобань і безпеки, що також накладає штраф за довжину розумової ланцюжка, щоб не допускати надмірно довгих ланцюжків, які можуть виникнути на ранніх етапах.
Як виглядає перемикаєме мислення на практиці
Кожна модель Granite 4.2 пропонує три режими роботи через шаблон чату. Режим мислення, який є типовим, генерує повний ланцюжок думок у спеціальних тегах перед остаточною відповіддю. Режим без мислення відповідає безпосередньо. Низько‑витратний режим розташовується між ними, витрачаючи короткий бюджет розумової обробки на прості питання. У багатократних діалогах мислення попередніх ходів за замовчуванням видаляється, щоб зберегти контекст.
Вбудований виклик інструментів включений у той самий шаблон: модель розмірковує, який інструмент викликати і чому, перед тим як випромінює виклик у форматі OpenAI function‑calling, тому вона легко інтегрується в агентні оболонки, що працюють через vLLM або SGLang, без додаткових адаптерів. За даними колекції моделей Granite 4.2, всі три ваги доступні для публічного завантаження, а карта моделі 30B підтверджує, що флагман був додатково навчений на базі Granite 4.1 30B. Моделі протестовані за 12 мовами, включаючи англійську, німецьку, японську, арабську, корейську та китайську.
Числа, які повідомляє IBM
IBM оцінила сімейство за показниками агентного кодування, загального використання інструментів, розумової обробки, чату та довгого контексту, використовуючи фреймворк, побудований на NeMo Evaluator SDK. Нижче наведено власні цифри компанії.
- SWE-Bench Verified: 57.00 (30B), 47.67 (8B)
- Terminal-Bench 2.1: 29.24 (30B), 20.56 (8B)
- AIME25 math: 89.17 (30B), 86.67 (8B), 78.33 (3B)
- GPQA science: 66.41 (30B), 64.14 (8B), 54.80 (3B)
- RULER long context at 128K: 81.38 (30B), 71.41 (8B), 55.30 (3B)
Така закономірність відповідає дизайну навчання. Оцінки стабільно зростають зі збільшенням розміру моделі у математиці, науці та кодовій розумовій обробці, а агентні кодувальні бенчмарки, що залежать від ексклюзивного агентного RL‑блоку моделей 8B і 30B, демонструють найширший розрив між розмірами. Модель 3B, яка не проходить жодного етапу середовища, взагалі не представлена у результатах SWE‑Bench та Terminal‑Bench.
Навчання агентів без мережі цінностей
Механізм RL заслуговує детальнішого розгляду, бо саме тут зосереджено більшу частину інженерної роботи випуску. Кожен етап навчається асинхронним GRPO — групово‑відносним оптимізатором політик, який оцінює кожну відповідь щодо середньої винагороди інших зразків, згенерованих для того ж запиту, усуваючи потребу у окремій мережі цінностей, яку вимагають багато RL‑конвеєрів. Генерація та навчання працюють на різних GPU‑пулах, які не блокують один одного: працівники безперервно збирають траєкторії у спільний буфер, а тренер транслює оновлені ваги під час rollout‑у. Захисний механізм не допускає, щоб генератори відставали більш ніж на одне оновлення, а скорочене важливісне вибіркове оцінювання обмежує вплив застарілих токенів.
Середовища підключаються через NeMo‑Gym, який уніфіковано надає верифікатори, інструменти та пісочниці, тоді як NeMo‑RL керує навчальним циклом на Megatron‑Core з генерацією через vLLM. Практичний результат — правило‑базований математичний чекер і повноцінна пісочниця репозиторію виглядають ідентично для навчального циклу, що робить можливим багатоступеневу навчальну програму. IBM тренувала моделі на кластері NVIDIA GB200 NVL72, розміщеному в CoreWeave, з 72‑GPU NVLink‑доменною мережею та 400 Gb/s InfiniBand‑фабрикою.
IBM також випустила квантизовані варіанти сімейства: FP8 без калібрування, NVFP4 і MXFP4, калібровані на 2 000 зразках з набору даних SFT, а також чотирнадцять форматів GGUF через llama.cpp для розгортання з обмеженою пам’яттю.
Де Granite 4.2 вписується у лінійку IBM
Випуск продовжує свідоме розподілення ролей у відкритій стратегії моделей IBM. Попередні покоління Granite позиціонувалися як потужні асистенти, орієнтовані на слідування інструкціям; компанія також представила Granite Speech 5.0, випущений того ж дня, у окремому анонсі, зосередженому на швидкості транскрипції. Granite 4.2 — це черга мовної моделі, орієнтованої на явне розумове обґрунтування, і вона постачається разом з повним рецептом навчання, пропорціями міксу даних та гіперпараметрами кожного етапу, опублікованими поряд з вагами.
Усі три моделі, квантизовані варіанти, репозиторій GitHub та документація доступні під ліцензією Apache 2.0, при цьому флагман 30B розрахований на один мульти‑GPU сервер, а 3B орієнтований на легші розгортання, де перемикач мислення все ще застосовується.












