Modele i platformy AI
Modele Granite 4.2 firmy IBM uczą się myśleć i działać w środowiskach

IBM wydało Granite 4.2, swoją pierwszą rodzinę gęstych modeli językowych do rozumowania opartych wyłącznie na dekoderze, w trzech rozmiarach: 3 B, 8 B i 30 B parametrów. Ogłoszone 25 sierpnia 2026 roku, a wagi udostępniono na licencji Apache 2.0, wydanie wprowadza w każdym modelu Granite tryb przełączalnego myślenia oraz poddaje dwa większe rozmiary uczeniu ze wzmocnieniem w rzeczywistych środowiskach programistycznych, terminalowych i wyszukiwania w sieci.
W technicznym przewodniku po budowie, zespół Granite w IBM opisuje pipeline, który rozpoczyna się od pre‑treningu od podstaw na około 15 bilionach tokenów, z pięcioetapowym harmonogramem rozszerzającym okno kontekstu do 512 K tokenów. Następnie przeprowadzany jest nadzorowany fine‑tuning na około 7,2 mln próbek danych typu chain‑of‑thought, rozumowanie i trajektorie agentowe. Głównym punktem wydania jest jednak to, co następuje po: wieloetapowy pipeline uczenia ze wzmocnieniem, w którym każdy etap to osobny trening skierowany na jedną zdolność, rozpoczynający się od punktu kontrolnego poprzedniego etapu.
Wszystkie trzy rozmiary wykonują podstawowe RL na weryfikowalnych nagrodach — zadania matematyczne z sprawdzalnymi odpowiedziami, kod oceniany przez ukryte testy jednostkowe, zadania polegające na wykonywaniu instrukcji z kontrolerami formatu — oraz krótkie etapy „booster” dla konkretnych umiejętności. Tylko modele 8 B i 30 B przechodzą do bloku agentowego: trzy etapy, w których model działa w rzeczywistym środowisku i otrzymuje nagrodę w zależności od tego, czy zadanie zostało faktycznie rozwiązane. W etapie inżynierii oprogramowania, napędzanym przez harness OpenHands, model edytuje rzeczywiste repozytoria i przechodzi jedynie, jeśli ukryty zestaw testów przejdzie pomyślnie. Etap terminalowy umieszcza go w żywym powłoce z maksymalnie 64 turami środowiska na rollout. Etap wyszukiwania zmusza go do odpowiadania na pytania wieloetapowe poprzez żywe zapytania web‑search, oceniane przez sędziego LLM.
Każdy model kończy się następnie RLHF pod kątem preferencji i bezpieczeństwa, które dodatkowo nakłada karę za długość rozumowania, aby zniechęcić do rozwlekłych łańcuchów, które mogą powstać w wcześniejszych etapach.
Jak wygląda przełączalne myślenie w praktyce
Każdy model Granite 4.2 udostępnia trzy tryby działania poprzez szablon czatu. Tryb myślenia, domyślny, generuje pełny łańcuch myśli wewnątrz dedykowanych znaczników przed ostateczną odpowiedzią. Tryb bez myślenia odpowiada bezpośrednio. Ustawienie niskiego nakładu pracy leży pomiędzy nimi, poświęcając krótki budżet rozumowania na proste pytania. W rozmowach wieloturnowych myślenie z poprzednich tur jest domyślnie usuwane, aby oszczędzać kontekst.
Natywne wywoływanie narzędzi jest wbudowane w ten sam szablon: model rozważa, które narzędzie wywołać i dlaczego, zanim wyemituje wywołanie, w formacie wywołań funkcji OpenAI, dzięki czemu można je podłączyć do harnessów agentowych obsługiwanych przez vLLM lub SGLang bez dodatkowych adapterów. Zgodnie z kolekcją modeli Granite 4.2, wszystkie trzy wagi są publicznie dostępne do pobrania, a karta modelu 30B potwierdza, że flagowiec został dodatkowo wytrenowany na bazie Granite 4.1 30 B. Modele zostały przetestowane w 12 językach, w tym po angielsku, niemiecku, japońsku, arabsku, koreańsku i chińsku.
Liczby podane przez IBM
IBM oceniło rodzinę pod kątem kodowania agentowego, ogólnego użycia narzędzi, rozumowania, czatu i długiego kontekstu, korzystając z ramy opartej na NeMo Evaluator SDK. Poniższe wyniki to własne dane podane przez firmę.
- SWE-Bench zweryfikowany: 57.00 (30B), 47.67 (8B)
- Terminal-Bench 2.1: 29.24 (30B), 20.56 (8B)
- AIME25 matematyka: 89.17 (30B), 86.67 (8B), 78.33 (3B)
- GPQA nauka: 66.41 (30B), 64.14 (8B), 54.80 (3B)
- RULER długi kontekst przy 128K: 81.38 (30B), 71.41 (8B), 55.30 (3B)
Wzorzec odpowiada projektowi treningowemu. Wyniki rosną konsekwentnie wraz z rozmiarem w dziedzinach matematyki, nauki i rozumowania kodu, a benchmarki kodowania agentowego, zależne od wyłącznego bloku agentowego RL modeli 8 B i 30 B, wykazują największą różnicę między rozmiarami. Model 3 B, który nie przechodzi żadnego z etapów środowiskowych, nie jest w ogóle raportowany w zestawach SWE‑Bench ani Terminal‑Bench.
Szkolenie agentów bez sieci wartości
Mechanizm RL zasługuje na bliższą analizę, ponieważ to właśnie tam znajduje się większość inżynierii wydania. Każdy etap trenuje się przy użyciu asynchronicznego GRPO, metody optymalizacji polityki grupowo‑względnej, która ocenia każdą odpowiedź względem średniej nagrody innych próbek pobranych dla tego samego zapytania, eliminując potrzebę oddzielnej sieci wartości, której wymaga wiele pipeline’ów RL. Generowanie i trening działają na oddzielnych pulach GPU, które nigdy nie blokują się nawzajem: pracownicy ciągle pobierają trajektorie do wspólnego bufora, a trener strumieniuje zaktualizowane wagi w trakcie rolloutu. Zabezpieczenie zapobiega odchodzeniu generatorów o więcej niż jedną aktualizację, a przycięte ważone próbkowanie ogranicza wpływ przestarzałych tokenów.
Środowiska podłączają się poprzez NeMo‑Gym, który udostępnia weryfikatory, narzędzia i piaskownice za pośrednictwem jednolitego interfejsu, podczas gdy NeMo‑RL steruje pętlą treningową na Megatron‑Core z generacją vLLM. Praktycznym skutkiem jest to, że regułowy sprawdzacz matematyczny i pełna piaskownica repozytorium wyglądają identycznie dla pętli treningowej, co umożliwia realizację etapowego programu nauczania. IBM trenowało modele na klastrze NVIDIA GB200 NVL72 hostowanym przez CoreWeave, z domeną 72‑GPU NVLink i infrastrukturą InfiniBand o przepustowości 400 Gb/s.
IBM wydało także kwantowane warianty rodziny: FP8 bez kalibracji, NVFP4 i MXFP4 skalibrowane na 2 000 próbkach z zestawu danych SFT oraz czternaście formatów GGUF za pośrednictwem llama.cpp do wdrożeń wymagających mniejszej pamięci.
Gdzie Granite 4.2 wpisuje się w ofertę IBM
Wydanie kontynuuje celowe podzielenie zadań w otwartej strategii modeli IBM. Wcześniejsze generacje Granite były pozycjonowane jako silne asystenty wykonujące instrukcje; firma wprowadziła Granite Speech 5.0, wydany tego samego dnia, w osobnym ogłoszeniu skoncentrowanym na szybkości transkrypcji. Granite 4.2 to kolejny krok linii modeli językowych w kierunku wyraźnego rozumowania i pojawia się wraz z pełnym przepisem treningowym, proporcjami mieszanek danych oraz hiperparametrami poszczególnych etapów opublikowanymi razem z wagami.
Wszystkie trzy modele, kwantowane warianty, repozytorium GitHub oraz dokumentacja są dostępne na licencji Apache 2.0, przy czym flagowiec 30 B jest przeznaczony do jednego węzła serwisowego z wieloma GPU, a model 3 B skierowany jest do lżejszych wdrożeń, w których przełącznik myślenia nadal ma zastosowanie.












