Modele i platformy AI

IBM wypuszcza model szeregów czasowych Granite PatchTST-FM-R2 Zero‑Shot

mm
Dodaj Unite.AI do preferowanych źródeł w Google

IBM wydało model Granite Time Series PatchTST-FM-r2 9 września 2026 r., model prognozowania szeregów czasowych zero‑shot o około 385 milionach parametrów, udostępniony na podwójnej licencji Apache 2.0 oraz OpenMDW 1.0 Fundacji Linux. Wagi modelu, architektura, pipeline inferencyjny oraz kod niezbędny do odtworzenia wyników benchmarku zostały opublikowane publicznie wraz z wydaniem.

IBM ogłosiło model w poście na blogu Hugging Face autorstwa badaczy IBM Research, przedstawiając go jako następcę PatchTST-FM-r1 oraz najnowszy model w rodzinie modeli bazowych Granite dla szeregów czasowych. Według ogłoszenia, PatchTST-FM-r2 łączy zaktualizowaną architekturę, większy korpus wstępnego treningu, prognozowanie probabilistyczne oraz obsługę imputacji brakujących wartości, a prognozy generuje na nowych danych bez konieczności dostrajania czy dopasowywania do konkretnego zadania.

Zgłoszone wyniki GIFT‑Eval

GIFT‑Eval to kompleksowy benchmark służący do oceny modeli prognozujących na różnorodnych zestawach danych i scenariuszach, przy czym niższe wartości są lepsze zarówno dla CRPS, jak i MASE, dwóch metryk podawanych przez IBM. IBM poinformowało, że na dzień 8 września 2026 r. PatchTST-FM-r2 zajmuje drugie miejsce wśród replikowalnych modeli zero‑shot pod względem obu metryk i jest najlepiej wypadającym modelem w tej kategorii spośród modeli udostępnionych na licencjach permissywnych, przyjaznych komercyjnie. W ogłoszeniu podano geometryczną średnią CRPS równą 0,467, tuż za modelem TimesFM‑3, oraz geometryczną średnią MASE równą 0,6846.

Niektóre modele w GIFT‑Eval są klasyfikowane jako wstępnie wytrenowane, a nie ściśle zero‑shot, co oznacza, że mogą zawierać fragmenty danych treningowych z zestawów oceny benchmarku w swoich korpusach wstępnego treningu. IBM podało, że nawet po uwzględnieniu tych modeli w porównaniu, PatchTST-FM-r2 zajmuje trzecie miejsce pod względem CRPS i czwarte pod względem MASE wśród replikowalnych modeli, wyprzedzając wstępnie wytrenowane Chronos‑2, Timer‑S1 oraz warianty Toto, z których niektóre są znacznie większe.

Karta modelu, napisana przez Jiriho Navratila, Wesleya M. Gifforda, Yunshi Wena, Chandra K. Reddy oraz Agunga Juliusza, datuje drugie miejsce replikowalnego modelu zero‑shot na 31 sierpnia 2026 r. i zauważa, że wyniki modelu znajdują się w oczekującym pull request skierowanym do benchmarku GIFT‑Eval; w ogłoszeniu to samo miejsce datowane jest na 8 września 2026 r.

Architektura Conformer

PatchTST-FM-r2 zachowuje reprezentację opartą na patchach swojego poprzednika, ale zastępuje standardowe bloki transformerów blokami conformer, projektem wywodzącym się z przetwarzania mowy. Każdy blok zawiera dwie warstwy feed‑forward o połowie kroku otaczające wielogłową samą uwagę oraz warstwę konwolucji czasowej, przy naprzemiennych rozmiarach jąder konwolucyjnych 3 i 5 w powtarzającym się wzorcu {5, 5, 3, 3}. IBM podkreśliło, że komponent konwolucyjny wychwytuje krótkodystansową strukturę temporalną, umożliwiając mechanizmowi uwagi skupienie się na długodystansowych zależnościach pomiędzy patchami.

Model wykorzystuje nakładające się w 50 % patche — długość patcha 16, krok 8 — z ważeniem okna Hamminga podczas treningu oraz prognozowaniem metodą overlap‑and‑add przy inferencji, a także zastosowano warstwową normalizację przed głową dla stabilności treningu. Posiada ukrytą wymiarowość 1024 oraz 30 bloków, w porównaniu do 20 w wersji r1, obsługuje długości kontekstu do 8 192 kroków i prognozuje 99 kwantyli przy elastycznych długościach prognozy, generując zarówno prognozy punktowe, jak i przedziały niepewności. Implementacja jest dostępna w otwartym repozytorium granite‑tsfm i pozostaje kompatybilna wstecz z checkpointami PatchTST‑FM‑r1.

Dane treningowe i licencjonowanie

Udokumentowany korpus wstępnego treningu składa się z czterech źródeł: wybranych zestawów danych z GiftEvalPretrain; własnych syntetycznych danych opartych na KernelSynth z zmodyfikowanymi kernelami okresowymi i ograniczoną augmentacją; korpusu TSMixup wygenerowanego metodą opisaną w publikacji Chronos, ale ograniczonego do zestawów danych spoza zestawu oceny GIFT‑Eval; oraz około 500 000 syntetycznych sekwencji CauKer, każda o długości 4 096. Karta modelu zauważa, że zestaw danych CauKer został wygenerowany przez zespół FlowState firmy IBM i cytuje artykuł arXiv z 2026 r. „Revisiting the Generic Transformer: Deconstructing a Strong Baseline for Time Series Foundation Models” jako podstawę podejścia.

Użytkownicy mogą wybrać licencję Apache 2.0 lub OpenMDW 1.0, ramy licencyjne Fundacji Linux przeznaczone dla modeli AI i powiązanych materiałów. IBM podkreśliło, że obie licencje przyznają szerokie, permissywne prawa do używania, modyfikowania i dystrybucji modelu oraz mają na celu zmniejszenie barier przyjęcia. Oświadczenie w karcie modelu informuje, że deweloperzy IBM stworzyli kod jako projekt open‑source, a nie produkt IBM, oraz że IBM nie ma obowiązku dostarczania ulepszeń, aktualizacji ani wsparcia.

Dostępność i kontekst rodziny Granite

Wagi można pobrać z Hugging Face Hub i wczytać za pomocą pakietu granite‑tsfm, wersja 0.3.9 lub nowsza, poprzez API pipeline. Przykładowy kod IBM generuje prognozę, włącznie z żądanymi kwantylami, z ostatnich 512 próbek serii ETTh1, a IBM pozycjonuje model do prognozowania popytu, cen, obciążeń energetycznych, ruchu, telemetrii oraz innych regularnie próbkowanych szeregów czasowych.

W przypadku wdrożeń strumieniowych, IBM i Confluent udostępniły kilka modeli Granite Time Series (PatchTST‑FM‑r1, FlowState‑r1.1, TTM‑r3 i TSPulse) w ramach programu Early Access w Confluent Cloud, który uruchamia inferencję modeli bazowych na żywych strumieniach przy użyciu Apache Flink.

Karta modelu, napisana przez Jiriho Navratila, Wesleya M. Gifforda, Yunshi Wena, Chandra K. Reddy oraz Agunga Juliusza, datuje drugie miejsce replikowalnego modelu zero‑shot na 31 sierpnia 2026 r. i zauważa, że wyniki modelu znajdują się w oczekującym pull request skierowanym do benchmarku GIFT‑Eval; w ogłoszeniu to samo miejsce datowane jest na 8 września 2026 r.

Przegląd IBM Research rodziny dokumentuje pochodzenie wydania: TST w 2021 r., jeden z pierwszych modeli opartych na transformerach zastosowanych do danych szeregów czasowych; PatchTST w 2023 r., wprowadzający podział na patche i niezależność kanałów; Tiny Time Mixer w 2024 r.; oraz FlowState w 2025 r. Zgodnie z tym przeglądem, modele zostały łącznie wytrenowane na ponad 100 miliardach punktów danych, a modele TTM odnotowały ponad 37 milionów pobrań na Hugging Face. PatchTST‑FM‑r1, bezpośredni poprzednik nowego modelu, został współopracowany z Rensselaer Polytechnic Institute, a modele wersji badawczej IBM posiadają licencję niekomercyjną, podczas gdy linia Granite jest publikowana na licencji Apache 2.0.

Jonas Reeve jest analitykiem wygenerowanym przez AI w Unite.AI, specjalizującym się w sztucznej inteligencji kognitywnej, ogólnej inteligencji sztucznej (AGI) oraz teoretycznych podstawach inteligencji maszynowej. Jego praca bada, jak uczenie się, rozumowanie, pamięć i abstrakcja pojawiają się w systemach biologicznych i sztucznych, nawiązując połączenia między nowoczesnymi architekturami AI a długotrwałymi pytaniami w nauce o poznaniu i filozofii umysłu.
Z konceptualnym i refleksyjnym podejściem, Jonas bada ramy takie jak modele rozumowania, systemy agenty, emergentna percepcja i teoria dopasowania, mając na celu wyjaśnienie, co oznacza postęp w kierunku AGI - i co nie. Zamiast gonienia za harmonogramami lub hiperem, kładzie nacisk na pierwsze zasady, konceptualną surowość i granice obecnych modeli.
Artykuły napisane przez Jonasa Reeve są wygenerowane przez AI i sprawdzane przez zespół redakcyjny Unite.AI, aby zapewnić dokładność, klarowność i odpowiedzialną dyskusję zaawansowanych pojęć AI.