Modele și platforme AI
IBM lansează modelul de serii temporale Granite PatchTST-FM-R2 Zero-Shot

IBM a lansat Granite Time Series PatchTST-FM-r2 pe 9 septembrie 2026, un model de prognoză a seriilor temporale zero-shot cu aproximativ 385 de milioane de parametri, licențiat dublu sub Apache 2.0 și OpenMDW 1.0 al Linux Foundation. Greutățile modelului, arhitectura, fluxul de inferență și codul necesar pentru reproducerea rezultatelor benchmark-ului au fost publicate deschis odată cu lansarea.
IBM a anunțat modelul într-un post pe blogul Hugging Face scris de autorii de la IBM Research, prezentându-l ca succesor al PatchTST-FM-r1 și ca cel mai recent model din familia de modele de bază pentru serii temporale Granite. Conform anunțului, PatchTST-FM-r2 combină o arhitectură actualizată, un corpus de pre-antrenare mai mare, prognoză probabilistică și suport pentru imputarea valorilor lipsă, și generează prognoze pe date noi fără ajustare fină sau adaptare specifică sarcinii.
Clasamente raportate GIFT‑Eval
GIFT‑Eval este un benchmark cuprinzător pentru evaluarea modelelor de prognoză pe seturi de date și scenarii diverse, iar valori mai mici sunt mai bune atât pentru CRPS, cât și pentru MASE, cele două metrici raportate de IBM. IBM a declarat că, începând cu 8 septembrie 2026, PatchTST-FM-r2 se situează pe locul al doilea în rândul modelelor replicabile, zero‑shot, pentru ambele metrici și este modelul cu cea mai bună performanță în acea categorie dintre modelele lansate sub licențe permisive și prietenoase cu mediul comercial. Anunțul raportează un CRPS mediu geometric de 0,467, imediat în spatele TimesFM‑3, și un MASE mediu geometric de 0,6846.
Unele modele din GIFT‑Eval sunt categorisite ca pre-antrenate, nu strict zero-shot, ceea ce înseamnă că li se permite să includă părțile de antrenament ale seturilor de date de evaluare ale benchmark-ului în corpusurile lor de pre‑antrenare. IBM a declarat că, chiar și atunci când aceste modele sunt adăugate în comparație, PatchTST‑FM‑r2 se plasează pe al treilea loc pentru CRPS și pe al patrulea pentru MASE în rândul modelelor replicabile, înaintea variantelor pre‑antrenate Chronos‑2, Timer‑S1 și Toto, unele dintre ele fiind considerabil mai mari.
Fișa modelului, redactată de Jiri Navratil, Wesley M. Gifford, Yunshi Wen, Chandra K. Reddy și Agung Julius, marchează poziția de al doilea model replicabil zero-shot la data de 31 august 2026 și menționează că rezultatele modelului se află într-un pull request în așteptare trimis către benchmark‑ul GIFT‑Eval; anunțul fixează aceeași poziție la data de 8 septembrie 2026.
Arhitectura Conformer
PatchTST‑FM‑r2 păstrează reprezentarea bazată pe patch-uri a predecesorului său, dar înlocuiește blocurile standard de transformer cu blocuri conformer, un design care își are originea în procesarea vorbirii. Fiecare bloc conține două straturi feed‑forward de jumătate de pas, înconjurând atenția multi‑head și un strat de convoluție temporală, cu dimensiuni de kernel de convoluție alternante de 3 și 5 într-un model repetitiv {5, 5, 3, 3}. IBM a declarat că componenta de convoluție captează structura temporală pe termen scurt, permițând mecanismului de atenție să se concentreze pe relațiile pe termen lung dintre patch‑uri.
Modelul folosește patch‑uri suprapuse în proporție de 50 % — lungime patch 16, pas 8 — cu ponderare prin fereastră Hamming în timpul antrenamentului și prognoză prin suprapunere‑și‑adăugare la inferență, plus o normalizare de strat pre‑head aplicată pentru stabilitatea antrenamentului. Are o dimensiune ascunsă de 1024 și 30 de blocuri, în creștere față de 20 în r1, suportă lungimi de context de până la 8.192 de pași și prezice 99 de cuantile pe lungimi flexibile de prognoză, generând atât prognoze punctuale, cât și intervale de incertitudine. Implementarea este disponibilă în depozitul open‑source granite‑tsfm și rămâne compatibilă înapoi cu checkpoint‑urile PatchTST‑FM‑r1.
Date de antrenare și licențiere
Corpusul de pre‑antrenare documentat are patru surse: seturi de date selectate din GiftEvalPretrain; date sintetice personalizate bazate pe KernelSynth cu nuclee periodice modificate și augmentare limitată; un corpus TSMixup generat utilizând abordarea descrisă în lucrarea Chronos, dar restricționat la seturi de date din afara setului de evaluare GIFT‑Eval; și aproximativ 500.000 de secvențe sintetice CauKer, fiecare având o lungime de 4.096. Fișa modelului menționează că setul de date CauKer a fost generat de echipa FlowState a IBM și citează lucrarea arXiv din 2026 „Revisiting the Generic Transformer: Deconstructing a Strong Baseline for Time Series Foundation Models” pentru abordarea de bază.
Utilizatorii pot alege fie licența Apache 2.0, fie OpenMDW 1.0, un cadru de licențiere al Linux Foundation conceput pentru modele AI și materiale conexe. IBM a declarat că ambele licențe acordă drepturi largi și permisive de utilizare, modificare și distribuire a modelului și că scopul este de a reduce barierele în adoptare. O declarație din fișa modelului precizează că dezvoltatorii IBM au produs codul ca un proiect open‑source, nu ca un produs IBM, și că IBM nu are nicio obligație de a furniza îmbunătățiri, actualizări sau suport.
Disponibilitate și contextul familiei Granite
Greutățile pot fi descărcate de pe Hugging Face Hub și încărcate prin pachetul granite‑tsfm, versiunea 0.3.9 sau ulterioară, printr-un API de tip pipeline. Codul exemplu al IBM generează o prognoză, inclusiv cuantilele solicitate, din ultimele 512 mostre ale unei serii ETTh1, iar IBM poziționează modelul pentru cerere, prețuri, sarcini energetice, trafic, telemetrie și alte serii temporale eșantionate regulat.
Pentru implementări în streaming, IBM și Confluent au pus la dispoziție mai multe modele Granite Time Series (PatchTST‑FM‑r1, FlowState‑r1.1, TTM‑r3 și TSPulse) printr-un program Early Access în Confluent Cloud, care rulează inferență de modele de bază pe fluxuri live prin Apache Flink.
O prezentare IBM Research a familiei documentează linia de evoluție din spatele lansării: TST în 2021, unul dintre primele modele bazate pe transformer aplicate la date de serii temporale; PatchTST în 2023, care a introdus patch‑area și independența canalelor; Tiny Time Mixer în 2024; și FlowState în 2025. Conform acelei prezentări, modelele au fost antrenate colectiv pe peste 100 de miliarde de puncte de date, iar modelele TTM au depășit 37 de milioane de descărcări pe Hugging Face. PatchTST‑FM‑r1, predecessorul direct al noului model, a fost co‑dezvoltat cu Rensselaer Polytechnic Institute, iar modelele versiune de cercetare ale IBM au o licență non‑comercială, în timp ce linia Granite este publicată sub Apache 2.0.












