AI-modeller og plattformer

IBM lanserer Granite PatchTST-FM-R2 null‑shot tidsseriemodell

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

IBM ga ut Granite Time Series PatchTST-FM-r2 9. september 2026, en modell for tidsserie‑prognostisering med omtrent 385 millioner parametere og null‑shot‑evne, som er dobbel‑lisensiert under Apache 2.0 og Linux Foundations OpenMDW 1.0. Modellvektene, arkitekturen, inferens‑pipeline og koden som kreves for å gjenskape benchmark‑resultatene ble alle publisert åpent sammen med utgivelsen.

IBM kunngjorde modellen i et Hugging Face‑blogginnlegg av forfattere fra IBM Research, og presenterte den som etterfølgeren til PatchTST-FM-r1 og den nyeste modellen i Granite‑familien av tidsserie‑grunnmodeller. Ifølge kunngjøringen kombinerer PatchTST-FM-r2 en oppdatert arkitektur, et større forhåndstreningskorpus, probabilistisk prognostisering og støtte for imputering av manglende verdier, og den genererer prognoser på nye data uten fin‑tuning eller oppgavespesifikk tilpasning.

Rapporterte GIFT‑Eval‑plasseringer

GIFT‑Eval er en omfattende benchmark for å evaluere prognosemodeller på tvers av ulike datasett og scenarier, og lavere verdier er bedre for både CRPS og MASE, de to målene IBM rapporterer. IBM oppga at per 8. september 2026 ligger PatchTST‑FM‑r2 på andreplass blant reproduserbare null‑shot‑modeller for begge målene, og er den best‑presterende modellen i den kategorien blant modeller som er utgitt under permissive, kommersielt vennlige lisenser. Kunngjøringen rapporterer en geometrisk gjennomsnittlig CRPS på 0,467, rett bak TimesFM‑3, og en geometrisk gjennomsnittlig MASE på 0,6846.

Noen modeller i GIFT‑Eval er kategorisert som forhåndstrente snarere enn strengt null‑shot, noe som betyr at de får inkludere treningsdelene av benchmark‑evalueringens datasett i sine forhåndstreningskorpuser. IBM oppga at selv når disse modellene legges til sammenligningen, havner PatchTST‑FM‑r2 på tredjeplass for CRPS og fjerdeplass for MASE blant reproduserbare modeller, foran de forhåndstrente variantene Chronos‑2, Timer‑S1 og Toto, hvorav noen er betydelig større.

Modellkortet, skrevet av Jiri Navratil, Wesley M. Gifford, Yunshi Wen, Chandra K. Reddy og Agung Julius, daterer den andreplasseringen for reproduserbar null‑shot til 31. august 2026, og bemerker at modellens resultater ligger i en ventende pull‑request som er sendt til GIFT‑Eval‑benchmarken; kunngjøringen daterer den samme plasseringen til 8. september 2026.

Conformer‑arkitektur

PatchTST‑FM‑r2 beholder den patch‑baserte representasjonen fra forgjengeren, men erstatter standard transformer‑blokker med conformer‑blokker, en design som opprinnelig ble utviklet for tale‑behandling. Hver blokk inneholder to halvtids‑feed‑forward‑lag som omgir multi‑head‑self‑attention og et temporalt konvolusjonslag, med alternerende konvolusjonskjerne‑størrelser på 3 og 5 i et repeterende mønster {5, 5, 3, 3}. IBM oppga at konvolusjonskomponenten fanger kort‑distanse‑temporal struktur, slik at attention‑mekanismen kan fokusere på lang‑distanse‑relasjoner mellom patches.

Modellen bruker 50 % overlappende patches — patch‑lengde 16, stride 8 — med Hamming‑vindu‑vektning under trening og overlap‑and‑add‑prognostisering under inferens, samt en pre‑head‑layer‑norm for stabilitet under trening. Den har en skjult dimensjon på 1024 og 30 blokker, opp fra 20 i r1, støtter kontekstlenger opp til 8 192 steg, og predikerer 99 kvantiler over fleksible prognoselengder, og produserer både punkt‑prognoser og usikkerhetsintervaller. Implementeringen er tilgjengelig i det åpne kildekode‑repoet granite‑tsfm og er bakoverkompatibel med PatchTST‑FM‑r1‑kontrollpunkter.

Treningsdata og lisensiering

Det dokumenterte forhåndstreningskorpuset har fire kilder: utvalgte datasett fra GiftEvalPretrain; egendefinerte syntetiske data basert på KernelSynth med modifiserte periodiske kjerner og begrenset augmentering; et TSMixup‑korpus generert ved hjelp av metoden beskrevet i Chronos‑artikkelen, men begrenset til datasett utenfor GIFT‑Eval‑evalueringsettet; samt omtrent 500 000 syntetiske CauKer‑sekvenser, hver med en lengde på 4 096. Modellkortet bemerker at CauKer‑datasettet ble generert av IBMs FlowState‑team, og refererer til arXiv‑artikkelen fra 2026 «Revisiting the Generic Transformer: Deconstructing a Strong Baseline for Time Series Foundation Models» for den underliggende tilnærmingen.

Brukere kan velge enten Apache 2.0‑lisensen eller OpenMDW 1.0, et lisensrammeverk fra Linux Foundation designet for AI‑modeller og tilhørende materiale. IBM oppga at begge lisensene gir brede, permissive rettigheter til å bruke, modifisere og distribuere modellen, og at de har som mål å redusere hindringer for adopsjon. En opplysning i modellkortet sier at IBM‑utviklere produserte koden som et åpen‑kilde‑prosjekt snarere enn som et IBM‑produkt, og at IBM ikke er forpliktet til å levere forbedringer, oppdateringer eller support.

Tilgjengelighet og Granite‑familiekontekst

Vektene kan lastes ned fra Hugging Face‑huben og lastes inn via granite‑tsfm‑pakken, versjon 0.3.9 eller senere, gjennom et pipeline‑API. IBMs eksempel‑kode genererer en prognose, inkludert ønskede kvantiler, fra de siste 512 prøvene av en ETTh1‑serie, og IBM posisjonerer modellen for etterspørsel, priser, energilaster, trafikk, telemetri og andre jevnlig samplede tidsserier.

For streaming‑utplasseringer har IBM og Confluent gjort flere Granite Time Series‑modeller (PatchTST‑FM‑r1, FlowState‑r1.1, TTM‑r3 og TSPulse) tilgjengelige via et Early‑Access‑program i Confluent Cloud, som kjører grunnmodells‑inferens på live‑strømmer gjennom Apache Flink.

En IBM Research‑oversikt over familien dokumenterer slektslinjen bak utgivelsen: TST i 2021, blant de første transformer‑baserte modellene anvendt på tidsseriedata; PatchTST i 2023, som introduserte patching og kanal‑uavhengighet; Tiny Time Mixer i 2024; og FlowState i 2025. Ifølge oversikten har modellene samlet blitt trent på mer enn 100 milliarder datapunkter, og TTM‑modellene har oppnådd over 37 millioner nedlastinger på Hugging Face. PatchTST‑FM‑r1, den nye modellens direkte forgjenger, ble utviklet i samarbeid med Rensselaer Polytechnic Institute, og IBMs forsknings‑versjonsmodeller har en ikke‑kommersiell lisens, mens Granite‑serien publiseres under Apache 2.0.

Jonas Reeve er en AI-generert analytiker hos Unite.AI, som fokuserer på kognitiv AI, kunstig generell intelligens (AGI) og de teoretiske grunnlagene for maskinintelligens. Hans arbeid utforsker hvordan læring, resonnering, minne og abstraksjon oppstår i både biologiske og kunstige systemer, og trekker sammenheng mellom moderne AI-arkitekturer og langvarige spørsmål i kognitiv vitenskap og filosofi om sinn.

Med en konseptuell og reflektert tilnærming, undersøker Jonas rammer som resonneringsmodeller, agente systemer, emergent kognisjon og aligneringsteori, med mål om å klargjøre hva fremgang mot AGI faktisk betyr - og hva det ikke betyr. I stedet for å jage tidsfrister eller hype, legger han vekt på første prinsipper, konseptuell rigor og grensene for nåværende modeller.

Artikler skrevet av Jonas Reeve er AI-generert og gjennomgått av Unite.AIs redaksjonelle team for å sikre nøyaktighet, klarhet og ansvarlig diskusjon av avanserte AI-konsepter.