AI-mallit ja alustat

IBM julkaisee Granite PatchTST-FM-R2 -nollakoulutuksen aikasarjamallin

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

IBM julkaisi Granite Time Series PatchTST-FM-r2:n 9. syyskuuta 2026, noin 385 miljoonan parametrin nollakoulutettu aikasarjaforecasting-malli, jonka lisenssi on kaksinkertainen: Apache 2.0 ja Linux Foundationin OpenMDW 1.0. Mallin painot, arkkitehtuuri, inferenssiputki ja koodi, jotka tarvitaan sen vertailutulosten toistamiseen, julkaistiin kaikki avoimesti julkaisun yhteydessä.

IBM ilmoitti mallista Hugging Face -blogipostaus IBM Research -kirjoittajien toimesta, esitellen sen PatchTST-FM-r1:n seuraajaksi ja Granite-aikasarja‑perusmalliperheen uusimmaksi malliksi. Ilmoituksen mukaan PatchTST-FM-r2 yhdistää päivitetyn arkkitehtuurin, laajemman esikoulutuskorpuksen, probabilistisen ennustamisen sekä tuen puuttuvien arvojen imputointiin, ja se tuottaa ennusteita uudesta datasta ilman hienosäätöä tai tehtäväkohtaisia sovituksia.

Raportoitu GIFT-Eval -tulokset

GIFT-Eval on kattava vertailu aikasarjaennustemallien arvioimiseksi erilaisilla tietoaineistoilla ja skenaarioilla, ja pienemmät arvot ovat parempia sekä CRPS- että MASE-mittareissa, joita IBM raportoi. IBM kertoi, että 8. syyskuuta 2026 PatchTST-FM-r2 sijoittui toiseksi toistettavien nollakoulutettujen mallien joukossa molemmissa mittareissa, ja se on kyseisessä kategoriassa paras suorituskykyinen malli, jotka on julkaistu sallivilla, kaupallisesti ystävällisillä lisensseillä. Ilmoituksessa raportoitiin geometrinen keskiarvo CRPS:stä 0.467, heti TimesFM-3:n jälkeen, ja geometrinen keskiarvo MASE:sta 0.6846.

Jotkut GIFT-Eval -malleista luokitellaan esikoulutetuiksi eikä tiukasti nollakoulutetuiksi, mikä tarkoittaa, että ne saavat sisällyttää vertailun arviointidatasetien koulutusosuudet esikoulutuskorpuksiinsa. IBM totesi, että vaikka nämä mallit lisätään vertailuun, PatchTST-FM-r2 sijoittuu kolmanneksi CRPS:ssä ja neljänneksi MASE:ssa toistettavien mallien joukossa, edellä esikoulutetut Chronos-2, Timer-S1 ja Toto -variantit, joista osa on huomattavasti suurempia.

Mallikortti, jonka ovat laatineet Jiri Navratil, Wesley M. Gifford, Yunshi Wen, Chandra K. Reddy ja Agung Julius, ajoittaa toisen sijan toistettavissa nollakoulutetuissa malleissa 31. elokuuta 2026, ja huomauttaa, että mallin tulokset odottavat pull request -pyyntöä GIFT-Eval -vertailuun; ilmoitus ajoittaa saman sijan 8. syyskuuta 2026.

Conformer-arkkitehtuuri

PatchTST-FM-r2 säilyttää edeltäjänsä käyttämän patruunapohjaisen esitystavan, mutta korvaa tavalliset transformer-lohkot conformer-lohkoilla, jotka alun perin kehitettiin puheentunnistukseen. Jokainen lohko sisältää kaksi puoliaskeltaista syötteen läpivientikerrosta, jotka ympäröivät monipäistä itsehuomiota ja aikakauttaulokerrosta, vuorotellen konvoluutiokerroin kokoja 3 ja 5 toistuvassa {5, 5, 3, 3} -mallissa. IBM totesi, että konvoluutiokomponentti sieppaa lyhyen kantaman aikarakenteen, jolloin huomiointimekanismi voi keskittyä pitkän kantaman suhteisiin patruunoiden välillä.

Malli käyttää 50 % päällekkäisiä patruunoita — patruunan pituus 16, askel 8 — Hamming-ikkunapainotuksella koulutuksen aikana ja päällekkäin‑lisää‑ennustuksella inferenssissä, sekä esipään kerrospainotuksen, joka parantaa koulutuksen vakautta. Siinä on piilotettu ulottuvuus 1024 ja 30 lohkoa, mikä on enemmän kuin r1:n 20, se tukee kontekstipituuksia jopa 8 192 askelta, ja ennustaa 99 kvantiilia joustavilla ennustepituuksilla, tuottaen sekä pistemenetelmät että epävarmuusväliä. Toteutus on saatavilla avoimen lähdekoodin granite-tsfm -tietovarastossa ja on taaksepäin yhteensopiva PatchTST-FM-r1:n tarkistuspisteiden kanssa.

Koulutusdata ja lisensointi

Dokumentoitu esikoulutuskorpus sisältää neljä lähdettä: valittuja tietoaineistoja GiftEvalPretrainista; räätälöityä synteettistä dataa, joka perustuu KernelSynthiin muokatuilla periodisilla ytimillä ja rajoitetulla augmentaatiolla; TSMixup‑korpus, joka on luotu Chronosin artikkelissa kuvattua menetelmää käyttäen, mutta rajoitettuna tietoaineistoihin GIFT-Eval -arviointijoukon ulkopuolella; sekä noin 500 000 synteettistä CauKer‑sekvenssiä, joista jokaisen pituus on 4 096. Mallikortti huomauttaa, että CauKer‑tietoaineiston on tuottanut IBM:n FlowState‑tiimi, ja se viittaa vuoden 2026 arXiv‑julkaisuun “Revisiting the Generic Transformer: Deconstructing a Strong Baseline for Time Series Foundation Models” taustamenetelmään.

Käyttäjät voivat valita joko Apache 2.0 -lisenssin tai OpenMDW 1.0 -lisenssin, joka on Linux Foundationin AI‑malleille ja niihin liittyville materiaaleille suunniteltu lisenssikehys. IBM totesi, että molemmat lisenssit antavat laajat, sallivat oikeudet käyttää, muokata ja jakaa mallia, ja että tavoitteena on vähentää käyttöönoton esteitä. Mallikortissa ilmoitetaan, että IBM:n kehittäjät tuottivat koodin avoimen lähdekoodin projektina eikä IBM‑tuotteena, eikä IBM ole velvollinen tarjoamaan parannuksia, päivityksiä tai tukea.

Saatavuus ja Granite-perheen konteksti

Painot voidaan ladata Hugging Face Hubista ja ladata granite-tsfm‑paketin, version 0.3.9 tai uudemman, kautta pipeline‑API:lla. IBM:n esimerkkikoodi tuottaa ennusteen, mukaan lukien pyydetyt kvantiilit, viimeisistä 512 ETTh1‑sarjan näytteestä, ja IBM asettaa mallin kysynnän, hintojen, energialatausten, liikenteen, telemetrian ja muiden säännöllisesti otettujen aikasarjojen ennustamiseen.

Suoratoistoympäristöihin IBM ja Confluent ovat tehneet useita Granite Time Series -malleja (PatchTST-FM-r1, FlowState-r1.1, TTM-r3 ja TSPulse) saataville Early Access -ohjelman kautta Confluent Cloudissa, jossa perusmallien inferenssi ajetaan live‑virroissa Apache Flinkin avulla.

IBM Research -yleiskatsaus perheestä dokumentoi julkaisun taustalla olevan sukupuun: TST vuonna 2021, yksi ensimmäisistä transformer-pohjaisista malleista, joita sovellettiin aikasarjadataan; PatchTST vuonna 2023, joka esitteli patruunoinnin ja kanavariippumattomuuden; Tiny Time Mixer vuonna 2024; sekä FlowState vuonna 2025. Tämän yleiskatsauksen mukaan malleja on yhteensä koulutettu yli 100 miljardiin datapisteeseen, ja TTM‑mallit ovat ylittäneet 37 miljoonaa latausta Hugging Facessa. PatchTST-FM-r1, uuden mallin suora edeltäjä, kehitettiin yhdessä Rensselaer Polytechnic Institute:n kanssa, ja IBM:n tutkimusversioiden malleilla on ei‑kaupallinen lisenssi, kun taas Granite‑sarja on julkaistu Apache 2.0 -lisenssillä.

Jonas Reeve on tekoälyanalyytikko Unite.AI:ssa, joka keskittyy kognitiiviseen tekoälyyn, tekoälyyn ja tekoälyjärjestelmien teoreettisiin perusteisiin. Hänen työnsä tutkii, miten oppiminen, päättely, muisti ja abstraktio ilmenevät sekä biologisissa että tekoälyjärjestelmissä, ja piirtää yhteyksiä modernien tekoälyarkkitehtuureiden ja kognitiivisen tieteen ja mielen filosofian pitkäaikaisiin kysymyksiin.
Konseptuaalisella ja refleksiivisellä lähestymistavalla Jonas tutkii kehyksiä, kuten päättelymalleja, agenteja, emergenttiä kognitiota ja suuntautumisteoriaa, pyrkien selventämään, mitä edistystä tekoälyssä tarkalleen ottaen tarkoittaa - ja mitä se ei tarkoita. Sen sijaan, että hän ajaisi aikatauluja tai hypeä, hän korostaa ensisijaisia periaatteita, konseptuaalista tarkkuutta ja nykyisten mallien rajoja.
Jonas Reeven kirjoittamat artikkelit ovat tekoälygeneroituja ja Unite.AI:n toimituksen tarkastamia, jotta varmistetaan ettei artikkeleissa käsitellä tekoälykonsepteja epätarkasti tai vastuuttomasti.