Modelli e piattaforme di IA

IBM rilascia Granite PatchTST-FM-R2, modello di serie temporali zero-shot

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

IBM ha rilasciato Granite Time Series PatchTST-FM-r2 il 9 settembre 2026, un modello di previsione di serie temporali zero-shot di circa 385 milioni di parametri, con doppia licenza Apache 2.0 e OpenMDW 1.0 della Linux Foundation. I pesi del modello, l’architettura, il pipeline di inferenza e il codice necessari per riprodurre i risultati del benchmark sono stati pubblicati apertamente insieme al rilascio.

IBM ha annunciato il modello in un post del blog di Hugging Face scritto da autori di IBM Research, presentandolo come successore di PatchTST-FM-r1 e l’ultimo modello della famiglia di modelli di fondazione per serie temporali Granite. Secondo l’annuncio, PatchTST-FM-r2 combina un’architettura aggiornata, un corpus di pre-addestramento più ampio, previsioni probabilistiche e il supporto per l’imputazione di valori mancanti, e genera previsioni su nuovi dati senza fine-tuning o adattamento specifico al compito.

Classifiche GIFT-Eval riportate

GIFT-Eval è un benchmark completo per valutare i modelli di previsione su diversi set di dati e scenari, e valori più bassi sono migliori sia per CRPS che per MASE, le due metriche riportate da IBM. IBM ha dichiarato che, al 8 settembre 2026, PatchTST-FM-r2 si classifica al secondo posto tra i modelli replicabili zero-shot per entrambe le metriche, ed è il modello con le migliori prestazioni in quella categoria tra i modelli rilasciati con licenze permissive e orientate al commercio. L’annuncio segnala un CRPS medio geometrico di 0,467, subito dietro TimesFM-3, e un MASE medio geometrico di 0,6846.

Alcuni modelli su GIFT-Eval sono classificati come pre-addestrati anziché strettamente zero-shot, il che significa che possono includere le parti di addestramento dei set di dati di valutazione del benchmark nei loro corpus di pre-addestramento. IBM ha affermato che, anche includendo questi modelli nel confronto, PatchTST-FM-r2 si posiziona al terzo posto per CRPS e al quarto per MASE tra i modelli replicabili, davanti ai modelli pre-addestrati Chronos-2, Timer-S1 e alle varianti Toto, alcune delle quali notevolmente più grandi.

La scheda del modello, redatta da Jiri Navratil, Wesley M. Gifford, Yunshi Wen, Chandra K. Reddy e Agung Julius, fissa la posizione replicabile numero due zero-shot al 31 agosto 2026, e osserva che i risultati del modello sono contenuti in una pull request in attesa inviata al benchmark GIFT-Eval; l’annuncio fissa la stessa posizione al 8 settembre 2026.

Architettura Conformer

PatchTST-FM-r2 conserva la rappresentazione basata su patch del suo predecessore, ma sostituisce i blocchi transformer standard con blocchi conformer, un design originario dell’elaborazione del parlato. Ogni blocco contiene due layer feed-forward a mezza fase che circondano l’attenzione multi-head e un layer di convoluzione temporale, con dimensioni dei kernel di convoluzione alternanti 3 e 5 in un pattern ripetuto {5, 5, 3, 3}. IBM ha dichiarato che la componente di convoluzione cattura la struttura temporale a breve raggio, permettendo al meccanismo di attenzione di concentrarsi sulle relazioni a lungo raggio tra le patch.

Il modello utilizza patch con sovrapposizione del 50 % — lunghezza patch 16, stride 8 — con ponderazione a finestra di Hamming durante l’addestramento e previsione overlap-and-add in fase di inferenza, oltre a una normalizzazione layer pre-head applicata per la stabilità dell’addestramento. Ha una dimensione nascosta di 1024 e 30 blocchi, rispetto ai 20 della r1, supporta lunghezze di contesto fino a 8 192 step e prevede 99 quantili su lunghezze di previsione flessibili, producendo sia previsioni puntuali sia intervalli di incertezza. L’implementazione è disponibile nel repository open-source granite-tsfm e rimane retro-compatibile con i checkpoint di PatchTST-FM-r1.

Dati di addestramento e licenze

Il corpus di pre-addestramento documentato comprende quattro fonti: set di dati selezionati da GiftEvalPretrain; dati sintetici personalizzati basati su KernelSynth con kernel periodici modificati e augmentazione limitata; un corpus TSMixup generato con l’approccio descritto nel paper Chronos ma limitato a set di dati al di fuori del set di valutazione GIFT-Eval; e circa 500 000 sequenze sintetiche CauKer, ciascuna di lunghezza 4 096. La scheda del modello osserva che il dataset CauKer è stato generato dal team FlowState di IBM e cita il paper arXiv 2026 “Revisiting the Generic Transformer: Deconstructing a Strong Baseline for Time Series Foundation Models” per l’approccio di base.

Gli utenti possono scegliere tra la licenza Apache 2.0 o OpenMDW 1.0, un quadro di licenze della Linux Foundation progettato per modelli AI e materiali correlati. IBM ha dichiarato che entrambe le licenze concedono ampi diritti permissivi di utilizzo, modifica e distribuzione del modello, e che l’obiettivo è ridurre le barriere all’adozione. Una dichiarazione nella scheda del modello indica che gli sviluppatori IBM hanno prodotto il codice come progetto open-source piuttosto che come prodotto IBM, e che IBM non ha alcun obbligo di fornire miglioramenti, aggiornamenti o supporto.

Disponibilità e contesto della famiglia Granite

I pesi sono scaricabili dal Hugging Face Hub e caricati tramite il pacchetto granite-tsfm, versione 0.3.9 o successive, mediante un’API pipeline. Il codice di esempio di IBM genera una previsione, includendo i quantili richiesti, dagli ultimi 512 campioni di una serie ETTh1, e IBM posiziona il modello per domanda, prezzi, carichi energetici, traffico, telemetria e altre serie temporali campionate regolarmente.

Per le distribuzioni in streaming, IBM e Confluent hanno reso disponibili diversi modelli Granite Time Series (PatchTST-FM-r1, FlowState-r1.1, TTM-r3 e TSPulse) tramite un programma Early Access in Confluent Cloud, che esegue inferenza di modelli di fondazione su flussi live tramite Apache Flink.

Una panoramica di IBM Research sulla famiglia documenta la genealogia alla base del rilascio: TST nel 2021, tra i primi modelli basati su transformer applicati a dati di serie temporali; PatchTST nel 2023, che ha introdotto il patching e l’indipendenza dei canali; Tiny Time Mixer nel 2024; e FlowState nel 2025. Secondo tale panoramica, i modelli sono stati addestrati collettivamente su più di 100 miliardi di punti dati, e i modelli TTM hanno superato i 37 milioni di download su Hugging Face. PatchTST-FM-r1, diretto predecessore del nuovo modello, è stato co-sviluppato con il Rensselaer Polytechnic Institute, e i modelli di versione ricerca di IBM sono distribuiti con licenza non commerciale mentre la linea Granite è pubblicata sotto Apache 2.0.

Jonas Reeve è un analista generato da AI presso Unite.AI, che si concentra sull'intelligenza artificiale cognitiva, l'intelligenza artificiale generale (AGI) e i fondamenti teorici dell'intelligenza delle macchine. Il suo lavoro esplora come l'apprendimento, il ragionamento, la memoria e l'astrazione emergano sia in sistemi biologici che artificiali, stabilendo collegamenti tra le moderne architetture di intelligenza artificiale e le lunghe domande della scienza cognitiva e della filosofia della mente.
Con un approccio concettuale e riflessivo, Jonas esamina framework come modelli di ragionamento, sistemi agente, cognizione emergente e teoria dell'allineamento, con l'obiettivo di chiarire cosa significhi realmente il progresso verso l'AGI - e cosa no. Piuttosto che inseguire le scadenze o l'entusiasmo, enfatizza i primi principi, la rigorosità concettuale e i limiti dei modelli attuali.
Gli articoli scritti da Jonas Reeve sono generati da AI e revisionati dal team editoriale di Unite.AI per garantire l'accuratezza, la chiarezza e la discussione responsabile dei concetti di intelligenza artificiale avanzata.