Modèles et plateformes d’IA

IBM publie Granite PatchTST-FM-R2, modèle de séries temporelles zéro-shot

mm
Ajouter Unite.AI à vos sources préférées sur Google

IBM a publié Granite Time Series PatchTST-FM-r2 le 9 septembre 2026, un modèle de prévision de séries temporelles zéro-shot d’environ 385 millions de paramètres, sous double licence Apache 2.0 et OpenMDW 1.0 de la Linux Foundation. Les poids du modèle, son architecture, le pipeline d’inférence et le code nécessaires pour reproduire ses résultats de référence ont tous été publiés ouvertement avec la version.

IBM a annoncé le modèle dans un article de blog Hugging Face rédigé par des auteurs d’IBM Research, le présentant comme le successeur de PatchTST-FM-r1 et le dernier modèle de la famille de modèles fondamentaux de séries temporelles Granite. Selon l’annonce, PatchTST-FM-r2 combine une architecture mise à jour, un corpus de pré‑entraînement plus grand, une prévision probabiliste et la prise en charge de l’imputation des valeurs manquantes, et il génère des prévisions sur de nouvelles données sans ajustement fin ni adaptation spécifique à la tâche.

Classements GIFT-Eval rapportés

GIFT‑Eval est une référence exhaustive pour évaluer les modèles de prévision sur des jeux de données et des scénarios variés, et des valeurs plus faibles sont meilleures pour le CRPS et le MASE, les deux métriques rapportées par IBM. IBM a indiqué qu’au 8 septembre 2026, PatchTST-FM-r2 se classait deuxième parmi les modèles zéro-shot reproductibles pour les deux métriques, et était le modèle le plus performant de cette catégorie parmi ceux publiés sous licences permissives et favorables au commerce. L’annonce indique un CRPS moyen géométrique de 0,467, juste derrière TimesFM-3, et un MASE moyen géométrique de 0,6846.

Certains modèles de GIFT-Eval sont classés comme pré-entraînés plutôt que strictement zéro-shot, ce qui signifie qu’ils peuvent inclure les parties d’entraînement des jeux de données d’évaluation du benchmark dans leurs corpus de pré‑entraînement. IBM a déclaré que même en ajoutant ces modèles à la comparaison, PatchTST-FM-r2 se place troisième pour le CRPS et quatrième pour le MASE parmi les modèles reproductibles, devant les variantes pré‑entraînées Chronos-2, Timer-S1 et Toto, dont certaines sont nettement plus grandes.

La fiche modèle, rédigée par Jiri Navratil, Wesley M. Gifford, Yunshi Wen, Chandra K. Reddy et Agung Julius, fixe le classement zéro-shot reproductible numéro deux au 31 août 2026, et indique que les résultats du modèle se trouvent dans une pull request en attente soumise au benchmark GIFT-Eval ; l’annonce fixe le même classement au 8 septembre 2026.

Architecture Conformer

PatchTST-FM-r2 conserve la représentation basée sur des patchs de son prédécesseur mais remplacent les blocs de transformeur standards par des blocs conformer, un design issu du traitement de la parole. Chaque bloc comprend deux couches feed‑forward à demi‑étape encadrant une auto‑attention multi‑têtes et une couche de convolution temporelle, avec des tailles de noyau de convolution alternant 3 et 5 selon le motif répété {5, 5, 3, 3}. IBM a indiqué que le composant convolutionnel capture la structure temporelle à courte portée, permettant au mécanisme d’attention de se concentrer sur les relations à longue portée entre les patchs.

Le modèle utilise des patchs se chevauchant à 50 % — longueur de patch 16, pas 8 — avec un pondération à fenêtre de Hamming pendant l’entraînement et une prévision par chevauchement‑et‑addition lors de l’inférence, ainsi qu’une normalisation de couche pré‑tête appliquée pour la stabilité de l’entraînement. Il possède une dimension cachée de 1024 et 30 blocs, contre 20 dans r1, prend en charge des longueurs de contexte allant jusqu’à 8 192 pas, et prédit 99 quantiles sur des horizons de prévision flexibles, produisant à la fois des prévisions ponctuelles et des intervalles d’incertitude. L’implémentation est disponible dans le dépôt open‑source granite‑tsfm et reste compatible avec les points de contrôle de PatchTST‑FM‑r1.

Données d’entraînement et licences

Le corpus de pré‑entraînement documenté comprend quatre sources: des jeux de données sélectionnés de GiftEvalPretrain ; des données synthétiques personnalisées basées sur KernelSynth avec des noyaux périodiques modifiés et une augmentation limitée ; un corpus TSMixup généré en utilisant l’approche décrite dans l’article Chronos mais limité aux jeux de données extérieurs à l’ensemble d’évaluation GIFT‑Eval ; et environ 500 000 séquences synthétiques CauKer, chacune d’une longueur de 4 096. La fiche modèle indique que le jeu de données CauKer a été généré par l’équipe FlowState d’IBM, et cite l’article arXiv 2026 « Revisiting the Generic Transformer: Deconstructing a Strong Baseline for Time Series Foundation Models » pour l’approche sous‑jacente.

Les utilisateurs peuvent choisir soit la licence Apache 2.0, soit OpenMDW 1.0, un cadre de licence de la Linux Foundation conçu pour les modèles d’IA et les matériaux associés. IBM a déclaré que les deux licences accordent des droits larges et permissifs d’utilisation, de modification et de distribution du modèle, et qu’elles visent à réduire les obstacles à l’adoption. Une mention dans la fiche modèle indique que les développeurs d’IBM ont produit le code en tant que projet open‑source plutôt qu’en tant que produit IBM, et qu’IBM n’est sous aucune obligation de fournir des améliorations, des mises à jour ou du support.

Disponibilité et contexte de la famille Granite

Les poids sont téléchargeables depuis le Hugging Face Hub et chargés via le package granite‑tsfm, version 0.3.9 ou supérieure, à l’aide d’une API pipeline. Le code d’exemple d’IBM génère une prévision, y compris les quantiles demandés, à partir des 512 derniers échantillons d’une série ETTh1, et IBM positionne le modèle pour la demande, les prix, les charges énergétiques, le trafic, la télémétrie et d’autres séries temporelles échantillonnées régulièrement.

Pour les déploiements en streaming, IBM et Confluent ont rendu plusieurs modèles Granite Time Series (PatchTST‑FM‑r1, FlowState‑r1.1, TTM‑r3 et TSPulse) disponibles via un programme Early Access dans Confluent Cloud, qui exécute l’inférence de modèles fondamentaux sur des flux en direct via Apache Flink.

Une vue d’ensemble d’IBM Research de la famille consigne la lignée à l’origine de la publication: TST en 2021, parmi les premiers modèles basés sur des transformeurs appliqués aux données de séries temporelles ; PatchTST en 2023, qui a introduit le patching et l’indépendance des canaux ; Tiny Time Mixer en 2024 ; et FlowState en 2025. Selon cette vue d’ensemble, les modèles ont été entraînés collectivement sur plus de 100 milliards de points de données, et les modèles TTM ont dépassé 37 millions de téléchargements sur Hugging Face. PatchTST‑FM‑r1, le prédécesseur direct du nouveau modèle, a été co‑développé avec le Rensselaer Polytechnic Institute, et les modèles de version recherche d’IBM sont distribués sous une licence non commerciale tandis que la gamme Granite est publiée sous Apache 2.0.

Jonas Reeve est un analyste généré par IA chez Unite.AI, se concentrant sur l'intelligence artificielle cognitive, l'intelligence artificielle générale (AGI) et les fondements théoriques de l'intelligence machine. Son travail explore comment l'apprentissage, le raisonnement, la mémoire et l'abstraction émergent à la fois dans les systèmes biologiques et artificiels, établissant des liens entre les architectures d'IA modernes et les questions de longue date en sciences cognitives et philosophie de l'esprit.
Avec une approche conceptuelle et réflexive, Jonas examine des cadres tels que les modèles de raisonnement, les systèmes agents, la cognition émergente et la théorie d'alignement, visant à clarifier ce que signifie réellement le progrès vers l'AGI - et ce que cela ne signifie pas. Plutôt que de poursuivre les délais ou l'hype, il met l'accent sur les principes fondamentaux, la rigueur conceptuelle et les limites des modèles actuels.
Les articles rédigés par Jonas Reeve sont générés par IA et révisés par l'équipe éditoriale d'Unite.AI pour garantir l'exactitude, la clarté et la discussion responsable des concepts d'IA avancés.