AI 模型与平台
IBM 发布 Granite PatchTST-FM-R2 零样本时间序列模型

IBM 于 2026 年 9 月 9 日发布了 Granite 时间序列 PatchTST-FM-r2,这是一款约 3.85 亿参数的零样本时间序列预测模型,采用 Apache 2.0 与 Linux 基金会的 OpenMDW 1.0 双许可证。模型权重、架构、推理流水线以及复现基准结果所需的代码均随发布公开。
IBM 在一篇由 IBM Research 作者撰写的 Hugging Face 博客文章 中宣布了该模型,称其为 PatchTST-FM-r1 的继任者,也是 Granite 时间序列基础模型系列的最新成员。公告称,PatchTST-FM-r2 融合了更新的架构、更大的预训练语料、概率预测以及对缺失值插补的支持,能够在无需微调或特定任务适配的情况下对新数据进行预测。
报告的 GIFT-Eval 排名
GIFT-Eval 是一个用于在多样化数据集和场景下评估预测模型的综合基准,CRPS 与 MASE 两项指标数值越低越好,正是 IBM 报告的两项指标。IBM 表示,截至 2026 年 9 月 8 日,PatchTST-FM-r2 在可复制的零样本模型中两项指标均排名第二,并且在采用宽松、商业友好许可证发布的模型中是表现最佳的。公告中给出的几何平均 CRPS 为 0.467,紧随 TimesFM-3 之后,几何平均 MASE 为 0.6846。
GIFT-Eval 中的部分模型被归类为预训练模型,而非严格的零样本模型,这意味着它们可以在预训练语料中使用基准评估数据集的训练部分。IBM 表示,即使将这些模型纳入比较,PatchTST-FM-r2 在可复制模型中仍然在 CRPS 排名第三、MASE 排名第四,领先于预训练的 Chronos-2、Timer-S1 以及 Toto 系列的变体,其中一些模型规模更大。
该模型卡由 Jiri Navratil、Wesley M. Gifford、Yunshi Wen、Chandra K. Reddy 和 Agung Julius 编写,将可复制的零样本第二名的时间点标记为 2026 年 8 月 31 日,并指出模型结果正处于提交至 GIFT-Eval 基准的待合并拉取请求中;公告则将同一排名的时间点定为 2026 年 9 月 8 日。
Conformer 架构
PatchTST-FM-r2 保留了前代模型的基于 patch 的表示方式,但将标准的 transformer 块替换为 conformer 块,这一设计最初来源于语音处理。每个块包含两个半步前馈层,环绕多头自注意力和时间卷积层,卷积核尺寸交替为 3 与 5,呈 {5, 5, 3, 3} 循环模式。IBM 表示,卷积组件捕获短程时间结构,使注意力机制能够专注于 patch 之间的长程关联。
该模型采用 50% 重叠的 patch——patch 长度为 16,步幅为 8——在训练时使用 Hamming 窗加权,推理时采用 overlap‑and‑add 方式进行预测,并在前置层使用层归一化以提升训练稳定性。模型隐藏维度为 1024,包含 30 个块(相较 r1 的 20 块有所增加),支持最长 8,192 步的上下文长度,并在灵活的预测长度上预测 99 个分位数,能够输出点预测和不确定区间。实现代码已在开源的 granite‑tsfm 仓库中提供,并保持对 PatchTST-FM-r1 检查点的向后兼容。
训练数据与授权许可
文档中记录的预训练语料库包含四个来源: 来自 GiftEvalPretrain 的精选数据集;基于 KernelSynth、经过修改的周期核并有限增强的自定义合成数据;使用 Chronos 论文中描述的方法生成的 TSMixup 语料,但仅限于 GIFT‑Eval 评估集之外的数据集;以及约 500,000 条合成的 CauKer 序列,每条长度为 4,096。模型卡指出,CauKer 数据集由 IBM 的 FlowState 团队生成,并引用了 2026 年 arXiv 论文《Revisiting the Generic Transformer: Deconstructing a Strong Baseline for Time Series Foundation Models》作为其底层方法的来源。
用户可以选择 Apache 2.0 许可证或 OpenMDW 1.0——一种为 AI 模型及相关材料设计的 Linux 基金会授权框架。IBM 表示,两种许可证均赋予广泛且宽松的使用、修改和分发模型的权利,旨在降低采用门槛。模型卡中的披露指出,IBM 开发者将代码作为开源项目而非 IBM 产品发布,且 IBM 对提供功能增强、更新或支持不承担义务。
可用性与 Granite 系列背景
模型权重可从 Hugging Face Hub 下载,并通过 granite‑tsfm 包(版本 0.3.9 及以上)通过 pipeline API 加载。IBM 的示例代码可对 ETTh1 序列的最近 512 个样本生成预测,包括所需的分位数,IBM 将该模型定位于需求、价格、能源负荷、交通、遥测以及其他定期采样的时间序列场景。
针对流式部署,IBM 与 Confluent 在 Confluent Cloud 的早期访问计划中提供了多款 Granite 时间序列模型(PatchTST-FM-r1、FlowState-r1.1、TTM-r3 和 TSPulse),该平台通过 Apache Flink 在实时流上运行基础模型推理。
IBM Research 对该系列的概述记录了发布背后的血统: 2021 年的 TST,是最早将 transformer 应用于时间序列数据的模型之一;2023 年的 PatchTST 引入了 patch 化和通道独立性;2024 年的 Tiny Time Mixer;以及 2025 年的 FlowState。该概述指出,这些模型累计在超过 1000 亿个数据点上进行训练,且 TTM 系列在 Hugging Face 上的下载量已超过 3700 万。PatchTST-FM-r1——新模型的直接前身——与伦斯勒理工学院共同研发,IBM 的研究版模型采用非商业许可证,而 Granite 系列则以 Apache 2.0 发布。












