Modelos y plataformas de IA
IBM lanza Granite PatchTST-FM-R2, modelo de series temporales zero-shot

IBM lanzó Granite Time Series PatchTST-FM-r2 el 9 de septiembre de 2026, un modelo de pronóstico de series temporales sin ajuste previo de aproximadamente 385 millones de parámetros, con licencia dual bajo Apache 2.0 y OpenMDW 1.0 de la Linux Foundation. Los pesos del modelo, la arquitectura, la canalización de inferencia y el código necesario para reproducir sus resultados de referencia se publicaron abiertamente con el lanzamiento.
IBM anunció el modelo en una publicación del blog de Hugging Face escrita por autores de IBM Research, presentándolo como el sucesor de PatchTST-FM-r1 y el modelo más reciente de la familia de modelos fundacionales de series temporales Granite. Según el anuncio, PatchTST-FM-r2 combina una arquitectura actualizada, un corpus de preentrenamiento más grande, pronóstico probabilístico y soporte para la imputación de valores faltantes, y genera pronósticos sobre datos nuevos sin ajuste fino ni entrenamiento específico para la tarea.
Posiciones reportadas en GIFT-Eval
GIFT-Eval es un benchmark integral para evaluar modelos de pronóstico en diversos conjuntos de datos y escenarios, y valores más bajos son mejores tanto para CRPS como para MASE, las dos métricas que IBM informa. IBM dijo que, a 8 de septiembre de 2026, PatchTST-FM-r2 ocupa el segundo lugar entre los modelos replicables y zero-shot para ambas métricas, y es el modelo de mayor rendimiento en esa categoría entre los modelos publicados bajo licencias permisivas y amigables con el comercio. El anuncio reporta un CRPS geométrico de 0,467, inmediatamente detrás de TimesFM-3, y un MASE geométrico de 0,6846.
Algunos modelos en GIFT-Eval se clasifican como preentrenados en lugar de estrictamente zero-shot, lo que significa que pueden incluir las porciones de entrenamiento de los conjuntos de datos de evaluación del benchmark en sus corpus de preentrenamiento. IBM afirmó que, incluso cuando esos modelos se añaden a la comparación, PatchTST-FM-r2 se sitúa en tercer lugar para CRPS y cuarto para MASE entre los modelos replicables, por delante de los variantes preentrenados Chronos-2, Timer-S1 y Toto, algunos de los cuales son considerablemente más grandes.
La tarjeta del modelo, redactada por Jiri Navratil, Wesley M. Gifford, Yunshi Wen, Chandra K. Reddy y Agung Julius, fecha la posición número dos replicable zero-shot al 31 de agosto de 2026, y señala que los resultados del modelo están en una solicitud de extracción pendiente enviada al benchmark GIFT-Eval; el anuncio fecha la misma posición al 8 de septiembre de 2026.
Arquitectura Conformer
PatchTST-FM-r2 conserva la representación basada en parches de su predecesor, pero reemplaza los bloques estándar de transformador por bloques conformer, un diseño que se originó en el procesamiento de voz. Cada bloque contiene dos capas feed-forward de medio paso que rodean la auto‑atención multi‑cabeza y una capa de convolución temporal, con tamaños de kernel de convolución alternados de 3 y 5 en un patrón repetitivo {5, 5, 3, 3}. IBM indicó que el componente de convolución captura la estructura temporal de corto alcance, permitiendo que el mecanismo de atención se concentre en relaciones de largo alcance entre los parches.
El modelo utiliza parches con un solapamiento del 50 % — longitud de parche 16, paso 8 — con ponderación de ventana de Hamming durante el entrenamiento y pronóstico de solapamiento‑y‑suma en la inferencia, además de una normalización de capa previa a la cabeza aplicada para la estabilidad del entrenamiento. Posee una dimensión oculta de 1024 y 30 bloques, frente a los 20 de r1, admite longitudes de contexto de hasta 8 192 pasos y predice 99 cuantiles sobre longitudes de pronóstico flexibles, generando tanto pronósticos puntuales como intervalos de incertidumbre. La implementación está disponible en el repositorio de código abierto granite-tsfm y sigue siendo compatible con los puntos de control de PatchTST-FM-r1.
Datos de entrenamiento y licenciamiento
El corpus de preentrenamiento documentado tiene cuatro fuentes: conjuntos de datos seleccionados de GiftEvalPretrain; datos sintéticos personalizados basados en KernelSynth con kernels periódicos modificados y augmentación limitada; un corpus TSMixup generado usando el enfoque descrito en el artículo de Chronos pero restringido a conjuntos de datos fuera del conjunto de evaluación GIFT-Eval; y aproximadamente 500 000 secuencias sintéticas CauKer, cada una con una longitud de 4 096. La tarjeta del modelo señala que el conjunto de datos CauKer fue generado por el equipo FlowState de IBM, y cita el artículo de arXiv 2026 “Revisiting the Generic Transformer: Deconstructing a Strong Baseline for Time Series Foundation Models” como base del enfoque.
Los usuarios pueden elegir entre la licencia Apache 2.0 o OpenMDW 1.0, un marco de licenciamiento de la Linux Foundation diseñado para modelos de IA y materiales relacionados. IBM indicó que ambas licencias otorgan derechos amplios y permisivos para usar, modificar y distribuir el modelo, y que busca reducir las barreras a su adopción. Una divulgación en la tarjeta del modelo indica que los desarrolladores de IBM produjeron el código como un proyecto de código abierto y no como un producto de IBM, y que IBM no tiene obligación de proporcionar mejoras, actualizaciones o soporte.
Disponibilidad y contexto de la familia Granite
Los pesos se pueden descargar desde el Hugging Face Hub y cargar mediante el paquete granite-tsfm, versión 0.3.9 o posterior, a través de una API de pipeline. El código de ejemplo de IBM genera un pronóstico, incluidos los cuantiles solicitados, a partir de las últimas 512 muestras de una serie ETTh1, y IBM posiciona el modelo para demanda, precios, cargas energéticas, tráfico, telemetría y otras series temporales muestreadas de forma regular.
Para implementaciones en streaming, IBM y Confluent han puesto a disposición varios modelos Granite Time Series (PatchTST-FM-r1, FlowState-r1.1, TTM-r3 y TSPulse) a través de un programa de Acceso Anticipado en Confluent Cloud, que ejecuta inferencia de modelos fundacionales en flujos en vivo mediante Apache Flink.
Una visión general de IBM Research sobre la familia documenta la genealogía detrás del lanzamiento: TST en 2021, entre los primeros modelos basados en transformadores aplicados a datos de series temporales; PatchTST en 2023, que introdujo el parcheado y la independencia de canales; Tiny Time Mixer en 2024; y FlowState en 2025. Según esa visión general, los modelos se han entrenado colectivamente con más de 100 mil millones de puntos de datos, y los modelos TTM han superado los 37 millones de descargas en Hugging Face. PatchTST-FM-r1, el predecesor directo del nuevo modelo, fue co‑desarrollado con el Rensselaer Polytechnic Institute, y los modelos de versión de investigación de IBM llevan una licencia no comercial mientras que la línea Granite se publica bajo Apache 2.0.












