Modelos e plataformas de IA

IBM lança Granite PatchTST-FM-R2, modelo de séries temporais zero-shot

mm
Adicione Unite.AI às suas fontes preferidas no Google

A IBM lançou o Granite Time Series PatchTST-FM-r2 em 9 de setembro de 2026, um modelo de previsão de séries temporais zero-shot com aproximadamente 385 milhões de parâmetros, licenciado duplamente sob Apache 2.0 e OpenMDW 1.0 da Linux Foundation. Os pesos do modelo, a arquitetura, o pipeline de inferência e o código necessários para reproduzir seus resultados de benchmark foram todos publicados abertamente com o lançamento.

A IBM anunciou o modelo em um post no blog da Hugging Face pelos autores da IBM Research, apresentando-o como sucessor do PatchTST-FM-r1 e o modelo mais recente da família de modelos de fundação de séries temporais Granite. Segundo o anúncio, o PatchTST-FM-r2 combina uma arquitetura atualizada, um corpus de pré‑treinamento maior, previsão probabilística e suporte à imputação de valores ausentes, e gera previsões em novos dados sem ajuste fino ou treinamento específico para a tarefa.

Classificações Reportadas no GIFT-Eval

O GIFT-Eval é um benchmark abrangente para avaliar modelos de previsão em diversos conjuntos de dados e cenários, e valores menores são melhores tanto para CRPS quanto para MASE, as duas métricas relatadas pela IBM. A IBM informou que, em 8 de setembro de 2026, o PatchTST-FM-r2 ocupa a segunda posição entre modelos replicáveis zero-shot em ambas as métricas, sendo o modelo de melhor desempenho nessa categoria entre os modelos lançados sob licenças permissivas e amigáveis ao comércio. O anúncio relata um CRPS médio geométrico de 0,467, imediatamente atrás do TimesFM-3, e um MASE médio geométrico de 0,6846.

Alguns modelos no GIFT-Eval são categorizados como pré‑treinados em vez de estritamente zero-shot, o que significa que podem incluir as partes de treinamento dos conjuntos de dados de avaliação do benchmark em seus corpora de pré‑treinamento. A IBM afirmou que, mesmo quando esses modelos são adicionados à comparação, o PatchTST-FM-r2 fica em terceiro lugar para CRPS e quarto para MASE entre modelos replicáveis, à frente das variantes pré‑treinadas Chronos-2, Timer-S1 e Toto, algumas delas consideravelmente maiores.

O cartão do modelo, escrito por Jiri Navratil, Wesley M. Gifford, Yunshi Wen, Chandra K. Reddy e Agung Julius, data a classificação número dois replicável zero-shot em 31 de agosto de 2026, e observa que os resultados do modelo estão em um pull request pendente submetido ao benchmark GIFT-Eval; o anúncio data a mesma classificação em 8 de setembro de 2026.

Arquitetura Conformer

O PatchTST-FM-r2 mantém a representação baseada em patches de seu predecessor, mas substitui os blocos padrão de transformer por blocos conformer, um design que se originou no processamento de fala. Cada bloco contém duas camadas feed‑forward de meio passo envolvendo auto‑atenção multi‑cabeça e uma camada de convolução temporal, com tamanhos de kernel de convolução alternados de 3 e 5 em um padrão repetido {5, 5, 3, 3}. A IBM afirmou que o componente de convolução captura a estrutura temporal de curto alcance, permitindo que o mecanismo de atenção se concentre nas relações de longo alcance entre os patches.

O modelo usa patches com 50 % de sobreposição — comprimento de patch 16, passo 8 — com ponderação por janela de Hamming durante o treinamento e previsão por sobreposição e soma na inferência, além de uma normalização de camada pré‑cabeça aplicada para estabilidade do treinamento. Possui uma dimensão oculta de 1024 e 30 blocos, em comparação com 20 no r1, suporta comprimentos de contexto de até 8 192 passos e prevê 99 quantis em comprimentos de previsão flexíveis, produzindo tanto previsões pontuais quanto intervalos de incerteza. A implementação está disponível no repositório de código aberto granite-tsfm e permanece compatível retroativamente com checkpoints do PatchTST-FM-r1.

Dados de Treinamento e Licenciamento

O corpus de pré‑treinamento documentado possui quatro fontes: conjuntos de dados selecionados do GiftEvalPretrain; dados sintéticos personalizados baseados no KernelSynth com kernels periódicos modificados e augmentação limitada; um corpus TSMixup gerado usando a abordagem descrita no artigo Chronos, mas restrito a conjuntos de dados fora do conjunto de avaliação GIFT-Eval; e aproximadamente 500 000 sequências sintéticas CauKer, cada uma com comprimento de 4 096. O cartão do modelo observa que o conjunto de dados CauKer foi gerado pela equipe FlowState da IBM, e cita o artigo arXiv de 2026 “Revisiting the Generic Transformer: Deconstructing a Strong Baseline for Time Series Foundation Models” como base da abordagem.

Os usuários podem escolher entre a licença Apache 2.0 ou a OpenMDW 1.0, um framework de licenciamento da Linux Foundation projetado para modelos de IA e materiais relacionados. A IBM afirmou que ambas as licenças concedem direitos amplos e permissivos para usar, modificar e distribuir o modelo, e que visa reduzir barreiras à adoção. Uma divulgação no cartão do modelo indica que desenvolvedores da IBM produziram o código como um projeto de código aberto, e não como um produto da IBM, e que a IBM não tem obrigação de fornecer aprimoramentos, atualizações ou suporte.

Disponibilidade e Contexto da Família Granite

Os pesos podem ser baixados do Hugging Face Hub e carregados através do pacote granite-tsfm, versão 0.3.9 ou posterior, via API de pipeline. O código de exemplo da IBM gera uma previsão, incluindo os quantis solicitados, a partir das últimas 512 amostras de uma série ETTh1, e a IBM posiciona o modelo para demanda, preços, cargas de energia, tráfego, telemetria e outras séries temporais amostradas regularmente.

Para implantações em streaming, a IBM e a Confluent disponibilizaram vários modelos Granite Time Series (PatchTST-FM-r1, FlowState-r1.1, TTM-r3 e TSPulse) por meio de um programa de Acesso Antecipado na Confluent Cloud, que executa inferência de modelos de fundação em fluxos ao vivo através do Apache Flink.

Uma visão geral da IBM Research sobre a família documenta a linhagem por trás do lançamento: TST em 2021, entre os primeiros modelos baseados em transformer aplicados a dados de séries temporais; PatchTST em 2023, que introduziu patching e independência de canais; Tiny Time Mixer em 2024; e FlowState em 2025. Segundo essa visão geral, os modelos foram treinados coletivamente em mais de 100 bilhões de pontos de dados, e os modelos TTM ultrapassaram 37 milhões de downloads no Hugging Face. O PatchTST-FM-r1, predecessor direto do novo modelo, foi co‑desenvolvido com o Rensselaer Polytechnic Institute, e os modelos de versão de pesquisa da IBM possuem licença não comercial, enquanto a linha Granite é publicada sob Apache 2.0.

Jonas Reeve é um analista gerado por IA na Unite.AI, com foco em inteligência artificial cognitiva, inteligência artificial geral (AGI) e fundamentos teóricos de inteligência de máquina. Seu trabalho explora como aprendizado, raciocínio, memória e abstração surgem em sistemas biológicos e artificiais, estabelecendo conexões entre arquiteturas de IA modernas e questões de longa data em ciência cognitiva e filosofia da mente.
Com uma abordagem conceitual e reflexiva, Jonas examina estruturas como modelos de raciocínio, sistemas agênticos, cognição emergente e teoria de alinhamento, visando esclarecer o que o progresso em direção à AGI realmente significa - e o que não significa. Em vez de perseguir cronogramas ou hype, ele enfatiza princípios fundamentais, rigor conceitual e os limites dos modelos atuais.
Artigos escritos por Jonas Reeve são gerados por IA e revisados pela equipe editorial da Unite.AI para garantir precisão, clareza e discussão responsável de conceitos de IA avançados.