AI 모델 및 플랫폼
IBM, Granite PatchTST-FM-R2 제로샷 시계열 모델 출시

IBM은 2026년 9월 9일에 Granite Time Series PatchTST-FM-r2를 출시했으며, 약 3억 8500만 파라미터를 가진 제로샷 시계열 예측 모델로 Apache 2.0과 Linux Foundation의 OpenMDW 1.0 두 가지 라이선스로 제공됩니다. 모델 가중치, 아키텍처, 추론 파이프라인 및 벤치마크 결과를 재현하는 데 필요한 코드는 모두 공개되었습니다.
IBM은 IBM Research 저자들이 작성한 Hugging Face 블로그 게시물에서 이 모델을 발표했으며, PatchTST-FM-r1의 후속 모델이자 Granite 시계열 기반 모델 패밀리의 최신 모델로 소개했습니다. 발표에 따르면 PatchTST-FM-r2는 업데이트된 아키텍처, 더 큰 사전학습 코퍼스, 확률적 예측 및 결측값 보간 지원을 결합했으며, 파인튜닝이나 특정 작업에 맞춘 학습 없이 새로운 데이터에 대한 예측을 생성합니다.
보고된 GIFT-Eval 순위
GIFT-Eval은 다양한 데이터셋과 시나리오에서 예측 모델을 평가하기 위한 포괄적인 벤치마크이며, IBM이 보고한 두 지표인 CRPS와 MASE 모두 값이 낮을수록 좋습니다. IBM은 2026년 9월 8일 기준으로 PatchTST-FM-r2가 재현 가능하고 제로샷인 모델 중 두 지표 모두에서 2위를 차지했으며, 관용적이고 상업 친화적인 라이선스로 출시된 모델 중 가장 높은 성능을 보인다고 밝혔습니다. 발표에 따르면 기하 평균 CRPS는 0.467로 TimesFM-3 바로 뒤이며, 기하 평균 MASE는 0.6846입니다.
GIFT-Eval에 포함된 일부 모델은 엄격한 제로샷이 아닌 사전학습 모델로 분류되며, 이는 벤치마크 평가 데이터셋의 학습 부분을 사전학습 코퍼스에 포함할 수 있음을 의미합니다. IBM은 이러한 모델들을 비교에 포함하더라도 PatchTST-FM-r2가 재현 가능한 모델 중 CRPS에서 3위, MASE에서 4위를 차지하며, 사전학습된 Chronos-2, Timer-S1, Toto 변형보다 앞선다고 밝혔습니다. 이들 중 일부는 훨씬 더 큰 규모입니다.
모델 카드는 Jiri Navratil, Wesley M. Gifford, Yunshi Wen, Chandra K. Reddy, Agung Julius가 작성했으며, 재현 가능한 제로샷 2위 기록을 2026년 8월 31일로 지정하고 모델 결과가 GIFT-Eval 벤치마크에 제출된 보류 중인 풀 리퀘스트에 포함되어 있음을 언급합니다; 발표에서는 동일한 순위를 2026년 9월 8일로 기록했습니다.
Conformer 아키텍처
PatchTST-FM-r2는 이전 모델의 패치 기반 표현을 유지하면서 표준 트랜스포머 블록을 Conformer 블록으로 교체했으며, 이 설계는 음성 처리에서 시작되었습니다. 각 블록은 멀티헤드 자체 주의와 시간 합성곱 레이어를 둘러싼 두 개의 반단계 피드포워드 레이어로 구성되며, {5, 5, 3, 3} 패턴으로 3과 5의 합성곱 커널 크기가 교대로 적용됩니다. IBM은 합성곱 구성 요소가 단거리 시간 구조를 포착하여 주의 메커니즘이 패치 간 장거리 관계에 집중할 수 있게 한다고 밝혔습니다.
이 모델은 50% 겹치는 패치(패치 길이 16, 스트라이드 8)를 사용하며, 학습 시에는 해밍 윈도우 가중치를 적용하고 추론 시에는 겹침-덧셈 방식으로 예측합니다. 또한 학습 안정성을 위해 사전 헤드 레이어 정규화가 적용됩니다. 은닉 차원은 1024이고 블록 수는 r1의 20에서 증가한 30이며, 최대 8,192 단계까지의 컨텍스트 길이를 지원하고, 유연한 예측 길이에 대해 99개의 분위수를 예측해 점 예측과 불확실성 구간을 모두 제공합니다. 구현은 오픈소스 granite-tsfm 저장소에서 제공되며 PatchTST-FM-r1 체크포인트와의 하위 호환성을 유지합니다.
학습 데이터 및 라이선스
문서화된 사전학습 코퍼스는 네 가지 출처: GiftEvalPretrain에서 선택된 데이터셋; 수정된 주기 커널과 제한된 증강을 적용한 KernelSynth 기반 맞춤 합성 데이터; Chronos 논문에서 설명된 방식을 사용해 생성했지만 GIFT-Eval 평가 세트 외의 데이터셋으로 제한한 TSMixup 코퍼스; 그리고 길이 4,096인 약 500,000개의 합성 CauKer 시퀀스입니다. 모델 카드에는 CauKer 데이터셋이 IBM의 FlowState 팀에 의해 생성되었으며, 기반 접근법으로 2026년 arXiv 논문 “Revisiting the Generic Transformer: Deconstructing a Strong Baseline for Time Series Foundation Models”를 인용하고 있다고 명시되어 있습니다.
사용자는 Apache 2.0 라이선스와 Linux Foundation이 AI 모델 및 관련 자료를 위해 설계한 OpenMDW 1.0 중 하나를 선택할 수 있습니다. IBM은 두 라이선스 모두 모델을 사용, 수정, 배포할 수 있는 폭넓고 관용적인 권리를 부여하며 채택 장벽을 낮추는 것이 목표라고 밝혔습니다. 모델 카드에는 IBM 개발자들이 코드를 IBM 제품이 아닌 오픈소스 프로젝트로 제작했으며, IBM은 향상, 업데이트 또는 지원을 제공할 의무가 없다고 명시되어 있습니다.
가용성 및 Granite 패밀리 맥락
가중치는 Hugging Face Hub에서 다운로드할 수 있으며, granite-tsfm 패키지 버전 0.3.9 이상을 통해 파이프라인 API로 로드됩니다. IBM의 예제 코드는 ETTh1 시계열의 마지막 512 샘플을 사용해 요청된 분위수를 포함한 예측을 생성하며, IBM은 이 모델을 수요, 가격, 에너지 부하, 교통, 텔레메트리 및 기타 정기적으로 샘플링되는 시계열에 적용한다고 제시합니다.
스트리밍 배포를 위해 IBM과 Confluent는 Confluent Cloud의 Early Access 프로그램을 통해 여러 Granite Time Series 모델(PatchTST-FM-r1, FlowState-r1.1, TTM-r3, TSPulse)을 제공하고 있으며, 이 프로그램은 Apache Flink를 통해 실시간 스트림에서 기반 모델 추론을 수행합니다.
IBM Research 개요는 이번 출시 배경의 계보를 문서화하고 있습니다: 2021년 TST는 시계열 데이터에 적용된 최초의 트랜스포머 기반 모델 중 하나였으며; 2023년 PatchTST는 패치와 채널 독립성을 도입했습니다; 2024년 Tiny Time Mixer; 2025년 FlowState. 해당 개요에 따르면 이 모델들은 총 1천억 개 이상의 데이터 포인트로 학습되었으며, TTM 모델은 Hugging Face에서 3,700만 건 이상의 다운로드를 기록했습니다. 새로운 모델의 직접 전임자인 PatchTST-FM-r1은 Rensselaer Polytechnic Institute와 공동 개발했으며, IBM의 연구 버전 모델은 비상업적 라이선스를 가지고 있는 반면 Granite 라인은 Apache 2.0 하에 공개되었습니다.












