Mô hình và nền tảng AI
IBM Phát Hành Mô Hình Dòng Thời Gian Zero-Shot Granite PatchTST-FM-R2

IBM đã phát hành Granite Time Series PatchTST-FM-r2 vào ngày 9 tháng 9 năm 2026, một mô hình dự báo chuỗi thời gian zero-shot với khoảng 385 triệu tham số, được cấp phép kép theo Apache 2.0 và OpenMDW 1.0 của Linux Foundation. Trọng số mô hình, kiến trúc, pipeline suy luận và mã cần thiết để tái tạo kết quả benchmark đều được công bố công khai cùng với bản phát hành.
IBM công bố mô hình này trong một bài đăng blog trên Hugging Face của các tác giả từ IBM Research, giới thiệu nó như là người kế thừa của PatchTST-FM-r1 và là mô hình mới nhất trong họ mô hình nền tảng chuỗi thời gian Granite. Theo thông báo, PatchTST-FM-r2 kết hợp kiến trúc được cập nhật, tập dữ liệu tiền huấn luyện lớn hơn, dự báo xác suất và hỗ trợ điền giá trị thiếu, đồng thời tạo ra dự báo trên dữ liệu mới mà không cần tinh chỉnh hay huấn luyện riêng cho nhiệm vụ.
Kết Quả Đánh Giá GIFT-Eval Được Báo Cáo
GIFT-Eval là một bộ chuẩn toàn diện để đánh giá các mô hình dự báo trên nhiều bộ dữ liệu và kịch bản khác nhau, và giá trị thấp hơn là tốt hơn cho cả hai chỉ số CRPS và MASE, hai chỉ số mà IBM công bố. IBM cho biết tính đến ngày 8 tháng 9 năm 2026, PatchTST-FM-r2 đứng thứ hai trong số các mô hình zero-shot có thể tái tạo cho cả hai chỉ số, và là mô hình có hiệu năng cao nhất trong danh mục này trong số các mô hình được phát hành dưới các giấy phép cho phép, thân thiện với thương mại. Thông báo ghi nhận CRPS trung bình hình học là 0,467, ngay sau TimesFM-3, và MASE trung bình hình học là 0,6846.
Một số mô hình trong GIFT-Eval được phân loại là tiền huấn luyện thay vì chỉ zero-shot, nghĩa là chúng được phép bao gồm các phần dữ liệu huấn luyện của bộ đánh giá benchmark trong tập dữ liệu tiền huấn luyện của mình. IBM cho biết ngay cả khi các mô hình này được đưa vào so sánh, PatchTST-FM-r2 vẫn xếp thứ ba về CRPS và thứ tư về MASE trong số các mô hình có thể tái tạo, vượt lên trước các biến thể Chronos-2, Timer-S1 và Toto đã được tiền huấn luyện, một số trong số chúng lớn hơn đáng kể.
Thẻ mô hình, do Jiri Navratil, Wesley M. Gifford, Yunshi Wen, Chandra K. Reddy và Agung Julius biên soạn, ghi nhận vị trí thứ hai của mô hình zero-shot có thể tái tạo vào ngày 31 tháng 8 năm 2026, và lưu ý rằng kết quả của mô hình đang nằm trong một pull request đang chờ xử lý được gửi tới benchmark GIFT-Eval; thông báo ghi ngày cùng vị trí này là ngày 8 tháng 9 năm 2026.
Kiến Trúc Conformer
PatchTST-FM-r2 vẫn giữ cách biểu diễn dựa trên patch của phiên bản tiền nhiệm nhưng thay thế các khối transformer tiêu chuẩn bằng các khối conformer, một thiết kế xuất phát từ xử lý giọng nói. Mỗi khối chứa hai lớp feed-forward nửa bước bao quanh cơ chế tự chú ý đa đầu và một lớp convolution thời gian, với kích thước kernel convolution luân phiên 3 và 5 theo mẫu lặp {5, 5, 3, 3}. IBM cho biết thành phần convolution nắm bắt cấu trúc thời gian ngắn hạn, cho phép cơ chế chú ý tập trung vào các mối quan hệ dài hạn giữa các patch.
Mô hình sử dụng các patch chồng lấn 50% — độ dài patch 16, stride 8 — với trọng số cửa sổ Hamming trong quá trình huấn luyện và dự báo overlap-and-add khi suy luận, cộng với chuẩn hoá lớp trước đầu (pre-head layer norm) để tăng ổn định huấn luyện. Nó có chiều ẩn 1024 và 30 khối, tăng từ 20 trong r1, hỗ trợ độ dài ngữ cảnh lên tới 8.192 bước, và dự đoán 99 quantile trên các độ dài dự báo linh hoạt, tạo ra cả dự báo điểm và khoảng tin cậy. Cài đặt có sẵn trong kho mã nguồn mở granite-tsfm và vẫn tương thích ngược với các checkpoint của PatchTST-FM-r1.
Dữ Liệu Huấn Luyện và Giấy Phép
Tập dữ liệu tiền huấn luyện được ghi chép bao gồm bốn nguồn: các bộ dữ liệu được chọn từ GiftEvalPretrain; dữ liệu tổng hợp tùy chỉnh dựa trên KernelSynth với các kernel tuần hoàn đã được chỉnh sửa và tăng cường hạn chế; một tập dữ liệu TSMixup được tạo ra bằng cách áp dụng phương pháp được mô tả trong bài báo Chronos nhưng chỉ giới hạn ở các bộ dữ liệu nằm ngoài tập đánh giá GIFT-Eval; và khoảng 500.000 chuỗi CauKer tổng hợp, mỗi chuỗi có độ dài 4.096. Thẻ mô hình ghi chú rằng bộ dữ liệu CauKer được tạo ra bởi nhóm FlowState của IBM, và trích dẫn bài báo arXiv năm 2026 “Revisiting the Generic Transformer: Deconstructing a Strong Baseline for Time Series Foundation Models” cho phương pháp cơ bản.
Người dùng có thể lựa chọn giấy phép Apache 2.0 hoặc OpenMDW 1.0, một khung giấy phép của Linux Foundation được thiết kế cho các mô hình AI và tài liệu liên quan. IBM cho biết cả hai giấy phép đều cung cấp quyền rộng rãi, cho phép sử dụng, sửa đổi và phân phối mô hình, và mục tiêu là giảm rào cản tiếp cận. Một tuyên bố trên thẻ mô hình cho biết các nhà phát triển IBM đã tạo ra mã nguồn như một dự án mã nguồn mở chứ không phải là sản phẩm của IBM, và IBM không có bất kỳ nghĩa vụ nào để cung cấp các cải tiến, cập nhật hay hỗ trợ.
Khả Dụng và Bối Cảnh Dòng Sản Phẩm Granite
Các trọng số có thể tải xuống từ Hugging Face Hub và được nạp qua gói granite-tsfm, phiên bản 0.3.9 trở lên, thông qua API pipeline. Mã mẫu của IBM tạo ra một dự báo, bao gồm các quantile yêu cầu, từ 512 mẫu cuối cùng của chuỗi ETTh1, và IBM định vị mô hình này cho các ứng dụng như nhu cầu, giá cả, tải năng lượng, giao thông, dữ liệu viễn thông và các chuỗi thời gian được lấy mẫu định kỳ khác.
Đối với triển khai dạng streaming, IBM và Confluent đã cung cấp một số mô hình Granite Time Series (PatchTST-FM-r1, FlowState-r1.1, TTM-r3 và TSPulse) thông qua chương trình Truy Cập Sớm trên Confluent Cloud, nơi thực hiện suy luận mô hình nền tảng trên các luồng dữ liệu trực tiếp bằng Apache Flink.
Một tổng quan của IBM Research về họ mô hình ghi lại nguồn gốc của bản phát hành: TST vào năm 2021, là một trong những mô hình dựa trên transformer đầu tiên được áp dụng cho dữ liệu chuỗi thời gian; PatchTST vào năm 2023, giới thiệu kỹ thuật patch và tính độc lập kênh; Tiny Time Mixer vào năm 2024; và FlowState vào năm 2025. Theo tổng quan này, các mô hình đã được huấn luyện tổng cộng trên hơn 100 tỷ điểm dữ liệu, và các mô hình TTM đã đạt hơn 37 triệu lượt tải xuống trên Hugging Face. PatchTST-FM-r1, tiền nhiệm trực tiếp của mô hình mới, được đồng phát triển cùng Rensselaer Polytechnic Institute, và các mô hình phiên bản nghiên cứu của IBM mang giấy phép phi thương mại trong khi dòng Granite được công bố dưới Apache 2.0.












