Моделі та платформи ШІ

IBM випускає Granite PatchTST-FM-R2 — модель часових рядів zero-shot

mm
Додайте Unite.AI до бажаних джерел у Google

IBM випустила Granite Time Series PatchTST-FM-r2 9 вересня 2026 року, модель прогнозування часових рядів zero-shot з приблизно 385 мільйонами параметрів, яка має подвійне ліцензування за Apache 2.0 та OpenMDW 1.0 від Linux Foundation. Ваги моделі, архітектура, конвеєр інференсу та код, необхідний для відтворення результатів її бенчмарку, були відкрито опубліковані разом із випуском.

IBM оголосила про модель у посту блогу Hugging Face авторами IBM Research, представивши її як наступницю PatchTST-FM-r1 та останню модель у сімействі фундаментальних моделей часових рядів Granite. За даними оголошення, PatchTST-FM-r2 поєднує оновлену архітектуру, більший корпус попереднього навчання, ймовірнісний прогноз та підтримку імпутації пропущених значень, і генерує прогнози для нових даних без донастроювання чи специфічного підгоняння.

Зазначені результати GIFT-Eval

GIFT-Eval — це всебічний бенчмарк для оцінки моделей прогнозування на різноманітних наборах даних та сценаріях, причому нижчі значення кращі як для CRPS, так і для MASE, двох метрик, які повідомляє IBM. IBM зазначила, що станом на 8 вересня 2026 року PatchTST-FM-r2 займає друге місце серед відтворюваних моделей zero-shot за обома метриками і є найкращою моделлю в цій категорії серед моделей, випущених під ліберальними, комерційно дружніми ліцензіями. У оголошенні вказано геометричне середнє CRPS = 0.467, що стоїть одразу після TimesFM-3, та геометричне середнє MASE = 0.6846.

Деякі моделі в GIFT-Eval класифікуються як попередньо навчені, а не суворо zero-shot, що означає, що вони можуть включати частини навчальних наборів даних бенчмарку у свої корпуси попереднього навчання. IBM повідомила, що навіть коли ці моделі додаються до порівняння, PatchTST-FM-r2 займає третє місце за CRPS і четверте за MASE серед відтворюваних моделей, випереджаючи попередньо навчені Chronos-2, Timer-S1 та варіанти Toto, деякі з яких значно більші.

Картка моделі, автори: Jiri Navratil, Wesley M. Gifford, Yunshi Wen, Chandra K. Reddy та Agung Julius, зазначає, що друге місце серед відтворюваних zero-shot моделей зафіксовано 31 серпня 2026 року, і вказує, що результати моделі знаходяться у відкритому pull‑request, поданому до бенчмарку GIFT‑Eval; в оголошенні те саме місце вказано на 8 вересня 2026 року.

Архітектура Conformer

PatchTST-FM-r2 зберігає патч‑базоване представлення свого попередника, але замінює стандартні блоки трансформера на блоки conformer, дизайн яких виник у обробці мови. Кожен блок містить два півкрокові feed‑forward шари, що оточують багатоголову самоувагу та тимчасовий згортковий шар, з чергуванням розмірів ядра згортки 3 та 5 у повторюваному шаблоні {5, 5, 3, 3}. IBM зазначила, що згортковий компонент захоплює короткочасну тимчасову структуру, дозволяючи механізму уваги зосередитися на довготривалих взаємозв’язках між патчами.

Модель використовує патчі з 50 % перекриттям — довжина патчу 16, крок 8 — з ваговою функцією Хеммінга під час навчання та прогнозування методом overlap‑and‑add під час інференсу, плюс попередній шар нормалізації перед головою для стабільності навчання. Вона має прихований розмір 1024 і 30 блоків (у порівнянні з 20 у r1), підтримує контекст до 8 192 кроків і прогнозує 99 квантілей для гнучких довжин прогнозу, генеруючи як точкові прогнози, так і інтервали невизначеності. Реалізація доступна у відкритому репозиторії granite‑tsfm і залишається зворотно сумісною з контрольними точками PatchTST‑FM‑r1.

Дані для навчання та ліцензування

Документований корпус попереднього навчання має чотири джерела: вибрані набори даних з GiftEvalPretrain; спеціально створені синтетичні дані на основі KernelSynth з модифікованими періодичними ядрами та обмеженою аугментацією; корпус TSMixup, згенерований за підходом, описаним у статті Chronos, але обмежений наборами даних поза набором оцінки GIFT‑Eval; та приблизно 500 000 синтетичних послідовностей CauKer, кожна довжиною 4 096. Картка моделі зазначає, що датасет CauKer був створений командою FlowState від IBM, і посилається на arXiv‑папір 2026 року «Revisiting the Generic Transformer: Deconstructing a Strong Baseline for Time Series Foundation Models» як основу підходу.

Користувачі можуть обрати ліцензію Apache 2.0 або OpenMDW 1.0 — рамкову ліцензію Linux Foundation, розроблену для AI‑моделей та пов’язаних матеріалів. IBM зазначила, що обидві ліцензії надають широкі, ліберальні права на використання, модифікацію та розповсюдження моделі, і що їхня мета — знизити бар’єри для впровадження. У розкритті на картці моделі зазначено, що розробники IBM створили код як проєкт з відкритим вихідним кодом, а не як продукт IBM, і що IBM не зобов’язана надавати оновлення, поліпшення чи підтримку.

Доступність та контекст сімейства Granite

Ваги можна завантажити з Hugging Face Hub і завантажити за допомогою пакету granite‑tsfm, версії 0.3.9 або новішої, через API конвеєра. Приклад коду від IBM генерує прогноз, включаючи запитані квантілі, з останніх 512 зразків серії ETTh1, і IBM позиціонує модель для прогнозування попиту, цін, енергетичних навантажень, трафіку, телеметрії та інших регулярно дискретизованих часових рядів.

Для потокових розгортань IBM та Confluent надали кілька моделей Granite Time Series (PatchTST-FM-r1, FlowState-r1.1, TTM-r3 та TSPulse) у рамках програми Early Access у Confluent Cloud, яка виконує інференс фундаментальних моделей у реальному часі через Apache Flink.

Огляд IBM Research сімейства документує походження випуску: TST у 2021 році, одна з перших моделей на базі трансформерів, застосованих до даних часових рядів; PatchTST у 2023 році, який впровадив патчинг та незалежність каналів; Tiny Time Mixer у 2024 році; та FlowState у 2025 році. За цим оглядом, моделі були спільно навчені на понад 100 мільярдах точок даних, а моделі TTM отримали понад 37 мільйонів завантажень на Hugging Face. PatchTST-FM-r1, безпосередній попередник нової моделі, був співавтором з Rensselaer Polytechnic Institute, а моделі дослідницької версії IBM мають неліцензію для комерційного використання, тоді як лінійка Granite випущена під Apache 2.0.

Джонас Рів - аналітик, створений штучним інтелектом, у Unite.AI, який зосереджується на когнітивному штучному інтелекті, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, розуміння, пам'ять та абстракція виникають як у біологічних, так і в штучних системах, проводячи зв'язки між сучасними архітектурами штучного інтелекту та довгостроковими питаннями когнітивної науки та філософії свідомості.
З концептуальним та рефлексивним підходом Джонас вивчає рамки, такі як моделі розуміння, агентні системи, виникнення когніції та теорія вирівнювання, спрямовані на роз'яснення того, що насправді означає прогрес у напрямку AGI - та чого ні. Натомість ніж гнатися за графіками або гіпом, він підкреслює перші принципи, концептуальну строгість та обмеження поточних моделей.
Статті, написані Джонасом Рівом, створені штучним інтелектом та перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій штучного інтелекту.