Modely a platformy AI

IBM uvádí model Granite PatchTST‑FM‑R2 pro zero‑shot časové řady

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

IBM vydala model Granite Time Series PatchTST-FM-r2 dne 9. září 2026, přibližně 385‑milionový parametrický model pro předpovídání časových řad v režimu zero‑shot, dvojí licencí pod Apache 2.0 a OpenMDW 1.0 Linux Foundation. Váhy modelu, architektura, inference pipeline a kód potřebný k reprodukci benchmarkových výsledků byly spolu s vydáním zveřejněny otevřeně.

IBM oznámila model v blogovém příspěvku na Hugging Face od autorů z IBM Research, představujícím jej jako nástupce PatchTST-FM-r1 a nejnovější model v rodině základních modelů časových řad Granite. Podle oznámení PatchTST-FM-r2 kombinuje aktualizovanou architekturu, větší korpus pro předtrénování, pravděpodobnostní předpovědi a podporu imputace chybějících hodnot a generuje předpovědi na nových datech bez dolaďování či úpravy pro konkrétní úlohu.

Uvedené pořadí v GIFT‑Eval

GIFT‑Eval je komplexní benchmark pro hodnocení modelů předpovídání napříč různými datovými sadami a scénáři a nižší hodnoty jsou lepší jak pro CRPS, tak pro MASE, dvě metriky, které IBM uvádí. IBM uvedla, že k 8. září 2026 je PatchTST-FM-r2 na druhém místě mezi replikovatelnými zero‑shot modely pro obě metriky a je nejvýkonnějším modelem v této kategorii mezi modely vydanými pod permisivními, obchodně přívětivými licencemi. V oznámení je uveden geometrický průměr CRPS 0,467, těsně za modelem TimesFM‑3, a geometrický průměr MASE 0,6846.

Některé modely v GIFT‑Eval jsou zařazeny jako předtrénované spíše než čistě zero‑shot, což znamená, že mohou zahrnovat tréninkové části evaluačních datových sad benchmarku ve svých předtrénovacích korpusech. IBM uvedla, že i když jsou tyto modely do srovnání zahrnuty, PatchTST-FM-r2 se umisťuje na třetím místě v CRPS a čtvrtém místě v MASE mezi replikovatelnými modely, před předtrénovanými Chronos‑2, Timer‑S1 a variantami Toto, z nichž některé jsou výrazně větší.

Modelová karta, kterou vytvořili Jiří Navrátil, Wesley M. Gifford, Yunshi Wen, Chandra K. Reddy a Agung Julius, uvádí druhé místo replikovatelného zero‑shot modelu k 31. srpnu 2026 a poznamenává, že výsledky modelu jsou součástí čekajícího pull requestu zaslaného do benchmarku GIFT‑Eval; oznámení uvádí stejné postavení k 8. září 2026.

Architektura Conformer

PatchTST-FM-r2 zachovává patch‑založenou reprezentaci svého předchůdce, ale nahrazuje standardní transformerové bloky bloky conformer, designem, který vznikl v oblasti zpracování řeči. Každý blok obsahuje dvě půlkrokové feed‑forward vrstvy obklopující multi‑head self‑attention a vrstvu temporální konvoluce, s alternujícími velikostmi konvolučních jader 3 a 5 v opakujícím se vzoru {5, 5, 3, 3}. IBM uvedla, že konvoluční komponenta zachycuje krátkodobou temporální strukturu, což umožňuje attention mechanismu soustředit se na dlouhodobé vztahy mezi patchemi.

Model používá 50 % překrývající se patche – délka patche 16, krok 8 – s vážením Hammingovým oknem během trénování a metodou overlap‑and‑add při inferenci, plus před‑hlavní layer norm pro stabilitu trénování. Má skrytou dimenzi 1024 a 30 bloků, oproti 20 v r1, podporuje kontextové délky až 8 192 kroků a předpovídá 99 kvantilů pro flexibilní délky předpovědí, čímž generuje jak bodové předpovědi, tak intervaly nejistoty. Implementace je dostupná v open‑source repozitáři granite‑tsfm a zůstává zpětně kompatibilní s kontrolními body PatchTST‑FM‑r1.

Tréninková data a licencování

Dokumentovaný korpus pro předtrénování má čtyři zdroje: vybrané datové sady z GiftEvalPretrain; vlastní syntetická data založená na KernelSynth s upravenými periodickými jádry a omezenou augmentací; korpus TSMixup vytvořený pomocí přístupu popsaného v článku Chronos, ale omezený na datové sady mimo evaluační sadu GIFT‑Eval; a přibližně 500 000 syntetických sekvencí CauKer, každá o délce 4 096. Modelová karta uvádí, že dataset CauKer byl vytvořen týmem IBM FlowState, a odkazuje na arXivový článek z roku 2026 „Revisiting the Generic Transformer: Deconstructing a Strong Baseline for Time Series Foundation Models“ jako na základní přístup.

Uživatelé si mohou vybrat buď licenci Apache 2.0, nebo OpenMDW 1.0, licenční rámec Linux Foundation určený pro AI modely a související materiály. IBM uvedla, že obě licence poskytují široká, permisivní práva k používání, úpravě a distribuci modelu a že cílí na snížení překážek při adopci. V odhalení na modelové kartě je uvedeno, že vývojáři IBM vytvořili kód jako open‑source projekt, nikoli jako produkt IBM, a že IBM není povinna poskytovat vylepšení, aktualizace ani podporu.

Dostupnost a kontext rodiny Granite

Váhy lze stáhnout z Hugging Face Hub a načíst pomocí balíčku granite‑tsfm, verze 0.3.9 nebo novější, prostřednictvím pipeline API. Ukázkový kód IBM generuje předpověď, včetně požadovaných kvantilů, z posledních 512 vzorků řady ETTh1 a IBM model umisťuje pro předpovědi poptávky, cen, energetických zátěží, provozu, telemetrie a dalších pravidelně vzorkovaných časových řad.

Pro nasazení na streamování IBM a Confluent zpřístupnily několik modelů Granite Time Series (PatchTST‑FM‑r1, FlowState‑r1.1, TTM‑r3 a TSPulse) prostřednictvím programu Early Access v Confluent Cloud, který provádí inferenci základních modelů na živých streamech pomocí Apache Flink.

Přehled IBM Research o rodině dokumentuje genealogii předchozích verzí: TST v roce 2021, jeden z prvních transformerových modelů aplikovaných na časové řady; PatchTST v roce 2023, který zavedl patchování a nezávislost kanálů; Tiny Time Mixer v roce 2024; a FlowState v roce 2025. Podle tohoto přehledu byly modely společně trénovány na více než 100 miliardách datových bodů a modely TTM překročily 37 milionů stažení na Hugging Face. PatchTST‑FM‑r1, přímý předchůdce nového modelu, byl spoluvyvíjen s Rensselaer Polytechnic Institute a modely výzkumné verze IBM mají nekomerční licenci, zatímco řada Granite je publikována pod licencí Apache 2.0.

Jonas Reeve je analytikum generovaným pomocí AI ve společnosti Unite.AI, zaměřujícím se na kognitivní AI, umělou obecnou inteligenci (AGI) a teoretické základy strojového učení. Jeho práce zkoumá, jak se učí, reasoning, paměť a abstrakce objevují v biologických i umělých systémech, a to tím, že spojuje moderní architektury AI s dlouholetými otázkami kognitivní vědy a filozofie mysli.
S konceptuálním a reflexivním přístupem Jonas zkoumá rámce, jako jsou modely uvažování, agentic systémy, emergentní kognice a teorie sladění, s cílem objasnit, co skutečně znamená pokrok směrem k AGI - a co ne. Místo toho, aby sledoval termíny nebo hype, zdůrazňuje první principy, konceptuální rigor a limity současných modelů.
Články napsané Jonasem Reeveem jsou generovány pomocí AI a recenzovány redakčním týmem Unite.AI, aby zajistily přesnost, jasnost a odpovědnou diskusi o pokročilých konceptech AI.