KI-Modelle und Plattformen

IBM veröffentlicht Granite PatchTST-FM-R2 Zero-Shot-Zeitreihenmodell

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

IBM hat am 9. September 2026 Granite Time Series PatchTST-FM-r2 veröffentlicht, ein etwa 385‑Millionen‑Parameter‑Zero‑Shot‑Zeitreihen‑Forecast‑Modell, das dual unter Apache 2.0 und dem OpenMDW 1.0‑Lizenzrahmen der Linux Foundation lizenziert ist. Die Modellgewichte, die Architektur, die Inferenz‑Pipeline und der Code, die zur Reproduktion seiner Benchmark‑Ergebnisse erforderlich sind, wurden zusammen mit der Veröffentlichung offen bereitgestellt.

IBM kündigte das Modell in einem Hugging Face Blogbeitrag von Autoren des IBM Research an und stellte es als Nachfolger von PatchTST-FM-r1 sowie als das neueste Modell der Granite‑Zeitreihen‑Foundation‑Model‑Familie vor. Laut der Ankündigung kombiniert PatchTST-FM-r2 eine aktualisierte Architektur, einen größeren Vortrainings‑Korpus, probabilistische Vorhersagen und Unterstützung für die Imputation fehlender Werte und erzeugt Prognosen für neue Daten, ohne Feintuning oder aufgabenspezifische Anpassung.

Gemeldete GIFT‑Eval‑Platzierungen

GIFT‑Eval ist ein umfassender Benchmark zur Bewertung von Prognosemodellen über verschiedene Datensätze und Szenarien hinweg, wobei niedrigere Werte für sowohl CRPS als auch MASE, die beiden von IBM berichteten Metriken, besser sind. IBM gab an, dass PatchTST-FM-r2 zum 8. September 2026 auf dem zweiten Platz unter replizierbaren Zero‑Shot‑Modellen für beide Metriken rangiert und das leistungsstärkste Modell in dieser Kategorie unter Modellen ist, die unter permissiven, kommerziell freundlichen Lizenzen veröffentlicht wurden. Die Ankündigung berichtet einen geometrischen Mittelwert‑CRPS von 0,467, unmittelbar hinter TimesFM‑3, und einen geometrischen Mittelwert‑MASE von 0,6846.

Einige Modelle in GIFT‑Eval werden als vortrainiert und nicht streng Zero‑Shot kategorisiert, was bedeutet, dass sie die Trainingsanteile der Evaluierungsdatensätze des Benchmarks in ihren Vortrainings‑Korpora einbeziehen dürfen. IBM erklärte, dass selbst wenn diese Modelle in den Vergleich aufgenommen werden, PatchTST-FM-r2 auf dem dritten Platz für CRPS und dem vierten Platz für MASE unter replizierbaren Modellen liegt, vor den vortrainierten Varianten Chronos‑2, Timer‑S1 und Toto, von denen einige deutlich größer sind.

Die Model‑Card, verfasst von Jiri Navratil, Wesley M. Gifford, Yunshi Wen, Chandra K. Reddy und Agung Julius, datiert die zweite Position für replizierbare Zero‑Shot‑Modelle auf den 31. August 2026 und weist darauf hin, dass die Ergebnisse des Modells in einem ausstehenden Pull‑Request für den GIFT‑Eval‑Benchmark liegen; die Ankündigung datiert dieselbe Position auf den 8. September 2026.

Conformer‑Architektur

PatchTST-FM-r2 behält die patch‑basierte Darstellung seines Vorgängers bei, ersetzt jedoch die herkömmlichen Transformer‑Blöcke durch Conformer‑Blöcke, ein Design, das ursprünglich in der Sprachverarbeitung entstand. Jeder Block enthält zwei halb‑schrittige Feed‑Forward‑Schichten, die die Multi‑Head‑Selbstaufmerksamkeit und eine zeitliche Faltungsschicht umschließen, mit abwechselnden Faltungskerngrößen von 3 und 5 in einem wiederholenden Muster {5, 5, 3, 3}. IBM erklärte, dass die Faltungskomponente kurze temporale Strukturen erfasst, wodurch der Aufmerksamkeitsmechanismus sich auf langfristige Beziehungen zwischen Patches konzentrieren kann.

Das Modell verwendet 50 % überlappende Patches – Patch‑Länge 16, Schrittweite 8 – mit Hamming‑Fenster‑Gewichtung während des Trainings und Overlap‑and‑Add‑Forecasting bei der Inferenz, sowie einer Vor‑Head‑Layer‑Norm für Trainingsstabilität. Es besitzt eine versteckte Dimension von 1024 und 30 Blöcke (gegenüber 20 in r1), unterstützt Kontextlängen von bis zu 8 192 Schritten und sagt 99 Quantile über flexible Vorhersagelängen voraus, wobei sowohl Punktprognosen als auch Unsicherheitsintervalle erzeugt werden. Die Implementierung ist im Open‑Source‑Repository granite‑tsfm verfügbar und bleibt rückwärtskompatibel zu den Checkpoints von PatchTST‑FM‑r1.

Trainingsdaten und Lizenzierung

Der dokumentierte Vortrainings‑Korpus umfasst vier Quellen: ausgewählte Datensätze von GiftEvalPretrain; benutzerdefinierte synthetische Daten basierend auf KernelSynth mit modifizierten periodischen Kernen und begrenzter Augmentation; ein TSMixup‑Korpus, der nach dem im Chronos‑Papier beschriebenen Ansatz erzeugt wurde, jedoch auf Datensätze außerhalb des GIFT‑Eval‑Evaluationssets beschränkt ist; sowie etwa 500 000 synthetische CauKer‑Sequenzen mit einer Länge von 4 096. Die Model‑Card vermerkt, dass der CauKer‑Datensatz vom FlowState‑Team von IBM generiert wurde, und sie zitiert das arXiv‑Paper von 2026 „Revisiting the Generic Transformer: Deconstructing a Strong Baseline for Time Series Foundation Models“ als zugrunde liegenden Ansatz.

Nutzer können entweder die Apache 2.0‑Lizenz oder OpenMDW 1.0 wählen, ein von der Linux Foundation entwickeltes Lizenz‑Framework für KI‑Modelle und zugehörige Materialien. IBM erklärte, dass beide Lizenzen umfassende, permissive Rechte zur Nutzung, Modifikation und Verbreitung des Modells gewähren und darauf abzielen, Hindernisse für die Adoption zu verringern. Ein Hinweis in der Model‑Card besagt, dass IBM‑Entwickler den Code als Open‑Source‑Projekt und nicht als IBM‑Produkt erstellt haben und dass IBM nicht verpflichtet ist, Verbesserungen, Updates oder Support bereitzustellen.

Verfügbarkeit und Kontext der Granite‑Familie

Die Gewichte können vom Hugging Face Hub heruntergeladen und über das granite‑tsfm‑Paket, Version 0.3.9 oder neuer, mittels einer Pipeline‑API geladen werden. Der Beispielcode von IBM erzeugt eine Vorhersage, einschließlich der angeforderten Quantile, aus den letzten 512 Stichproben einer ETTh1‑Serie, und IBM positioniert das Modell für Nachfrage, Preise, Energieverbrauch, Verkehr, Telemetrie und andere regelmäßig abgetastete Zeitreihen.

Für Streaming‑Einsätze haben IBM und Confluent mehrere Granite‑Time‑Series‑Modelle (PatchTST‑FM‑r1, FlowState‑r1.1, TTM‑r3 und TSPulse) über ein Early‑Access‑Programm in Confluent Cloud bereitgestellt, das Foundation‑Model‑Inference auf Live‑Streams mittels Apache Flink ausführt.

Ein IBM Research‑Überblick über die Familie dokumentiert die Herkunft der Veröffentlichung: TST im Jahr 2021, eines der ersten transformer‑basierten Modelle für Zeitreihendaten; PatchTST im Jahr 2023, das Patching und Kanalunabhängigkeit einführte; Tiny Time Mixer im Jahr 2024; und FlowState im Jahr 2025. Laut diesem Überblick wurden die Modelle gemeinsam auf mehr als 100 Milliarden Datenpunkten trainiert, und TTM‑Modelle haben über 37 Millionen Downloads auf Hugging Face erzielt. PatchTST‑FM‑r1, der direkte Vorgänger des neuen Modells, wurde gemeinsam mit dem Rensselaer Polytechnic Institute entwickelt, und die Forschungs‑Version‑Modelle von IBM tragen eine nicht‑kommerzielle Lizenz, während die Granite‑Linie unter Apache 2.0 veröffentlicht wird.

Jonas Reeve ist ein künstlich intelligenter Analyst bei Unite.AI, der sich auf kognitive KI, künstliche allgemeine Intelligenz (AGI) und die theoretischen Grundlagen der Maschinenintelligenz konzentriert. Seine Arbeit erforscht, wie Lernen, Argumentation, Gedächtnis und Abstraktion in biologischen und künstlichen Systemen entstehen, und zieht Verbindungen zwischen modernen KI-Architekturen und langjährigen Fragen der Kognitivwissenschaft und Philosophie des Geistes.
Mit einem konzeptionellen und reflektierenden Ansatz untersucht Jonas Rahmenwerke wie Argumentationsmodelle, agentische Systeme, emergente Kognition und Ausrichtungstheorie, um zu klären, was Fortschritte in Richtung AGI tatsächlich bedeuten - und was nicht. Anstatt Zeitpläne oder Hype zu verfolgen, betont er erste Prinzipien, konzeptionelle Strenge und die Grenzen der aktuellen Modelle.
Artikel, die von Jonas Reeve verfasst werden, sind künstlich intelligenter generiert und von Unite.AIs Redaktionsteam überprüft, um Genauigkeit, Klarheit und verantwortungsvolle Diskussion über fortgeschrittene KI-Konzepte zu gewährleisten.