Yapay zeka modelleri ve platformları

IBM, Granite PatchTST-FM-R2 Sıfır Atışlı Zaman Serisi Modelini Yayınladı

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

IBM, 9 Eylül 2026’da Granite Time Series PatchTST-FM-r2 modelini yayınladı; yaklaşık 385 milyon parametreli, sıfır atışlı bir zaman serisi tahmin modeli ve Apache 2.0 ile Linux Foundation’ın OpenMDW 1.0 lisansları altında çift lisanslıdır. Model ağırlıkları, mimarisi, çıkarım hattı ve benchmark sonuçlarını yeniden üretmek için gereken kod, yayınla birlikte açıkça paylaşıldı.

IBM, modeli IBM Research yazarları tarafından kaleme alınan bir Hugging Face blog gönderisinde duyurdu; modeli PatchTST-FM-r1’in halefi ve Granite zaman serisi temel model ailesinin en yeni modeli olarak tanıttı. Duyuruma göre, PatchTST-FM-r2 güncellenmiş bir mimariyi, daha büyük bir ön‑eğitim veri kümesini, olasılıksal tahmini ve eksik değerlerin doldurulmasını desteklemeyi birleştiriyor ve yeni veriler üzerinde ince ayar veya görev‑spesifik uyum gerektirmeden tahmin üretiyor.

Raporlanan GIFT-Eval Sıralamaları

GIFT-Eval, çeşitli veri setleri ve senaryolar üzerinden tahmin modellerini değerlendiren kapsamlı bir benchmark’tır ve hem CRPS hem de MASE metriklerinde daha düşük değerler daha iyidir; bu iki metriği IBM raporlamaktadır. IBM, 8 Eylül 2026 itibarıyla PatchTST-FM-r2’nin her iki metrikte de tekrarlanabilir, sıfır atışlı modeller arasında ikinci sırada yer aldığını ve izin verici, ticari dostu lisanslarla yayınlanan modeller arasında bu kategoride en yüksek performansa sahip model olduğunu belirtti. Duyuruda, TimesFM-3’ün hemen arkasında 0,467’lik geometrik ortalama CRPS ve 0,6846’lik geometrik ortalama MASE bildirildi.

GIFT-Eval’deki bazı modeller, kesin sıfır atışlı olmaktan ziyade ön‑eğitimli olarak sınıflandırılır; bu, benchmark’un değerlendirme veri setlerinin eğitim bölümlerinin ön‑eğitim veri kümelerine dahil edilebileceği anlamına gelir. IBM, bu modeller karşılaştırmaya eklense bile, PatchTST-FM-r2’nin tekrarlanabilir modeller arasında CRPS için üçüncü, MASE için dördüncü sırada yer aldığını ve ön‑eğitimli Chronos-2, Timer-S1 ve Toto varyantlarından, bazıları oldukça büyük olmasına rağmen, önde olduğunu belirtti.

model kartı, Jiri Navratil, Wesley M. Gifford, Yunshi Wen, Chandra K. Reddy ve Agung Julius tarafından hazırlanmış olup, ikinci sıradaki tekrarlanabilir sıfır atışlı konumu 31 Ağustos 2026 tarihine dayandırmaktadır ve modelin sonuçlarının GIFT-Eval benchmark’ına gönderilen bekleyen bir pull request içinde bulunduğunu belirtir; duyuru aynı konumu 8 Eylül 2026 olarak verir.

Conformer Mimarisi

PatchTST-FM-r2, selefinin yama tabanlı temsiliyetini korurken standart transformer bloklarını, konuşma işleme alanında ortaya çıkan bir tasarım olan conformer bloklarıyla değiştirir. Her blok, çok‑başlıklı öz‑dikkatin ve bir zamansal konvolüsyon katmanının etrafında iki yarım‑adımlı ileri besleme katmanı içerir; konvolüsyon çekirdek boyutları 3 ve 5 arasında dönüşümlü olarak {5, 5, 3, 3} şeklinde tekrarlanır. IBM, konvolüsyon bileşeninin kısa menzilli zamansal yapıyı yakaladığını ve dikkat mekanizmasının yamalar arasındaki uzun menzilli ilişkiler üzerine odaklanmasını sağladığını belirtti.

Model, eğitim sırasında Hamming pencere ağırlığıyla ve çıkarımda overlap‑and‑add tahminiyle %50 örtüşen yamalar (yama uzunluğu 16, adım 8) kullanır; ayrıca eğitim kararlılığı için bir ön‑baş katman normu uygulanır. Gizli boyutu 1024 ve 30 bloktan oluşur; r1’de 20 iken bu sayı artırılmıştır, 8.192 adıma kadar bağlam uzunluğunu destekler ve esnek tahmin uzunlukları üzerinde 99 kuantil tahmin eder; hem nokta tahminleri hem de belirsizlik aralıkları üretir. Uygulama, açık kaynaklı granite‑tsfm deposunda mevcuttur ve PatchTST‑FM‑r1 kontrol noktalarıyla geriye dönük uyumluluğunu korur.

Eğitim Verisi ve Lisanslama

Belgelendirilmiş ön‑eğitim veri kümesi dört kaynağa sahiptir: GiftEvalPretrain’dan seçilmiş veri setleri; değiştirilmiş periyodik çekirdekler ve sınırlı artırma içeren KernelSynth tabanlı özel sentetik veriler; Chronos makalesinde açıklanan yaklaşım kullanılarak oluşturulmuş ancak GIFT‑Eval değerlendirme setinin dışındaki veri setleriyle sınırlı bir TSMixup veri kümesi; ve yaklaşık 500.000 sentetik CauKer dizisi, her biri 4.096 uzunluğunda. Model kartı, CauKer veri kümesinin IBM’in FlowState ekibi tarafından üretildiğini ve temel yaklaşım için 2026 arXiv makalesi “Revisiting the Generic Transformer: Deconstructing a Strong Baseline for Time Series Foundation Models”e atıfta bulunduğunu belirtir.

Kullanıcılar, Apache 2.0 lisansı ya da AI modelleri ve ilgili materyaller için tasarlanmış Linux Foundation lisans çerçevesi OpenMDW 1.0 arasında seçim yapabilir. IBM, her iki lisansın da modeli kullanma, değiştirme ve dağıtma konusunda geniş ve izin verici haklar sağladığını ve benimsenme engellerini azaltmayı amaçladığını belirtti. Model kartındaki bir açıklama, IBM geliştiricilerinin kodu bir IBM ürünü yerine açık kaynaklı bir proje olarak ürettiğini ve IBM’in iyileştirme, güncelleme veya destek sağlama yükümlülüğü altında olmadığını ifade eder.

Kullanılabilirlik ve Granite Ailesi Bağlamı

Ağırlıklar, Hugging Face Hub üzerinden indirilebilir ve granite‑tsfm paketi, 0.3.9 veya sonraki sürüm aracılığıyla bir pipeline API’si üzerinden yüklenir. IBM’in örnek kodu, bir ETTh1 serisinin son 512 örneğinden, istenen kuantiller dahil olmak üzere bir tahmin üretir ve IBM modeli talep, fiyatlar, enerji yükleri, trafik, telemetri ve diğer düzenli örneklenen zaman serileri için konumlandırır.

Akış tabanlı dağıtımlar için IBM ve Confluent, birkaç Granite Time Series modelini (PatchTST-FM-r1, FlowState-r1.1, TTM-r3 ve TSPulse) Confluent Cloud’da bir Erken Erişim programı aracılığıyla kullanılabilir hâle getirdi; bu program, Apache Flink üzerinden canlı akışlarda temel model çıkarımı gerçekleştirir.

IBM Research genel bakışı, serinin sürüm geçmişini belgelemektedir: 2021’de TST, zaman serisi verilerine uygulanan ilk transformer tabanlı modellerden biri; 2023’te PatchTST, yama ve kanal bağımsızlığını tanıttı; 2024’te Tiny Time Mixer; ve 2025’te FlowState. Bu genel bakışa göre, modeller topluca 100 milyarın üzerinde veri noktasında eğitildi ve TTM modelleri Hugging Face üzerinde 37 milyon indirmeyi aştı. Yeni modelin doğrudan selefi olan PatchTST-FM-r1, Rensselaer Polytechnic Institute ile ortak geliştirilmiş olup, IBM’in araştırma‑versiyon modelleri ticari olmayan bir lisans taşırken Granite serisi Apache 2.0 altında yayımlanmıştır.

Jonas Reeve bilişsel AI, yapay genel zeka (AGI) ve makine zekasının teorik temelleri üzerine odaklanan Unite.AI'de AI tarafından oluşturulan bir analisttir. Çalışmaları, öğrenme, akıl yürütme, bellek ve soyutlama gibi kavramların hem biyolojik hem de yapay sistemlerde nasıl ortaya çıktığını keşfederek, modern AI mimarileri ile bilişsel bilim ve zihin felsefesindeki uzun süredir devam eden sorular arasında bağlantılar kurar.
Kavramsal ve düşünceli bir yaklaşım benimseyen Jonas, akıl yürütme modelleri, ajan sistemleri, ortaya çıkan biliş ve hizalama teorisi gibi çerçeveleri inceleyerek, AGI'ye doğru ilerlemenin ne anlama geldiğini - ve ne anlamadığını - açıklamayı amaçlar. Zaman çizelgesi veya hırs peşinde koşmak yerine, ilk ilkeleri, kavramsal titizliği ve mevcut modellerin sınırlarını vurgular.
Jonas Reeve tarafından yazılan makaleler AI tarafından oluşturulur ve Unite.AI'nin editör ekibi tarafından advanced AI kavramlarının doğruluğu, açıklığı ve sorumlu tartışması için gözden geçirilir.