โมเดลและแพลตฟอร์ม AI
IBM เปิดตัวโมเดลซีรีส์เวลา Granite PatchTST-FM-R2 แบบ Zero-Shot

IBM เปิดตัว Granite Time Series PatchTST-FM-r2 เมื่อวันที่ 9 กันยายน 2026 ซึ่งเป็นโมเดลการพยากรณ์ซีรีส์เวลาขนาดประมาณ 385 ล้านพารามิเตอร์แบบ zero-shot ที่มีสัญญาอนุญาตแบบคู่ภายใต้ Apache 2.0 และ OpenMDW 1.0 ของ Linux Foundation น้ำหนักโมเดล สถาปัตยกรรม กระบวนการ inference และโค้ดที่จำเป็นสำหรับการทำซ้ำผลการทดสอบเบนช์มาร์กทั้งหมดได้ถูกเผยแพร่อย่างเปิดเผยพร้อมกับการปล่อย
IBM ประกาศโมเดลนี้ใน โพสต์บล็อกของ Hugging Face โดยผู้เขียนจาก IBM Research โดยนำเสนอว่าเป็นรุ่นต่อจาก PatchTST-FM-r1 และเป็นโมเดลล่าสุดในตระกูลโมเดลพื้นฐานซีรีส์เวลาของ Granite ตามประกาศ PatchTST-FM-r2 ผสานสถาปัตยกรรมที่อัปเดต คอร์ปัสการฝึกล่วงหน้าที่ใหญ่ขึ้น การพยากรณ์แบบความน่าจะเป็น และการสนับสนุนการเติมค่าที่หายไป พร้อมทั้งสามารถสร้างการพยากรณ์บนข้อมูลใหม่โดยไม่ต้องทำ fine-tuning หรือการปรับให้เข้ากับงานเฉพาะ
ผลการจัดอันดับ GIFT-Eval ที่รายงาน
GIFT-Eval เป็นเบนช์มาร์กที่ครอบคลุมสำหรับประเมินโมเดลการพยากรณ์บนชุดข้อมูลและสถานการณ์ที่หลากหลาย โดยค่าที่ต่ำกว่าจะดีกว่าสำหรับทั้ง CRPS และ MASE ซึ่งเป็นสองเมตริกที่ IBM รายงาน IBM ระบุว่า ณ วันที่ 8 กันยายน 2026 PatchTST-FM-r2 อยู่ในอันดับที่สองในกลุ่มโมเดลที่ทำซ้ำได้และเป็น zero-shot สำหรับทั้งสองเมตริก และเป็นโมเดลที่มีประสิทธิภาพสูงสุดในหมวดนี้ระหว่างโมเดลที่ออกภายใต้สัญญาอนุญาตแบบเปิดและเป็นมิตรต่อการค้า ประกาศระบุค่าเฉลี่ยเรขาคณิตของ CRPS ที่ 0.467 ซึ่งตามหลัง TimesFM-3 อย่างใกล้ชิด และค่าเฉลี่ยเรขาคณิตของ MASE ที่ 0.6846
โมเดลบางตัวใน GIFT-Eval ถูกจัดประเภทเป็น pretrained แทนที่จะเป็น zero-shot อย่างเคร่งครัด ซึ่งหมายความว่าพวกเขาได้รับอนุญาตให้รวมส่วนการฝึกของชุดข้อมูลการประเมินเบนช์มาร์กเข้าไปในคอร์ปัสการฝึกล่วงหน้าของตน IBM กล่าวว่าแม้จะเพิ่มโมเดลเหล่านี้เข้าไปในการเปรียบเทียบ PatchTST-FM-r2 ยังอยู่ในอันดับที่สามสำหรับ CRPS และอันดับที่สี่สำหรับ MASE ในกลุ่มโมเดลที่ทำซ้ำได้ โดยเหนือกว่า Chronos-2, Timer-S1 และรูปแบบของ Toto ที่เป็น pretrained ซึ่งบางรุ่นมีขนาดใหญ่กว่ามาก
บัตรโมเดล ที่เขียนโดย Jiri Navratil, Wesley M. Gifford, Yunshi Wen, Chandra K. Reddy, และ Agung Julius ระบุว่าการจัดอันดับ zero-shot ที่ทำซ้ำได้อันดับสองมีวันที่ 31 สิงหาคม 2026 และชี้ว่าผลลัพธ์ของโมเดลอยู่ใน pull request ที่รอการตรวจสอบซึ่งส่งไปยังเบนช์มาร์ก GIFT-Eval; ส่วนประกาศระบุการจัดอันดับเดียวกันเป็นวันที่ 8 กันยายน 2026
สถาปัตยกรรม Conformer
PatchTST-FM-r2 ยังคงการแสดงผลแบบ patch ของรุ่นก่อนหน้า แต่แทนที่บล็อก transformer มาตรฐานด้วยบล็อก conformer ซึ่งเป็นการออกแบบที่มาจากการประมวลผลเสียงแต่ละบล็อกประกอบด้วยสองชั้น feed-forward ครึ่งขั้นที่ล้อมรอบ multi-head self-attention และชั้น convolution เชิงเวลา โดยมีขนาด kernel ของ convolution สลับกันที่ 3 และ 5 ในรูปแบบ {5, 5, 3, 3} ที่ทำซ้ำ IBM กล่าวว่าคอมโพเนนต์ convolution จับโครงสร้างเชิงเวลาระยะสั้น ทำให้กลไก attention สามารถมุ่งเน้นความสัมพันธ์ระยะยาวระหว่าง patch ได้
โมเดลใช้ patch ที่ทับซ้อน 50% — ความยาว patch 16, stride 8 — พร้อมการถ่วงน้ำหนักแบบ Hamming window ระหว่างการฝึกและการพยากรณ์แบบ overlap-and-add ในขั้น inference พร้อมทั้งใช้ pre-head layer norm เพื่อความเสถียรของการฝึก มีมิติซ่อน 1024 และ 30 บล็อก เพิ่มจาก 20 ใน r1 รองรับความยาวบริบทสูงสุดถึง 8,192 ขั้นตอน และทำนาย 99 ควอนไทล์บนความยาวการพยากรณ์ที่ยืดหยุ่น ทั้งการพยากรณ์แบบจุดและช่วงความไม่แน่นอน การนำไปใช้มีให้ใน repository แบบเปิดแหล่งที่มาของ granite-tsfm และยังคงเข้ากันได้ย้อนหลังกับ checkpoint ของ PatchTST-FM-r1
ข้อมูลการฝึกและสัญญาอนุญาต
คอร์ปัสการฝึกล่วงหน้าที่ระบุมีสี่แหล่ง: ชุดข้อมูลที่เลือกจาก GiftEvalPretrain; ข้อมูลสังเคราะห์ที่กำหนดเองโดยอิงจาก KernelSynth พร้อม kernel แบบเป็นระยะที่ปรับเปลี่ยนและการเพิ่มข้อมูลที่จำกัด; คอร์ปัส TSMixup ที่สร้างโดยใช้วิธีที่อธิบายในงานวิจัย Chronos แต่จำกัดไว้ที่ชุดข้อมูลนอกชุดประเมิน GIFT-Eval; และประมาณ 500,000 ลำดับ CauKer สังเคราะห์แต่ละลำดับมีความยาว 4,096 บัตรโมเดลระบุว่าชุดข้อมูล CauKer ถูกสร้างโดยทีม FlowState ของ IBM และอ้างอิงงานวิจัย arXiv ปี 2026 ชื่อ “Revisiting the Generic Transformer: Deconstructing a Strong Baseline for Time Series Foundation Models” สำหรับแนวทางพื้นฐาน
ผู้ใช้สามารถเลือกใช้สัญญาอนุญาต Apache 2.0 หรือ OpenMDW 1.0 ซึ่งเป็นกรอบสัญญาอนุญาตของ Linux Foundation ที่ออกแบบมาสำหรับโมเดล AI และวัสดุที่เกี่ยวข้อง IBM กล่าวว่าทั้งสองสัญญาอนุญาตให้สิทธิ์ที่กว้างและยืดหยุ่นในการใช้ ปรับเปลี่ยน และแจกจ่ายโมเดล และมีเป้าหมายเพื่อลดอุปสรรคต่อการนำไปใช้ การเปิดเผยในบัตรโมเดลระบุว่าผู้พัฒนาของ IBM สร้างโค้ดนี้เป็นโครงการโอเพนซอร์ส ไม่ได้เป็นผลิตภัณฑ์ของ IBM และ IBM ไม่มีภาระผูกพันใด ๆ ในการให้การปรับปรุง การอัปเดต หรือการสนับสนุน
การพร้อมใช้งานและบริบทของตระกูล Granite
น้ำหนักโมเดลสามารถดาวน์โหลดได้จาก Hugging Face Hub และโหลดผ่านแพ็กเกจ granite-tsfm เวอร์ชัน 0.3.9 หรือใหม่กว่า ผ่าน pipeline API ตัวอย่างโค้ดของ IBM สร้างการพยากรณ์รวมถึงควอนไทล์ที่ร้องขอจาก 512 ตัวอย่างสุดท้ายของซีรีส์ ETTh1 และ IBM วางตำแหน่งโมเดลนี้สำหรับการพยากรณ์ความต้องการ ราคา โหลดพลังงาน การจราจร เทเลเมทรี และซีรีส์เวลาอื่น ๆ ที่มีการสุ่มตัวอย่างเป็นประจำ
สำหรับการใช้งานแบบสตรีมมิ่ง IBM และ Confluent ได้ทำให้โมเดล Granite Time Series หลายตัว (PatchTST-FM-r1, FlowState-r1.1, TTM-r3, และ TSPulse) พร้อมให้ใช้ผ่านโปรแกรม Early Access ใน Confluent Cloud ซึ่งดำเนินการ inference ของโมเดลพื้นฐานบนสตรีมสดผ่าน Apache Flink
ภาพรวมจาก IBM Research ของตระกูลนี้บันทึกสายเลือดที่อยู่เบื้องหลังการเปิดตัว: TST ในปี 2021 ซึ่งเป็นหนึ่งในโมเดล transformer แรกที่นำไปใช้กับข้อมูลซีรีส์เวลา; PatchTST ในปี 2023 ที่นำเสนอการใช้ patch และความเป็นอิสระของช่อง; Tiny Time Mixer ในปี 2024; และ FlowState ในปี 2025 ตามภาพรวมดังกล่าว โมเดลเหล่านี้ได้ถูกฝึกรวมกันบนข้อมูลมากกว่า 100 พันล้านจุดข้อมูล และโมเดล TTM มีการดาวน์โหลดเกิน 37 ล้านครั้งบน Hugging Face PatchTST-FM-r1 ซึ่งเป็นรุ่นโดยตรงของโมเดลใหม่ ได้ร่วมพัฒนากับ Rensselaer Polytechnic Institute และโมเดลรุ่นวิจัยของ IBM มีสัญญาอนุญาตแบบไม่เพื่อการค้าในขณะที่ตระกูล Granite ถูกเผยแพร่ภายใต้ Apache 2.0












