โมเดลและแพลตฟอร์ม AI
Ai2 ปล่อย Olmo-Core 3, ชุดฝึกอบรมแบบเปิดสำหรับ MoE พารามิเตอร์ระดับหนึ่งล้านล้าน

สถาบัน Allen Institute for AI เปิดตัว Olmo-core 3 เมื่อวันที่ 1 ตุลาคม 2026 ซึ่งเป็นการอัปเกรดกรอบการพัฒนารุ่นภาษาใหญ่ที่สร้างขึ้นรอบระบบฝึกอบรมแบบผสมผู้เชี่ยวชาญ (mixture-of-experts) แบบเปิดที่ออกแบบใหม่ โดย Ai2 กล่าวว่าได้ทำการวัดประสิทธิภาพที่มากกว่าหนึ่งล้านล้านพารามิเตอร์ทั้งหมด
Ai2 กล่าวว่า Olmo-core 3 ถูกออกแบบมาเพื่อขยายการฝึก MoE ไปสู่ช่วงพารามิเตอร์ระดับหนึ่งล้านล้านพร้อมคงประสิทธิภาพการคำนวณไว้ และอธิบายว่าเป็นหนึ่งในระบบหลักที่อยู่เบื้องหลังรุ่นต่อไปของ Olmo. การเปิดตัวมาพร้อมกับ รายงานเชิงเทคนิค, การสาธิตแบบโต้ตอบ, และโค้ดเปิด
โมเดล MoE สามารถมีพารามิเตอร์จำนวนมากขึ้นโดยไม่จำเป็นต้องให้ทุกอินพุตใช้ทั้งหมด, แต่โมเดลเต็มยังต้องถูกจัดเก็บข้าม หน่วยความจำ GPU และอัปเดตระหว่างการฝึก, และการกำหนดเส้นทางอินพุตไปยังผู้เชี่ยวชาญที่ถูกต้องในคลัสเตอร์ทำให้เกิดค่าใช้จ่ายด้านการสื่อสารและการประสานงานของตนเอง. Ai2 กล่าวว่า ค่าใช้จ่ายเหล่านี้อาจทำให้ข้อได้เปรียบด้านการคำนวณลดลงเมื่อ MoE ขยายใหญ่ขึ้น, และ Olmo-core 3 ถูกสร้างขึ้นเพื่อปิดช่องว่างนั้น. ในการวัดผลของ Ai2 หนึ่งครั้ง, จำนวนผู้เชี่ยวชาญเพิ่มจาก 8 เป็น 128 ขณะที่ยังเลือกผู้เชี่ยวชาญสี่คนต่อโทเคน, ทำให้พารามิเตอร์ที่ทำงานอยู่คงที่ประมาณ 3.2 พันล้านขณะที่ความจุพารามิเตอร์รวมเพิ่มจาก 4.6 พันล้านเป็น 47 พันล้าน, โดยอัตราการฝึกลดลงน้อยกว่า 5%
จาก FSDP ไปสู่สแต็กการฝึกแบบ DDP
การนำ MoE ของ Ai2 ในรุ่นก่อนของ Olmo-core ใช้การขนานข้อมูลแบบ fully sharded data parallelism, ตั้งค่าให้รวบรวมและแบ่งใหม่น้ำหนักโมเดลสำหรับแต่ละแบชข้อมูลการฝึกขนาดเล็ก. Olmo-core 3 เปลี่ยนไปใช้ระบบที่อิง distributed data parallelism ซึ่งทำให้ผู้เชี่ยวชาญอยู่บน GPU อย่างถาวรและส่งข้อมูลที่เกี่ยวข้องไปยังพวกเขา, หลีกเลี่ยงการรวบรวมน้ำหนักซ้ำหลายครั้ง. ในการทดสอบเบื้องต้นบน NVIDIA B300 GPUs จำนวนแปดเครื่อง, Ai2 รายงานว่า MoE ขนาด 47 พันล้านพารามิเตอร์สามารถประมวลผล 52,000 โทเคนต่อวินาทีต่อ GPU ด้วยสแต็กใหม่, เทียบกับ 19,400 โทเคนต่อวินาทีโดยใช้การนำไปใช้ก่อนหน้า, ซึ่ง Ai2 ระบุว่าเป็นประมาณ 2.7 เท่าของอัตราผลผลิต
งานของ Ai2 เกี่ยวกับโมเดลแบบ sparse เริ่มตั้งแต่ OlmoE, ซึ่งใช้สถาปัตยกรรม MoE ที่มีผู้เชี่ยวชาญ 64 รายที่ถูกกำหนดเส้นทาง, ในขณะที่ Olmo 3 ใช้สถาปัตยกรรมแบบหนาแน่นที่เกือบทั้งหมดของโมเดลทำงานสำหรับทุกโทเคน. Olmo-core 3 ขยายกรอบงานด้วยระบบฝึกที่ออกแบบมาสำหรับ MoE ขนาดใหญ่กว่ามาก. Ai2 ระบุว่า Megatron-Core ของ NVIDIA เป็นตัวเลือกที่ได้รับการยอมรับสำหรับการฝึก MoE ขนาดใหญ่, และอธิบายว่า Olmo-core 3 นำสแต็กการฝึก MoE ที่รวมเข้าด้วยกันมาสู่กรอบงานเบื้องหลัง Olmo
การขนาน, ความแม่นยำ, และเทคนิคหน่วยความจำ
สามเทคนิคกำหนดวิธีที่โมเดลและสถานะการฝึกถูกแบ่งออกบนฮาร์ดแวร์: การขนานผู้เชี่ยวชาญ (expert parallelism) กระจายผู้เชี่ยวชาญไปยัง GPU, การขนานแบบ pipeline แบ่งชั้นของโมเดลไปยังกลุ่ม GPU, และตัวปรับแต่งแบบกระจาย (distributed optimizer) กระจายสถานะของ optimizer ไปยัง GPU แทนการเก็บสำเนาเต็มบนทุก GPU. Olmo-core 3 ยังลดค่าใช้จ่ายในการกำหนดเส้นทางข้อมูลไปยังผู้เชี่ยวชาญที่ถูกต้อง: การขนานผู้เชี่ยวชาญแบบ rowwise นำข้อมูลที่กำหนดเส้นทางใส่โดยตรงลงในบัฟเฟอร์อินพุตของผู้เชี่ยวชาญ, การกำหนดเส้นทางที่อยู่บน GPU ทำให้เมตาดาต้าการกำหนดเส้นทางอยู่บน GPU เพื่อให้ CPU สามารถคิวงานได้โดยไม่ต้องรอการคัดลอกกลับ, และการรวม GEMM (grouped GEMM) รวมการคำนวณผู้เชี่ยวชาญขนาดเล็กหลาย ๆ ตัวเพื่อให้ GPU ประมวลผลได้อย่างมีประสิทธิภาพมากขึ้น. รายงานเชิงเทคนิคอธิบายการออกแบบการขนานผู้เชี่ยวชาญแบบ rowwise ที่ใช้ NVSHMEM ซึ่งเขียนแต่ละโทเคนโดยตรงลงในบัฟเฟอร์ของผู้เชี่ยวชาญ, พร้อมการคูณเมทริกซ์แบบกลุ่มที่กำหนดโดยอุปกรณ์ซึ่งทำให้การขนานผู้เชี่ยวชาญเป็นแบบไม่มีการซิงโครไนซ์
Olmo-core 3 รองรับ MXFP8, รูปแบบตัวเลขความแม่นยำต่ำกว่า. ในการทดสอบเชิงควบคุมบน NVIDIA B300 GPUs สี่เครื่องโดยกระจายงานอย่างสม่ำเสมอไปยังผู้เชี่ยวชาญ, Ai2 รายงานว่าอัตราการฝึกเพิ่มประมาณ 21% เมื่อเทียบกับฐาน BF16, ในขณะที่หน่วยความจำที่ใช้งานสูงสุดลดจาก 103 GiB เหลือ 95 GiB, โดยส่วนใหญ่ของการเพิ่มประสิทธิภาพมาจากการคำนวณ feed-forward และการย้ายข้อมูลระหว่างผู้เชี่ยวชาญ. รายงานเพิ่มเติมว่า checkpoint ที่ไม่ขึ้นกับโทโพโลยีบันทึกเทนเซอร์ FP32 ทั้งหมดโดยอิสระจากการจัดวางแบบขนาน, ทำให้การรันสามารถดำเนินต่อบนโทโพโลยีที่แตกต่างได้, และในการเปรียบเทียบที่ควบคุมไว้ การคำนวณซ้ำของ activation ลบหน่วยความจำ activation ไปเกือบสองในสามและลดหน่วยความจำสูงสุดลงประมาณหนึ่งในสี่โดยเสียค่าอัตราการฝึกประมาณหนึ่งในห้าส่วน
การวัดประสิทธิภาพพารามิเตอร์ระดับหนึ่งล้านล้านและขีดจำกัดที่ระบุ
Ai2 กล่าวว่าได้ทำการวัดประสิทธิภาพ Olmo-core 3 ในหลายการกำหนดค่าบน NVIDIA B300 GPUs, รวมถึงโมเดลที่มีพารามิเตอร์ 1.2 ล้านล้านโดยมีพารามิเตอร์ที่ทำงานต่อโทเคน 58.36 พันล้านบน GPU จำนวน 512 เครื่อง, โดยอัตราการทำงานสูงสุดที่สังเกตได้คือ 858 TFLOP/s ต่อ GPU. Ai2 ระบุว่าการทดสอบเหล่านี้ใช้การกำหนดเส้นทางแบบสุ่มเพื่อวัดประสิทธิภาพของระบบแทนคุณภาพของโมเดลที่ฝึกแล้ว. รายงานเชิงเทคนิคแสดงจุดการทำงานที่วัดได้ตั้งแต่โมเดล 12.9 พันล้านพารามิเตอร์บน 16 GPU จนถึงโมเดล 1.2 ล้านล้านพารามิเตอร์บน 512 GPU, และระบุว่าอัตราหลักเป็นการอ้างอิงระบบที่วัดภายใต้การกำหนดเส้นทางแบบสุ่ม, ไม่ใช่เส้นโค้งการขยายที่ควบคุมหรือการอ้างอิงเวลาที่ถึงคุณภาพ
Ai2 ยังได้ทดลอง DeepEP v2 ซึ่งเป็นแบ็กเอนด์ทางเลือกสำหรับการสื่อสารระหว่างผู้เชี่ยวชาญข้าม GPU โดยบรรลุการกำหนดค่าที่มีพารามิเตอร์ทั้งหมด 2.38 ล้านล้านตัว Ai2 อธิบายผลลัพธ์นี้ว่าเป็นการทดสอบความจุสั้นที่แสดงขนาดที่ Olmo-core 3 สามารถทำได้ มากกว่าประสิทธิภาพการฝึกที่ต่อเนื่อง รายงานทางเทคนิคที่มีชื่อว่า “Supercharging Olmo-core for Efficient and Scalable MoE Training” มีวันที่ออกเดือนตุลาคม 2026; ผู้เขียนมาจาก Allen Institute for AI และ University of Washington โดย Tianhua Tao ระบุเป็นผู้เขียนหลักและนักพัฒนาหลัก
ผลการค้นพบที่บันทึกและแผน Olmo รุ่นต่อไป
รายงานบันทึกรูปแบบความล้มเหลวที่ Ai2 เรียกว่า token gerrymandering ซึ่งคะแนนที่ตั้งใจให้ส่งเสริมการกำหนดเส้นทางที่สมดุลอาจดีขึ้นแม้ภาระงานจริงจะกลายเป็นไม่สมดุล รายงานยังระบุผลการค้นหาอื่น ๆ ได้แก่ การลดอัตราการเรียนรู้ของผู้เชี่ยวชาญเนื่องจากพวกเขาประมวลผลโทเคนน้อยลงไม่ได้ทำให้ผลลัพธ์ดีขึ้นในกลุ่มโมเดลที่ทดสอบ; การคำนวณบน GPU ใช้เวลาต่างกันเมื่อค่าที่ประมวลผลเปลี่ยนแปลง แม้ขนาดเมทริกซ์จะเท่าเดิม; และการทำโอเวอร์แล็ปการสื่อสารและการคำนวณบนสตรีม GPU แยกกันไม่ได้ทำให้การฝึกเร็วขึ้นเสมอและในบางการทดสอบทำให้การดำเนินการแบบปลายถึงปลายช้าลง รายงานยังอธิบายวิธีการที่ทดสอบแต่ไม่ได้นำไปใช้ รวมถึงการโอนส่วนกระตุ้นไปยัง CPU ที่ลิงก์โฮสต์ไม่สามารถรับได้และสองโครงสร้างโอเวอร์แล็ปที่แข่งขันกับการคำนวณของผู้เชี่ยวชาญเพื่อใช้ทรัพยากร GPU
Ai2 กล่าวว่า Olmo รุ่นต่อไปของตนจะใช้สถาปัตยกรรม MoE และตั้งเป้าหมายให้เป็น Olmo ที่มีความสามารถสูงสุดจนถึงตอนนี้ โดยฝึกบนชุดข้อมูลที่ใหญ่ที่สุดของตนและมีหน้าต่างบริบทที่ยาวที่สุด องค์กรระบุว่า Olmo-core 3 เปิดให้ใช้อย่างเต็มที่ ดังนั้นนักวิจัยและนักพัฒนาจึงสามารถใช้เพื่อฝึก MoE ของตนเอง ปรับให้เข้ากับฮาร์ดแวร์ต่าง ๆ และทดลองกับการกำหนดเส้นทาง การทำงานขนาน และส่วนอื่น ๆ ของระบบ คลังโค้ด Olmo-core บน GitHub อธิบายโครงการว่าเป็นบล็อกการสร้างด้วย PyTorch สำหรับระบบนิเวศ OLMo มีสัญญาอนุญาต Apache-2.0 และสามารถติดตั้งจากซอร์สหรือจาก PyPI ในชื่อ ai2-olmo-core












