โมเดลและแพลตฟอร์ม AI

รุ่น flagship ใหม่ของ Xiaomi นำอันดับ Open-Weight ด้วยคะแนน 46

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

Xiaomi เมื่อวันที่ 22 กันยายน 2026 ประกาศการเปิดตัวและเปิดซอร์สของ MiMo-V2.6 series โดยมีรุ่น flagship ที่คะแนนบน Intelligence Index ของผู้วิเคราะห์ Artificial Analysis อยู่ที่ 46 ซึ่งเป็นผลลัพธ์สูงสุดในหมวด open-weights บนลีดเดอร์บอร์ดนั้น

ซีรีส์นี้ประกอบด้วยสองโมเดลที่เป็นออมินิมอดัลโดยเนทีฟ: MiMo-V2.6-Pro ซึ่ง Xiaomi บรรยายว่าเป็นโมเดลที่มีความสามารถสูงสุดจนถึงปัจจุบัน, และ MiMo-V2.6-Flash ซึ่งบริษัทกล่าวว่ามีความสมดุลระหว่างปัญญาประดิษฐ์, ประสิทธิภาพ, และต้นทุน. เวอร์ชันที่สาม, MiMo-V2.6-Pro-UltraSpeed, ให้ผลลัพธ์เร็วขึ้นถึง 20 เท่าในคุณภาพเดียวกันสำหรับผู้ใช้ที่ต้องการความเร็วการสร้างขั้นสุดยอด, ตามที่ Xiaomi ระบุ.

อันดับการทดสอบของ Artificial Analysis

Artificial Analysis’ หน้าโมเดล สำหรับ MiMo-V2.6-Pro บันทึก 46 บน Intelligence Index v4.3.2, ซึ่งเป็นการรวมผลการประเมิน 10 รายการรวมถึง AA‑Briefcase v1.1, GDPval‑AA v2.1, AutomationBench‑AA, Terminal‑Bench 4.0, SciCode, และ Humanity’s Last Exam. การ การเปรียบเทียบโมเดลโอเพ่นซอร์ส ของผู้ประเมินจัดอันดับ MiMo-V2.6-Pro เป็นอันดับแรกในโมเดล open‑weights, อยู่เหนือ GLM‑5.3 (max) ของ Z AI ที่ 45 และ Kimi K3 (max) ที่ 44, และอธิบายว่า MiMo-V2.6-Pro และ GLM‑5.3 (max) เป็นโมเดลโอเพ่นซอร์สที่มีปัญญาประดิษฐ์สูงสุด.

ในระบบที่เป็นกรรมสิทธิ์, Artificial Analysis’ หน้าสำหรับ Grok 4.7 (xhigh) ระบุว่าโมเดล SpaceXAI มีคะแนนเท่ากับ 46 เช่นเดียวกัน. การประกาศของ Xiaomi ระบุคะแนน 46.32 บนดัชนีและเรียก MiMo-V2.6-Pro ว่า “โมเดลโอเพ่นซอร์สที่แข็งแกร่งที่สุดจนถึงปัจจุบัน,” โดยกล่าวว่ามันเหนือกว่า Kimi K3 และ Qwen3.8 Max. Artificial Analysis กำหนดต้นทุนของโมเดลที่ $0.13 ต่องานบน Intelligence Index และรายงานว่าการประเมินบนดัชนีใช้ค่าใช้จ่าย $206.66. Xiaomi กล่าวว่าซีรีส์นี้ยังคงใช้ราคา API ของซีรีส์ V2.5, ซึ่งอธิบายว่าเป็นการขยายขอบเขตพาเรโต้ของปัญญาประดิษฐ์ต่อค่าใช้จ่ายออกไป.

Artificial Analysis ระบุวันที่เปิดตัวของโมเดลเป็น 21 กันยายน 2026; โพสต์การประกาศของ Xiaomi มีวันที่ 22 กันยายน 2026.

สถาปัตยกรรม Sparse MoE และน้ำหนักที่ได้รับใบอนุญาต MIT

ตาม การ์ดโมเดล ที่ทีม Xiaomi MiMo เผยแพร่, เช็คพอยต์ flagship MiMo-V2.6-Pro-RL เป็นโมเดล sparse mixture‑of‑experts ที่มีพารามิเตอร์ทั้งหมด 1.02 ล้านล้านและเปิดใช้งาน 42 พันล้านต่อโทเคน, ความยาวบริบท 1 ล้านโทเคน, และรับอินพุตข้อความ, รูปภาพ, วิดีโอ, และเสียงพร้อมเอาต์พุตเป็นข้อความ. รายละเอียดของ Artificial Analysis ระบุจำนวนพารามิเตอร์, หน้าต่างบริบท, และรูปแบบเดียวกัน, และบันทึกว่าได้รับใบอนุญาต MIT ซึ่งอนุญาตให้ใช้เชิงพาณิชย์.

การ์ดระบุว่าแบ็คบอนมี 70 ชั้น, มี 60 ชั้น attention แบบ sliding‑window ที่สลับกับ 10 ชั้น attention แบบ global, พร้อมผู้เชี่ยวชาญ 384 รายที่มี 8 รายทำงานต่อโทเคน. MiMo ViT ขนาด 681 ล้านพารามิเตอร์รับผิดชอบด้านวิชัน, AudioTokenizer ขนาด 308 ล้านพารามิเตอร์และตัวเข้ารหัสแพทช์เสียงขนาด 127 ล้านพารามิเตอร์จัดการเสียง, และดีคอเดอร์สเปคคิวเลทีฟแบบพยากรณ์หลายโทเคนห้าชั้นทำนายโทเคนต่อเนื่อง 7 ตัวต่อการส่งต่อหนึ่งครั้ง.

น้ำหนักของ MiMo-V2.6-Pro-RL และ MiMo-V2.6-Flash-RL ถูกเผยแพร่บน Hugging Face, พร้อมให้ใช้งานบน ModelScope ตั้งแต่การเปิดตัว. Xiaomi กล่าวว่าบริษัทยังเปิดซอร์สรายงานทางเทคนิคฉบับเต็ม, สภาพแวดล้อมการฝึก, และโค้ด RL เพื่อให้นักวิจัยสามารถทำซ้ำและตรวจสอบผลลัพธ์ได้.

การรัน Reinforcement‑Learning สด

Xiaomi กล่าวว่าได้สตรีมการรัน reinforcement‑learning ของการผลิตแบบสดขณะดำเนินการ. ภายในเวลาไม่ถึงหกวัน, MiMo-V2.6-Flash และ MiMo-V2.6-Pro แต่ละรุ่นสำเร็จ 30 ขั้นตอน RL บนเส้นทางประมาณ 750,000 เส้นทาง, โดยมีต้นทุนที่รายงานอยู่ที่ประมาณ $0.85 ล้านและ $2.62 ล้านตามลำดับ. อัตราการผ่านเฉลี่ยในงานฝึกเพิ่มขึ้น 25% และ 12% ตามลำดับ, และบน DeepSWE v1.1, เกณฑ์การประเมินซอฟต์แวร์วิศวกรรมระยะยาวที่แยกออก, คะแนนเพิ่มจาก 48.8 เป็น 65.68 สำหรับ Flash และจาก 58.4 เป็น 72.57 สำหรับ Pro, ตามที่ Xiaomi รายงาน.

บริษัทกล่าวว่าขยายการคำนวณ RL ตามสามมิติ: ขนาดแบตช์ที่ใหญ่ขึ้นบนสถาปัตยกรรมแบบเต็มอิสระพร้อม 1,568 ตัวอย่างต่อการอัปเดต, การฝึกที่ความยาวบริบทสูงสุด 1 ล้านและ 3.5‑ถึง 3.7 พันล้านโทเคนต่อขั้นตอน; ชุดงานหลายงานที่ครอบคลุมการเขียนโค้ด, ตัวแทนทั่วไป, งานด้านภาพและไซเบอร์ที่ผสมผสานผ่านหลาย harness; และการคำนวณ grader เพิ่มขึ้นโดยใช้การเปรียบเทียบเชิงสัมพัทธ์ภายในแต่ละกลุ่มเพื่อสร้างสัญญาณรางวัลที่แม่นยำยิ่งขึ้น.

การ์ดโมเดลระบุว่าใช้ Group Relative Policy Optimization แบบเต็มอิสระที่ 1,568 prompt พร้อม 16 rollout ต่อขั้นตอน, Groupwise Reward Synthesis เพื่อสร้างรูบริกเฉพาะงานแบบออฟไลน์จาก rollout ที่แตกต่างกัน, และ Groupwise Advantage Redistribution เพื่อจัดอันดับเส้นทางที่ผ่านแบบออนไลน์. ขั้นตอนการสกัดกั้นแบบ on‑policy ที่มีหลาย prefix และหลายครูเรียกว่า MOPD2 ทำตามการรัน RL แบบผสม, และ Xiaomi อธิบายการป้องกันการแฮ็กรางวัลที่ครอบคลุมการออกแบบรางวัล, การประเมินแบบศัตรู, การตรวจจับความผิดปกติ, และการตรวจสอบข้ามระหว่างผู้ตรวจสอบ.

ราคา, ความพร้อมใช้งาน, และการใช้งานที่แสดงตัวอย่าง

ในตารางเบนช์มาร์คของ Xiaomi เอง MiMo-V2.6-Pro ได้คะแนน 71.9 บน DeepSWE v1.1 เทียบกับ 67.9 ของ Flash และ 19.0 ของ MiMo-V2.5-Pro โดยอยู่หลัง DeepSeek V4.1 Flash (74.2), Claude Opus 5 (74.0) และ GPT 6 Astra (74.0) Xiaomi ระบุว่า Pro มีค่า 1,673 บน GDPVal 2.1 ซึ่งเป็นคะแนน Elo ที่รายงานโดย Artificial Analysis อยู่หลัง Claude Fable 5.1 (1,735) และ Claude Opus 5 (1,708) ผลลัพธ์ Pro ที่รายงานอื่น ๆ รวมถึง 76.9 บน Toolathlon‑verified, 53.1 บน Automation Bench v1.0.6, 34.9 บน Terminal Bench 4.0, และ 94.0 บน CyberGym ซึ่ง Flash ได้คะแนน 95.1 เทียบกับ GLM 5.3 ที่ 84.5

ทั้งสองโมเดลพร้อมให้ใช้ใน AI Studio, MiMo Code, และ MiMo Desktop รวมถึงผ่าน MiMo API Platform และ OpenRouter MiMo Desktop จะออกจากการเข้าถึงแบบเริ่มต้นด้วยการเปิดตัวรุ่นอย่างเป็นทางการครั้งแรก โดยมี Pro และ Flash ติดตั้งมาแล้ว และ Xiaomi ระบุว่าโปรแกรม UltraSpeed ที่เข้าถึงแบบเริ่มต้นจะดำเนินต่ออีกหนึ่งสัปดาห์ โดยผู้ใช้ที่มีอยู่จะถูกขอให้เปลี่ยนไปใช้ชื่อโมเดลใหม่

ราคาการใช้ API ไม่เปลี่ยนแปลงจากชุด V2.5: ต่อหนึ่งล้านโทเคน MiMo‑V2.6‑Pro มีค่า $0.0036 สำหรับอินพุตที่พบแคช, $0.435 สำหรับอินพุตที่ไม่พบแคช, และ $0.87 สำหรับเอาต์พุต; MiMo‑V2.6‑Flash มีค่า $0.0028, $0.14, และ $0.28; ส่วน MiMo‑V2.6‑Pro‑UltraSpeed มีค่า $0.036, $4.35, และ $8.70 ในสามประเภทเดียวกัน Artificial Analysis วัดได้ 129.7 โทเคนเอาต์พุตต่อวินาทีและเวลา 2.17 วินาทีจนถึงโทเคนแรกผ่าน API ของ Xiaomi

การสาธิตของ Xiaomi ครอบคลุมการพัฒนาเกมแบบหลายเอเจนต์, การสร้างโมเดล 3D ด้วย Blender, การควบคุมแบบปิดวงจรของแขนโรบอท Franka Panda จากฟีดกล้องหลายมุม, การออกแบบส่วนหน้าและการนำเสนอ, การสร้างวิดีโอแบบครบวงจร, และการประพันธ์ดนตรี รวมถึงชิ้นงานออร์เคสตราที่ชื่อ Night Road ซึ่งโมเดลได้ทำการประเมินและแปลงเป็น MIDI ด้วยตนเอง ในสองกรณีการวิจัยที่บริษัทรายงาน MiMo‑V2.6‑Pro ได้ออกแบบตัวเลือกกรอบโลหะ‑อินทรีย์สำหรับการดูดซับสาร PFAS ร่วมกับผู้เชี่ยวชาญด้านวัสดุของ Xiaomi และได้สร้างการรูปแบบ Lean 4 ของทฤษฎี “Period Three Implies Chaos” ของ Li และ Yorke ที่มีโค้ดเกิน 6,000 บรรทัด ตรวจสอบโดยเคอร์เนลของ Lean โดยไม่มีตัวแปรพิสูจน์ที่ยังไม่เสร็จ

จอนาส รีฟ เป็นนักวิเคราะห์ที่สร้างโดย AI ที่ Unite.AI โดยมุ่งเน้นไปที่ปัญญาประดิษฐ์แบบ认知 (Cognitive AI) ปัญญาประดิษฐ์ทั่วไป (Artificial General Intelligence - AGI) และรากฐานทางทฤษฎีของปัญญาประดิษฐ์ เขาได้สำรวจว่ากระบวนการเรียนรู้ การให้เหตุผล ความจำ และการสรุปผลเกิดขึ้นในระบบทางชีววิทยาและระบบประดิษฐ์ โดยเชื่อมโยงระหว่างโครงสร้าง AI สมัยใหม่และคำถามที่มีมานานในด้านวิทยาศาสตร์认知และปรัชญาของจิต

ด้วยแนวทางเชิงแนวคิดและสะท้อนกลับ จอนาสได้ตรวจสอบกรอบการทำงาน เช่น โมเดลการให้เหตุผล ระบบอージェนต์ การรับรู้ที่เกิดขึ้น และทฤษฎีการจัดตำแหน่ง โดยมีเป้าหมายเพื่อชี้แจงว่าการก้าวหน้าไปสู่ AGI หมายถึงอะไร และไม่หมายถึงอะไร โดยไม่ได้ตาม đuổiเส้นเวลาหรือการโฆษณา เขาเน้นย้ำถึงหลักการแรก การใช้เหตุผลเชิงแนวคิด และข้อจำกัดของโมเดลปัจจุบัน

บทความที่เขียนโดยจอนาส รีฟเป็นผลงานที่สร้างโดย AI และได้รับการตรวจสอบโดยทีมบรรณาธิการของ Unite.AI เพื่อให้แน่ใจถึงความถูกต้อง ความชัดเจน และการอภิปรายที่มีความรับผิดชอบเกี่ยวกับแนวคิด AI ที่ทันสมัย