Mô hình và nền tảng AI
Mẫu flagship mới của Xiaomi dẫn đầu bảng xếp hạng Open-Weight với điểm số 46

Vào ngày 22 tháng 9, 2026, Xiaomi công bố việc ra mắt và mã nguồn mở của MiMo-V2.6 series, do một mẫu flagship dẫn đầu, mà nhà benchmark Artificial Analysis cho điểm 46 trên Intelligence Index, là kết quả Open-Weight cao nhất trên bảng xếp hạng đó.
Dòng sản phẩm bao gồm hai mô hình omnimodal bản địa: MiMo-V2.6-Pro, mà Xiaomi mô tả là mô hình khả năng cao nhất đến nay, và MiMo-V2.6-Flash, mà công ty cho rằng cân bằng giữa trí tuệ, hiệu suất và chi phí. Một biến thể thứ ba, MiMo-V2.6-Pro-UltraSpeed, cung cấp tốc độ đầu ra nhanh hơn tới 20 lần với cùng chất lượng cho người dùng cần tốc độ sinh nội dung cực nhanh, theo Xiaomi.
Thứ hạng trong Benchmark Artificial Analysis
Trang trang mô hình của Artificial Analysis cho MiMo-V2.6-Pro ghi nhận điểm 46 trên Intelligence Index v4.3.2, là tổng hợp của 10 bài đánh giá bao gồm AA‑Briefcase v1.1, GDPval‑AA v2.1, AutomationBench‑AA, Terminal‑Bench 4.0, SciCode và Humanity’s Last Exam. so sánh mô hình nguồn mở của nhà benchmark đưa MiMo-V2.6-Pro lên vị trí đầu tiên trong các mô hình open-weights, vượt qua GLM‑5.3 (max) của Z AI với 45 và Kimi K3 (max) với 44, và mô tả MiMo-V2.6-Pro và GLM‑5.3 (max) là các mô hình nguồn mở có trí tuệ cao nhất.
Trong các hệ thống độc quyền, trang cho Grok 4.7 (xhigh) của Artificial Analysis liệt kê mô hình SpaceXAI với cùng điểm 46. Thông cáo của Xiaomi trích dẫn điểm 46.32 trên chỉ số và gọi MiMo-V2.6-Pro là “mô hình nguồn mở mạnh nhất tính đến thời điểm hiện tại”, cho rằng nó vượt qua Kimi K3 và Qwen3.8 Max. Artificial Analysis đưa chi phí của mô hình là $0.13 cho mỗi nhiệm vụ trên Intelligence Index và báo cáo việc đánh giá trên chỉ số này tốn $206.66. Xiaomi cho biết dòng sản phẩm duy trì mức giá API của dòng V2.5, mà họ mô tả là đẩy ranh giới Pareto giữa trí tuệ và chi phí ra ngoài.
Artificial Analysis liệt kê ngày phát hành của mô hình là 21 tháng 9, 2026; bài đăng thông báo của Xiaomi có ngày 22 tháng 9, 2026.
Kiến trúc MoE thưa và Trọng số có giấy phép MIT
Theo thẻ mô hình do Nhóm Xiaomi MiMo công bố, checkpoint flagship MiMo-V2.6-Pro-RL là một mô hình mixture-of-experts thưa với tổng 1.02 trillion tham số và 42 billion được kích hoạt mỗi token, độ dài ngữ cảnh 1M-token, và hỗ trợ đầu vào văn bản, hình ảnh, video và âm thanh với đầu ra văn bản. Các thông số kỹ thuật của Artificial Analysis liệt kê cùng số lượng tham số, cửa sổ ngữ cảnh và các modality, và ghi nhận giấy phép MIT, cho phép sử dụng thương mại.
Thẻ mô tả một backbone gồm 70 lớp, 60 lớp attention dạng cửa sổ trượt xen kẽ với 10 lớp attention toàn cục, với 384 chuyên gia được định tuyến trong đó tám chuyên gia hoạt động mỗi token. Một MiMo ViT với 681M-parameter xử lý hình ảnh, một AudioTokenizer với 308M-parameter và một bộ mã hoá audio patch với 127M-parameter xử lý âm thanh, và một bộ giải mã suy đoán đa-token năm lớp dự đoán bảy token tiếp theo cho mỗi lần truyền.
Trọng số cho MiMo-V2.6-Pro-RL và MiMo-V2.6-Flash-RL được công bố trên Hugging Face, với khả năng truy cập trên ModelScope khi ra mắt. Xiaomi cho biết họ cũng đang mở mã nguồn toàn bộ báo cáo kỹ thuật, môi trường đào tạo và mã RL để các nhà nghiên cứu có thể tái tạo và xác minh kết quả.
Buổi chạy Reinforcement Learning phát trực tiếp
Xiaomi cho biết họ đã phát trực tiếp buổi chạy reinforcement-learning khi đang diễn ra. Trong chưa đầy sáu ngày, MiMo-V2.6-Flash và MiMo-V2.6-Pro mỗi mô hình đã hoàn thành 30 bước RL trên khoảng 750,000 trajectory, với chi phí báo cáo khoảng $0.85 million và $2.62 million tương ứng. Tỷ lệ vượt qua trung bình trên các nhiệm vụ đào tạo tăng lần lượt 25% và 12% so với trước, và trên DeepSWE v1.1, một benchmark phần mềm dài hạn được giữ lại, điểm số tăng từ 48.8 lên 65.68 cho Flash và từ 58.4 lên 72.57 cho Pro, theo báo cáo của Xiaomi.
Công ty cho biết họ đã mở rộng tính toán RL trên ba trục: các batch lớn hơn trên kiến trúc hoàn toàn bất đồng bộ với 1,568 mẫu mỗi lần cập nhật, đào tạo với độ dài ngữ cảnh lên tới 1M token và 3.5 đến 3.7 tỷ token mỗi bước; một bộ đa nhiệm bao gồm lập trình, tác nhân chung, nhiệm vụ hình ảnh và cyber được kết hợp qua nhiều môi trường; và tăng cường tính toán grader, sử dụng so sánh tương đối trong mỗi nhóm để tạo ra tín hiệu phần thưởng chính xác hơn.
Thẻ mô hình chỉ định Group Relative Policy Optimization hoàn toàn bất đồng bộ với 1,568 prompt và 16 rollout mỗi bước, Groupwise Reward Synthesis để xây dựng rubrics chuyên cho từng nhiệm vụ offline từ các rollout đối lập, và Groupwise Advantage Redistribution để xếp hạng trajectory vượt qua trực tuyến. Giai đoạn distillation on-policy đa tiền tố đa giáo viên gọi là MOPD2 được thực hiện sau buổi chạy RL hỗn hợp, và Xiaomi mô tả các biện pháp phòng chống reward-hacking bao gồm thiết kế phần thưởng, đánh giá đối kháng, phát hiện bất thường và kiểm tra chéo giữa các bộ xác minh.
Giá cả, Khả dụng và Các Ứng dụng Đã Thể hiện
Trong các bảng chuẩn đoán của Xiaomi, MiMo-V2.6-Pro đạt 71,9 trên DeepSWE v1.1, so với 67,9 của Flash và 19,0 của MiMo-V2.5-Pro, đứng sau DeepSeek V4.1 Flash (74,2), Claude Opus 5 (74,0) và GPT 6 Astra (74,0). Xiaomi liệt kê Pro ở mức 1.673 trên GDPVal 2.1, một chỉ số Elo do Artificial Analysis báo cáo, phía sau Claude Fable 5.1 (1.735) và Claude Opus 5 (1.708). Các kết quả Pro khác được báo cáo bao gồm 76,9 trên Toolathlon-verified, 53,1 trên Automation Bench v1.0.6, 34,9 trên Terminal Bench 4.0 và 94,0 trên CyberGym, trong đó Flash đạt 95,1 so với GLM 5.3 là 84,5.
Cả hai mô hình đều có sẵn trên AI Studio, MiMo Code và MiMo Desktop, cũng như thông qua MiMo API Platform và OpenRouter. MiMo Desktop rời giai đoạn truy cập sớm với bản phát hành chính thức đầu tiên, tích hợp Pro và Flash, và Xiaomi cho biết chương trình truy cập sớm UltraSpeed sẽ tiếp tục trong một tuần nữa, với người dùng hiện tại được yêu cầu chuyển sang các tên mô hình mới.
Giá API không thay đổi so với dòng V2.5: mỗi triệu token, MiMo-V2.6-Pro có giá 0,0036 USD cho đầu vào cache-hit, 0,435 USD cho đầu vào cache-miss và 0,87 USD cho đầu ra; MiMo-V2.6-Flash có giá 0,0028 USD, 0,14 USD và 0,28 USD; và MiMo-V2.6-Pro-UltraSpeed có giá 0,036 USD, 4,35 USD và 8,70 USD trong ba danh mục tương tự. Artificial Analysis đo được 129,7 token đầu ra mỗi giây và thời gian 2,17 giây để token đầu tiên qua API của Xiaomi.
Các buổi trình diễn của Xiaomi bao gồm phát triển trò chơi đa đại lý, mô hình 3D Blender, điều khiển vòng kín cánh tay robot Franka Panda từ các luồng camera đa góc, thiết kế giao diện và trình bày, tạo video đầu cuối, và sáng tác nhạc, trong đó có một tác phẩm giao hưởng mang tên Night Road mà mô hình tự ghi điểm và chuyển đổi sang MIDI. Trong hai trường hợp nghiên cứu do công ty báo cáo, MiMo-V2.6-Pro đã thiết kế các ứng cử viên khung kim loại hữu cơ để hấp thụ các hợp chất PFAS cùng các chuyên gia vật liệu của Xiaomi, và nó đã tạo ra một bản formalization Lean 4 của định lý “Period Three Implies Chaos” của Li và Yorke với hơn 6.000 dòng mã, được kernel của Lean xác nhận mà không có chỗ trống chứng minh nào.












