Mô hình và nền tảng AI

MiniMax Phát Hành M2.7, Một Mô Hình Trợ Lý Tự Tiến Hóa

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Công ty AI Trung Quốc MiniMax đã phát hành trọng lượng cho MiniMax M2.7, một mô hình Mixture-of-Experts 229 tỷ tham số đã tham gia vào chu kỳ phát triển của chính nó – đánh dấu bước đầu tiên hướng tới sự tự tiến hóa của AI.

Ban đầu được công bố vào ngày 18 tháng 3, MiniMax M2.7 hiện đã có sẵn miễn phí trên Hugging Face với hỗ trợ triển khai cho SGLang, vLLM, Transformers và NVIDIA NIM. Mô hình này đạt điểm 56,22% trên SWE-Pro và 57,0% trên Terminal Bench 2, đứng trong số các mô hình LLM mã nguồn mở mạnh nhất cho các nhiệm vụ kỹ thuật phần mềm thực tế.

Cách Mô Hình Giúp Xây Dựng Chính Nó

Yếu tố đáng chú ý nhất về M2.7 là vai trò của nó trong sự lặp lại của chính mình. MiniMax đã giao cho một phiên bản nội bộ của mô hình này nhiệm vụ tối ưu hóa một khuôn khổ lập trình, chạy nó tự động trong hơn 100 vòng. Trong quá trình đó, M2.7 đã phân tích các đường cong thất bại, sửa đổi mã khuôn khổ, chạy đánh giá và quyết định liệu có giữ lại hoặc trả lại mỗi thay đổi.

Mô hình này đã tự phát hiện ra các tối ưu hóa: tìm kiếm có hệ thống các tham số lấy mẫu tối ưu như nhiệt độ và phạt tần số, thiết kế hướng dẫn công việc như tự động kiểm tra các mẫu lỗi giống nhau trên các tệp sau khi sửa, và thêm phát hiện vòng lặp vào vòng lặp tác nhân của khuôn khổ. MiniMax báo cáo một sự cải thiện hiệu suất 30% trên các tập dữ liệu đánh giá nội bộ từ quá trình tự động này.

Trong nhóm học tăng cường của MiniMax, M2.7 hiện xử lý 30% đến 50% công việc hàng ngày từ đầu đến cuối. Các nhà nghiên cứu chỉ tương tác cho các quyết định quan trọng, trong khi mô hình này quản lý việc xem xét tài liệu, theo dõi thí nghiệm, đường ống dữ liệu, gỡ lỗi và yêu cầu hợp nhất.

MiniMax cũng đã thử nghiệm M2.7 trên MLE Bench Lite, bộ công cụ 22 cuộc thi học máy của OpenAI chạy trên một GPU A30 duy nhất. Trong ba lần thử nghiệm 24 giờ, lần chạy tốt nhất của mô hình này đã sản xuất 9 huy chương vàng, 5 huy chương bạc và 1 huy chương đồng. Tỷ lệ huy chương trung bình là 66,6%, ngang bằng với Gemini 3.1 và chỉ sau Opus 4.6 (75,7%) và GPT-5.4 (71,2%).

Hiệu Suất Benchmark Trên Kỹ Thuật Và Công Việc Văn Phòng

Trên các tiêu chuẩn kỹ thuật phần mềm, M2.7 tương đương hoặc gần với các mô hình đóng mã nguồn tiên tiến. Điểm 56,22% của nó trên SWE-Pro – một tiêu chuẩn bao gồm phân tích nhật ký, xử lý sự cố, xem xét bảo mật mã và gỡ lỗi công việc ML trên nhiều ngôn ngữ lập trình – tương đương với GPT-5.3-Codex. Trên VIBE-Pro, một tiêu chuẩn tạo mã cấp kho, nó đạt 55,6%, và nó đăng ký 76,5 trên SWE Multilingual và 52,7 trên Multi SWE Bench.

Beyond các công cụ tạo mã AI, MiniMax đã định vị M2.7 cho các nhiệm vụ văn phòng chuyên nghiệp. Trên GDPval-AA, mô hình này đạt được điểm ELO là 1495 – cao nhất trong số các mô hình mã nguồn mở, chỉ sau Opus 4.6, Sonnet 4.6 và GPT-5.4. Trên Toolathon, nó đạt 46,3% độ chính xác, và nó duy trì tỷ lệ tuân thủ kỹ năng 97% trên 40 kỹ năng phức tạp (mỗi kỹ năng vượt quá 2.000 token) trong đánh giá MM Claw của MiniMax.

Mô hình này hỗ trợ sự hợp tác đa tác nhân bản địa thông qua những gì MiniMax gọi là Agent Teams, nơi nhiều thể hiện mô hình duy trì các bản sắc vai trò riêng biệt và làm việc cùng nhau trên các nhiệm vụ. Khả năng này nhắm vào các tác nhân AI cho tự động hóa kinh doanh trong đó các ranh giới vai trò ổn định và lý luận đối thủ giữa các tác nhân là cần thiết.

MiniMax đã xây dựng M2.7 trên kiến trúc Mixture-of-Experts, có nghĩa là chỉ một tập hợp con của 229 tỷ tham số tổng thể được kích hoạt trong mỗi lần suy luận. Điều này làm cho mô hình này rẻ hơn và nhanh hơn để phục vụ so với một mô hình dày đặc có chất lượng đầu ra tương đương – một yếu tố quan trọng đối với các nhà phát triển muốn chạy mô hình cục bộ hoặc trên cơ sở hạ tầng hạn chế.

MiniMax cũng đã phát hành OpenRoom, một bản demo tương tác được xây dựng chủ yếu bởi AI, đặt tương tác tác nhân bên trong một giao diện người dùng web với phản hồi trực quan thời gian thực, cho thấy sự quan tâm của họ trong việc mở rộng các mô hình ngôn ngữ lớn vượt ra ngoài năng suất vào giải trí tương tác.

Phát hành này thêm một lựa chọn cạnh tranh khác vào cảnh quan kỹ năng tác nhân mã nguồn mở, nơi các mô hình từ Meta, Alibaba và DeepSeek đã đẩy ranh giới của những gì có sẵn miễn phí. Góc độ tự tiến hóa – nơi một mô hình góp phần có ý nghĩa vào việc cải thiện người kế nhiệm của nó – vẫn còn ở giai đoạn đầu, nhưng M2.7 cung cấp những điểm dữ liệu cụ thể đầu tiên về việc nó trông như thế nào trong thực tế: một sự cải thiện 30% về điểm chuẩn nội bộ từ 100+ vòng tối ưu hóa tự động, không có sự can thiệp của con người trong vòng lặp.

Alex McFarland là một nhà báo và nhà văn về trí tuệ nhân tạo, khám phá những phát triển mới nhất trong lĩnh vực trí tuệ nhân tạo. Ông đã hợp tác với nhiều công ty khởi nghiệp và xuất bản về trí tuệ nhân tạo trên toàn thế giới.