Модели и платформы ИИ

MiniMax открыл исходный код M2.7, модели самоэволюционирующего агента

mm
Добавьте Unite.AI в избранные источники в Google

Китайская компания по искусственному интеллекту MiniMax выпустила веса для MiniMax M2.7, модели Mixture-of-Experts с 229 миллиардами параметров, которая участвовала в собственном цикле разработки – что компания называет первым шагом к автономной самоэволюции ИИ.

Первоначально объявлено 18 марта, MiniMax M2.7 теперь доступен бесплатно на Hugging Face с поддержкой развертывания для SGLang, vLLM, Transformers и NVIDIA NIM. Модель набирает 56,22% на SWE-Pro и 57,0% на Terminal Bench 2, что ставит ее среди самых сильных открытых моделей LLM для реальных задач программной инженерии.

Как модель помогла построить себя

Самым заметным утверждением о M2.7 является ее роль в собственном улучшении. MiniMax поручил внутренней версии модели оптимизировать программный каркас, запустив ее автономно более чем на 100 раундов. В течение этого процесса M2.7 анализировала траектории неудач, изменяла код каркаса, проводила оценки и решала, сохранять или отменять каждое изменение.

Модель открыла оптимизации самостоятельно: систематически搜索я оптимальные параметры выборки, такие как температура и штраф за частоту, проектируя руководства по рабочему процессу, такие как автоматическая проверка на идентичные шаблоны ошибок в файлах после исправления, и добавляя обнаружение циклов в цикле агента каркаса. MiniMax сообщает о 30% улучшении производительности на внутренних наборах оценки из этого автономного процесса.

В команде по обучению с подкреплением MiniMax M2.7 теперь обрабатывает 30% до 50% ежедневных рабочих процессов от начала до конца. Исследователи взаимодействуют только для критических решений, в то время как модель управляет обзором литературы, отслеживанием экспериментов, трубопроводами данных, отладкой и запросами на слияние.

MiniMax также протестировала M2.7 на MLE Bench Lite, наборе из 22 машинных обучений, который запускается на одном A30 GPU. В течение трех 24-часовых испытаний лучший запуск модели принес 9 золотых медалей, 5 серебряных медалей и 1 бронзовую медаль. Средний показатель медалей 66,6% совпал с Gemini 3.1 и уступил только Opus 4.6 (75,7%) и GPT-5.4 (71,2%).

Производительность на бенчмарках по инженерии и офисной работе

На бенчмарках программной инженерии M2.7 соответствует или приближается к закрытым моделям. Ее результат 56,22% на SWE-Pro – бенчмарке, который охватывает анализ журналов, устранение неисправностей, проверку безопасности кода и отладку рабочих процессов ML на нескольких языках программирования – соответствует GPT-5.3-Codex. На VIBE-Pro, бенчмарке генерации кода на уровне репозитория, она набрала 55,6%, и она зарегистрировала 76,5 на SWE Multilingual и 52,7 на Multi SWE Bench.

Помимо генераторов кода ИИ, MiniMax позиционировала M2.7 для профессиональных офисных задач. На GDPval-AA, который оценивает экспертизу в 45 моделях, M2.7 достигла рейтинга Эло 1495 – самого высокого среди открытых моделей, уступая только Opus 4.6, Sonnet 4.6 и GPT-5.4. На Toolathon она достигла 46,3% точности, и она сохранила 97% показателя соблюдения навыков на 40 сложных навыках (каждый превышает 2000 токенов) в оценке MiniMax MM Claw.

Модель поддерживает родовую многоагентную сотрудничество через то, что MiniMax называет Agent Teams, где несколько экземпляров модели сохраняют разные роли и работают вместе над задачами. Эта возможность нацелена на агентов ИИ для бизнес-автоматизации сценариев, где требуются стабильные границы ролей и противоречивые рассуждения между агентами.

MiniMax построила M2.7 на архитектуре Mixture-of-Experts, что означает, что только подмножество ее 229 миллиардов параметров активируется во время каждого единого прохода вывода. Это делает модель дешевле и быстрее для обслуживания, чем плотная модель сравнимого качества вывода – важное соображение для разработчиков, которые хотят запускать модели локально или на ограниченной инфраструктуре.

MiniMax также открыла OpenRoom, интерактивную демонстрацию, построенную в основном ИИ, которая помещает взаимодействия агентов внутри веб-интерфейса с реальной визуальной обратной связью, сигнализируя о своем интересе к расширению крупных языковых моделей за пределы производительности в интерактивное развлечение.

Выпуск добавляет еще один конкурентный вариант в ландшафт открытых навыков агентов, где модели от Meta, Alibaba и DeepSeek расширяют границы того, что доступно бесплатно. Угол самоэволюции – где модель существенно способствует улучшению своего собственного преемника – остается на ранней стадии, но M2.7 предлагает первые конкретные данные о том, как это выглядит на практике: 30% внутреннего прироста бенчмарка от 100+ автономных раундов оптимизации, без вмешательства человека в цикл.

Алекс Макфарленд - журналист и писатель в области искусственного интеллекта, исследующий последние разработки в этой области. Он сотрудничал с многочисленными стартапами и изданиями в области искусственного интеллекта во всем мире.