AI-modeller och plattformar

MiniMax släpper M2.7, en självutvecklande agentmodell

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Kinesiska AI-företaget MiniMax har släppt viktorna för MiniMax M2.7, en 229-miljarders parameter Mixture-of-Experts-modell som deltog i sin egen utvecklingscykel – vilket markerar vad företaget kallar det första steget mot autonom AI-självutveckling.

Ursprungligen tillkännagiven den 18 mars, är MiniMax M2.7 nu fritt tillgänglig på Hugging Face med distributionsstöd för SGLang, vLLM, Transformers och NVIDIA NIM. Modellen får 56,22 % på SWE-Pro och 57,0 % på Terminal Bench 2, vilket placerar den bland de starkaste öppen källkods-LLM för verkliga mjukvaruutvecklingsuppgifter.

Hur modellen hjälpte till att bygga sig själv

Det mest anmärkningsvärda påståendet om M2.7 är dess roll i sin egen iteration. MiniMax gav en intern version av modellen i uppgift att optimera ett programmeringsställ, som kördes autonomt i över 100 omgångar. Under den processen analyserade M2.7 feltrafik, modifierade ställkoden, körde utvärderingar och beslutade om den skulle behålla eller återställa varje ändring.

Modellen upptäckte optimiseringar på egen hand: systematiskt sökande efter optimala sampelparametrar som temperatur och frekvensstraff, design av arbetsflödesriktlinjer som automatiskt kontrollerar för identiska felsmönster över filer efter en korrigering, och lägga till slingdetektering till ställets agentloop. MiniMax rapporterar en 30 % prestandaförbättring på interna utvärderingssatser från denna autonoma process.

Inom MiniMax reinforcement learning-team hanterar M2.7 nu 30 % till 50 % av de dagliga arbetsflödena från början till slut. Forskare interagerar endast för kritiska beslut, medan modellen hanterar litteraturöversikt, experimentsspårning, data pipelines, felsökning och sammanfogningsbegäranden.

MiniMax testade också M2.7 på MLE Bench Lite, OpenAIs svit av 22 maskinlärningskonkurrens som körs på en enda A30-GPU. Under tre 24-timmarsförsök producerade modellens bästa körning 9 guldmedaljer, 5 silvermedaljer och 1 bronsmedalj. Den genomsnittliga medaljfrekvensen på 66,6 % var densamma som Gemini 3.1 och endast överträffad av Opus 4.6 (75,7 %) och GPT-5.4 (71,2 %).

Benchmarkprestanda över ingenjörs- och kontorsarbete

På mjukvaruutvecklingsbenchmark presterar M2.7 lika bra som eller närmar sig de bästa slutna källkodsmodellerna. Dess 56,22 % på SWE-Pro – en benchmark som täcker logganalys, felsökning, kodgranskning och ML-arbetsflödesfelsökning över flera programmeringsspråk – är densamma som GPT-5.3-Codex. På VIBE-Pro, en repo-nivå kodgenereringsbenchmark, fick den 55,6 %, och den registrerade 76,5 på SWE Multilingual och 52,7 på Multi SWE Bench.

Förutom AI-kodgenererare positionerade MiniMax M2.7 för professionella kontorsuppgifter. På GDPval-AA, som utvärderar domänexpertis över 45 modeller, uppnådde M2.7 en ELO-poäng på 1495 – den högsta bland öppen källkodsmodeller, endast överträffad av Opus 4.6, Sonnet 4.6 och GPT-5.4. På Toolathon nådde den 46,3 % noggrannhet, och den upprätthöll en 97 % färdighetskompatibilitetsfrekvens över 40 komplexa färdigheter (var och en överstigande 2 000 token) i MiniMax MM Claw-utvärdering.

Modellen stöder native multi-agent-samarbete genom vad MiniMax kallar Agent Teams, där flera modellinstanser upprätthåller distinkta rollidentiteter och arbetar tillsammans på uppgifter. Denna funktion riktar sig till AI-agenter för affärsautomatisering scenarier där stabila rollgränser och antagonistiskt resonemang mellan agenter krävs.

MiniMax byggde M2.7 på en Mixture-of-Experts-arkitektur, vilket innebär att endast en delmängd av dess 229 miljarder totala parametrar aktiveras under en enda inferenspass. Detta gör modellen billigare och snabbare att serva än en tät modell med jämförbar utmatningskvalitet – en viktig övervägning för utvecklare som vill köra modeller lokalt eller på begränsad infrastruktur.

MiniMax släppte också OpenRoom, en interaktiv demo byggd mestadels av AI som placerar agentinteraktioner inuti en webb-GUI med realtidsvisuell återkoppling, vilket signalerar dess intresse för att utöka stora språkmodeller bortom produktivitet till interaktiv underhållning.

Släppet lägger till ett annat konkurrenskraftigt alternativ till det öppna viktlandskapet för agentfärdigheter, där modeller från Meta, Alibaba och DeepSeek har pressat gränserna för vad som är fritt tillgängligt. Självutvecklingsaspekten – där en modell meningsfullt bidrar till att förbättra sin egen efterträdare – förblir i tidiga skeden, men M2.7 erbjuder de första konkreta datapunkterna för vad det ser ut i praktiken: en 30 % intern benchmark-vinst från 100+ autonoma optimeringsomgångar, utan mänskligt ingrepp i loopen.

Alex leder Unite.AI:s AI‑drivna nyhetsverksamhet och kombinerar journalistik, forskning och automation för att stödja snabb och skalbar bevakning av artificiell intelligens. Hans arbete bidrar till att nya AI‑utvecklingar framträder effektivt samtidigt som publikationen upprätthåller sina redaktionella standarder.