AI-modeller och plattformar

MiniMax slÃĪpper M2.7, en sjÃĪlvutvecklande agentmodell

mm
LÃĪgg till Unite.AI bland dina fÃķredragna kÃĪllor pÃĨ Google

Kinesiska AI-fÃķretaget MiniMax har slÃĪppt viktorna fÃķr MiniMax M2.7, en 229-miljarders parameter Mixture-of-Experts-modell som deltog i sin egen utvecklingscykel – vilket markerar vad fÃķretaget kallar det fÃķrsta steget mot autonom AI-sjÃĪlvutveckling.

Ursprungligen tillkÃĪnnagiven den 18 mars, ÃĪr MiniMax M2.7 nu fritt tillgÃĪnglig pÃĨ Hugging Face med distributionsstÃķd fÃķr SGLang, vLLM, Transformers och NVIDIA NIM. Modellen fÃĨr 56,22 % pÃĨ SWE-Pro och 57,0 % pÃĨ Terminal Bench 2, vilket placerar den bland de starkaste Ãķppen kÃĪllkods-LLM fÃķr verkliga mjukvaruutvecklingsuppgifter.

Hur modellen hjÃĪlpte till att bygga sig sjÃĪlv

Det mest anmÃĪrkningsvÃĪrda pÃĨstÃĨendet om M2.7 ÃĪr dess roll i sin egen iteration. MiniMax gav en intern version av modellen i uppgift att optimera ett programmeringsstÃĪll, som kÃķrdes autonomt i Ãķver 100 omgÃĨngar. Under den processen analyserade M2.7 feltrafik, modifierade stÃĪllkoden, kÃķrde utvÃĪrderingar och beslutade om den skulle behÃĨlla eller ÃĨterstÃĪlla varje ÃĪndring.

Modellen upptÃĪckte optimiseringar pÃĨ egen hand: systematiskt sÃķkande efter optimala sampelparametrar som temperatur och frekvensstraff, design av arbetsflÃķdesriktlinjer som automatiskt kontrollerar fÃķr identiska felsmÃķnster Ãķver filer efter en korrigering, och lÃĪgga till slingdetektering till stÃĪllets agentloop. MiniMax rapporterar en 30 % prestandafÃķrbÃĪttring pÃĨ interna utvÃĪrderingssatser frÃĨn denna autonoma process.

Inom MiniMax reinforcement learning-team hanterar M2.7 nu 30 % till 50 % av de dagliga arbetsflÃķdena frÃĨn bÃķrjan till slut. Forskare interagerar endast fÃķr kritiska beslut, medan modellen hanterar litteraturÃķversikt, experimentsspÃĨrning, data pipelines, felsÃķkning och sammanfogningsbegÃĪranden.

MiniMax testade ocksÃĨ M2.7 pÃĨ MLE Bench Lite, OpenAIs svit av 22 maskinlÃĪrningskonkurrens som kÃķrs pÃĨ en enda A30-GPU. Under tre 24-timmarsfÃķrsÃķk producerade modellens bÃĪsta kÃķrning 9 guldmedaljer, 5 silvermedaljer och 1 bronsmedalj. Den genomsnittliga medaljfrekvensen pÃĨ 66,6 % var densamma som Gemini 3.1 och endast ÃķvertrÃĪffad av Opus 4.6 (75,7 %) och GPT-5.4 (71,2 %).

Benchmarkprestanda Ãķver ingenjÃķrs- och kontorsarbete

PÃĨ mjukvaruutvecklingsbenchmark presterar M2.7 lika bra som eller nÃĪrmar sig de bÃĪsta slutna kÃĪllkodsmodellerna. Dess 56,22 % pÃĨ SWE-Pro – en benchmark som tÃĪcker logganalys, felsÃķkning, kodgranskning och ML-arbetsflÃķdesfelsÃķkning Ãķver flera programmeringssprÃĨk – ÃĪr densamma som GPT-5.3-Codex. PÃĨ VIBE-Pro, en repo-nivÃĨ kodgenereringsbenchmark, fick den 55,6 %, och den registrerade 76,5 pÃĨ SWE Multilingual och 52,7 pÃĨ Multi SWE Bench.

FÃķrutom AI-kodgenererare positionerade MiniMax M2.7 fÃķr professionella kontorsuppgifter. PÃĨ GDPval-AA, som utvÃĪrderar domÃĪnexpertis Ãķver 45 modeller, uppnÃĨdde M2.7 en ELO-poÃĪng pÃĨ 1495 – den hÃķgsta bland Ãķppen kÃĪllkodsmodeller, endast ÃķvertrÃĪffad av Opus 4.6, Sonnet 4.6 och GPT-5.4. PÃĨ Toolathon nÃĨdde den 46,3 % noggrannhet, och den upprÃĪtthÃķll en 97 % fÃĪrdighetskompatibilitetsfrekvens Ãķver 40 komplexa fÃĪrdigheter (var och en Ãķverstigande 2 000 token) i MiniMax MM Claw-utvÃĪrdering.

Modellen stÃķder native multi-agent-samarbete genom vad MiniMax kallar Agent Teams, dÃĪr flera modellinstanser upprÃĪtthÃĨller distinkta rollidentiteter och arbetar tillsammans pÃĨ uppgifter. Denna funktion riktar sig till AI-agenter fÃķr affÃĪrsautomatisering scenarier dÃĪr stabila rollgrÃĪnser och antagonistiskt resonemang mellan agenter krÃĪvs.

MiniMax byggde M2.7 pÃĨ en Mixture-of-Experts-arkitektur, vilket innebÃĪr att endast en delmÃĪngd av dess 229 miljarder totala parametrar aktiveras under en enda inferenspass. Detta gÃķr modellen billigare och snabbare att serva ÃĪn en tÃĪt modell med jÃĪmfÃķrbar utmatningskvalitet – en viktig ÃķvervÃĪgning fÃķr utvecklare som vill kÃķra modeller lokalt eller pÃĨ begrÃĪnsad infrastruktur.

MiniMax slÃĪppte ocksÃĨ OpenRoom, en interaktiv demo byggd mestadels av AI som placerar agentinteraktioner inuti en webb-GUI med realtidsvisuell ÃĨterkoppling, vilket signalerar dess intresse fÃķr att utÃķka stora sprÃĨkmodeller bortom produktivitet till interaktiv underhÃĨllning.

SlÃĪppet lÃĪgger till ett annat konkurrenskraftigt alternativ till det Ãķppna viktlandskapet fÃķr agentfÃĪrdigheter, dÃĪr modeller frÃĨn Meta, Alibaba och DeepSeek har pressat grÃĪnserna fÃķr vad som ÃĪr fritt tillgÃĪngligt. SjÃĪlvutvecklingsaspekten – dÃĪr en modell meningsfullt bidrar till att fÃķrbÃĪttra sin egen eftertrÃĪdare – fÃķrblir i tidiga skeden, men M2.7 erbjuder de fÃķrsta konkreta datapunkterna fÃķr vad det ser ut i praktiken: en 30 % intern benchmark-vinst frÃĨn 100+ autonoma optimeringsomgÃĨngar, utan mÃĪnskligt ingrepp i loopen.

Alex McFarland ÃĪr en AI-journalist och fÃķrfattare som utforskar de senaste utvecklingarna inom artificiell intelligens. Han har samarbetat med mÃĨnga AI-startups och publikationer Ãķver hela vÃĪrlden.