AI-modeller og platforme
MiniMax åbner kildekode for M2.7, en selvudviklende agentmodel

Kinesisk AI-virksomhed MiniMax har frigivet vægtene for MiniMax M2.7, en 229-milliard-parameter Mixture-of-Experts-model, der deltog i sin egen udviklingscyklus – hvilket markerer, hvad virksomheden kalder det første skridt mod autonom AI-selvudvikling.
Oprindeligt annonceret den 18. marts, er MiniMax M2.7 nu frit tilgængelig på Hugging Face med installationsstøtte til SGLang, vLLM, Transformers og NVIDIA NIM. Modellen scorer 56,22% på SWE-Pro og 57,0% på Terminal Bench 2, hvilket placerer den blandt de stærkeste open-source LLM’er til virkelige software-ingeniørmæssige opgaver.
Hvordan modellen hjalp med at bygge sig selv
Det mest bemærkelsesværdige krav om M2.7 er dens rol i sin egen iteration. MiniMax gav en intern version af modellen til opgaven med at optimere en programmeringsscaffold, der kørte autonomt i over 100 runder. Under denne proces analyserede M2.7 fejlbaner, ændrede scaffold-koden, kørte evalueringer og besluttede, om at beholde eller omgøre hver ændring.
Modellen opdagede optimeringer på egen hånd: systematisk søgning efter optimale samplingparametre som temperatur og frekvensstraf, design af arbejdsgangsretningslinjer såsom automatisk kontrol for identiske fejlbaner på tværs af filer efter en korrektion, og tilføjelse af løkkeopdækning til scaffolds agentløkke. MiniMax rapporterer en 30% forbedring af ydeevnen på interne evalueringssæt fra denne autonome proces.
Inden for MiniMax’s forstærkede læringshold håndterer M2.7 nu 30% til 50% af de daglige arbejdsgange fra ende til ende. Forskere interagerer kun for kritiske beslutninger, mens modellen styrer litteraturgennemgang, eksperimentssporing, datapipelines, fejlfinding og merge-anmodninger.
MiniMax testede også M2.7 på MLE Bench Lite, OpenAI’s suite af 22 maskinlæringskonkurrencer, der kører på en enkelt A30-GPU. Over tre 24-timers forsøg producerede modellens bedste løb 9 guldmedaljer, 5 sølvmedaljer og 1 bronzemedalje. Den gennemsnitlige medalje-rate på 66,6% var lig med Gemini 3.1 og kun overgået af Opus 4.6 (75,7%) og GPT-5.4 (71,2%).
Benchmark-ydeevne på tværs af ingeniør- og kontorarbejde
På software-ingeniørmæssige benchmarks matcher eller nærmer M2.7 sig frontløbende lukkede kilde-modeller. Dens 56,22% på SWE-Pro – en benchmark, der dækker log-analyse, fejlfejlsning, kode-sikkerhedsrevision og ML-arbejdsgangsfejlfinding på tværs af multiple programmeringssprog – matcher GPT-5.3-Codex. På VIBE-Pro, en repo-niveau kode-genereringsbenchmark, scorede den 55,6%, og den registrerede 76,5 på SWE Multilingual og 52,7 på Multi SWE Bench.
Ud over AI-kode-genereringsværktøjer positionerede MiniMax M2.7 for professionelle kontoropgaver. På GDPval-AA, der vurderer domæneekspertise på tværs af 45 modeller, opnåede M2.7 en ELO-score på 1495 – den højeste blandt open-source-modeller, kun overgået af Opus 4.6, Sonnet 4.6 og GPT-5.4. På Toolathon nåede den 46,3% nøjagtighed, og den opretholdt en 97% færdigheds-overensstemmelsesrate på tværs af 40 komplekse færdigheder (hver over 2.000 tokens) i MiniMax’s MM Claw-evaluering.
Modellen understøtter naturlig multi-agent-samarbejde gennem, hvad MiniMax kalder Agent Teams, hvor multiple model-forekomster opretholder distinkte rolle-identiteter og arbejder sammen på opgaver. Denne funktion sigter mod AI-agenter til forretningsautomatisering-scenarier, hvor stabile rollegrænser og modstridende resonnering mellem agenter er nødvendige.
MiniMax byggede M2.7 på en Mixture-of-Experts-arkitektur, hvilket betyder, at kun en undermængde af dens 229 milliarder parametre aktiveres under en enkelt inferens-passage. Dette gør modellen billigere og hurtigere at betjene end en tæt model af sammenlignelig udgangskvalitet – en vigtig overvejelse for udviklere, der ønsker at køre modeller lokalt eller på begrænsede infrastrukturer.
MiniMax åbnede også OpenRoom, en interaktiv demo bygget primært af AI, der placerer agent-interaktioner inde i en web-GUI med realtids-visuel feedback, hvilket signalerer dens interesse i at udvide store sprogmodeller ud over produktivitet til interaktiv underholdning.
Udgivelsen tilføjer endnu en konkurrencedygtig mulighed til det åbne vægts agent-færdigheds-landskab, hvor modeller fra Meta, Alibaba og DeepSeek har presset grænserne for, hvad der er frit tilgængeligt. Den selvudviklende vinkel – hvor en model betydeligt bidrager til at forbedre sin egen efterfølger – er stadig i et tidligt stadium, men M2.7 tilbyder de første konkrete datapunkter for, hvordan det ser ud i praksis: en 30% intern benchmark-forbedring fra 100+ autonome optimeringsrunder, uden menneskelig indgriben i løkken.












