AI-modellen en platforms

MiniMax Maakt M2.7 Open Source, een Zelf-Evoluerend Agent Model

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Het Chinese AI-bedrijf MiniMax heeft de gewichten voor MiniMax M2.7 vrijgegeven, een 229-miljard-parameter Mixture-of-Experts-model dat deelnam aan zijn eigen ontwikkelingscyclus – wat het bedrijf noemt de eerste stap naar autonome AI-zelfevolutie.

Oorspronkelijk aangekondigd op 18 maart, is MiniMax M2.7 nu gratis beschikbaar op Hugging Face met implementatieondersteuning voor SGLang, vLLM, Transformers en NVIDIA NIM. Het model scoort 56,22% op SWE-Pro en 57,0% op Terminal Bench 2, waarmee het een van de sterkste open-source LLM’s is voor real-world software-engineeringtaken.

Hoe het Model Zichzelf Hielp Bouwen

De meest opvallende claim over M2.7 is zijn rol in zijn eigen iteratie. MiniMax gaf een interne versie van het model de taak om een programmeerscaffold te optimaliseren, dat autonoom werd uitgevoerd voor meer dan 100 ronden. Tijdens dat proces analyseerde M2.7 fouttrajecten, wijzigde scaffoldcode, voerde evaluaties uit en besloot of elke wijziging moest worden behouden of teruggedraaid.

Het model ontdekte optimalisaties op zichzelf: systematisch zoeken naar optimale steekproefparameters zoals temperatuur en frequentiepenalty, ontwerpen van workflowrichtlijnen zoals automatisch controleren op identieke bugpatronen in bestanden na een fix, en toevoegen van lusdetectie aan de scaffold’s agentlus. MiniMax meldt een prestatieverbetering van 30% op interne evaluatiesets vanuit dit autonome proces.

Binnen het reinforcement learning-team van MiniMax behandelt M2.7 nu 30% tot 50% van de dagelijkse workflows eind-tot-eind. Onderzoekers interacteren alleen voor kritische beslissingen, terwijl het model literature review, experimenten bijhoudt, datapipelines, debugging en merge-aanvragen beheert.

MiniMax testte M2.7 ook op MLE Bench Lite, OpenAI’s suite van 22 machine learning-competities die draaien op een enkele A30 GPU. Over drie 24-uur-proeven produceerde de beste run van het model 9 gouden medailles, 5 zilveren medailles en 1 bronzen medaille. Het gemiddelde medaillepercentage van 66,6% was gelijk aan Gemini 3.1 en volgde alleen Opus 4.6 (75,7%) en GPT-5.4 (71,2%).

Benchmarkprestaties Over Engineering en Kantoorwerk

Op software-engineeringbenchmarks komt M2.7 overeen met of benadert gesloten bronmodellen. Zijn 56,22% op SWE-Pro – een benchmark die loganalyse, bugopsporing, codebeveiligingsreview en ML-workflowdebugging omvat in meerdere programmeertalen – komt overeen met GPT-5.3-Codex. Op VIBE-Pro, een repo-niveau codegeneratiebenchmark, scoorde het 55,6%, en het registreerde 76,5 op SWE Multilingual en 52,7 op Multi SWE Bench.

Verder dan AI-codegeneratoren, positioneerde MiniMax M2.7 voor professionele kantoor taken. Op GDPval-AA, die domeinexpertise evalueert over 45 modellen, behaalde M2.7 een ELO-score van 1495 – de hoogste onder open-sourcemodellen, alleen gevolgd door Opus 4.6, Sonnet 4.6 en GPT-5.4. Op Toolathon bereikte het 46,3% nauwkeurigheid, en het behield een vaardigheidscompliancerate van 97% over 40 complexe vaardigheden (elk boven de 2.000 tokens) in MiniMax’ MM Claw-evaluatie.

Het model ondersteunt native multi-agent-samenwerking via wat MiniMax noemt Agent Teams, waarin meerdere modelinstanties afzonderlijke rolidentiteiten behouden en samenwerken aan taken. Deze functionaliteit richt zich op AI-agents voor bedrijfsautomatisering-scenario’s waarin stabiele rolgrenzen en tegenstrijdige redenering tussen agents vereist zijn.

MiniMax bouwde M2.7 op een Mixture-of-Experts-architectuur, wat betekent dat alleen een subset van de 229 miljard parameters actief is tijdens elke enkele inferentiepas. Dit maakt het model goedkoper en sneller om te serveren dan een dicht model van vergelijkbare outputkwaliteit – een belangrijke overweging voor ontwikkelaars die modellen lokaal of op beperkte infrastructuur willen uitvoeren.

MiniMax maakte ook OpenRoom open source, een interactieve demo die grotendeels door AI is gebouwd en agentinteracties plaatst in een web-GUI met real-time visuele feedback, waarmee het zijn interesse toont om grote taalmodellen uit te breiden van productiviteit naar interactieve entertainment.

De release voegt een concurrerende optie toe aan het open-gewicht agentvaardigheden-landschap, waarin modellen van Meta, Alibaba en DeepSeek de grenzen van wat gratis beschikbaar is hebben verlegd. Het zelfevolutieaspect – waarin een model significant bijdraagt aan het verbeteren van zijn eigen opvolger – is nog in de vroege fase, maar M2.7 biedt de eerste concrete gegevens over hoe dat er in de praktijk uitziet: een interne benchmarkverbetering van 30% van 100+ autonome optimalisatieronden, zonder menselijke interventie in de lus.

Alex McFarland is een AI-journalist en schrijver die de laatste ontwikkelingen op het gebied van kunstmatige intelligentie onderzoekt. Hij heeft samengewerkt met talloze AI-startups en publicaties wereldwijd.