Modelli e piattaforme di IA

MiniMax Rilascia M2.7, un Modello di Agente che si Evolve da Solo

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

La società cinese di intelligenza artificiale MiniMax ha rilasciato i pesi per MiniMax M2.7, un modello Mixture-of-Experts da 229 miliardi di parametri che ha partecipato al proprio ciclo di sviluppo – segnando ciÃē che la società definisce il primo passo verso l’auto-evoluzione dell’intelligenza artificiale.

Originariamente annunciato il 18 marzo, MiniMax M2.7 ÃĻ ora disponibile gratuitamente su Hugging Face con supporto per la distribuzione su SGLang, vLLM, Transformers e NVIDIA NIM. Il modello ottiene un punteggio del 56,22% su SWE-Pro e del 57,0% su Terminal Bench 2, posizionandolo tra i piÃđ forti modelli di linguaggio open-source per compiti di ingegneria del software nel mondo reale.

Come il Modello ha Contribuito a Costruire se Stesso

La rivendicazione piÃđ nota su M2.7 ÃĻ il suo ruolo nella propria iterazione. MiniMax ha affidato a una versione interna del modello l’ottimizzazione di uno scaffold di programmazione, eseguendolo in modo autonomo per oltre 100 round. Durante quel processo, M2.7 ha analizzato le traiettorie di fallimento, modificato il codice dello scaffold, eseguito valutazioni e deciso se mantenere o revertire ogni modifica.

Il modello ha scoperto ottimizzazioni da solo: cercando sistematicamente parametri di campionamento ottimali come temperatura e penalità di frequenza, progettando linee guida di flusso di lavoro come il controllo automatico di pattern di bug identici tra file dopo una correzione, e aggiungendo la rilevazione di loop allo scaffold dell’agente. MiniMax segnala un miglioramento delle prestazioni del 30% sui set di valutazione interni da questo processo autonomo.

All’interno del team di apprendimento per rinforzo di MiniMax, M2.7 gestisce ora il 30% al 50% dei flussi di lavoro quotidiani end-to-end. I ricercatori interagiscono solo per decisioni critiche, mentre il modello gestisce la revisione della letteratura, il tracciamento degli esperimenti, le pipeline di dati, il debugging e le richieste di merge.

MiniMax ha anche testato M2.7 su MLE Bench Lite, la suite di 22 competizioni di apprendimento automatico di OpenAI che girano su un’unica GPU A30. In tre prove da 24 ore, l’esecuzione migliore del modello ha prodotto 9 medaglie d’oro, 5 medaglie d’argento e 1 medaglia di bronzo. La media del tasso di medaglie del 66,6% ha eguagliato Gemini 3.1 e ha superato solo Opus 4.6 (75,7%) e GPT-5.4 (71,2%).

Prestazioni di Benchmark su Ingegneria e Lavoro di Ufficio

Su benchmark di ingegneria del software, M2.7 eguaglia o si avvicina a modelli chiusi di frontiera. Il suo punteggio del 56,22% su SWE-Pro – un benchmark che copre l’analisi dei log, la risoluzione dei bug, la revisione della sicurezza del codice e il debugging del flusso di lavoro di apprendimento automatico su piÃđ linguaggi di programmazione – eguaglia GPT-5.3-Codex. Su VIBE-Pro, un benchmark di generazione di codice a livello di repository, ha segnato il 55,6%, e ha registrato il 76,5 su SWE Multilingual e il 52,7 su Multi SWE Bench.

Oltre ai generatori di codice AI, MiniMax ha posizionato M2.7 per compiti di ufficio professionale. Su GDPval-AA, che valuta l’esperienza di dominio su 45 modelli, M2.7 ha raggiunto un punteggio ELO di 1495 – il piÃđ alto tra i modelli open-source, superato solo da Opus 4.6, Sonnet 4.6 e GPT-5.4. Su Toolathon, ha raggiunto il 46,3% di precisione, e ha mantenuto un tasso di conformità delle competenze del 97% su 40 competenze complesse (ognuna superiore a 2.000 token) nella valutazione MM Claw di MiniMax.

Il modello supporta la collaborazione multi-agente nativa attraverso ciÃē che MiniMax chiama Agent Teams, dove piÃđ istanze del modello mantengono identità di ruolo distinte e lavorano insieme sui compiti. Questa funzionalità si concentra su scenari di automazione aziendale con agenti AI in cui sono richiesti confini di ruolo stabili e ragionamento avversario tra gli agenti.

MiniMax ha costruito M2.7 su un’architettura Mixture-of-Experts, il che significa che solo una parte dei suoi 229 miliardi di parametri totali si attivano durante ogni singola inferenza. CiÃē rende il modello piÃđ economico e veloce da servire rispetto a un modello denso di qualità di output comparabile – una considerazione importante per gli sviluppatori che desiderano eseguire modelli localmente o su infrastrutture limitate.

MiniMax ha anche open-source OpenRoom, una demo interattiva costruita principalmente da AI che posiziona le interazioni degli agenti all’interno di un’interfaccia utente web con feedback visivo in tempo reale, segnalando il suo interesse nell’estendere i grandi modelli di linguaggio oltre la produttività verso l’intrattenimento interattivo.

Il rilascio aggiunge un’altra opzione competitiva al paesaggio delle competenze degli agenti open-source, dove modelli di Meta, Alibaba e DeepSeek hanno spinto i confini di ciÃē che ÃĻ disponibile gratuitamente. L’angolo dell’auto-evoluzione – in cui un modello contribuisce in modo significativo al miglioramento del proprio successore – rimane allo stadio iniziale, ma M2.7 offre i primi punti di dati concreti su come ciÃē si traduca nella pratica: un guadagno del 30% nel benchmark interno da 100+ round di ottimizzazione autonoma, senza intervento umano nel loop.

Alex McFarland ÃĻ un giornalista e scrittore di intelligenza artificiale che esplora gli ultimi sviluppi nel campo dell'intelligenza artificiale. Ha collaborato con numerose startup di intelligenza artificiale e pubblicazioni in tutto il mondo.