Modelli e piattaforme di IA
MAI-Transcribe-2 domina il benchmark FLEURS in 60 lingue, afferma Microsoft

Microsoft AI ha rilasciato MAI-Transcribe-2 il 3 settembre 2026, un modello di riconoscimento vocale che il laboratorio ha dichiarato al primo posto nel benchmark FLEURS su 60 lingue, con un tasso medio di errore di parola del 5,2 %. Nell’annuncio, Microsoft ha descritto il modello come il suo sistema di trascrizione più avanzato finora e lo ha prezzato a $0,10 per ora di audio.
Microsoft ha affermato che MAI-Transcribe-2 aggiunge la diarizzazione degli speaker, stili di trascrizione configurabili e timestamp a livello di parola, e supera i modelli concorrenti tra cui Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3‑Large e ScribeV2 su un più ampio spettro di audio reale. Secondo l’annuncio, il modello definisce la frontiera di Pareto per accuratezza e latenza su Artificial Analysis e si posiziona al secondo posto nella classifica del tasso di errore di parola di Artificial Analysis, migliorando i risultati delle versioni precedenti di MAI-Transcribe.
Microsoft ha collocato il modello per carichi di lavoro quali la presa di appunti clinici, la documentazione legale, l’accessibilità e i sottotitoli. L’azienda ha segnalato un’inferenza più rapida con latenza notevolmente inferiore, soprattutto per audio di lunga durata, fino a 10 volte la velocità di elaborazione dei principali concorrenti. Ha inoltre dichiarato che il modello mantiene la qualità della trascrizione in condizioni rumorose al di fuori di ambienti di registrazione controllati.
Risultati del benchmark
Citandosi alle valutazioni condotte da Artificial Analysis, Microsoft ha affermato che MAI-Transcribe-2 è 10 volte più veloce del GPT-Transcribe di OpenAI, 7 volte più veloce del Scribe v2 di ElevenLabs e 5 volte più veloce del Gemini 3.5 Transcribe, garantendo al contempo una maggiore accuratezza. L’azienda ha dichiarato che il modello occupa da solo il quadrante più interessante del grafico precisione‑vs‑velocità del benchmark, con un tasso di errore del 2,0 % e un fattore di velocità di 403,6, il che significa che un’ora di audio viene restituita in circa dieci secondi.
Nel benchmark multilingue pubblico FLEURS, Microsoft ha riportato che MAI-Transcribe-2 mantiene un livello di accuratezza costantemente elevato su tutte le 60 lingue testate. L’azienda ha descritto il modello come più preciso su un numero di lingue superiore a qualsiasi altro modello e ha affermato che gli sviluppatori che trascrivono in più lingue possono fare affidamento su un unico modello, riducendo la complessità e potenzialmente risparmiando utilizzo di GPU. L’annuncio segnala inoltre che la velocità e la capacità del modello consentono a Microsoft di offrire quello che ha definito il prezzo più competitivo sul mercato. Al lancio, il costo di $0,10 all’ora è un’offerta a tempo limitato valida fino alla fine dell’anno.
Disponibilità e funzionalità per gli sviluppatori
La documentazione Microsoft Learn elenca MAI-Transcribe-2 come disponibile in Azure Speech in anteprima pubblica, senza un accordo sul livello di servizio e non consigliato per carichi di lavoro di produzione. La documentazione descrive MAI-Transcribe come un modello speech‑to‑text sviluppato internamente dal team Microsoft AI, coprendo carichi di lavoro quali la generazione di sottotitoli video, le riunioni, le note cliniche, la documentazione dei call center, gli strumenti di accessibilità, la creazione di contenuti e gli agenti vocali. Elenca inoltre MAI-Transcribe-2 accanto ai precedenti MAI-Transcribe-1.5 e MAI-Transcribe-1, quest’ultimo deprecato il 20 agosto 2026.
Le richieste passano attraverso la modalità avanzata della Fast Transcription API, con il modello selezionato impostando la proprietà del modello in modalità avanzata su MAI-Transcribe-2. L’input audio è limitato a file inferiori a 300 MB nei formati WAV, MP3 o FLAC, e l’utilizzo richiede un abbonamento Azure e una risorsa Microsoft Foundry per Speech.
I parametri opzionali controllano il set di funzionalità del modello. La diarizzazione degli speaker segmenta una registrazione per speaker e restituisce segmenti etichettati con offset e metadati di durata. I timestamp a livello di parola forniscono la tempistica per ogni parola, mentre l’opzione “segment” restituisce la tempistica per segmento e l’opzione “none” omette i dati temporali. Un parametro “phrase‑list” orienta il riconoscimento verso termini forniti, come terminologia specifica di dominio, abbreviazioni e nomi propri, con la documentazione che osserva che i termini fungono da suggerimenti piuttosto che da output forzato.
Il parametro “transcription style” è impostato di default su “verbatim”, che cattura il discorso esattamente com’è stato pronunciato, includendo parole di riempimento e avvii falsi, per carichi di lavoro di conformità, QA e analisi. L’impostazione “clean” rimuove i riempitivi e auto‑formatta i pattern di linguaggio comuni per produrre sottotitoli, note e trascrizioni pubblicate più leggibili. La selezione della lingua è opzionale; per impostazione predefinita il modello rileva automaticamente la lingua parlata, e la documentazione consiglia di forzare una lingua specifica solo quando il rilevamento automatico fallisce. Il passaggio di codice per coppie linguistiche miste come Hinglish e Spanglish è gestito automaticamente, e la robustezza al rumore per audio registrati al di fuori di ambienti controllati è intrinseca al modello.
La documentazione osserva inoltre che MAI-Transcribe può fornire la trascrizione dell’audio di input nell’API Voice Live tramite un campo di configurazione della sessione. Microsoft ha dichiarato che il modello è disponibile per una demo tramite Microsoft Foundry e il MAI Playground, con la disponibilità su OpenRouter indicata come prossima.












