Modelli e piattaforme di IA
Microsoft lancia MAI-Transcribe-2-Streaming e due modelli MAI-Voice

Microsoft AI il 1 ottobre 2026 ha lanciato MAI-Transcribe-2-Streaming, il suo primo modello di trascrizione in streaming, insieme a due nuovi modelli di sintesi vocale, MAI-Voice-2.1 e MAI-Voice-2.1-Flash, tutti e tre disponibili tramite Microsoft Foundry.
MAI-Transcribe-2-Streaming e il benchmark Artificial Analysis
Microsoft descrive MAI-Transcribe-2-Streaming come in grado di fornire trascrizioni in tempo reale a bassa latenza in 60 lingue, con rilevamento automatico e continuo della lingua. L’azienda ha dichiarato che il modello si classifica al numero 1 per precisione sia per le trascrizioni finali sia per quelle parziali su Artificial Analysis, e che si colloca sulla frontiera di Pareto della valutazione precisione‑vs‑latenza del benchmark, il che significa che una maggiore precisione non richiede un pesante compromesso di latenza. Il grafico della classifica nel post, che cita la classifica streaming di Artificial Analysis del 28 settembre 2026, mostra il modello con un tasso di errore finale di parole del 2,5 percento, un tasso di primo parziale del 2,8 percento e 0,13 secondi per la trascrizione finale.
Invece di attendere che un oratore termini prima di restituire il testo, il modello genera le sue prime ipotesi, note come parziali, appena dopo 100 millisecondi dalla ricezione dell’audio, per poi revisionarle man mano che arriva più contesto prima di produrre una trascrizione stabile. Microsoft ha affermato che ciò consente alle applicazioni con supporto vocale di agire sul discorso prima che l’oratore finisca: gli agenti vocali possono iniziare a ragionare o a chiamare strumenti a metà frase, e le trascrizioni in tempo reale possono apparire mentre le persone parlano. Per la dettatura e il sottotitolaggio in tempo reale, l’azienda ha dichiarato che le sue valutazioni interne mostrano che le parole compaiono nella trascrizione due volte più velocemente rispetto al suo concorrente più vicino.
Artificial Analysis afferma che il suo indice AA-WER Streaming misura la precisione della trascrizione per modelli in cui l’audio viene trasmesso in tempo reale, segmento per segmento, su circa otto ore di audio provenienti da tre set di dati: AA-AgentTalk al 50 percento, VoxPopuli al 25 percento e Earnings22 al 25 percento. I set di dati coprono discorsi reali con accenti diversi, linguaggio specifico di dominio e condizioni acustiche difficili, e le misurazioni Time to Final e Time to First Partial del benchmark iniziano entrambe al termine del discorso rilevato dal rilevatore di attività vocale SileroVAD.
MAI-Transcribe-2-Streaming è disponibile a un prezzo introduttivo di $0.54 per ora di audio fino alla fine dell’anno. Il modello amplia la linea audio MAI di Microsoft, che include già MAI-Transcribe-2, il precedente modello di riconoscimento vocale non in streaming che l’azienda ha presentato come il più veloce, preciso ed economico al mondo.
MAI-Voice-2.1 e MAI-Voice-2.1-Flash
MAI-Voice-2.1 supporta 23 lingue e 26 impostazioni regionali, e Microsoft ha dichiarato che una singola voce può utilizzare tutte con accento nativo, mantenendo la stessa identità dell’oratore quando si cambia lingua. Un’app di tutoraggio, nell’esempio dell’azienda, può cambiare lingua a metà lezione senza dover sostituire gli insegnanti, e un assistente multilingue può rispondere nella lingua in cui gli si parla mantenendo lo stesso timbro vocale. Il modello ha un prezzo di $22 per 1 M di caratteri.
MAI-Voice-2.1-Flash supporta le stesse lingue e gli speaker multilingue, ma è progettato per carichi di lavoro ad alto volume e sensibili alla latenza. Può generare fino a 45 secondi di audio con una latenza end‑to‑end di 150 millisecondi, e Microsoft ha affermato che offre un’inferenza del modello del 55 percento più veloce ed è circa il 60 percento più economico rispetto a modelli comparabili. Il prezzo è $15 per 1 M di caratteri.
Entrambi i modelli vocali supportano la clonazione della voce in tutte le lingue supportate utilizzando pochi secondi di audio di riferimento, con salvaguardie integrate sul consenso che, secondo Microsoft, impediscono usi impropri. In un test di Turing con 4 000 ascoltatori che ha combinato i due nuovi modelli vocali, il 50,3 percento degli ascoltatori ha valutato MAI-Voice come ugualmente o più simile a una voce umana rispetto a registrazioni umane, ha dichiarato Microsoft.
Microsoft ha presentato l’abbinamento di MAI-Transcribe-2-Streaming con MAI-Voice-2.1-Flash come un modo per guadagnare tempo su entrambi i lati del ciclo di un agente vocale, la sequenza di ascolto, comprensione, decisione e parlata entro la finestra in cui l’uomo percepisce ancora l’interazione come una conversazione. I casi d’uso per gli sviluppatori elencati includono agenti di assistenza clienti che trascrivono le richieste mentre vengono pronunciate e rispondono con parlato naturale, assistenti multilingue che rilevano la lingua parlata e rispondono in una delle 23 lingue supportate da MAI-Voice, e applicazioni interattive di apprendimento e media che utilizzano speaker distinti per tutoraggio, giochi di ruolo, simulazioni, narrazione e contenuti conversazionali.
Disponibilità e la demo Chatter
MAI-Voice-2.1 e MAI-Voice-2.1-Flash sono disponibili tramite OpenRouter. Tutti e tre i modelli sono disponibili tramite Microsoft Foundry, il MAI Playground, Vercel e Azure Voice Live, con LiveKit indicato come in arrivo.
Per mostrare i modelli che lavorano insieme in un agente live, Microsoft ha creato Chatter, una nuova demo nel MAI Playground che consente agli utenti di parlare con un assistente vocale alimentato dai modelli di trascrizione e voce.












