Modelli e piattaforme di IA

Microsoft lancia MAI-Transcribe-2-Streaming e due modelli MAI-Voice

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Microsoft AI il 1 ottobre 2026 ha lanciato MAI-Transcribe-2-Streaming, il suo primo modello di trascrizione in streaming, insieme a due nuovi modelli di sintesi vocale, MAI-Voice-2.1 e MAI-Voice-2.1-Flash, tutti e tre disponibili tramite Microsoft Foundry.

MAI-Transcribe-2-Streaming e il benchmark Artificial Analysis

Microsoft descrive MAI-Transcribe-2-Streaming come in grado di fornire trascrizioni in tempo reale a bassa latenza in 60 lingue, con rilevamento automatico e continuo della lingua. L’azienda ha dichiarato che il modello si classifica al numero 1 per precisione sia per le trascrizioni finali sia per quelle parziali su Artificial Analysis, e che si colloca sulla frontiera di Pareto della valutazione precisione‑vs‑latenza del benchmark, il che significa che una maggiore precisione non richiede un pesante compromesso di latenza. Il grafico della classifica nel post, che cita la classifica streaming di Artificial Analysis del 28 settembre 2026, mostra il modello con un tasso di errore finale di parole del 2,5 percento, un tasso di primo parziale del 2,8 percento e 0,13 secondi per la trascrizione finale.

Invece di attendere che un oratore termini prima di restituire il testo, il modello genera le sue prime ipotesi, note come parziali, appena dopo 100 millisecondi dalla ricezione dell’audio, per poi revisionarle man mano che arriva più contesto prima di produrre una trascrizione stabile. Microsoft ha affermato che ciò consente alle applicazioni con supporto vocale di agire sul discorso prima che l’oratore finisca: gli agenti vocali possono iniziare a ragionare o a chiamare strumenti a metà frase, e le trascrizioni in tempo reale possono apparire mentre le persone parlano. Per la dettatura e il sottotitolaggio in tempo reale, l’azienda ha dichiarato che le sue valutazioni interne mostrano che le parole compaiono nella trascrizione due volte più velocemente rispetto al suo concorrente più vicino.

Artificial Analysis afferma che il suo indice AA-WER Streaming misura la precisione della trascrizione per modelli in cui l’audio viene trasmesso in tempo reale, segmento per segmento, su circa otto ore di audio provenienti da tre set di dati: AA-AgentTalk al 50 percento, VoxPopuli al 25 percento e Earnings22 al 25 percento. I set di dati coprono discorsi reali con accenti diversi, linguaggio specifico di dominio e condizioni acustiche difficili, e le misurazioni Time to Final e Time to First Partial del benchmark iniziano entrambe al termine del discorso rilevato dal rilevatore di attività vocale SileroVAD.

MAI-Transcribe-2-Streaming è disponibile a un prezzo introduttivo di $0.54 per ora di audio fino alla fine dell’anno. Il modello amplia la linea audio MAI di Microsoft, che include già MAI-Transcribe-2, il precedente modello di riconoscimento vocale non in streaming che l’azienda ha presentato come il più veloce, preciso ed economico al mondo.

MAI-Voice-2.1 e MAI-Voice-2.1-Flash

MAI-Voice-2.1 supporta 23 lingue e 26 impostazioni regionali, e Microsoft ha dichiarato che una singola voce può utilizzare tutte con accento nativo, mantenendo la stessa identità dell’oratore quando si cambia lingua. Un’app di tutoraggio, nell’esempio dell’azienda, può cambiare lingua a metà lezione senza dover sostituire gli insegnanti, e un assistente multilingue può rispondere nella lingua in cui gli si parla mantenendo lo stesso timbro vocale. Il modello ha un prezzo di $22 per 1 M di caratteri.

MAI-Voice-2.1-Flash supporta le stesse lingue e gli speaker multilingue, ma è progettato per carichi di lavoro ad alto volume e sensibili alla latenza. Può generare fino a 45 secondi di audio con una latenza end‑to‑end di 150 millisecondi, e Microsoft ha affermato che offre un’inferenza del modello del 55 percento più veloce ed è circa il 60 percento più economico rispetto a modelli comparabili. Il prezzo è $15 per 1 M di caratteri.

Entrambi i modelli vocali supportano la clonazione della voce in tutte le lingue supportate utilizzando pochi secondi di audio di riferimento, con salvaguardie integrate sul consenso che, secondo Microsoft, impediscono usi impropri. In un test di Turing con 4 000 ascoltatori che ha combinato i due nuovi modelli vocali, il 50,3 percento degli ascoltatori ha valutato MAI-Voice come ugualmente o più simile a una voce umana rispetto a registrazioni umane, ha dichiarato Microsoft.

Microsoft ha presentato l’abbinamento di MAI-Transcribe-2-Streaming con MAI-Voice-2.1-Flash come un modo per guadagnare tempo su entrambi i lati del ciclo di un agente vocale, la sequenza di ascolto, comprensione, decisione e parlata entro la finestra in cui l’uomo percepisce ancora l’interazione come una conversazione. I casi d’uso per gli sviluppatori elencati includono agenti di assistenza clienti che trascrivono le richieste mentre vengono pronunciate e rispondono con parlato naturale, assistenti multilingue che rilevano la lingua parlata e rispondono in una delle 23 lingue supportate da MAI-Voice, e applicazioni interattive di apprendimento e media che utilizzano speaker distinti per tutoraggio, giochi di ruolo, simulazioni, narrazione e contenuti conversazionali.

Disponibilità e la demo Chatter

MAI-Voice-2.1 e MAI-Voice-2.1-Flash sono disponibili tramite OpenRouter. Tutti e tre i modelli sono disponibili tramite Microsoft Foundry, il MAI Playground, Vercel e Azure Voice Live, con LiveKit indicato come in arrivo.

Per mostrare i modelli che lavorano insieme in un agente live, Microsoft ha creato Chatter, una nuova demo nel MAI Playground che consente agli utenti di parlare con un assistente vocale alimentato dai modelli di trascrizione e voce.

Jonas Reeve è un analista generato dall'IA presso Unite.AI, focalizzato su AI cognitiva, intelligenza artificiale generale (AGI) e le fondamenta teoriche dell'intelligenza delle macchine. Il suo lavoro esplora come apprendimento, ragionamento, memoria e astrazione emergano sia nei sistemi biologici sia in quelli artificiali, tracciando collegamenti tra le moderne architetture AI e le domande di lunga data nella scienza cognitiva e nella filosofia della mente.

Con un approccio concettuale e riflessivo, Jonas esamina quadri teorici come i modelli di ragionamento, i sistemi agentici, la cognizione emergente e la teoria dell'allineamento, mirando a chiarire cosa significhi realmente il progresso verso l'AGI — e cosa non significhi. Piuttosto che inseguire scadenze o hype, egli enfatizza i principi primi, il rigore concettuale e i limiti dei modelli attuali.

Gli articoli scritti da Jonas Reeve sono generati dall'IA e revisionati dal team editoriale di Unite.AI per garantire accuratezza, chiarezza e una discussione responsabile dei concetti avanzati di IA.