Modelos e plataformas de IA
Microsoft lança MAI-Transcribe-2-Streaming e dois modelos MAI-Voice

Microsoft AI em 1 de outubro de 2026 lançou MAI-Transcribe-2-Streaming, seu primeiro modelo de transcrição em streaming, juntamente com dois novos modelos de texto para fala, MAI-Voice-2.1 e MAI-Voice-2.1-Flash, com todos os três disponíveis através do Microsoft Foundry.
MAI-Transcribe-2-Streaming e o benchmark Artificial Analysis
Microsoft descreve o MAI-Transcribe-2-Streaming como capaz de fornecer transcrições em tempo real e baixa latência em 60 idiomas, com detecção automática e contínua de idioma. A empresa afirmou que o modelo ocupa o primeiro lugar em precisão tanto para transcrições finais quanto parciais no Artificial Analysis, e que está na fronteira de Pareto da avaliação de precisão versus latência do benchmark, o que significa que maior precisão não exige um grande comprometimento de latência. O gráfico de classificação na publicação, citando a classificação de streaming do Artificial Analysis datada de 28 de setembro de 2026, mostra o modelo com uma taxa de erro de palavra final de 2,5 por cento, uma taxa de primeiro parcial de 2,8 por cento e 0,13 segundo para a transcrição final.
Em vez de aguardar o falante terminar antes de devolver o texto, o modelo gera suas primeiras hipóteses, conhecidas como parciais, em pouco mais de 100 milissegundos após receber o áudio, revisando-as à medida que mais contexto chega antes de consolidar uma transcrição estável. A Microsoft disse que isso permite que aplicativos habilitados para voz ajam sobre a fala antes que o falante termine: agentes de voz podem começar a raciocinar ou chamar ferramentas no meio da frase, e transcrições ao vivo podem aparecer enquanto as pessoas falam. Para ditado e legendagem em tempo real, a empresa afirmou que suas avaliações internas mostram palavras aparecendo na transcrição duas vezes mais rápido do que com seu concorrente mais próximo.
Artificial Analysis afirma que seu índice AA-WER Streaming mede a precisão de transcrição para modelos onde o áudio é transmitido em tempo real, fragmento a fragmento, ao longo de aproximadamente oito horas de áudio provenientes de três conjuntos de dados: AA-AgentTalk com 50 por cento, VoxPopuli com 25 por cento e Earnings22 com 25 por cento. Os conjuntos de dados abrangem fala do mundo real com diversos sotaques, linguagem específica de domínio e condições acústicas desafiadoras, e as medições Time to Final e Time to First Partial do benchmark começam ambas ao final da fala detectada pelo detector de atividade de voz SileroVAD.
O MAI-Transcribe-2-Streaming está disponível a um preço introdutório de US$ 0,54 por hora de áudio até o final do ano. O modelo amplia a linha de áudio MAI da Microsoft, que já inclui o MAI-Transcribe-2, o modelo anterior de reconhecimento de fala não streaming que a empresa descreveu como o mais rápido, preciso e barato do mundo.
MAI-Voice-2.1 e MAI-Voice-2.1-Flash
O MAI-Voice-2.1 oferece suporte a 23 idiomas e 26 localidades, e a Microsoft afirmou que uma única voz pode usar todos eles com um sotaque nativo, mantendo a mesma identidade do falante ao mudar de idioma. Um aplicativo de tutoria, no exemplo da empresa, pode trocar de idioma no meio da aula sem trocar de professor, e um assistente multilíngue pode responder em qualquer idioma ao qual seja dirigido, mantendo a mesma voz. O modelo tem preço de US$ 22 por 1 milhão de caracteres.
O MAI-Voice-2.1-Flash suporta os mesmos idiomas e falantes multilíngues, mas foi desenvolvido para cargas de trabalho de alto volume e sensíveis à latência. Ele pode gerar até 45 segundos de áudio com uma latência de ponta a ponta de 150 milissegundos, e a Microsoft afirmou que oferece inferência de modelo 55 por cento mais rápida e é aproximadamente 60 por cento mais barato que modelos comparáveis. O preço é de US$ 15 por 1 milhão de caracteres.
Ambos os modelos de voz suportam clonagem de voz em todos os idiomas suportados usando alguns segundos de áudio de referência, com salvaguardas de consentimento integradas que a Microsoft afirmou impedir o uso indevido. Em um teste de Turing com 4 000 ouvintes que combinou os dois novos modelos de voz, 50,3 por cento dos ouvintes avaliaram o MAI-Voice como igualmente ou mais parecido com humanos do que gravações humanas, disse a Microsoft.
A Microsoft apresentou o emparelhamento do MAI-Transcribe-2-Streaming com o MAI-Voice-2.1-Flash como uma forma de ganhar tempo em ambas as extremidades do ciclo de agente de voz, a sequência de ouvir, entender, decidir e falar dentro da janela em que o ser humano ainda percebe a interação como uma conversa. Os casos de uso listados para desenvolvedores incluem agentes de atendimento ao cliente que transcrevem solicitações à medida que são faladas e respondem em fala natural, assistentes multilíngues que detectam o idioma falado e respondem em qualquer um dos 23 idiomas suportados pelo MAI-Voice, e aplicativos interativos de aprendizagem e mídia que utilizam falantes distintos para tutoria, interpretação de papéis, simulações, narração e conteúdo conversacional.
Disponibilidade e a demonstração Chatter
O MAI-Voice-2.1 e o MAI-Voice-2.1-Flash estão disponíveis através do OpenRouter. Todos os três modelos estão disponíveis através do Microsoft Foundry, do MAI Playground, da Vercel e do Azure Voice Live, com o LiveKit listado como em breve.
Para demonstrar os modelos trabalhando juntos em um agente ao vivo, a Microsoft criou o Chatter, uma nova demonstração no MAI Playground que permite aos usuários conversar com um assistente de voz alimentado pelos modelos de transcrição e voz.












