Modelos e plataformas de IA

Microsoft lança MAI-Transcribe-2-Streaming e dois modelos MAI-Voice

mm
Adicione Unite.AI às suas fontes preferidas no Google

Microsoft AI em 1 de outubro de 2026 lançou MAI-Transcribe-2-Streaming, seu primeiro modelo de transcrição em streaming, juntamente com dois novos modelos de texto para fala, MAI-Voice-2.1 e MAI-Voice-2.1-Flash, com todos os três disponíveis através do Microsoft Foundry.

MAI-Transcribe-2-Streaming e o benchmark Artificial Analysis

Microsoft descreve o MAI-Transcribe-2-Streaming como capaz de fornecer transcrições em tempo real e baixa latência em 60 idiomas, com detecção automática e contínua de idioma. A empresa afirmou que o modelo ocupa o primeiro lugar em precisão tanto para transcrições finais quanto parciais no Artificial Analysis, e que está na fronteira de Pareto da avaliação de precisão versus latência do benchmark, o que significa que maior precisão não exige um grande comprometimento de latência. O gráfico de classificação na publicação, citando a classificação de streaming do Artificial Analysis datada de 28 de setembro de 2026, mostra o modelo com uma taxa de erro de palavra final de 2,5 por cento, uma taxa de primeiro parcial de 2,8 por cento e 0,13 segundo para a transcrição final.

Em vez de aguardar o falante terminar antes de devolver o texto, o modelo gera suas primeiras hipóteses, conhecidas como parciais, em pouco mais de 100 milissegundos após receber o áudio, revisando-as à medida que mais contexto chega antes de consolidar uma transcrição estável. A Microsoft disse que isso permite que aplicativos habilitados para voz ajam sobre a fala antes que o falante termine: agentes de voz podem começar a raciocinar ou chamar ferramentas no meio da frase, e transcrições ao vivo podem aparecer enquanto as pessoas falam. Para ditado e legendagem em tempo real, a empresa afirmou que suas avaliações internas mostram palavras aparecendo na transcrição duas vezes mais rápido do que com seu concorrente mais próximo.

Artificial Analysis afirma que seu índice AA-WER Streaming mede a precisão de transcrição para modelos onde o áudio é transmitido em tempo real, fragmento a fragmento, ao longo de aproximadamente oito horas de áudio provenientes de três conjuntos de dados: AA-AgentTalk com 50 por cento, VoxPopuli com 25 por cento e Earnings22 com 25 por cento. Os conjuntos de dados abrangem fala do mundo real com diversos sotaques, linguagem específica de domínio e condições acústicas desafiadoras, e as medições Time to Final e Time to First Partial do benchmark começam ambas ao final da fala detectada pelo detector de atividade de voz SileroVAD.

O MAI-Transcribe-2-Streaming está disponível a um preço introdutório de US$ 0,54 por hora de áudio até o final do ano. O modelo amplia a linha de áudio MAI da Microsoft, que já inclui o MAI-Transcribe-2, o modelo anterior de reconhecimento de fala não streaming que a empresa descreveu como o mais rápido, preciso e barato do mundo.

MAI-Voice-2.1 e MAI-Voice-2.1-Flash

O MAI-Voice-2.1 oferece suporte a 23 idiomas e 26 localidades, e a Microsoft afirmou que uma única voz pode usar todos eles com um sotaque nativo, mantendo a mesma identidade do falante ao mudar de idioma. Um aplicativo de tutoria, no exemplo da empresa, pode trocar de idioma no meio da aula sem trocar de professor, e um assistente multilíngue pode responder em qualquer idioma ao qual seja dirigido, mantendo a mesma voz. O modelo tem preço de US$ 22 por 1 milhão de caracteres.

O MAI-Voice-2.1-Flash suporta os mesmos idiomas e falantes multilíngues, mas foi desenvolvido para cargas de trabalho de alto volume e sensíveis à latência. Ele pode gerar até 45 segundos de áudio com uma latência de ponta a ponta de 150 milissegundos, e a Microsoft afirmou que oferece inferência de modelo 55 por cento mais rápida e é aproximadamente 60 por cento mais barato que modelos comparáveis. O preço é de US$ 15 por 1 milhão de caracteres.

Ambos os modelos de voz suportam clonagem de voz em todos os idiomas suportados usando alguns segundos de áudio de referência, com salvaguardas de consentimento integradas que a Microsoft afirmou impedir o uso indevido. Em um teste de Turing com 4 000 ouvintes que combinou os dois novos modelos de voz, 50,3 por cento dos ouvintes avaliaram o MAI-Voice como igualmente ou mais parecido com humanos do que gravações humanas, disse a Microsoft.

A Microsoft apresentou o emparelhamento do MAI-Transcribe-2-Streaming com o MAI-Voice-2.1-Flash como uma forma de ganhar tempo em ambas as extremidades do ciclo de agente de voz, a sequência de ouvir, entender, decidir e falar dentro da janela em que o ser humano ainda percebe a interação como uma conversa. Os casos de uso listados para desenvolvedores incluem agentes de atendimento ao cliente que transcrevem solicitações à medida que são faladas e respondem em fala natural, assistentes multilíngues que detectam o idioma falado e respondem em qualquer um dos 23 idiomas suportados pelo MAI-Voice, e aplicativos interativos de aprendizagem e mídia que utilizam falantes distintos para tutoria, interpretação de papéis, simulações, narração e conteúdo conversacional.

Disponibilidade e a demonstração Chatter

O MAI-Voice-2.1 e o MAI-Voice-2.1-Flash estão disponíveis através do OpenRouter. Todos os três modelos estão disponíveis através do Microsoft Foundry, do MAI Playground, da Vercel e do Azure Voice Live, com o LiveKit listado como em breve.

Para demonstrar os modelos trabalhando juntos em um agente ao vivo, a Microsoft criou o Chatter, uma nova demonstração no MAI Playground que permite aos usuários conversar com um assistente de voz alimentado pelos modelos de transcrição e voz.

Jonas Reeve é um analista gerado por IA na Unite.AI, focado em IA cognitiva, inteligência geral artificial (AGI) e nas fundações teóricas da inteligência de máquinas. Seu trabalho explora como aprendizado, raciocínio, memória e abstração surgem tanto em sistemas biológicos quanto artificiais, estabelecendo conexões entre arquiteturas modernas de IA e questões de longa data na ciência cognitiva e na filosofia da mente.

Com uma abordagem conceitual e reflexiva, Jonas examina estruturas como modelos de raciocínio, sistemas agentes, cognição emergente e teoria de alinhamento, visando esclarecer o que realmente significa o progresso rumo à AGI — e o que não significa. Em vez de perseguir cronogramas ou exageros, ele enfatiza princípios fundamentais, rigor conceitual e os limites dos modelos atuais.

Artigos escritos por Jonas Reeve são gerados por IA e revisados pela equipe editorial da Unite.AI para garantir precisão, clareza e discussão responsável de conceitos avançados de IA.