Modelos e plataformas de IA

MAI-Transcribe-2 lidera benchmark FLEURS em 60 idiomas, afirma a Microsoft

mm
Adicione Unite.AI às suas fontes preferidas no Google

A Microsoft AI lançou o MAI-Transcribe-2 em 3 de setembro de 2026, um modelo de reconhecimento de fala que o laboratório afirmou ocupar o primeiro lugar no benchmark FLEURS em 60 idiomas, com uma taxa média de erro de palavra de 5,2 %. Em seu anúncio, a Microsoft descreveu o modelo como seu sistema de transcrição mais avançado até o momento e o precificou em US$ 0,10 por hora de áudio.

A Microsoft afirmou que o MAI-Transcribe-2 adiciona diarização de falantes, estilos de transcrição configuráveis e marcas‑tempo a nível de palavra, e supera modelos concorrentes, incluindo Gemini 3.5 Transcribe, GPT‑Transcribe, Whisper V3‑Large e ScribeV2, em uma gama mais ampla de áudio do mundo real. Segundo o anúncio, o modelo define a fronteira de Pareto para precisão e latência na Artificial Analysis e ocupa a segunda posição no ranking de taxa de erro de palavra da Artificial Analysis, melhorando os resultados das versões anteriores do MAI-Transcribe.

A Microsoft posicionou o modelo para cargas de trabalho como tomada de notas clínicas, documentação jurídica, acessibilidade e legendagem fechada. A empresa informou inferência mais rápida com latência substancialmente menor, particularmente para áudio de longa duração, alcançando até 10 vezes a velocidade de processamento dos principais concorrentes. Também afirmou que o modelo mantém a qualidade da transcrição em condições ruidosas fora de ambientes de gravação controlados.

Resultados do Benchmark

Com base em avaliações realizadas pela Artificial Analysis, a Microsoft afirmou que o MAI-Transcribe-2 é 10 vezes mais rápido que o GPT-Transcribe da OpenAI, 7 vezes mais rápido que o Scribe v2 da ElevenLabs e 5 vezes mais rápido que o Gemini 3.5 Transcribe, ao mesmo tempo em que oferece maior precisão. A empresa disse que o modelo ocupa sozinho o quadrante mais atraente do gráfico de precisão versus velocidade do benchmark, com uma taxa de erro de 2,0 % e um fator de velocidade de 403,6, o que significa que uma hora de áudio é retornada em cerca de dez segundos.

No benchmark público multilíngue FLEURS, a Microsoft relatou que o MAI-Transcribe-2 mantém um nível de precisão consistentemente alto em todas as 60 línguas testadas. A empresa descreveu o modelo como preciso em mais idiomas do que qualquer outro modelo e afirmou que desenvolvedores que transcrevem em múltiplos idiomas podem contar com um único modelo, reduzindo a complexidade e potencialmente economizando uso de GPU. O anúncio também declara que a velocidade e a taxa de processamento do modelo permitem à Microsoft oferecer o que chamou de preço mais competitivo do mercado. No lançamento, a tarifa de US$ 0,10 por hora é uma oferta por tempo limitado válida até o final do ano.

Disponibilidade e Recursos para Desenvolvedores

A documentação do Microsoft Learn lista o MAI-Transcribe-2 como disponível no Azure Speech em pré‑visualização pública, sem acordo de nível de serviço e não recomendado para cargas de trabalho de produção. A documentação descreve o MAI-Transcribe como um modelo de fala‑para‑texto desenvolvido internamente pela equipe Microsoft AI, abrangendo cargas de trabalho como legendagem de vídeo, reuniões, notas clínicas, documentação de call center, ferramentas de acessibilidade, criação de conteúdo e agentes de voz. Também lista o MAI-Transcribe-2 ao lado dos modelos anteriores MAI-Transcribe-1.5 e MAI-Transcribe-1, este último descontinuado em 20 de agosto de 2026.

As solicitações são encaminhadas através do modo aprimorado da Fast Transcription API, com o modelo selecionado ao definir a propriedade de modelo do modo aprimorado para MAI-Transcribe-2. A entrada de áudio está limitada a arquivos com menos de 300 MB nos formatos WAV, MP3 ou FLAC, e o uso requer uma assinatura Azure e um recurso Microsoft Foundry para Speech.

Parâmetros opcionais controlam o conjunto de recursos do modelo. A diarização de falantes segmenta uma gravação por locutor e devolve segmentos rotulados com metadados de deslocamento e duração. Marcas‑tempo a nível de palavra retornam o tempo de cada palavra, enquanto a opção de segmento devolve o tempo por segmento e a opção nenhum omite os dados de tempo. Um parâmetro de lista de frases direciona o reconhecimento para termos fornecidos, como terminologia específica de domínio, abreviações e nomes próprios, com a documentação observando que os termos funcionam como sugestões, não como saída forçada.

O parâmetro de estilo de transcrição tem como padrão verbatim, que captura a fala exatamente como pronunciada, incluindo palavras de preenchimento e inícios falsos, para cargas de trabalho de conformidade, controle de qualidade e análise. A configuração clean remove os preenchimentos e formata automaticamente padrões de fala comuns para produzir legendas, notas e transcrições publicadas mais legíveis. A seleção de idioma é opcional; por padrão o modelo detecta automaticamente o idioma falado, e a documentação recomenda forçar um idioma específico somente quando a detecção automática falha. A troca de código para pares de idiomas mistos, como Hinglish e Spanglish, é tratada automaticamente, e a robustez ao ruído para áudio gravado fora de ambientes controlados é inerente ao modelo.

A documentação também observa que o MAI-Transcribe pode fornecer transcrição de áudio de entrada na Voice Live API por meio de um campo de configuração de sessão. A Microsoft afirmou que o modelo está disponível para demonstração através do Microsoft Foundry e do MAI Playground, com disponibilidade no OpenRouter listada como em breve.

Jonas Reeve é um analista gerado por IA na Unite.AI, com foco em inteligência artificial cognitiva, inteligência artificial geral (AGI) e fundamentos teóricos de inteligência de máquina. Seu trabalho explora como aprendizado, raciocínio, memória e abstração surgem em sistemas biológicos e artificiais, estabelecendo conexões entre arquiteturas de IA modernas e questões de longa data em ciência cognitiva e filosofia da mente.
Com uma abordagem conceitual e reflexiva, Jonas examina estruturas como modelos de raciocínio, sistemas agênticos, cognição emergente e teoria de alinhamento, visando esclarecer o que o progresso em direção à AGI realmente significa - e o que não significa. Em vez de perseguir cronogramas ou hype, ele enfatiza princípios fundamentais, rigor conceitual e os limites dos modelos atuais.
Artigos escritos por Jonas Reeve são gerados por IA e revisados pela equipe editorial da Unite.AI para garantir precisão, clareza e discussão responsável de conceitos de IA avançados.