Modelos y plataformas de IA
MAI-Transcribe-2 lidera el benchmark FLEURS en 60 idiomas, dice Microsoft

Microsoft AI lanzó MAI-Transcribe-2 el 3 de septiembre de 2026, un modelo de reconocimiento de voz que el laboratorio dijo que ocupa el primer lugar en el benchmark FLEURS en 60 idiomas con una tasa de error de palabras promedio del 5,2 %. En su anuncio, Microsoft describió el modelo como su sistema de transcripción más capaz hasta la fecha y lo cotizó en $0,10 por hora de audio.
Microsoft afirmó que MAI-Transcribe-2 incorpora diarización de hablantes, estilos de transcripción configurables y marcas de tiempo a nivel de palabra, y supera a los modelos competidores, incluidos Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large y ScribeV2, en un rango más amplio de audio del mundo real. Según el anuncio, el modelo define la frontera de Pareto en precisión y latencia según Artificial Analysis y ocupa el segundo lugar en la tabla de clasificación de tasa de error de palabras de Artificial Analysis, mejorando los resultados de versiones anteriores de MAI-Transcribe.
Microsoft posicionó el modelo para cargas de trabajo que incluyen la toma de notas clínicas, documentación legal, accesibilidad y subtitulado cerrado. La empresa informó una inferencia más rápida con una latencia sustancialmente menor, particularmente para audio de larga duración, alcanzando hasta 10 veces la velocidad de procesamiento de los principales competidores. También señaló que el modelo mantiene la calidad de transcripción en condiciones ruidosas fuera de entornos de grabación controlados.
Resultados del benchmark
Citando evaluaciones realizadas por Artificial Analysis, Microsoft dijo que MAI-Transcribe-2 es 10 veces más rápido que GPT-Transcribe de OpenAI, 7 veces más rápido que Scribe v2 de ElevenLabs y 5 veces más rápido que Gemini 3.5 Transcribe, al tiempo que ofrece mayor precisión. La empresa afirmó que el modelo se sitúa solo en el cuadrante más atractivo del gráfico de precisión versus velocidad del benchmark, con una tasa de error del 2,0 % y un factor de velocidad de 403,6, lo que significa que una hora de audio se procesa en aproximadamente diez segundos.
En el benchmark multilingüe público FLEURS, Microsoft informó que MAI-Transcribe-2 mantiene un nivel de precisión consistentemente alto en los 60 idiomas evaluados. La empresa describió el modelo como preciso en más idiomas que cualquier otro modelo y afirmó que los desarrolladores que transcriben en varios idiomas pueden confiar en un único modelo, reduciendo la complejidad y potencialmente ahorrando uso de GPU. El anuncio también indica que la velocidad y el rendimiento del modelo permiten a Microsoft ofrecer lo que llamó el precio más competitivo del mercado. En el lanzamiento, la tarifa de $0,10 por hora es una oferta por tiempo limitado que se mantendrá hasta fin de año.
Disponibilidad y características para desarrolladores
La documentación de Microsoft Learn enumera MAI-Transcribe-2 como disponible en Azure Speech en vista previa pública, sin un acuerdo de nivel de servicio y no recomendado para cargas de trabajo de producción. La documentación describe MAI-Transcribe como un modelo de voz a texto desarrollado internamente por el equipo de Microsoft AI, que cubre cargas de trabajo como subtitulado de video, reuniones, notas clínicas, documentación de centros de llamadas, herramientas de accesibilidad, creación de contenido y agentes de voz. También lista MAI-Transcribe-2 junto a los anteriores MAI-Transcribe-1.5 y MAI-Transcribe-1, este último descontinuado el 20 de agosto de 2026.
Las solicitudes se canalizan a través del modo mejorado de la API Fast Transcription, con el modelo seleccionado estableciendo la propiedad del modelo en modo mejorado a MAI-Transcribe-2. La entrada de audio está limitada a archivos de menos de 300 MB en formato WAV, MP3 o FLAC, y su uso requiere una suscripción a Azure y un recurso Microsoft Foundry para Speech.
Los parámetros opcionales controlan el conjunto de funciones del modelo. La diarización de hablantes segmenta una grabación por interlocutor y devuelve segmentos etiquetados con metadatos de desplazamiento y duración. Las marcas de tiempo a nivel de palabra proporcionan la sincronización de cada palabra, mientras que una opción de segmento devuelve la sincronización por segmento y la opción ‘none’ omite los datos de tiempo. Un parámetro de lista de frases sesga el reconocimiento hacia los términos suministrados, como terminología específica del dominio, abreviaturas y nombres propios, y la documentación indica que los términos actúan como pistas más que como salida obligatoria.
El parámetro de estilo de transcripción tiene como valor predeterminado ‘verbatim’, que captura el discurso exactamente como se pronuncia, incluidos los muletillas y los inicios falsos, para cargas de trabajo de cumplimiento, aseguramiento de calidad y análisis. La configuración ‘clean’ elimina las muletillas y formatea automáticamente los patrones de habla comunes para producir subtítulos, notas y transcripciones publicadas más legibles. La selección de idioma es opcional; por defecto el modelo detecta automáticamente el idioma hablado, y la documentación aconseja forzar un idioma específico solo cuando la detección automática falla. El cambio de código para pares de idiomas mezclados, como Hinglish y Spanglish, se gestiona automáticamente, y la robustez al ruido para audio grabado fuera de entornos controlados es inherente al modelo.
La documentación también indica que MAI-Transcribe puede proporcionar la transcripción de audio de entrada en la API Voice Live mediante un campo de configuración de sesión. Microsoft dijo que el modelo está disponible para demostración a través de Microsoft Foundry y el MAI Playground, y que su disponibilidad en OpenRouter está prevista para pronto.












