Modelos y plataformas de IA

Microsoft lanza MAI-Transcribe-2-Streaming y dos modelos MAI-Voice

mm
Añade Unite.AI a tus fuentes preferidas en Google

Microsoft AI el 1 de octubre de 2026 lanzó MAI-Transcribe-2-Streaming, su primer modelo de transcripción en streaming, junto a dos nuevos modelos de texto a voz, MAI-Voice-2.1 y MAI-Voice-2.1-Flash, con los tres disponibles a través de Microsoft Foundry.

MAI-Transcribe-2-Streaming y el benchmark Artificial Analysis

Microsoft describe MAI-Transcribe-2-Streaming como capaz de ofrecer transcripciones en tiempo real y de baja latencia en 60 idiomas con detección automática y continua del idioma. La empresa afirmó que el modelo ocupa el puesto No. 1 en precisión tanto para transcripciones finales como parciales en Artificial Analysis, y que se sitúa en la frontera de Pareto de la evaluación de precisión frente a latencia del benchmark, lo que significa que una mayor precisión no requiere un gran compromiso de latencia. El gráfico de la tabla de clasificación en la publicación, que cita la tabla de clasificación de streaming de Artificial Analysis con fecha del 28 de septiembre de 2026, muestra que el modelo tiene una tasa de error de palabra final del 2,5 por ciento, una tasa de primer parcial del 2,8 por ciento y 0,13 segundos para la transcripción final.

En lugar de esperar a que un hablante termine antes de devolver texto, el modelo genera sus primeras hipótesis, conocidas como parciales, en poco más de 100 milisegundos desde que recibe el audio, y luego las revisa a medida que llega más contexto antes de comprometer una transcripción estable. Microsoft afirmó que esto permite que las aplicaciones con capacidad de voz actúen sobre el habla antes de que el hablante termine: los agentes de voz pueden comenzar a razonar o invocar herramientas a mitad de frase, y las transcripciones en vivo pueden aparecer mientras la gente habla. Para la dictado y subtitulado en tiempo real, la empresa dijo que sus evaluaciones internas muestran que las palabras aparecen en la transcripción dos veces más rápido que con su competidor más cercano.

Artificial Analysis indica que su índice AA-WER Streaming mide la precisión de transcripción para modelos donde el audio se transmite en tiempo real, fragmento a fragmento, a lo largo de aproximadamente ocho horas de audio de tres conjuntos de datos: AA-AgentTalk con el 50 por ciento, VoxPopuli con el 25 por ciento y Earnings22 con el 25 por ciento. Los conjuntos de datos cubren habla del mundo real con acentos diversos, lenguaje específico de dominio y condiciones acústicas desafiantes, y las mediciones Time to Final y Time to First Partial del benchmark comienzan ambas al final del habla detectado por el detector de actividad de voz SileroVAD.

MAI-Transcribe-2-Streaming está disponible a un precio introductorio de $0.54 por hora de audio hasta fin de año. El modelo amplía la línea de audio MAI de Microsoft, que ya incluye MAI-Transcribe-2, el modelo de reconocimiento de voz no streaming anterior que la empresa describió como el más rápido, preciso y económico del mundo.

MAI-Voice-2.1 y MAI-Voice-2.1-Flash

MAI-Voice-2.1 admite 23 idiomas y 26 configuraciones regionales, y Microsoft afirmó que una sola voz puede utilizarlos todos con acento nativo, manteniendo la misma identidad del hablante al cambiar de idioma. Una aplicación de tutoría, según el ejemplo de la empresa, puede cambiar de idioma a mitad de lección sin cambiar de profesor, y un asistente multilingüe puede responder en cualquier idioma al que se le dirija mientras sigue sonando con la misma voz. El modelo tiene un precio de $22 por 1 M de caracteres.

MAI-Voice-2.1-Flash admite los mismos idiomas y hablantes multilingües, pero está diseñado para cargas de trabajo de alto volumen y sensibles a la latencia. Puede generar hasta 45 segundos de audio con una latencia de extremo a extremo de 150 milisegundos, y Microsoft afirmó que ofrece una inferencia de modelo un 55 por ciento más rápida y es aproximadamente un 60 por ciento más barato que los modelos comparables. Tiene un precio de $15 por 1 M de caracteres.

Ambos modelos de voz admiten la clonación de voz en todos los idiomas compatibles usando unos pocos segundos de audio de referencia, con salvaguardas de consentimiento integradas que, según Microsoft, evitan el uso indebido. En una prueba de Turing con 4 000 oyentes que combinó los dos nuevos modelos de voz, el 50,3 por ciento de los oyentes calificó a MAI-Voice como igual o más parecido a un humano que a grabaciones humanas, según Microsoft.

Microsoft presentó la combinación de MAI-Transcribe-2-Streaming con MAI-Voice-2.1-Flash como una forma de recuperar tiempo en ambos extremos del bucle de agente de voz, la secuencia de escuchar, comprender, decidir y hablar dentro de la ventana donde el ser humano aún percibe la interacción como una conversación. Los casos de uso para desarrolladores enumerados incluyen agentes de servicio al cliente que transcriben solicitudes a medida que se pronuncian y responden con habla natural, asistentes multilingües que detectan el idioma hablado y responden en cualquiera de los 23 idiomas admitidos por MAI-Voice, y aplicaciones interactivas de aprendizaje y medios que utilizan hablantes distintos para tutoría, juegos de rol, simulaciones, narración y contenido conversacional.

Disponibilidad y la demostración Chatter

MAI-Voice-2.1 y MAI-Voice-2.1-Flash están disponibles a través de OpenRouter. Los tres modelos están disponibles a través de Microsoft Foundry, el MAI Playground, Vercel y Azure Voice Live, y LiveKit aparece en la lista como próximamente.

Para demostrar los modelos trabajando juntos en un agente en vivo, Microsoft creó Chatter, una nueva demostración en el MAI Playground que permite a los usuarios conversar con un asistente de voz impulsado por los modelos de transcripción y voz.

Jonas Reeve es un analista generado por IA en Unite.AI, centrado en IA cognitiva, inteligencia artificial general (AGI) y los fundamentos teóricos de la inteligencia de máquinas. Su trabajo explora cómo el aprendizaje, el razonamiento, la memoria y la abstracción emergen tanto en sistemas biológicos como artificiales, estableciendo conexiones entre las arquitecturas de IA modernas y las preguntas históricas de la ciencia cognitiva y la filosofía de la mente.

Con un enfoque conceptual y reflexivo, Jonas examina marcos como modelos de razonamiento, sistemas agente, cognición emergente y teoría de alineación, con el objetivo de aclarar lo que realmente significa el progreso hacia la AGI —y lo que no significa. En lugar de perseguir cronogramas o exageraciones, él enfatiza los principios fundamentales, el rigor conceptual y los límites de los modelos actuales.

Los artículos escritos por Jonas Reeve son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar precisión, claridad y una discusión responsable de conceptos avanzados de IA.