Modèles et plateformes d’IA

Microsoft lance MAI-Transcribe-2-Streaming et deux modèles MAI-Voice

mm
Ajouter Unite.AI à vos sources préférées sur Google

Microsoft AI le 1 octobre 2026 a lancé MAI-Transcribe-2-Streaming, son premier modèle de transcription en streaming, aux côtés de deux nouveaux modèles de synthèse vocale, MAI-Voice-2.1 et MAI-Voice-2.1-Flash, les trois étant disponibles via Microsoft Foundry.

MAI-Transcribe-2-Streaming et le benchmark Artificial Analysis

Microsoft décrit MAI-Transcribe-2-Streaming comme offrant des transcriptions en temps réel à faible latence dans 60 langues avec une détection automatique et continue de la langue. L’entreprise a indiqué que le modèle se classe n° 1 en précision pour les transcriptions finales et partielles sur Artificial Analysis, et qu’il se situe sur la frontière de Pareto de l’évaluation précision‑vers‑latence du benchmark, ce qui signifie qu’une meilleure précision ne nécessite pas de compromis important sur la latence. Le graphique du classement dans le billet, citant le classement streaming d’Artificial Analysis daté du 28 septembre 2026, montre que le modèle affiche un taux d’erreur de mot final de 2,5 %, un taux de première partie partielle de 2,8 % et 0,13 seconde pour la transcription finale.

Plutôt que d’attendre que l’orateur termine avant de renvoyer du texte, le modèle génère ses premières hypothèses, appelées partielles, en un peu plus de 100 millisecondes après la réception de l’audio, puis les révise à mesure que davantage de contexte arrive avant de produire une transcription stable. Microsoft a déclaré que cela permet aux applications vocales d’agir sur la parole avant que l’orateur ne termine : les agents vocaux peuvent commencer à raisonner ou à appeler des outils au milieu d’une phrase, et des transcriptions en direct peuvent apparaître pendant que les personnes parlent. Pour la dictée et le sous‑titrage en temps réel, l’entreprise a indiqué que ses évaluations internes montrent que les mots apparaissent dans la transcription deux fois plus rapidement qu’avec son concurrent le plus proche.

Artificial Analysis indique que son indice AA-WER Streaming mesure la précision de transcription pour les modèles où l’audio est diffusé en temps réel, morceau par morceau, sur environ huit heures d’audio provenant de trois jeux de données : AA-AgentTalk à 50 %, VoxPopuli à 25 % et Earnings22 à 25 %. Les jeux de données couvrent la parole réelle avec des accents divers, un langage spécifique à des domaines et des conditions acoustiques difficiles, et les mesures Time to Final et Time to First Partial du benchmark commencent toutes deux à la fin de la parole détectée par le détecteur d’activité vocale SileroVAD.

MAI-Transcribe-2-Streaming est disponible à un prix de lancement de 0,54 $ par heure d’audio jusqu’à la fin de l’année. Le modèle prolonge la gamme audio MAI de Microsoft, qui comprend déjà MAI-Transcribe-2, le précédent modèle de reconnaissance vocale non‑streaming que l’entreprise présentait comme le plus rapide, le plus précis et le moins cher au monde.

MAI-Voice-2.1 et MAI-Voice-2.1-Flash

MAI-Voice-2.1 prend en charge 23 langues et 26 paramètres régionaux, et Microsoft a indiqué qu’une seule voix peut les utiliser toutes avec un accent natif, en conservant la même identité de locuteur lors du changement de langue. Une application de tutorat, selon l’exemple de l’entreprise, peut changer de langue en cours de leçon sans changer d’enseignant, et un assistant multilingue peut répondre dans la langue dans laquelle on s’adresse à lui tout en conservant la même voix. Le modèle est proposé à 22 $ par 1 M de caractères.

MAI-Voice-2.1-Flash prend en charge les mêmes langues et locuteurs interlinguistiques mais est conçu pour des charges de travail à haut volume et sensibles à la latence. Il peut générer jusqu’à 45 secondes d’audio avec une latence de bout en bout de 150 millisecondes, et Microsoft a déclaré qu’il offre une inférence de modèle 55 % plus rapide et est environ 60 % moins cher que des modèles comparables. Il est proposé à 15 $ par 1 M de caractères.

Les deux modèles vocaux prennent en charge le clonage de voix dans toutes les langues prises en charge à l’aide de quelques secondes d’audio de référence, avec des garde‑fous de consentement intégrés que Microsoft affirme empêcher les abus. Dans un test de Turing avec 4 000 auditeurs combinant les deux nouveaux modèles vocaux, 50,3 % des auditeurs ont évalué MAI-Voice comme étant aussi ou plus humain que des enregistrements humains, selon Microsoft.

Microsoft a présenté l’association de MAI-Transcribe-2-Streaming avec MAI-Voice-2.1-Flash comme un gain de temps aux deux extrémités d’une boucle d’agent vocal, la séquence d’écoute, de compréhension, de décision et de parole dans la fenêtre où l’humain perçoit toujours l’interaction comme une conversation. Les cas d’utilisation répertoriés pour les développeurs incluent des agents de service client qui transcrivent les demandes au moment où elles sont prononcées et répondent en parole naturelle, des assistants multilingues qui détectent la langue parlée et répondent dans l’une des 23 langues prises en charge par MAI-Voice, ainsi que des applications d’apprentissage interactif et de médias utilisant des locuteurs distincts pour le tutorat, le jeu de rôle, les simulations, la narration et le contenu conversationnel.

Disponibilité et démonstration Chatter

MAI-Voice-2.1 et MAI-Voice-2.1-Flash sont disponibles via OpenRouter. Les trois modèles sont disponibles via Microsoft Foundry, le MAI Playground, Vercel et Azure Voice Live, LiveKit étant annoncé prochainement.

Pour démontrer le fonctionnement conjoint des modèles dans un agent en direct, Microsoft a créé Chatter, une nouvelle démonstration dans le MAI Playground qui permet aux utilisateurs de parler à un assistant vocal alimenté par les modèles de transcription et de voix.

Jonas Reeve est un analyste généré par IA chez Unite.AI, spécialisé dans l'IA cognitive, l'intelligence artificielle générale (IAG) et les fondements théoriques de l'intelligence des machines. Son travail explore comment l'apprentissage, le raisonnement, la mémoire et l'abstraction émergent à la fois dans les systèmes biologiques et artificiels, établissant des liens entre les architectures d'IA modernes et les questions de longue date en sciences cognitives et en philosophie de l'esprit.

Avec une approche conceptuelle et réflexive, Jonas examine des cadres tels que les modèles de raisonnement, les systèmes agentiques, la cognition émergente et la théorie de l'alignement, visant à clarifier ce que signifie réellement le progrès vers l'IAG — et ce qu'il ne signifie pas. Plutôt que de courir après des échéances ou le battage médiatique, il met l'accent sur les premiers principes, la rigueur conceptuelle et les limites des modèles actuels.

Les articles rédigés par Jonas Reeve sont générés par IA et revus par l'équipe éditoriale de Unite.AI afin d'assurer précision, clarté et discussion responsable des concepts avancés d'IA.