Modèles et plateformes d’IA
MAI-Transcribe-2 domine le benchmark FLEURS dans 60 langues, selon Microsoft

Microsoft AI a publié MAI-Transcribe-2 le 3 septembre 2026, un modèle de reconnaissance vocale que le laboratoire affirme se classer premier au benchmark FLEURS sur 60 langues avec un taux d’erreur moyen de 5,2 %. Dans son annonce, Microsoft a décrit le modèle comme son système de transcription le plus performant à ce jour et l’a tarifé à 0,10 $ par heure d’audio.
Microsoft a indiqué que MAI-Transcribe-2 ajoute la diérisation des locuteurs, des styles de transcription configurables et des horodatages au niveau du mot, et surpasse les modèles concurrents tels que Gemini 3.5 Transcribe, GPT‑Transcribe, Whisper V3‑Large et ScribeV2 sur un éventail plus large d’audios réels. Selon l’annonce, le modèle définit la frontière de Pareto en termes de précision et de latence sur Artificial Analysis et se classe deuxième au classement du taux d’erreur de mots d’Artificial Analysis, améliorant les résultats des versions précédentes de MAI‑Transcribe.
Microsoft a positionné le modèle pour des charges de travail telles que la prise de notes cliniques, la documentation juridique, l’accessibilité et le sous‑titrage. L’entreprise a signalé une inférence plus rapide avec une latence nettement réduite, notamment pour les audios longs, atteignant jusqu’à 10 fois la vitesse de traitement des principaux concurrents. Elle a également indiqué que le modèle conserve la qualité de transcription dans des conditions bruyantes en dehors d’environnements d’enregistrement contrôlés.
Résultats du benchmark
En s’appuyant sur des évaluations réalisées par Artificial Analysis, Microsoft a déclaré que MAI-Transcribe-2 est 10 fois plus rapide que GPT‑Transcribe d’OpenAI, 7 fois plus rapide que Scribe v2 d’ElevenLabs et 5 fois plus rapide que Gemini 3.5 Transcribe tout en offrant une précision supérieure. L’entreprise a indiqué que le modèle occupe seul le quadrant le plus attractif du graphique précision‑vs‑vitesse du benchmark, avec un taux d’erreur de 2,0 % et un facteur de vitesse de 403,6, ce qui signifie qu’une heure d’audio est traitée en environ dix secondes.
Sur le benchmark multilingue public FLEURS, Microsoft a indiqué que MAI-Transcribe-2 maintient un niveau de précision constamment élevé sur les 60 langues testées. L’entreprise a décrit le modèle comme étant plus précis sur un plus grand nombre de langues que tout autre modèle et a affirmé que les développeurs effectuant des transcriptions multilingues peuvent s’appuyer sur un seul modèle, réduisant ainsi la complexité et pouvant potentiellement économiser l’utilisation des GPU. L’annonce précise également que la vitesse et le débit du modèle permettent à Microsoft de proposer ce qu’elle qualifie de prix le plus compétitif du marché. Au lancement, le tarif de 0,10 $ de l’heure est une offre limitée valable jusqu’à la fin de l’année.
Disponibilité et fonctionnalités pour les développeurs
La documentation Microsoft Learn indique que MAI-Transcribe-2 est disponible dans Azure Speech en aperçu public, sans accord de niveau de service et n’est pas recommandé pour des charges de travail en production. La documentation décrit MAI-Transcribe comme un modèle de conversion parole‑texte développé en interne par l’équipe Microsoft AI, couvrant des charges de travail telles que le sous‑titrage vidéo, les réunions, les notes cliniques, la documentation des centres d’appels, les outils d’accessibilité, la création de contenu et les agents vocaux. Elle répertorie également MAI‑Transcribe‑2 aux côtés des versions antérieures MAI‑Transcribe‑1.5 et MAI‑Transcribe‑1, cette dernière étant retirée le 20 août 2026.
Les requêtes transitent via le mode amélioré de l’API Fast Transcription, le modèle étant sélectionné en définissant la propriété du modèle en mode amélioré sur MAI‑Transcribe‑2. L’entrée audio est limitée à des fichiers de moins de 300 Mo aux formats WAV, MP3 ou FLAC, et son utilisation nécessite un abonnement Azure ainsi qu’une ressource Microsoft Foundry pour Speech.
Des paramètres optionnels contrôlent l’ensemble des fonctionnalités du modèle. La diérisation des locuteurs segmente un enregistrement par intervenant et renvoie des segments étiquetés avec des métadonnées de décalage et de durée. Les horodatages au niveau du mot fournissent le timing de chaque mot, tandis qu’une option segment renvoie le timing par segment et une option none omet les données de timing. Un paramètre phrase‑list oriente la reconnaissance vers les termes fournis, tels que la terminologie spécifique à un domaine, les abréviations et les noms propres, la documentation précisant que ces termes servent d’indices plutôt que d’obligations de sortie.
Le paramètre de style de transcription est par défaut « verbatim », ce qui capture la parole exactement telle qu’elle est prononcée, y compris les mots de remplissage et les faux départs, pour les charges de travail de conformité, d’assurance qualité et d’analyse. Le réglage « clean » supprime les remplissages et reformate automatiquement les schémas de parole courants afin de produire des sous‑titres, notes et transcriptions publiées plus lisibles. La sélection de la langue est optionnelle ; par défaut le modèle détecte automatiquement la langue parlée, et la documentation recommande d’imposer une langue spécifique uniquement lorsque la détection automatique échoue. Le changement de code pour des paires de langues mélangées comme le Hinglish ou le Spanglish est géré automatiquement, et la robustesse au bruit pour les audios enregistrés hors environnements contrôlés est inhérente au modèle.
La documentation indique également que MAI‑Transcribe peut fournir la transcription d’audio d’entrée via l’API Voice Live grâce à un champ de configuration de session. Microsoft a déclaré que le modèle est disponible en démonstration via Microsoft Foundry et le MAI Playground, avec une disponibilité sur OpenRouter annoncée prochainement.












