Modèles et plateformes d’IA

Lancement de Munsit par CNTXT AI : le système de reconnaissance de parole arabe le plus précis jamais construit

mm
Ajouter Unite.AI à vos sources préférées sur Google

Dans un moment déterminant pour l’intelligence artificielle en langue arabe, CNTXT AI a présenté Munsit, un modèle de reconnaissance de parole arabe de nouvelle génération qui est non seulement le plus précis jamais créé pour l’arabe, mais qui surpasse également les géants mondiaux tels que OpenAI, Meta, Microsoft (MSFT ) et ElevenLabs sur les benchmarks standard. Développé aux Émirats arabes unis et conçu pour l’arabe dès le départ, Munsit représente un puissant pas en avant dans ce que CNTXT appelle « l’intelligence artificielle souveraine » – une technologie construite dans la région, pour la région, mais avec une compétitivité mondiale.

Les fondements scientifiques de cette réalisation sont exposés dans le document de recherche récemment publié par l’équipe, « Améliorer la reconnaissance de parole arabe grâce à l’apprentissage faiblement supervisé à grande échelle », qui présente une méthode d’apprentissage scalable et efficace en termes de données qui répond au problème persistant de la rareté de données de parole arabe étiquetées. Cette méthode – l’apprentissage faiblement supervisé – a permis à l’équipe de construire un système qui définit une nouvelle norme pour la qualité de la transcription dans les deux langues arabe moderne standard (MSA) et plus de 25 dialectes régionaux.

Surmonter la pénurie de données en reconnaissance de parole arabe

L’arabe, malgré le fait qu’il s’agit de l’une des langues les plus parlées dans le monde et d’une langue officielle des Nations Unies, a longtemps été considéré comme une langue à faibles ressources dans le domaine de la reconnaissance de parole. Cela est dû à la fois à sa complexité morphologique et à un manque de grands ensembles de données de parole étiquetées et diversifiées. Contrairement à l’anglais, qui bénéficie de nombreuses heures de données audio transcrites manuellement, la richesse dialectale de l’arabe et sa présence numérique fragmentée ont posé des défis importants pour la construction de systèmes de reconnaissance de parole automatique (ASR) robustes.

Plutôt que d’attendre le processus lent et coûteux de transcription manuelle pour rattraper le retard, CNTXT AI a poursuivi une voie beaucoup plus scalable : la supervision faible. Leur approche a commencé avec un corpus massif de plus de 30 000 heures d’audio arabe non étiqueté collecté à partir de sources diverses. Grâce à un pipeline de traitement de données personnalisé, cet audio brut a été nettoyé, segmenté et automatiquement étiqueté pour produire un ensemble de données de formation de haute qualité de 15 000 heures – l’un des plus grands et des plus représentatifs ensembles de parole arabe jamais assemblés.

Ce processus n’a pas reposé sur l’annotation humaine. Au lieu de cela, CNTXT a développé un système à plusieurs étapes pour générer, évaluer et filtrer des hypothèses à partir de plusieurs modèles ASR. Ces transcriptions ont été comparées à l’aide de la distance de Levenshtein pour sélectionner les hypothèses les plus cohérentes, puis passées à travers un modèle de langage pour évaluer leur plausibilité grammaticale. Les segments qui n’ont pas répondu aux seuils de qualité définis ont été rejetés, garantissant que même sans vérification humaine, les données de formation restaient fiables. L’équipe a affiné ce pipeline à travers plusieurs itérations, améliorant à chaque fois la précision des étiquettes en réentraînant le système ASR lui-même et en le réinjectant dans le processus d’étiquetage.

Munsit : l’architecture Conformer

Au cœur de Munsit se trouve l’architecture Conformer, un réseau neuronal hybride qui combine la sensibilité locale des couches convolutionnelles avec les capacités de modélisation de séquences globales des transformateurs. Cette conception rend le Conformer particulièrement adapté pour gérer les nuances de la langue parlée, où à la fois les dépendances à longue portée (comme la structure de phrase) et les détails phonétiques fins sont cruciaux.

CNTXT AI a mis en œuvre une grande variante du Conformer, l’entraînant à partir de zéro en utilisant des mél-spectrogrammes à 80 canaux comme entrée. Le modèle se compose de 18 couches et comprend environ 121 millions de paramètres. L’entraînement a été effectué sur un cluster haute performance en utilisant huit GPU NVIDIA A100 avec une précision bfloat16, permettant une gestion efficace de grands lots et d’espaces de fonctionnalités à haute dimension. Pour gérer la tokenisation de la structure morphologiquement riche de l’arabe, l’équipe a utilisé un tokeniseur SentencePiece formé spécifiquement sur leur corpus personnalisé, aboutissant à un vocabulaire de 1 024 unités de sous-mots.

Contrairement à la formation supervisée conventionnelle, qui nécessite généralement que chaque clip audio soit apparié avec une étiquette soigneusement transcrite, la méthode de CNTXT a fonctionné entièrement sur des étiquettes faibles. Ces étiquettes, bien que plus bruyantes que celles vérifiées par l’homme, ont été optimisées à travers une boucle de rétroaction qui a donné la priorité au consensus, à la cohérence grammaticale et à la plausibilité lexicale. Le modèle a été formé en utilisant la fonction de perte Connectionist Temporal Classification (CTC), qui convient bien au modélisation de séquences non alignées – essentiel pour les tâches de reconnaissance de parole où le moment des mots parlés est variable et imprévisible.

Dominer les benchmarks

Les résultats parlent d’eux-mêmes. Munsit a été testé contre les principaux modèles ASR open source et commerciaux sur six ensembles de données de référence arabe : SADA, Common Voice 18.0, MASC (propres et bruyants), MGB-2 et Casablanca. Ces ensembles de données couvrent collectivement des dizaines de dialectes et d’accents à travers le monde arabe, de l’Arabie saoudite au Maroc.

Sur tous les benchmarks, Munsit-1 a atteint un taux d’erreur de mot moyen (WER) de 26,68 et un taux d’erreur de caractère moyen (CER) de 10,05. En comparaison, la meilleure version de Whisper d’OpenAI a enregistré un WER moyen de 36,86 et un CER moyen de 17,21. Meta’s SeamlessM4T, un autre modèle multilingue de pointe, a obtenu des résultats encore plus élevés. Munsit a surpassé tous les autres systèmes sur les données propres et bruyantes, et a démontré une robustesse particulièrement forte dans les conditions bruyantes, un facteur critique pour les applications réelles comme les centres d’appel et les services publics.

L’écart était tout aussi important contre les systèmes propriétaires. Munsit a surpassé les modèles ASR arabe de Microsoft Azure, ElevenLabs Scribe et même la fonction de transcription GPT-4o d’OpenAI. Ces résultats ne représentent pas des gains marginaux – ils représentent une amélioration moyenne relative de 23,19 % en WER et de 24,78 % en CER par rapport à la référence ouverte la plus forte, établissant Munsit comme le leader clair de la reconnaissance de parole arabe.

Une plateforme pour l’avenir de l’intelligence vocale arabe

Alors que Munsit-1 est déjà en train de transformer les possibilités de transcription, de sous-titrage et de support client dans les marchés de langue arabe, CNTXT AI considère ce lancement comme seulement le début. L’entreprise envisage une gamme complète de technologies vocales en langue arabe, y compris la synthèse vocale, les assistants vocaux et les systèmes de traduction en temps réel – tous fondés sur une infrastructure souveraine et une intelligence artificielle pertinente pour la région.

« Munsit est plus qu’une avancée dans la reconnaissance de parole », a déclaré Mohammad Abu Sheikh, PDG de CNTXT AI. « C’est une déclaration que l’arabe appartient au premier plan de l’IA mondiale. Nous avons prouvé que l’IA de classe mondiale n’a pas besoin d’être importée – elle peut être construite ici, en arabe, pour l’arabe. »

Avec l’émergence de modèles spécifiques à la région comme Munsit, l’industrie de l’IA entre dans une nouvelle ère – une ère où la pertinence linguistique et culturelle ne sont pas sacrifiées dans la poursuite de l’excellence technique. En fait, avec Munsit, CNTXT AI a montré qu’elles sont une et la même chose.

Antoine est un leader visionnaire et associé fondateur d'Unite.AI, animé par une passion inébranlable pour façonner et promouvoir l'avenir de l'IA et de la robotique. Un entrepreneur en série, il croit que l'IA sera aussi perturbatrice pour la société que l'électricité, et se fait souvent prendre en train de vanter le potentiel des technologies perturbatrices et de l'AGI.

En tant que futuriste, il se consacre à explorer comment ces innovations vont façonner notre monde. En outre, il est le fondateur de Securities.io, une plateforme axée sur l'investissement dans les technologies de pointe qui redéfinissent l'avenir et remodelent des secteurs entiers.