AI 模型与平台

CNTXT AI 推出 Munsit:有史以来最准确的阿拉伯语语音识别系统

mm
将 Unite.AI 添加到您在 Google 上的首选来源

在阿拉伯语人工智能领域的决定性时刻,CNTXT AI 推出了 Munsit,一种下一代阿拉伯语语音识别模型,它不仅是有史以来为阿拉伯语创建的最准确的模型,而且在标准基准测试中,它明显优于 OpenAI、Meta、Microsoft (MSFT ) 和 ElevenLabs 等全球巨头。Munsit是在阿联酋开发的,并从头开始为阿拉伯语量身定制,代表着CNTXT所谓的“主权AI”的一个强大步骤——这是一种在该地区为该地区打造的技术,但具有全球竞争力。

这一成就的科学基础在团队最新发表的论文《通过大规模弱监督学习推进阿拉伯语语音识别》中有详细介绍,这篇论文介绍了一种可扩展、数据高效的训练方法,以解决阿拉伯语标记语音数据长期以来缺乏的问题。这种方法——弱监督学习——使团队能够构建一个系统,它为现代标准阿拉伯语(MSA)和超过25种区域方言的转录质量设定了新的标准。

克服阿拉伯语ASR中的数据匮乏

阿拉伯语尽管是全球使用最广泛的语言之一,也是联合国的官方语言,但在语音识别领域长期被认为是一种低资源语言。这是由于其形态复杂性以及缺乏大量、多样化的标记语音数据集。与英语不同,英语可以利用数不清的小时数的手动转录音频数据,阿拉伯语的方言丰富性和数字化存在的碎片化为构建强大的自动语音识别(ASR)系统带来了重大挑战。

CNTXT AI 没有等待手动转录的缓慢和昂贵的过程,而是采取了一条更可扩展的道路:弱监督。他们的方法从收集了来自多种来源的超过30,000小时的未标记阿拉伯语音频开始。通过自定义的数据处理管道,这些原始音频被清理、分段并自动标记,产生了一个高质量的15,000小时训练数据集——这是有史以来组装的最大的、最具代表性的阿拉伯语语音语料库之一。

这个过程不依赖于人工注释。相反,CNTXT 开发了一个多阶段系统,用于从多个 ASR 模型生成、评估和过滤假设。这些转录通过 Levenshtein 距离进行比较,以选择最一致的假设,然后通过语言模型评估其语法合理性。未达到定义的质量阈值的段被丢弃,确保即使没有人工验证,训练数据仍然可靠。该团队通过多次迭代完善了这个管道,每次都通过重新训练 ASR 系统本身并将其反馈到标记过程中来提高标签准确性。

为 Munsit 提供动力:Conformer 架构

Munsit 的核心是 Conformer 模型,一种混合神经网络架构,它结合了卷积层的局部敏感性和变换器的全局序列建模能力。这种设计使 Conformer 特别适合处理口语的细微差别,在口语中,长距离依赖(如句子结构)和细粒度的语音细节都至关重要。

CNTXT AI 实现了一个大型的 Conformer 变体,从头开始使用 80 通道的 mel-频谱图作为输入进行训练。该模型由 18 层组成,包含大约 121 百万个参数。训练是在使用八个 NVIDIA A100 GPU 和 bfloat16 精度的高性能集群上进行的,这允许高效地处理大批量和高维特征空间。为了处理阿拉伯语丰富的形态结构的标记化,团队使用了在他们的自定义语料库上训练的 SentencePiece 标记化工具,结果产生了 1,024 个子词单位的词汇表。

与传统的有监督 ASR 训练不同,后者通常需要每个音频片段都与仔细转录的标签配对,CNTXT 的方法完全运行在弱标签上。这些标签虽然比人工验证的标签更嘈杂,但通过优先考虑一致性、语法连贯性和词汇合理性的反馈循环进行了优化。该模型使用了连接主义时间分类(CTC)损失函数进行训练,CTC 对于无对齐序列建模非常适用,这对于语音识别任务至关重要,因为口语的时间是可变和不可预测的。

主导基准测试

结果不言自明。Munsit 被测试在六个基准阿拉伯语数据集上,与领先的开源和商业 ASR 模型相比:SADA、Common Voice 18.0、MASC(干净和嘈杂)、MGB-2 和卡萨布兰卡。这些数据集涵盖了阿拉伯世界的几十种方言和口音,从沙特阿拉伯到摩洛哥。

在所有基准测试中,Munsit-1 实现了平均单词错误率(WER)26.68 和字符错误率(CER)10.05。相比之下,OpenAI 的 Whisper 记录的平均 WER 为 36.86,CER 为 17.21。Meta 的 SeamlessM4T,另一款最先进的多语言模型,表现更差。Munsit 在干净和嘈杂数据上都优于其他所有系统,并且在嘈杂条件下表现出特别强的鲁棒性,这是实际应用(如呼叫中心和公共服务)中的一个关键因素。

与专有系统的差距同样明显。Munsit 超越了 Microsoft Azure 的阿拉伯语 ASR 模型、ElevenLabs Scribe,甚至 OpenAI 的 GPT-4o 转录功能。这些结果不仅是边缘性的提升——它们代表了相对于最强开源基线的平均 23.19% 的 WER 和 24.78% 的 CER 改进,确立了 Munsit 为阿拉伯语语音识别的明确领导者。

阿拉伯语语音AI的未来平台

虽然 Munsit-1 已经在转录、字幕和阿拉伯语市场的客户支持方面开启了新的可能性,CNTXT AI 将这一推出视为仅仅是一个开始。该公司设想了一整套阿拉伯语语音技术,包括文本转语音、语音助手和实时翻译系统——所有这些都建立在主权基础设施和区域相关的 AI 之上。

“Munsit 不仅仅是语音识别方面的突破,”CNTXT AI 首席执行官 Mohammad Abu Sheikh 说。“它是宣告阿拉伯语属于全球 AI 前沿的声明。我们已经证明,世界级的 AI 不需要进口——它可以在这里,以阿拉伯语为阿拉伯语而建造。”

随着像 Munsit 这样的区域特定模型的兴起,AI 行业正在进入一个新时代——在这个时代,语言和文化的相关性不会被技术卓越的追求所牺牲。事实上,通过 Munsit,CNTXT AI 已经证明它们是同一件事。

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。