AI 模型与平台
Speechmatics 推出自主语音识别软件
领先的语音识别技术初创公司 Speechmatics推出了其“自主语音识别”软件,该软件使用最新的深度学习技术和突破性的自监督模型。该系统已证明能够超越亚马逊、谷歌和微软。
斯坦福大学的数据集
Speechmatics 基于斯坦福大学的“语音识别中的种族差异”研究,该研究中,Speechmatics 达到了 82.8% 的整体准确率,用于识别非裔美国人的声音。为了参考,谷歌仅达到 68.7% 的准确率,而亚马逊达到 68.6%。 (AMZN ) (GOOGL )
这种准确率相当于语音识别错误减少了 45%,这相当于平均句子中的三个字。不仅新的 Speechmatics 系统在这方面是准确的,而且它还在口音、年龄、方言和各种其他社会人口统计特征方面表现出改进的准确率。
由于算法可以用来训练的标记数据量有限,语音识别中经常存在误解。标记数据需要由人类手动分类,这导致可用于这些系统的数据量较少。这也限制了所有声音的代表性,从而产生了一系列新的问题。
在未标记数据上训练
Speechmatics 在这方面取得了巨大的进步,其技术是在互联网上直接获取的大量未标记数据上进行训练的。这些数据来自社交媒体内容、播客等。
自监督学习使得该系统能够在 1.1 万小时的音频上进行训练,这比之前的 3 万小时有了显著增加。这使得它能够拥有更广泛的语音代表性,并有助于减少 AI 偏差和语音识别中的错误。
在儿童的声音方面,Speechmatics 也表现出了超越竞争对手的能力。儿童的声音对传统语音识别技术来说是具有挑战性的,但 Speechmatics 管理记录了 91.8% 的准确率。谷歌仅达到 83.4%,Deepgram 达到 82.3%。
Katy Wigdahl 是 Speechmatics 的 CEO。
“我们正在执行一项使命,即提供下一代机器学习能力,并通过这种方式提供更具包容性和可及性的语音技术。这一公告是实现这一使命的巨大一步。”
“我们专注于解决 AI 偏差的问题,这导致了语音识别行业的巨大进步,并且这种影响将在许多不同的场景中产生变化,”Wigdahl 继续说。“想想我们在社交媒体上看到的不正确的字幕、法庭听证会中被误译的文字以及在疫情期间难以处理儿童声音的电子学习平台。人们迄今为止不得不接受的错误可能会对人们的日常生活产生切实的影响。”
Allison Zhu Koenecke 是斯坦福大学语音识别研究的首席作者。
“研究和改进语音转文本系统的公平性至关重要,考虑到这些系统可能对个人在医疗保健、刑事司法等各个领域造成的不同伤害。”












