AI 模型与平台

EchoSpeech:革命性的沉默语音识别技术

mm
将 Unite.AI 添加到您在 Google 上的首选来源

康奈尔大学的研究人员开发了一种名为EchoSpeech的沉默语音识别接口,它采用声学感知和人工智能技术,可以连续识别多达31个未发音的命令,基于嘴唇和嘴巴的运动。这种低功耗、可佩戴的接口可以在智能手机上运行,只需要几分钟的用户训练数据即可进行命令识别。

信息科学博士生Ruidong Zhang是”EchoSpeech:基于声学感知的连续沉默语音识别“的首席作者,该论文将在本月的德国汉堡举行的计算机人机交互会议(CHI)上发表。

“对于那些无法发出声音的人来说,这项沉默语音技术可能是语音合成器的一个极好的输入。它可以让患者重新获得声音,”张说,强调了该技术在进一步发展中的潜在应用。

实际应用和隐私优势

在其当前形式中,EchoSpeech可以用于通过智能手机在不方便或不适合说话的环境中(如嘈杂的餐厅或安静的图书馆)与他人交流。沉默语音接口还可以与触控笔配对,并与设计软件(如CAD)一起使用,显著减少了对键盘和鼠标的需求。

配备了比铅笔橡皮还小的麦克风和扬声器,EchoSpeech眼镜作为一种可佩戴的AI驱动的声纳系统,向面部发送和接收声波,并检测嘴巴的运动。然后,一个深度学习算法以大约95%的准确率实时分析这些回声特征。

“我们正在将声纳技术应用于人体,”信息科学助理教授、康奈尔大学智能计算机接口未来交互实验室(SciFi)主任程张说。

现有的沉默语音识别技术通常依赖于有限的预定义命令,并要求用户面对或佩戴摄像头。程张解释说,这既不实用也不可行,并且还会对用户和他们互动的人带来重大的隐私问题。

EchoSpeech的声学感知技术消除了对可佩戴视频摄像头的需求。此外,根据信息科学教授弗朗索瓦·吉姆布雷蒂埃(François Guimbretière)的说法,由于音频数据比图像或视频数据小,因此需要较少的带宽来处理,并且可以通过蓝牙实时传输到智能手机。

“而且,因为数据是在智能手机上本地处理的,而不是上传到云端,”他说,“因此,敏感信息永远不会离开您的控制范围。”

Alex McFarland 是一名人工智能记者和作家,探索最新的人工智能发展。他曾与世界各地的众多人工智能初创公司和出版物合作。