AIモデルとプラットフォーム
EchoSpeech:サイレントスピーチ認識技術によるコミュニケーションの革命

コーネル大学の研究者は、EchoSpeechと呼ばれるサイレントスピーチ認識インターフェースを開発しました。このインターフェースは、音響センシングと人工知能を使用して、31種類の非発声コマンドを連続して認識します。この低電力のウェアラブルインターフェースは、スマートフォンで操作でき、コマンド認識にはユーザー訓練データが数分間しか必要としません。
情報科学の博士課程学生であるRuidong Zhangは、 “EchoSpeech:最小限の邪魔になるアイウェアを使用した連続的なサイレントスピーチ認識” の第一著者であり、この論文は今月ドイツのハンブルクで開催されるAssociation for Computing Machinery Conference on Human Factors in Computing Systems(CHI)で発表される予定です。
「声が出ない人にとって、このサイレントスピーチ技術は音声合成器への入力として優れたものになる可能性があります。患者さんに声を返すことができるのです」とZhangさんは述べています。この技術の将来的な応用について言及しています。
実際の応用とプライバシーの利点
現在のEchoSpeechは、騒々しいレストランや静かな図書館などの、発声が不適切な環境でスマートフォンを使用して他の人とコミュニケーションをとるために使用できます。サイレントスピーチインターフェースは、スタイラスとペアになって、CADなどのデザインソフトウェアと一緒に使用でき、キーボードとマウスの必要性を大幅に減らすことができます。
EchoSpeechグラスは、鉛筆の消しゴムよりも小さいマイクとスピーカーを備えており、ウェアラブルAIパワードソナーシステムとして機能し、顔全体に音波を送受信し、口の動きを検出します。ディープラーニングアルゴリズムは、これらのエコープロファイルを約95%の精度でリアルタイムで分析します。
「私たちは、身体にソナーを取り付けている」とCheng Zhangさんは述べています。Cheng Zhangは情報科学の助教授であり、コーネル大学のSmart Computer Interfaces for Future Interactions(SciFi)ラボのディレクターでもあります。
既存のサイレントスピーチ認識技術は、事前に決定されたコマンドの限定されたセットに依存し、ユーザーがカメラを向けたり着用したりする必要があります。Cheng Zhangは、これは実用的でもなければ実行可能でもなく、ユーザーと彼らがやり取りする人にとって、重大なプライバシーの懸念も生じるということを説明しています。
EchoSpeechの音響センシング技術は、ウェアラブルビデオカメラの必要性を排除します。さらに、オーディオデータは画像またはビデオデータよりも小さいため、François Guimbretière情報科学教授によると、Bluetoothを介してリアルタイムにスマートフォンに転送するために必要な帯域幅が少なくて済みます。
「そして、データはクラウドにアップロードされるのではなく、スマートフォンでローカルに処理されるため、」彼は述べています、「プライバシーセンシティブな情報はあなたの管理から離れることはありません」。












