AIモデルとプラットフォーム

研究者が開発した深層学習を用いた人間の音声認識モデル

mm
Unite.AI を Google の優先ソースに追加

ドイツの研究者グループは、機械学習と深層学習ネットワークに基づく新しい人間の音声認識モデルを開発しています。この新しいモデルは、人間の音声認識を大幅に改善することができます。

通常、補聴器アルゴリズムは人間の音声認識を改善するために使用され、さまざまな実験によって評価されます。これらの実験では、特定の数の単語が認識される信号対雑音比を決定します。しかし、これらの実験は時間がかかり、費用がかかることがよくあります。

新しいモデルは、アメリカ音響学会誌に掲載された研究で詳しく説明されています。

聴覚障害者の予測

カール・フォン・オシエツキー大学のジャナ・ロスバッハは、この研究の著者の一人です。

「私たちのモデルの新しい点は、複雑性の異なるさまざまなノイズタイプに対して、聴覚障害者の予測を提供し、低いエラー率と測定データとの高い相関性を示すことです」とロスバッハは述べました。

研究者たちは、自動音声認識(ASR)を使用して、リスナーが1文あたりに何単語を理解できるかを計算しました。AlexaやSiriなどの音声認識ツールは、このASRに依存しています。

研究と結果

研究チームは、8人の正常な聴覚と20人の聴覚障害を持つ個人の聴覚を調べました。リスナーは、さまざまな複雑なノイズにさらされ、聴覚障害者のリスナーは、年齢による聴覚喪失の程度に応じて3つのグループに分けられました。

新しいモデルを使用して、研究者たちは、さまざまな程度の聴覚喪失を持つ聴覚障害者の人間の音声認識パフォーマンスを予測することができました。彼らは、さまざまなノイズ・マスカーに対して予測を行うことができました。これらのノイズ・マスカーは、時間的変調の複雑性と実際の音声との類似性が異なりました。これにより、各個人の可能な聴覚喪失について個別に観察および分析することが可能になりました。

「私たちが最も驚いたのは、予測がすべてのノイズタイプでうまく機能したことです。私たちは、単一の競合話者を使用する場合にモデルが問題を起こすことを期待していました。しかし、実際にはそうではありませんでした」とロスバッハは述べました。

モデルの焦点は単耳聴覚に置かれていたため、チームは今後、2耳の聴覚に対応した二耳模型を作成することを目指しています。また、新しいモデルは、聴覚労力または音声品質を予測するために使用できる可能性もあると述べています。

Alex McFarlandは、人工知能の最新の開発を探求するAIジャーナリスト兼ライターです。彼は、世界中の数多くのAIスタートアップや出版物と共同しています。