AIモデルとプラットフォーム
スピーチマティクス、自律型音声認識ソフトウェアを発表
先端の音声認識技術スタートアップであるスピーチマティクスは、最新のディープラーニング技術とブレークスルー的なセルフスーパーバイズモデルを使用する『自律型音声認識』ソフトウェアを発表しました。このシステムは、Amazon (AMZN ) 、Google (GOOGL ) 、Microsoftを上回る能力を示しています。
スタンフォードのデータセット
スピーチマティクスは、スタンフォードの『人種的差異のある音声認識』研究で見つかったデータセットに基づいており、アフリカ系アメリカ人の声に対して全体的な精度が82.8%を達成しました。参考として、Googleは68.7%、Amazonは68.6%の精度率しか達成できませんでした。
この精度のレベルは、音声認識エラーを45%削減することを意味し、平均の文では3つの単語に相当します。新しいスピーチマティクスシステムは、この点で非常に正確であり、またアクセント、年齢、方言、さまざまな社会人文的特性に対する精度の向上も示しました。
音声認識では、アルゴリズムが自己をトレーニングするために使用できるラベル付きデータが限られていることが多く、誤解を招くことがあります。ラベル付きデータは、人間によって手動で分類する必要がありますが、これにより利用可能なデータ量が少なくなり、すべての声の表現が制限され、新しい問題が生じます。
ラベルなしデータでのトレーニング
スピーチマティクスは、この点で大きな進歩を遂げており、その技術はインターネットから直接得られた大量のラベルなしデータでトレーニングされています。このデータは、ソーシャルメディアのコンテンツやポッドキャストから来ています。
セルフスーパーバイズ学習により、システムは1,100,000時間のオーディオでトレーニングされることができました。これは、以前の30,000時間から大幅に増加しており、より広い声の表現と、音声認識におけるAIの偏見とエラーの削減に役立ちます。
子供の声に関しては、スピーチマティクスも競合他社を上回る能力を示しました。子供の声は、従来の音声認識技術では認識が難しいですが、スピーチマティクスは91.8%の精度率を達成しました。Googleは83.4%、Deepgramは82.3%でした。
ケイティ・ウィグダールはスピーチマティクスのCEOです。
「私たちは、次世代のマシンラーニング機能を提供し、より包括的でアクセスしやすい音声技術を提供する使命を持っています。この発表は、その使命を達成するための大きな一歩です。」
「AIの偏見に対処することに重点を置いた結果、音声認識業界で大きな進歩が見られ、多くのシナリオで変化がもたらされるでしょう。」ウィグダールは続けました。「ソーシャルメディアの不正確なキャプション、誤った言葉が書き留められた法廷の公聴会、eラーニングプラットフォームが子供の声を認識するのに苦労したパンデミック期間など、人々が受け入れてきたエラーは、日常生活に実質的な影響を与える可能性があります。」
アリソン・ズー・コエネッケは、スタンフォード大学の音声認識研究のリード著者です。
「音声からテキストへのシステムの公平性を研究し、改善することは、ヘルスケアから刑事司法までのさまざまな分野で個人の被害につながる可能性があるため、非常に重要です。」












