Andersonの視点

ビゼームとマシンラーニングを用いたリップリーディング

mm
Unite.AI を Google の優先ソースに追加
HAL reads lips in 2001: A Space Odyssey (1968)

テヘランのコンピューターエンジニアリング学部からの新しい研究は、リップリーディングに適したマシンラーニングシステムの作成という課題に対する改善されたアプローチを提供しています。

ビゼーム解码を用いたリップリーディング」というタイトルの論文は、新しいシステムが、以前の同様のモデルの中で最も優れたものよりも、4%の単語エラー率の改善を達成したと報告しています。このシステムは、オープンサブタイトルデータセットの600万サンプルから得られたテキストコンテンツにビゼームをマッピングすることで、この分野の有用なトレーニングデータの一般的な不足に対処しています。

ビゼームは、音素の視覚的な同等物であり、実質的にオーディオ>イメージマッピングであり、マシンラーニングモデルにおける「特徴」となる可能性があります。

ビゼームの動画

ビゼームの動作. ソース:https://developer.oculus.com/documentation/unity/audio-ovrlipsync-viseme-reference/

研究者は、利用可能なデータセットで最低のエラー率を確立し、既存のマッピング手順からビゼームシーケンスを開発することから始めました。徐々に、このプロセスはビゼームを使用して視覚的な辞書を作成しますが、ビゼームを共有する異なる単語(たとえば、「heart」と「art」)の精度の確率を定義する必要があります。

テキストから抽出されたビゼーム

テキストから抽出されたビゼーム. ソース:https://arxiv.org/pdf/2104.04784.pdf

2つの同一の単語が同じビゼームを生成する場合、最も頻繁に出現する単語が選択されます。

モデルは、ビゼームをテキストから予測し、専用のパイプラインでモデル化するサブプロセスステージを追加することによって、伝統的なシーケンスツーシーケンス学習を拡張しています:

ビゼームアーキテクチャのリップリーディング

上部は、キャラクターモデルにおける伝統的なシーケンスツーシーケンス方法です。下部は、テヘランの研究モデルにおけるビゼームキャラクターモデリングの追加です。 ソース:https://arxiv.org/pdf/2104.04784.pdf

モデルは、オックスフォード大学によって2018年に公開されたLRS3-TEDデータセットに対して、視覚的なコンテキストなしで適用され、最悪の単語エラー率(WER)は24.29%でした。

テヘランの研究では、グラフィームからフォネームへのコンバーターの使用も含まれています。

2017年のオックスフォード研究「野外でのリップリーディング」に対するテストでは、ビデオからビゼームへの方法は62.3%の単語エラー率を達成しました。これは、オックスフォード方法の69.5%よりも低い値です。

研究者は、テキスト情報のより大きな量を組み合わせてグラフィームからフォネームへのコンバーターとビゼームマッピングを使用することで、自動リップリーディングマシンシステムの現状を超える改善が期待できると結論付けています。ただし、使用される方法は、より洗練された現在のフレームワークに組み込まれた場合に、さらに優れた結果をもたらす可能性があることを認めています。

マシン駆動のリップリーディングは、コンピュータビジョンとNLPの研究における活発で継続的な分野であり、過去20年間に多くの例やプロジェクトがあります。2006年には、自動リップリーディングソフトウェアの使用が、ババリアの別荘で撮影された有名なサイレント映画の中でアドルフ・ヒトラーが何を言っていたかを解釈するために使用されたときに、注目を集めました。ただし、このアプリケーションは、その後から見えなくなったようです。(12年後、ピーター・ジャクソンは、WW1の映像の会話を復元するために人間のリップリーダーに頼った「彼らは老いることはない」というプロジェクトに取り組みました。)

2017年には、オックスフォード大学とGoogleのAI研究部門の共同研究である「野外でのリップリーディング」は、音なしのビデオで48%のスピーチを正しく推測できるリップリーディングAIを生み出しました。人間のリップリーダーは、同じ素材から12.4%の精度しか達成できませんでした。このモデルは、数千時間のBBC TVの映像でトレーニングされました。

この研究は、前年のオックスフォード/Googleイニシアチブ「リップネット」に続くものでした。リップネットは、ゲート付き再帰ネットワーク(GRN)を使用して、可変長のビデオシーケンスをテキストシーケンスにマッピングするニューラルネットワークアーキテクチャです。リップネットは、再帰ニューラルネットワーク(RNN)の基本アーキテクチャに機能を追加します。このモデルは、人間のリップリーダーよりも4.1倍の性能を達成しました。

リアルタイムで正確なトランスクリプトを生成する問題に加えて、音、顔の前面の映像、明るい照明、言語/文化(フォネーム/ビゼームが比較的明確である)などの有用なコンテキストを除去すると、スピーチをビデオから解釈するという課題は深まります。

現在、オーディオなしでリップリーディングが最も難しい言語については、経験的な理解はありませんが、日本語は主要な候補です。日本人(および一部の西アジア人や東アジア人)が、話しの内容に対して顔の表情を活用するさまざまな方法は、すでに感情分析システムにとって大きな課題です。

ただし、一般的に、このトピックに関する科学文献は慎重です。なぜなら、この分野の研究は、意図的でない場合でも、人種プロファイリングや既存のステレオタイプの普及につながる可能性があるからです。

内発的な要素の割合が高い言語(たとえば、チェチェン語オランダ語)は、自動音声抽出技術にとって特に問題があります。話者が感情や敬意を表現するために視線を外す文化(一般的にアジア文化)では、AIリップリーディング研究者は、他のコンテキストからのヒントから「埋め込み」するための追加の方法を開発する必要があります。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai