Andersonの視点

スピーチとジェスチャーの統合

mm
Unite.AI を Google の優先ソースに追加

イタリア南部で数年間過ごした後、イギリスに戻ったとき、私は話しながらジェスチャーをしないようにするのに相当な時間がかかった。イギリスでは、ボディランゲージで話を補うことは、ただ過剰なカフェインの影響のように見えるが、イタリアでは、言語を学んでいる私にとって、実際に理解されるのに役立った。理解されることである。現在でも、イタリア語で話すことは稀ですが、「野性的」な手のジェスチャーが復活する。それはイタリア語で話すこととほぼ不可分である。

最近の年々、イタリア語とユダヤ人の文化におけるジェスチャーによるコミュニケーションは、マーティン・スコセッシや初期のウディ・アレンの作品からのトロープとしてではなく、注目を集めるようになった。2013年、ニューヨーク・タイムズはイタリアのハンドジェスチャーの短いビデオの歴史をまとめ、学術界は、ジェスチャーを単なるステレオタイプとして見なすのではなく、人種によるジェスチャーの傾向を研究し始めた。また、Unicodeコンソーシアムからの新しい絵文字は、純粋にテキストベースのデジタルコミュニケーションにおけるジェスチャーの不足を解消している。

スピーチとジェスチャーの統合アプローチ

スウェーデンのKTHロイヤル工科大学のスピーチ、音楽、聴覚学科からの新しい研究は、ボディランゲージをスピーチの補助としてではなく、統合された多モーダルシステムの一部として使用することで、スピーチベースのコミュニケーションの理解を高めることを目指している。

スウェーデンのスピーチ/ジェスチャープロジェクトのテストページからのビジュアル。

スウェーデンのスピーチ/ジェスチャープロジェクトのテストページからのビジュアル。 ソース:https://swatsw.github.io/isg_icmi21/

この研究では、統合スピーチとジェスチャー(ISG)合成という新しいモデルが提案されており、スピーチとジェスチャー研究からの最新のニューラルモデルを統合している。

新しいアプローチは、線形のパイプラインモデル(ジェスチャー情報がスピーチから二次的な処理ステージとして導出される)を放棄し、既存のシステムと同等の評価結果を示し、合成時間が短縮され、パラメータ数が削減された統合アプローチを採用している。

線形と統合されたスピーチとジェスチャーのシンセシス。

線形と統合されたスピーチとジェスチャーのシンセシス。 ソース:https://arxiv.org/pdf/2108.11436.pdf

新しい多モーダルシステムには、自発的なテキストからスピーチへのシンセサイザーとオーディオスピーチ駆動のジェスチャー生成器が含まれており、両方とも既存のTrinity Speech Gesture データセットでトレーニングされている。このデータセットには、さまざまなトピックについて話し、自由にジェスチャーする男性の244分のオーディオとボディキャプチャデータが含まれている。

この研究は、DurIANプロジェクトと同等のものであり、ジェスチャーとスピーチではなく、顔の表情とスピーチを生成し、表情の認識とシンセシスの分野に属する。

アーキテクチャ

プロジェクトのスピーチと視覚(ジェスチャー)コンポーネントは、データのバランスが取れていない。テキストはスパースであり、ジェスチャーは豊富でデータ集約型であるため、目標とメトリックを定義する際の課題である。したがって、研究者は、より明らかな機械的なアプローチではなく、人間の反応に基づいてシステムを評価した。

2つの主要なISGモデルは、2017年のGoogleのTacotronエンドツーエンドスピーチシンセシスプロジェクトの2番目のバージョンと、2020年に公開された韓国のGlow-TTSイニシアチブを中心に開発された。Tacotronは、自己回帰LSTMアーキテクチャを使用するのに対し、Glow-TTSは並列にコンボリューション演算子を使用し、GPUのパフォーマンスが向上し、自己回帰モデルに伴う安定性の問題がない。

研究者は、プロジェクト中に3つの有効なスピーチ/ジェスチャーシステムをテストした:2021年に同じ研究者グループによって公開された多モーダルスピーチとジェスチャー生成の修正バージョン;Tacotron 2の改良されたISGバージョン;Glow-TTSの改良されたISGバージョン。

システムを評価するために、研究者は、事前に定義されたテキストセグメントに基づいて話し、動く3Dの人を特徴とするウェブベースのフィードバック環境を作成した(環境の一般的な見た目はパブリックプロジェクトページで見ることができる)。

テスト環境。

テスト環境。

テスト参加者は、システムのパフォーマンスをスピーチとジェスチャー、スピーチのみ、ジェスチャーのみに基づいて評価するよう求められた。結果は、新しいISGバージョンが古いパイプラインバージョンよりもわずかに改善されたことを示しており、新しいシステムはより迅速に動作し、リソースが削減された。

「ジェスチャーはどの程度人間らしいか?」と尋ねられた場合、完全に統合されたISGモデルは、遅いパイプラインモデルよりもわずかに優れており、TacotronとGlowベースのモデルはさらに後ろにある。

「ジェスチャーはどの程度人間らしいか?」と尋ねられた場合、完全に統合されたISGモデルは、遅いパイプラインモデルよりもわずかに優れており、TacotronとGlowベースのモデルはさらに後ろにある。

埋め込まれたシュラグ

Tacotron2-ISGモデルは、データセットの中で最も一般的なフレーズのいくつか、たとえば「私は知らない」というフレーズに関連する「潜在的な」学習を示している。明示的なデータがないにもかかわらず、このフレーズに伴うジェスチャーを生成するジェネレーターは、実際に首を振る。

研究者は、この新しいプロジェクトの特定の性質は、スピーチとジェスチャーデータを統合してシステムをトレーニングするのに適した専用のデータセットなどの一般的なリソースの不足につながると指摘している。にもかかわらず、研究者は、この研究をスピーチ、言語学、ジェスチャー認識における新しい、まだ探索されていない分野と見なしており、先駆的な研究であるにもかかわらず、有望であると考えている。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai