AIモデルとプラットフォーム
映画やメディアのサウンドエフェクトを生成するAIプログラムを研究者が設計
テキサス大学サンアントニオ校の研究者は、動画内のアクションを観察し、それに合った人工的なサウンドエフェクトを生成するAIベースのアプリケーションを開発しました。プログラムによって生成されるサウンドエフェクトは、人間の観察者がそれらを本物のサウンドエフェクトと見分けることができないほどリアルです。
サウンドエフェクトを生成するプログラム、AudioFoleyは、最近IEEE Transactions on Multimediaに掲載された研究で詳しく説明されています。IEEE Spectrumによると、AIプログラムは、UTサンアントニオのジェフ・プロボスト教授と博士課程のサンチタ・ゴースによって開発されました。研究者は、複数の機械学習モデルを組み合わせてプログラムを作成しました。
アクションに適したサウンドエフェクトを生成する最初のタスクは、アクションを認識し、サウンドエフェクトにマッピングすることでした。 이를実現するために、研究者は2つの異なる機械学習モデルを設計し、異なるアプローチをテストしました。最初のモデルは、入力されたビデオからフレームを抽出して、動きや色などの関連する機能を分析します。次に、2番目のモデルが使用されて、オブジェクトの位置がフレーム間でどのように変化するかを分析して、時間情報を抽出します。この時間情報は、ビデオ内の次のアクションを予測するために使用されます。2つのモデルは、アクションを分析する方法が異なりますが、両方ともクリップ内の情報を使用して、クリップに最も適したサウンドを推測します。
次のタスクは、サウンドを合成することであり、活動/予測された動きを可能なサウンドサンプルにマッチングすることで実現されます。ゴースとプロボストによると、AutoFoleyは、火、走る馬、刻み時計、植物に降る雨などのアクションやアイテムを含む1000個の短いクリップのサウンドを生成するために使用されました。AutoFoleyは、アクションとサウンドの完全な一致が必要ないクリップで最も成功を収めましたが、変化のあるアクションが発生するクリップでは苦労しました。ただし、プログラムは依然として多くの人間の観察者を欺くことができ、生成されたサウンドをクリップの元のサウンドよりも優先しました。
プロボストとゴースは、57人の大学生を集め、さまざまなクリップを観察させました。いくつかのクリップには元のオーディオが含まれていましたが、いくつかのクリップにはAutoFoleyによって生成されたオーディオが含まれていました。最初のモデルをテストした結果、約73%の学生が合成オーディオを元のオーディオと見なしました。もう1つのモデルは、66%の参加者が生成されたオーディオを元のオーディオよりも優先したため、わずかに悪い結果になりました。
プロボストは、AutoFoleyが映画、テレビ、他のメディアの制作プロセスを迅速化するために使用できる可能性があると説明しました。プロボストは、リアルなフォーリー・トラックはメディアを魅力的で信頼性の高いものにするために重要であると指摘していますが、フォーリーのプロセスはしばしば完了するのに多くの時間がかかることを認めています。基本的なフォーリー要素の作成を処理できる自動システムを持つことで、メディアの制作をより安価で迅速にできる可能性があります。
現在、AutoFoleyにはいくつかの重大な制限があります。まず、モデルは予測可能な動きを持つイベントでうまく機能しますが、時間の変化(雷雨など)を持つイベントのオーディオを生成する際に苦労します。また、分類対象がクリップ全体に存在し、フレームから外れないことも要求されます。研究チームは、これらの問題を将来のアプリケーションのバージョンで解決することを目指しています。












