Andersonの視点
AI 研究は、ダイアログ、音楽、音効の個別のボリュームコントロールを実現する

三菱電機が主導する新しい研究コラボレーションは、元のオーディオソースから 3 つの個別のサウンドトラックを抽出する可能性を調査し、オーディオトラックをスピーチ、音楽、音効(例:環境ノイズ)に分割しています。
これは事後処理フレームワークであるため、将来のマルチメディアビューワープラットフォーム、消費者機器を含む、3 点のボリュームコントロールを提供する可能性があり、ユーザーがダイアログのボリュームを上げたり、サウンドトラックのボリュームを下げたりすることができます。
以下の研究用のビデオからの短いクリップ(記事の最後にフルビデオを参照)では、ユーザーが三角形のコントロールをドラッグするときに、サウンドトラックのさまざまな側面が強調される様子が見られます。三角形の各角には、3 つのオーディオコンポーネントがあります。
研究用のビデオからの短いクリップ(記事の最後に埋め込まれています)。ユーザーがカーソルを三角形 UI の右側の 3 つの抽出された側面の 1 つに向けてドラッグすると、オーディオはその部分のサウンドトラックを強調します。より長いビデオでは、YouTube にある追加の例が引用されていますが、現在は利用できないようです。 ソース:https://vimeo.com/634073402
論文は The Cocktail Fork Problem:Three-Stem Audio Separation for Real-World Soundtracks というタイトルで、メリーランド州カンブリッジにある三菱電機研究所(MERL)とイリノイ州のインディアナ大学のインテリジェントシステム工学科の研究者によって執筆されています。
サウンドトラックの側面を分離する
研究者は、この課題を「The Cocktail Party Problem」と命名しました。なぜなら、サウンドトラックの激しく絡み合った要素を分離する必要があるからです。これは、フォークに似たロードマップを作成します(以下の画像参照)。実践では、マルチチャンネル(例:ステレオ以上)のサウンドトラックには、ダイアログ、音楽、アンビエンスなどのコンテンツの種類が異なる場合があります。特に、ダイアログは Dolby 5.1 ミックスのセンター チャンネルを支配する傾向があるためです。現在、オーディオ分離の活発な研究分野は、単一の焼き込まれたサウンドトラックからこれらのストランドをキャプチャすることに重点を置いています。これは、現在の研究でも同様です。

The Cocktail Fork – 1 つの統合されたサウンドトラックから 3 つの個別のサウンドトラックを導出する ソース:https://arxiv.org/pdf/2110.09958.pdf
最近の研究は、さまざまな環境でのスピーチの抽出に集中しており、主にスピーチオーディオのノイズ除去のために自然言語処理(NLP)システムと関わる目的で行われています。また、保存された歌唱ボイスの 分離 に対する研究も行われています。つまり、実在の(死んだ)歌手の合成バージョンを作成するか、カラオケスタイルの音楽分離を容易にするためです。
各側面のデータセット
これまで、サウンドトラックのミックスをより制御できるようにするために、この種の AI テクノロジーを使用することについてはほとんど考慮されていませんでした。したがって、研究者は問題を正式化し、多種類のサウンドトラック分離に関する継続的な研究を支援するために、新しいデータセットを作成しました。また、さまざまな既存のオーディオ分離フレームワークをテストしました。
研究者が開発した新しいデータセットは、Divide and Remaster(DnR)と呼ばれています。これは、以前のデータセットである LibriSpeech、Free Music Archive、および Freesound Dataset 50k(FSD50K)から派生しています。DnR を最初から作成したい場合は、3 つのソースからデータセットを再構築する必要があります。さもなければ、すぐに Zenodo で利用できるようになる予定です。ただし、現在、ソース抽出ユーティリティの GitHub リンク はアクティブではありません。したがって、関心がある場合は、しばらく待つ必要があるかもしれません。
研究者は、ソニーが 5 月に提案した CrossNet un-mix (XUMX) アーキテクチャが、特に DnR でうまく機能することを発見しました。

ソニーの CrossNet アーキテクチャ
著者は、YouTube のサウンドトラックで動作するマシンラーニング抽出モデルがうまく機能することを主張しています。ただし、論文で提示された評価は合成データに基づいており、提供された主なサポートビデオ(以下に埋め込まれている)は、現在利用できる唯一のビデオのようです。
3 つのデータセットは、それぞれサウンドトラックから抽出する必要がある出力のコレクションで構成されています。FSD50K は、Google の AudioSet オントロジーから 200 のクラス ラベルでタグ付けされた 50,000 の 44.1 kHz モノオーディオ クリップで構成されています。Free Music Archive には、161 の音楽ジャンルにわたる 100,000 のステレオ ソングが含まれています。ただし、著者は FSD50K と同じ 25,000 ソングのサブセットを使用しています。LibriSpeech では、DnR に 44.1 kHz の mp3 オーディオ ファイルとして 100 時間のオーディオ ブック サンプルを提供します。
将来の研究
著者は、データセットと追加のスピーチ認識および音分類フレームワークに関する研究に開発された個別のモデルを組み合わせるためのさらなる研究を予想しています。さらに、自動キャプション生成を備えたスピーチおよび非スピーチ音を特徴とする可能性を評価する予定です。また、知覚されるアーティファクトを削減できるリミックスアプローチの可能性を評価することも予定しています。これは、統合されたオーディオ サウンドトラックをその構成要素に分割する際の中心的な問題です。
将来、この種の分離は、高度に最適化された推論ネットワークを統合するスマート TV として消費者向けに利用可能になる可能性があります。ただし、初期の実装では、事前処理時間とストレージ容量が必要になる可能性があります。サムスンはすでに、ローカル ニューラル ネットワークを使用してアップスケーリングを行っています。ソニーの Cognitive Processor XR は、同社の Bravia シリーズで使用されており、分析および解釈 を実行し、軽量な統合 AI を介してリアルタイムでサウンドトラックを再解釈します。
サウンドトラックのミックスをより制御できるようにするための要望は、定期的に繰り返されています。ほとんどの 解決策 は、サウンドトラックがすでに映画やテレビ業界の現在の標準(および視聴者が何を望むかについての仮定)に従ってバウンドダウンされているという事実に対処する必要があります。
映画のサウンドトラックのさまざまな要素のボリューム レベルが驚くほど不均衡であることに悩まされた視聴者は、ハードウェア ベースの自動ボリューム調整器 を開発するほど絶望的になりました。この調整器は、ボリュームを均等化 して映画やテレビ番組を視聴することができます。
スマート TV では、ダイアログのボリュームを大きな音楽のボリュームに対して上げるための さまざまな方法 が提供されています。ただし、これらはすべて、ミックス時に行われた決定と、オーディオをそのまま設定した状態で聴取者に体験してもらうことを望むコンテンツ プロデューサーのビジョンに抵抗しています。
コンテンツ プロデューサーは、デフォルトの事後処理 TV ベースのアルゴリズムである モーション スムージング に対して不満を表明している業界の著名人もいるため、この「リミックス文化」への潜在的な追加に対して反発する可能性が高いと思われます。
https://vimeo.com/634073402












