AIモデルとプラットフォーム
研究者が中国語と英語で歌うことができるAIモデルを開発
マイクロソフトと浙江大学の研究者チームは最近、多言語で歌うことができるAIモデルを開発しました。 VentureBeatによると、チームが開発したDeepSinger AIは、さまざまな音楽ウェブサイトからのデータでトレーニングされ、歌手の声の音色を捉えるアルゴリズムを使用しました。
AIシンガーの「声」を生成するには、音の高さと長さを予測して制御することができるアルゴリズムが必要です。人間が歌うときに生み出す音は、単純な会話よりもはるかに複雑なリズムとパターンを持っています。チームが克服しなければならなかった別の問題は、話し言葉のトレーニングデータセットは豊富に存在しますが、歌のトレーニングデータセットは比較的少ないということです。これらの課題に加えて、歌には音と歌詞の両方を分析する必要があり、歌の生成は非常に複雑な問題です。
研究者が開発したDeepSingerシステムは、オーディオデータをマイニングして変換するデータパイプラインを開発することで、これらの課題を克服しました。音楽ウェブサイトからの歌のクリップが抽出され、歌はオーディオの他の部分から分離されて文に分割されました。次のステップは、歌詞の中の各音素の長さを決定することで、各音素を表す一連のサンプルが生成されました。歌詞とオーディオサンプルが信頼度スコアに従って整理された後、歪んだトレーニングサンプルを処理するためにデータのクリーンアップが行われました。
同じ方法がさまざまな言語で機能するようです。DeepSingerは、89人の歌手が92時間以上にわたって歌った中国語、広東語、英語のボーカルサンプルでトレーニングされました。研究の結果、DeepSingerシステムは、音の高さの正確さや歌の自然さなどのメトリックに従って、高品質の「歌」のサンプルを信頼性高く生成することができました。研究者は20人に、DeepSingerによって生成された歌とトレーニング曲をこれらのメトリックに従って評価してもらい、生成されたサンプルと本物のオーディオのスコアの差はかなり小さかったことがわかりました。参加者はDeepSingerに、平均的な意見スコアを0.34から0.76の範囲で付けてしました。
今後、研究者は、WaveNetなどの特殊なテクノロジーの支援を受けて、DeepSingerを構成するさまざまなサブモデルを共同でトレーニングすることで、生成された声の品質を向上させたいと考えています。これは、オーディオ波形を介して自然に聞こえるスピーチを生成するために特別に設計されたテクノロジーです。
DeepSingerシステムは、歌手や他の音楽アーティストがスタジオに戻って再レコーディングすることなく、作品の修正を支援するために使用できます。また、歌手が実際に歌っていない歌を歌ったように聞こえるオーディオディープフェイクを作成するために使用することもできます。パロディーや風刺のために使用することができますが、法的にも疑問があります。
DeepSingerは、音楽とオーディオのやり取りを変える可能性のある、新しいAIベースの音楽とオーディオシステムの波の一部です。OpenAIは、特定のジャンルやアーティストのスタイルでオリジナルの音楽トラックを生成することができる、JukeBoxと呼ばれるAIシステムを最近リリースしました。他の音楽AIツールには、GoogleのMagentaとAmazonのDeepComposer (AMZN ) があります。Magentaは、自動化されたドラムのバックトラックから音楽ベースのビデオゲームまで、すべてを生成することができるオープンソースのオーディオ(および画像)操作ライブラリです。AmazonのDeepComposerは、事前にトレーニングされたサンプルモデルを取り込み、ユーザーがモデルを必要なように調整できるように設計されています。DeepComposerは、音楽ベースのディープラーニングモデルをトレーニングしてカスタマイズしたい人を対象としています。
(GOOGL )DeepSingerによって生成されたオーディオサンプルの一部を、こちらのリンクで聞くことができます。












