AIモデルとプラットフォーム
StyleTTS 2: 人間レベルのテキストからスピーチ合成を実現する大規模なスピーチ言語モデル
自然なスピーチ合成と人工的なスピーチ合成のアプローチの進歩により、AI 業界が過去 few 年間で達成した主な成果の 1 つは、テキストからスピーチのフレームワークを効果的に合成することです。これは、オーディオブック、仮想アシスタント、声優ナレーションなど、さまざまな業界で応用できます。さらに、一部の最先端モデルは、広範なスピーチ関連タスクで人間レベルのパフォーマンスと効率性を実現しています。ただし、強力なパフォーマンスにもかかわらず、表現力のあるスピーチ、ゼロショット テキストからスピーチ フレームワークの最適化に大量のトレーニング データが必要であること、そして OOD (Out of Distribution) テキストやロバスト性の向上の必要性から、開発者はよりロバストでアクセスしやすいテキストからスピーチ フレームワークの開発に取り組んでいます。
この記事では、StyleTTS-2 というテキストからスピーチ フレームワークについて説明します。StyleTTS-2 は、StyleTTS フレームワークの基礎に築かれた革新的なテキストからスピーチ フレームワークであり、最先端のテキストからスピーチ システムの次のステップを提案します。StyleTTS2 フレームワークは、スピーチ スタイルを潜在的なランダム変数としてモデル化し、確率論的拡散モデルを使用してこれらのスピーチ スタイルまたはランダム変数をサンプリングします。したがって、StyleTTS2 フレームワークは、リファレンス オーディオ入力なしで現実的なスピーチを効果的に合成できます。アプローチにより、StyleTTS2 フレームワークは、現在の最先端のテキストからスピーチ フレームワークと比較して優れた結果を達成し、高い効率性を示します。また、拡散モデル フレームワークによって提供される多様なスピーチ合成の利点も利用できます。StyleTTS2 フレームワークの詳細について説明し、そのアーキテクチャと方法論について説明し、結果についても見ていきましょう。では、始めましょう。
StyleTTS2 を使用したテキストからスピーチの合成: はじめに
StyleTTS2 は、人間レベルの TTS フレームワークを構築するための次のステップを踏み出す革新的なテキストからスピーチの合成モデルです。StyleTTS2 は、StyleTTS に基づいて構築されています。StyleTTS は、スピーチ生成モデル です。StyleTTS2 フレームワークは、スピーチ スタイルを潜在的なランダム変数としてモデル化し、確率論的拡散モデルを使用してこれらのスピーチ スタイルまたはランダム変数をサンプリングします。したがって、StyleTTS2 フレームワークは、リファレンス オーディオ入力なしで現実的なスピーチを効果的に合成できます。StyleTTS フレームワークと StyleTTS2 フレームワークの主な違いは、スピーチ スタイルを潜在的なランダム変数としてモデル化することです。入力テキストに最も適したスピーチ スタイルを生成することを目指しています。リファレンス オーディオ入力は不要です。また、拡散モデル の利点を活かし、効果的な潜在的な拡散を実現しながら、多様なスピーチ合成能力を利用できます。さらに、StyleTTS2 フレームワークは、WavLM フレームワークなどの事前トレーニング済みの大規模な SLM (スピーチ言語モデル) をディスクリミネーターとして使用し、独自の新しい微分可能な期間モデリング アプローチと組み合わせて、エンドツーエンドのトレーニング プロセスでフレームワークをトレーニングし、最終的に自然なスピーチを生成します。アプローチにより、StyleTTS2 フレームワークは、スピーチ生成タスクで現在の最先端のフレームワークを上回り、スピーカー適応タスクのゼロショット設定での大規模なスピーチモデルの事前トレーニングに最も効率的なフレームワークの 1 つになります。
次に、人間レベルのテキストからスピーチの合成を実現するために、StyleTTs2 フレームワークは、既存の研究成果を取り入れています。拡散モデルは、スピーチ合成タスクで使用されます。なぜなら、拡散モデルは、スピーチを微妙に制御し、多様なスピーチ サンプルを生成する能力があるからです。ただし、拡散モデルは、GAN ベースの非イテラティブ フレームワークほど効率的ではありません。主な理由は、目標の期間までイテラティブに潜在的な表現、波形、メル スペクトログラムをサンプリングする必要があるためです。
一方で、大規模なスピーチ言語モデルの最近の研究は、テキストからスピーチの生成タスクの品質を向上させる能力を示しています。また、スピーカーに適応する能力もあります。大規模なスピーチ言語モデルは、通常、テキスト入力を事前トレーニング済みのスピーチ言語フレームワークから派生した量子化または連続的な表現に変換して、スピーチ再構築タスクを実行します。ただし、これらのスピーチ言語モデルの機能は、直接スピーチ合成に最適化されていません。対照的に、StyleTTS2 フレームワークは、大規模な SLM フレームワークから得られた知識を利用して、潜在的な空間マップを使用せずに、スピーチ言語モデルの機能を生成します。したがって、スピーチ合成の最適化された潜在的な空間を直接学習します。
StyleTTS2: アーキテクチャと方法論
StyleTTS2 の核心は、StyleTTS フレームワークに基づいて構築されています。StyleTTS は、リファレンス オーディオからスタイル ベクトルを導出するスタイル エンコーダーを使用する非自律的なテキストからスピーチ フレームワークです。StyleTTS フレームワークのスタイル ベクトルは、Adaptive Instance Normalization (AdaIN) を使用してエンコーダー、期間、予測器に直接組み込まれています。したがって、StyleTTS モデルは、プロソディ、期間、感情が異なるスピーチ出力を生成できます。StyleTTS フレームワークは、全部で 8 つのモデルで構成されており、3 つのカテゴリに分類されます。
- 音響モデルまたはスピーチ生成システム (スタイル エンコーダー、テキスト エンコーダー、スピーチ デコーダーを含む)。
- テキストからスピーチの予測システム (プロソディと期間予測器を使用)。
- ユーティリティ システム (テキスト アライナー、ピッチ抽出器、トレーニング用のディスクリミネーターを含む)。
アプローチにより、StyleTTS フレームワークは、制御可能なスピーチ合成と多様なスピーチ合成に関して最先端のパフォーマンスを提供します。ただし、このパフォーマンスには、サンプルの品質の低下、表現力の制限、リアルタイムでのスピーチ妨害アプリケーションの依存などの欠点があります。
StyleTTS フレームワークを改良した StyleTTS2 モデルは、表現力のあるテキストからスピーチのタスクを向上させ、外部分布のパフォーマンスを向上させ、人間レベルの品質を高めています。StyleTTS2 フレームワークは、エンドツーエンドのトレーニング プロセスを使用して、さまざまなコンポーネントを対抗的なトレーニングで直接波形合成とともに最適化します。StyleTTS フレームワークと異なり、StyleTTS2 フレームワークは、スピーチ スタイルを潜在的な変数としてモデル化し、拡散モデルを使用してこれをサンプリングします。したがって、リファレンス オーディオを使用せずに多様なスピーチ サンプルを生成できます。詳細を見てみましょう。
干渉のためのエンドツーエンド トレーニング
StyleTTS2 フレームワークでは、固定コンポーネントに依存せずに、テキストからスピーチのコンポーネントを最適化するために、エンドツーエンドのトレーニング アプローチが使用されます。StyleTTS2 フレームワークは、スタイル ベクトル、ピッチ、エネルギー曲線、同期された表現から直接波形を生成するようにデコーダーを変更してこれを実現します。次に、デコーダーの最後の投影層を削除し、波形デコーダーに置き換えます。StyleTTS2 フレームワークは、2 つのエンコーダーを使用します。HifiGAN ベースのデコーダーは波形を直接生成し、iSTFT ベースのデコーダーは、より高速な干渉とトレーニングのために波形に変換される位相と大きさを生成します。

上の図は、事前トレーニングとジョイント トレーニングに使用される音響モデルを表しています。トレーニング時間を短縮するために、モジュールは事前トレーニング段階で最初に最適化され、ジョイント トレーニングではピッチ抽出器を除くすべてのコンポーネントが最適化されます。ジョイント トレーニングでピッチ抽出器を最適化しない理由は、ピッチ曲線のグラウンド トゥルースを提供するためです。

上の図は、WavLM フレームワークを使用したスピーチ言語モデルの対抗的なトレーニングと干渉を表しています。プロセスは、事前トレーニング済みだがファインチューニングされていない WavLM フレームワークを使用して、バッチごとにパラメータを更新するためにグラデーションを蓄積することです。
スタイル拡散
StyleTTS2 フレームワークは、スピーチを条件付き分布としてモデル化することを目的とし、潜在的な変数を条件付き分布として使用します。これは、一般化されたスピーチ スタイルと呼ばれ、音素コンテンツの範囲を超えたスピーチ サンプルの任意の特性を表します。レクシカル ストレス、プロソディ、話し手の速度、フォルマント遷移などです。
スピーチ言語モデル ディスクリミネーター
スピーチ言語モデルは、広範なセマンティクスと音響的側面に関する貴重な情報をエンコードする能力で知られています。SLM 表現は、人間の認識を模倣して生成された合成スピーチの品質を評価するために従来使用されてきました。StyleTTS2 フレームワークは、スピーチ生成タスクを実行するために SLM エンコーダーの能力を利用するために、対抗的なトレーニング アプローチを使用し、12 層の WavLM フレームワークをディスクリミネーターとして使用します。このアプローチにより、フレームワークは OOD テキスト (Out of Distribution) のトレーニングを可能にし、パフォーマンスを向上させることができます。さらに、オーバーフィッティングの問題を防ぐために、フレームワークは OOD テキストとインディストリビューション テキストを等しい確率でサンプリングします。
微分可能な期間モデリング
従来、テキストからスピーチのフレームワークでは、音素期間を生成する期間予測器が使用されます。ただし、期間予測器が使用するアップサンプリング方法は、E2E トレーニング プロセス中にグラデーションのフローをブロックすることが多く、NaturalSpeech フレームワークでは、アテンションベースのアップサンプラーを使用して人間レベルのテキストからスピーチの変換を実現します。ただし、StyleTTS2 フレームワークは、このアプローチが対抗的なトレーニング中に不安定であると判断し、対抗的なトレーニングなしで微分可能なアップサンプリングを使用します。ソフト ダイナミック タイム ワーピング アプローチを使用すると、長さの不一致によるミスマッチを軽減できますが、計算コストが高く、メル再構築タスクや対抗的な目的で使用する安定性は懸念されます。したがって、人間レベルのパフォーマンスを実現し、トレーニング プロセスを安定させるために、StyleTTC2 フレームワークは非パラメトリックなアップサンプリング アプローチを使用します。ガウシアン アップサンプリングは、予測期間を変換するために使用される非パラメトリックなアップサンプリング アプローチですが、ガウシアン カーネルの固定長の制限により、さまざまな長さのアライメントを正確にモデル化する能力が制限されます。
この制限に対処するために、StyleTTC2 フレームワークは、追加のトレーニングなしで、さまざまな長さのアライメントを考慮できる新しい非パラメトリックなアップサンプリング アプローチを提案します。各音素について、StyleTTC2 フレームワークは、アライメントをランダム変数としてモデル化し、スピーチ フレームと音素がアライメントするインデックスを示します。
モデル トレーニングと評価
StyleTTC2 フレームワークは、VCTK、LibriTTS、LJSpeech の 3 つのデータセットでトレーニングおよび実験されています。StyleTTS2 フレームワークのシングル スピーカー コンポーネントは、約 13,000 個のオーディオ サンプル (12,500 個のトレーニング サンプル、100 個のバリデーション サンプル、約 500 個のテスト サンプル) で構成される LJSpeech データセットでトレーニングされます。合計実行時間は約 24 時間です。StyleTTS2 フレームワークのマルチ スピーカー コンポーネントは、100 人以上のネイティブ スピーカー (さまざまなアクセント) を含む約 44,000 個のオーディオ クリップで構成される VCTK データセットでトレーニングされます。データセットは、43,500 個のトレーニング サンプル、100 個のバリデーション サンプル、約 500 個のテスト サンプルに分割されます。最後に、ゼロショット適応機能をフレームワークに備えるために、合計約 250 時間のオーディオ クリップ (1,150 人以上のスピーカー) で構成される LibriTTS データセットでトレーニングされます。パフォーマンスを評価するために、モデルは 2 つのメトリックを使用します。MOS-N (自然さの平均意見スコア) と MOS-S (類似性の平均意見スコア) です。MOS-NまたはMOS-S。

結果
StyleTTS2 フレームワークのアプローチと方法論は、そのパフォーマンスに示されています。モデルは、NaturalSpeech データセットでいくつかの最先端の TTS フレームワークを上回り、データセットの新しい基準を設定します。さらに、StyleTTS2 フレームワークは、VCTK データセットで最先端の VITS フレームワークを上回り、結果は次の図に示されています。

StyleTTS2 モデルは、LJSpeech データセットでも以前のモデルを上回り、以前のフレームワークが示したような OOD テキストまたは外部分布テキストでの品質の低下は表示されません。さらに、ゼロショット設定では、StyleTTC2 モデルは自然さでは既存の Vall-E フレームワークを上回り、類似性では後ろに続きます。ただし、StyleTTS2 フレームワークは、Vall-E フレームワークの 60,000 時間のトレーニングに比べて、わずか 245 時間のオーディオ サンプルでトレーニングされたにもかかわらず、競合するパフォーマンスを達成することが注目に値するため、StyleTTC2 は、既存の大規模な事前トレーニング方法の代替手段としてデータ効率が高いことを証明しています。

さらに、感情ラベル付きオーディオ テキスト データが不足しているため、StyleTTC2 フレームワークは、GPT-4 モデルを使用して、さまざまな感情に対して 500 個以上のインスタンスを生成し、フレームワークが拡散プロセスを使用して生成するスタイル ベクトルの視覚化を行います。

最初の図では、入力テキストの感情に対する感情的なスタイルが、LJSpeech モデルからのスタイル ベクトルによって示されており、StyleTTC2 フレームワークが感情の異なるスピーチを合成する能力を示しています。2 番目の図では、5 人の個別のスピーカーに対して異なるクラスターが形成され、1 つのオーディオ ファイルから得られる多様性の範囲を示しています。最後の図では、スピーカー 1 の感情の緩いクラスターが示されており、感情ベースのクラスターが目立つものの、一部の重複があること、およびリファレンス オーディオ サンプルや入力トーンに関係なく、スピーカーの感情的な調子を操作する可能性があることを示しています。拡散ベースのアプローチを使用しているにもかかわらず、StyleTTS2 フレームワークは、VITS、ProDiff、FastDiff を含む既存の最先端のフレームワークを上回ります。

最終的な考え
この記事では、StyleTTS2 という革新的なテキストからスピーチのフレームワークについて説明しました。StyleTTS2 は、StyleTTS フレームワークの基礎に築かれた、次のステップの最先端のテキストからスピーチ システムを目指しています。StyleTTS2 フレームワークは、スピーチ スタイルを潜在的なランダム変数としてモデル化し、確率論的拡散モデルを使用してこれらのスピーチ スタイルまたはランダム変数をサンプリングします。したがって、StyleTTS2 フレームワークは、リファレンス オーディオ入力なしで現実的なスピーチを効果的に合成できます。StyleTTS2 フレームワークは、スタイル拡散と SLM ディスクリミネーターを使用して、テキストからスピーチのタスクで人間レベルのパフォーマンスを達成し、広範なスピーチタスクで既存の最先端のフレームワークを上回ります。












