AIモデルとプラットフォーム
HierSpeech++ : 階層型バリアンシャル推論を用いたゼロショット音声合成
最近の言語モデルにおける進歩と大規模言語モデルの能力の向上は、特にゼロショット設定におけるオーディオ生成と音声合成タスクのLLMベースのフレームワークの進歩に重要な役割を果たしています。伝統的な音声合成フレームワークは、ニューラルオーディオコーデックなどの追加機能を統合することで、重大な進歩を遂げました。ただし、これらの音声およびオーディオ合成フレームワークは、現在のLLMベースのオーディオフレームワークには以下の3つの重大な制限があります
- オーディオ出力を自動生成する傾向があり、頑健性の欠如と遅い干渉速度の結果、発音の誤り、スキップ、または繰り返しが発生します。
- 離散的な音声単位または事前トレーニング済みのニューラルオーディオコーデックに過度に依存する傾向があります。
- 大量のトレーニングデータを必要とします。
上記の問題に対処し、LLMベースのオーディオおよび音声合成モデルの能力を向上させるために、開発者はHierSpeech++という堅牢で効率的なゼロショット音声合成器を開発しました。HierSpeech++フレームワークは、階層型音声合成フレームワークの知見に基づいて構築されており、合成音声出力の頑健性と表現力を向上させ、自然さとスピーカーの類似性も向上させます。
この記事では、HierSpeech++フレームワークについて詳細に説明し、モデルのアーキテクチャ、動作、そして最新のテキストとオーディオ生成モデルとの比較結果について見ていきます。では、始めましょう。
HierSpeech++ : 階層型バリアンシャル推論を用いたゼロショット音声合成
HierSpeech++は、階層型音声合成パイプラインを使用する高速、堅牢、効率的なゼロショット音声合成フレームワークです。このエンドツーエンドの音声合成フレームワークを採用することで、HierSpeech++モデルは、高品質の波形生成の潜在能力を最大化し、階層的にセマンティックと音響の表現のギャップを埋め、セマンティック音声表現として自己教師ありの音声表現を採用し、現在のスタイル適応の制限を解決しようとします。
VITSモデルによって最初に導入されたエンドツーエンドの音声合成フレームワークは、VAE(バリアンシャルオートエンコーダー)と正常化フローを組み合わせたアドバーサリアルトレーニングを採用しています。さらに、VAEベースのフレームワークはエンドツーエンドのトレーニングパイプラインを備えており、高品質の波形オーディオを生成する能力があり、他の音声合成フレームワークによって生成されるものよりも感覚的な音声合成品質が大幅に向上しています。
HierSpeech++フレームワークは、階層型条件付きバリアンシャルオートエンコーダーを使用して、エンドツーエンドのトレーニングパイプラインベースのモデルに特有の制限を解消しようとします。HierSpeech++モデルは、ゼロショット設定でスピーカーの類似性が依然として高い計算複雑性に悩まされているにもかかわらず、高品質のオーディオを生成する能力があります。一方、拡散ベースの音声合成モデルはスピーカー適応において良好な結果を示していますが、完璧ではありません。なぜなら、インタラクティブな生成プロセスを使用するため、推論速度が遅く、ノイズに敏感であり、メルスペクトログラムと生成されたグラウンドトゥルースの2段階の生成プロセス間のトレーニングと推論の不一致のため、オーディオ品質が十分ではないからです。
前述の問題に対処するために、HierSpeech++モデルは階層型音声合成器、音声スーパーレゾリューション、テキストからベクトルへの変換コンポーネントを採用し、階層型条件付きバリアンシャルオートエンコーダーを使用した改良された階層型音声合成器を導入します。オーディオ品質を感覚的な品質を超えて向上させるために、HierSpeech++フレームワークはデュアルバイオを採用して音響的ポステリアを強化し、階層型適応ジェネレーターを使用して、条件付きおよび無条件の生成を備えた出現の一般化を強化します。さらに、HierSpeech++フレームワークは、音声コンポーネントを解結合し、スピーカー関連およびスピーカー非依存のセマンティック情報を強化するために、ソースフィルタ理論に基づくマルチパスセマンティックエンコーダーを採用します。
HierSpeech++モデルは、階層型の表現を接続して学習し、ターゲットのボイススタイルに適応して波形オーディオを推論する能力があります。さらに、HierSpeech++フレームワークは、適応を強化し、トレーニングと推論の不一致を減らすために、双方向の正規化フロートランスフォーマーのネットワークを採用します。
全体として、HierSpeech++モデルは、ゼロショット設定で音声サンプルを合成することを目的とした、完全に並列化された新しい階層型音声合成フレームワークであり、以下の貢献を試みています
- 階層型音声合成フレームワークを使用してボイススタイルとプロソディを制御および転送します。
- データのスケーラビリティと高解像度の音声合成を可能にし、波形オーディオを16 kHzから48 kHzにアップサンプリングします。
- ゼロショットボイス変換とテキストから音声へのタスクで人間レベルの能力を達成します。
HierSpeech++ : モデルコンポーネントとアーキテクチャ
HierSpeech++は、ゼロショット音声合成モデルであり、ボイスの類似性と自然さの人間レベルの精度を達成することを目指しています。

HierSpeech++モデルは、階層型音声合成器、音声スーパーレゾリューション、テキストからベクトルへの変換コンポーネントで構成されています。これらのコンポーネントは、ボイスクローニングのために大量の低解像度音声データを効果的に利用できるように、トレーニングのために連携して動作します。フレームワークの詳細を見てみましょう。
音声表現
人間の周波数帯域が4 kHz以下であるため、音声合成のために、HierSpeech++フレームワークは16 kHzでオーディオをダウンサンプリングします。さらに、声信号を再構築するには、最も高い周波数成分の2倍以上の周波数を使用する必要があります。感覚的な品質を向上させるために、HierSpeech++フレームワークは、オーディオサンプルを16 kHzから48 kHzにアップサンプリングするために、音声スーパーレゾリューションコンポーネントを使用します。

伝統的なテキストから音声へのフレームワークでは、メルスペクトログラムを中間の音響特徴として使用し、STFT(短時間フーリエ変換)を使用して波形から変換します。ただし、音響特徴は、コンテンツ、発音、声情報など、多くの属性を含む豊富な表現であるため、フレームワークがこれらの表現を推論することが困難であり、発音の誤り、類似性の欠如、またはスピーチの過度な平滑化につながることがあります。
次に、波形から連続したセマンティック表現を抽出するために、HierSpeech++フレームワークはWav2Vecフレームワークを使用します。Wav2Vecは、セマンティック表現のための自己教師ありの音声表現アプローチの代替として機能しますが、特に多言語音声合成タスクの場合、ゼロショットボイスクローニング能力の頑健性と表現力を損ないます。
階層型音声合成器
階層型音声合成器コンポーネントは、HierSpeech++フレームワークの基礎であり、テキストトランスクリプトやスピーカーIDなどのラベルを使用せずに、音声データのみに依存してモジュールをトレーニングできるようにします。音響能力を高めるために、以前の最先端の音声合成モデルは、メルスペクトログラムを線形スペクトログラムに置き換えました。ただし、このアプローチは、ピッチの周期性、PESQ、声と無声音のスコア、メルスペクトログラム距離などのKLダイバージェンススコアを最小化します。

さらに、スピーカー非依存およびスピーカー依存のセマンティック表現を扱うために、HierSpeech++フレームワークは、マルチパスの自己教師あり音声表現を使用します。各個別の表現は、階層的なスタイル適応のために使用され、セマンティック表現は、言語情報を中間層のMMSから抽出するために使用されます。フレームワークは、ピッチのコンテュアを手動で制御できるように、基本周波数を使用して音声の解結合を処理します。また、階層的な波形オーディオの生成のために、条件付きの言語情報としてリンギュスティック表現を使用します。
テキストからベクトル
テキストから音声への合成のために、HierSpeech++フレームワークは、テキストからベクトルへの変換モデルを使用します。このモデルは、テキストシーケンスから基本周波数とセマンティック表現を生成し、音声とテキストの内部的な整列を実現するために、モノトニック整列検索とバリアンシャルオートエンコーダーを使用します。HierSpeech++フレームワークは、線形スペクトログラムを自己教師ありの線形表現に置き換え、同じ表現を出力として再構築します。

さらに、HierSpeech++フレームワークは、自己教師ありの音声表現のセマンティック情報を使用して、テキストからベクトルへのモデルでプロソディスタイルを転送し、フォノームエンコーダーに潜在的な表現を提供して、表現の言語能力を強化します。
音声スーパーレゾリューション
HierSpeech++フレームワークは、比較的低解像度のデータセットでトレーニングされ、16 kHzから48 kHzまでの低解像度音声波形を高解像度音声波形にアップサンプリングします。フレームワークは、トランスポーズドコンボリューションによって生じるアーティファクトを軽減するために、ニアレストネイバーアップサンプラーでトランスポーズドコンボリューションを置き換えます。

アーキテクチャ
テキストからベクトルへのモデルのコンテンツエンコーダーは、カーネルサイズ5、隠れサイズ256の16個のノンカジュアルWaveNet層で構成されています。テキストエンコーダーコンポーネントは、カーネルサイズ9、フィルターサイズ1024、隠れサイズ256の3つのプロソディー条件付きトランスフォーマーネットワークと3つの無条件トランスフォーマーネットワークで構成されています。テキストエンコーダーには、ドロップアウト率0.2が設定されています。Prosodyスタイル適応を強化し、隣接情報を符号化するために、トランスフォーマーブロックではカーネルサイズ5のCNNを採用します。音声スーパーレゾリューションは、32個の初期チャンネルを備えた単一のAMPブロックで構成されており、UPSAMPLINGレイヤーはありません。フレームワークは、隠れ表現をアップサンプリングするためにニアレストネイバーアップサンプラーを使用し、6つの異なるウィンドウサイズと4つのサブバンドディスクリミネーターを備えたMPDをディスクリミネーターとして使用します。

上記の図は、HierSpeech++フレームワークの推論パイプラインを示しています。16 kHzの周波数とYAPPTアルゴリズムを使用して音声からセマンティック表現を抽出します。基本周波数は、ソースオーディオの標準偏差と平均偏差を使用して正規化され、正規化された基本周波数は、ターゲットオーディオの標準偏差と平均偏差を使用して非正規化されます。テキストから音声への抽出の場合、HierSpeech++フレームワークは、テキストからベクトルへのモデルを使用して、プロソディープロンプトからセマンティック表現を生成します。
実験と結果
HierSpeech++フレームワークは、LibriTTSデータセットを使用して階層型音声合成器コンポーネントをトレーニングし、最初のステップとして、データセットのトレーニング用サブセットを使用してモデルをトレーニングし、残りのデータを使用してボイススタイルの転送を強化します。さらに、多様性と頑健性を向上させるために、フレームワークはデータセットを1 kHzにアップスケールします。

再構築、再合成タスク、ボイス変換
HierSpeech++フレームワークの再構築と再合成タスクの性能を評価するために、開発者は7つの客観的な指標を実施し、結果は以下の図に示されています。


ボイス変換タスクの場合、フレームワークは、ボイスの類似性MOS(sMOS)と自然さの平均意見スコア(nMOS)の2つの主観的な指標を使用して評価します。さらに、3つの自然さの客観的な指標と2つの類似性の客観的な指標を使用します。

HierSpeech++フレームワークの主な目的は、ゼロショット音声合成を可能にすることです。ゼロショットでの性能を評価するために、AutoVC、VoiceMixer、拡散ベースのモデルなどのベースモデルと比較します。結果は以下の図に示されています。

以下の図は、ノイズのあるプロンプトと非常にノイズのあるプロンプトでのゼロショットテキストから音声への結果を示しています。


最終的な考え
この記事では、HierSpeech++モデルについて説明しました。HierSpeech++モデルは、ゼロショット設定で堅牢で効果的な音声合成を可能にするための新しいアプローチであり、現在の音声合成フレームワークの制限を克服することを目指しています。HierSpeech++モデルは、ゼロショット設定で音声サンプルを合成することを目的とした、完全に並列化された新しい階層型音声合成フレームワークであり、以下の貢献を試みています
- 階層型音声合成フレームワークを使用してボイススタイルとプロソディを制御および転送します。
- データのスケーラビリティと高解像度の音声合成を可能にし、波形オーディオを16 kHzから48 kHzにアップサンプリングします。
- ゼロショットボイス変換とテキストから音声へのタスクで人間レベルの能力を達成します。












