AI 模型与平台

HierSpeech++ : 层次变分推理用于零样本语音合成

mm
将 Unite.AI 添加到您在 Google 上的首选来源

最近在大型语言模型的能力方面的发展和进步在LLM-based框架的音频生成和语音合成任务方面,尤其是在零样本设置中发挥了至关重要的作用。传统的语音合成框架通过集成额外的功能,如神经音频编解码器,用于离散音频和语音单元,已经取得了显著的进步。尽管这些语音和音频合成框架能够提供令人满意的结果,但仍然存在改进的空间,因为当前的LLM-based音频框架具有以下三个主要限制

  1. 它们倾向于自动生成音频输出,最终导致缺乏鲁棒性和慢的干扰速度,并导致发音错误、跳过或重复。
  2. 它们倾向于过度依赖离散语音单元或预训练的神经音频编解码器。
  3. 它们通常需要大量的训练数据。

为了解决上述问题,并提高LLM-based音频和语音合成模型的能力,开发人员提出了HierSpeech++,一种强大且高效的零样本语音合成器,用于语音和文本到语音(TTS)转换。HierSpeech++框架建立在层次语音合成框架的基础上,不仅提高了合成语音输出的鲁棒性,还增加了合成语音输出的表达性,同时提高了合成语音的自然性和与真实语音的相似度,即使在零样本设置中。

在本文中,我们将详细讨论HierSpeech++框架,并研究模型的架构、工作原理和结果,与最先进的文本和音频生成模型进行比较。因此,让我们开始。

HierSpeech++ : 层次变分推理用于零样本语音合成

HierSpeech++是一种快速、鲁棒且高效的零样本语音合成框架,使用层次语音合成管道,并通过采用这种端到端的语音合成框架,HierSpeech++模型能够最大限度地发挥高质量波形生成的潜力,以层次方式弥合语义和声学表示之间的差距,采用自监督语音表示作为语义语音表示,并试图解决当前风格适应的局限性。端到端语音合成框架首先由VITS模型引入,它采用了增强型对抗训练和正则化流的VAE或变分自编码器。另外,具有端到端训练管道的VAE-based框架能够生成高质量的波形音频,其感知语音合成质量明显优于其他语音合成框架。

这些框架的音频重构质量可以通过使用HierSpeech框架中使用的层次条件变分自编码器进一步增强。尽管它们具有潜力,但基于端到端训练管道的模型在零样本设置中具有某些限制,尤其是即使它们可以合成具有高质量音频的语音样本,但零样本语音克隆任务中的说话人相似度仍然存在高计算复杂度。另一方面,扩散基于语音合成模型在说话人适应方面表现良好,但它们仍然不完美,因为它们使用交互式生成过程,这减慢了其推理速度,它们通常容易受到噪声数据的影响,并且由于两阶段生成过程之间的Mel-谱图和生成的真实音频之间的不匹配,音频质量不佳。

为了解决其前身面临的问题,HierSpeech++模型采用层次语音合成器、语音超分辨率和文本到向量组件,并引入了改进的层次语音合成器,建立在层次条件变分自编码器上。为了提高音频质量超越感知质量,HierSpeech++框架采用双音频来增强声学后验,并通过采用具有条件和无条件生成的层次自适应生成器来增强分布外泛化。此外,为了分离语音组件并增强说话人相关和说话人非相关语义信息,HierSpeech++框架还采用了基于源过滤器理论的多路径语义编码器。由于采用了变分自编码器,HierSpeech++模型可以连接和学习表示层次,并逐渐适应目标语音风格以推断波形音频。另外,HierSpeech++框架还部署了一个双向网络的正则化流变换器,尝试增强适应性,并减少训练和推理之间的不匹配。

总体而言,HierSpeech++模型是一种全并行、全新的层次语音合成框架,旨在零样本设置中合成语音样本,并试图做出以下贡献

  • 使用层次语音合成框架来控制和转移语音风格和语调。
  • 实现数据可扩展性和高分辨率语音合成,通过将波形音频从16 kHz升采样到48 kHz。
  • 在零样本语音转换和文本到语音任务中实现人类级别的能力。

HierSpeech++ : 模型组件和架构

如前所述,HierSpeech++是一种零样本语音合成模型,旨在实现人类级别的准确性,尤其是在语音相似度和语音自然性方面。

HierSpeech++模型由多个组件组成,包括层次语音合成器、语音超分辨率和文本到向量,共同工作以促进每个模型的训练,可以有效地利用大量低分辨率语音数据进行语音克隆。让我们分解框架,并讨论每个组件。

语音表示

由于人类的频率带在4 kHz以下,因此对于语音合成,HierSpeech++框架将音频下采样到16 kHz。此外,为了重构语音信号,使用至少两倍于最高语音频率的采样率是至关重要的。为了获得增强的感知质量,HierSpeech++框架使用语音超分辨率或SpeechSR组件,将音频样本从16 kHz升采样到48 kHz,并使用低分辨率表示进行语义和声学表示。

对于声学表示,传统的文本到语音或TTS框架使用Mel-谱图作为其中间声学特征,然后使用STFT或短时傅里叶变换将其从波形转换而来。然而,值得注意的是,声学特征是丰富的表示,包括各种属性,包括内容和发音、语音信息等,这使得框架难以推断这些表示,常常导致发音错误、缺乏相似度或语音过度平滑。

继续讨论,为了从波形中提取连续的语义表示,HierSpeech++框架使用Wav2Vec框架,而不是流行的自监督语音表示方法,用于语义表示。虽然这种方法对于丰富的单语言模型来说是一个很好的替代方案,但它会影响模型在多语言语音合成任务中的零样本语音克隆能力,尤其是在鲁棒性和表达性方面。

层次语音合成器

层次语音合成器组件是HierSpeech++框架的基础,因为它允许在不使用任何标签(如文本转录或说话人ID)的情况下训练模块,并仅依赖语音数据。为了增加声学容量,之前的最先进的语音合成模型用线性谱图替换了Mel-谱图,但是这种方法最小化了pitch周期性、PESQ、语音和非语音评分以及Mel-谱图距离。层次语音合成器采用双音频声学编码器来解决使用线性谱图的挑战,旨在捕获更丰富和更全面的声学表示。框架还采用波形编码器来从原始波形音频中提取信息,并将其与线性谱图表示连接起来,最后将声学表示投影为连接表示。

此外,为了处理说话人非相关和说话人相关的语义表示,HierSpeech++框架使用多路径自监督语音表示,其中每个表示用于层次风格适应,语义表示从MMS的中间层中提取以获得语言信息。框架还使用基本频率来增强语音分离,使得可以手动控制音调轮廓。框架还使用语言表示作为条件信息来层次生成波形音频,并使用增强的语言表示自监督表示。值得注意的是,训练期间使用波形和线性谱图提取的声学表示用于重构原始波形音频,并使用层次变分推理将声学表示与多路径语言表示连接起来。框架还采用层次自适应生成器(HAG)来生成语义到波形样本,并生成的表示(包括风格表示和声学表示)被馈送到源和波形生成器。

文本到向量

对于文本到语音合成,HierSpeech++框架采用文本到向量或TTV模型,生成文本序列的基本频率和语义表示,并使用单调对齐搜索和变分自编码器将语音和文本内部对齐。然后,HierSpeech++框架用自监督线性表示替换线性谱图,并重构相同的表示作为TTV的输出。

此外,HierSpeech++框架预测基本频率,其分辨率比自监督语音表示高四倍,并使用条件文本表示作为先验信息。由于自监督语音表示的语义信息,框架能够将文本到向量模型中的风格转移,并将潜在表示馈送到音素编码器以增强表示的语言能力。

语音超分辨率或语音超分辨率

HierSpeech++框架在相对低分辨率的数据集上训练,以提高数据效率和可用性,并将低分辨率语音波形从16 kHz升采样到48 kHz。框架还用最近邻上采样器替换了转置卷积,这以前被证明可以缓解转置卷积的伪影。

架构

文本到向量模型的内容编码器由16个非因果WaveNet层组成,核大小为5,隐藏大小为256,而内容解码器由8个非因果WaveNet层组成,核大小为5,隐藏大小为512。文本编码器组件由三个语调条件Transformer网络和三个无条件Transformer网络组成,核大小为9,滤波器大小为1024,隐藏大小为256,文本编码器的dropout率为0.2。为了编码相邻信息并增强语调风格适应,框架采用了具有核大小为5的Transformer块中的CNN。语音超分辨率组件由单个AMP块组成,具有32个初始通道,没有上采样层。框架使用最近邻上采样器来上采样隐藏表示,并使用MPD作为判别器,具有六个不同的窗口大小和四个子带判别器。

上图展示了HierSpeech++框架的推理管道,从16 kHz的音频中提取语义表示,并使用YAPPT算法提取基本频率。在将基本频率馈送到层次合成器之前,使用源音频的标准和均值偏差对其进行归一化,然后使用目标音频的标准和均值偏差对归一化的基本频率进行反归一化。对于文本到语音提取,HierSpeech++框架提取文本表示而不是语音表示,并使用文本到向量模型从语调提示中生成语义表示。

实验和结果

框架使用公开可用的LibriTTS数据集来训练层次合成器组件,第一步是使用数据集的trainclean子集训练模型,并使用剩余的数据来实现语音风格的增强转移。此外,为了提高多样性和鲁棒性,框架将数据集扩大到1 kHz,如下图所示。

重构、重合成任务和语音转换

为了评估HierSpeech++框架在重构和重合成任务上的性能,开发人员进行了七个客观指标的评估,结果如下图所示。

对于语音转换任务,框架使用两个主观指标进行评估:语音相似度MOS(sMOS)和自然性平均意见评分(nMOS),以及三个自然性客观指标和两个相似度客观指标。

继续讨论,HierSpeech++框架的主要目标是实现零样本语音合成,并为了评估其在零样本设置中的性能,将其与其他基线模型(如AutoVC、VoiceMixer、扩散模型等)进行比较,结果如下图所示。

以下图表展示了零样本文本到语音结果,分别使用有噪提示和非常有噪提示。

结论

在本文中,我们讨论了HierSpeech++模型,一种用于零样本语音合成的新颖方法,旨在克服当前语音合成框架的局限性,包括其过度依赖大量训练数据、离散语音单元或预训练的神经音频编解码器,以及其自动生成音频输出的倾向,导致缺乏鲁棒性和慢的干扰速度,并导致发音错误、跳过或重复。HierSpeech++模型是一种全并行、全新的层次语音合成框架,旨在零样本设置中合成语音样本,并试图做出以下贡献

  • 使用层次语音合成框架来控制和转移语音风格和语调。
  • 实现数据可扩展性和高分辨率语音合成,通过将波形音频从16 kHz升采样到48 kHz。
  • 在零样本语音转换和文本到语音任务中实现人类级别的能力。

专业为工程师,心为作家。 Kunal是一名技术作家,对AI和ML有着深厚的热爱和理解,致力于通过其引人入胜和信息丰富的文档来简化这些领域中的复杂概念。