AI 모델 및 플랫폼
StyleTTS 2: 인간 수준의 텍스트 음성 합성
최근 몇 년 동안 AI 산업이 달성한 주요 성과 중 하나는 다양한 산업에서 적용할 수 있는 오디오북, 가상 어시스턴트, 음성 내레이션 등에 잠재적인 응용 프로그램을 갖춘 텍스트 음성 프레임워크를 효과적으로 합성하는 것입니다. 일부 최첨단 모델은 광범위한 음성 관련 작업에서 인간 수준의 성능과 효율성을 제공합니다. 그러나 강력한 성능에도 불구하고, 표현적이고 다양한 음성, 제로샷 텍스트 음성 프레임워크를 최적화하기 위한大量의 훈련 데이터 요구, OOD(Out of Distribution) 텍스트에 대한 강건성 등에서 개선의 여지가 있습니다.
이 기사에서는 StyleTTS-2라는 강력하고 혁신적인 텍스트 음성 프레임워크에 대해 이야기하겠습니다. StyleTTS-2는 StyleTTS 프레임워크의 기초 위에 구축되었으며, 최첨단 텍스트 음성 시스템의 다음 단계를 제시합니다. StyleTTS2 프레임워크는 음성 스타일을 잠재적인 랜덤 변수로 모델링하고 확률론적 확산 모델을 사용하여 이러한 음성 스타일 또는 랜덤 변수를 샘플링하여 참조 오디오 입력 없이 현실적인 음성을 합성할 수 있습니다. StyleTTS2 프레임워크는 현재 최첨단 텍스트 음성 프레임워크보다 더 나은 결과를 제공하며, 확산 모델 프레임워크에서 제공하는 다양한 음성 합성의 이점도 활용할 수 있습니다.
StyleTTS2를 위한 텍스트 음성 합성: 소개
StyleTTS2는 인간 수준의 TTS 프레임워크를 구축하기 위한 다음 단계를 나타내는 혁신적인 텍스트 음성 합성 모델입니다. StyleTTS2는 StyleTTS 프레임워크 위에 구축되었으며, 음성 스타일을 잠재적인 랜덤 변수로 모델링하고 확률론적 확산 모델을 사용하여 이러한 음성 스타일 또는 랜덤 변수를 샘플링하여 참조 오디오 입력 없이 현실적인 음성을 합성할 수 있습니다. StyleTTS2 프레임워크는 또한 확산 모델의 다양한 음성 합성 능력을 활용하여 효과적인 잠재적인 확산을 달성합니다.
StyleTTS2 프레임워크는 기존 연구에서 학습한 내용을 통합하여 인간 수준의 텍스트 음성 합성을 제공합니다. 확산 모델은 음성 합성 작업에서 미세한 음성 제어와 다양한 음성 샘플링 능력으로 인해 일반적으로 사용됩니다. 그러나 확산 모델은 GAN 기반의 비반복적 프레임워크만큼 효율적이지 않습니다. 주요 이유는 목표 기간까지 반복적으로 잠재적인 표현, 波形, 및 멜-스펙트로그램을 샘플링해야 하기 때문입니다.
최근의 연구에서는 대규모 음성 언어 모델이 텍스트 음성 생성 작업의 품질을 향상시키고 스피커에 잘 적응할 수 있음을 보여주었습니다. 대규모 음성 언어 모델은 일반적으로 텍스트 입력을 사전 훈련된 음성 언어 프레임워크에서 파생된 정량화 또는 연속적인 표현으로 변환하여 음성 재구성 작업을 위해 사용합니다. 그러나 이러한 음성 언어 모델의 특징은 직접 음성 합성에 최적화되어 있지 않습니다. StyleTTS2 프레임워크는 대규모 SLM 프레임워크에서 얻은 지식을 활용하여 적대적 훈련을 사용하여 음성 언어 모델의 특징을 합성하고, 잠재적인 공간 맵을 사용하지 않으므로 음성 합성을 최적화한 잠재적인 공간을 직접 학습할 수 있습니다.
StyleTTS2: 아키텍처 및 방법론
StyleTTS2의 핵심은 StyleTTS 프레임워크 위에 구축되었으며, 비자율적인 텍스트 음성 프레임워크입니다. StyleTTS 프레임워크는 참조 오디오에서 스타일 벡터를 파생하기 위한 스타일 인코더를 사용합니다. StyleTTS2 프레임워크는 음성 스타일을 잠재적인 랜덤 변수로 모델링하고 확률론적 확산 모델을 사용하여 이러한 음성 스타일 또는 랜덤 변수를 샘플링하여 참조 오디오 입력 없이 현실적인 음성을 합성할 수 있습니다.
- 음성 생성 시스템 또는 음성 디코더, 스타일 인코더, 텍스트 인코더를 사용하는 음성 생성 시스템.
- Prosody 및 기간 예측기를 사용하는 텍스트 음성 예측 시스템.
- 텍스트 정렬기, 피치 추출기, 훈련 목적으로 사용되는 판별기를 포함하는 유틸리티 시스템.
StyleTTS2 프레임워크는 이러한 구성 요소를 사용하여 인간 수준의 음성 합성을 제공합니다. 그러나 이러한 성능에도 불구하고, 샘플 품질의 저하, 표현의 제한, 실시간 음성 합성에 대한 의존성과 같은 단점이 있습니다.
StyleTTS2 프레임워크는 StyleTTS 프레임워크를 개선하여 표현력이 향상된 텍스트 음성 작업을 제공합니다. StyleTTS2 프레임워크는 음성 스타일을 잠재적인 변수로 모델링하고 확률론적 확산 모델을 사용하여 이러한 음성 스타일 또는 랜덤 변수를 샘플링하여 참조 오디오 입력 없이 현실적인 음성을 합성할 수 있습니다. StyleTTS2 프레임워크는 또한 대규모 음성 언어 모델을 사용하여 음성 언어 모델의 특징을 합성하고, 잠재적인 공간 맵을 사용하지 않으므로 음성 합성을 최적화한 잠재적인 공간을 직접 학습할 수 있습니다.
종단 간 훈련을 위한 간섭
StyleTTS2 프레임워크에서는 종단 간 훈련 접근 방식을 사용하여 텍스트 음성 구성 요소를 간섭 없이 최적화합니다. StyleTTS2 프레임워크는 디코더를 수정하여 스타일 벡터, 피치 및 에너지 곡선, 정렬된 표현으로부터 직접 波形을 생성하도록 합니다. StyleTTS2 프레임워크는 두 개의 인코더를 사용합니다. HifiGAN 기반 디코더는 波形을 직접 생성하며, iSTFT 기반 디코더는 훈련 및 간섭을 위해 더 빠른 波形을 생성합니다.

위의 그림은 사전 훈련 및 공동 훈련을 위한 음성 모델을 나타냅니다. 훈련 시간을 줄이기 위해 모듈은 사전 훈련 단계에서 먼저 최적화되고, 공동 훈련에서는 모든 구성 요소가 최적화됩니다. 공동 훈련에서 피치 추출기가 최적화되지 않는 이유는 피치 곡선의 지면 진실을 제공하기 때문입니다.

위의 그림은 음성 언어 모델의 적대적 훈련 및 간섭을 나타냅니다. 이 과정은 이전에 언급된 과정과 다르며, 다양한 입력 텍스트를 취할 수 있지만 각 배치에서 매개변수를 업데이트하기 위해 그라디언트를 누적합니다.
스타일 확산
StyleTTS2 프레임워크는 음성을 조건부 분포를 통해 잠재적인 변수로 모델링하고, 이러한 변수는 일반화된 음성 스타일을 나타내며, 음성 샘플의 특징을 나타냅니다. 이러한 특징에는 음성의 운율, 속도, 형태전이 등이 포함됩니다.
음성 언어 모델 판별기
음성 언어 모델은 음성의 다양한 특징을 인코딩하는 능력으로 알려져 있으며, 음성 언어 모델의 특징은 인간의 지각을 모방하여 생성된 음성의 품질을 평가할 수 있습니다. StyleTTS2 프레임워크는 음성 언어 모델의 판별기를 사용하여 음성 언어 모델의 특징을 합성하고, 적대적 훈련을 사용하여 음성 언어 모델의 특징을 학습할 수 있습니다.
미분 가능한 기간 모델링
일반적으로 텍스트 음성 프레임워크에서는 기간 예측기를 사용하여 음성의 기간을 생성합니다. 그러나 이러한 기간 예측기를 사용하는 경우, 확산 모델을 사용하여 음성을 생성할 때, 그라디언트 흐름이 방해를 받을 수 있습니다. StyleTTS2 프레임워크는 이러한 문제를 해결하기 위해 비모수적 업샘플링 접근 방식을 사용합니다.
StyleTTS2 프레임워크는 각 음성의 정렬을 랜덤 변수로 모델링하고, 음성 프레임의 인덱스를 나타내는 변수를 사용하여 음성의 기간을 생성합니다. 이 접근 방식은 음성의 기간을 생성할 때 더 안정적이고 효율적인 방법을 제공합니다.
모델 훈련 및 평가
StyleTTS2 프레임워크는 세 가지 데이터셋에서 훈련 및 실험되었습니다. VCTK, LibriTTS, LJSpeech 데이터셋은 StyleTTS2 프레임워크의 성능을 평가하기 위해 사용되었습니다. StyleTTS2 프레임워크의 성능은 두 가지 지표를 사용하여 평가되었습니다. MOS-N 또는 자연성의 평균 의견 점수, MOS-S 또는 유사성의 평균 의견 점수.

결과
StyleTTS2 프레임워크의 접근 방식과 방법론은 성능에서 나타납니다. StyleTTS2 프레임워크는 여러 최첨단 텍스트 음성 프레임워크를 능가하며, 특히 NaturalSpeech 데이터셋에서 새로운 기준을 설정합니다. 또한, StyleTTS2 프레임워크는 VCTK 데이터셋에서 VITS 프레임워크를 능가하며, 결과는 다음 그림에 나타납니다.

StyleTTS2 프레임워크는 이전 모델을 능가하며, OOD 텍스트에서 품질의 저하를 나타내지 않습니다. 또한, 제로샷 설정에서 StyleTTS2 프레임워크는 Vall-E 프레임워크를 능가하며, 자연성에서 경쟁력 있는 성능을 나타냅니다.

StyleTTS2 프레임워크는 또한 감정 레이블이 있는 오디오 텍스트 데이터의 부족으로 인해 GPT-4 모델을 사용하여 다양한 감정에 대한 500개 이상의 인스턴스를 생성했습니다. 이러한 인스턴스는 StyleTTS2 프레임워크의 확산 프로세스를 사용하여 생성되었습니다.

첫 번째 그림은 LJSpeech 모델의 스타일 벡터를 나타내며, 입력 텍스트 감정에 대한 음성 스타일을 나타냅니다. 두 번째 그림은 5개의 개별 스피커에 대한 구별된 클러스터를 나타내며, 단일 오디오 파일에서 다양한 음성의 다양성을 나타냅니다. 세 번째 그림은 스피커 1의 느슨한 클러스터를 나타내며, 감정 기반 클러스터가 두드러지며, 참조 오디오 샘플과 입력 톤에 관계없이 스피커의 감정적인 색조를 조작할 수 있음을 나타냅니다.

최종 생각
이 기사에서는 StyleTTS2 프레임워크에 대해 이야기했습니다. StyleTTS2 프레임워크는 StyleTTS 프레임워크 위에 구축되었으며, 최첨단 텍스트 음성 시스템의 다음 단계를 제시합니다. StyleTTS2 프레임워크는 음성 스타일을 잠재적인 랜덤 변수로 모델링하고 확률론적 확산 모델을 사용하여 이러한 음성 스타일 또는 랜덤 변수를 샘플링하여 참조 오디오 입력 없이 현실적인 음성을 합성할 수 있습니다. StyleTTS2 프레임워크는 또한 대규모 음성 언어 모델을 사용하여 음성 언어 모델의 특징을 합성하고, 잠재적인 공간 맵을 사용하지 않으므로 음성 합성을 최적화한 잠재적인 공간을 직접 학습할 수 있습니다.












