AI 모델 및 플랫폼
HierSpeech++ : 계층적 변분 추론을 통한 제로샷 음성 합성
최근에 큰 언어 모델의 능력과 개발이 음성 생성과 음성 합성 작업에서 특히 제로샷 설정에서 큰 발전을 이루었다. 전통적인 음성 합성 프레임워크는 신경 음성 코덱과 같은 추가 기능을 통합함으로써 상당한 발전을 이루었다. 이러한 음성 및 오디오 합성 프레임워크는 만족할 만한 결과를 제공하지만, 현재의 LLM 기반 오디오 프레임워크에는 다음과 같은 세 가지 주요 제한 사항이 있다.
- 자동으로 생성된 오디오 출력은 강건성의 부족과 느린 간섭 속도 및 발음 오류, 생략 또는 반복을 초래한다.
- 이들은 이산 음성 단위 또는 사전 훈련된 신경 음성 코덱에過度 의존한다.
- 이들은大量의 훈련 데이터를 필요로 한다.
위에서 언급된 문제를 해결하고 LLM 기반 오디오 및 음성 합성 모델의 능력을 개선하기 위해 개발자들은 HierSpeech++라는 강력하고 효율적인 제로샷 음성 합성기를 만들었다. HierSpeech++ 프레임워크는 계층적 음성 합성 프레임워크를 기반으로 하여 합성 음성 출력의 강건성과 표현력을 향상시키고 자연스러움과 화자 유사성을 향상시킨다.
이 기사에서, 우리는 HierSpeech++ 프레임워크에 대해 자세히 살펴보고, 모델의 구조, 작동 및 결과를 상태 오토 텍스트 및 오디오 생성 모델과 비교하여 살펴본다. 시작해 보자.
HierSpeech++ : 계층적 변분 추론을 통한 제로샷 음성 합성
HierSpeech++는 빠르고 강력하며 효율적인 제로샷 음성 합성 프레임워크로, 계층적 음성 합성 파이프라인을 사용한다. 이 프레임워크는 자기 지도 학습 음성 표현을 사용하여 의미적과 음향적 표현 사이의 간격을 계층적으로 연결한다. 또한, HierSpeech++는 VAE(변분 오토인코더)와 적대적 훈련 및 정규화 흐름을 사용한다. VAE 기반 프레임워크는 높은 품질의 波形 오디오를 생성할 수 있다.
이 프레임워크의 오디오 재구성 품질은 계층적 조건부 변분 오토인코더를 사용하여 향상될 수 있다. 그러나, 이러한 모델은 제로샷 설정에서 일부 제한 사항이 있다. 예를 들어, 이러한 모델은 높은 품질의 음성 샘플을 생성할 수 있지만, 제로샷 음성 클론 작업에서 화자 유사성이 여전히 높은 계산 복잡성을 가지고 있다. 반면에, 확산 기반 음성 합성 모델은 화자 적응에서 잘 작동하지만, 여전히 완벽하지 않다.
HierSpeech++ 모델은 계층적 음성 합성기, 음성 超解像度, 텍스트를 벡터로 변환하는 구성 요소를 사용한다. 또한, 이 프레임워크는 계층적 적응 생성기를 사용하여 음향 표현을 향상시키고, 음성 구성 요소를 분리하여 화자 관련 및 화자 비관련 의미 정보를 향상시킨다. HierSpeech++ 모델은 또한 波形 오디오를 계층적으로 생성하고, 자기 지도 학습 음성 표현을 사용하여 음성 스타일을 전송한다.
HierSpeech++ 모델은 다음과 같은 기여를 한다.
- 계층적 음성 합성 프레임워크를 사용하여 음성 스타일과 프로소디를 제어하고 전송한다.
- 데이터 확장성과 고해상도 음성 합성을 가능하게 하기 위해 16 kHz에서 48 kHz로 波形 오디오를 업샘플링한다.
- 제로샷 음성 전환 및 텍스트 음성 작업에서 인간 수준의 능력을 달성한다.
HierSpeech++ : 모델 구성 요소와 구조
HierSpeech++는 제로샷 음성 합성 모델로, 인간 수준의 정확도를 달성하려고 한다. 이 모델은 다음과 같은 구성 요소를 가지고 있다.

HierSpeech++ 모델은 계층적 음성 합성기, 음성 超解像度, 텍스트를 벡터로 변환하는 구성 요소를 가지고 있다. 이러한 구성 요소는 함께 작동하여 대량의 저해상도 음성 데이터를 사용하여 음성 클론을 훈련시킬 수 있다. 이제, 각 구성 요소를 자세히 살펴보자.
음성 표현
HierSpeech++ 프레임워크는 음성 합성을 위해 16 kHz에서 오디오를 다운샘플링한다. 또한, 음성 신호를 재구성하기 위해, 음성 주파수의最高 구성 요소를 사용하여 오디오 샘플을 업샘플링해야 한다. HierSpeech++ 프레임워크는 음성 超解像度 구성 요소를 사용하여 오디오 샘플을 16 kHz에서 48 kHz로 업샘플링한다.

전통적인 텍스트 음성 프레임워크는 중간 음향 특征으로 멜스펙트로그램을 사용한다. 그러나, 음향 특징은 다양한 속성을 포함하는 풍부한 표현으로, 음성 정보, 발음 정보 등이 포함되어 있다. 이러한 특징으로 인해, 프레임워크는 이러한 표현을 추론하기 어렵다. 이는 발음 오류, 화자 유사성의 부족 또는 음성의过度 평활화로 이어질 수 있다.
계속해서, 波形에서 연속적인 의미적 표현을 추출하기 위해, HierSpeech++ 프레임워크는 Wav2Vec 프레임워크를 사용한다. 그러나, 이 접근법은 다국어 음성 합성 작업에서 강건성과 표현력을 저하할 수 있다.
계층적 음성 합성기
계층적 음성 합성기 구성 요소는 HierSpeech++ 프레임워크의基础이다. 이 구성 요소는 레이블이나 텍스트 전사 없이 음성 데이터만을 사용하여 훈련할 수 있다. 음향 능력을 향상시키기 위해, 이전의 음성 합성 모델은 멜스펙트로그램을 선형 스펙트로그램으로 대체했다. 그러나, 이 접근법은 피치 주기, PESQ, 음성 및 무음 점수, 멜스펙트로그램 거리 등에서 KL 발산 점수를 최소화한다.

계층적 음성 합성기 구성 요소는 두 개의 음향 인코더를 사용하여 음향 표현을 캡처한다. 또한, 이 구성 요소는 波形 인코더를 사용하여 원시 波形 오디오에서 정보를 추출하고, 선형 스펙트로그램 표현과 결합한다. 계층적 음성 합성기 구성 요소는 또한 다중 경로 자기 지도 학습 음성 표현을 사용하여 화자 관련 및 화자 비관련 의미 정보를 추출한다.
텍스트를 벡터로 변환
텍스트 음성 합성을 위해, HierSpeech++ 프레임워크는 텍스트를 벡터로 변환하는 구성 요소를 사용한다. 이 구성 요소는 텍스트 시퀀스에서 기본 주파수와 의미적 표현을 생성한다. 또한, 이 구성 요소는 변분 오토인코더와 단조적 정렬 검색을 사용하여 음성과 텍스트를 내부적으로 정렬한다.

HierSpeech++ 프레임워크는 또한 선형 스펙트로그램을 자기 지도 학습 선형 표현으로 대체한다. 또한, 이 프레임워크는 조건부 텍스트 표현을 사용하여 음성 스타일을 전송한다.
음성 超解像度
HierSpeech++ 프레임워크는 상대적으로 저해상도 데이터 세트에서 훈련된다. 이 프레임워크는 저해상도 음성 波形을 16 kHz에서 48 kHz로 업샘플링한다.

구조
HierSpeech++ 프레임워크의 구조는 다음과 같다. 텍스트를 벡터로 변환하는 구성 요소의 내용 인코더는 16개의 비순차적 WaveNet 레이어로 구성되며, 内部 크기는 256이다. 내용 디코더는 8개의 비순차적 WaveNet 레이어로 구성되며, 내부 크기는 512이다.

HierSpeech++ 프레임워크는 다음과 같은 구성 요소를 사용하여 음성 합성을 수행한다. 이 프레임워크는 계층적 음성 합성기, 음성 超解像度, 텍스트를 벡터로 변환하는 구성 요소를 사용하여 음성 합성을 수행한다.
실험 및 결과
HierSpeech++ 프레임워크는 공개적으로 उपलब한 LibriTTS 데이터 세트를 사용하여 계층적 음성 합성기 구성 요소를 훈련한다. 이 프레임워크는 다음과 같은 결과를 얻는다.

재구성, 재합성 작업 및 음성 전환
HierSpeech++ 프레임워크의 성능을 평가하기 위해, 개발자들은 다음과 같은 결과를 얻었다.


HierSpeech++ 프레임워크는 다음과 같은 결과를 얻었다. 이 프레임워크는 제로샷 음성 전환 작업에서 높은 성능을 보여주었다.

HierSpeech++ 프레임워크는 다음과 같은 결과를 얻었다. 이 프레임워크는 제로샷 텍스트 음성 작업에서 높은 성능을 보여주었다.


최종 생각
이 기사에서, 우리는 HierSpeech++ 모델에 대해 살펴보았다. 이 모델은 제로샷 음성 합성에서 강건성과 자연스러움을 향상시키는 새로운 접근법이다. HierSpeech++ 모델은 다음과 같은 기여를 한다.
- 계층적 음성 합성 프레임워크를 사용하여 음성 스타일과 프로소디를 제어하고 전송한다.
- 데이터 확장성과 고해상도 음성 합성을 가능하게 하기 위해 16 kHz에서 48 kHz로 波形 오디오를 업샘플링한다.
- 제로샷 음성 전환 및 텍스트 음성 작업에서 인간 수준의 능력을 달성한다.












