Модели и платформы ИИ

HierSpeech++ : Иерархическая вариационная интерференция для синтеза речи с нулевым выстрелом

mm
Добавьте Unite.AI в избранные источники в Google

Недавние разработки и прогресс в возможностях больших языковых моделей сыграли решающую роль в продвижении рамок, основанных на LLM, для генерации аудио и задач синтеза речи, особенно в нулевом выстреле. Традиционные рамки синтеза речи стали свидетелями значительного прогресса в результате интеграции дополнительных функций, таких как нейронные аудиокодеки для дискретного аудио и речевых единиц. Хотя эти рамки синтеза речи и аудио обеспечивают удовлетворительные результаты, все еще есть место для улучшения, поскольку текущие рамки аудио, основанные на LLM, имеют три основных ограничения

  1. Они склонны к автогенерации аудиовыхода, что в конечном итоге приводит к отсутствию прочности и медленной скорости интерференции, что приводит к неправильному произношению, пропуску или повторению.
  2. Они склонны слишком сильно полагаться на дискретные речевые единицы или предварительно обученные нейронные аудиокодеки.
  3. Они часто требуют большого количества обучающих данных.

Чтобы решить проблемы, упомянутые выше, и улучшить возможности моделей синтеза речи и аудио на основе LLM, разработчики создали HierSpeech++, прочный и эффективный синтезатор речи с нулевым выстрелом для преобразования голоса и текста в речь или задач TTS. Рамка HierSpeech++ основана на иерархических рамках синтеза речи, которые не только повышают прочность, но и добавляют выразительность синтетической речи, а также повышают естественность и сходство говорящего синтетически сгенерированной речи, даже в нулевом выстреле.

В этой статье мы подробно рассмотрим рамку HierSpeech++, и посмотрим на архитектуру модели, ее работу и результаты по сравнению с современными моделями генерации текста и аудио. Итак, начнем.

HierSpeech++ : Иерархическая вариационная интерференция для синтеза речи с нулевым выстрелом

HierSpeech++ – это быстрый, прочный и эффективный синтезатор речи с нулевым выстрелом, который использует иерархический конвейер синтеза речи, и, принимая этот конвейер синтеза речи от начала до конца, модель HierSpeech++ может максимизировать потенциал высококачественной генерации волновой формы, чтобы иерархически мостить разрыв между семантическими и акустическими представлениями, принимая самообучаемое представление речи в качестве семантического представления речи, и таким образом пытается решить текущие ограничения адаптации стиля. Конвейер синтеза речи от начала до конца был впервые представлен моделью VITS, и он принимает VAE или вариационный автоэнкодер, дополненный обучением с противостоянием и нормализующим потоком. Кроме того, рамки, основанные на VAE, с конвейером обучения от начала до конца, имеют возможность генерировать высококачественную волновую форму аудио, с синтезом речи, воспринимаемым значительно лучше, чем тот, который генерируется другими рамками синтеза речи.

Качество аудиовосстановления этих рамок можно еще больше улучшить, используя иерархический условный вариационный автоэнкодер, используемый в рамке HierSpeech. Несмотря на их потенциал, модели с конвейером обучения от начала до конца имеют определенные ограничения, особенно в нулевом выстреле, поскольку, хотя они могут синтезировать образцы речи с высококачественным аудио, сходство говорящего в задачах клонирования голоса с нулевым выстрелом все еще осложнено высокой вычислительной сложностью. С другой стороны, диффузионные модели синтеза речи работают хорошо в плане адаптации говорящего, но они все еще далеки от совершенства, поскольку они используют интерактивный процесс генерации, который замедляет скорость вывода, они часто уязвимы для шумных данных, и в результате несоответствия между обучением и выводом двухэтапного процесса генерации между мел-спектрограммой и сгенерированной фактической аудио качество аудио не на высоте.

Чтобы решить проблемы, с которыми столкнулись его предшественники, модель HierSpeech++ использует иерархический синтезатор речи, супер-разрешение речи и компонент текста в вектор, и вводит улучшенный иерархический синтезатор речи, построенный на иерархическом условном VAE или вариационном автоэнкодере. В попытке повысить качество аудио за пределами воспринимаемого качества рамка HierSpeech++ принимает двойной аудио, чтобы повысить акустический постериор, и улучшает обобщение вне распределения, используя иерархический адаптивный генератор, оснащенный как условной, так и безусловной генерацией. Кроме того, чтобы разъединить компоненты речи и повысить связанную с говорящим и независимую от говорящего семантическую информацию, рамка HierSpeech++ также принимает теоретически-основанный много-путьный семантический кодировщик на основе источника и фильтра. В результате использования вариационного автоэнкодера модель HierSpeech++ может соединить и изучить представления иерархически и прогрессивно адаптироваться к целевому стилю голоса, чтобы сделать вывод о волновой форме аудио. Кроме того, рамка HierSpeech++ также развертывает двустороннюю сеть нормализующих потоков трансформеров в попытке повысить адаптацию и также уменьшить несоответствие между обучением и выводом.

В целом, модель HierSpeech++ – это полностью-параллельная, новая и прочная иерархическая рамка синтеза речи, направленная на синтез образцов речи в нулевом выстреле, и пытается сделать следующие вклады

  • Использование иерархической рамки синтеза речи для контроля и передачи стилей голоса и просодии.
  • Включить масштабируемость данных и высокое разрешение синтеза речи, увеличивая волновую форму аудио с 16 до 48 кГц.
  • Достичь человеческого уровня способностей в задачах преобразования голоса и текста в речь с нулевым выстрелом.

HierSpeech++ : Компоненты модели и архитектура

Как обсуждалось, HierSpeech++ – это модель синтеза речи с нулевым выстрелом, которая пытается достичь человеческого уровня точности в плане сходства голоса и естественности речи.

Модель HierSpeech++ состоит из различных компонентов, включая иерархический синтезатор речи, супер-разрешение речи и текст-в-вектор, которые работают в гармонии друг с другом, чтобы облегчить обучение каждой модели, которая может эффективно использовать большое количество низкокачественных данных речи для клонирования голоса. Давайте разберем рамку и поговорим о каждом компоненте.

Представления речи

Поскольку человеческая частотная полоса находится ниже 4 кГц, для синтеза речи рамка HierSpeech++ снижает частоту аудио до 16 кГц. Кроме того, для восстановления сигнала голоса важно использовать как минимум вдвое высшую компоненту частоты голоса, помимо снижения частоты аудио. Чтобы достичь повышенного воспринимаемого качества, рамка HierSpeech++ использует компонент супер-разрешения речи или SpeechSR для увеличения частоты аудио с 16 до 48 кГц и использует низкокачественные представления для семантических и акустических представлений.

Для акустических представлений традиционная рамка текста в речь или TTS использует мел-спектрограмму в качестве промежуточной акустической функции, которая затем преобразуется из волновой формы с помощью STFT или короткого преобразования Фурье. Однако стоит отметить, что поскольку акустические функции являются богатыми представлениями, включающими различные атрибуты, включая содержание и произношение, информацию о голосе и многое другое, что делает трудным для рамки сделать вывод об этих представлениях, что часто приводит к неправильному произношению, отсутствию сходства или чрезмерному сглаживанию речи.

Двигаясь дальше, чтобы извлечь непрерывное семантическое представление из волновой формы, рамка HierSpeech++ использует рамку Wav2Vec, в отличие от популярного самообучаемого подхода представления речи для семантических представлений. Хотя этот подход делает хорошую альтернативу для богатой монолингвальной модели, он влияет на способности модели к нулевому выстрелу в плане как прочности, так и выразительности, особенно на задачах синтеза речи на нескольких языках.

Иерархический синтезатор речи

Компонент иерархического синтезатора речи – это основа рамки HierSpeech++, поскольку он позволяет обучать модуль без использования каких-либо меток, таких как текстовые транскрипты или идентификатор говорящего, и полагаться исключительно на данные речи. Чтобы повысить акустическую емкость, предыдущие модели синтеза речи заменили мел-спектрограмму на линейный спектрограмму, однако этот подход минимизирует показатель KL-расхождения в плане периодичности тона, PESQ, голоса и не голоса, и даже расстояния мел-спектрограммы. Иерархический синтезатор речи использует двойной акустический кодировщик для решения проблем, представленных линейным спектрограммой, предназначенным для захвата более богатых и полных акустических представлений. Рамка также использует кодировщик волновой формы для извлечения информации из сырой волновой формы аудио и объединяет ее с линейным спектрограммным представлением, и, наконец, проецирует акустическое представление в виде объединенного представления.

Кроме того, чтобы решить проблемы, связанные с говорящим и независимыми от говорящего семантическими представлениями, рамка HierSpeech++ использует много-путьный самообучаемый подход представления речи, где каждое отдельное представление используется для иерархической адаптации стиля с семантическими представлениями, извлеченными для получения лингвистической информации из среднего слоя MMS. Рамка также использует фундаментальную частоту для повышения дезентанглемента речи, что позволяет контролировать контур тона вручную. Рамка также использует лингвистическое представление в качестве условной информации для генерации волновой формы аудио иерархически и использует повышенное лингвистическое представление самообучаемого представления. Также стоит отметить, что акустические представления, извлеченные во время обучения с помощью волновой формы и линейного спектрограммы, используются для восстановления сырой волновой формы аудио, и иерархическая вариационная интерференция используется для соединения акустических представлений с много-путьными лингвистическими представлениями. Рамка также использует иерархический адаптивный генератор для генерации семантических-в-волновую форму образцов, и сгенерированные представления, включающие представление стиля и акустическое представление, подаются в генераторы источника и волновой формы.

Текст в вектор

Для синтеза речи из текста рамка HierSpeech++ использует модель текста в вектор или TTV, которая генерирует фундаментальную частоту и семантическое представление из последовательности текста, и использует монотонный поиск выравнивания, объединенный с вариационным автоэнкодером, для выравнивания речи и текста внутри. Рамка HierSpeech++ затем заменяет линейный спектрограмму на самообучаемое линейное представление и восстанавливает то же представление, чтобы служить выходом для TTV.

Кроме того, рамка HierSpeech++ предсказывает фундаментальную частоту с четырьмя разами большей разрешающей способностью по сравнению с самообучаемыми представлениями речи, и использует условное текстовое представление в качестве приоритетной информации. В результате семантической информации самообучаемых представлений речи, рамка способна передавать стиль просодии в модели текста в вектор, и подает潜ное представление в кодировщик фонемы, чтобы повысить лингвистические способности представления.

SpeechSR или супер-разрешение речи

Рамка HierSpeech++ обучается на относительно низкокачественном наборе данных в плане эффективности и доступности данных, и увеличивает низкокачественную волновую форму речи до высококачественной волновой формы речи с 16 до 48 кГц. Рамка также заменяет транспонированную свертку на ближайший соседний апсэмплер, который ранее был известен как средство для смягчения артефактов, вызванных транспонированными свертками.

Архитектура

Кодировщик контента модели текста в вектор состоит из 16 неказуальных слоев WaveNet с размером ядра 5 и скрытым размером 256, в то время как декодировщик контента состоит из 8 неказуальных слоев WaveNet с размером ядра 5 и скрытым размером 512. Компонент текстового кодировщика состоит из трех условных трансформерных сетей просодии и трех безусловных трансформерных сетей с размером ядра 9, размером фильтра 1024 и скрытым размером 256, с текстовым кодировщиком, имеющим коэффициент dropout 0,2. Чтобы закодировать соседнюю информацию и повысить адаптацию стиля просодии, рамка использует свертку с размером ядра 5 в трансформерных блоках. SpeechSR, с другой стороны, состоит из одного блока AMP с 32 начальными каналами без наличия слоя апсэмплинга. Рамка использует ближайший соседний апсэмплер для апсэмплинга скрытых представлений и использует MPD в качестве дискриминатора с шестью разными размерами окон и четырьмя суб-банд дискриминаторами.

Вышеуказанная фигура демонстрирует конвейер вывода рамки HierSpeech++, который начинается с извлечения семантических представлений из аудио на частоте 16 кГц и на фундаментальной частоте с помощью алгоритма YAPPT. Перед тем, как фундаментальная частота может быть подана в иерархический синтезатор, она нормализуется с помощью стандартного и среднего отклонения источника аудио, и нормализованная фундаментальная частота затем денормализуется с помощью стандартного и среднего отклонения целевого аудио. Для задач синтеза речи из текста рамка HierSpeech++ извлекает текстовые представления вместо представлений речи и использует модель текста в вектор для генерации семантического представления из просодического промпта.

Эксперимент и результаты

Рамка использует общедоступный набор данных LibriTTS для обучения компонента иерархического синтезатора с первым шагом, заключающимся в обучении модели на подмножестве trainclean набора данных, и использовании оставшихся данных для улучшения передачи стиля голоса. Кроме того, чтобы повысить разнообразие и прочность, рамка масштабирует набор данных до 1 кГц, как показано на следующей фигуре.

Восстановление, задачи ресинтеза и преобразование голоса

Чтобы оценить производительность рамки HierSpeech++ на задачах восстановления и ресинтеза, разработчики провели семь объективных метрик, и результаты демонстрируются на следующих фигурах для задач восстановления и ресинтеза соответственно.

Для задач преобразования голоса рамка использует два субъективных метрика для оценки: голосовое сходство MOS или sMOS и естественность среднее мнение о качестве или nMOS с тремя объективными метриками естественности и двумя метриками сходства.

Двигаясь дальше, основная цель рамки HierSpeech++ – это включить синтез речи с нулевым выстрелом, и чтобы оценить ее производительность в нулевом выстреле, она сравнивается с другими базовыми моделями, такими как AutoVC, VoiceMixer, диффузионными моделями и многими другими, с результатами, демонстрируемыми на следующей фигуре.

Следующие фигуры демонстрируют результаты синтеза речи из текста с нулевым выстрелом с шумными промптами и очень шумными промптами соответственно.

Окончательные мысли

В этой статье мы говорили о модели HierSpeech++, новом подходе к включению прочного и эффективного синтеза речи в нулевом выстреле, и преодолению ограничений, с которыми сталкиваются текущие рамки синтеза речи, включая их чрезмерную зависимость от больших объемов обучающих данных, зависимость от дискретных единиц речи или предварительно обученных нейронных аудиокодеков, и их тенденцию к автогенерации аудиовыхода, что в конечном итоге приводит к отсутствию прочности и медленной скорости интерференции, что приводит к неправильному произношению, пропуску или повторению. Модель HierSpeech++ – это полностью-параллельная, новая и прочная иерархическая рамка синтеза речи, направленная на синтез образцов речи в нулевом выстреле, и пытается сделать следующие вклады

  • Использование иерархической рамки синтеза речи для контроля и передачи стилей голоса и просодии.
  • Включить масштабируемость данных и высокое разрешение синтеза речи, увеличивая волновую форму аудио с 16 до 48 кГц.
  • Достичь человеческого уровня способностей в задачах преобразования голоса и текста в речь с нулевым выстрелом.

"Инженер по профессии, писатель по сердцу". Кунал - технический писатель с глубокой любовью и пониманием ИИ и МО, посвященный упрощению сложных концепций в этих областях посредством своей увлекательной и информативной документации.