Моделі та платформи ШІ
HierSpeech++ : Ієрархічний варіаційний висновок для синтезу мови без зразків
Недавні розробки та прогрес у можливостях великих мовних моделей відіграли важливу роль у вдосконаленні рамок, заснованих на LLM, для генерації аудіо та синтезу мови, особливо в умовах без зразків. Традиційні рамки синтезу мови значно вдосконалилися завдяки інтеграції додаткових функцій, таких як нейронні аудіо-коди для дискретного аудіо та мовних одиниць. Хоча ці рамки синтезу мови та аудіо забезпечують задовільні результати, все ще є місце для покращення, оскільки поточні рамки синтезу мови на основі LLM мають три основні обмеження
- Вони схильні до автогенерації аудіових даних, що призводить до відсутності стійкості та повільної швидкості інтерференції, що результатом є неправильна вимова, пропуск або повторення.
- Вони надмірно залежать від дискретних мовних одиниць або попередньо натренованих нейронних аудіо-кодеків.
- Вони часто вимагають великої кількості тренувальних даних.
Щоб подолати вищезазначені проблеми та покращити можливості моделей синтезу мови та аудіо на основі LLM, розробники створили HierSpeech++, стійкий і ефективний синтезатор мови без зразків для конверсії голосу та тексту в мову. Рамка HierSpeech++ будується на基础і ієрархічного синтезу мови, який не тільки підвищує стійкість, але й додає виразності синтезованому мовному виходу, а також підвищує природність та схожість мовлення, навіть у умовах без зразків.
У цій статті ми детально розглянемо рамку HierSpeech++, її архітектуру, роботу та результати порівняно з сучасними моделями генерації тексту та аудіо. Тому почнімо.
HierSpeech++ : Ієрархічний варіаційний висновок для синтезу мови без зразків
HierSpeech++ – це швидкий, стійкий і ефективний синтезатор мови без зразків, який використовує ієрархічний синтез мови, і приймаючи цю кінцеву рамку синтезу мови, модель HierSpeech++能够 максимізувати потенціал генерації високоякісних хвильових аудіо для ієрархічного мосту між семантичними та акустичними представленнями шляхом прийняття самонавчального мовного представлення як семантичного мовного представлення, і таким чином намагається вирішити поточні обмеження адаптації стилю. Кінцева рамка синтезу мови була вперше представлена моделлю VITS, і вона використовує VAE або варіаційний автоенкодер, доповнений адверсивною тренуванням та нормалізуючим потоком. Крім того, рамки VAE з кінцевою тренувальною трубопроводом мають можливість генерувати високоякісні хвильові аудіо з перцептивною якістю мовного синтезу, яка значно краще, ніж у інших рамок синтезу мови.
Якість реконструкції аудіо цих рамок можна ще більше покращити за допомогою ієрархічного умовного варіаційного автоенкодера, як у рамці HierSpeech. Хоча ці рамки мають потенціал, вони мають певні обмеження, особливо у умовах без зразків, оскільки хоча вони можуть синтезувати мовні зразки з високоякісним аудіо, схожість мовлення у завданнях клонування голосу без зразків все ще супроводжується високою обчислювальною складністю. З іншого боку, дифузійні моделі синтезу мови працюють добре з точки зору адаптації стилю, але вони все ще далекі від досконалості, оскільки вони використовують інтерактивний процес генерації, який сповільнює швидкість інтерференції, вони часто вразливі до шумових даних, і в результаті несумісності між тренуванням та інтерференцією двоступеневого процесу генерації між Мел-спектрограмою та згенерованим реальним аудіо якість аудіо не на рівні.
Щоб подолати проблеми, з якими стикаються її попередники, модель HierSpeech++ використовує ієрархічний синтезатор мови, супер-роздільність мови та компонент тексту до вектору, і вводить покращений ієрархічний синтезатор мови, побудований на ієрархічному умовному варіаційному автоенкодері. У спробі підвищити якість аудіо за межі перцептивної якості, рамка HierSpeech++ приймає подвійний аудіо для підвищення акустичної постеріорної ймовірності, і підвищує узагальнення за межами розподілу за допомогою ієрархічного адаптивного генератора, обладнаного умовною та безумовною генерацією. Крім того, щоб розрізняти мовні компоненти та підвищити семантичну інформацію, пов’язану з мовленням, та незалежну від мовлення, рамка HierSpeech++ також приймає теорію джерела та фільтра на основі багатошляхового семантичного кодувача. Як результат використання варіаційного автоенкодера, модель HierSpeech++能够 зв’язати та вивчити представлення ієрархічно, і поступово адаптуватися до цільового стилю голосу для висновку хвильового аудіо. Крім того, рамка HierSpeech++ також розгортає двонаправлену мережу трансформерів нормалізуючого потоку в спробі підвищити адаптацію та зменшити несумісність між тренуванням та інтерференцією.
У цілому, модель HierSpeech++ – це повністю паралельна, нова та стійка ієрархічна рамка синтезу мови, спрямована на синтез мовних зразків у умовах без зразків, і намагається зробити наступні внески
- Використання ієрархічної рамки синтезу мови для контролю та передачі стилів голосу та просодії.
- Забезпечення масштабованості даних та високої роздільності синтезу мови шляхом інтерполяції хвильового аудіо з 16 до 48 кГц.
- Досягнення людського рівня можливостей у завданнях конверсії голосу без зразків та тексту в мову.
HierSpeech++ : Компоненти моделі та архітектура
Як обговорювалося, HierSpeech++ – це модель синтезу мови без зразків, яка намагається досягти людського рівня точності щодо схожості голосу та природності мови.

Модель HierSpeech++ складається з різних компонентів, включаючи ієрархічний синтезатор мови, супер-роздільність мови та текст до вектору до TTV, які працюють у синхронізації один з одним для забезпечення тренування кожної моделі, яка може ефективно використовувати велику кількість низькочастотних мовних даних для клонування голосу. Давайте розберемо рамку та поговоримо про кожен компонент.
Мовні представлення
Оскільки людський діапазон частот нижче 4 кГц, для синтезу мови рамка HierSpeech++ дискретизує аудіо на 16 кГц. Крім того, для реконструкції сигналу голосу необхідно використовувати至少 вдвічі вищу частоту голосу, а також дискретизувати аудіо-зразок. Для досягнення покращеної перцептивної якості рамка HierSpeech++ використовує компонент супер-роздільності мови або SpeechSR для інтерполяції аудіо-зразка з 16 до 48 кГц, і використовує низькочастотні представлення для семантичних та акустичних представлень.

Для акустичних представлень традиційна рамка тексту в мову використовує Мел-спектрограму як проміжну акустичну особливість, яка потім перетворюється з хвильового аудіо за допомогою STFT або короткочасного Фур’є-перетворення. Однак варто зазначити, що оскільки акустичні особливості є багатими представленнями, які включають різні атрибути, включаючи вміст та вимову, інформацію про голос та інше, що робить складним для рамки вивести ці представлення, ситуація, яка часто призводить до неправильної вимови, відсутності схожості або надмірного згладжування мови.
Далі, для витягування безперервного семантичного представлення з хвильового аудіо, рамка HierSpeech++ використовує рамку Wav2Vec, на відміну від популярного самонавчального мовного представлення для семантичних представлень. Хоча цей підхід робить хорошу альтернативу для багатої монолінгвальної моделі, він впливає на здатність моделі до клонування голосу без зразків щодо стійкості та виразності, особливо на багатому мовному синтезі.
Ієрархічний синтезатор мови
Компонент ієрархічного синтезатора мови є фундаментальним каменем для рамки HierSpeech++, оскільки він дозволяє тренувати модуль без використання будь-яких міток, таких як текстові транскрипти або ідентифікатори мовлення, і залежить лише від мовних даних. Для підвищення акустичної здатності попередні моделі синтезу мови замінили Мел-спектрограму на лінійний спектрограму, однак цей підхід мінімізує оцінку КЛ у термінах періодичності тона, PESQ, оцінки голосу та безголосся, а також відстань Мел-спектрограми. Ієрархічний синтезатор мови використовує подвійний аудіо-акустичний кодувач для вирішення проблем, пов’язаних з використанням лінійної спектрограми, призначеної для захоплення багатших та більш повних акустичних представлень. Рамка також використовує кодувач хвильового аудіо для витягування інформації з сирого хвильового аудіо та конкатенує його з лінійним спектрограмним представленням, і нарешті проєктує акустичне представлення як конкатеноване представлення.

Крім того, для вирішення проблем, пов’язаних з мовленням-незалежними та мовлення-пов’язаними семантичними представленнями, рамка HierSpeech++ використовує багатошляхове самонавчальне мовне представлення, де кожне окреме представлення використовується для ієрархічної адаптації стилю з семантичними представленнями, витягнутими для отримання лінгвістичних відомостей з середнього шару ММС. Рамка також використовує фундаментальну частоту для підвищення розрізнення мови, що дозволяє контролювати контур тона вручну. Рамка також використовує лінгвістичне представлення як умовну інформацію для генерації хвильового аудіо ієрархічно, і використовує покращене лінгвістичне представлення самонавчального представлення. Також варто зазначити, що акустичні представлення, витягнуті під час тренування за допомогою хвильового аудіо та лінійної спектрограми, використовуються для реконструкції сирого хвильового аудіо, і ієрархічний варіаційний висновок використовується для зв’язку акустичних представлень з багатошляховими лінгвістичними представленнями. Рамка також використовує ієрархічний адаптивний генератор для генерації семантичних-у-хвильових зразків, і згенеровані представлення, що складаються з представлення стилю та акустичного представлення, подаються до джерела та генератора хвильового аудіо.
Текст до вектору
Для синтезу мови з тексту рамка HierSpeech++ використовує модель тексту до вектору або TTV, яка генерує фундаментальну частоту та семантичне представлення з текстової послідовності, і використовує монотонний пошук збігів, поєднаний з варіаційним автоенкодером, для внутрішнього збігання мови та тексту. Рамка HierSpeech++ потім замінює лінійну спектрограму на самонавчальне лінійне представлення, і реконструює те ж представлення для використання як виходу для TTV.

Крім того, рамка HierSpeech++ передбачає фундаментальну частоту з чотири рази більшою роздільністю порівняно з самонавчальними мовними представленнями, і використовує умовне текстове представлення як апріорну інформацію. Як результат семантичної інформації самонавчальних мовних представлень, рамка能够 передавати стиль просодії у тексті до моделі TTV, і подає латентне представлення до фонемного кодувача для підвищення лінгвістичної здатності представлення.
SpeechSR або супер-роздільність мови
Рамка HierSpeech++ тренується на відносно низькочастотному наборі даних щодо ефективності даних та доступності, і інтерполює низькочастотний хвильовий аудіо-зразок у високочастотний аудіо-зразок з 16 до 48 кГц. Рамка також замінює транспоновану конволюцію на найближчого сусіда-інтерполювач, який раніше був відомий тим, що пом’якшує артефакти, пов’язані з транспонованою конволюцією.

Архітектура
Кодувач змісту моделі тексту до вектору складається з 16 неказуальних шарів WaveNet з розміром ядра 5 та прихованим розміром 256, тоді як декодувач змісту складається з 8 неказуальних шарів WaveNet з розміром ядра 5 та прихованим розміром 512. Компонент текстового кодувача складається з трьох умовних трансформерів просодії та трьох безумовних трансформерів з розміром ядра 9, розміром фільтра 1024 та прихованим розміром 256 з текстовим кодувачем, який має коефіцієнт витоку 0,2. Для кодування сусідньої інформації та підвищення адаптації стилю просодії рамка приймає конволюційний нейронний мережевий шар з розміром ядра 5 у трансформерних блоках. SpeechSR, з іншого боку, складається з одного блоку AMP з 32 початковими каналами без присутності шару інтерполяції. Рамка використовує найближчого сусіда-інтерполювач для інтерполяції прихованих представлень та використовує MPD як дискримінатор з шістьма різними розмірами вікна та чотирма суб-банд дискримінаторами.

Вище зображення демонструє трубопровід інтерференції рамки HierSpeech++, який починається з витягування семантичних представлень з аудіо на частоті 16 кГц та фундаментальної частоти за допомогою алгоритму YAPPT. Перед тим, як фундаментальна частота подається до ієрархічного синтезатора, вона нормалізується за допомогою стандартного та середнього відхилення вихідного аудіо, а нормалізована фундаментальна частота потім денормалізується за допомогою стандартного та середнього відхилення цільового аудіо. Для синтезу мови з тексту рамка HierSpeech++ витягує текстові представлення замість мовних представлень, і використовує модель тексту до вектору для генерації семантичного представлення з просодійного запиту.
Експеримент та результати
Рамка використовує публічно доступний набір даних LibriTTS для тренування компоненту ієрархічного синтезатора мови з першим кроком тренування моделі з підмножиною trainclean набору даних, та використовує решту даних для підвищення передачі стилю голосу. Крім того, для підвищення різноманітності та стійкості рамка збільшує набір даних до 1 кГц, як показано на наступному зображенні.

Реконструкція, ресинтез завдань та конверсія голосу
Щоб оцінити продуктивність рамки HierSpeech++ на завданнях реконструкції та ресинтезу, розробники провели сім об’єктивних метрик, і результати демонструються на наступних зображеннях для завдань реконструкції та ресинтезу відповідно.


Для завдань конверсії голосу рамка використовує дві суб’єктивні метрики для оцінки: голосова схожість MOS або sMOS та природність середнього оцінювання nMOS з трьома об’єктивними метриками природності та двома об’єктивними метриками схожості.

Далі, основною метою рамки HierSpeech++ є забезпечення синтезу мови без зразків, і для оцінки її продуктивності у умовах без зразків вона порівнюється з іншими базовими моделями, такими як AutoVC, VoiceMixer, дифузійними моделями та багатьма іншими, з результатами, показаними на наступному зображенні.

Наступні зображення демонструють результати синтезу мови без зразків з шумними запиту та дуже шумними запитами відповідно.


Фінальні думки
У цій статті ми обговорили модель HierSpeech++, новий підхід для забезпечення стійкого та ефективного синтезу мови у умовах без зразків, і подолання обмежень, з якими стикаються поточні рамки синтезу мови, включаючи надмірну залежність від великої кількості тренувальних даних, залежність від дискретних мовних одиниць або попередньо натренованих нейронних аудіо-кодеків, і схильність до автогенерації аудіо-виводу, який призводить до відсутності стійкості та повільної швидкості інтерференції, що результатом є неправильна вимова, пропуск або повторення. Модель HierSpeech++ – це повністю паралельна, нова та стійка ієрархічна рамка синтезу мови, спрямована на синтез мовних зразків у умовах без зразків, і намагається зробити наступні внески
- Використання ієрархічної рамки синтезу мови для контролю та передачі стилів голосу та просодії.
- Забезпечення масштабованості даних та високої роздільності синтезу мови шляхом інтерполяції хвильового аудіо з 16 до 48 кГц.
- Досягнення людського рівня можливостей у завданнях конверсії голосу без зразків та тексту в мову.












