Моделі та платформи ШІ
StyleTTS 2: Людський рівень тексту до мови з великими мовними моделями
Через зростання природних і синтетичних підходів до синтезу мови, одним із основних досягнень галузі штучного інтелекту за останні роки є ефективний синтез тексту до мови з потенційними застосуваннями в різних галузях, включаючи аудіокниги, віртуальних помічників, озвучування та інше, причому деякі сучасні моделі демонструють людський рівень продуктивності та ефективності при виконанні завдань, пов’язаних із мовою. Однак, незважаючи на їхню потужну продуктивність, все ще є місце для покращення завдань завдяки виразному та різноманітному мовленню, необхідності великої кількості навчальних даних для оптимізації нульових текстових моделей мови та стійкості до текстів, що знаходяться поза розподілом, що спонукає розробників працювати над більш стійкою та доступною моделлю мови.
У цій статті ми поговоримо про StyleTTS-2, стійку та інноваційну модель мови, яка побудована на основі моделі StyleTTS, і спрямована на презентацію наступного кроку до сучасних моделей мови. Модель StyleTTS2 моделює стилі мови як латентні випадкові змінні та використовує ймовірнісну дифузійну модель для вибірки цих стилів мови або випадкових змінних, що дозволяє моделі StyleTTS2 синтезувати реалістичну мову ефективно без використання аудіовхідних даних. Завдяки цьому підходу модель StyleTTS2 демонструє кращі результати та високу ефективність у порівнянні з сучасними моделями мови, але також здатна скористатися різноманітним синтезом мови, наданим моделями дифузії. Ми детально розглянемо модель StyleTTS2 та її архітектуру та методологію, а також ознайомимося з результатами, досягнутими цією моделлю. Тому почнімо.
StyleTTS2 для синтезу тексту до мови: Введення
StyleTTS2 – це інноваційна модель синтезу тексту до мови, яка робить наступний крок до створення людського рівня моделей мови, і вона побудована на основі моделі StyleTTS, яка є стильовою моделлю генерації мови.
StyleTTS2: Архітектура та методологія
У своїй основі StyleTTS2 побудована на своїй попередниці, моделі StyleTTS, яка є неавтономною моделлю мови, що використовує стильовий кодувач для отримання вектора стилю з аудіовхідних даних, що дозволяє генерувати виразну та природну мову. Вектор стилю, використовуваний у моделі StyleTTS, безпосередньо включений до кодувача, тривалості та передбачувача за допомогою адаптивної нормалізації екземплярів, що дозволяє моделі StyleTTS генерувати мовні виходи з різною просодією, тривалістю та навіть емоціями.
Навчання з кінцевими цілями для інтерференції
У моделі StyleTTS2 використовується підхід навчання з кінцевими цілями для оптимізації різних компонентів мови для інтерференції без використання фіксованих компонентів. Модель StyleTTS2 досягає цього, модифікуючи декодувач для генерації хвильової форми безпосередньо з вектора стилю, кривих піку та енергії, а також вирівняних представлень.
Дифузія стилю
Модель StyleTTS2 спрямована на моделювання мови як умовного розподілу через латентну змінну, яка слідує умовному розподілу, і ця змінна називається узагальненим стилем мови, і представляє будь-яку характеристику мовної вибірки за межами фонетичного змісту, включаючи лексичний наголос, просодію, швидкість мовлення та навіть переходи форманту.
Дискримінатори мовної моделі
Моделі мови відомі своєю загальною здатністю кодувати цінну інформацію про широкий спектр семантичних та акустичних аспектів, і представлення моделей мови традиційно能够 імітувати людське сприйняття для оцінки якості генерованої синтезованої мови. Модель StyleTTS2 використовує підхід антагоністичного навчання для використання можливостей кодувачів моделей мови для виконання генеративних завдань, і використовує 12-шарову модель WavLM як дискримінатор.
Диференційоване моделювання тривалості
Традиційно у моделях мови використовується передбачувач тривалості, який генерує тривалості фонем, але методи інтерполяції, які ці передбачувачі тривалості використовують, часто блокують потік градієнта під час процесу навчання з кінцевими цілями, і модель NaturalSpeech використовує уваговий інтерполятор для людського рівня синтезу мови.
Навчання та оцінка моделі
Модель StyleTTS2 навчена та експериментально перевірена на трьох наборах даних: VCTK, LibriTTS та LJSpeech. Односpeakerський компонент моделі StyleTTS2 навчений за допомогою набору даних LJSpeech, який містить близько 13 000 аудіозразків, розділених на 12 500 навчальних зразків, 100 валідних зразків та близько 500 тестових зразків, з загальною тривалістю близько 24 годин.
Результати
Підхід та методологія, використані у моделі StyleTTS2, демонструються у її продуктивності, оскільки модель перевершує кілька сучасних моделей мови, особливо на наборі даних NaturalSpeech, і встановлює новий стандарт для цього набору даних.
Заключні думки
У цій статті ми говорили про StyleTTS2, нову, стійку та інноваційну модель мови, яка побудована на основі моделі StyleTTS, і спрямована на презентацію наступного кроку до сучасних моделей мови. Модель StyleTTS2 моделює стилі мови як латентні випадкові змінні та використовує ймовірнісну дифузійну модель для вибірки цих стилів мови або випадкових змінних, що дозволяє моделі StyleTTS2 синтезувати реалістичну мову ефективно без використання аудіовхідних даних.












