Моделі та платформи ШІ

Розробники ігор розглядають можливість використання технології голосової AI для нових творчих можливостей

mm
Додайте Unite.AI до бажаних джерел у Google

Технологія звукової синтезу, зокрема синтезу мови, стала значно більш досконалою за останні роки. Хоча технологія тексту-в-мову існувала протягом десятиліть, вона стала значно більш природною. Останні алгоритми можуть витворити високо реалістичні аудіозразки за кілька годин аудіо. По мірі розвитку технології відкриваються нові застосування, включаючи можливості в творчих медіа. Нещодавно, як повідомлялося VentureBeat, компанії, що розробляють відеоігри, розпочали дослідження використання генерації голосу AI для створення діалогів для відеоігор.

Одна з компаній, Leviathan Games, розпочала впровадження технології голосової AI у іграх, які зараз розробляються. Власник Leviathan Games Ваєт Рідгвей пояснив, що технологія голосової AI може суттєво змінити дизайн ігор. Рідгвей порівняв використання технології голосової AI у дизайні ігор з тим, як програмне забезпечення 3D-анімації змінилося за останні десять років, коли компанії, такі як Pixar, створювали власне програмне забезпечення для анімації та моделювання.

Традиційні методи генерації мови працюють шляхом додавання попередньо записаних звукових файлів на льоту, зшиваючи речення з попередньо існуючих слів і фраз. Цей метод генерації мови вимагає запису сотень годин діалогів і ручного маркування звукових кліпів. Він також звучить дещо нерівномірно, оскільки інтонація та акцент мають тенденцію зміщуватися через слова. Навпаки, сучасна технологія голосової AI звучить значно більш природньо і працює інакше.

Технологія голосової AI заснована на глибоких нейронних мережах. WaveNet була однією з перших AI, яка могла генерувати переконливі, природні аудіозразки. Оскільки звукові зразки генеруються з нуля, немає потреби попередньо записувати сотні годин діалогів, якщо є достатньо тренувальних даних. Оптимізовані GAN і моделі LSTM можуть генерувати аудіо після навчання лише на декілька годин позначених аудіо. Результати можуть бути надзвичайно переконливими, наприклад, коли експеримент Google (GOOGL ) Duplex викликав у салону краси, щоб записатися на прийом.

По мірі того, як ці технології стають більш потужними, стандартизованими та легко доступними через хмарні обчислення, ймовірно, що更多 розробників ігор будуть використовувати технологію голосової AI, щоб скоротити час виробництва та витрати. Деякі компанії вже створюють моделі, які потенційно можуть бути використані розробниками ігор. Replica Studios спеціалізується на технології голосової AI, і деякі аудіозразки, згенеровані їхньою технологією, можна прослухати за посиланнями тут і тут.

Неможливо, щоб розробники ігор відмовилися від використання акторів голосу на користь AI. Насправді, технологія голосової AI може відкрити більше можливостей для акторів голосу. Зараз багато компаній, що розробляють ігри, часто відмовляються від озвучування діалогів через часові та фінансові витрати, пов’язані з створенням озвучених діалогів. Актори голосу часто повинні повертатися для додаткових сесій запису, якщо є зміни в сценарії або якщо режисери ігор хочуть іншого типу виконання. Технологія голосової AI може бути використана для експериментів з діалогами, отримання відчуття того, які зміни в сценарії та ревізії потрібно зробити, перш ніж запросити професійного актора голосу для запису сценарію. Це може привести до того, що більше компаній матимуть ресурси для інвестування у створення озвучених діалогів.

Моделі голосової AI навіть можуть бути натреновані на голос конкретного актора голосу, і AI можна використовувати для генерації тривіальних діалогових кліпів, якщо актор отримує оплату за використання свого голосу. Як повідомлялося VentureBeat, актори голосу, такі як Саймон Дж. Сміт, оптимістично ставляться до зростання використання моделей голосової AI та їх потенціалу для відкриття нових можливостей для акторів голосу.

Поза використанням технології голосової AI для прототипування сценаріїв або створення озвучених рядків для другорядних персонажів, розробники ігор також можуть використовувати технологію голосової AI, щоб дати гравцям більше можливостей для налаштування ролевих ігор. Зараз навіть ігри, які дозволяють гравцям вибирати голос для своїх аватарів, зазвичай мають лише кілька варіантів. З використанням технології голосової AI варіанти можуть бути функціонально безмежними.

Блогер і програміст з спеціалізацією у темах Machine Learning і Deep Learning. Даніель сподівається допомогти іншим використовувати силу штучного інтелекту для соціальної добробути.