Моделі та платформи ШІ
Дослідники створили модель штучного інтелекту, яка може співати китайською та англійською
Команда дослідників з Microsoft і університету Чжяджян недавно створила модель штучного інтелекту, яка може співати багатьма мовами. Як повідомляє VentureBeat, модель DeepSinger, розроблена командою була навчена на даних з різних музичних сайтів, використовуючи алгоритми, які захопили тембр голосу співака.
Генерування “голосу” штучного співака вимагає алгоритмів, які можуть передбачати і контролювати як висоту, так і тривалість аудіо. Коли люди співають, шуми, які вони видають, мають значно більш складні ритми і закономірності порівняно з простою мовою. Іншою проблемою, яку команда мала подолати, було те, що хоча існує достатня кількість даних для навчання мови, набори даних для навчання співу досить рідкісні. Об’єднавши ці виклики з тим фактом, що пісні потребують аналізу як звуку, так і тексту, проблема генерації співу вкрай складна.
Система DeepSinger, створена дослідниками, подолала ці виклики, розробивши потік даних, який видобував і перетворював аудіодані. Уривки співу були видобуті з різних музичних сайтів, а потім спів був виділений з решти аудіо і розділений на речення. Наступним кроком було визначення тривалості кожного фонеми в тексті, що призвело до серії зразків, кожний з яких представляв унікальну фонему в тексті. Очищення даних проводиться для боротьби з будь-якими спотвореними зразками навчання після того, як тексти і супровідні аудіозразки відсортовані за рівнем впевненості.
Ті самі методи здаються ефективними для різних мов. DeepSinger була навчена на вокальних зразках китайської, кантонської і англійської мов, складених з 89 різних співаків, які співали понад 92 години. Результати дослідження показали, що система DeepSinger була здатна надійно генерувати високоякісні “співочі” зразки згідно з метриками, такими як точність висоти і природність звучання співу. Дослідники попросили 20 осіб оцінити пісні, згенеровані DeepSinger, і пісні з навчальних даних згідно з цими метриками, і розрив між оцінками згенерованих зразків і справжнього аудіо був досить малим. Учасники дали DeepSinger середній бал оцінки, який відрізнявся між 0,34 і 0,76.
Оглядаючись у майбутнє, дослідники хочуть спробувати покращити якість згенерованих голосів, спільно тренуючи різні підмоделі, які складають DeepSinger, з допомогою спеціальних технологій, таких як WaveNet, які призначені конкретно для генерації природньо звучного мовлення через аудіо-відрізки.
Система DeepSinger могла б бути використана для допомоги співакам і іншим музичним артистам у виправленні їхньої роботи без необхідності повертатися в студію для ще однієї записувальної сесії. Вона також потенційно могла б бути використана для створення аудіо- deepfake, роблячи так, щоб здавалося, що артист заспівав пісню, якої він насправді не співав. Хоча вона могла б бути використана для пародії або сатири, її використання також має сумнівну законність.
DeepSinger – це лише одна з хвилі нових систем штучного інтелекту для музики і аудіо, які можуть трансформувати спосіб взаємодії музики і програмного забезпечення. OpenAI недавно випустила свою власну систему штучного інтелекту, дубльовану JukeBox, яка здатна створювати оригінальні музичні треки в стилі певного жанру або навіть конкретного артиста. Інші музичні інструменти штучного інтелекту включають Google’s Magenta (GOOGL ) і Amazon’s DeepComposer (AMZN ). Magenta – це відкрита бібліотека маніпулювання аудіо (і зображеннями), яка може бути використана для створення всього, від автоматичного барабанного супроводу до простих музичних відеоігор. Тим часом Amazon’s DeepComposer орієнтована на тих, хто хоче тренувати і налаштовувати свої власні музичні моделі глибокого навчання, дозволяючи користувачеві брати попередньо натреновані зразкові моделі і налаштовувати моделі відповідно до своїх потреб. Ви можете послухати деякі аудіозразки, згенеровані DeepSinger, за цим посиланням.












