Модели и платформы ИИ
Исследователи создали модель ИИ, способную петь на китайском и английском языках
Команда исследователей из Microsoft и университета Чжэцзян недавно создала модель ИИ, способную петь на numerous языках. Как сообщает VentureBeat, модель ИИ DeepSinger, разработанная командой была обучена на данных с различных музыкальных сайтов, используя алгоритмы, которые захватывали тембр голоса певца.
Генерация “голоса” модели ИИ требует алгоритмов, способных предсказывать и контролировать как высоту, так и продолжительность аудио. Когда люди поют, производимые ими звуки имеют гораздо более сложные ритмы и узоры по сравнению с простой речью. Другой проблемой, которую команда должна была преодолеть, было то, что, хотя существует много данных для обучения речи, наборы данных для обучения пению довольно редки. Объединение этих проблем с тем, что песни необходимо проанализировать как звук, так и текст, делает задачу генерации пения невероятно сложной.
Система DeepSinger, созданная исследователями, преодолела эти проблемы, разработав конвейер данных, который извлекал и преобразовывал аудиоданные. Клипы пения были извлечены из различных музыкальных сайтов, а затем пение было выделено из остальной части аудио и разделено на предложения. Следующий шаг заключался в определении продолжительности каждого фонемы в тексте, в результате чего получилась серия образцов, каждый из которых представлял уникальный фонему в тексте. Очистка данных производится для борьбы с искаженными образцами обучения после того, как текст и сопровождающие аудио-образцы отсортированы по баллу уверенности.
Те же методы, кажется, работают для различных языков. DeepSinger была обучена на китайских, кантонских и английских вокальных образцах, составленных из 89 разных певцов, поющих более 92 часов. Результаты исследования показали, что система DeepSinger смогла надежно генерировать высококачественные “песенные” образцы по метрикам, таким как точность высоты и естественность звука. Исследователи попросили 20 человек оценить песни, сгенерированные DeepSinger, и тренировочные песни по этим метрикам, и разрыв между оценками для сгенерированных образцов и подлинного аудио был довольно небольшим. Участники дали DeepSinger средний балл мнения, который отклонялся от 0,34 до 0,76.
В будущем исследователи хотят попытаться улучшить качество сгенерированных голосов, обучая совместно различные подмодели, составляющие DeepSinger, с помощью специальных технологий, таких как WaveNet, предназначенных специально для генерации естественно звучащей речи через аудио-волны.
Система DeepSinger может быть использована для помощи певцам и другим музыкальным артистам в исправлении их работы без необходимости возвращаться в студию для другой записи. Она также потенциально может быть использована для создания аудио-DeepFake, делая так, чтобы казалось, что артист спел песню, которую он никогда не пел на самом деле. Хотя она может быть использована для пародии или сатиры, это также вопросом сомнительной законности.
DeepSinger – это только одна из новой волны ИИ-основанных музыкальных и аудиосистем, которые могут изменить то, как музыка и программное обеспечение взаимодействуют. OpenAI недавно выпустила свою собственную систему ИИ, названную JukeBox, которая способна производить оригинальные музыкальные треки в стиле определенного жанра или даже конкретного артиста. Другие музыкальные инструменты ИИ включают Google’s Magenta и Amazon’s DeepComposer (AMZN ). Magenta – это библиотека манипуляции аудио (и изображениями) с открытым исходным кодом, которая может быть использована для производства всего, от автоматического барабанного сопровождения до простых музыкальных видеоигр. Тем временем Amazon’s DeepComposer ориентирована на тех, кто хочет обучать и настраивать свои собственные музыкальные модели глубокого обучения, позволяя пользователю брать предварительно обученные образцы моделей и настраивать модели в соответствии со своими потребностями.
(GOOGL )Вы можете послушать некоторые аудио-образцы, сгенерированные DeepSinger, по этой ссылке.












