Модели и платформы ИИ

OpenAI Создает Новую Программу AI Для Создания Музыки На Основе Жанров

mm
Добавьте Unite.AI в избранные источники в Google

Независимая исследовательская организация OpenAI недавно выпустила новую форму генеративного ИИ под названием Jukebox, названную так из-за ее способности генерировать музыку. ИИ Jukebox может генерировать звуки на основе атрибутов, таких как инструментовка и даже тексты песен, и команда исследователей OpenAI создала этот ИИ, обучая его сжатым аудиоклипам и различными фрагментами текстов песен.

Как сообщает TechCrunch , исследователи OpenAI обучили модель, используя сырые аудиоклипы, давая модели возможность производить аудио. Это отличается от подходов, используемых для создания других приложений генерации музыки, которые часто полагаются на “символическую музыку” (например, музыку в формате MIDI), которая представляет собой информацию о нотах и высотах, но не реальное аудио. Команда исследователей использовала свёрточные нейронные сети для обучения модели, сжимая аудио и кодируя его в формат, который нейронная сеть могла интерпретировать. После этого был использован трансформер для генерации сжатого аудио, которое было расширено для преобразования данных в аудиоформат.

При создании Jukebox OpenAI должна была разработать метод решения проблемы сложной и плотной природы аудио. Исследователи справились с непрерывной природой аудио, разбивая его на более дискретные и усваиваемые части, разделив песни на фрагменты, которые составляют 1/128 секунды. Целью было создание модели ИИ, способной разбить песни на части, достаточно большие, чтобы проблема не стала неразрешимой, но достаточно маленькие и точные, чтобы модели могли выучить закономерность песни и воссоздать эту закономерность.

Техника, используемая OpenAI, имеет некоторые общие черты с более старым ИИ для генерации музыки, который компания ранее производила, под названием MuseNet. MuseNet был обучен на файлах MIDI и был способен генерировать музыку в различных стилях, хотя он фокусировался на общей мелодии песни и не мог производить тексты песен. В отличие от этого, Jukebox может писать свои собственные тексты песен, чтобы сопровождать музыку. Тексты песен “соавторствуются” исследователями OpenAI, направляя модель на создание текстов в определенных стилях. Система Jukebox была обучена на текстах песен, собранных из LyricWiki, с обучающими данными, состоящими из текста и метаданных на 1,2 миллиона песен.

Когда речь идет о текстах песен модели, исследователи сначала попробовали использовать простой эвристический метод, растянув тексты песен примерно на продолжительность песни, анализируя текст, соответствующий определенному фрагменту/сегменту песни. Этот простой подход работал хорошо в целом, хотя исследователи обнаружили, что когда тексты песен были особенно быстрыми, он разваливался. Чтобы решить эту проблему, были извлечены вокалы из песни и выровнены с текстом песни, чтобы получить выравнивание текста песни на уровне слов. После этого был использован слой кодирования для текста песни вместе со слоем внимания, который сопоставлял части музыки с текстом песни, используя пары ключ-значение. В результате тексты песен и вокалы имели довольно точное совпадение.

Авторы статьи также отмечают, что существует несколько ограничений, которые имеет Jukebox, и что будущая работа будет направлена на улучшение способности ИИ. Как пишут авторы в блоге :

“Хотя Jukebox представляет собой шаг вперед в музыкальном качестве, связности, длине аудио и способности условиться на артиста, жанр и тексты песен, существует значущий разрыв между этими генерациями и музыкой, созданной человеком. Например, хотя сгенерированные песни демонстрируют локальную музыкальную связность, следуют традиционным аккордовым узорам и могут даже включать впечатляющие соло, мы не слышим знакомых более крупных музыкальных структур, таких как припевы, которые повторяются.”

В настоящее время модель способна производить песню, которая узнаваемо находится в стиле определенного жанра или даже определенного артиста. Например, она может производить песни в стиле Элвиса Пресли, Кэти Перри или Rage Against the Machine. Хотя песни узнаваемо находятся в жанре или тематически связаны с стилем певца, они также довольно грубы, часто звучащие как пародия или плохая кавер-версия песни. Тем не менее, техническое достижение впечатляет. Исследователи, ответственные за создание системы генерации ИИ, выбрали работу над программой, способной генерировать музыку, специально потому, что задача была трудной, и исследователи планируют продолжать совершенствовать свои методы. Вы можете послушать некоторые из песен здесь.

Блогер и программист с специализацией в Machine Learning и Deep Learning темах. Daniel надеется помочь другим использовать силу ИИ для социального блага.