Модели и платформы ИИ
OpenAI Создает Новую Программу AI Для Создания Музыки На Основе Жанров
Независимая исследовательская организация OpenAI недавно выпустила новую форму генеративного ИИ под названием Jukebox, названную так из-за ее способности генерировать музыку. ИИ Jukebox может генерировать звуки на основе атрибутов, таких как инструментовка и даже тексты песен, и команда исследователей OpenAI создала этот ИИ, обучая его сжатым аудиоклипам и различными фрагментами текстов песен.
При создании Jukebox OpenAI должна была разработать метод решения проблемы сложной и плотной природы аудио. Исследователи справились с непрерывной природой аудио, разбивая его на более дискретные и усваиваемые части, разделив песни на фрагменты, которые составляют 1/128 секунды. Целью было создание модели ИИ, способной разбить песни на части, достаточно большие, чтобы проблема не стала неразрешимой, но достаточно маленькие и точные, чтобы модели могли выучить закономерность песни и воссоздать эту закономерность.
Техника, используемая OpenAI, имеет некоторые общие черты с более старым ИИ для генерации музыки, который компания ранее производила, под названием MuseNet. MuseNet был обучен на файлах MIDI и был способен генерировать музыку в различных стилях, хотя он фокусировался на общей мелодии песни и не мог производить тексты песен. В отличие от этого, Jukebox может писать свои собственные тексты песен, чтобы сопровождать музыку. Тексты песен “соавторствуются” исследователями OpenAI, направляя модель на создание текстов в определенных стилях. Система Jukebox была обучена на текстах песен, собранных из LyricWiki, с обучающими данными, состоящими из текста и метаданных на 1,2 миллиона песен.
Когда речь идет о текстах песен модели, исследователи сначала попробовали использовать простой эвристический метод, растянув тексты песен примерно на продолжительность песни, анализируя текст, соответствующий определенному фрагменту/сегменту песни. Этот простой подход работал хорошо в целом, хотя исследователи обнаружили, что когда тексты песен были особенно быстрыми, он разваливался. Чтобы решить эту проблему, были извлечены вокалы из песни и выровнены с текстом песни, чтобы получить выравнивание текста песни на уровне слов. После этого был использован слой кодирования для текста песни вместе со слоем внимания, который сопоставлял части музыки с текстом песни, используя пары ключ-значение. В результате тексты песен и вокалы имели довольно точное совпадение.
Авторы статьи также отмечают, что существует несколько ограничений, которые имеет Jukebox, и что будущая работа будет направлена на улучшение способности ИИ. Как пишут авторы в блоге :
“Хотя Jukebox представляет собой шаг вперед в музыкальном качестве, связности, длине аудио и способности условиться на артиста, жанр и тексты песен, существует значущий разрыв между этими генерациями и музыкой, созданной человеком. Например, хотя сгенерированные песни демонстрируют локальную музыкальную связность, следуют традиционным аккордовым узорам и могут даже включать впечатляющие соло, мы не слышим знакомых более крупных музыкальных структур, таких как припевы, которые повторяются.”
В настоящее время модель способна производить песню, которая узнаваемо находится в стиле определенного жанра или даже определенного артиста. Например, она может производить песни в стиле Элвиса Пресли, Кэти Перри или Rage Against the Machine. Хотя песни узнаваемо находятся в жанре или тематически связаны с стилем певца, они также довольно грубы, часто звучащие как пародия или плохая кавер-версия песни. Тем не менее, техническое достижение впечатляет. Исследователи, ответственные за создание системы генерации ИИ, выбрали работу над программой, способной генерировать музыку, специально потому, что задача была трудной, и исследователи планируют продолжать совершенствовать свои методы. Вы можете послушать некоторые из песен здесь.












