Модели и платформы ИИ
Использование искусственного интеллекта в музыке становится всё более сложным
Применение искусственного интеллекта в музыке увеличивается уже несколько лет. Как объясняет Кumba Sennaar, три текущих применения ИИ в музыкальной индустрии лежат в области композиции музыки, потокового воспроизведения музыки и монетизации музыки, где платформы ИИ помогают артистам монетизировать свою музыкальную контент на основе данных о деятельности пользователей.
Все началось в 1957 году, когда Learn Hiller и Leonard Issacson запрограммировали Illiac I для создания “Illiac Suite для струнного квартета”, первого произведения, полностью написанного искусственным интеллектом, а затем, 60 лет спустя, это превратилось в полноценные альбомы, такие как альбом Taryn Southern, произведенный Amper Music в 2017 году. В настоящее время у Southern более 452 тысяч подписчиков на YouTube, и песня “Lovesick” из альбома была прослушана и просмотрена более 45 тысяч раз.
Но с тех пор применение ИИ в этой области стало более сложным и разветвленным. Open AI создал MuseNet, как объясняет компания, “глубокую нейронную сеть, которая может генерировать 4-минутные музыкальные композиции с 10 разными инструментами и может объединять стили от кантри до Моцарта до The Beatles. MuseNet не был явно запрограммирован с нашим пониманием музыки, а вместо этого открыл закономерности гармонии, ритма и стиля, изучая hundreds тысяч MIDI-файлов. MuseNet использует ту же общую цельную несупервизированную технологию, что и GPT-2, крупномасштабную трансформер-модель, обученную предсказывать следующий токен в последовательности, будь то аудио или текст.”
С другой стороны, как сообщает GeekWire, среди других, доктор МICK Гриерсон, компьютерный ученый и музыкант из Goldsmiths, University of London, был недавно поручен итальянским производителем автомобилей Fiat создать список 50 самых иконических поп-песен с помощью алгоритмов. Его аналитическое программное обеспечение использовалось для определения того, что делает песни заметными, включая ключ, количество ударов в минуту, разнообразие аккордов, содержание текста, разнообразие тембра и звуковую вариацию.”
Согласно его результатам, песня, которая имела лучшую комбинацию заданных параметров, была Nirvana’s “Smells Like Teen Spirit”, опередив U2’s “One” и John Lennon’s “Imagine”. Песня Nirvana была затем использована FIAT для продвижения новой модели FIAT 500. Гриерсон объяснил, что алгоритмы показали, что ‘звуки, которые используются в этих песнях, и то, как они объединены, является высоко уникальным в каждом случае.’
Другое применение было подготовлено библиотекой musicnn, которая, как объясняется, использует глубокие сверточные нейронные сети для автоматического тегирования песен. Модели, которые включены, достигают лучших результатов в публичных оценочных бенчмарках.” Музыка (как музыкант) и ее лучшие модели были выпущены как библиотека с открытым исходным кодом. Проект был разработан Music Technology Group of the Universitat Pompeu Fabra, расположенной в Барселоне, Испания.
В своем анализе применения Jordi Pons использовал musicnn для анализа и тегирования другой иконической песни, Queen’s “Bohemian Rhapsody.” Он заметил, что вокал Фредди Меркьюри был помечен как женский голос, в то время как его другие прогнозы были довольно точными. Сделав musicnn доступным как открытый исходный код, становится возможным дальнейшее усовершенствование процесса тегирования.
Сообщая об использовании ИИ в музыкальном стриминге, Digital Music News заключает, что “введение искусственного интеллекта и технологий машинного обучения значительно улучшило способ, которым мы слушаем музыку. Благодаря быстрым достижениям в области ИИ и подобных технологий, мы, скорее всего, увидим множество футуристических улучшений в ближайшие годы.”












