Моделі та платформи ШІ

Використання штучного інтелекту в музиці стає дедалі більш складним

mm
Додайте Unite.AI до бажаних джерел у Google

Застосування штучного інтелекту в музиці збільшується вже кілька років. Як пояснює Кумба Сеннар, три поточні застосування штучного інтелекту в музичній індустрії лежать у сфері музичної композиції, музичного стрімінгу та музичної монетизації, де платформи штучного інтелекту допомагають артистам монетизувати свій музичний контент на основі даних про активність користувачів.

Все почалося ще у 1957 році, коли Лерн Хіллер і Леонард Ісааксон програмували Illiac I для створення “Illiac Suite for String Quartet”, першої роботи, повністю написаної штучним інтелектом. Потім, через 60 років, це переросло у повноцінні альбоми, такі як альбом Тарін Саутерн, створений компанією Amper Music у 2017 році. Наразі Тарін Саутерн має понад 452 тисячі підписників на YouTube, а пісня “Lovesick” з цього альбому була прослухана і переглянута понад 45 тисячами користувачів.

Але з тих пір застосування штучного інтелекту в цій сфері стало ще більш складним і розгалуженим. Open AI створила MuseNet, про яку компанія говорить, що це “глибока нейронна мережа, яка може генерувати 4-хвилинні музичні композиції з 10-ма різними інструментами і може поєднувати стилі від кантрі до Моцарта і Beatles. MuseNet не була явно запрограмована нашим розумінням музики, а натомість відкрила закономірності гармонії, ритму і стилю шляхом навчання передбачення наступного токену в сотнях тисяч файлів MIDI. MuseNet використовує ту ж саму загальну безопeraційну технологію, що і GPT-2, великомасштабна модель трансформера, навчена передбачати наступний токен у послідовності, будь то аудіо чи текст.

З іншого боку, як повідомляє GeekWire, серед інших, доктор Мік Гріерсон, комп’ютерний вчений і музикант з Goldsmiths, University of London, був недавно замовлений італійським виробником автомобілів Fiat для створення списку 50 найіконічних поп-пісень за допомогою алгоритмів. Його аналітичне програмне забезпечення було використано для визначення того, що робить ці пісні помітними, включаючи ключ, кількість ударів на хвилину, різноманітність акордів, ліричний зміст, тимбральне різноманіття і звукову варіацію.

За результатами його дослідження, пісня, яка мала найкращу комбінацію цих параметрів, була “Smells Like Teen Spirit” групи Nirvana, попереду пісень “One” групи U2 і “Imagine” Джона Леннона. Пісня Nirvana була потім використана компанією FIAT для просування своєї нової моделі FIAT 500. Гріерсон пояснив, що алгоритми показали, що “звуки, які використовуються в цих піснях, і спосіб їх поєднання є високо унікальним у кожному випадку”.

Іншим застосуванням став проєкт musicnn, який, як пояснюється, використовує глибокі конволюційні нейронні мережі для автоматичного тегування пісень. Моделі, які включені в проєкт, “досягають найкращих результатів у публічних оцінках”. Найкращі моделі проєкту були випущені як відкритий бібліотеки. Проєкт був розроблений групою Music Technology Group університету Pompeu Fabra, розташованого в Барселоні, Іспанія.

У своєму аналізі застосування цього проєкту Джорді Понс використав musicnn для аналізу і тегування іншої іконічної пісні, “Bohemian Rhapsody” групи Queen. Він помітив, що співочий голос Фредді Мерк’юрі був позначений як жіночий голос, тоді як інші передбачення були досить точними. Надання musicnn у відкритому доступі дозволяє подальше удосконалення процесу тегування.

У звіті про використання штучного інтелекту в музичному стрімінгу Digital Music News висновує, що “введення штучного інтелекту і технологій машинного навчання суттєво покращило спосіб, яким ми слухаємо музику. Завдяки швидким досягненням у сфері штучного інтелекту і подібних технологій, ми, ймовірно, побачимо багато футуристичних удосконалень у найближчі роки”.

Колишній дипломат і перекладач для ООН, зараз фріланс-журналіст/письменник/дослідник, зосереджений на сучасних технологіях, штучному інтелекті та сучасній культурі.