Modele i platformy AI

Użycie sztucznej inteligencji w muzyce staje się coraz bardziej zaawansowane

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Zastosowanie sztucznej inteligencji w muzyce zwiększa się od kilku lat. Jak wyjaśnia Kumba Sennaar, trzy obecne zastosowania AI w przemyśle muzycznym dotyczą kompozycji muzyki, transmisji muzyki i monetyzacji muzyki, gdzie platformy AI pomagają artystom monetyzować swoją zawartość muzyczną na podstawie danych z aktywności użytkowników.

Wszystko zaczęło się w 1957 roku, kiedy Lejaren Hiller i Leonard Issacson zaprogramowali Illiac I, aby wyprodukował “Illiac Suite for String Quartet”, pierwsze dzieło w całości napisane przez sztuczną inteligencję. 60 lat później, w 2017 roku, powstały całe albumy, takie jak album Taryn Southern, wyprodukowany przez Amper Music. Obecnie Taryn Southern ma ponad 452 tysiące subskrybentów na YouTube, a jej piosenka “Lovesick” była odtworzona i wyświetlona przez ponad 45 000 widzów.

Jednak od tego czasu zastosowanie AI w tym polu stało się bardziej zaawansowane i rozgałęzione. Open AI stworzyło MuseNet, które, jak wyjaśnia firma, jest “głęboką siecią neuronową, która może generować 4-minutowe kompozycje muzyczne z 10 różnymi instrumentami i łączyć style od country do Mozarta do The Beatles. MuseNet nie został wyraźnie zaprogramowany z naszym zrozumieniem muzyki, ale odkrył wzorce harmonii, rytmu i stylu, ucząc się przewidywać następny token w setkach tysięcy plików MIDI. MuseNet wykorzystuje tę samą ogólną, nienadzorowaną technologię co GPT-2, duży model transformatora, który został przeszkolony do przewidywania następnego tokenu w sekwencji, niezależnie od tego, czy jest to dźwięk, czy tekst.

Z drugiej strony, jak donosi GeekWire, Dr. Mick Grierson, komputerowy naukowiec i muzyk z Goldsmiths, University of London, został niedawno zlecony przez włoskiego producenta samochodów Fiat do stworzenia listy 50 najbardziej ikonicznych piosenek pop z wykorzystaniem algorytmów. Jego oprogramowanie analityczne zostało wykorzystane do “określenia czynników, które sprawiają, że piosenki są godne uwagi, w tym klucz, liczbę uderzeń na minutę, różnorodność akordów, treść tekstów, różnorodność barwy dźwięku i zmienność dźwięku.

Według jego wyników, piosenka, która miała najlepszą kombinację tych parametrów, była “Smells Like Teen Spirit” Nirvany, przed “One” U2 i “Imagine” Johna Lennona. Piosenka Nirvany została następnie wykorzystana przez FIAT do promocji nowego modelu FIAT 500. Grierson wyjaśnił, że algorytmy pokazały, że “dźwięki, które te piosenki wykorzystują, i sposób, w jaki są łączone, są wysoce unikalne w każdym przypadku.

Inne zastosowanie zostało przygotowane przez bibliotekę musicnn, która, jak wyjaśnia, wykorzystuje głębokie sieci neuronowe do automatycznego tagowania piosenek. Modele “które są zawarte osiągają najlepsze wyniki w publicznych benchmarkach oceny.” Muzyka (jak muzyk) i jej najlepsze modele zostały wydane jako biblioteka open-source. Projekt został opracowany przez Music Technology Group of the Universitat Pompeu Fabra, zlokalizowaną w Barcelonie, Hiszpania.

W swojej analizie zastosowania, Jordi Pons wykorzystał musicnn do analizy i tagowania innego ikonicznego utworu, “Bohemian Rhapsody” Queen. Zauważył, że śpiewający głos Freddiego Mercury’ego został otagowany jako głos kobiecy, podczas gdy jego inne przewidywania były dość dokładne. Udział musicnn jako open-source umożliwia dalsze udoskonalenie procesu tagowania.

W raporcie o zastosowaniu AI w transmisji muzyki, Digital Music News stwierdza, że “wprowadzenie sztucznej inteligencji i technologii machine learning znacznie poprawiło sposób, w jaki słuchamy muzyki. Dzięki szybkim postępom w AI i podobnych technologiach, prawdopodobnie zobaczymy wiele futurologicznych ulepszeń w nadchodzących latach.”

Były dyplomata i tłumacz dla UN, obecnie wolny strzelec/journalista/pisarz/badacz, koncentrujący się na nowoczesnej technologii, sztucznej inteligencji i nowoczesnej kulturze.