Modele i platformy AI
OpenAI Tworzy Nowy Program AI Do Tworzenia Muzyki Na Podstawie Gatunków
Niezależna organizacja badawcza OpenAI niedawno wydała nową formę generatywnego AI o nazwie Jukebox, nazwaną tak ze względu na jej zdolność do generowania muzyki. Jukebox AI jest w stanie generować dźwięki na podstawie atrybutów takich jak instrumentacja i nawet teksty piosenek, a zespół badawczy OpenAI stworzył AI, szkoląc ją na skompresowanych klipach audio i różnych fragmentach tekstów piosenek.
Jak donosi TechCrunch , badacze OpenAI szkolili model, używając surowych klipów audio, dając modelowi możliwość produkcji audio. Jest to w przeciwieństwie do podejść stosowanych w przypadku innych aplikacji generujących muzykę, które często opierają się na „symbolicznej muzyce” (jak muzyka MIDI), która jest informacją o nutach i wysokościach, ale nie rzeczywistym audiu. Zespół badawczy wykorzystał sieci neuronowe zwinięte do szkolenia modelu, kompresując audio i kodując je w formacie, który sieć neuronowa mogła zinterpretować. Następnie wykorzystano transformator do generowania skompresowanego audio, które zostało przekonwertowane w celu przekształcenia danych w format audio.
Podczas tworzenia Jukebox, OpenAI musiało stworzyć metodę radzenia sobie z złożoną, gęstą naturą audio. Badacze radzili sobie z ciągłą naturą audio, dzieląc ją na bardziej dyskretne, strawne sekcje, dzieląc piosenki na kawałki, które są 1/128 sekundy długości. Celem było stworzenie modelu AI, który mógłby rozbić piosenki na kawałki wystarczająco duże, aby problem nie stał się nie do pokonania, a jednocześnie wystarczająco małe i precyzyjne, aby modele mogły nauczyć się wzorca piosenki i odtworzyć ten wzorzec.
Technika wykorzystana przez OpenAI ma pewne podobieństwa do starszego AI generującego muzykę, które firma wyprodukowała, o nazwie MuseNet. MuseNet został wyszkolony na plikach MIDI i był w stanie generować muzykę w różnych stylach, chociaż koncentrował się na ogólnym melodie piosenki i nie mógł produkować tekstów. W przeciwieństwie do tego, Jukebox jest w stanie pisać własne teksty do muzyki. Teksty są „współpisane” przez badaczy OpenAI, kierując model w stronę tworzenia tekstów w określonym stylu. System Jukebox został wyszkolony na tekstach pobranych z LyricWiki, a dane szkoleniowe składały się z tekstu i metadanych na 1,2 miliona piosenek.
Gdy chodzi o teksty modelu, badacze najpierw próbowali użyć prostego heurystycznego podejścia, które rozciągało teksty do przybliżonej długości piosenki, analizując tekst, który odpowiadał określonemu kawałkowi/segmentowi piosenki. To proste podejście działało dobrze w ogóle, chociaż badacze stwierdzili, że gdy teksty były szczególnie szybkie, to podejście zawiodło. Aby rozwiązać ten problem, wokale zostały wyodrębnione z piosenki i wyrównane z tekstem, aby uzyskać słowo-po-słowie wyrównanie dla tekstów. Następnie warstwa kodowania została użyta dla tekstów wraz z warstwą uwagi, która mapowała sekcje muzyki na teksty za pomocą par klucz-wartość. W efekcie teksty i wokale miały dość precyzyjne dopasowanie.
Autorzy artykułu zauważają również, że istnieją pewne ograniczenia, których Jukebox posiada, i że przyszła praca będzie miała na celu poprawienie możliwości AI. Jak autorzy piszą w poście na blogu:
„Chociaż Jukebox reprezentuje krok naprzód w jakości muzycznej, spójności, długości próbki audio i możliwości warunkowania na artystę, gatunek i teksty, istnieje znacząca luka między tymi generacjami a muzyką stworzoną przez ludzi. Na przykład, chociaż wygenerowane piosenki pokazują lokalną spójność muzyczną, podążają za tradycyjnymi wzorcami akordów i mogą nawet zawierać imponujące solówki, nie słyszymy znanych większych struktur muzycznych, takich jak refreny, które się powtarzają.”
Obecnie model jest w stanie produkować piosenkę, która jest rozpoznawalna w stylu określonego gatunku lub nawet określonego artysty. Na przykład, może produkować piosenki w stylu Elvisa Presleya, Katy Perry lub Rage Against the Machine. Chociaż piosenki są rozpoznawalne w gatunku lub stylu określonego artysty, są one również dość szorstkie, często brzmiąc jak parodia lub słaba wersja piosenki. Niemniej, osiągnięcie techniczne jest imponujące. Badacze odpowiedzialni za stworzenie systemu generacji AI wybrali pracę nad programem zdolnym do generowania muzyki specjalnie dlatego, że zadanie było trudne, a badacze planują kontynuować doskonalenie swoich technik. Można posłuchać niektórych piosenek tutaj.












