Modele i platformy AI
Sztuczna inteligencja generująca muzykę: Stability Audio, Google’s MusicLM i więcej
Muzyka, forma sztuki, która rezonuje z ludzką duszą, była naszym stałym towarzyszem. Tworzenie muzyki przy użyciu sztucznej inteligencji rozpoczęło się kilka dekad temu. Początkowo próby były proste i intuicyjne, z podstawowymi algorytmami tworzącymi monotonne melodie. Jednak wraz z postępem technologicznym, rosły również złożoność i możliwości generatorów muzyki AI, tworząc drogę dla głębokiego uczenia się i przetwarzania języka naturalnego (NLP), aby odegrać kluczową rolę w tej technologii.
Dziś platformy takie jak Spotify wykorzystują AI do doskonalenia doświadczeń słuchowych swoich użytkowników. Te algorytmy głębokiego uczenia się rozcinają indywidualne preferencje na podstawie różnych elementów muzycznych, takich jak tempo i nastrój, aby tworzyć spersonalizowane sugestie piosenek. Analizują również szersze wzorce słuchania i przeszukują internet w poszukiwaniu dyskusji o piosenkach, aby tworzyć szczegółowe profile piosenek.
Pochodzenie AI w muzyce: Podróż od kompozycji algorytmicznej do modelowania generatywnego
Na wczesnych etapach AI w świecie muzyki, od lat 50. do 70., główny nacisk kładziono na kompozycję algorytmiczną. Była to metoda, w której komputery używały określonego zestawu reguł do tworzenia muzyki. Pierwszym godnym uwagi tworem z tego okresu była Illiac Suite for String Quartet w 1957 roku. Używała algorytmu Monte Carlo, procesu zaangażowanego w losowe numery, aby określić wysokość i rytm w ramach tradycyjnej teorii muzycznej i prawdopodobieństwa statystycznego.
W tym czasie inny pionier, Iannis Xenakis, wykorzystywał procesy stochastyczne, pojęcie obejmujące losowe rozkłady prawdopodobieństwa, do tworzenia muzyki. Używał komputerów i języka FORTRAN, aby połączyć wiele funkcji prawdopodobieństwa, tworząc wzór, w którym różne przedstawienia graficzne odpowiadały różnym przestrzeniom dźwiękowym.
Złożoność tłumaczenia tekstu na muzykę
Muzyka jest przechowywana w bogatym i wielowymiarowym formacie danych, który obejmuje elementy takie jak melodia, harmonia, rytm i tempo, co sprawia, że zadanie tłumaczenia tekstu na muzykę jest bardzo złożone. Standardowa piosenka jest reprezentowana przez prawie milion liczb w komputerze, liczba znacznie wyższa niż inne formaty danych, takie jak obrazy, tekst itp.
Obszar generacji audio jest świadkiem innowacyjnych podejść do pokonania wyzwań tworzenia realistycznego dźwięku. Jedną z metod jest generowanie spektrogramu, a następnie przekształcenie go z powrotem w audio.
Inna strategia wykorzystuje symboliczną reprezentację muzyki, taką jak nuty, która może być interpretowana i odtwarzana przez muzyków. Ta metoda została z powodzeniem zdigitalizowana, z narzędziami takimi jak Chamber Ensemble Generator Magenta, tworzącym muzykę w formacie MIDI, protokole, który ułatwia komunikację między komputerami a instrumentami muzycznymi.
Chociaż te podejścia przyczyniły się do rozwoju tej dziedziny, mają one swoje własne ograniczenia, podkreślając złożony charakter generacji audio.
Modele autoregresyjne oparte na Transformerze i modele dyfuzyjne oparte na U-Net, są na czele technologii, produkując wyniki na poziomie stanu sztuki (SOTA) w generowaniu audio, tekstu, muzyki i wielu innych. Seria GPT OpenAI i prawie wszystkie inne LLM są napędzane przez transformery, wykorzystując architektury encodera, dekodera lub obu. Po stronie sztuki/obrazu MidJourney, Stability AI i DALL-E 2 wykorzystują wszystkie ramy dyfuzyjne. Te dwie podstawowe technologie były kluczowe w osiąganiu wyników SOTA w sektorze audio. W tym artykule będziemy się zagłębiać w Google’s MusicLM i Stable Audio, które są świadectwem niezwykłych możliwości tych technologii.
Google’s MusicLM
Google’s MusicLM został wydany w maju tego roku. MusicLM może generować utwory muzyczne o wysokiej wierności, które rezonują z dokładnym sentymentem opisanym w tekście. Wykorzystując modelowanie sekwencyjne hierarchiczne, MusicLM ma możliwość transformowania opisów tekstowych w muzykę, która rezonuje na poziomie 24 kHz przez przedłużone okresy.
Model działa na wielu poziomach, nie tylko przestrzegając wejść tekstowych, ale także demonstrując zdolność do warunkowania melodii. Oznacza to, że może on wziąć założoną lub gwizdaną melodię i przekształcić ją zgodnie ze stylem określonym w opisie tekstowym.
Wgląd techniczny
MusicLM wykorzystuje zasady AudioLM, ramy wprowadzonej w 2022 roku do generacji audio. AudioLM syntetyzuje audio jako zadanie modelowania języka w przestrzeni dyskretnej, wykorzystując hierarchię jednostek audio dyskretnych od grubych do drobnych, znanych również jako tokeny. To podejście zapewnia wysoką wierność i długoterminową spójność na znacznych okresach.
Aby ułatwić proces generowania, MusicLM rozszerza możliwości AudioLM, aby uwzględnić warunkowanie tekstu, technikę, która wyrównuje wygenerowane audio z nuansami wejścia tekstowego. To jest osiągane za pomocą wspólnej przestrzeni osadzania utworzonej przy użyciu MuLan, wspólnego modelu muzyki i tekstu, przeszkolonego w celu umieszczenia muzyki i jej opisów tekstowych blisko siebie w przestrzeni osadzania. Ta strategia skutecznie eliminuje potrzebę podpisów podczas szkolenia, pozwalając modelowi być szkolony na ogromnych korpusach audio-only.
Model MusicLM wykorzystuje również SoundStream jako swój tokenizator audio, który może odtworzyć muzykę 24 kHz z imponującą wiernością, wykorzystując kwantyzację wektorową resztową (RVQ) do wydajnej i wysokiej jakości kompresji audio.

Ilustracja procesu szkolenia MusicLM: SoundStream, w2v-BERT i MuLan | Źródło: tutaj
Ponadto MusicLM rozszerza swoje możliwości, pozwalając na warunkowanie melodii. To podejście zapewnia, że nawet prosta założona melodia może stanowić podstawę dla wspaniałego doświadczenia dźwiękowego, dostrojonego do dokładnych opisów stylu tekstowego.
Twórcy MusicLM udostępnili również MusicCaps, zestaw danych zawierający 5,5 tys. par muzyki i tekstu, każda z bogatymi opisami tekstowymi opracowanymi przez ekspertów ludzkich. Można je znaleźć tutaj.
Gotowy stworzyć ścieżki dźwiękowe AI z Google’s MusicLM? Oto jak zacząć:
- Odwiedź oficjalną stronę MusicLM i kliknij “Rozpocznij.”
- Dołącz do listy oczekujących, wybierając “Zarejestruj swoje zainteresowanie.”
- Zaloguj się przy użyciu swojego konta Google.
- Gdy zostanie Ci przyznany dostęp, kliknij “Próbuj”, aby rozpocząć.
Poniżej znajdują się kilka przykładowych podpowiedzi, z którymi eksperymentowałem:
“Uspokajająca piosenka, kojąca i uspokajająca, z fletami i gitarą. Muzyka jest powolna, z naciskiem na tworzenie poczucia pokoju i spokoju.”
“jazz z saksofonem”
Porównując go z poprzednimi modelami SOTA, takimi jak Riffusion i Mubert w ocenie jakościowej, MusicLM był bardziej preferowany niż inne, z uczestnikami, którzy pozytywnie oceniali zgodność podpisów tekstowych z 10-sekundowymi klipami audio.

Porównanie wyników MusicLM, Źródło: tutaj
Stability Audio
Stability AI wprowadził w zeszłym tygodniu “Stable Audio”, architekturę modelu dyfuzyjnego warunkowanego na metadanych tekstowych wraz z czasem trwania pliku audio i czasem startu. To podejście, podobnie jak Google’s MusicLM, ma kontrolę nad zawartością i długością generowanego audio, pozwalając na tworzenie klipów audio o określonych długościach do rozmiaru okna szkoleniowego.
Wgląd techniczny
Stable Audio składa się z kilku komponentów, w tym z Autoencoderu Variational (VAE) i modelu dyfuzyjnego warunkowanego U-Net, współpracujących z encodera tekstu.

Architektura Stable Audio, Źródło: tutaj
Autoencoder Variational (VAE) umożliwia szybszą generację i szkolenie, kompresując audio stereo do kompresowanego, odporne na szum i odwracalnego przestrzeni osadzania, omijając potrzebę pracy z surowymi próbkami audio.
Encoder tekstu, pochodzący z modelu CLAP, odgrywa kluczową rolę w zrozumieniu złożonych relacji między słowami i dźwiękami, oferując informacyjną reprezentację tokenizowanego tekstu wejściowego. To jest osiągane za pomocą funkcji tekstu z warstwy przedostatniej encodera tekstu CLAP, które są następnie integrowane z modelem dyfuzyjnym U-Net za pomocą warstw uwagi skrzyżowanej.
Istotnym aspektem jest włączenie osadzania czasowego, które są obliczane na podstawie dwóch właściwości: sekundy startu fragmentu audio i całkowitej długości oryginalnego pliku audio. Te wartości, przetłumaczone na dyskretne osadzania na sekundę, są łączone z tokenami podpowiedzi i wprowadzane do warstw uwagi skrzyżowanej U-Net, umożliwiając użytkownikom dyktowanie ogólnej długości wyjściowego audio.
Model Stable Audio został przeszkolony przy użyciu ogromnego zestawu danych ponad 800 000 plików audio, we współpracy z dostawcą muzyki stockowej AudioSparx.
Stable Audio oferuje wersję bezpłatną, pozwalając na 20 generacji do 20-sekundowych ścieżek dźwiękowych miesięcznie, oraz plan Pro za 12 dolarów miesięcznie, pozwalający na 500 generacji do 90-sekundowych ścieżek dźwiękowych.
Poniżej znajduje się klip audio, który stworzyłem przy użyciu Stable Audio.
“Cinematic, Soundtrack Gentle Rainfall, Ambient, Soothing, Distant Dogs Barking, Calming Leaf Rustle, Subtle Wind, 40 BPM”
Zastosowania tak starannie wytworzonych utworów muzycznych są nieograniczone. Twórcy filmowi mogą wykorzystać tę technologię do tworzenia bogatych i immersyjnych pejzaży dźwiękowych. W sektorze komercyjnym reklamodawcy mogą wykorzystać te dostosowane ścieżki dźwiękowe. Ponadto, ten narzędzie otwiera drogę dla indywidualnych twórców i artystów do eksperymentowania i innowacji, oferując canvas nieograniczonego potencjału do tworzenia utworów dźwiękowych, które opowiadają historie, wywołują emocje i tworzą atmosfery z głębią, która wcześniej była trudna do osiągnięcia bez znacznego budżetu lub specjalistycznej wiedzy.
Porady dotyczące podpowiedzi
Stwórz idealną muzykę przy użyciu podpowiedzi tekstowych. Oto krótki przewodnik, aby rozpocząć:
- Bądź szczegółowy: Określ gatunki, nastroje i instrumenty. Na przykład: Cinematic, Wild West, Perkusja, Napięty, Atmosferyczny
- Ustawienie nastroju: Połącz terminy muzyczne i emocjonalne, aby przekazać pożądany nastrój.
- Wybór instrumentu: Wzbogać nazwy instrumentów przymiotnikami, takimi jak “Reverberowany Gitara” lub “Potężny Chór”.
- BPM: Wyrównaj tempo z gatunkiem, aby uzyskać harmonijny wynik, na przykład “170 BPM” dla utworu Drum and Bass.
Uwagi końcowe
W tym artykule zagłębiliśmy się w AI-generowaną muzykę, od kompozycji algorytmicznych do zaawansowanych ram generatywnych AI dzisiaj, takich jak Google’s MusicLM i Stability Audio. Te technologie, wykorzystujące głębokie uczenie się i modele kompresji SOTA, nie tylko poprawiają generację muzyki, ale także doskonalą doświadczenia słuchowe.
Jednak jest to dziedzina w ciągłej ewolucji, z wyzwaniami, takimi jak utrzymanie długoterminowej spójności i trwającą debatą na temat autentyczności muzyki tworzonej przez AI, wyzwaniem dla pionierów w tej dziedzinie. Zaledwie tydzień temu, buzz był wszystko o utworze AI, który naśladuje style Drake’a i The Weeknd, który wcześniej zdobył uznanie online w tym roku. Jednak został usunięty z listy nominacji do Grammy, pokazując trwającą debatę na temat legitymizacji muzyki generowanej przez AI w branży (źródło). Podczas gdy AI kontynuuje mosty między muzyką a słuchaczami, z pewnością promuje ekosystem, w którym technologia współistnieje ze sztuką, promując innowacje i szanując tradycję.

















