Modely a platformy AI

Text-to-Music Generativní AI: Stability Audio, Google’s MusicLM a další

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Hudba, umělecká forma, která rezonuje s lidskou duší, byla naší stálou společnicí. Tvorba hudby pomocí umělé inteligence začala před několika desetiletími. Zpočátku byly pokusy jednoduché a intuitivní, s základními algoritmy vytvářejícími monotónní melodie. Nicméně, jak technologie pokročila, tak i složitost a schopnosti generátorů hudby AI, což otevřelo cestu pro hluboké učení a zpracování přirozeného jazyka (NLP) hrát zásadní roli v této technologii.

Dneska platformy jako Spotify využívají AI k jemnému ladění zkušeností svých uživatelů. Tyto algoritmy hlubokého učení analyzují individuální preference na základě různých hudebních prvků, jako je tempo a nálada, aby vytvořily personalizované návrhy písní. Analyzují také širší poslouchací vzorce a prohledávají internet pro diskuse související s písněmi, aby vytvořily podrobné profily písní.

Původ AI v hudbě: Cesta od algoritmického složení k generativnímu modelování

V raných fázích AI v hudbě, od 50. do 70. let, se zaměřilo na algoritmické složení. Jednalo se o metodu, při které počítače používaly definovaný soubor pravidel k vytváření hudby. První pozoruhodné dílo z této doby bylo Illiac Suite pro smyčcový kvartet v roce 1957. Používal algoritmus Monte Carlo, proces zahrnující náhodná čísla, která určovala výšku a rytmus v rámci tradiční hudební teorie a statistických pravděpodobností.

Obrázek vygenerován autorem pomocí Midjourney

Obrázek vygenerován autorem pomocí Midjourney

Během této doby jiný průkopník, Iannis Xenakis, využíval stochastické procesy, koncept zahrnující náhodné pravděpodobnostní rozdělení, k vytváření hudby. Používal počítače a jazyk FORTRAN k propojení více pravděpodobnostních funkcí, vytvářející vzorec, kde různé grafické reprezentace odpovídaly rozličným zvukovým prostorám.

Složitost překladu textu do hudby

Hudba je uložena v bohatém a vícedimenzionálním formátu dat, který zahrnuje prvky, jako je melodie, harmonie, rytmus a tempo, což činí úkol překladu textu do hudby vysoce složitým. Standardní píseň je reprezentována téměř milionem čísel v počítači, což je číslo výrazně vyšší než jiná data, jako jsou obrázky, texty atd.

Obor generování audio zaznamenává inovativní přístupy k překonání výzev vytváření realistického zvuku. Jednou z metod je generování spektrogramu a poté jeho převod zpět do audio.

Jinou strategií je využití symbolické reprezentace hudby, jako je notový zápis, který může být interpretován a hrán hudebníky. Tato metoda byla úspěšně digitalizována, s nástroji, jako je Chamber Ensemble Generator od Magenty, který vytváří hudbu ve formátu MIDI, protokolu, který umožňuje komunikaci mezi počítači a hudebními nástroji.

Zatímco tyto přístupy pokročily v oboru, přinášejí také svá omezení, což podtrhuje složitou povahu generování audio.

Transformer-based autoregresivní modely a U-Net-based difúzní modely jsou na špici technologie, produkující špičkové výsledky v generování audio, textu, hudby a mnohem více. OpenAI’s GPT série a téměř všechny ostatní LLM jsou poháněny transformery, využívajícími buď encoder, decoder, nebo obě architektury. Na straně umění/obrazu MidJourney, Stability AI a DALL-E 2 všechny využívají difúzní rámce. Tyto dvě základní technologie byly klíčové v dosažení špičkových výsledků v audio sektoru. V tomto článku se budeme zabývat Google’s (GOOGL ) MusicLM a Stable Audio, které jsou svědectvím pozoruhodných schopností těchto technologií.

Google’s MusicLM

Google’s MusicLM byl vydán v květnu tohoto roku. MusicLM může generovat high-fidelity hudební kusy, které rezonují s přesně tím sentimentem, který je popsán v textu. Používá hierarchické sekvence k sekvenci modelování, MusicLM má schopnost transformovat textové popisy do hudby, která rezonuje na 24 kHz po prodloužené době.

Model funguje na víceúrovňové úrovni, nejen se řídí textovými vstupy, ale také demonstruje schopnost být podmíněn melodiemi. To znamená, že může vzít hummed nebo pískanou melodii a transformovat ji podle stylu popsáného v textové popisce.

Technické pohledy

MusicLM využívá principy AudioLM, rámce zavedeného v roce 2022 pro generování audio. AudioLM syntetizuje audio jako úloha modelování jazyka v diskrétním reprezentačním prostoru, využívající hierarchii hrubých až jemných audio diskrétních jednotek, také nazývaných tokeny. Tento přístup zajišťuje high-fidelity a dlouhodobou koherenci po podstatných délkách.

Pro usnadnění generování procesu MusicLM rozšiřuje schopnosti AudioLM o textové podmínění, techniku, která zarovnává vygenerované audio s nuancemi vstupního textu. To je dosaženo pomocí sdíleného embedovacího prostoru vytvořeného pomocí MuLan, společného hudebního-textového modelu, který byl vyškoleno projekovat hudbu a její odpovídající textové popisy blízko sebe v embedovaném prostoru. Tato strategie efektivně eliminuje potřebu popisků během školení, umožňující modelu být vyškoleno na masivních audio-only korpusech.

Model MusicLM také používá SoundStream jako svůj audio tokenizér, který může rekonstruovat 24 kHz hudbu na 6 kbps s působivou fidelitou, využívající reziduální vektorové kvantizace (RVQ) pro efektivní a high-quality audio kompresi.

Ilustrace nezávislého předškolního procesu pro základní modely MusicLM: SoundStream, w2v-BERT a MuLan

Ilustrace předškolního procesu MusicLM: SoundStream, w2v-BERT a MuLan | Zdroj obrázku: zde

Více než to, MusicLM rozšiřuje své schopnosti, umožňující melodiální podmínění. Tento přístup zajišťuje, že i jednoduchá hummed melodie může položit základy pro velkolepý audio zážitek, jemně laděný podle přesně těch textových stylů popisků.

Developers MusicLM také otevřeli MusicCaps, dataset s 5,5k hudebních-textových párů, každý doprovázený bohatými textovými popisy vytvořenými lidskými odborníky. Můžete si jej prohlédnout zde: MusicCaps na Hugging Face.

Připraveni vytvořit AI soundtracky s Google’s MusicLM? Zde je, jak začít:

  1. Navigate na oficiální webovou stránku MusicLM a klikněte na “Get Started”.
  2. Připojte se k čekací listině výběrem “Register your interest”.
  3. Přihlaste se pomocí svého Google účtu.
  4. Jakmile budete mít přístup, klikněte na “Try Now”, aby jste začali.

Níže jsou einige ukázkové prompty, se kterými jsem experimentoval:

“Meditativní píseň, uklidňující a uvolňující, s flétnami a kytarami. Hudba je pomalá, se zaměřením na vytváření pocitu míru a klidu.”

“jazz s saxofonem”

Když byl MusicLM porovnán s předchozími SOTA modely, jako je Riffusion a Mubert v kvalitativní evaluaci, MusicLM byl preferován více než ostatní, s účastníky, kteří kladně hodnotili kompatibilitu textových popisků s 10sekundovými audio klipy.

MusicLM Performance comparision

MusicLM Performance, Zdroj obrázku: zde

Stability Audio

Stability AI minulý týden představila “Stable Audio”, latentní difúzní modelovou architekturu, podmíněnou textovými metadata a audio soubory délky a startovacího času. Tento přístup, podobně jako Google’s MusicLM, má kontrolu nad obsahem a délkou vygenerovaného audio, umožňující vytvářet audio klipy se specifikovanými délkami až do velikosti trénovacího okna.

Technické pohledy

Stable Audio se skládá z několika komponent, včetně Variational Autoencoder (VAE) a U-Net-based podmíněného difúzního modelu, který pracuje společně s textovým encodeřem.

Ilustrace integrovaného VAE, textového encodeéru a U-Net-based podmíněného difúzního modelu

Stable Audio Architektura, Zdroj obrázku: zde

VAE usnadňuje rychlejší generování a trénování, komprimuje stereo audio do komprimovaného, odolného vůči šumu a invertibilního ztrátového latentního kódování, čímž se eliminuje potřeba pracovat s raw audio vzorky.

Textový encodeř, odvozený z CLAP modelu, hraje zásadní roli v pochopení složitých vztahů mezi slovy a zvuky, nabízející informativní reprezentaci tokenizovaného vstupního textu. To je dosaženo pomocí textových funkcí z předposlední vrstvy textového encodeéru CLAP, které jsou poté integrovány do difúzního U-Net prostřednictvím cross-attention vrstev.

Důležitým aspektem je začlenění časových vložek, které jsou vypočteny na základě dvou vlastností: startovacího sekundy audio chunku a celkové délky původního audio souboru. Tyto hodnoty, přeložené do per-second diskrétních naučených vložek, jsou kombinovány s prompt tokeny a krmeny do cross-attention vrstev U-Net, umožňující uživatelům diktovat celkovou délku výstupního audio.

Model Stable Audio byl trénován pomocí rozsáhlého datasetu více než 800 000 audio souborů, ve spolupráci se stockovou hudební službou AudioSparx.

Stable audio komerční

Stable audio komerční

Stable Audio nabízí bezplatnou verzi, která umožňuje 20 generací až 20sekundových stop za měsíc, a $12/měsíc Pro plán, který umožňuje 500 generací až 90sekundových stop.

Níže je audio klip, který jsem vytvořil pomocí stable audio.

Obrázek vygenerován autorem pomocí Midjourney

Obrázek vygenerován autorem pomocí Midjourney

“Cinematic, Soundtrack Gentle Rainfall, Ambient, Uklidňující, Distant Dogs Barking, Calming Leaf Rustle, Subtle Wind, 40 BPM”

 

Aplikace takto jemně vyřezávaných audio kusů jsou nekonečné. Filmaři mohou využít tuto technologii k vytváření bohatých a imerzivních zvukových krajin. V komerčním sektoru mohou inzerenti využít tyto přizpůsobené audio stopy. Kromě toho tato nástroj otevírá cesty pro jednotlivé tvůrce a umělce, aby experimentovali a inovovali, nabízející plátno neomezeného potenciálu k vytvoření zvukových kusů, které vyprávějí příběhy, evokují emoce a vytvářejí atmosféry s hloubkou, která byla dříve obtížně dosažitelná bez podstatného rozpočtu nebo technických znalostí.

Prompting Tipy

Vytvořte dokonalé audio pomocí textových promptů. Zde je rychlý průvodce, jak začít:

  1. Buďte podrobní: Specifikujte žánry, nálady a nástroje. Například: Cinematic, Divoký Západ, Perkuse, Napjatý, Atmosférický
  2. Nastavení nálady: Kombinujte hudební a emocionální termíny, aby jste vyjádřili požadovanou náladu.
  3. Výběr nástrojů: Zlepšete názvy nástrojů pomocí adjektiv, jako je “Reverberated Guitar” nebo “Powerful Choir”.
  4. BPM: Zarovnejte tempo s žánrem pro harmonický výstup, jako je “170 BPM” pro Drum and Bass track.

Závěrečné poznámky

Obrázek vygenerován autorem pomocí Midjourney

Obrázek vygenerován autorem pomocí Midjourney

V tomto článku jsme se ponořili do AI-generované hudby/audio, od algoritmických kompozic až po sofistikované generativní AI rámce dneška, jako je Google’s MusicLM a Stability Audio. Tyto technologie, využívající hluboké učení a SOTA kompresních modelů, nejen zlepšují generování hudby, ale také jemně ladí zkušenosti posluchačů.

Ale je to stále se vyvíjející doména, s překážkami, jako je udržování dlouhodobé koherence a pokračující debata o autenticitě AI-vytvořené hudby, které vyzývají průkopníky v tomto oboru. Před několika dny byl celý rozruch kolem AI-vytvořené písně, která napodobovala styly Drake a The Weeknd, která se nejprve stala virální online na začátku tohoto roku. Nicméně, byla odstraněna z nominace na Grammy, což ukazuje na pokračující debatu o legitimitě AI-generované hudby v průmyslu (zdroj). Jak AI pokračuje v mostování mezi hudbou a posluchači, jistě podporuje ekosystém, ve kterém technologie koexistuje s uměním, podporuje inovace a respektuje tradici.

Já pět let se ponořím do fascinujícího světa strojového učení a hlubokého učení. Mé vášně a odborné znalosti mě vedly k tomu, abych se podílel na více než 50 různých projektech softwarového inženýrství, se zvláštním zaměřením na AI/ML. Mé pokračující zvědavosti mě také přivedly k přirozenému jazykovému zpracování, oblasti, kterou jsem ochoten prozkoumat dále.