Modely a platformy AI
OpenAI Vytvořila Nový AI Program Pro Tvorbu Hudby Na Základě Žánrů
Nezávislá výzkumná organizace OpenAI nedávno vydala novou formu generativní umělé inteligence nazvanou Jukebox, pojmenovanou podle její schopnosti generovat hudbu. Jukebox AI je schopná generovat zvuky na základě atributů, jako je instrumentace a dokonce i texty písní, a výzkumný tým OpenAI vytvořil tuto AI tím, že ji trénoval na komprimovaných audio klipech a různých úryvcích textů písní.
Podle TechCrunch uvedl, výzkumníci z OpenAI trénovali model pomocí surových audio klipů, čímž modelu poskytli schopnost produkovat audio. To je v kontrastu s přístupy používanými pro vytvoření jiných aplikací generující hudbu, které často spoléhají na “symbolickou hudbu” (jako MIDI hudba), která je informace o notách a tónech, ale ne skutečné audio. Tým výzkumníků využil konvoluční neuronové sítě k trénování modelu, komprimaci audio a kódování do formátu, který neuronová síť mohla interpretovat. Poté byl použit transformer k generování komprimovaného audio, které bylo upsampleno, aby se data konvertovala do audio formátu.
Při tvorbě Jukeboxu musela OpenAI vytvořit metodu, jak zpracovat komplexní a hustou povahu audio. Výzkumníci se vypořádali s kontinuální povahou audio tím, že ji rozdělili na více diskrétní a stravitelné sekce, rozdělující písně na kousky, které jsou 1/128 sekundy dlouhé. Cílem bylo vytvořit AI model, který je schopen rozložit písně na kusy dostatečně velké, aby problém nebyl neřešitelný, ale dostatečně malé a přesné, aby model mohl naučit vzorec písně a rekonstruovat tento vzorec.
Technika použita OpenAI sdílí některé společné rysy se starším hudebním generativním AI, který společnost vyrobila, nazvaným MuseNet. MuseNet byl trénován na MIDI souborech a byl schopen generovat hudbu v různých stylech, i když se zaměřil na celkovou melodii písně a nemohl produkovat texty. Naopak, Jukebox je schopen psát své vlastní texty k doprovodu hudby. Texty jsou “spolu-psané” výzkumníky z OpenAI, kteří směrují model k tvorbě textů v určitých stylech. Jukebox systém byl trénován na textech z LyricWiki, s trénovacími daty skládajícími se z textu a metadat o 1,2 milionu písní.
Když jde o texty modelu, výzkumníci se nejprve pokusili použít jednoduchou heuristiku, která roztažovala texty na přibližnou délku písně, analyzující text, který odpovídal konkrétnímu kusu/sekci písně. Tento jednoduchý přístup fungoval dobře obecně, i když výzkumníci zjistili, že když texty byly besonders rychlé, rozpadl se. Aby se vypořádali s tímto problémem, byly extrahovány vokály z písně a zarovnány s textem, aby se získaly word-level zarovnání pro texty. Poté byl použit kódovací vrstva pro texty spolu s pozornostní vrstvou, která mapovala sekce hudby na texty pomocí key-value párů. Výsledkem bylo, že texty a vokály měly bastante přesné zarovnání.
Autor článku také poznamenává, že existují beberapa omezení, která Jukebox má, a že budoucí práce bude zaměřena na zlepšení schopností AI. Jak autoři píší v blogovém příspěvku:
„Zatímco Jukebox představuje krok vpřed v hudební kvalitě, koherenci, délce audio vzorku a schopnosti podmínit se na umělce, žánr a texty, existuje významná mezera mezi těmito generacemi a hudbou vytvořenou lidmi. Například, zatímco generované písně ukazují lokální hudební koherenci, následují tradiční akordové vzory a mohou dokonce obsahovat působivé sóla, neslyšíme známé větší hudební struktury, jako jsou refrény, které se opakují.“
Právě teď je model schopen produkovat píseň, která je rozpoznatelná jako styl konkrétního žánru nebo dokonce konkrétního umělce. Například, může produkovat písně ve stylu Elvise Presleyho, Katy Perry nebo Rage Against the Machine. Ačkoli písně jsou rozpoznatelné jakožto patřící do žánru nebo tématizované kolem stylu zpěváka, jsou také bastante hrubé, často znějící jako parodie nebo špatné cover verze písně. Přesto je technické dosažení působivé. Výzkumníci zodpovědní za vytvoření systému generace AI zvolili pracovat na programu schopném generovat hudbu specificky proto, že úkol byl obtížný, a výzkumníci plánují pokračovat ve zdokonalování svých technik. Můžete si poslechnout některé písně zde.












