Modele și platforme AI
OpenAI Creează Un Nou Program AI Pentru A Crea Muzică Bazată Pe Genuri
Organizația independentă de cercetare OpenAI a lansat recent o nouă formă de inteligență artificială generativă, numită Jukebox, numită astfel datorită capacității sale de a genera muzică. Jukebox AI poate genera sunete pe baza unor atribute precum instrumentația și chiar versurile, iar echipa de cercetare OpenAI a creat AI-ul prin antrenarea acestuia pe clipuri audio comprimate și diverse fragmente de versuri.
Conform raportului TechCrunch , cercetătorii OpenAI au antrenat modelul folosind clipuri audio brute, dând modelului capacitatea de a produce audio. Acest lucru este în contrast cu abordările utilizate pentru a crea alte aplicații de generare a muzicii, care adesea se bazează pe “muzică simbolică” (cum ar fi muzica MIDI), care este informație despre note și pitch-uri, dar nu și audio real. Echipa de cercetători a utilizat rețele neuronale convoluționale pentru a antrena modelul, comprimând audio-ul și codificându-l într-un format pe care rețeaua neurală îl putea interpreta. Ulterior, un transformator a fost utilizat pentru a genera audio comprimat, care a fost upsamplat pentru a converti datele într-un format audio.
Când au creat Jukebox, OpenAI a trebuit să creeze o metodă de a face față naturii complexe și dense a audio-ului. Cercetătorii au făcut față naturii continue a audio-ului prin împărțirea acestuia în secțiuni mai discrete și mai ușor de digerat, împărțind cântecele în bucăți care sunt lungi de 1/128 de secundă. Scopul a fost de a crea un model de inteligență artificială capabil să descompună cântecele în bucăți suficient de mari pentru ca problema să nu devină intractabilă, dar suficient de mici și precise pentru ca modelul să poată învăța modelul unui cântec și să reconstruiască acel model.
Tehnica utilizată de OpenAI are unele asemănări cu un AI mai vechi de generare a muzicii pe care compania l-a produs, numit MuseNet. MuseNet a fost antrenat pe fișiere MIDI și a fost capabil să genereze muzică într-o varietate de stiluri, deși s-a concentrat pe melodia generală a unui cântec și nu a putut produce versuri. În contrast, Jukebox este capabil să scrie propriile sale versuri pentru a însoți muzica. Versurile sunt “co-scrise” de cercetătorii OpenAI, ghidând modelul spre a crea versuri în anumite stiluri. Sistemul Jukebox a fost antrenat pe versuri extrase din LyricWiki, cu date de antrenare care constau în text și metadate pentru 1,2 milioane de cântece.
Când vine vorba de versurile modelului, cercetătorii au încercat mai întâi să utilizeze o euristică simplă care întindea versurile la durata aproximativă a unui cântec, analizând textul care corespundea unei anumite bucăți/secvențe a cântecului. Această abordare simplă a funcționat bine în general, deși cercetătorii au descoperit că atunci când versurile erau deosebit de rapide, aceasta se deteriora. Pentru a face față acestei probleme, vocalele au fost extrase din cântec și aliniate cu textul liric pentru a obține alinieri la nivel de cuvânt pentru versuri. Ulterior, un strat de codificare a fost utilizat pentru versuri, împreună cu un strat de atenție care a mapat secțiuni ale muzicii la versuri utilizând perechi cheie-valoare. Rezultatul a fost că versurile și vocalele aveau o potrivire destul de precisă.
Autorii articolului notează, de asemenea, că există câteva limitări ale Jukebox, și că viitoarele lucrări vor urmări să îmbunătățească capacitatea AI-ului. Așa cum autorii scriu într-o postare pe blog:
„În timp ce Jukebox reprezintă un pas înainte în calitatea muzicală, coerență, lungimea eșantionului audio și capacitatea de a condiționa artistul, genul și versurile, există o lacună semnificativă între aceste generații și muzica creată de oameni. De exemplu, în timp ce cântecele generate arată o coerență muzicală locală, urmează tiparele tradiționale de acorduri și pot avea chiar solo-uri impresionante, nu auzim structuri muzicale mai mari familiare, cum ar fi refrene care se repetă.”
În acest moment, modelul este capabil să producă un cântec care este recunoscut ca fiind în stilul unui anumit gen sau chiar al unui anumit artist. De exemplu, poate produce cântece în stilul lui Elvis Presley, Katy Perry sau Rage Against the Machine. Deși cântecele sunt recunoscute ca fiind într-un anumit gen sau tematică legată de un anumit artist, acestea sunt, de asemenea, destul de crude, adesea sunând ca o parodie sau o versiune slabă a unui cântec. Cu toate acestea, realizarea tehnică este impresionantă. Cercetătorii responsabili pentru crearea sistemului de generare AI au ales să lucreze la un program capabil să genereze muzică în special pentru că sarcina a fost dificilă, iar cercetătorii plănuiesc să continue să-și rafineze tehnicile. Puteți asculta câteva dintre cântece aici.












