Modele și platforme AI
Generare de muzică cu Inteligență Artificială Text-to-Music: Stability Audio, Google’s MusicLM și multe altele
Muzica, o formă de artă care răsună în sufletul uman, a fost un companion constant al nostru. Crearea de muzică utilizând inteligența artificială a început cu mai multe decenii în urmă. Inițial, încercările au fost simple și intuitive, cu algoritmi de bază care creeau melodii monotone. Cu toate acestea, pe măsură ce tehnologia a evoluat, așa au făcut și complexitatea și capacitățile generatorilor de muzică AI, deschizând calea pentru învățarea profundă și procesarea limbajului natural (NLP) să joace roluri cheie în această tehnologie.
Astăzi, platforme precum Spotify utilizează inteligența artificială pentru a rafina experiența de ascultare a utilizatorilor. Acești algoritmi de învățare profundă analizează preferințele individuale pe baza diverselor elemente muzicale, cum ar fi tempo și dispoziție, pentru a crea sugestii de cântece personalizate. Ei analizează, de asemenea, modelele de ascultare mai largi și scanează internetul pentru discuții despre cântece pentru a construi profiluri de cântece detaliate.
Illiac Suite pentru cvartet de coarde a fost una dintre primele creații notabile în această perioadă, utilizând algoritmul Monte Carlo, un proces care implică numere aleatoare pentru a dicta pitch-ul și ritmul în limitele teoriei muzicale tradiționale și a probabilităților statistice.
În această perioadă, un alt pionier, Iannis Xenakis, a utilizat procese stohastice, un concept care implică distribuții de probabilitate aleatoare, pentru a crea muzică. El a utilizat computere și limbajul FORTRAN pentru a conecta multiple funcții de probabilitate, creând un model în care diferite reprezentări grafice corespund diverselor spații sonore.
Originea Inteligenței Artificiale în Muzică: O Călătorie de la Compoziția Algoritmică la Modelarea Generativă
În primele etape ale inteligenței artificiale în lumea muzicală, care s-a întins din anii 1950 până în anii 1970, accentul a fost pus în principal pe compoziția algoritmică. Acesta a fost un metoda în care computerele utilizau un set definit de reguli pentru a crea muzică.
Complexitatea Traducerii Textului în Muzică
Muzica este stocată într-un format de date bogat și multi-dimensional care cuprinde elemente precum melodia, armonia, ritmul și tempo, făcând sarcina de a traduce textul în muzică extrem de complexă. Un cântec standard este reprezentat de aproape un milion de numere într-un computer, o cifră semnificativ mai mare decât alte formate de date, cum ar fi imaginea, textul etc.
Domeniul generației audio este martorul unor abordări inovatoare pentru a depăși provocările creației de sunete realiste. O metodă implică generarea unui spectrogram și apoi conversia acestuia înapoi în audio.
O altă strategie utilizează reprezentarea simbolică a muzicii, cum ar fi partiturile, care pot fi interpretate și cântate de muzicieni. Această metodă a fost digitizată cu succes, cu instrumente precum Chamber Ensemble Generator de la Magenta, care creează muzică în formatul MIDI, un protocol care facilitează comunicarea între computere și instrumente muzicale.
În timp ce aceste abordări au avansat domeniul, ele vin cu propriile limitări, subliniind natura complexă a generației audio.
Modelele autoregresive bazate pe Transformer și modelele de difuziune bazate pe U-Net se află în fruntea tehnologiei, producând rezultate de ultimă generație în generarea de audio, text, muzică și multe altele. Seria GPT de la OpenAI și aproape toate celelalte modele de limbaj mare (LLM) sunt alimentate de transformatoare care utilizează arhitecturi de encoder, decoder sau ambele. Pe partea de artă/imagini, MidJourney, Stability AI și DALL-E 2 toate utilizează cadre de difuziune. Aceste două tehnologii de bază au fost cheia pentru a obține rezultate de ultimă generație în sectorul audio.
Google’s MusicLM
Google’s MusicLM a fost lansat în luna mai a acestui an. MusicLM poate genera piese de muzică de înaltă fidelitate care răsună cu exact sentimentul descris în text. Utilizând modelarea ierarhică secvențială, MusicLM are capacitatea de a transforma descrieri de text în muzică care răsună la 24 kHz pe durate extinse.
Modelul funcționează la nivel multi-dimensional, nu doar respectând intrările textuale, ci și demonstrând capacitatea de a fi condiționat de melodii. Acest lucru înseamnă că poate lua o melodie fredonată sau fluierată și o poate transforma în conformitate cu stilul descris într-o legendă de text.
Insights Tehnice
MusicLM se bazează pe principiile AudioLM, un cadru introdus în 2022 pentru generarea de audio. AudioLM sintetizează audio ca o sarcină de modelare a limbajului într-un spațiu de reprezentare discretă, utilizând o ierarhie de unități audio discrete de la gros la fin, cunoscute și sub numele de tokenuri. Acest abordaj asigură fidelitate ridicată și coerență pe termen lung pe durate substanțiale.
Pentru a facilita procesul de generare, MusicLM extinde capacitățile AudioLM pentru a incorpora condiționarea textului, o tehnică care aliniază audio-ul generat cu nuanțele intrării de text. Acest lucru se realizează prin crearea unui spațiu de încorporare comun utilizând MuLan, un model de muzică-text comun antrenat pentru a proiecta muzica și descrierile sale de text corespunzătoare aproape unul de celălalt într-un spațiu de încorporare. Această strategie elimină eficient nevoia de legende în timpul antrenamentului, permițând modelului să fie antrenat pe corpora audio masive doar.
Modelul MusicLM utilizează, de asemenea, SoundStream ca tokenizer de audio, care poate reconstrui muzică de 24 kHz la 6 kbps cu fidelitate impresionantă, utilizând cuantificarea vectorială reziduală (RVQ) pentru compresia audio eficientă și de înaltă calitate.

Ilustrație a procesului de preantrenare a MusicLM: SoundStream, w2v-BERT și Mulan | Sursă imagine: aici
De asemenea, MusicLM extinde capacitățile sale prin permiterea condiționării melodiei. Acest abordaj asigură că chiar și o melodie simplă fredonată poate sta la baza unei experiențe auditive magnifice, finisate în conformitate cu descrierile exacte de stil textual.
Dezvoltatorii MusicLM au deschis, de asemenea, MusicCaps, un set de date care prezintă 5,5 mii de perechi muzică-text, fiecare însoțită de descrieri de text bogate create de experți umani. Puteți găsi mai multe informații aici.
Gata să creați coloane sonore AI cu Google’s MusicLM? Iată cum să începeți:
- Accesați site-ul oficial MusicLM și faceți clic pe “Începeți”.
- Înscrieți-vă pe lista de așteptare selectând “Înregistrați-vă interesul”.
- Conectați-vă utilizând contul dvs. Google.
- Odată ce ați primit acces, faceți clic pe “Încercați acum” pentru a începe.
Iată câteva exemple de prompturi cu care am experimentat:
“Cântec meditativ, liniștitor și calm, cu flaut și chitară. Muzica este lentă, cu accent pe crearea unei senzații de pace și liniște.”
“jazz cu saxofon”
Când a fost comparat cu modelele SOTA anterioare, cum ar fi Riffusion și Mubert, într-o evaluare calitativă, MusicLM a fost preferat mai mult decât altele, cu participanți care au evaluat favorabil compatibilitatea legendelor de text cu clipuri audio de 10 secunde.

Comparație a performanței MusicLM, Sursă imagine: aici
Stability Audio
Stability AI a introdus recent “Stable Audio”, o arhitectură de model de difuziune latentă condiționată de metadate de text, durată de fișier audio și timp de start. Acest abordaj, similar cu cel al lui Google’s MusicLM, are control asupra conținutului și lungimii audio generate, permițând crearea de clipuri audio cu lungimi specificate până la dimensiunea ferestrei de antrenament.
Insights Tehnice
Stable Audio cuprinde mai multe componente, inclusiv un Variational Autoencoder (VAE) și un model de difuziune condiționat bazat pe U-Net, care lucrează împreună cu un encoder de text.

Arhitectura Stable Audio, Sursă imagine: aici
VAE facilitează generarea mai rapidă și antrenamentul prin comprimarea audio stereo într-o codificare latentă comprimată, rezistentă la zgomot și inversibilă, ocolind nevoia de a lucra cu mostre de audio brute.
Encoderul de text, derivat dintr-un model CLAP, joacă un rol cheie în înțelegerea relațiilor complexe dintre cuvinte și sunete, oferind o reprezentare informativă a textului tokenizat. Acest lucru se realizează prin utilizarea caracteristicilor de text din stratul penultim al encoderului de text CLAP, care sunt apoi integrate în modelul de difuziune U-Net prin straturi de atenție încrucișate.
Un aspect important este incorporarea încorporării temporale, care sunt calculate pe baza a două proprietăți: a doua de start a fragmentului de audio și durata totală a fișierului audio original. Aceste valori, traduse în încorporări discrete învățate pe secundă, sunt combinate cu tokenurile de prompt și alimentate în straturile de atenție încrucișate ale U-Net, permițând utilizatorilor să dicteze lungimea generală a audio-ului de ieșire.
Modelul Stable Audio a fost antrenat utilizând un set de date extins de peste 800.000 de fișiere audio, prin colaborare cu furnizorul de muzică de stock AudioSparx.
Stable Audio oferă o versiune gratuită, care permite 20 de generări de până la 20 de secunde pe lună, și un plan Pro de 12 dolari pe lună, care permite 500 de generări de până la 90 de secunde.
Mai jos este un clip audio pe care l-am creat utilizând Stable Audio.
“Cinematic, Coloană sonoră ploaie liniștită, Ambient, Liniștitor, Lătratul câinilor la distanță, Foșnet de frunze calm, Vânt subtil, 40 BPM”
Aplicabilitățile unor astfel de piese audio fin create sunt infinite. Cineaștii pot utiliza această tehnologie pentru a crea peisaje sonore bogate și imersive. În sectorul comercial, reclamele pot utiliza aceste piese audio personalizate. Mai mult, acest instrument deschide drumul pentru creatori individuali și artiști să experimenteze și să inoveze, oferind o paletă nelimitată pentru a crea piese sonore care spun povești, evocă emoții și creează atmosfere cu o adâncime care anterior era dificil de atins fără un buget substanțial sau expertiză tehnică.
Sfaturi pentru Prompting
Creați piese audio perfecte utilizând prompturi de text. Iată un ghid rapid pentru a începe:
- Fii Detaliat: Specifică genuri, dispoziții și instrumente. De exemplu: Cinematic, Vestul Sălbatic, Percuție, Încordat, Atmospheric
- Setarea Dispoziției: Combinați termeni muzicali și emoționali pentru a transmite dispoziția dorită.
- Alegerea Instrumentului: Îmbunătățiți numele instrumentelor cu adjective, cum ar fi “Chitară reverberată” sau “Cor Puternic”.
- BPM: Aliniați tempo-ul cu genul pentru a obține o ieșire armonioasă, cum ar fi “170 BPM” pentru un cântec de Drum and Bass.
Notă Finală
În acest articol, am explorat muzica generată de inteligența artificială, de la compoziția algoritmică până la cadrele generative avansate de astăzi, cum ar fi Google’s MusicLM și Stability Audio. Aceste tehnologii, care utilizează învățarea profundă și modele de compresie de ultimă generație, nu numai că îmbunătățesc generarea de muzică, dar și rafinează experiența ascultătorilor.
Însă, acesta este un domeniu în evoluție constantă, cu provocări precum menținerea coerenței pe termen lung și dezbaterea în curs despre autenticitatea muzicii create de inteligența artificială, care îi provoacă pe pionierii din acest domeniu. Abia săptămâna trecută, era vorba despre un cântec creat de inteligența artificială care imita stilurile lui Drake și The Weeknd, care a fost inițial nominalizat la premii Grammy, dar a fost ulterior eliminat din lista nominalizărilor, subliniind dezbaterea în curs despre legitimitatea muzicii generate de inteligența artificială în industrie (sursă). Pe măsură ce inteligența artificială continuă să reducă distanța dintre muzică și ascultători, ea promovează un ecosistem în care tehnologia coexistă cu arta, stimulând inovația și respectând, în același timp, tradiția.

















