Modelli e piattaforme di IA

Generativo di Musica Testo-AI: Stability Audio, MusicLM di Google e altro

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

La musica, un’arte che risuona con l’anima umana, è stata una costante compagna di noi tutti. La creazione di musica utilizzando l’intelligenza artificiale è iniziata diversi decenni fa. Inizialmente, i tentativi erano semplici e intuitivi, con algoritmi di base che creavano melodie monotone. Tuttavia, man mano che la tecnologia avanzava, anche la complessità e le capacità dei generatori di musica AI aumentavano, aprendo la strada all’apprendimento profondo e all’elaborazione del linguaggio naturale (NLP) per svolgere un ruolo fondamentale in questa tecnologia.

Oggi piattaforme come Spotify stanno sfruttando l’AI per perfezionare l’esperienza di ascolto degli utenti. Questi algoritmi di apprendimento profondo analizzano le preferenze individuali in base a vari elementi musicali come il tempo e l’umore per creare suggerimenti di canzoni personalizzati. Analizzano anche modelli di ascolto più ampi e setacciano internet per discussioni relative alle canzoni per creare profili di canzoni dettagliati.

L’origine dell’AI nella musica: un viaggio dall’elaborazione algoritmica al modeling generativo

Nelle prime fasi dell’introduzione dell’AI nel mondo della musica, che va dagli anni ’50 ai ’70, l’attenzione era focalizzata principalmente sull’elaborazione algoritmica. Questo era un metodo in cui i computer utilizzavano un insieme definito di regole per creare musica. La prima creazione notevole durante questo periodo fu la Illiac Suite per quartetto d’archi nel 1957. Utilizzava l’algoritmo di Monte Carlo, un processo che coinvolge numeri casuali per determinare l’altezza e il ritmo all’interno dei confini della teoria musicale tradizionale e delle probabilità statistiche.

Immagine generata dall'autore utilizzando Midjourney

Immagine generata dall’autore utilizzando Midjourney

Durante questo periodo, un altro pioniere, Iannis Xenakis, utilizzò processi stocastici, un concetto che coinvolge distribuzioni di probabilità casuali, per creare musica. Utilizzò computer e il linguaggio FORTRAN per collegare più funzioni di probabilità, creando un modello in cui diverse rappresentazioni grafiche corrispondevano a spazi sonori diversi.

La complessità della traduzione del testo in musica

La musica è archiviata in un formato di dati ricco e multidimensionale che comprende elementi come melodia, armonia, ritmo e tempo, rendendo il compito di tradurre il testo in musica altamente complesso. Una canzone standard è rappresentata da quasi un milione di numeri in un computer, un numero significativamente più alto di altri formati di dati come immagini, testo, ecc.

Il campo della generazione audio sta assistendo ad approcci innovativi per superare le sfide della creazione di suoni realistici. Un metodo coinvolge la generazione di uno spettrogramma e quindi la sua conversione in audio.

Un’altra strategia sfrutta la rappresentazione simbolica della musica, come la musica scritta, che può essere interpretata ed eseguita da musicisti. Questo metodo è stato digitalizzato con successo, con strumenti come il Chamber Ensemble Generator di Magenta, che crea musica nel formato MIDI, un protocollo che facilita la comunicazione tra computer e strumenti musicali.

Sebbene questi approcci abbiano avanzato il campo, presentano anche una serie di limitazioni, sottolineando la natura complessa della generazione audio.

I modelli autoregressivi basati su Transformer e i modelli di diffusione basati su U-Net, come i modelli di diffusione, sono all’avanguardia della tecnologia, producendo risultati di stato dell’arte (SOTA) nella generazione di audio, testo, musica e molto altro. La serie GPT di OpenAI e quasi tutti gli altri LLM attualmente sono alimentati da trasformatori che utilizzano architetture di encoder, decoder o entrambe. Sul lato arte/immagine, MidJourney, Stability AI e DALL-E 2 sfruttano tutti i framework di diffusione. Queste due tecnologie di base sono state fondamentali per raggiungere risultati SOTA nel settore audio. In questo articolo, esploreremo Google’s MusicLM e Stable Audio, che testimoniano le capacità notevoli di queste tecnologie.

Google’s MusicLM

Google’s MusicLM è stato rilasciato a maggio di quest’anno. MusicLM può generare pezzi musicali ad alta fedeltà che risuonano con il sentimento esatto descritto nel testo. Utilizzando la modellazione sequenza-sequenza gerarchica, MusicLM ha la capacità di trasformare descrizioni testuali in musica che risuona a 24 kHz su durate estese.

Il modello opera a livello multidimensionale, non solo aderendo agli input testuali ma anche dimostrando la capacità di essere condizionato su melodie. Ciò significa che può prendere una melodia fischiettata o cantata e trasformarla secondo lo stile delineato in una didascalia testuale.

Approfondimenti tecnici

MusicLM sfrutta i principi di AudioLM, un framework introdotto nel 2022 per la generazione audio. AudioLM sintetizza l’audio come un compito di modellazione linguistica all’interno di uno spazio di rappresentazione discreta, utilizzando una gerarchia di unità audio discrete da grossolane a fini, anche note come token. Questo approccio garantisce fedeltà e coerenza a lungo termine su durate sostanziali.

Per facilitare il processo di generazione, MusicLM estende le capacità di AudioLM per incorporare la condizionamento testuale, una tecnica che allinea l’audio generato con le sfumature del testo di input. Ciò è realizzato attraverso uno spazio di incorporamento condiviso creato utilizzando MuLan, un modello musicale-testuale congiunto addestrato per proiettare musica e relative descrizioni testuali vicine l’una all’altra in uno spazio di incorporamento. Questa strategia elimina efficacemente la necessità di didascalie durante l’addestramento, consentendo al modello di essere addestrato su enormi corpora audio-solo.

Il modello MusicLM utilizza anche SoundStream come tokenizzatore audio, che può ricostruire musica a 24 kHz a 6 kbps con fedeltà impressionante, sfruttando la quantizzazione vettoriale residuale (RVQ) per la compressione audio efficiente e di alta qualità.

Un'illustrazione del processo di pre-addestramento indipendente per i modelli fondamentali di MusicLM: SoundStream, w2v-BERT e MuLan,

Un’illustrazione del processo di pre-addestramento di MusicLM: SoundStream, w2v-BERT e MuLan | Fonte dell’immagine: qui

Inoltre, MusicLM estende le sue capacità consentendo la condizionamento della melodia. Questo approccio garantisce che anche una semplice melodia fischiettata possa costituire la base per un’esperienza auditiva magnifica, fine-tunata alle esatte descrizioni stilistiche testuali.

Gli sviluppatori di MusicLM hanno anche reso open-source MusicCaps, un set di dati che presenta 5.5k coppie musica-testo, ciascuna accompagnata da descrizioni testuali ricche create da esperti umani. Puoi trovarlo qui: MusicCaps su Hugging Face.

Pronto a creare colonne sonore AI con Google’s MusicLM? Ecco come iniziare:

  1. Visita il sito web ufficiale di MusicLM e clicca “Inizia.”
  2. Unisciti alla lista d’attesa selezionando “Registra il tuo interesse.”
  3. Accedi utilizzando il tuo account Google.
  4. Una volta concesso l’accesso, clicca “Prova ora” per iniziare.

Ecco alcuni esempi di prompt che ho sperimentato:

“Canzone meditativa, calma e rilassante, con flauti e chitarre. La musica è lenta, con un focus sulla creazione di un senso di pace e tranquillità.”

“jazz con sassofono”

Quando paragonato a precedenti modelli SOTA come Riffusion e Mubert in una valutazione qualitativa, MusicLM è stato preferito più degli altri, con i partecipanti che hanno valutato favorevolmente la compatibilità delle didascalie testuali con clip audio da 10 secondi.

Confronto delle prestazioni di MusicLM

Confronto delle prestazioni di MusicLM, Fonte dell’immagine: qui

Stability Audio

Stability AI ha introdotto recentemente “Stable Audio”, un’architettura di modello di diffusione latente condizionata su metadati testuali oltre che sulla durata del file audio e sull’ora di inizio. Questo approccio, come Google’s MusicLM, ha il controllo sul contenuto e sulla lunghezza dell’audio generato, consentendo la creazione di clip audio con lunghezze specificate fino alle dimensioni della finestra di addestramento.

Approfondimenti tecnici

Stable Audio comprende diversi componenti, tra cui un’autoencoder variazionale (VAE) e un modello di diffusione condizionato basato su U-Net, che lavorano insieme con un encoder testuale.

Un'illustrazione che mostra l'integrazione di un'autoencoder variazionale (VAE), un encoder testuale e un modello di diffusione condizionato basato su U-Net

Architettura di Stable Audio, Fonte dell’immagine: qui

Il VAE facilita la generazione più rapida e l’addestramento, compressando l’audio stereo in un’incorporazione lossy, resistente al rumore e invertibile, bypassando la necessità di lavorare con campioni audio grezzi.

L’encoder testuale, derivato da un modello CLAP, svolge un ruolo fondamentale nel comprendere le intricate relazioni tra parole e suoni, offrendo una rappresentazione informativa del testo di input tokenizzato. Ciò è realizzato attraverso l’utilizzo di caratteristiche testuali dall’ultimo livello dell’encoder testuale CLAP, che vengono poi integrate nel modello di diffusione U-Net attraverso livelli di cross-attenzione.

Un aspetto importante è l’incorporazione di incorporamenti temporali, che vengono calcolati in base a due proprietà: il secondo di inizio del chunk audio e la durata totale del file audio originale. Questi valori, tradotti in incorporamenti discreti appresi per secondo, vengono combinati con i token di prompt e alimentati nei livelli di cross-attenzione dell’U-Net, consentendo agli utenti di dettare la lunghezza complessiva dell’output audio.

Il modello Stable Audio è stato addestrato utilizzando un vasto set di dati di oltre 800.000 file audio, in collaborazione con il fornitore di musica stock AudioSparx.

Spot pubblicitari di Stable audio

Spot pubblicitari di Stable audio

Stable Audio offre una versione gratuita, che consente 20 generazioni di tracce fino a 20 secondi al mese, e un piano Pro da 12 dollari al mese, che consente 500 generazioni di tracce fino a 90 secondi.

Ecco un clip audio che ho creato utilizzando Stable Audio.

Immagine generata dall'autore utilizzando Midjourney

Immagine generata dall’autore utilizzando Midjourney

“Cinematico, Colonna sonora pioggia gentile, Ambient, Rilassante, Cani lontani che abbaiano, Fruscio di foglie calmante, Vento sottile, 40 BPM”

 

Le applicazioni di questi pezzi audio finemente elaborati sono infinite. I registi possono sfruttare questa tecnologia per creare paesaggi sonori ricchi e immersivi. Nel settore commerciale, gli inserzionisti possono utilizzare queste tracce audio personalizzate. Inoltre, questo strumento apre strade per creatori e artisti individuali per sperimentare e innovare, offrendo una tela di potenziale illimitato per creare pezzi sonori che narrano storie, evocano emozioni e creano atmosfere con una profondità che era precedentemente difficile da raggiungere senza un budget sostanziale o competenze tecniche.

Suggerimenti per la scrittura di prompt

Crea l’audio perfetto utilizzando prompt testuali. Ecco una guida rapida per iniziare:

  1. Sii dettagliato: Specifica generi, umori e strumenti. Ad esempio: Cinematico, Selvaggio West, Percussione, Teso, Atmosferico
  2. Impostazione dell’umore: Combina termini musicali ed emozionali per trasmettere l’umore desiderato.
  3. Scelta dello strumento: Migliora i nomi degli strumenti con aggettivi, come “Chitarra riverberata” o “Coro potente”.
  4. BPM: Allinea il tempo con il genere per un output armonioso, come “170 BPM” per una traccia Drum and Bass.

Note conclusive

Immagine generata dall'autore utilizzando Midjourney

Immagine generata dall’autore utilizzando Midjourney

In questo articolo, abbiamo esplorato la musica generata da AI, dalle composizioni algoritmiche ai sofisticati framework di intelligenza artificiale generativa di oggi come Google’s MusicLM e Stability Audio. Queste tecnologie, che sfruttano l’apprendimento profondo e i modelli di compressione SOTA, non solo migliorano la generazione musicale ma anche l’esperienza di ascolto degli utenti.

Tuttavia, è un dominio in costante evoluzione, con sfide come il mantenimento della coerenza a lungo termine e il dibattito in corso sull’autenticità della musica creata da AI che sfidano i pionieri in questo campo. Solo una settimana fa, il buzz era tutto sulla canzone creata da AI che incanalava gli stili di Drake e The Weeknd, che aveva inizialmente preso fuoco online all’inizio di quest’anno. Tuttavia, è stato rimosso dall’elenco delle nomination ai Grammy, mostrando il dibattito in corso sulla legittimità della musica generata da AI nel settore (fonte). Mentre l’AI continua a colmare il divario tra la musica e gli ascoltatori, sta sicuramente promuovendo un ecosistema in cui la tecnologia coesiste con l’arte, promuovendo l’innovazione e rispettando la tradizione.

Ho trascorso gli ultimi cinque anni immergendomi nel mondo affascinante del Machine Learning e del Deep Learning. La mia passione e la mia esperienza mi hanno portato a contribuire a oltre 50 progetti di ingegneria del software diversi, con un focus particolare su AI/ML. La mia curiosità in corso mi ha anche portato verso l'elaborazione del linguaggio naturale, un campo che sono ansioso di esplorare ulteriormente.