Modelli e piattaforme di IA

OpenAI Crea un Nuovo Programma AI per Creare Musica in Base a Generi

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

L’organizzazione di ricerca indipendente OpenAI ha recentemente rilasciato una nuova forma di AI generativa chiamata Jukebox, così chiamata a causa della sua capacità di generare musica. L’AI Jukebox è in grado di generare suoni in base a attributi come strumentazione e anche testi, e il team di ricerca di OpenAI ha creato l’AI addestrandola con clip audio compressi e vari frammenti di testi.

Come riportato da TechCrunch , gli ricercatori di OpenAI hanno addestrato il modello utilizzando clip audio grezzi, dando al modello la capacità di produrre audio. Ciò è in contrasto con gli approcci utilizzati per creare altre applicazioni di generazione di musica, che spesso si basano sulla “musica simbolica” (come la musica MIDI) che è informazione sulle note e le altezze, ma non l’audio effettivo. Il team di ricercatori ha utilizzato reti neurali convoluzionali per addestrare il modello, comprimendo l’audio e codificandolo in un formato che la rete neurale potesse interpretare. Successivamente, un trasformatore è stato utilizzato per generare audio compresso, che è stato campionato per convertire i dati in un formato audio.

Quando si crea Jukebox, OpenAI ha dovuto creare un metodo per gestire la natura complessa e densa dell’audio. I ricercatori hanno gestito la natura continua dell’audio dividendo le canzoni in bit che sono lunghi 1/128 di secondo. L’obiettivo era creare un modello di AI in grado di dividere le canzoni in pezzi abbastanza grandi da non rendere il problema intractabile, ma abbastanza piccoli e precisi da poter apprendere il pattern di una canzone e ricostruirlo.

La tecnica utilizzata da OpenAI condivide alcune somiglianze con un vecchio AI di generazione di musica prodotto dalla società, chiamato MuseNet. MuseNet è stato addestrato su file MIDI e poteva generare musica in una varietà di stili, sebbene si concentrasse sulla melodia generale di una canzone e non potesse produrre testi. Al contrario, Jukebox è in grado di scrivere i propri testi per accompagnare la musica. I testi sono “co-scritti” dai ricercatori di OpenAI, guidando il modello verso la creazione di testi in determinati stili. Il sistema Jukebox è stato addestrato su testi recuperati da LyricWiki, con dati di addestramento che consistevano in testo e metadati su 1,2 milioni di canzoni.

Quando si tratta dei testi del modello, i ricercatori hanno prima provato a utilizzare un semplice algoritmo che allungava i testi alla durata approssimativa di una canzone, analizzando il testo che corrispondeva a un particolare pezzo/segmento della canzone. Questo approccio semplice ha funzionato bene in generale, sebbene i ricercatori abbiano scoperto che quando i testi erano particolarmente veloci, si rompeva. Per risolvere questo problema, le voci sono state estratte dalla canzone e allineate con il testo dei testi per ottenere allineamenti a livello di parola per i testi. Successivamente, un livello di codifica è stato utilizzato per i testi insieme a un livello di attenzione che mappava sezioni della musica ai testi utilizzando coppie chiave-valore. Il risultato è stato che i testi e le voci avevano una corrispondenza abbastanza precisa.

Gli autori del documento notano anche che ci sono diverse limitazioni che Jukebox ha, e che il lavoro futuro mirerà a migliorare la capacità dell’AI. Come gli autori scrivono in un post del blog :

“Sebbene Jukebox rappresenti un passo avanti nella qualità musicale, coerenza, lunghezza del campione audio e capacità di condizionare l’artista, il genere e i testi, c’è un divario significativo tra queste generazioni e la musica creata dall’uomo. Ad esempio, sebbene le canzoni generate mostrino una coerenza musicale locale, seguano modelli di accordi tradizionali e possano anche presentare assoli impressionanti, non sentiamo strutture musicali più grandi e familiari come i cori che si ripetono.”

Al momento, il modello è in grado di produrre una canzone che è riconoscibile nello stile di un genere specifico o anche di un artista specifico. Ad esempio, può produrre canzoni nello stile di Elvis Presley, Katy Perry o Rage Against the Machine. Sebbene le canzoni siano riconoscibili all’interno di un genere o tematiche intorno allo stile di un cantante, sono anche abbastanza grezze, spesso suonando come una parodia o una cattiva copia di una canzone. Tuttavia, il risultato tecnico è impressionante. I ricercatori responsabili della creazione del sistema di generazione di AI hanno scelto di lavorare su un programma in grado di generare musica specificamente perché il compito era difficile, e i ricercatori pianificano di continuare a raffinare le loro tecniche. Puoi ascoltare alcune delle canzoni qui.

Blogger e programmatore con specializzazioni in Machine Learning e Deep Learning argomenti. Daniel spera di aiutare gli altri a utilizzare il potere dell'AI per il bene sociale.