Modelli e piattaforme di IA

OpenAI Crea un Nuovo Programma AI per Creare Musica in Base a Generi

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

L’organizzazione di ricerca indipendente OpenAI ha recentemente rilasciato una nuova forma di AI generativa chiamata Jukebox, cosÃŽ chiamata a causa della sua capacità di generare musica. L’AI Jukebox ÃĻ in grado di generare suoni in base a attributi come strumentazione e anche testi, e il team di ricerca di OpenAI ha creato l’AI addestrandola con clip audio compressi e vari frammenti di testi.

Come riportato da TechCrunch , gli ricercatori di OpenAI hanno addestrato il modello utilizzando clip audio grezzi, dando al modello la capacità di produrre audio. CiÃē ÃĻ in contrasto con gli approcci utilizzati per creare altre applicazioni di generazione di musica, che spesso si basano sulla “musica simbolica” (come la musica MIDI) che ÃĻ informazione sulle note e le altezze, ma non l’audio effettivo. Il team di ricercatori ha utilizzato reti neurali convoluzionali per addestrare il modello, comprimendo l’audio e codificandolo in un formato che la rete neurale potesse interpretare. Successivamente, un trasformatore ÃĻ stato utilizzato per generare audio compresso, che ÃĻ stato campionato per convertire i dati in un formato audio.

Quando si crea Jukebox, OpenAI ha dovuto creare un metodo per gestire la natura complessa e densa dell’audio. I ricercatori hanno gestito la natura continua dell’audio dividendo le canzoni in bit che sono lunghi 1/128 di secondo. L’obiettivo era creare un modello di AI in grado di dividere le canzoni in pezzi abbastanza grandi da non rendere il problema intractabile, ma abbastanza piccoli e precisi da poter apprendere il pattern di una canzone e ricostruirlo.

La tecnica utilizzata da OpenAI condivide alcune somiglianze con un vecchio AI di generazione di musica prodotto dalla società, chiamato MuseNet. MuseNet ÃĻ stato addestrato su file MIDI e poteva generare musica in una varietà di stili, sebbene si concentrasse sulla melodia generale di una canzone e non potesse produrre testi. Al contrario, Jukebox ÃĻ in grado di scrivere i propri testi per accompagnare la musica. I testi sono “co-scritti” dai ricercatori di OpenAI, guidando il modello verso la creazione di testi in determinati stili. Il sistema Jukebox ÃĻ stato addestrato su testi recuperati da LyricWiki, con dati di addestramento che consistevano in testo e metadati su 1,2 milioni di canzoni.

Quando si tratta dei testi del modello, i ricercatori hanno prima provato a utilizzare un semplice algoritmo che allungava i testi alla durata approssimativa di una canzone, analizzando il testo che corrispondeva a un particolare pezzo/segmento della canzone. Questo approccio semplice ha funzionato bene in generale, sebbene i ricercatori abbiano scoperto che quando i testi erano particolarmente veloci, si rompeva. Per risolvere questo problema, le voci sono state estratte dalla canzone e allineate con il testo dei testi per ottenere allineamenti a livello di parola per i testi. Successivamente, un livello di codifica ÃĻ stato utilizzato per i testi insieme a un livello di attenzione che mappava sezioni della musica ai testi utilizzando coppie chiave-valore. Il risultato ÃĻ stato che i testi e le voci avevano una corrispondenza abbastanza precisa.

Gli autori del documento notano anche che ci sono diverse limitazioni che Jukebox ha, e che il lavoro futuro mirerà a migliorare la capacità dell’AI. Come gli autori scrivono in un post del blog :

“Sebbene Jukebox rappresenti un passo avanti nella qualità musicale, coerenza, lunghezza del campione audio e capacità di condizionare l’artista, il genere e i testi, c’ÃĻ un divario significativo tra queste generazioni e la musica creata dall’uomo. Ad esempio, sebbene le canzoni generate mostrino una coerenza musicale locale, seguano modelli di accordi tradizionali e possano anche presentare assoli impressionanti, non sentiamo strutture musicali piÃđ grandi e familiari come i cori che si ripetono.”

Al momento, il modello ÃĻ in grado di produrre una canzone che ÃĻ riconoscibile nello stile di un genere specifico o anche di un artista specifico. Ad esempio, puÃē produrre canzoni nello stile di Elvis Presley, Katy Perry o Rage Against the Machine. Sebbene le canzoni siano riconoscibili all’interno di un genere o tematiche intorno allo stile di un cantante, sono anche abbastanza grezze, spesso suonando come una parodia o una cattiva copia di una canzone. Tuttavia, il risultato tecnico ÃĻ impressionante. I ricercatori responsabili della creazione del sistema di generazione di AI hanno scelto di lavorare su un programma in grado di generare musica specificamente perchÃĐ il compito era difficile, e i ricercatori pianificano di continuare a raffinare le loro tecniche. Puoi ascoltare alcune delle canzoni qui.

Blogger e programmatore con specializzazioni in Machine Learning e Deep Learning argomenti. Daniel spera di aiutare gli altri a utilizzare il potere dell'AI per il bene sociale.