Modelli e piattaforme di IA
OpenAI Crea un Nuovo Programma AI per Creare Musica in Base a Generi
L’organizzazione di ricerca indipendente OpenAI ha recentemente rilasciato una nuova forma di AI generativa chiamata Jukebox, così chiamata a causa della sua capacità di generare musica. L’AI Jukebox è in grado di generare suoni in base a attributi come strumentazione e anche testi, e il team di ricerca di OpenAI ha creato l’AI addestrandola con clip audio compressi e vari frammenti di testi.
Quando si crea Jukebox, OpenAI ha dovuto creare un metodo per gestire la natura complessa e densa dell’audio. I ricercatori hanno gestito la natura continua dell’audio dividendo le canzoni in bit che sono lunghi 1/128 di secondo. L’obiettivo era creare un modello di AI in grado di dividere le canzoni in pezzi abbastanza grandi da non rendere il problema intractabile, ma abbastanza piccoli e precisi da poter apprendere il pattern di una canzone e ricostruirlo.
La tecnica utilizzata da OpenAI condivide alcune somiglianze con un vecchio AI di generazione di musica prodotto dalla società, chiamato MuseNet. MuseNet è stato addestrato su file MIDI e poteva generare musica in una varietà di stili, sebbene si concentrasse sulla melodia generale di una canzone e non potesse produrre testi. Al contrario, Jukebox è in grado di scrivere i propri testi per accompagnare la musica. I testi sono “co-scritti” dai ricercatori di OpenAI, guidando il modello verso la creazione di testi in determinati stili. Il sistema Jukebox è stato addestrato su testi recuperati da LyricWiki, con dati di addestramento che consistevano in testo e metadati su 1,2 milioni di canzoni.
Quando si tratta dei testi del modello, i ricercatori hanno prima provato a utilizzare un semplice algoritmo che allungava i testi alla durata approssimativa di una canzone, analizzando il testo che corrispondeva a un particolare pezzo/segmento della canzone. Questo approccio semplice ha funzionato bene in generale, sebbene i ricercatori abbiano scoperto che quando i testi erano particolarmente veloci, si rompeva. Per risolvere questo problema, le voci sono state estratte dalla canzone e allineate con il testo dei testi per ottenere allineamenti a livello di parola per i testi. Successivamente, un livello di codifica è stato utilizzato per i testi insieme a un livello di attenzione che mappava sezioni della musica ai testi utilizzando coppie chiave-valore. Il risultato è stato che i testi e le voci avevano una corrispondenza abbastanza precisa.
Gli autori del documento notano anche che ci sono diverse limitazioni che Jukebox ha, e che il lavoro futuro mirerà a migliorare la capacità dell’AI. Come gli autori scrivono in un post del blog :
“Sebbene Jukebox rappresenti un passo avanti nella qualità musicale, coerenza, lunghezza del campione audio e capacità di condizionare l’artista, il genere e i testi, c’è un divario significativo tra queste generazioni e la musica creata dall’uomo. Ad esempio, sebbene le canzoni generate mostrino una coerenza musicale locale, seguano modelli di accordi tradizionali e possano anche presentare assoli impressionanti, non sentiamo strutture musicali più grandi e familiari come i cori che si ripetono.”
Al momento, il modello è in grado di produrre una canzone che è riconoscibile nello stile di un genere specifico o anche di un artista specifico. Ad esempio, può produrre canzoni nello stile di Elvis Presley, Katy Perry o Rage Against the Machine. Sebbene le canzoni siano riconoscibili all’interno di un genere o tematiche intorno allo stile di un cantante, sono anche abbastanza grezze, spesso suonando come una parodia o una cattiva copia di una canzone. Tuttavia, il risultato tecnico è impressionante. I ricercatori responsabili della creazione del sistema di generazione di AI hanno scelto di lavorare su un programma in grado di generare musica specificamente perché il compito era difficile, e i ricercatori pianificano di continuare a raffinare le loro tecniche. Puoi ascoltare alcune delle canzoni qui.












