Modelli e piattaforme di IA
I ricercatori creano un modello di intelligenza artificiale in grado di cantare in cinese e inglese
Un team di ricercatori di Microsoft e dell’Università di Zhajiang ha recentemente creato un modello di intelligenza artificiale in grado di cantare in numerose lingue. Come riportato da VentureBeat, il modello DeepSinger sviluppato dal team è stato addestrato su dati provenienti da vari siti web musicali, utilizzando algoritmi che hanno catturato il timbro della voce del cantante.
Generare la “voce” di un cantante di intelligenza artificiale richiede algoritmi in grado di prevedere e controllare sia la pitch che la durata dell’audio. Quando le persone cantano, i rumori che producono hanno ritmi e pattern molto più complessi rispetto al semplice discorso. Un altro problema che il team ha dovuto superare è che mentre esiste una quantità ragionevole di dati di addestramento per il discorso, i set di dati di addestramento per il canto sono abbastanza rari. Combinare queste sfide con il fatto che le canzoni devono avere sia il suono che i testi analizzati, e il problema di generare il canto è incredibilmente complesso.
Il sistema DeepSinger creato dai ricercatori ha superato queste sfide sviluppando una pipeline di dati che ha estratto e trasformato i dati audio. I clip di canto sono stati estratti da vari siti web musicali, e poi il canto è stato isolato dal resto dell’audio e diviso in frasi. Il passo successivo è stato determinare la durata di ogni fonema all’interno dei testi, risultando in una serie di campioni ciascuno rappresentante un fonema unico nei testi. La pulizia dei dati è stata eseguita per gestire eventuali campioni di addestramento distorti dopo che i testi e i campioni audio sono stati ordinati in base al punteggio di confidenza.
Gli stessi metodi sembrano funzionare per una varietà di lingue. DeepSinger è stato addestrato su campioni vocali cinesi, cantonesi e inglesi composti da 89 diversi cantanti che cantano per oltre 92 ore. I risultati dello studio hanno trovato che il sistema DeepSinger è stato in grado di generare in modo affidabile campioni di “canto” di alta qualità in base a metriche come l’accuratezza della pitch e quanto naturale suonava il canto. I ricercatori hanno fatto ascoltare a 20 persone canzoni generate da DeepSinger e canzoni di addestramento in base a queste metriche e il divario tra i punteggi per i campioni generati e l’audio genuino era piuttosto piccolo. I partecipanti hanno assegnato a DeepSinger un punteggio di opinione medio che deviava tra 0,34 e 0,76.
Guardando avanti, i ricercatori vogliono provare a migliorare la qualità delle voci generate addestrando congiuntamente i vari sottomodelli che compongono DeepSinger, fatto con l’assistenza di tecnologie specializzate come WaveNet progettate specificamente per il compito di generare discorso naturale attraverso forme d’onda audio.
Il sistema DeepSinger potrebbe essere utilizzato per aiutare i cantanti e altri artisti musicali a correggere il loro lavoro senza dover tornare in studio per un’altra sessione di registrazione. Potrebbe anche essere utilizzato per creare audio deepfake, facendo sembrare che un artista abbia cantato una canzone che non ha mai realmente cantato. Mentre potrebbe essere utilizzato per parodia o satira, è anche di dubbia legalità.
DeepSinger è solo una delle nuove ondate di sistemi di musica e audio basati su intelligenza artificiale che potrebbero trasformare il modo in cui la musica e il software interagiscono. OpenAI ha recentemente rilasciato il proprio sistema di intelligenza artificiale, chiamato JukeBox, che è in grado di produrre tracce musicali originali nello stile di un certo genere o addirittura di un artista specifico. Altri strumenti musicali basati su intelligenza artificiale includono Google’s Magenta e Amazon’s DeepComposer (AMZN ). Magenta è una libreria di manipolazione audio (e immagine) open source che può essere utilizzata per produrre tutto, dalle basi di batteria automatizzate ai semplici giochi di musica basati su video. Nel frattempo, Amazon’s DeepComposer è rivolto a coloro che desiderano addestrare e personalizzare i propri modelli di apprendimento profondo basati su musica, consentendo all’utente di prendere modelli di esempio pre-addestrati e regolare i modelli in base alle proprie esigenze.
(GOOGL )Puoi ascoltare alcuni dei campioni audio generati da DeepSinger a questo link.












