Modele și platforme AI
Cercetători creează un model de inteligență artificială capabil să cânte în chineză și engleză
O echipă de cercetători de la Microsoft și Universitatea Zhajiang a creat recent un model de inteligență artificială capabil să cânte în numeroase limbi. Așa cum a raportat VentureBeat, modelul DeepSinger AI, dezvoltat de echipă a fost antrenat pe date de pe diverse site-uri de muzică, utilizând algoritmi care au capturat timbrul vocii cântărețului.
Generarea “vocii” unui cântăreț de inteligență artificială necesită algoritmi care sunt capabili să prevadă și să controleze atât pitch-ul, cât și durata audio. Când oamenii cântă, zgomotele pe care le produc au ritmuri și modele mult mai complexe comparativ cu vorbirea simplă. O altă problemă pe care echipa a trebuit să o depășească a fost că, în timp ce există o cantitate considerabilă de date de antrenament pentru vorbire, seturile de date de antrenament pentru cântat sunt relativ rare. Combinați aceste provocări cu faptul că cântecele necesită atât sunet, cât și analiza versurilor, și problema generării cântecelor devine incredibil de complexă.
Sistemul DeepSinger creat de cercetători a depășit aceste provocări prin dezvoltarea unui flux de date care a extras și transformat datele audio. Clipurile de cântat au fost extrase de pe diverse site-uri de muzică, apoi cântatul a fost izolat de restul audio și divizat în propoziții. Următorul pas a fost să se determine durata fiecărui fonem din versuri, rezultând o serie de mostre care reprezintă fiecare fonem unic din versuri. Curățarea datelor se face pentru a face față oricăror mostre de antrenament distorsionate după ce versurile și mostrele audio însoțitoare sunt sortate în funcție de scorul de încredere.
Aceleași metode par să funcționeze pentru o varietate de limbi. DeepSinger a fost antrenat pe mostre vocale chineze, cantoneze și engleze, alcătuite din 89 de cântăreți care cântă timp de peste 92 de ore. Rezultatele studiului au arătat că sistemul DeepSinger a fost capabil să genereze mostre de “cântat” de înaltă calitate, conform unor metrice precum acuratețea pitch-ului și cât de natural sună cântatul. Cercetătorii au avut 20 de persoane care au evaluat atât cântecele generate de DeepSinger, cât și cântecele de antrenament, conform acestor metrice, și diferența dintre scorurile pentru mostrele generate și audio-ul autentic a fost foarte mică. Participanții au acordat DeepSinger un scor de opinie medie care a variat între 0,34 și 0,76.
În perspectivă, cercetătorii doresc să încerce să îmbunătățească calitatea vocilor generate prin antrenarea comună a diverselor submodele care compun DeepSinger, cu ajutorul unor tehnologii specializate, cum ar fi WaveNet, care sunt proiectate în mod special pentru generarea de vorbire naturală prin forme de undă audio.
Sistemul DeepSinger ar putea fi utilizat pentru a ajuta cântăreți și alți artiști muzicali să corecteze lucrările lor fără a fi nevoiți să se întoarcă în studio pentru o altă sesiune de înregistrare. De asemenea, ar putea fi utilizat pentru a crea “deepfakes” audio, făcându-se să pară că un artist a cântat o melodie pe care nu a cântat-o de fapt. În timp ce ar putea fi utilizat pentru parodie sau satiră, este și de o legalitate îndoielnică.
DeepSinger este doar una dintre valul de noi sisteme de muzică și audio bazate pe inteligență artificială care ar putea transforma modul în care interacționează muzica și software-ul. OpenAI a lansat recent propriul sistem de inteligență artificială, numit JukeBox, care este capabil să producă piese muzicale originale în stilul unui anumit gen sau chiar al unui artist specific. Alte unelte muzicale bazate pe inteligență artificială includ Magenta de la Google (GOOGL ) și DeepComposer de la Amazon (AMZN ). Magenta este o bibliotecă de manipulare audio (și imagine) open source care poate fi utilizată pentru a produce totul, de la acompaniament de tobă automat la simple jocuri video muzicale. Între timp, DeepComposer de la Amazon este destinat celor care doresc să antreneze și să personalizeze propriile modele de învățare profundă bazate pe muzică, permițând utilizatorului să ia mostre preantrenate și să ajusteze modelele în funcție de nevoile lor.
Puteți asculta unele dintre mostrele audio generate de DeepSinger la acest link.












