AI-modeller og platforme
Forskere udvikler AI-model, der kan synge på både kinesisk og engelsk
Et hold forskere fra Microsoft og Zhajiang University har nyligt udviklet en AI-model, der kan synge på flere sprog. Ifølge VentureBeat blev DeepSinger AI udviklet af holdet trænet på data fra forskellige musik-websites, ved hjælp af algoritmer, der fik fat i timbren af sangerens stemme.
At generere en “stemme” til en AI-sanger kræver algoritmer, der kan forudsige og kontrollere både tonehøjde og varighed af lyd. Når mennesker synger, har de lyde, de producerer, langt mere komplekse rytmer og mønstre sammenlignet med almindelig tale. Et andet problem, som holdet skulle overvinde, var, at mens der er en del tale/træningsdata til rådighed, er sangtræningsdata-sæt ret sjældne. Kombiner disse udfordringer med, at sange skal have både lyd og tekst analyseret, og problemet med at generere sang er utrolig komplekst.
DeepSinger-systemet, som forskerne udviklede, overvandt disse udfordringer ved at udvikle en data-pipeline, der udvandt og omdannede lyddata. Klip af sang blev udtrukket fra forskellige musik-websites, og derefter blev sangen isoleret fra resten af lyden og opdelt i sætninger. Næste skridt var at bestemme varigheden af hver fonem i teksten, hvilket resulterede i en række prøver, hvor hver repræsenterede et unikt fonem i teksten. Rensning af data blev udført for at tackle eventuelle forvrængede træningsprøver efter, at teksten og den tilhørende lydprøve var sorteret efter tillidsvurdering.
De samme metoder synes at virke for en række sprog. DeepSinger blev trænet på kinesiske, kantonesiske og engelske vokalprøver bestående af 89 forskellige sangere, der sang i over 92 timer. Resultaterne af studiet fandt, at DeepSinger-systemet kunne pålideligt generere højkvalitets “sang”-prøver ifølge mål som tonehøjde og hvor naturlig sangen lød. Forskerne havde 20 personer bedømme både sange genereret af DeepSinger og træningssangene ifølge disse mål, og forskellen mellem scorene for de genererede prøver og ægte lyd var ret lille. Deltagerne gav DeepSinger en gennemsnitlig menings-score, der afveg mellem 0,34 og 0,76.
Settende fremad vil forskerne prøve at forbedre kvaliteten af de genererede stemmer ved at træne de forskellige undermodeller, der udgør DeepSinger, med hjælp fra specialteknologier som WaveNet, der er designet specifikt til opgaven med at generere naturlig lydende tale gennem lydbølger.
DeepSinger-systemet kan bruges til at hjælpe sangere og andre musikere med at korrigere deres arbejde uden at skulle gå tilbage i studiet for endnu en optagelsesession. Det kan også potentielt bruges til at skabe audio-deepfakes, så det ser ud, som om en kunstner sang en sang, de aldrig har sunget. Mens det kan bruges til parodi eller satire, er det også af tvivlsom lovlighed.
DeepSinger er blot en af en bølge af nye AI-baserede musik- og lydsystemer, der kan forandre, hvordan musik og software interagerer. OpenAI har nyligt udgivet deres eget AI-system, kaldet JukeBox, der kan producere originale musikspor i en bestemt genre eller endda en specifik kunstner. Andre musikalske AI-værktøjer omfatter Googles Magenta og Amazons DeepComposer. Magenta er en open-source lyd- (og billed-) manipulationsbibliotek, der kan bruges til at producere alt fra automatiseret tromme-backing til simple musik-baserede videospil. Imens er Amazons DeepComposer rettet mod dem, der ønsker at træne og tilpasse deres egne musik-baserede dybe læremodeller, hvilket giver brugeren mulighed for at tage forudtrænede prøvemodeller og justere modellerne efter deres behov.
DeepSinger er kun ét af mange nye AI-baserede musik- og lydsystemer, der kan forandre, hvordan musik og software interagerer. Du kan lytte til nogle af de lydprøver, der er genereret af DeepSinger, på dette link.












