AI-modeller og plattformer

Forskere utvikler AI-modell som kan synge på både kinesisk og engelsk

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Et team av forskere fra Microsoft og Zhajiang University har nylig utviklet en AI-modell som kan synge på flere språk. Ifølge VentureBeat, ble DeepSinger AI utviklet av teamet trening på data fra ulike musikksider, ved hjelp av algoritmer som fanget timbren til sangerens stemme.

Å generere en “stemme” til en AI-sanger krever algoritmer som kan forutsi og kontrollere både tonehøyde og varighet av lyd. Når mennesker synger, har lydene de produserer mye mer komplekse rytmer og mønster sammenlignet med vanlig tale. Et annet problem for teamet å overvinne var at mens det finnes en del tale/treningdata tilgjengelig, er sang-treningdata relativt sjeldne. Kombiner disse utfordringene med det faktum at sanger må ha både lyd og tekst analysert, og problemet med å generere sang er ekstremt komplekst.

DeepSinger-systemet utviklet av forskerne overvant disse utfordringene ved å utvikle en datapipeline som utvant og transformerte lyddata. Klipp av sang ble eksfrert fra ulike musikksider, og deretter ble sangen isolert fra resten av lyden og delt inn i setninger. Neste skritt var å bestemme varigheten av hver fonem i tekstene, resulterende i en rekke eksempler som hver representerer et unikt fonem i tekstene. Rensning av data gjøres for å håndtere eventuelle forvrengte trenings eksempler etter at tekstene og tilhørende lydeksempler er sortert etter konfidensscore.

De samme metodene ser ut til å fungere for en rekke språk. DeepSinger ble trent på kinesiske, kantonesiske og engelske vokale eksempler bestående av 89 forskjellige sangere som sang i over 92 timer. Resultatene av studien fant at DeepSinger-systemet kunne pålitelig generere høykvalitets “sang”-eksempler ifølge mål som nøyaktighet av tonehøyde og hvor naturlig sangen låter. Forskerne hadde 20 personer som vurderte både sanger generert av DeepSinger og trenings-sangene ifølge disse målene, og gapet mellom poengene for de genererte eksemplene og ekte lyd var ganske liten. Deltagerne ga DeepSinger en gjennomsnittlig meningsscore som avvikte mellom 0,34 og 0,76.

I fremtiden ønsker forskerne å prøve å forbedre kvaliteten på de genererte stemmene ved å trene de ulike undermodellene som utgjør DeepSinger, gjort med hjelp av spesialteknologier som WaveNet som er designet spesifikt for å generere naturlig lydende tale gjennom lydbølger.

DeepSinger-systemet kan brukes til å hjelpe sangere og andre musikere å korrigere arbeid uten å måtte gå tilbake til studio for en ny innspillingsøkt. Det kan også potensielt brukes til å lage lyd-djefakta, og gjøre det slik at det ser ut som om en artist sang en sang de aldri faktisk gjorde. Mens det kan brukes til parodi eller satire, er det også av tvilsom lovlighet.

DeepSinger er bare ett av en bølge av nye AI-baserte musikk- og lydsystemer som kan transformere hvordan musikk og programvare samhandler. OpenAI har nylig lansert sitt eget AI-system, kalt JukeBox, som kan produsere originale musikkspor i en bestemt sjanger eller selv en bestemt artist. Andre musikalske AI-verktøy inkluderer Googles Magenta og Amazons DeepComposer. Magenta er en åpen kildekode (og bilde) manipulasjonsbibliotek som kan brukes til å produsere alt fra automatiske trommebakgrunner til enkle musikkbaserte videospill. Mens Amazons DeepComposer er rettet mot de som ønsker å trene og tilpasse sine egne musikkbaserte dyptlæringsmodeller, og lar brukeren ta forhåndsinnlærte eksempler og justere modellene etter deres behov. Du kan lytte til noen av lydeksemplene generert av DeepSinger på denne lenken.

(GOOGL ) (AMZN )

Blogger og programmerer med spesialområder i Machine Learning og Deep Learning emner. Daniel håper å hjelpe andre med å bruke kraften av AI for sosialt godt.