AI-modeller och plattformar

Forskare Skapar AI-Modell som Kan Sjunga på Både Kinesiska och Engelska

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Ett team av forskare från Microsoft och Zhajiang University har nyligen skapat en AI-modell som kan sjunga på flera språk. Som VentureBeat rapporterade, utvecklades DeepSinger AI av teamet tränades på data från olika musikwebbplatser, med algoritmer som fångade timbren av sångarens röst.

Att generera en “röst” för en AI-sångare kräver algoritmer som kan förutsäga och kontrollera både tonhöjd och varaktighet av ljud. När människor sjunger producerar de ljud med mycket mer komplexa rytmer och mönster jämfört med vanligt tal. Ett annat problem för teamet att övervinna var att det finns en hel del tal/träningdata tillgänglig, men sjungande träningsdata är ganska sällsynta. Kombinera dessa utmaningar med det faktum att sånger behöver ha både ljud och text analyserade, och problemet med att generera sång är otroligt komplext.

DeepSinger-systemet som skapades av forskarna övervann dessa utmaningar genom att utveckla en datapipeline som utvann och omvandlade ljuddata. Klippen av sång togs från olika musikwebbplatser, och sedan isolerades sången från resten av ljudet och delades in i meningar. Nästa steg var att bestämma varaktigheten av varje fonem i texten, vilket resulterade i en serie prover som vardera representerade ett unikt fonem i texten. Rengöring av data görs för att hantera eventuella förvanskade träningsprover efter att texten och tillhörande ljudprover sorterats enligt förtroendepoäng.

De exakta metoderna verkar fungera för en mängd olika språk. DeepSinger tränades på kinesiska, kantonesiska och engelska vokala prover som bestod av 89 olika sångare som sjöng i över 92 timmar. Resultaten av studien visade att DeepSinger-systemet kunde tillförlitligt generera högkvalitativa “sång”prover enligt mått som noggrannhet av tonhöjd och hur naturligt sången lät. Forskarna hade 20 personer som bedömde både sånger genererade av DeepSinger och träningslåtarna enligt dessa mått, och gapet mellan poängen för de genererade proverna och äkta ljud var ganska litet. Deltagarna gav DeepSinger ett medelopinionsscore som avvek med mellan 0,34 och 0,76.

I framtiden vill forskarna försöka förbättra kvaliteten på de genererade rösterna genom att gemensamt träna de olika undermodellerna som utgör DeepSinger, med hjälp av specialteknologier som WaveNet som är utformade specifikt för uppgiften att generera naturligt ljudande tal genom ljudvågor.

DeepSinger-systemet kunde användas för att hjälpa sångare och andra musikartister att korrigera sitt arbete utan att behöva gå tillbaka till studion för en ny inspelningssession. Det kunde också potentiellt användas för att skapa ljuddeepfakes, vilket gör det verkar som om en artist sjöng en sång som de aldrig faktiskt gjorde. Medan det kunde användas för parodi eller satir, är det också av tvivelaktig laglighet.

DeepSinger är bara en av en våg av nya AI-baserade musik- och ljudsystem som kan förändra hur musik och programvaror interagerar. OpenAI släppte nyligen sitt eget AI-system, dubbade JukeBox, som kan producera originalmusikspår i en viss genre eller till och med en specifik artist. Andra musikaliska AI-verktyg inkluderar Googles Magenta och Amazons DeepComposer. Magenta är ett öppen källkods bibliotek för ljud- (och bild-) manipulation som kan användas för att producera allt från automatisk trummande till enkla musikbaserade videospel. Medan Amazons DeepComposer riktar sig till dem som vill träna och anpassa sina egna musikbaserade djupa inlärningsmodeller, vilket tillåter användaren att ta förtränade exempelmodeller och justera modellerna efter sina behov. Du kan lyssna på några av de ljudprover som genererats av DeepSinger på den här länken.

(GOOGL ) (AMZN )

Blogger och programmerare med specialområden inom Machine Learning och Deep Learning ämnen. Daniel hoppas på att hjälpa andra att använda kraften från AI för socialt väl.