Modely a platformy AI

Vědci vytvořili model AI, který je schopen zpívat v čínštině i angličtině

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Tým výzkumníků z Microsoftu a Zhajiang University nedávno vytvořil model AI, který je schopen zpívat v mnoha jazycích. Jak uvádí VentureBeat, model DeepSinger AI vyvinutý týmem byl trénován na datech z různých hudebních webových stránek, pomocí algoritmů, které zachycovaly tón zpěváka.

Generování “hlasu” AI zpěváka vyžaduje algoritmy, které jsou schopné předpovídat a ovládat jak tón, tak délku audio. Když lidé zpívají, zvuky, které produkují, mají mnohem složitější rytmy a vzorce ve srovnání s prostou řečí. Další problém, který tým musel překonat, byl ten, že zatímco je k dispozici dostatek trénovacích dat pro řeč, trénovací sady pro zpěv jsou poměrně vzácné. Kombinace těchto výzev s tím, že písně potřebují analyzovat både zvuk a text, činí problém generování zpěvu nesmírně komplexním.

Systém DeepSinger vytvořený výzkumníky překonal tyto výzvy vyvinutím datové pipeline, která extrahovala a transformovala audio data. Klipy zpěvu byly extrahovány z různých hudebních webových stránek a poté byl zpěv izolován od zbytku audio a rozdělen do vět. Následujícím krokem bylo určení délky každé fonémy ve větách, což vedlo k sérii vzorků, z nichž každý reprezentoval jedinečnou fonému ve větách. Čištění dat se provádí pro řešení problémů s poškozenými trénovacími vzorky po seřazení textů a doprovodných audio vzorků podle skóre spolehlivosti.

Stejné metody se zdají fungovat pro různé jazyky. DeepSinger byl trénován na čínských, kantonštině a anglických vokálních vzorcích složených z 89 různých zpěváků, kteří zpívali po dobu více než 92 hodin. Výsledky studie ukázaly, že systém DeepSinger byl schopen spolehlivě generovat vysoké kvalitní “zpěvní” vzorky podle metrik, jako je přesnost tónu a jak přirozeně zní zpěv. Výzkumníci požádali 20 lidí, aby ohodnotili písně generované DeepSinger a trénovací písně podle těchto metrik, a mezera mezi skóre generovaných vzorků a skutečného audio byla bastante malá. Účastníci dali DeepSinger průměrný názorový skóre, který se lišil od 0,34 do 0,76.

V budoucnu chtějí výzkumníci pokusit se zlepšit kvalitu generovaných hlasů společným trénováním různých submodelů, které tvoří DeepSinger, s pomocí specializovaných technologií, jako je WaveNet, které jsou navrženy speciálně pro generování přirozeně znějícího projevu prostřednictvím audio vlnových forem.

Systém DeepSinger by mohl být použit k pomoci zpěvákům a jiným hudebním umělcům, aby opravili své práce bez nutnosti návratu do studia pro další nahrávací sezení. Může být také potenciálně použit k vytvoření audio deepfake, aby se zdálo, že umělec zpíval píseň, kterou ve skutečnosti nezpíval. Zatímco by to mohlo být použito pro parodii nebo satiru, je to také pochybné z právního hlediska.

DeepSinger je pouze jeden z vlny nových AI-založených hudebních a audio systémů, které by mohly transformovat, jak hudba a software interagují. OpenAI nedávno vydal svůj vlastní AI systém, nazvaný JukeBox, který je schopen produkovat originální hudební skladby ve stylu určitého žánru nebo dokonce konkrétního umělce. Další hudební AI nástroje zahrnují Google’s Magenta (GOOGL ) a Amazon’s DeepComposer (AMZN ). Magenta je open-source audio (a obrazová) manipulační knihovna, která může být použita k produkci všeho od automatizovaného bubnového doprovodu až po jednoduché hudební video hry. Zatímco Amazon’s DeepComposer je zaměřen na ty, kteří chtějí trénovat a přizpůsobit své vlastní hudební založené hluboké učící modely, umožňující uživateli vzít předtrénované vzorové modely a upravit modely podle svých potřeb.

Můžete si poslechnout některé audio vzorky generované DeepSinger na tomto odkazu.

Blogger a programátor se specializací na Machine Learning a Deep Learning témata. Daniel doufá, že pomůže ostatním využít sílu AI pro sociální dobro.