Modely a platformy AI
Výzkumníci vyvinuli „Audeo“ – umělou inteligenci schopnou hrát na piano

Tým výzkumníků z University of Washington vyvinul umělou inteligenci (AI) nazvanou Audeo, která dokáže vytvářet audio z tichých pianistických výkonů. Testovací fáze zahrnovala hudební rozpoznávací aplikace, jako je SoundHound, které mohly správně identifikovat hudbu z Audea přibližně 86 % času.
Výzkum byl prezentován na konferenci NeurlPS 2020 dne 8. prosince.
Hlavní autor Eli Shlizerman je asistent profesora na katedře aplikované matematiky a elektrotechniky a počítačového inženýrství na univerzitě.
“Vytvořit hudbu, která zní, jako by mohla být hrána v hudebním výkonu, se dříve považovalo za nemožné,” řekl Shlizerman. “Algoritmus musí určit signály, nebo ‘funkce’, ve videoframech, které jsou spojeny s generováním hudby, a musí ‘představit’ si zvuk, který se děje mezi videoframy. To vyžaduje systém, který je zároveň přesný a imaginativní. Skutečnost, že jsme dosáhli hudby, která zněla docela dobře, byla překvapením.”
Jak Audeo funguje
Systém Audeo funguje tak, že dekóduje video a překládá ho do hudby. První z několika kroků zahrnuje detekci kláves, které jsou stisknuty v každém videoframe, a nakonec vyvíjí diagram. Diagram je pak přeložen tak, aby jej mohl hudba syntetizátor rozpoznat.
Dalším krokem je vyčistit data a přidat další informace. Tyto informace mohou zahrnovat věci, jako je tlak za každým klávesovým stiskem a jak dlouho trval.
“Pokud se pokusíme syntetizovat hudbu pouze z prvního kroku, zjistíme, že kvalita hudby je nevyhovující,” řekl Shlizerman. “Druhý krok je podobný, jako když učitel prochází studentským skladatelem hudby a pomáhá ji vylepšit.”
Systém byl trénován a testován s videi pianisty Paula Bartona na YouTube a skládal se z přibližně 172 000 videoframeů hudebníka, který hrál různé klasické skladby, jako je Mozart. Audeo byl testován s 19 000 frameů Bartona, který hrál různé hudby.
Syntetizátor
Po tréninku Audeo generuje přepis hudby, který je pak předán syntetizátoru, aby jej přeložil do zvuku. Hudba zní jinak v závislosti na každém syntetizátoru, což je ekvivalentní změně nastavení instrumentu na elektrické klávesnici.
Tým použil dva samostatné syntetizátory.
“Fluidsynth vytváří syntetizátorové pianistické zvuky, se kterými jsme obeznámeni. Tyto zvuky jsou somewhat mechanické, ale docela přesné,” řekl Shlizerman. “Použili jsme také PerfNet, nový syntetizátor AI, který generuje bohatší a expresivnější hudbu. Ale také generuje více šumu.”
“Cílem tohoto výzkumu bylo zjistit, zda umělá inteligence může generovat hudbu, která je hrána pianistou ve videonahrávce – i když jsme neměli za cíl replikovat Paula Bartona, protože je takovým virtuózem,” pokračoval Shlizerman. “Doufáme, že náš výzkum umožní nové způsoby interakce s hudbou. Například jedna budoucí aplikace spočívá v tom, že Audeo může být rozšířeno na virtuální piano s kamerou, která zaznamenává pouze ruce osoby. Také umístěním kamery na skutečné piano by Audeo mohl potenciálně pomoci při nových způsobech učení studentů, jak hrát.”
Kung Su a Ziulong Liu, doktorandi v oboru elektrotechniky a počítačového inženýrství, byli spoluautory článku.












