Modely a platformy AI

Výzkumníci z oblasti umělé inteligence navrhli program pro generování zvukových efektů pro filmy a další média

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Výzkumníci z University of Texas v San Antoniu vytvořili aplikaci založenou na umělé inteligenci, která je schopná pozorovat akce probíhající ve videu a vytvářet umělé zvukové efekty, které odpovídají těmto akcím. Zvukové efekty generované programem jsou údajně tak realistické, že když byli dotázáni lidské pozorovatelé, většinou si mysleli, že zvukové efekty jsou skutečné.

Program odpovědný za generování zvukových efektů, AudioFoley, byl popsán v studii nedávno zveřejněné v IEEE Transactions on Multimedia. Podle IEEE Spectrum byl program vyvinut Jeffem Provostem, profesorem na UT San Antonio, a doktorandem Sanchitou Ghose. Výzkumníci vytvořili program pomocí více modelů strojového učení spojených dohromady.

První úkolem při generování zvukových efektů vhodných pro akce na obrazovce bylo rozpoznání těchto akcí a mapování na zvukové efekty. K tomu výzkumníci navrhli dva různé modely strojového učení a otestovali jejich různé přístupy. První model funguje tak, že extrahuje snímky z videí, která jsou mu předložena, a analyzuje tyto snímky pro relevantní funkce, jako jsou pohyby a barvy. Poté je použit druhý model k analýze, jak se pozice objektu mění mezi snímky, aby se extrahovala časová informace. Tato časová informace se používá k předpovědi následujících pravděpodobných akcí ve videu. Oba modely mají různé metody analýzy akcí ve videu, ale oba používají informace obsažené ve videu k odhadu, jaký zvuk by nejlépe doprovázel.

Dalším úkolem je syntetizovat zvuk, a to se provádí tak, že se činnosti/předpokládané pohyby mapují na možné zvukové vzorky. Podle Ghose a Prevosta byl AutoFoley použit k generování zvuku pro 1000 krátkých klipů, které obsahovaly akce a předměty, jako je oheň, běžící kůň, tikající hodiny a déšť padající na rostliny. Zatímco AutoFoley byl nejúspěšnější při vytváření zvuku pro klipy, kde nemusel být dokonalý soulad mezi akcemi a zvuky, měl problémy s klipy, kde se akce odehrávaly s větší variabilitou, ale program byl stále schopen oklamat mnoho lidských pozorovatelů, aby si vybrali generovaný zvuk místo původního zvuku, který doprovázel klip.

Prevost a Ghose najali 57 studentů vysokých škol a nechali je sledovat různé klipy. Některé klipy obsahovaly původní audio, některé obsahovaly audio generované AutoFoleym. Když byl otestován první model, asi 73 % studentů vybralo syntetizovaný zvuk jako původní audio, ignorujících skutečný zvuk, který doprovázel klip. Druhý model fungoval mírně hůře, s pouze 66 % účastníků, kteří vybrali generovaný zvuk místo původního zvuku.

Prevost vysvětlil, že AutoFoley by mohl být potenciálně použit k urychlení procesu výroby filmů, televizních pořadů a dalších médií. Prevost poznamenává, že realistický Foley track je důležitý pro to, aby média byla atraktivní a přesvědčivá, ale že proces Foley často vyžaduje značné množství času. Mít automatizovaný systém, který by mohl zpracovat vytváření základních Foley prvků, by mohl výrobu médií učinit levnější a rychlejší.

V současné době má AutoFoley některé významné omezení. Jedním z nich je, že zatímco model funguje dobře při pozorování událostí s stabilními, předvídatelnými pohyby, trpí při generování zvuku pro události s variací v čase (jako bouřky). Kromě toho také vyžaduje, aby klasifikační předmět byl přítomen v celém klipu a neopouštěl rám. Výzkumný tým se snaží tyto problémy vyřešit v budoucích verzích aplikace.

Blogger a programátor se specializací na Machine Learning a Deep Learning témata. Daniel doufá, že pomůže ostatním využít sílu AI pro sociální dobro.