Modele i platformy AI

Badacze AI Projektują Program Do Generowania Dźwięków Efektów Dla Filmów i Innych Mediów

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Badacze z Uniwersytetu Teksasu w San Antonio stworzyli aplikację opartą na sztucznej inteligencji, która jest w stanie obserwować działania zachodzące w filmie i tworzyć sztuczne efekty dźwiękowe, które odpowiadają tym działaniom. Efekty dźwiękowe generowane przez program są tak realistyczne, że gdy ludzie zostali poproszeni o ich ocenę, większość z nich uznała, że są one autentyczne.

Program odpowiedzialny za generowanie efektów dźwiękowych, AudioFoley, został opisany w badaniu opublikowanym niedawno w IEEE Transactions on Multimedia. Zgodnie z IEEE Spectrum, program został opracowany przez Jeffa Provosta, profesora na Uniwersytecie Teksasu w San Antonio, oraz Sanchitę Ghose, studentkę doktorancką. Badacze stworzyli program, łącząc wiele modeli machine learning.

Pierwszym zadaniem w generowaniu efektów dźwiękowych odpowiednich do działań na ekranie było rozpoznanie tych działań i przyporządkowanie im efektów dźwiękowych. Aby to osiągnąć, badacze opracowali dwa różne modele machine learning i przetestowali różne podejścia. Pierwszy model działa poprzez wyodrębnianie klatek z filmów i analizowanie ich pod kątem istotnych cech, takich jak ruchy i kolory. Następnie zastosowano drugi model do analizy, w jaki sposób pozycja obiektu zmienia się między klatkami, aby wyodrębnić informacje czasowe. Informacje te są wykorzystywane do przewidzenia następnych prawdopodobnych działań w filmie. Obie modele mają różne metody analizy działań w klipie, ale obie wykorzystują informacje zawarte w klipie, aby zgadnąć, jaki dźwięk najlepiej towarzyszyłby mu.

Kolejnym zadaniem jest synteza dźwięku, która jest realizowana poprzez dopasowanie działań/przewidywanych ruchów do możliwych próbek dźwięku. Zgodnie z Ghose i Prevostem, AutoFoley został wykorzystany do wygenerowania dźwięku dla 1000 krótkich klipów, zawierających działania i obiekty, takie jak ogień, biegnący koń, tykające zegary i deszcz pada na rośliny. Chociaż AutoFoley był najbardziej skuteczny w tworzeniu dźwięku dla klipów, w których nie było potrzeby idealnego dopasowania między działaniami a dźwiękami, miał trudności z dopasowaniem klipów, w których działania występowały z większą zmiennością, program był w stanie oszukać wielu ludzi, powodując, że wybrali oni wygenerowany dźwięk zamiast oryginalnego.

Prevost i Ghose zrekrutowali 57 studentów college’u i poprosili ich o obejrzenie różnych klipów. Niektóre klipy zawierały oryginalny dźwięk, a niektóre zawierały dźwięk wygenerowany przez AutoFoley. Gdy pierwszy model został przetestowany, około 73% studentów wybrało syntetyzowany dźwięk jako oryginalny dźwięk, ignorując prawdziwy dźwięk, który towarzyszył klipowi. Drugi model działał nieco gorzej, a tylko 66% uczestników wybrało wygenerowany dźwięk zamiast oryginalnego.

Prevost wyjaśnił, że AutoFoley może potencjalnie być wykorzystany do przyspieszenia procesu produkcji filmów, telewizji i innych mediów. Prevost zauważa, że realistyczny ślad Foley jest ważny dla tworzenia mediów angażujących i wiarygodnych, ale proces Foley często zajmuje znaczny czas. Posiadanie zautomatyzowanego systemu, który mógłby zajmować się tworzeniem podstawowych elementów Foley, mogłoby uczynić produkcję mediów tańszą i szybszą.

Obecnie AutoFoley ma pewne ograniczenia. Po pierwsze, chociaż model wydaje się działać dobrze podczas obserwacji zdarzeń o stabilnych, przewidywalnych ruchach, on cierpi, gdy próbuje wygenerować dźwięk dla zdarzeń o zmienności w czasie (jak burze). Poza tym wymaga on, aby obiekt klasyfikacji był obecny w całym klipie i nie opuszczał ramy. Zespół badawczy stara się rozwiązać te problemy w przyszłych wersjach aplikacji.

Blogger i programista ze specjalnościami w Machine Learning i Deep Learning tematy. Daniel liczy, że pomoże innym wykorzystać moc sztucznej inteligencji dla dobra społecznego.