AI-modeller og plattformer

AI-forskere designer program for å generere lydeffekter for filmer og andre medier

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Forskere fra University of Texas San Antonio har utviklet en AI-basert applikasjon som kan observere handlingene i en video og generere kunstige lydeffekter som passer til disse handlingene. Lydeffektene som genereres av programmet er så realistiske at når menneskelige observatører ble spurt, trodde de vanligvis at lydeffektene var ekte.

Programmet som genererer lydeffektene, AudioFoley, ble beskrevet i en studie som nylig ble publisert i IEEE Transactions on Multimedia. Ifølge IEEE Spectrum ble AI-programmet utviklet av Jeff Provost, professor ved UT San Antonio, og Ph.D.-student Sanchita Ghose. Forskerne utviklet programmet ved hjelp av flere maskinlæringsmodeller som ble koblet sammen.

Den første oppgaven i å generere lydeffekter som passer til handlingene på skjermen, var å gjenkjenne disse handlingene og kartlegge dem til lydeffekter. For å oppnå dette, designet forskerne to forskjellige maskinlæringsmodeller og testet deres forskjellige tilnærminger. Den første modellen opererer ved å trekke ut rammer fra videoer som den får og analysere disse ramme for relevante egenskaper som bevegelser og farger. Deretter ble en annen modell brukt til å analysere hvordan posisjonen til et objekt endrer seg over rammer, for å trekke ut tidsinformasjon. Denne tidsinformasjonen brukes til å forutsi de neste sannsynlige handlingene i videoen. De to modellene har forskjellige metoder for å analysere handlingene i klippet, men de bruker begge informasjonen i klippet for å gjette hva slags lyd som best skulle akkompagnere det.

Neste oppgave er å syntetisere lyden, og dette oppnås ved å matche aktiviteter/predikerte bevegelser med mulige lydprøver. Ifølge Ghose og Prevost, ble AutoFoley brukt til å generere lyd for 1000 korte klipp, med handlinger og gjenstander som ild, en løpende hest, tikking klokker og regn som faller på planter. Mens AutoFoley var mest suksessfull i å generere lyd for klipp hvor det ikke trengtes en perfekt match mellom handlinger og lyder, og det hadde problemer med å matche klipp hvor handlinger skjedde med mer variasjon, var programmet likevel i stand til å lure mange menneskelige observatører til å velge de genererte lydene over den originale lyden som fulgte med klippet.

Prevost og Ghose rekrutterte 57 college-studenter og lot dem se forskjellige klipp. Noen klipp inneholdt den originale lyden, noen inneholdt lyd generert av AutoFoley. Når den første modellen ble testet, valgte omtrent 73% av studentene den syntetiserte lyden som den originale lyden, og neglisjerte den ekte lyden som fulgte med klippet. Den andre modellen performerte litt dårligere, med bare 66% av deltakerne som valgte den genererte lyden over den originale lyden.

Prevost forklarte at AutoFoley potensielt kunne brukes til å raske opp prosessen med å produsere filmer, TV og andre medier. Prevost påpeker at en realistisk Foley-spor er viktig for å gjøre media engasjerende og troverdig, men at Foley-prosessen ofte tar en betydelig mengde tid å fullføre. Å ha et automatisert system som kunne håndtere skapelsen av grunnleggende Foley-elementer, kunne gjøre det billigere og raskere å produsere media.

Aktuelt har AutoFoley noen bemerkelsesverdige begrensninger. For det første, mens modellen ser ut til å performere bra når den observerer hendelser med stabile, forutsigbare bevegelser, lider den når den prøver å generere lyd for hendelser med variasjon i tid (som tordenvær). Videre krever den at klassifiseringsobjektet er til stede i hele klippet og ikke forlater rammen. Forskningsgruppen har som mål å løse disse problemene med fremtidige versjoner av applikasjonen.

Blogger og programmerer med spesialområder i Machine Learning og Deep Learning emner. Daniel håper å hjelpe andre med å bruke kraften av AI for sosialt godt.