AI-modeller och plattformar

AI-forskare utvecklar program för att generera ljud-effekter för filmer och andra medier

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Forskare från University of Texas San Antonio har skapat ett AI-baserat program som kan observera handlingarna i en video och skapa artificiella ljud-effekter som matchar dessa handlingar. De ljud-effekter som programmet genererar är enligt uppgift så realistiska att när mänskliga observatörer tillfrågades, trodde de vanligtvis att ljud-effekterna var äkta.

Programmet som ansvarar för att generera ljud-effekterna, AudioFoley, beskrevs i en studie som nyligen publicerades i IEEE Transactions on Multimedia. Enligt IEEE Spectrum utvecklades AI-programmet av Jeff Provost, professor vid UT San Antonio, och Ph.D.-studenten Sanchita Ghose. Forskarna skapade programmet med hjälp av flera maskinlärningsmodeller som kopplades samman.

Det första steget i att generera ljud-effekter som är lämpliga för handlingarna på en skärm var att känna igen dessa handlingar och koppla dem till ljud-effekter. För att åstadkomma detta utformade forskarna två olika maskinlärningsmodeller och testade deras olika tillvägagångssätt. Den första modellen fungerar genom att extrahera ramar från de videor den matas med och analysera dessa ramar för relevanta funktioner som rörelser och färger. Därefter användes en andra modell för att analysera hur objektets position förändras mellan ramarna, för att extrahera tidsmässig information. Denna tidsmässiga information används för att förutse de nästa sannolika handlingarna i videon. De två modellerna har olika metoder för att analysera handlingarna i klippet, men de använder båda informationen i klippet för att gissa vilket ljud som bäst skulle åtfölja det.

Nästa uppgift är att syntetisera ljudet, och detta åstadkoms genom att matcha aktiviteter/predicerade rörelser med möjliga ljudprover. Enligt Ghose och Prevost användes AutoFoley för att generera ljud för 1000 korta klipp, som visar handlingar och föremål som eld, en springande häst, tickande klockor och regn som faller på växter. Medan AutoFoley var mest framgångsrikt i att skapa ljud för klipp där det inte behövdes en perfekt match mellan handlingarna och ljuden, och det hade svårt att matcha klipp där handlingar skedde med mer variation, kunde programmet fortfarande lura många mänskliga observatörer att välja de genererade ljuden i stället för det ursprungliga ljudet som åtföljde klippet.

Prevost och Ghose rekryterade 57 college-studenter och lät dem se olika klipp. Vissa klipp innehöll det ursprungliga ljudet, medan andra innehöll ljud genererat av AutoFoley. När den första modellen testades valde cirka 73% av studenterna det syntetiserade ljudet som det ursprungliga ljudet, och försummade det riktiga ljud som åtföljde klippet. Den andra modellen presterade något sämre, med endast 66% av deltagarna som valde det genererade ljudet i stället för det ursprungliga ljudet.

Prevost förklarade att AutoFoley potentiellt kunde användas för att påskynda processen att producera filmer, TV och andra medieproduktioner. Prevost påpekar att en realistisk Foley-spår är viktig för att göra medierna engagerande och trovärdiga, men att Foley-processen ofta tar en betydande tid att slutföra. Att ha ett automatiserat system som kunde hantera skapandet av grundläggande Foley-element kunde göra det billigare och snabbare att producera media.

För närvarande har AutoFoley några betydande begränsningar. För det första, medan modellen verkar fungera bra när den observerar händelser som har stabila, förutsägbara rörelser, lider den när den försöker generera ljud för händelser med variation i tid, som åskväder. Utöver detta kräver det också att klassificeringsföremålet är närvarande i hela klippet och inte lämnar ramen. Forskningsgruppen syftar till att åtgärda dessa problem med framtida versioner av programmet.

Blogger och programmerare med specialområden inom Machine Learning och Deep Learning ämnen. Daniel hoppas på att hjälpa andra att använda kraften från AI för socialt väl.