AI-modeller og platforme

AI-forskere designer program til at generere lydeffekter til film og anden medie

mm
Føj Unite.AI til dine foretrukne kilder på Google

Forskere fra University of Texas San Antonio har skabt en AI-baseret applikation, der kan observere handlingerne i en video og generere kunstige lydeffekter, der matcher disse handlinger. Lydeffekterne, der genereres af programmet, er ifølge rapporterne så realistiske, at menneskelige observatører typisk troede, at lydeffekterne var ægte.

Programmet, der er ansvarlig for at generere lydeffekterne, AudioFoley, blev detaljeret i en studie, der nylig blev offentliggjort i IEEE Transactions on Multimedia. Ifølge IEEE Spectrum blev AI-programmet udviklet af Jeff Provost, professor ved UT San Antonio, og Ph.D.-studerende Sanchita Ghose. Forskerne skabte programmet ved hjælp af multiple maskinlæringsmodeller, der blev kombineret.

Den første opgave i at generere lydeffekter, der er passende for handlingerne på skærmen, var at genkende disse handlinger og tilknytte dem til lydeffekter. For at opnå dette designede forskerne to forskellige maskinlæringsmodeller og testede deres forskellige tilgange. Den første model opererer ved at trække frames fra videoer og analysere disse frames for relevante funktioner som bevægelser og farver. Herefter blev en anden model anvendt til at analysere, hvordan positionen af et objekt ændrer sig over frames, for at trække tidsmæssig information. Denne tidsmæssige information bruges til at forudsige de næste sandsynlige handlinger i videoen. De to modeller har forskellige metoder til at analysere handlingerne i klippet, men de bruger begge informationen i klippet til at gætte, hvilken lyd, der bedst skulle ledsage det.

Den næste opgave er at syntetisere lyden, og dette opnås ved at matche aktiviteter/forventede bevægelser med mulige lydeksampler. Ifølge Ghose og Prevost blev AutoFoley brugt til at generere lyd for 1000 korte klip, der viser handlinger og genstande som ild, en løbende hest, tikken fra ure, og regn, der falder på planter. Mens AutoFoley var mest succesfuld i at generere lyd for klip, hvor der ikke behøvede at være en perfekt match mellem handlingerne og lydene, havde det svært ved at matche klip, hvor handlingerne skete med mere variation, og programmet kunne alligevel narre mange menneskelige observatører til at vælge de genererede lyde over den originale lyd, der fulgte med klippet.

Prevost og Ghose rekrutterede 57 college-studerende og lod dem se forskellige klip. Nogle klip indeholdt den originale audio, mens andre indeholdt audio, der var genereret af AutoFoley. Da den første model blev testet, valgte ca. 73% af studenterne den syntetiserede audio som den originale audio, og negligerede den sande lyd, der fulgte med klippet. Den anden model opnåede en lidt lavere score, hvor kun 66% af deltagerne valgte den genererede audio over den originale audio.

Prevost forklarede, at AutoFoley potentielt kunne bruges til at fremskynde processen med at producere film, tv og andre medieprodukter. Prevost bemærker, at en realistisk Foley-spor er vigtig for at gøre mediet engagerende og troværdigt, men at Foley-processen ofte tager en betydelig tid at fuldføre. At have et automatiseret system, der kan håndtere skabelsen af grundlæggende Foley-elementer, kunne gøre det billigere og hurtigere at producere medie.

For øjeblikket har AutoFoley nogle bemærkelsesværdige begrænsninger. For det første ser modellen ud til at fungere godt, når den observerer begivenheder med stabile, forudsigelige bevægelser, men den lider, når den forsøger at generere audio for begivenheder med variation i tid (som tordenstorme). Derudover kræver den, at klassificeringsobjektet er til stede i hele klippet og ikke forlader rammen. Forskningsholdet sigter mod at løse disse problemer med fremtidige versioner af applikationen.

Blogger og programmør med specialer i Machine Learning og Deep Learning emner. Daniel håber at hjælpe andre med at bruge AI's kraft til sociale formål.