AI-mallit ja alustat
Tekoälytutkijat suunnittelevat ohjelman äänitehosteiden luomiseen elokuviin ja muihin medioihin
Texasin yliopiston San Antonion tutkijat ovat luoneet tekoälypohjaisen sovelluksen, joka pystyy havainnoimaan videossa tapahtuvia toimia ja luomaan niiden mukaisia äänitehosteita. Sovelluksen luomat äänitehosteet ovat niin realistisia, että kun ihmiset kuulivat niitä, he usein luulivat niiden olevan aitoja.
Äänitehosteiden luomiseen vastaava ohjelma, AudioFoley, on kuvattu äskettäin julkaistussa tutkimuksessa IEEE Transactions on Multimediassa. IEEE Spectrumin mukaan tekoälyohjelmaa kehittivät UT San Antonion professori Jeff Provost ja väitöskirjaopiskelija Sanchita Ghose. Tutkijat loivat ohjelman useiden koneoppimismallien avulla.
Ensimmäinen tehtävä äänitehosteiden luomisessa oli toimien tunnistaminen ja niiden kytkeminen äänitehosteisiin. Tätä varten tutkijat suunnittelivat kaksi erilaista koneoppimismallia ja testasivat eri lähestymistapoja. Ensimmäinen malli toimii videosta poimimalla kehyksiä ja analysoimalla niistä merkityksellisiä piirteitä, kuten liikkeitä ja värejä. Sen jälkeen toinen malli analysoi, miten objektin sijainti muuttuu kehys kehyksestä, jotta voidaan poimia aikaisempia tietoja. Tätä aikaisempaa tietoa käytetään seuraavien toimien ennustamiseen videossa. Molemmat mallit analysoivat toimia eri tavoilla, mutta molemmat käyttävät videossa olevaa tietoa arvaamaan, mikä ääni sopisi parhaiten siihen.
Seuraava tehtävä on äänen syntetisointi, ja se tehdään sopimalla toimia/ennustettuja liikkeitä mahdollisiin ääninäytteisiin. Ghosen ja Prevostin mukaan AutoFoleyä käytettiin äänen luomiseen 1000 lyhyelle klipille, joissa oli toimia ja esineitä, kuten tulen, juoksevan hevosen, tikittävien kellojen ja sateen putoamista kasveille. Vaikka AutoFoley oli parhaimmillaan luomassa ääniä klipeille, joissa ei tarvinnut olla täydellistä vastaavuutta toimien ja äänien välillä, se kärsi klipien kanssa, joissa toimia tapahtui enemmän vaihtelua, ja ohjelma pystyi silti petkuttamaan monia ihmisiä valitsemaan sen luomat äänet alkuperäisen äänen sijaan.
Prevost kertoi, että AutoFoley voidaan potentiaalisesti käyttää elokuvien, televisio-ohjelmien ja muiden median tuottamisen nopeuttamiseen. Prevost huomauttaa, että realistinen Foley-rata on tärkeä median tekemiseksi viihdyttäväksi ja uskottavaksi, mutta Foley-prosessi usein kestää paljon aikaa. Automaattinen järjestelmä, joka voisi käsitellä perustavien Foley-elementtien luomisen, voisi tehdä median tuottamisen halvemmmaksi ja nopeammaksi.
Tällä hetkellä AutoFoleyllä on joitakin merkittäviä rajoituksia. Ensinnäkin, vaikka malli näyttää suoriutuvan hyvin havainnoimalla tapahtumia, joissa on vakaat ja ennustettavissa olevat liikkeet, se kärsii, kun yritetään luoda ääniä tapahtumille, joissa on vaihtelua ajassa (kuten ukkosissa). Lisäksi se edellyttää, että luokitteluaine on koko klipin ajan ruudussa eikä poistu siitä. Tutkimusryhmä pyrkii ratkaisemaan nämä ongelmat sovelluksen tulevissa versioissa.












