Andersonin kulma

Tutkijat ovat löytäneet syvänvedon kestävän ominaisuuden, joka voi auttaa pitkäaikaisessa havaitsemisessa

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Sitä lähtien, kun varhaisimmat syvänvedon havaitsemisratkaisut alkoivat ilmestyä vuonna 2018, tietokoneen näkö- ja turvallisuustutkimusala on pyrkinyt määrittämään olennaisen ominaisuuden syvänvedovideoista – signaaleja, jotka voisivat osoittautua kestäviksi kasvotunnistusteknologioiden parantamisessa (kuten autoencoder-pohjaisissa syvänvedopaketeissa, kuten DeepFaceLab ja FaceSwap, ja generatiivisten vastakkainoppijaverkkojen käytössä ihmiskasvojen uudelleenluomiseen, simuloimiseen tai muuttamiseen).

Monet “merkit”, kuten räpytämättömyys, ovat jääneet tarpeettomiksi syvänvedon parantumisen myötä, kun taas digitaalisten alkuperätekniikoiden, kuten Adoben johtaman Content Authenticity Initiative käytön mahdollistavia menetelmiä, kuten blockchain-lähestymistapoja ja digitaalisten vesileimojen käyttöä mahdollisista lähdekuvaista, edellyttävät laajoja ja kalliita muutoksia olemassa olevaan internetin kuvamateriaaliin tai merkittävää yhteistyötä maiden ja hallitusten välillä invigiliaatio- ja todennusjärjestelmien luomiseksi.

Olisi siis erittäin hyödyllistä, jos todella perustavanlaatuinen ja kestävä ominaisuus voitaisiin havaita kuvissa ja videoissa, joissa on muutettuja, keksittyjä tai identiteetin vaihdettuja kasvoja; ominaisuus, joka voitaisiin johtaa suoraan väärennettyjen videoista ilman laajaa vahvistusta, kryptografista assettien hakemista, kontekstintarkastelua, uskottavuuden arviointia, artifact-keskeisiä havaitsemisruutineja tai muita raskaita lähestymistapoja syvänvedon havaitsemiseen.

Syvänvedot kehyksessä

Uusi tutkimusyhteistyö Kiinan ja Australian välillä uskoo, että he ovat löytäneet tämän “pyhän graalin” säännöllisyyden häiriintymisen muodossa.

Tutkijat ovat kehittäneet menetelmän, jolla vertaillaan aitojen videojen avaruudellista eheyttyneisyyttä ja aikamuistia niihin, jotka sisältävät syvänvedon sisältöä, ja he ovat havainneet, että mikä tahansa syvänvedon häiriintyminen rikkoaa kuvan säännöllisyyden, olkoon se kuinka huomaamaton tahansa.

Tämä johtuu osittain siitä, että syvänvedon prosessi purkaa kohdevideon kehyksiin ja soveltaa koulutetun syvänvedon mallin vaikutusta jokaiseen (korvattuun) kehykseen. Suositut syvänvedon jakelut toimivat samalla tavalla kuin animaattorit, ja ne antavat enemmän huomiota jokaisen kehyksen aitouden kuin kehyksen osallistumisen koko videon avaruudelliseen eheyttyneisyyteen ja aikamuistiin.

Tutkimuksesta: A) Erojen välillä. Tässä nähdään, miten p-fake-häiriöt muuttavat kuvan avaruudellista ja aikamuistia samalla tavalla kuin syvänvedokin, ilman identiteetin vaihtamista. B) Meluanalyysi kolmesta tietotyyppiä, osoittaa, miten p-fake jäljittelee syvänvedon häiriintymistä. C) Aikamuistinen visualisointi kolmesta tietotyyppiä, jossa aito data osoittaa suuremman eheyttyneisyyden muutoksissa. D) T-SNE-visualisointi poistetuista piirteistä aito, väärennetty ja p-fake-videoille. Lähde: https://arxiv.org/pdf/2207.10402.pdf

Tutkimuksesta: A) Erojen välillä. Tässä nähdään, miten p-fake-häiriöt muuttavat kuvan avaruudellista ja aikamuistia samalla tavalla kuin syvänvedokin, ilman identiteetin vaihtamista. B) Meluanalyysi kolmesta tietotyyppiä, osoittaa, miten p-fake jäljittelee syvänvedon häiriintymistä. C) Aikamuistinen visualisointi kolmesta tietotyyppiä, jossa aito data osoittaa suuremman eheyttyneisyyden muutoksissa. D) T-SNE-visualisointi poistetuista piirteistä aito, väärennetty ja p-fake-videoille. Lähde: https://arxiv.org/pdf/2207.10402.pdf

Tämä ei ole tapa, jolla videokooderi käsittelee kehyksiä, kun alkuperäinen tallenne tehdään tai prosessoidaan. Tallennettaessa tiedostokokoa tai tehdessä videota striimaukseen sopivaksi, videokooderi hylkää valtavan määrän tietoa. Jopa korkeilla laatuasetuksilla kooderi varaa avainkehykset (muuttuja, jonka käyttäjä voi asettaa) – kokonaiset, käytännössä pakkaamattomat kuvat, jotka esiintyvät esitettyyn väliin videossa.

Avainkehysten välisten kehysten välillä on tietty määrä arvioituja kehyksiä, ja ne uudelleenkytetään niin paljon kuin mahdollista lähimmistä avainkehyksistä, eikä ole täysin kehyksiä omillaan.

Vasemmalla on täydellinen avainkehys, tai 'i-kehys', joka tallennetaan pakattuun videoon, jossa on tietty kustannus tiedostokoolle; oikealla on välikehys, joka uudelleenkytetään sovellettavasta osasta tietokkaampaa avainkehystä. Lähde: https://blog.video.ibm.com/streaming-video-tips/keyframes-interframe-video-compression/

Vasemmalla on täydellinen avainkehys, tai ‘i-kehys’, joka tallennetaan pakattuun videoon, jossa on tietty kustannus tiedostokoolle; oikealla on välikehys, joka uudelleenkytetään sovellettavasta osasta tietokkaampaa avainkehystä. Lähde: https://blog.video.ibm.com/streaming-video-tips/keyframes-interframe-video-compression/

Tässä mielessä lohko (joka sisältää x määrän kehyksiä, riippuen avainkehyksen asetuksista) on kiistatta pienin yksikkö, jota tyypillisessä pakatussa videossa pidetään, eikä yksittäinen kehys ole sitä. Jopa avainkehys itsessään, joka tunnetaan i-kehyksenä, muodostaa osan siitä yksiköstä.

Perinteisen animaatioanimaation kannalta kooderi suorittaa tietynlaista välikäyttöä, jossa avainkehykset toimivat teltan keppinä välikehysille, jotka ovat johdettuja kehyksiä, tunnettuja delta-kehyksinä.

Toisin sanoen syvänvedon ylittäminen omistaa valtavat resurssit jokaiselle yksittäiselle kehykselle, eikä ottaa huomioon kehyksen laajempaa asiayhteyttä eikä siitä, miten pakkaus ja lohkopohjainen koodaus vaikuttavat “aitoisen” videon ominaisuuksiin.

Lähempi katsaus aikamuistisen laadun epäjatkuvuuteen aidossa videossa (vasemmalla) ja samassa videossa, jossa on häiriintynyt syvänvedolla (oikealla).

Lähempi katsaus aikamuistisen laadun epäjatkuvuuteen aidossa videossa (vasemmalla) ja samassa videossa, jossa on häiriintynyt syvänvedolla (oikealla).

Vaikka jotkut parhaat syvänvedot käyttävät laajaa jälkikäsittelyä, kuten After Effects -paketteja, ja vaikka DeepFaceLab-jakeluilla on jotkin alkuperäiset ominaisuudet soveltamaan “sekoittamis”-menettelyjä, kuten liikkeen sumennus, tällainen taituruus ei vaikuta aitojen ja syvänvedon videoiden väliseen säännöllisyyden ja aikamuistin epäsymmetriaan.

Uusi tutkimus on nimeltään Syvänvedon havaitseminen luomalla avaruudellista ja aikamuistista säännöllisyyden häiriintymistä, ja se tulee Tsinghua-yliopistosta, Baidu Inc.:n tietokoneen näkötekniikan osastolta (VIS) ja Melbournen yliopistosta.

‘Väärät’ Väärät Videot

Tutkijat, jotka ovat tehneet tutkimuksen, ovat sisällyttäneet tutkimuksen toiminnallisuuden moduliin, jota kutsutaan Pseudo-fake Generatoriksi (P-fake Generator), joka muuttaa aitoja videoita väärän syvänvedon videoiksi, häiritsemällä niitä samalla tavalla kuin itse syvänvedon prosessi, ilman varsinaista syvänvedon suorittamista.

Kokeet osoittavat, että moduli voidaan lisätä kaikkiin olemassa oleviin syvänvedon havaitsemisjärjestelmiin käytännössä ilman resursseja, ja se parantaa merkittävästi niiden suorituskykyä.

Tämä löytö voi auttaa ratkaisemaan yhtä syvänvedon havaitsemistutkimuksen esteitä: aitojen ja ajantasaisen tietokantojen puutetta. Koska syvänvedon luominen on monimutkainen ja aikaa vievä prosessi, yhteisö on kehittänyt useita syvänvedon tietokantoja viiden viime vuoden aikana, joista monet ovat melko vanhentuneita.

Syvänvedon häiriintymisen erottamisella voidaan luoda rajattomia näyte- ja tietokantavideoita, jotka keskittyvät tähän syvänvedon puoleen.

STE-lohkon yleiskatsaus, jossa kanavakohtainen aikamuistinen konvoluutio käytetään syötteenä luomaan avaruudellisesti ja aikamuistisesti vahvistettuja koodauksia, joista syntyy sama allekirjoitus, jonka jopa erittäin vakuuttava syvänvedo antaa. Tällä menetelmällä voidaan luoda 'väärät' väärät videot, jotka sisältävät samat allekirjoitusominaisuudet kuin mikä tahansa muutettu, syvänvedon tyylinen video, eivätkä riipu erityisistä jakeluista tai volatiilista ominaisuuksista, kuten piirteiden käyttäytymisestä tai algoritmisista artefakteista.

STE-lohkon yleiskatsaus, jossa kanavakohtainen aikamuistinen konvoluutio käytetään syötteenä luomaan avaruudellisesti ja aikamuistisesti vahvistettuja koodauksia, joista syntyy sama allekirjoitus, jonka jopa erittäin vakuuttava syvänvedo antaa. Tällä menetelmällä voidaan luoda ‘väärät’ väärät videot, jotka sisältävät samat allekirjoitusominaisuudet kuin mikä tahansa muutettu, syvänvedon tyylinen video, eivätkä riipu erityisistä jakeluista tai volatiilista ominaisuuksista, kuten piirteiden käyttäytymisestä tai algoritmisista artefakteista.

Kokeet

Tutkijat suorittivat kokeita kuudella merkittävällä tietokannalla, joita käytetään syvänvedon havaitsemistutkimuksessa: FaceForensics++ (FF++); WildDeepFake; Syvänvedon havaitsemisen haasteen esikatselu (DFDCP); Celeb-DF; Syvänvedon havaitseminen (DFD); ja Face Shifter (FSh).

FF++:n kohdalla tutkijat kouluttivat mallinsa alkuperäisellä tietokannalla ja testasivat jokaista neljää alatietokantaa erikseen. Ilman syvänvedon materiaalin käyttöä koulutuksessa uusi menetelmä ylitti valmiiden tulokset.

Menetelmä saavutti myös pole position, kun se vertailtiin FF++ C23 -pakkaukseen, joka tarjoaa esimerkkejä, joissa on sellaisia pakkausartefakteja, jotka ovat uskottavia todellisissa syvänvedon katseluympäristöissä.

Tutkijat kommentoivat:

‘Suoritukset FF++:ssa vahvistavat ideamme toteuttamiskelpoisuuden, kun taas yleistettävyys on edelleen suuri ongelma olemassa olevissa syvänvedon havaitsemismenetelmissä, koska suorituskyky ei ole taattu, kun testataan syvänveodoilla, jotka on luotu näkymättömillä menetelmillä.

‘Lisäksi, kun otetaan huomioon havainto- ja väärentämisen välinen kilpailu, yleistettävyys on tärkeä kriteeri arvioida havaitsemismenetelmän tehokkuutta todellisissa olosuhteissa.’

Koska tutkijat suorittivat useita alikokeita (ks. tutkimus yksityiskohtaisista tiedoista) “robustisuudesta” ja vaihdellen syötteen videoita (ts. aito, väärä, p-fake jne.), mielenkiintoisimmat tulokset ovat ristitietokannan suorituskyvyn testit.

Tässä tutkijat kouluttivat mallinsa mainitun “todellisen maailman” C23 -version FF++:sta ja testasivat sitä neljää tietokantaa vastaan, saavuttaen, kuten tutkijat sanovat, paremman suorituskyvyn kaikissa niissä.

Tulokset ristitietokannan haasteesta. Tutkimus toteaa, että SBI käyttää samankaltaista lähestymistapaa kuin tutkijoiden oma, kun taas p-fake-näyttää parempaa suorituskykyä avaruudellisessa ja aikamuistisessa säännöllisyyden häiriintymisessä.

Tulokset ristitietokannan haasteesta. Tutkimus toteaa, että SBI käyttää samankaltaista lähestymistapaa kuin tutkijoiden oma, kun taas p-fake-näyttää parempaa suorituskykyä avaruudellisessa ja aikamuistisessa säännöllisyyden häiriintymisessä.

Tutkimus toteaa:

‘Deepwildissä menetelmämme ylittää SOTA-menetelmän noin 10 prosenttiyksiköllä AUC-prosentteina. Uskomme, että tämä johtuu syvänveodon suuresta monimuotoisuudesta Deepwildissä, mikä tekee muut menetelmät epäonnistuviksi yleistettävyyden suhteen.’

Mittareina kokeissa käytettiin Tarkkuusarvoa (ACC), Alueen alla olevaa ROC-käyrää (AUC) ja Tasapuolisuusvirhettä (EER).

Vastahyökkäykset?

Vaikka media kuvailee jännitettä syvänvedon kehittäjien ja syvänvedon havaitsemistutkijoiden välillä teknologisena sodana, on perusteltua väittää, että ensin mainitut yrittävät vain luoda vakuuttavampaa ulostuloa, ja että lisääntynyt syvänvedon havaitsemisen vaikeus on sivutuote heidän pyrkimyksistään.

On mahdollista, että kehittäjät yrittävät korjata tämän uuden paljastuneen heikkouden, jos he katsovat, että säännöllisyyden häiriintyminen voidaan havaita syvänvedovideossa paljain silmin epäaidon merkkinä, ja että tämä mittari on arvokas puhtaasti laadullisesta näkökulmasta.

Vaikka viisi vuotta on kulunut siitä, kun ensimmäiset syvänvedot tulivat verkossa julki, syvänvedo on edelleen suhteellisen nuori teknologia, ja yhteisö on kiinnostunut yksityiskohtaisuudesta ja resoluutiosta kuin oikeasta asiayhteydestä tai vastaamisesta pakatun videon allekirjoituksista, jotka vaativat tietynlaista “heikentymistä” ulostulosta – juuri sitä, mitä koko syvänvedoyhteisö kamppailee vastaan.

Jos yleinen konsensus osoittautuu sille, että säännöllisyyden häiriintyminen on nuori allekirjoitus, joka ei vaikuta laatuun, ei ehkä ole pyrkimyksiä korvata sitä – vaikka se voi olla “peruutettu” jollain jälkikäsittely- tai arkkitehtuurimenetelmillä, mikä on kaukana selvyydestä.

 

Julkaistu ensimmäisen kerran 22. heinäkuuta 2022.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai