Andersonin kulma
Uskollisuus vs. realisminen syvyysvideot

Ei kaikki syvyysvalokuvauksen harjoittajat jaa samaa tavoitetta: kuvansynteesitutkimuksen alan tukijat, kuten Adobe, NVIDIA ja Facebook, pyrkivät kehittämään kuvansynteesitekniikoita, jotta ne voivat lopulta luoda tai syntetisoida ihmistoimintaa korkealla resoluutiolla ja haastavissa olosuhteissa (uskollisuus).
Toisin sanoen, niiden, jotka haluavat käyttää syvyysvalokuvauksen teknologioita levittääämään väärää tietoa, on tavoitteena luoda uskottavia simulaatioita todellisista ihmisistä monin muin keinoin kuin vain syvyysvalokuvauksen kasvojen totuudenmukaisuuden avulla. Tässä skenaariossa liitännäisetekijät, kuten konteksti ja uskottavuus, ovat melkein yhtä tärkeitä kuin videon kyky simuloida kasvoja (realismi).
Tämä “sleight-of-hand”-lähestymistapa ulottuu myös syvyysvalokuvauksen lopputuloksen kuvanlaatuun, jotta koko video (eikä vain petollinen osa, jota edustaa syvyysvalokuvauksen kasvo) on yhtenäinen “näköinen”, joka on oikea odotetulle laadulle kyseisessä mediassa.
‘Yhtenäinen’ ei välttämättä tarkoita ‘hyvää’ – riittää, että laatu on yhtenäinen alkuperäisessä ja lisätyssä, väärennettyssä sisällössä, ja noudattaa odotuksia. Esimerkiksi VOIP-suoratoistopalveluissa, kuten Skype ja Zoom, vaatimus voi olla varsin matala, ja sisältää tärinää, epätasaisuutta, ja monia mahdollisia pakkausartefakteja, sekä “sileitä” algoritmeja, jotka on suunniteltu vähentämään niiden vaikutuksia – jotka itsessään muodostavat lisää “epäaidoita” vaikutuksia, joita olemme hyväksyneet suoratoistamisen rajoituksien ja erikoisuuksien seurauksena.

DeepFaceLive toiminnassa: tämä suoratoistoversio DeepFaceLab-ohjelmasta voi tarjota kontekstuaalista realismia esittämällä väärennöksiä rajoitetun videolaadun kontekstissa, mukaan lukien toistovirheitä ja muita yleisiä yhteyden muodostamisartefakteja. Lähde: https://www.youtube.com/watch?v=IL517EgYH8U
Sisäänrakennettu heikentäminen
Itse asiassa kaksi suosituinta syvyysvalokuvauksen pakettia (molemmat perustuvat kiistanalaiseen 2017 vuoden lähdekoodiin) sisältävät komponentteja, joiden tarkoituksena on integroida syvyysvalokuvauksen kasvo “historiallisen” tai alempilaatuisen videon kontekstiin heikentämällä luotua kasvoa. DeepFaceLab:ssa bicubic_degrade_power-parametri saavuttaa tämän, ja FaceSwap:ssa Ffmpeg-konfiguraation “grain”-asetus auttaa väärennetyn kasvojen integroimisessa olemassa olevaan videomateriaaliin säilyttämällä grainin koodauksen aikana*.

FaceSwapin ‘grain’-asetus auttaa aidon integroimisessa matalanlaatuisiin videoihin ja perinteisiin sisältöihin, joissa voi olla elokuvan grain-efektejä, jotka ovat suhteellisen harvinaisia nykyään.
Usein syvyysvalokuvauksen sijaan syvyysvalokuvauksella voidaan tuottaa erillinen sarja PNG-kuvia, joissa on alfa-kanava, ja jokainen kuva näyttää vain synteettisen kasvon, jotta kuvavirta voidaan muuttaa videoksi alustoilla, joissa on kehittyneemmät “heikentämisen” vaikutusten käsittelyominaisuudet, kuten Adobe After Effects, ennen kuin väärennetty ja aito sisältö yhdistetään lopulliseen videoon.
Lisäksi syvyysvalokuvauksen sisällön heikentäminen on usein rekursiivista, joko algoritmisesti (jossa sosiaalisen median alustat pyrkivät säästämään kaistanleveyttä tuottamalla kevyempiä versioita käyttäjien latauksista) alustoilla, kuten YouTube ja Facebook, tai alkuperäisen työn käsittelyä animoituiksi GIF-kuviksi, yksityiskohtaisiksi osiksi tai muihin eriin motivaatioihin perustuviin työvirtoihin, jotka käsittelevät alkuperäisen julkaisun lähtökohtana ja joissa esitetään lisää pakkausta.
Realistiset syvyysvalokuvauksen havaintokontekstit
Tästä syystä uusi Sveitsissä tehty tutkimus on ehdottanut syvyysvalokuvauksen havaintomenetelmien uudelleenarviointia opettamalla havaintojärjestelmiä tunnistamaan syvyysvalokuvauksen sisällön ominaisuuksia, kun se esitetään tarkoituksella heikennetyissä konteksteissa.

Stokastinen datan laajennus sovellettu yhteen uuden tutkimuksen käyttämiin tietokantoihin, jossa on Gaussian-kohina, gamma-korjaus ja Gaussian-sumennus sekä JPEG-pakkausartefakteja. Lähde: https://arxiv.org/pdf/2203.11807.pdf
Tutkimuksessa tutkijat väittävät, että johtavat syvyysvalokuvauksen havaintopaketit perustuvat epärealistisiin mittausolosuhteisiin, ja että “heikennetty” syvyysvalokuvauksen tulostus voi laskea alle havaintojärjestelmien minimilaatuvaatimukset, vaikka sen “likainen” sisältö on todennäköisesti petollinen johtuen oikeasta kontekstin huomioon ottamisesta.
Tutkijat ovat kehittäneet uuden “reaalimaailman” datan heikentämismenetelmän, joka parantaa johtavien syvyysvalokuvauksen havaintojärjestelmien yleistettävyyttä vain vähäisen tarkin luotettavuuden menetyksen kustannuksella “puhtaiden” tietojen alkuperäisillä havaintotasoilla. He tarjoavat myös uuden arviointikehyksen, joka voi arvioida syvyysvalokuvauksen havaintojärjestelmien luotettavuutta reaaliolosuhteissa, tukeutuen laajiin poistotutkimuksiin.
Tutkimus tutkimus on otsikoitu Uusi lähestymistapa parantaa oppimispohjaisen syvyysvalokuvauksen havainnon realistisissa olosuhteissa, ja se tulee tutkijoilta Sveitsin Multimedia Signal Processing Group (MMSPG) ja Ecole Polytechnique Federale de Lausanne (EPFL) -yliopistosta.
Hyödyllinen sekaantuminen
Aikaisemmat yritykset sisällyttää heikennettyjä tuloksia syvyysvalokuvauksen havaintolähestymistapaan sisältävät Mixup-neuraaliverkon, MIT:n ja FAIR:n 2018 vuoden tarjoaman, ja AugMix, DeepMindin ja Googleen 2020 vuoden yhteistyönä, jotka ovat data-laajennusmenetelmiä, jotka pyrkivät “sameaan” koulutusmateriaalia tavalla, joka on altis yleistämiseen.
Tutkijat huomauttavat myös aikaisemmat tutkimukset, jotka sovelsivat Gaussian-kohinaa ja pakkausartefakteja koulutusdataan määrittääksesi johdettujen ominaisuuksien ja kohinan, jossa ne on upotettu, välistä suhdetta.
Uusi tutkimus tarjoaa putken, joka simuloi sekä kuvan hankinnan prosessin heikentymistä että pakkaus- ja muiden algoritmien aiheuttamaa kuvanlaadun heikentymistä. Sisällyttämällä tämän reaaliolosuhteiden työvirran arviointikehykseen on mahdollista tuottaa syvyysvalokuvauksen havaintojärjestelmille koulutusdataa, joka on vastustuskykyisempää artefakteja vastaan.

Uuden lähestymistavan konseptuaalinen logiikka ja työvirta.
Heikentämisprosessi sovellettiin kahteen suosittuun ja menestyksekäseen syvyysvalokuvauksen havaintoon käytettyyn tietokantaan: FaceForensics++ ja Celeb-DFv2. Lisäksi johtavat syvyysvalokuvauksen havaintokehykset Capsule-Forensics ja XceptionNet koulutettiin väärennettyjen tietokantojen versioilla.
Havaintojärjestelmät koulutettiin Adam-optimoinnilla 25 ja 10 epochilla vastaavasti. Tietokannan muunnoksessa 100 kehystä otettiin satunnaisesti kustakin koulutusvideosta, ja 32 kehystä otettiin testaamiseen ennen heikentämismenetelmien lisäämistä.
Tutkijat tarkastelivat seuraavia vääristymisiä työvirrassa: kohina, jossa nollakeski-Gaussian-kohinaa sovellettiin kuudella eri tasolla; kokoa muuttaminen, jotta voidaan simuloida tyypillisen ulkokuvauksen alentunut resoluutio, joka voi vaikuttaa havaintojärjestelmiin; pakkaus, jossa eri JPEG-pakkaustasot sovellettiin dataan; sileät, jossa kolmea tyypillistä “sileää” suodatinta arvioidaan kehyksessä; parannus, jossa kontrastia ja kirkkautta säädettiin; ja yhdistelmät, jossa mikä tahansa kolmen edellä mainitun menetelmän yhdistelmä sovellettiin yhteen kuvaan.
Testaus ja tulokset
Testatessaan dataa tutkijat omaksuivat kolme mittaria: Tarkkuus (ACC); Alue alle vastaanottimen käyrän (AUC); ja F1-lukema.
Tutkijat testasivat standardikoulutettuja versioita kahdesta syvyysvalokuvauksen havaintojärjestelmästä väärennettyjä tietoja vastaan ja totesivat, että ne eivät ole riittäviä:
‘Yleensä useimmat realistisia vääristymiä ja prosessointia ovat erittäin haitallisia normaalisti koulutetuille oppimispohjaisille syvyysvalokuvauksen havaintojärjestelmille. Esimerkiksi Capsule-Forensics-menetelmä näyttää erittäin korkeat AUC-lukemat molemmilla FFpp- ja Celeb-DFv2-testisarjoilla koulutuksen jälkeen, mutta kärsii dramaattisesta suorituskyvyn laskusta muokatulla datasta arviointikehyksestämme. Samanlaisia trendejä on havaittu XceptionNet-havaintojärjestelmässä.’
Toisin sanoen, kummankin havaintojärjestelmän suorituskyky parani merkittävästi, kun ne koulutettiin muunnetuilla tiedoilla, ja kummassakin järjestelmässä havaintokyky näkymättömistä huijauksista parani.
‘Data-laajennusskeema parantaa merkittävästi havaintojärjestelmien robustisuutta ja samalla ne säilyttävät korkean suorituskyvyn alkuperäisillä, muuttamattomilla tiedoilla.’

Suorituskyvyn vertailu raakatietyjen ja laajennettujen tietojoukkoihin, joita tutkimuksessa arvioiduissa syvyysvalokuvauksen havaintojärjestelmissä käytettiin.
Tutkimus päättyy:
‘Nykyiset havaintomenetelmät on suunniteltu saavuttamaan mahdollisimman hyvä suorituskyky tietyillä mittareilla. Tämä johtaa usein yleistettävyyden uhraamiseen realistisempiin skenaarioihin. Tässä tutkimuksessa on ehdotettu tarkkaan suunniteltua data-laajennusskeemaa, joka perustuu luonnolliseen kuvan heikentymisprosessiin.’
‘Laajat kokeet osoittavat, että yksinkertainen mutta tehokas tekniikka parantaa merkittävästi mallin robustisuutta moniin realistisiin vääristymisiin ja prosessointiin tyypillisissä kuvankäsittelyvirroissa, ja se tekee sen ilman merkittävää tarkin luotettavuuden menetystä.’
* Vastaavuus luotujen kasvojen ja grainin välillä on tyylin siirtämisen funktio muunnosprosessissa.
Julkaistu ensimmäisen kerran 29. maaliskuuta 2022. Päivitetty kello 20:33 EST selventämään grainin käyttöä Ffmpegissä.












