Andersonin kulma

Deepfake-havainnonten kehitys: Latentti-diffuusiomallit ja GAN:t

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Mielipide

Viime aikoina deepfake-havainnonten tutkimusyhteisö, joka on vuodesta 2017 lähtien ollut lähes yksinomaan autoencoder-pohjaisen kehyksen parissa, joka esiteltiin tuolloin yleisölle (ja hämmästykseksi), on alkanut osoittaa forensista kiinnostusta vakaampiin arkkitehtuureihin, mukaan lukien latentti-diffuusiomallit, kuten DALL-E 2 ja Stable Diffusion, sekä generatiivisten vastakkainoppijoiden (GAN) tuotokset. Esimerkiksi kesäkuussa UC Berkeley julkaisi tutkimustuloksiaan DALL-E 2:n tuottamien kuvien havainnointijärjestelmästä.

Mikä näyttää olevan tämän kasvavan kiinnostuksen taustalla, on latentti-diffuusiomallien kykyjen ja saatavuuden äkillinen kehitysaskel vuonna 2022, DALL-E 2:n suljetun lähdekoodin ja rajoitetun käytön julkaisun keväällä, ja Stable Diffusionin avoin lähdekoodi myöhemmin kesällä.

GAN:t ovat myös pitkään tutkittu tässä asiayhteydessä, vaikka vähemmän intensiivisesti, koska on erittäin vaikea käyttää niitä vakuuttavien ja monimutkaisten videopohjaisten henkilöhahmojen luomiseen; ainakin, verrattuna vanhoihin autoencoder-paketteihin, kuten FaceSwap ja DeepFaceLab – ja jälkimmäisen live-streaming-veli, DeepFaceLive.

Liikkuvat kuvat

Molemmissa tapauksissa vaikuttava tekijä näyttää olevan mahdollisuus videon synteesin seuraavalle kehitysaskelille. Lokakuun alku – ja vuoden 2022 suuren konferenssikausi – oli luonteenomaista äkkiä ja odottamattomien ratkaisujen vyöryä perinteisiin videon synteesin ongelmiin: Facebook julkaisi oman teksti-videopohjaisen alustansa näytteitä, ja Google Research nopeasti haudattiin alkuperäinen maine uuden Imagen-to-Video T2V-arkkitehtuurin ilmoittamisella, joka pystyy tuottamaan korkearesoluutioisia kuvia (vaikka vain 7-kerroksisen ylös skaalauksen kautta).

Jos uskot, että tämänlainen asia tulee kolmena, huomaa myös stability.ai:n salaperäinen lupa, että “video on tulossa” Stable Diffusioniin, ilmeisesti myöhemmin tänä vuonna, kun taas Stable Diffusionin kehittäjä Runway on lupautunut samasta järjestelmästä, vaikka ei ole selvää, viittaavatko he samaan järjestelmään. Stabilityn toimitusjohtaja Emad Mostaqué myös lupailee ‘ääntä, videota [ja] 3D:ta’.

Mikä tahansa, uusien äänen synteesirunkojen tarjoaminen (joista osa perustuu latentti-diffuusiota) ja uuden diffuusiomallin, joka pystyy tuottamaan aidon hahmo-liikkeen, ajatus siitä, että “staattiset” kehykset, kuten GAN:t ja diffuusorit, lopulta ottavat paikkansa ulkoisten animaatiokehyksien tukirakenteina, on alkanut saada todellista vauhtia.

Lyhyesti sanottuna, näyttää siltä, että autoencoder-pohjaisen videon deepfake-maailma, joka voi vain korvata kasvojen keskiosan, voisi tämän vuoden loppuun mennessä olla korvattu uudella sukupolvelle diffuusiopohjaisilla deepfake-kykyisillä teknologioilla – suosituilla, avoimilla lähestymistavoilla, joilla on potentiaali väärentää fotorealistisia kuvia, ei vain kokonaisia kehoja, vaan koko kohtauksia.

Tästä syystä, ehkä, anti-deepfake-tutkimusyhteisö on alkanut ottaa kuvan synteesin tosissaan ja ymmärtää, että se voi palvella muita tarkoituksia kuin vain väärennettyjen LinkedIn-profiilikuva; ja että jos kaikki latentti-avaruudet voivat saavuttaa aikaliikkeen, se voi olla erittäin hyvä tekstuuri-renderöinti, mikä voi olla tarpeeksi.

Blade Runner

Viimeisimmät kaksi tutkimusta, jotka käsittelevät latentti-diffuusiota ja GAN-pohjaista deepfake-havainnointia, ovat DE-FAKE: Väärän kuvan havainnointi ja attribuutio teksti-kuvadiffuusiomalleilla, yhteistyö CISPA Helmholtz Center for Information Securityn ja Salesforcen välillä; ja BLADERUNNER: Nopea vastatoimi synteettisille (AI-luoduille) StyleGAN-kasvoille, Adam Dorian Wongin työ MIT:n Lincoln Laboratoryssa.

Ennen uuden menetelmän selittämistä, jälkimmäinen tutkimus käsittelee aiempia lähestymistapoja GAN-kuvan tunnistamiseksi.

“Brady Bunch” -menetelmä – ehkä merkityksetön viittaus kenellekään, joka ei ollut katsomassa TV:tä 1970-luvulla tai joka ei nähnyt 1990-luvun elokuva-sovituksia – tunnistaa GAN-väärennetyn sisällön kiinteiden osien sijainnin perusteella, joita GAN-kasvojen “tuotantoprosessi” käyttää.

Brady Bunch -menetelmä, joka esiteltiin SANS-instituutin webcastissa vuonna 2022: GAN-pohjainen kasvontunnistin sijoittaa epätodennäköisesti yhtenäisiä kasvon piirteitä, paljastaen valokuvan alkuperän tietyissä tapauksissa. Lähde: https://arxiv.org/ftp/arxiv/papers/2210/2210.06587.pdf

Brady Bunch -menetelmä, joka esiteltiin SANS-instituutin webcastissa vuonna 2022: GAN-pohjainen kasvontunnistin sijoittaa epätodennäköisesti yhtenäisiä kasvon piirteitä, paljastaen valokuvan alkuperän tietyissä tapauksissa. Lähde: https://arxiv.org/ftp/arxiv/papers/2210/2210.06587.pdf

Toinen hyödyllinen tunnistettava merkki on StyleGANin usein kyvyttömyys renderöidä useita kasvoja (ensimmäinen kuva alla), sekä sen puute taitoa koordinoimaan lisävarusteita (keskimmäinen kuva alla), ja taipumus käyttää hiustenrajaa hatun alkuna (kolmas kuva alla).

Kolmas menetelmä, jota tutkija kiinnittää huomiota, on valokuvan ylaidan (esimerkki siitä on meidän elokuun artikkelissa AI-avusteisesta mielenterveyden häiriöiden diagnosoinnista), joka käyttää kompositorista “kuva-yhdistämisen” ohjelmistoa, kuten CombineZ-sarjaa, yhdistämään useita kuvia yhdeksi kuvaksi, usein paljastaen perustuvan rakenteen yhtenäisyyksiä – potentiaalinen merkki synteesistä.

Uusi tutkimus ehdottaa arkkitehtuuria, joka on nimetty (ehkä vastoin kaikkia SEO-neuvoja) Blade Runner, viitaten Voight-Kampff-testiin, joka määrittää, ovatko vastustajat tieteisfranchisingissa “väärennettyjä” vai ei.

Putki koostuu kahdesta vaiheesta, joista ensimmäinen on PapersPlease-analysaattori, joka voi arvioida tietoja, jotka on poimittu tunnetuista GAN-kasvo-sivustoista, kuten thispersondoesnotexist.com tai generated.photos.

Vaikka lyhennetty koodiversio voidaan tarkastella GitHubissa (ks. alla), vähän yksityiskohtia on annettu tästä moduulista, paitsi että OpenCV ja DLIB käytetään kasvojen piirteiden määrittämiseen ja havainnointiin kerätyssä aineistossa.

Toinen moduuli on AmongUs -havainnontaja. Järjestelmä on suunniteltu etsimään koordinoitua silmien sijoittelua valokuvissa, joka on yleinen piirre StyleGANin kasvontuotoksessa, tyypillinen “Brady Bunch” -skenaariossa, josta on mainittu yllä. AmongUs perustuu 68-merkkisen tunnistajan voimaan.

Kasvon piirteiden merkinnät Intelligent Behaviour Understanding Groupin (IBUG) avulla, jonka kasvon piirteiden piirroskoodi on käytössä Blade Runner -paketissa.

Kasvon piirteiden merkinnät Intelligent Behaviour Understanding Groupin (IBUG) avulla, jonka kasvon piirteiden piirroskoodi on käytössä Blade Runner -paketissa.

AmongUs perustuu PapersPlease:n “Brady Bunch” -koordinaatteihin ja on tarkoitettu käytettäväksi vastaan live, web-pohjaisia StyleGAN-pohjaisia kasvokuvia.

Blade Runner on, kirjoittajan mukaan, helppokäyttöinen ratkaisu, joka on tarkoitettu yrityksille tai organisaatioille, joilla ei ole resursseja kehittää omia ratkaisuja deepfake-havainnoinnin kaltaisiin; ja “väliaikainen ratkaisu ostaa aikaa pysyvemmille vastatoimille”.

Todellisuudessa, turvallisuussektorissa, joka on näin volatiilinen ja nopeasti kehittyvä, ei ole monia mukautettuja tai valmiita pilvipalveluratkaisuja, joihin alityövoimainen yritys voisi turvautua luottavaisesti.

Vaikka Blade Runner suoriutuu heikosti silmälasien kanssa StyleGAN-väärennettyjen kasvojen kanssa, tämä on suhteellisen yleinen ongelma vastaavissa järjestelmissä, jotka odottavat silmien määrittelyä viitekohtina.

Blade Runnerin suppeampi versio on julkaistu avoimena lähdekoodina GitHubissa. Lisäksi on olemassa omistuksellinen versio, joka voi käsitellä useita kuvia kerran, toisin kuin avoimen lähdekoodin versio, joka käsittelee vain yhden kuvan kerran. Kirjoittaja aikoo, hän sanoo, päivittää GitHubin version samaan tasoon, kun aika sallii. Hän myöntää myös, että StyleGAN on todennäköisesti kehittyy nykyisistä heikkouksistaan, ja ohjelmisto on kehittyy vastaavasti.

DE-FAKE

DE-FAKE-arkkitehtuuri on tarkoitettu saavuttamaan “yleinen havainnointi” teksti-kuvadiffuusiomalleilla tuotetuille kuville, ja tarjoamaan menetelmän määrittää, mikä latentti-diffuusiomalli (LD) tuotti kuvan.

DE-FAKEN yleinen havainnointikehys käsittää paikallisia kuvia, hybridikehystä (vihreä) ja avoimia maailman kuvia (sininen). Lähde: http://export.arxiv.org/pdf/2210.06998

DE-FAKEN yleinen havainnointikehys käsittää paikallisia kuvia, hybridikehystä (vihreä) ja avoimia maailman kuvia (sininen). Lähde: http://export.arxiv.org/pdf/2210.06998

Rehellisesti sanoen, tämä on tällä hetkellä melko helppo tehtävä, koska kaikki suositut LD-mallit – suljetut tai avoimet – ovat merkittäviä erottuvia piirteitä.

Lisäksi useimmat jakavat yleisiä heikkouksia, kuten taipumuksen leikata pois päät, koska mielivaltaisella tavalla ei-neliönmuotoisia verkkokuvia syötetään massiivisiin tietokantoihin, jotka voimavat järjestelmiä kuten DALL-E 2, Stable Diffusion ja MidJourney:

Tutkijat käyttivät Stable Diffusionia, Latent Diffusionia (joka on erillinen tuote), GLIDE:a ja DALL-E 2:ta luomaan koulutus- ja testausaineistoa MSCOCO:n ja Flickr30k:n avulla.

Tutkijat käyttivät Stable Diffusionia, Latent Diffusionia (joka on erillinen tuote), GLIDE:a ja DALL-E 2:ta luomaan koulutus- ja testausaineistoa MSCOCO:n ja Flickr30k:n avulla.

Normaalisti ottaisimme laajan katsauksen tutkijoiden kokeiden tuloksiin uudesta kehyksestä; mutta totta puhuen, DE-FAKEN tulokset ovat todennäköisesti enemmän hyödyllisiä tulevien iterointien ja samankaltaisten projektien vertailukohtana, kuin merkittävänä mittarina projektin onnistumiselle, koska ympäristö, jossa se toimii, on niin volatiilinen, ja järjestelmä, jota se kilpailee tutkimuksessa, on lähes kolme vuotta vanha – ajoilta, jolloin kuvan synteesin kenttä oli todella alkuvaiheessa.

Vasemmalla olevat kaksi kuvaa: aiempi kehys, joka on peräisin vuodelta 2019, suoriutuu odottavasti heikommin DE-FAKE:ta (oikealla olevat kaksi kuvaa) vastaan neljän LD-järjestelmän testauksessa.

Vasemmalla olevat kaksi kuvaa: aiempi kehys, joka on peräisin vuodelta 2019, suoriutuu odottavasti heikommin DE-FAKE:ta (oikealla olevat kaksi kuvaa) vastaan neljän LD-järjestelmän testauksessa.

Tutkijoiden tulokset ovat ylivoimaisesti myönteisiä kahdesta syystä: on vain vähän aiempaa työtä, johon voidaan verrata, ja mitään, joka tarjoaa reilun vertailun (ts. joka kattaa vain kolme kuukautta sitten, kun Stable Diffusion julkaistiin avoimena lähdekoodina).

Toiseksi, kuten mainittiin aiemmin, vaikka LD-kuvan synteesin kenttä kehittyy eksponentiaalisesti, nykyisten tarjontien tuottama sisältö “merkkaa” itsensä rakenteellisilla (ja hyvin ennustettavissa olevilla) heikkouksilla ja erikoisuuksilla – monet niistä ovat todennäköisesti korjattavissa, ainakin Stable Diffusionin kohdalla, sen 1,5-vaiheen julkaisun myötä (ts. 4 GB:n koulutusmalli, joka pyörittää järjestelmää).

Samalla Stability on jo ilmoittanut, että sillä on selkeä tiekartta järjestelmän V2- ja V3-versioille. Ottaen huomioon viime kuukausien merkittävät tapahtumat, mikä tahansa yritysten, kuten OpenAI:n, ja muiden kilpailevien toimijoiden, torpori kuvan synteesin alalla on todennäköisesti haihtunut, mikä tarkoittaa, että voimme odottaa samanlaista nopeaa edistystä myös suljetun lähdekoodin kuvan synteesin alalla. Ensimmäinen julkaisu 14. lokakuuta 2022.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai