Andersonin kulma

TikTok-kehittäjät pyyhkivät kasvot pois augmenteoiduista todellisuuden sovelluksista

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

ByteDance, kiinalainen monikansallinen internet-yhtiö, joka on vastuussa TikTokista, on kehittänyt uuden menetelmän kasvojen pyyhkimiseksi videoista, jotta voidaan lisätä identiteetin vääristymistä ja muita outoja vaikutuksia ihmisiin augmenteoiduissa todellisuuden sovelluksissa. Yhtiö väittää, että tekniikka on jo integroitu kaupallisiin mobiilituotteisiin, vaikka se ei mainitse, mitkä tuotteet.

Kun kasvot on “nollattu” videosta, on tarjolla riittävästi “kasvojen kankaata” tuottamaan silmäniskoksiin vaikutuksia, sekä mahdollisesti superimponoimalla muita identiteettejä. Esimerkit uudesta ByteDancen tutkimuspaperista osoittavat mahdollisuuksia, mukaan lukien palautettujen “pyyhittyjen” piirteiden erilaisissa komedia- (ja varmasti jossain groteskeissa) konfiguraatioissa:

Jotkut mahdollisuudet kasvojen uudelleenmääritykseen, jotka sisältyvät ByteDancen paperiin. Lähde: https://arxiv.org/pdf/2109.10760.pdf

Jotkut mahdollisuudet kasvojen uudelleenmääritykseen, jotka sisältyvät ByteDancen paperiin. Lähde: https://arxiv.org/pdf/2109.10760.pdf

Loppukesästä paljastui, että TikTok, ensimmäinen Facebookin ulkopuolinen sovellus, joka on saavuttanut kolme miljardia latausta, oli lanseerannut TikTok Effect Studio (tällä hetkellä suljettuun beetaversioon), alustan augmenteoidun todellisuuden kehittäjille luoda AR-vaikutuksia TikTokin sisällön virroksi.

Vaikka yhtiö on vasta kiinni muiden kehittäjäyhteisöjen kaltaisissa sovelluksissa, kuten Facebookin AR Studio ja Snap AR, Applen vanha AR-tutkimusyhteisö on valmis saamaan uuden laitteen seuraavan vuoden aikana.

Tyhjät ilmeet

Paperi, joka on otsikoitu Kasvojen pyyhkiminen: Kasvojen osien poistaminen augmenteoiduista todellisuuden sovelluksista, toteaa, että olemassa olevat sisäänmaalaus-/täyttöalgoritmit, kuten NVIDIA:n SPADE, ovat enemmän suunnattuja täydentämään katkaistuja tai muuten osittain peitettynä olevia kuvia kuin suorittamaan tätä epätavallista “tyhjentämismenettelyä”, ja että olemassa oleva aineistoa on siten odottavasti niukasti saatavilla.

Koska ei ole saatavilla valmiita aineistoja ihmisille, joilla on kiinteä liha-ala, missä heidän kasvonsa pitäisi olla, tutkijat ovat luoneet uuden verkkoarkkitehtuurin nimeltä pixel-kloni, joka voidaan yhdistää olemassa oleviin neuronaalisiin täyttömalliin, ja joka ratkaisee ongelmia, jotka liittyvät tekstuuriin ja väriepäjohdonmukaisuuksiin, joita vanhemmat menetelmät, kuten StructureFlow ja EdgeConnect, ovat osoittaneet (paperi vakuuttaa).

Yleinen pixel-klonin työnkulku uudessa pipelineissa.

Yleinen pixel-klonin työnkulku uudessa pipelineissa.

Jotta malli voidaan kouluttaa “tyhjille” kasvoille, tutkijat poissulkevat kuvat, joissa on lasit tai joissa hiukset peittävät otsaa, koska alue otsan ja kulmien välillä on yleensä suurin yksittäinen pikseliryhmä, joka voidaan käyttää “liimaamiseen” kasvojen keskiosiin.

Koulutuskuva. Otsa-alue leikataan irti kasvojen tunnistamisen avainpisteiden perusteella, käännöksellä ja ompelemalla.

Koulutuskuva. Otsa-alue leikataan irti kasvojen tunnistamisen avainpisteiden perusteella, käännöksellä ja ompelemalla.

256×256 pikselin kuva saadaan, joka on tarpeeksi pieni syötettäväksi neuronaalisen verkon latenteihin avaruuksiin tarpeeksi suurissa erissä, jotta voidaan saavuttaa yleistys. Myöhempi algoritminen skaalaus palauttaa tarvittavat resoluutiot, jotta voidaan työskennellä AR-tilassa.

Arkkitehtuuri

Verkko koostuu kolmesta sisäverkosta, jotka koostuvat reunan täydentämisestä, pixel-klonista ja hienosäätöverkosta. Reunan täydentämisverkko käyttää samaa kooderin-dekooderin arkkitehtuuria, jota käytetään EdgeConnectissa (ks. yllä), sekä kahdessa suosituimmassa deepfake-sovelluksessa. Kooderit pienentävät kuvan sisällön kahdesti, ja dekooderit palauttavat alkuperäisen kuvan mitat.

Pixel-kloni käyttää muunnettuja kooderin-dekooderin menetelmiä, kun taas hienosäätökerros käyttää U-Net-arkkitehtuuria, jota on alun perin kehitetty biolääketieteelliseen kuvantamiseen, joka usein sisältyy kuvansynteesitutkimushankkeisiin.

Koulutusprosessin aikana on tarpeen arvioida muodonmuutosten tarkkuutta, ja tarvittaessa toistaa yritykset toistuvasti saavutettavuuteen asti. Tähän tarkoitukseen käytetään kahta PatchGAN-pohjaista diskriminaattoria, joista kummallakin arvioidaan 70×70 pikselin paikallista realismin arvoa, jolloin arvioidaan koko kuvan realismin arvo.

Koulutus ja data

Reunan täydentämisverkko koulutetaan aluksi itsenäisesti, kun taas muut kaksi verkkoa koulutetaan yhdessä, perustuen reunan täydentämiskoulutuksen painoihin, jotka on jäädytetty ja jäädytetty tämän prosessin aikana.

Vaikka paperi ei erityisesti mainitse, että lopullisten piirteiden vääristymisen esimerkit ovat mallin keskeinen tavoite, se toteuttaa erilaisia komedia-vaikutuksia järjestelmän kestävyyden testaamiseksi, mukaan lukien kulmien poistaminen, suurennettujen suupiirteiden ja pienenempien alikasvojen sekä “toonized”-vaikutukset (kuten edellä olevassa kuvassa).

Paperi väittää, että “pyyhittyjen” kasvojen ansiosta voidaan toteuttaa erilaisia augmenteoidun todellisuuden sovelluksia, joissa voidaan sijoittaa minkä tahansa käyttäjän mukautettuja elementtejä, mikä mahdollistaa kasvojen mukauttamisen kolmannen osapuolen käyttäjien luomilla elementeillä.

Malli on koulutettu NVIDIA:n luomasta FFHQ-aineistosta, joka sisältää riittävän monipuolisen joukon ikäryhmiä, etnisiä ryhmiä, valaistuksia ja kasvon ilmeitä ja tyylejä, jotta voidaan saavuttaa hyödyllinen yleistys. Aineistossa on 35 000 kuvaa ja 10 000 koulutusmaskia, joilla voidaan määritellä muodonmuutosten alueet, ja 4000 kuvaa ja 1000 maskia on varattu validointitarkoituksiin.

Koulutusaineiston näyte.

Koulutusaineiston näyte.

Koulutettu malli voi suorittaa inference-aineistoa vuoden 2017 CelebA-HQ- ja VoxCeleb-aineistoista, näkymättömistä kasvoista FFHQ:sta ja minkä tahansa muun rajoittamattoman, näkymättömän kasvon, joka esitetään sille. 256×256 pikselin kuvat koulutettiin verkossa 8 kappaleen erissä Adam-optimoinnilla, joka toteutettiin PyTorchissa, ja suoritettiin Tesla V100 -näytönohjaimella “2000 000 epochin” ajan.

Inferenssitulokset, jotka saadaan oikeasta kasvosta.

Inferenssitulokset, jotka saadaan oikeasta kasvosta.

Kuten on yleensä tapana kasvojen perusteella tehtävissä kuvansynteesitutkimuksissa, järjestelmän on vastattava satunnaisia epäonnistumisia, jotka johtuvat esteistä tai peittävistä tekijöistä, kuten hiuksista, laitteista, silmälaseista ja partakarvasta.

Raportti päättyy:

‘Lähestymistapa on kaupallistettu, ja se toimii hyvin tuotteissa, joissa on rajoittamattomat käyttäjän syötteet.’

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai