Andersons vinkel

TikTok-utviklere sletter ansikter for augumentert virkelighet-applikasjoner

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

ByteDance, det kinesiske multinasjonale internett-selskapet bak TikTok, har utviklet en ny metode for å slette ansikter i video, slik at identitetsforvrengning og andre merkelige effekter kan påføres mennesker i augumentert virkelighet-applikasjoner. Selskapet hevder at teknikken allerede er integrert i kommersielle mobilprodukter, selv om det ikke spesifiserer hvilke produkter.

Når ansikter i video er “nullstilt”, er det nok “ansiktskanvas” til å produsere øyeblikksbetagende forvrengninger, samt potensielt å overføre andre identiteter. Eksempler som er supplert i en ny rapport fra ByteDance-forskere illustrerer mulighetene, inkludert å gjenopprette de “slettede” trekkene i forskjellige komiske (og sannelig noen groteske) konfigurasjoner:

Noen av mulighetene for ansiktsomorganisering inkludert i ByteDance-rapporten. Kilde: https://arxiv.org/pdf/2109.10760.pdf

Noen av mulighetene for ansiktsomorganisering inkludert i ByteDance-rapporten. Kilde: https://arxiv.org/pdf/2109.10760.pdf

Mot slutten av august ble det kjent at TikTok, den første ikke-Facebook-appen som har nådd tre milliarder nedlastinger, hadde lansert TikTok Effect Studio (for tiden i lukket beta), en plattform for augumentert virkelighet (AR)-utviklere til å lage AR-efekter for TikTok-innholdstrømmer.

Effektivt sett, er selskapet i ferd med å holde tritt med lignende utviklermiljøer på Facebooks AR Studio og Snap AR, med Apples venerable AR R&D-samfunn også sett til å bli galvanisert av nytt hårdtware over de neste året.

Tomme uttrykk

Rapporten hefter at eksisterende in-painting/infill-algoritmer, som NVIDIA’s SPADE, er mer rettet mot å fullføre avkortede eller delvis skjulte bilder enn å utføre denne usedvanlige “sletting”-prosessen, og at eksisterende datasett-materiale derfor er svært sjeldent.

Ettersom det ikke finnes noen tilgjengelige grunn-sannhetsdatasett for mennesker som har en solid utstrekning av hud der ansiktet skulle være, har forskerne skapt en nytt nettverksarkitektur kalt pixel-clone, som kan overføres til eksisterende neurale in-painting-modeller, og som løser problemer relatert til tekstur- og fargeuoverensstemmelser som vises (rapporten hevder) av eldre metoder som StructureFlow og EdgeConnect.

Generell arbeidsflyt av pixel-clone i den nye pipeline.

Generell arbeidsflyt av pixel-clone i den nye pipeline.

For å trene en modell på “tomme” ansikter, har forskerne utelukket bilder med briller, eller hvor håret skjuler pannen, siden området mellom hårlinjen og øyebrynene vanligvis er den største enkeltgruppen av piksler som kan supplere “lim-over”-materiale for ansiktets sentrale trekk.

Forberedelse av treningsbilder. Pannen er klippet ut, basert på nøkkel-punkter i ansikts-alignment-gjenkjenning, vertikalt flippet og sydd.

Forberedelse av treningsbilder. Pannen er klippet ut, basert på nøkkel-punkter i ansikts-alignment-gjenkjenning, vertikalt flippet og sydd.

Et 256×256 piksel-bilde er oppnådd, et tilstrekkelig lite størrelse til å mata inn i latent-rommet til et neuralt nettverk i batcher som er store nok til å oppnå generalisering. Senere algoritmer vil gjenopprette nødvendige oppløsninger for å fungere i AR-rommet.

Arkitektur

Nettverket består av tre indre nettverk, bestående av Edge Completion, Pixel-Clone og en forfiningsnettverk. Edge Completion-nettverket bruker samme type encoder-decoder-arkitektur som brukes i EdgeConnect (se over), samt i de to mest populære deepfake-applikasjonene. Encoderne nedsamplet bildeinnholdet to ganger, og decoderne gjenopprettet de opprinnelige bilde-dimensjonene.

Pixel-Clone bruker en modifisert encoder-decoder-metodologi, mens forfiningslaget bruker U-Net-arkitektur, en teknikk som opprinnelig ble utviklet for biomedisinsk bildesynthese, som ofte vises i bildesyntheseforskningsprosjekter.

Under treningens arbeidsflyt er det nødvendig å evaluere transformasjonens nøyaktighet, og, hvis nødvendig, gjenta forsøkene iterativt opp til konvergens. Til dette formålet brukes to diskriminatorene basert på PatchGAN, hver av dem vurderer den lokale realisme av 70×70 piksler-patcher, og diskonterer realisme-verdien av hele bildet.

Trening og data

Edge Completion-nettverket er først trent uavhengig, mens de to andre nettverkene er trent sammen, basert på vekter som har resultert fra edge completion-treningen, som er fikset og frosset under denne prosedyren.

Selv om rapporten ikke uttrykkelig angir at eksemplene på endelige funksjonsforvrengninger er modellens hovedmål, implementerer den forskjellige komiske effekter for å teste systemets motstandskraft, inkludert øyebryn-fjerning, forstørrede munn, krympede under-ansikter og “tegnefil”-effekter (som vist i tidligere bilde, over).

Rapporten hevder at “de slettede ansiktene muliggjør ulike augumentert virkelighet-applikasjoner som krever plassering av bruker-tilpassede elementer”, og indikerer muligheten for å tilpasse ansikter med tredjeparts-, bruker-bidragete elementer.

Modellen er trent på masker fra NVIDIA-skapt FFHQ-datasett, som inneholder en tilstrekkelig variasjon av alder, etnisitet, lys og ansiktsposer og stiler for å oppnå en nyttig generalisering. Datasettet inneholder 35 000 bilder og 10 000 treningsmasker for å avgrense områdene for transformasjon, med 4000 bilder og 1000 masker satt av til valideringsformål.

Treningsdata-eksempler.

Treningsdata-eksempler.

Den trenede modellen kan utføre inferens på data fra 2017s CelebA-HQ og VoxCeleb, usette ansikter fra FFHQ, og alle andre ubegrensede, usette ansikter som presenteres for den. De 256×256-bildene ble trent på nettverket i batcher på 8 over en Adam-optimizer, implementert i PyTorch, og kjørt på en Tesla (TSLA ) V100-GPU for “2000 000 epoker”.

Inferens-resultater oppnådd på et virkelig ansikt.

Inferens-resultater oppnådd på et virkelig ansikt.

Som er vanlig i ansiktsbasert bildesyntheseforskning, må systemet håndtere tilfeldige feil provocert av hindringer eller okklusjoner som hår, periferer, briller og ansikts-hår.

Rapporten konkluderer:

‘Vår tilnærming har blitt kommersialisert og fungerer godt i produkter for ubegrensede bruker-inndata.’

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai