Andersons vinkel

TikTok-utvecklare raderar ansikten för förstärkt verklighetstillämpningar

mm
Lägg till Unite.AI bland dina föredragna källor på Google

ByteDance, det kinesiska multinationella internetföretaget bakom TikTok, har utvecklat en ny metod för att radera ansikten i video så att identitetsfördistortion och andra bisarra effekter kan påföras människor i förstärkt verklighetstillämpningar. Företaget hävdar att tekniken redan har integrerats i kommersiella mobilprodukter, även om det inte anger vilka produkter.

När ansikten i video har “nollställts” finns det tillräckligt med “ansiktsduk” för att producera ögonbedövande distorsioner, samt potentiellt påföra andra identiteter. Exempel som tillhandahålls i en ny rapport från ByteDance-forskare illustrerar möjligheterna, inklusive återställande av “raderade” funktioner i olika komiska (och säkert några groteska) konfigurationer:

Några av möjligheterna för ansiktsomkonfiguration som ingår i ByteDance-rapporten. Källa: https://arxiv.org/pdf/2109.10760.pdf

Några av möjligheterna för ansiktsomkonfiguration som ingår i ByteDance-rapporten. Källa: https://arxiv.org/pdf/2109.10760.pdf

I slutet av augusti avslöjades det att TikTok, den första icke-Facebook-appen som nått tre miljarder nedladdningar, hade lanserat TikTok Effect Studio (för närvarande i sluten beta), en plattform för förstärkt verklighetsutvecklare för att skapa förstärkt verklighetseffekter för TikTok-innehållsströmmar.

Effektivt sett är företaget på väg att komma ikapp liknande utvecklarkommuniteter på Facebooks AR Studio och Snap AR, med Apples väletablerade AR R&D-community som också kommer att bli galvaniserad av ny hårdvara under de kommande året.

Tomma uttryck

Rapporten, med titeln FaceEraser: Radera ansiktsdelar för förstärkt verklighet, påpekar att befintliga in-painting/infill-algoritmer, såsom NVIDIA’s SPADE, är mer inriktade på att slutföra avklippta eller på annat sätt semi-överskuggade bilder än att utföra denna ovanliga “raderingsprocedur”, och att befintliga datamaterial därför är förutsägbart knapphändigt.

Eftersom det inte finns några tillgängliga grundläggande datamängder för människor som har en solid utsträckning av hud där deras ansikte borde vara, har forskarna skapat en ny nätverksarkitektur som kallas pixel-klon, som kan läggas till i befintliga neuralt in-painting-modeller, och som löser problem relaterade till textur- och färginkonsekvenser som visas (rapporten intygar) av äldre metoder som StructureFlow och EdgeConnect.

Den allmänna arbetsflödet för pixel-klon i den nya pipelinen.

Den allmänna arbetsflödet för pixel-klon i den nya pipelinen.

För att träna en modell på “tomma” ansikten uteslöt forskarna bilder med glasögon eller där hår täcker pannan, eftersom området mellan hårfästet och ögonbrynen vanligtvis är den största enskilda gruppen pixlar som kan tillhandahålla “klistra-över”-material för ansiktets centrala funktioner.

Förberedelse av träningsbilder. Pannområdet skärs ut, baserat på nyckelpunkter i ansiktsaligneringsigenkänning, vertikalt vänd och sydd.

Förberedelse av träningsbilder. Pannområdet skärs ut, baserat på nyckelpunkter i ansiktsaligneringsigenkänning, vertikalt vänd och sydd.

En 256×256-pixelbild erhålls, en tillräckligt liten storlek för att mata in i den latenta utrymmet för ett neuralt nätverk i batcher som är tillräckligt stora för att uppnå generalisering. Senare algoritmisk uppskalning kommer att återställa upplösningar som krävs för att fungera i AR-utrymmet.

Arkitektur

Nätverket består av tre inre nätverk, som består av Edge Completion, Pixel-Clone och en förfiningsnätverk. Edge Completion-nätverket använder samma typ av encoder-decoder-arkitektur som används i EdgeConnect (se ovan), samt i de två mest populära deepfake-applikationerna. Encoderarna nedsamplear bildinnehåll två gånger, och decoderarna återställer de ursprungliga bildimensionerna.

Pixel-Clone använder en modifierad encoder-decoder-metodik, medan förfiningslagret använder U-Net-arkitektur, en teknik som ursprungligen utvecklats för biomedicinsk avbildning, som ofta förekommer i bildsynthesprojekt.

Under träningsarbetsflödet är det nödvändigt att utvärdera noggrannheten hos transformationerna, och, om nödvändigt, upprepa försöken iterativt upp till konvergens. För detta ändamål används två diskriminatörer baserade på PatchGAN, var och en av vilka utvärderar den lokaliserade realismen hos 70×70-pixelstora patchar, med avdrag för realismvärdet hos hela bilden.

Träning och data

Edge Completion-nätverket tränas initialt oberoende, medan de andra två nätverken tränas tillsammans, baserat på de vikter som har resulterat från Edge Completion-träningen, som är fasta och frysta under denna procedur.

Även om rapporten inte uttryckligen anger att exempel på slutliga funktionella distorsioner är modellens centrala mål, implementerar den olika komiska effekter för att testa systemets motståndskraft, inklusive ögonbrynsborttagning, förstorade munnar, minskade underansikten och “tecknade” effekter (som visas i den tidigare bilden ovan).

Rapporten hävdar att “de raderade ansiktena möjliggör olika förstärkt verklighetstillämpningar som kräver placering av användarkustomiserade element”, vilket indikerar möjligheten att anpassa ansikten med tredjeparts-, användarbidragande element.

Modellen tränas på masker från NVIDIA-skapade FFHQ-datasetet, som innehåller en tillräcklig variation av åldrar, etniciteter, belysning och ansiktsposer och stilar för att uppnå en användbar generalisering. Datasetet innehåller 35 000 bilder och 10 000 träningsmasker för att avgränsa områdena för transformation, med 4000 bilder och 1000 masker som sätts åt sidan för valideringsändamål.

Träningsdataprover.

Träningsdataprover.

Den tränade modellen kan utföra inferens på data från 2017 års CelebA-HQ och VoxCeleb, osynliga ansikten från FFHQ, och alla andra obegränsade, osynliga ansikten som presenteras för den. De 256×256-pixelbilder som tränades på nätverket i batcher om 8 över en Adam-optimizer, implementerad i PyTorch, och som kördes på en Tesla (TSLA ) V100 GPU för “2000 000 epoker”.

Inferensresultat som erhållits på ett riktigt ansikte.

Inferensresultat som erhållits på ett riktigt ansikte.

Som är vanligt i ansiktsbaserad bildsynthesforskning, måste systemet hantera tillfälliga misslyckanden som provoceras av hinder eller ockultationer såsom hår, tillbehör, glasögon och ansiktsbehåring.

Rapporten avslutas:

‘Vår metod har kommersialiserats och fungerar bra i produkter för obegränsade användarindata.’

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai