Andersonův úhel
Vývojáři TikTok mazají tváře pro aplikace s rozšířenou realitou

ByteDance, čínská nadnárodní internetová společnost za TikTok, vyvinula novou metodu pro mazání tváří ve videu, aby mohla být aplikována identifikační distorce a další podivné efekty na lidi v aplikacích s rozšířenou realitou. Společnost tvrdí, že tato technika již byla integrována do komerčních mobilních produktů, i když neuvádí, o které produkty se jedná.
Jakmile jsou tváře ve videu “vymazány”, je dostatek “tváří plátna” pro výrobu očích-boggling distorcí, stejně jako potenciální superimpozice jiných identit. Příklady poskytnuté v novém dokumentu od výzkumníků ByteDance ilustrují možnosti, včetně obnovení “vymazaných” rysů v různých komických (a jistě některých groteskních) konfiguracích:

Některé z možností pro faciální re-konfiguraci uvedené v dokumentu ByteDance. Source: https://arxiv.org/pdf/2109.10760.pdf
V konci srpna se ukázalo, že TikTok, první ne-Facebook aplikace, která spustila TikTok Effect Studio (v současné době v uzavřené beta verzi), platformu pro vývojáře aplikací s rozšířenou realitou, aby mohli vytvářet efekty pro tok TikTok.
Efektivně, společnost chytá krok se podobnými vývojářskými komunitami na Facebook’s AR Studio a Snap AR, s Apple’s vznešenou AR R&D komunitou, která se také brzy stane galvanizovanou novým hardwarovým vybavením v příštím roce.
Prázdné výrazy
Dokument dokument, nazvaný FaceEraser: Odstranění obličejových částí pro aplikaci s rozšířenou realitou, uvádí, že stávající algoritmy pro dokončování obrázků, jako je NVIDIA’s SPADE, jsou více orientovány na dokončování zkrácených nebo jinak semi-zakrytých obrázků než na provedení této neobvyklé “mazání” procedury, a že stávající dataset materiál je proto předvídatelně vzácný.
Protože neexistují žádné dostupné ground truth dataset pro lidi, kteří mají pevnou plochu kůže, kde by měly být jejich tváře, výzkumníci vytvořili novou síťovou architekturu nazvanou pixel-clone, která může být superimpozována do stávajících neuronových modelů pro dokončování obrázků, a která řeší problémy související s texturou a barevnými nekonzistencemi, které jsou vykazovány (dokument potvrzuje) staršími metodami, jako je StructureFlow a EdgeConnect.

Obecná struktura pixel-clone v novém pipeline.
Abyste mohli trénovat model na “prázdné” tváře, výzkumníci vyloučili obrázky s brýlemi nebo vlasy, které zakrývají čelo, protože oblast mezi vlasovou linií a obočím je obvykle největší skupina pixelů, která může poskytnout “přilepenou” hmotu pro centrální rysy obličeje.

Příprava trénovacích obrázků. Čelní oblast je oříznuta, založena na klíčových bodech v rozpoznávání obličeje, svisle otočena a sešita.
Obrázek o rozměrech 256×256 pixelů je dostatečně malý, aby se vešly do latentního prostoru neuronové sítě v dávkách, které jsou dostatečně velké, aby se dosáhlo generalizace. Pozdější algoritmické zvětšení obnoví rozlišení nezbytné pro práci v prostoru s rozšířenou realitou.
Architektura
Síť se skládá ze tří vnitřních sítí, skládajících se z dokončování hran, pixel-clone a síť pro jemné úpravy. Síť pro dokončování hran používá stejnou typ encoder-decoder architektury, jako je použitá v EdgeConnect (viz výše), stejně jako ve dvou nejoblíbenějších aplikacích pro deepfakes. Encodery vzorkují obrazový obsah dvakrát, a decodery obnovují původní rozměry obrazu.
Pixel-Clone používá modifikovanou encoder-decoder metodologii, zatímco síť pro jemné úpravy používá U-Net architekturu, techniku původně vyvinutou pro biomedicínské zobrazování, která často figuruje ve výzkumných projektech syntézy obrazu.
Během trénovacího workflow je nutné vyhodnotit přesnost transformací, a v případě potřeby opakovat pokusy iterativně až do konvergence. K tomuto účelu se používají dva diskriminátory založené na PatchGAN, z nichž každý vyhodnocuje lokalizovanou realističnost 70×70 pixelových patchů, slevující realističnost hodnoty celého obrazu.
Trénování a data
Síť pro dokončování hran je inicializována nezávisle, zatímco ostatní dvě sítě jsou trénovány společně, založené na váhách, které vyplynuly z trénování dokončování hran, které jsou pevné a zmrazené během tohoto postupu.
Ačkoli dokument výslovně neuvádí, že jeho příklady konečných efektů jsou centrálním cílem modelu, implementuje různé komické efekty pro testování odolnosti systému, včetně odstranění obočí, zvětšení úst, zmenšení sub-obličejů a “toonizovaných” efektů (jako je ukázáno v předchozím obrázku výše).
Dokument tvrdí, že “vymazané tváře umožňují různé aplikace s rozšířenou realitou, které vyžadují umístění libovolných uživatelsky přizpůsobených prvků”, což naznačuje možnost přizpůsobení tváří třetím stranám, uživatelsky přispívaným prvkům.
Model je trénován na maskách z NVIDIA-vytvořeného FFHQ datasetu, který obsahuje dostatečnou rozmanitost věků, etnických skupin, osvětlení a obličejových póz a stylů, aby se dosáhlo užitečné generalizace. Dataset obsahuje 35 000 obrázků a 10 000 trénovacích masek pro vymezení oblastí transformace, s 4000 obrázky a 1000 maskami vyhrazenými pro validační účely.

Trénovací datové vzorky.
Trénovaný model může provádět inference na datech z roku 2017 CelebA-HQ a VoxCeleb, neviditelné tváře z FFHQ a jakékoli jiné neomezené, neviditelné tváře, které jsou mu předloženy. Obrázky o rozměrech 256×256 pixelů byly trénovány na síti v dávkách po 8 přes Adam optimalizátor, implementovaný v PyTorch, a běžel na Tesla (TSLA ) V100 GPU po dobu 2000 000 epoch.

Výsledky inference získané na skutečných tvářích.
Jak je obvyklé ve výzkumu syntézy obrazu založené na tvářích, systém musí řešit příležitostné selhání způsobené překážkami nebo zakrytími, jako jsou vlasy, periferní zařízení, brýle a vousy.
Zpráva uzavírá:
‘Naše přístup byl komercializován a funguje dobře v produktech pro neomezené uživatelské vstupy.’












