Ãngulo de Anderson
Desenvolvedores do TikTok Apagam Rostos para Aplicativos de Realidade Aumentada

A ByteDance, empresa multinacional de internet chinesa por trÃĄs do TikTok, desenvolveu um novo mÃĐtodo para apagar rostos em vÃdeo, de modo que distorçÃĩes de identidade e outros efeitos bizarros possam ser impostos a pessoas em aplicativos de realidade aumentada. A empresa afirma que a tÃĐcnica jÃĄ foi integrada a produtos mÃģveis comerciais, embora nÃĢo especifique quais produtos.
Uma vez que os rostos em vÃdeo foram âzeradosâ, hÃĄ espaço suficiente para produzir distorçÃĩes impressionantes, bem como superpor outras identidades. Exemplos fornecidos em um novo artigo de pesquisadores da ByteDance ilustram as possibilidades, incluindo restaurar as caracterÃsticas âapagadasâ em vÃĄrias configuraçÃĩes cÃīmicas (e certamente algumas grotescas):

Algumas das possibilidades de reconfiguraçÃĢo facial incluÃdas no artigo da ByteDance. Fonte: https://arxiv.org/pdf/2109.10760.pdf
Para o final de agosto, foi divulgado que o TikTok, o primeiro aplicativo nÃĢo Facebook a atingir trÊs bilhÃĩes de instalaçÃĩes, havia lançado o TikTok Effect Studio (atualmente em beta fechado), uma plataforma para desenvolvedores de realidade aumentada criarem efeitos de realidade aumentada para transmissÃĩes de conteÚdo do TikTok.
Em essÊncia, a empresa estÃĄ alcançando comunidades de desenvolvedores semelhantes no AR Studio do Facebook e no Snap AR, com a venerÃĄvel comunidade de P&D de realidade aumentada da Apple tambÃĐm prestes a ser galvanizada por novo hardware nos prÃģximos anos.
ExpressÃĩes em Branco
O artigo, intitulado FaceEraser: Removendo Partes Faciais para Realidade Aumentada, observa que os algoritmos de preenchimento de imagens existentes, como o SPADE da NVIDIA, estÃĢo mais orientados para completar imagens truncadas ou semi-obscurecidas do que para realizar esse procedimento de âapagamentoâ incomum, e que o material de conjunto de dados existente ÃĐ, portanto, previsivelmente escasso.
Como nÃĢo hÃĄ conjuntos de dados de verdade disponÃveis para pessoas que tÊm uma extensÃĢo sÃģlida de carne onde o rosto deveria estar, os pesquisadores criaram uma nova arquitetura de rede chamada pixel-clone, que pode ser superposta a modelos de preenchimento de imagens neurais existentes, e que resolve questÃĩes relacionadas a inconsistÊncias de textura e cor exibidas (o artigo atesta) por mÃĐtodos mais antigos, como o StructureFlow e o EdgeConnect.

Fluxo de trabalho geral do pixel-clone na nova pipeline.
Para treinar um modelo em ârostos em brancoâ, os pesquisadores excluÃram imagens com Ãģculos ou onde o cabelo obscurece a testa, pois a ÃĄrea entre a linha do cabelo e as sobrancelhas ÃĐ geralmente o maior grupo de pixels que pode fornecer material para âcolarâ as caracterÃsticas centrais do rosto.

Preparando imagens de treinamento. A ÃĄrea da testa ÃĐ recortada com base em pontos-chave no reconhecimento de alinhamento facial, verticalmente invertida e costurada.
Uma imagem de 256Ã256 pixels ÃĐ obtida, um tamanho pequeno o suficiente para ser alimentada no espaço latente de uma rede neural em lotes grandes o suficiente para alcançar generalizaçÃĢo. O dimensionamento algorÃtmico posterior restaurarÃĄ as resoluçÃĩes necessÃĄrias para funcionar no espaço de realidade aumentada.
Arquitetura
A rede ÃĐ composta por trÊs redes internas, que consistem em ConclusÃĢo de Borda, Pixel-Clone e uma rede de refino. A rede de conclusÃĢo de borda usa a mesma arquitetura de codificador-decodificador empregada no EdgeConnect (ver acima), bem como nas duas aplicaçÃĩes de deepfake mais populares. Os codificadores diminuem a amostragem do conteÚdo da imagem duas vezes, e os decodificadores restauram as dimensÃĩes originais da imagem.
O Pixel-Clone usa uma metodologia de codificador-decodificador modificada, enquanto a camada de refino usa a arquitetura U-Net, uma tÃĐcnica originalmente desenvolvida para imagens biomÃĐdicas, que frequentemente aparece em projetos de pesquisa de sÃntese de imagens.
Durante o fluxo de trabalho de treinamento, ÃĐ necessÃĄrio avaliar a precisÃĢo das transformaçÃĩes e, conforme necessÃĄrio, repetir as tentativas iterativamente atÃĐ convergÊncia. Para esse fim, dois discriminadores baseados no PatchGAN sÃĢo usados, cada um dos quais avalia a realidade localizada de patches de 70Ã70 pixels, descontando o valor de realidade da imagem inteira.
Treinamento e Dados
A rede de conclusÃĢo de borda ÃĐ treinada inicialmente de forma independente, enquanto as outras duas redes sÃĢo treinadas juntas, com base nos pesos resultantes do treinamento de conclusÃĢo de borda, que sÃĢo fixos e congelados durante esse procedimento.
Embora o artigo nÃĢo afirme explicitamente que os exemplos de distorçÃĢo de caracterÃsticas finais sejam o objetivo central do modelo, ele implementa vÃĄrios efeitos cÃīmicos para testar a resiliÊncia do sistema, incluindo remoçÃĢo de sobrancelhas, bocas aumentadas, sub-rostos encolhidos e efeitos âtoonizadosâ (como mostrado na imagem anterior).
O artigo afirma que âos rostos apagados permitem vÃĄrios aplicativos de realidade aumentada que exigem a colocaçÃĢo de elementos personalizados por usuÃĄrioâ, indicando a possibilidade de personalizar rostos com elementos contribuÃdos por terceiros.
O modelo ÃĐ treinado em mÃĄscaras do conjunto de dados FFHQ criado pela NVIDIA, que contÃĐm uma variedade adequada de idades, etnias, iluminaçÃĢo e poses e estilos faciais para alcançar uma generalizaçÃĢo Útil. O conjunto de dados contÃĐm 35.000 imagens e 10.000 mÃĄscaras de treinamento para delinear as ÃĄreas de transformaçÃĢo, com 4000 imagens e 1000 mÃĄscaras reservadas para fins de validaçÃĢo.

Amostras de treinamento.
O modelo treinado pode realizar inferÊncia em dados do CelebA-HQ de 2017 e do VoxCeleb, rostos nÃĢo vistos do FFHQ e quaisquer outros rostos nÃĢo vistos e nÃĢo restritos apresentados a ele. As imagens de 256Ã256 pixels foram treinadas na rede em lotes de 8 sobre um otimizador Adam, implementado no PyTorch, e executado em um GPU Tesla V100 por â2000.000 ÃĐpocasâ.

Resultados de inferÊncia obtidos em um rosto real.
Como ÃĐ comum em pesquisas de sÃntese de imagens baseadas em rostos, o sistema tem que lidar com falhas ocasionais provocadas por obstruçÃĩes ou oclusÃĩes, como cabelo, acessÃģrios, Ãģculos e pelos faciais.
O relatÃģrio conclui:
âNossa abordagem foi comercializada e funciona bem em produtos para entradas de usuÃĄrio nÃĢo restritas.â












