Ángulo de Anderson
Desarrolladores de TikTok borran caras para aplicaciones de realidad aumentada

ByteDance, la empresa china de internet multinacional detrás de TikTok, ha desarrollado un nuevo método para borrar caras en video para que se puedan imponer distorsiones de identidad y otros efectos extraños en personas en aplicaciones de realidad aumentada. La empresa afirma que la técnica ya se ha integrado en productos comerciales para móviles, aunque no especifica qué productos.
Una vez que las caras en el video han sido “borradas”, hay suficiente “lienzo de cara” para producir distorsiones asombrosas, así como superponer otras identidades. Los ejemplos proporcionados en un nuevo artículo de investigadores de ByteDance ilustran las posibilidades, incluyendo la restauración de las características “borradas” en varias configuraciones cómicas (y ciertamente algunas grotescas):

Algunas de las posibilidades para la reconfiguración facial incluidas en el artículo de ByteDance. Fuente: https://arxiv.org/pdf/2109.10760.pdf
Hacia finales de agosto, se supo que TikTok, la primera aplicación no de Facebook en alcanzar tres mil millones de descargas, había lanzado TikTok Effect Studio (actualmente en beta cerrada), una plataforma para que los desarrolladores de realidad aumentada creen efectos de realidad aumentada para las transmisiones de TikTok.
En efecto, la empresa está alcanzando a comunidades de desarrolladores similares en AR Studio de Facebook y Snap AR, con la venerable comunidad de investigación y desarrollo de AR de Apple también lista para ser galvanizada por nuevo hardware en el próximo año.
Expresiones en blanco
El artículo, titulado FaceEraser: Eliminación de partes faciales para realidad aumentada, señala que los algoritmos de inpintura/infill existentes, como NVIDIA’s SPADE, están más orientados hacia la finalización de imágenes truncadas u oscurecidas que a realizar este procedimiento de “borrado” inusual, y que el material de datos existente es, por lo tanto, predeciblemente escaso.
Dado que no hay conjuntos de datos de verdad disponibles para personas que tienen una extensión de carne donde debería estar su cara, los investigadores han creado una arquitectura de red novedosa llamada pixel-clone, que se puede superponer a los modelos de inpintura neural existentes, y que resuelve problemas relacionados con la inconsistencia de textura y color exhibida (el artículo atestigua) por métodos anteriores como StructureFlow y EdgeConnect.

Flujo de trabajo general de pixel-clone en la nueva canalización.
Para entrenar un modelo en “caras en blanco”, los investigadores excluyeron imágenes con gafas o donde el cabello oculta la frente, ya que el área entre la línea del cabello y las cejas es generalmente el grupo más grande de píxeles que puede suministrar material “para sobreescribir” para las características centrales de la cara.

Preparación de imágenes de entrenamiento. El área de la frente se recorta, basándose en puntos clave en el reconocimiento de alineación facial, se invierte verticalmente y se cose.
Se obtiene una imagen de 256×256 píxeles, un tamaño lo suficientemente pequeño como para alimentar el espacio latente de una red neuronal en lotes lo suficientemente grandes como para lograr la generalización. Más tarde, el escalado algorítmico de la imagen restaurará las resoluciones necesarias para trabajar en el espacio de realidad aumentada.
Arquitectura
La red se compone de tres redes internas, que comprenden la finalización de bordes, Pixel-Clone y una red de refinamiento. La red de finalización de bordes utiliza la misma arquitectura de codificador-decodificador empleada en EdgeConnect (ver arriba), así como en las dos aplicaciones de deepfake más populares. Los codificadores muestran el contenido de la imagen dos veces, y los decodificadores restauran las dimensiones originales de la imagen.
Pixel-Clone utiliza una metodología de codificador-decodificador modificada, mientras que la capa de refinamiento utiliza la arquitectura U-Net, una técnica originalmente desarrollada para la imagen biomédica, que a menudo se presenta en proyectos de investigación de síntesis de imágenes.
Durante el flujo de trabajo de entrenamiento, es necesario evaluar la precisión de las transformaciones y, según sea necesario, repetir los intentos de forma iterativa hasta convergencia. Con este fin, se utilizan dos discriminadores basados en PatchGAN, cada uno de los cuales evalúa la realidad localizada de parches de 70×70 píxeles, descontando el valor de realidad de la imagen completa.
Entrenamiento y datos
La red de finalización de bordes se entrena inicialmente de forma independiente, mientras que las otras dos redes se entrenan juntas, basándose en los pesos que han resultado del entrenamiento de finalización de bordes, que se congelan durante este procedimiento.
Aunque el artículo no establece explícitamente que los ejemplos de distorsión de características finales son el objetivo central del modelo, implementa varios efectos cómicos para probar la resistencia del sistema, incluyendo la eliminación de cejas, bocas agrandadas, subcaras encogidas y efectos “de dibujos animados” (como se muestra en la imagen anterior).
El artículo afirma que “las caras borradas permiten diversas aplicaciones de realidad aumentada que requieren la colocación de elementos personalizados por el usuario”, lo que indica la posibilidad de personalizar caras con elementos contribuidos por terceros y personalizados por el usuario.
El modelo se entrena en máscaras del conjunto de datos FFHQ creado por NVIDIA, que contiene una variedad adecuada de edades, etnias, iluminación y poses y estilos faciales para lograr una generalización útil. El conjunto de datos contiene 35.000 imágenes y 10.000 máscaras de entrenamiento para delinear las áreas de transformación, con 4000 imágenes y 1000 máscaras reservadas para fines de validación.

Muestras de datos de entrenamiento.
El modelo entrenado puede realizar inferencia en datos del conjunto de datos CelebA-HQ de 2017 y VoxCeleb, caras no vistas del conjunto de datos FFHQ y cualquier otra cara no vista y no restringida que se le presente. Las imágenes de 256×256 píxeles se entrenaron en la red en lotes de 8 sobre un optimizador Adam, implementado en PyTorch, y ejecutado en una GPU Tesla V100 durante “2.000.000 de épocas”.

Resultados de inferencia obtenidos en una cara real.
Como es común en la investigación de síntesis de imágenes basada en caras, el sistema tiene que contender con fallos ocasionales provocados por obstrucciones u ocultaciones como el cabello, los accesorios, las gafas y el vello facial.
El informe concluye:
‘Nuestro enfoque se ha comercializado y funciona bien en productos para entradas de usuario no restringidas.’












