Ángulo de Anderson
SofGAN: Un Generador de Caras Basado en GAN que Ofrece un Mayor Control

Investigadores en Shanghai y EE. UU. han desarrollado un sistema de generación de retratos basado en GAN que permite a los usuarios crear caras nuevas con un nivel de control sin precedentes sobre aspectos individuales como el cabello, los ojos, las gafas, las texturas y el color.
Para demostrar la versatilidad del sistema, los creadores han proporcionado una interfaz similar a la de Photoshop en la que un usuario puede dibujar directamente elementos de segmentación semántica que se reinterpretarán en imágenes realistas, y que incluso se pueden obtener dibujando directamente sobre fotografías existentes.
En el ejemplo a continuación, se utiliza una foto del actor Daniel Radcliffe como plantilla de trazado (y el objetivo no es producir un parecido con él, sino una imagen fotorealista en general). A medida que el usuario rellena los diferentes elementos, incluidos facetas discretas como las gafas, se identifican y se interpretan en la imagen de dibujo de salida:

Usando una imagen como material de trazado para un retrato generado por SofGAN. Fuente: https://www.youtube.com/watch?v=xig8ZA3DVZ8
El artículo se titula SofGAN: Un Generador de Imágenes de Retrato con Estilo Dinámico, y está liderado por Anpei Chen y Ruiyang Liu, junto con dos investigadores más de la Universidad ShanghaiTech y otro de la Universidad de California en San Diego.
Desenredando Características
La contribución principal del trabajo no es tanto proporcionar una interfaz de usuario amigable, sino más bien “desenredar” las características de las facciones faciales aprendidas, como la pose y la textura, lo que permite a SofGAN generar caras que están en ángulos indirectos con respecto a la vista de la cámara.

Inusual entre los generadores de caras basados en Redes Adversarias Generativas, SofGAN puede cambiar el ángulo de vista a voluntad, dentro de los límites del conjunto de ángulos presentes en los datos de entrenamiento. Fuente: https://arxiv.org/pdf/2007.03780.pdf
Desde que las texturas están ahora desenredadas de la geometría, la forma de la cara y la textura también se pueden manipular como entidades separadas. En efecto, esto permite cambiar la raza de una cara de origen, una práctica escandalosa que ahora tiene una aplicación potencialmente útil, para la creación de conjuntos de datos de aprendizaje automático equilibrados racialmente.

SofGAN también admite el envejecimiento artificial y el ajuste de estilo consistente con los atributos a un nivel granular sin precedentes en sistemas de segmentación a imagen similares, como GauGAN de NVIDIA y el sistema de renderizado neuronal basado en juegos de Intel.

SofGAN puede implementar el envejecimiento como un estilo iterativo.
Otro avance en la metodología de SofGAN es que el entrenamiento no requiere imágenes reales emparejadas con segmentación, sino que se puede entrenar directamente con imágenes del mundo real no emparejadas.
Los investigadores afirman que la arquitectura de “desenredado” de SofGAN se inspiró en los sistemas de renderizado de imágenes tradicionales, que descomponen los elementos individuales de una imagen. En los flujos de trabajo de efectos visuales, los elementos para un compuesto se descomponen rutinariamente en los componentes más mínimos, con especialistas dedicados a cada componente.
Campo de Ocupación Semántico (SOF)
Para lograr esto en un marco de síntesis de imágenes de aprendizaje automático, los investigadores desarrollaron un campo de ocupación semántico (SOF), una extensión del campo de ocupación tradicional que individúa los elementos componentes de los retratos faciales. El SOF se entrenó en mapas de segmentación semántica multivista calibrados, pero sin supervisión de verdad fundamentada.

Iteraciones múltiples a partir de un solo mapa de segmentación (abajo a la izquierda).
Además, se obtienen mapas de segmentación 2D mediante el rastreo de rayos de la salida del SOF, antes de ser texturizados por un generador GAN. Los mapas de segmentación semántica “sintéticos” también se codifican en un espacio de baja dimensión a través de un codificador de tres capas para garantizar la continuidad de la salida cuando se cambia la vista.
El esquema de entrenamiento mezcla espacialmente dos estilos aleatorios para cada región semántica:
Los investigadores afirman que SofGAN logra una distancia de Frechet Inception (FID) más baja que los enfoques actuales alternativos del estado del arte (SOTA), así como una métrica de similitud de parches de imagen aprendida (LPIPS) más alta.
Los enfoques anteriores de StyleGAN a menudo se han visto obstaculizados por la entrelazamiento de características, en el que los elementos que componen una imagen están irretrievablemente unidos entre sí, lo que causa la aparición de elementos no deseados junto con un elemento deseado (es decir, los pendientes pueden aparecer cuando se representa una forma de oreja que se informó en el momento del entrenamiento con una imagen que presentaba pendientes).

Rastreo de rayos se utiliza para calcular el volumen de los mapas de segmentación semántica, lo que permite múltiples vistas.
Conjuntos de Datos y Entrenamiento
Se utilizaron tres conjuntos de datos en el desarrollo de varias implementaciones de SofGAN: CelebAMask-HQ, un repositorio de 30.000 imágenes de alta resolución tomadas del conjunto de datos CelebA-HQ; Flickr-Faces-HQ de NVIDIA, que contiene 70.000 imágenes, donde los investigadores etiquetaron las imágenes con un analizador de caras preentrenado; y un grupo auto-producido de 122 escaneos de retratos con regiones semánticas etiquetadas manualmente.
El SOF consta de tres submódulos entrenables: la hiper-red, un rastreador de rayos (ver imagen anterior), y un clasificador. El generador de estilo de SofGAN se configura de manera similar a StyleGAN2 en ciertos aspectos. Se aplica la augmentación de datos a través del escalado y el recorte aleatorios, y el entrenamiento cuenta con la regularización de la ruta cada cuatro pasos. El procedimiento de entrenamiento completo tardó 22 días en alcanzar 800.000 iteraciones en cuatro GPU RTX 2080 Ti con CUDA 10.1.
El artículo no menciona la configuración de las tarjetas 2080, que pueden acomodar entre 11 GB y 22 GB de VRAM cada una, lo que significa que la VRAM total empleada para la mayor parte de un mes para entrenar a SofGAN está en algún lugar entre 44 GB y 88 GB.
Los investigadores observan que los resultados generalizados y de alto nivel comenzaron a surgir bastante temprano en el entrenamiento, a 1500 iteraciones, tres días después del inicio del entrenamiento. El resto del entrenamiento se dedicó a la lenta aproximación hacia la obtención de detalles finos como el cabello y las facciones de los ojos.
SofGAN generalmente logra resultados más realistas a partir de un solo mapa de segmentación que los métodos rivales como SPADE de NVIDIA y Pix2PixHD, y SEAN.
A continuación se muestra el video publicado por los investigadores. Se pueden encontrar más videos auto-hospedados en la página del proyecto.














