Ángulo de Anderson
Adobe Research Extiende la Edición de Rostros Desacoplados de GAN

No es difícil entender por qué el desacoplamiento es un problema en la síntesis de imágenes, porque a menudo es un problema en otras áreas de la vida; por ejemplo, es mucho más difícil eliminar el curry de un plato de curry que descartar la pepinilla de una hamburguesa, y es prácticamente imposible desendulzar un vaso de café. Algunas cosas simplemente vienen empaquetadas.
De manera similar, el desacoplamiento es un obstáculo para las arquitecturas de síntesis de imágenes que idealmente les gustaría separar diferentes características y conceptos al utilizar el aprendizaje automático para crear o editar rostros (o perros, barcos, o cualquier otro dominio).
Si se pudieran separar hebras como edad, género, color de cabello, tono de piel, emoción, y así sucesivamente, se tendrían los comienzos de un verdadero instrumento y flexibilidad en un marco que podría crear y editar imágenes de rostros a un nivel verdaderamente granular, sin arrastrar “pasajeros” no deseados en estas conversiones.
En el máximo desacoplamiento (arriba a la izquierda), solo se puede cambiar la imagen de una red GAN aprendida a la imagen de otra persona.
Esto es efectivamente utilizar la última tecnología de visión artificial para lograr algo que se resolvió por otros medios hace más de treinta años.
Con algún grado de separación (‘Separación media’ en la imagen anterior), es posible realizar cambios basados en el estilo, como el color del cabello, la expresión, la aplicación de cosméticos y la rotación limitada de la cabeza, entre otros.

Fuente: FEAT: Edición de rostros con atención, febrero de 2022, https://arxiv.org/pdf/2202.02713.pdf
Ha habido una serie de intentos en los últimos dos años para crear entornos de edición de rostros interactivos que permitan a un usuario cambiar las características faciales con controles deslizantes y otras interacciones de interfaz de usuario tradicionales, manteniendo las características básicas del rostro objetivo intactas al realizar adiciones o cambios. Sin embargo, esto ha resultado un desafío debido al desacoplamiento de características/estilo subyacente en el espacio latente de la GAN.
Por ejemplo, el rasgo de gafas a menudo se entrelaza con el rasgo envejecido, lo que significa que agregar gafas también puede “envejecer” el rostro, mientras que envejecer el rostro puede agregar gafas, dependiendo del grado de separación de características de alto nivel aplicadas (ver “Pruebas” a continuación para ejemplos).
La mayoría de los intentos han demostrado que es casi imposible alterar el color del cabello y otros aspectos del cabello sin que los mechones de cabello y la disposición se recalculen, lo que da un efecto de “chisporroteo”, transitorio.

Fuente: Demo de InterFaceGAN (CVPR 2020), https://www.youtube.com/watch?v=uoftpl3Bj6w
Travesía de GAN Latente a Latente
Un nuevo artículo liderado por Adobe presentado para WACV 2022 ofrece un enfoque novedoso para estos problemas subyacentes en un artículo titulado Latente a Latente: Un mapeador aprendido para la edición de preservación de identidad de múltiples atributos faciales en imágenes generadas por StyleGAN.

Material suplementario del artículo Latente a Latente: Un mapeador aprendido para la edición de preservación de identidad de múltiples atributos faciales en imágenes generadas por StyleGAN. Aquí vemos que las características básicas en el rostro aprendido no se arrastran en cambios no relacionados. Ver el video incrustado al final del artículo para más detalles y resolución. Fuente: https://www.youtube.com/watch?v=rf_61llRH0Q
El artículo está liderado por el científico aplicado de Adobe Siavash Khodadadeh, junto con cuatro otros investigadores de Adobe y un investigador del Departamento de Ciencias de la Computación de la Universidad de Florida Central.
El artículo es interesante en parte porque Adobe ha estado operando en este espacio durante algún tiempo, y es tentador imaginar esta funcionalidad ingresando en un proyecto de Creative Suite en los próximos años; pero principalmente porque la arquitectura creada para el proyecto toma un enfoque diferente para mantener la integridad visual en un editor de rostros GAN mientras se aplican cambios.
Los autores declaran:
‘[Nosotros] entrenamos una red neuronal para realizar una transformación latente a latente que encuentra la codificación latente correspondiente a la imagen con el atributo cambiado. Como la técnica es de un solo disparo, no depende de una trayectoria lineal o no lineal del cambio gradual de los atributos.
‘Al entrenar la red de extremo a extremo en toda la tubería de generación, el sistema puede adaptarse a los espacios latentes de las arquitecturas generadoras fuera de la caja. Las propiedades de conservación, como mantener la identidad de la persona, se pueden codificar en la forma de pérdidas de entrenamiento.
‘Una vez que se entrenó la red latente a latente, se puede reutilizar para imágenes arbitrarias sin volver a entrenar.’
Esto último significa que la arquitectura propuesta llega con el usuario final en un estado terminado. Todavía necesita ejecutar una red neuronal en recursos locales, pero las nuevas imágenes se pueden “depositar” y estar listas para alterar casi de inmediato, ya que el marco está lo suficientemente desconectado como para no necesitar un entrenamiento adicional de imagen específica.

Género y vello facial cambiados a medida que los controles deslizantes trazan caminos aleatorios y arbitrarios a través del espacio latente, no solo ‘frotando entre puntos finales’. Ver el video incrustado al final del artículo para más transformaciones a mejor resolución.
Entre los principales logros en el trabajo se encuentra la capacidad de la red para ‘congelar’ identidades en el espacio latente cambiando solo el atributo en un vector objetivo, y proporcionando ‘términos de corrección’ que conservan identidades que se transforman.
Esencialmente, la red propuesta está incrustada en una arquitectura más amplia que orquesta todos los elementos procesados, que pasan a través de componentes preentrenados con pesos congelados que no producirán efectos laterales no deseados en las transformaciones.
Dado que el proceso de entrenamiento depende de triplets que se pueden generar mediante una imagen de semilla (bajo inversión GAN) o una codificación latente inicial existente, todo el proceso de entrenamiento es no supervisado, con las acciones tácitas de los sistemas de etiquetado y curación habituales en tales sistemas efectivamente horneados en la arquitectura. De hecho, el nuevo sistema utiliza reconocedores de atributos fuera de la caja:
‘[El] número de atributos que nuestra red puede controlar de forma independiente solo está limitado por las capacidades del reconocedor – si se tiene un reconocedor para un atributo, podemos agregarlo a rostros arbitrarios. En nuestros experimentos, entrenamos la red latente a latente para permitir el ajuste de 35 atributos faciales diferentes, más que cualquier enfoque anterior.’
El sistema incorpora una salvaguarda adicional contra transformaciones de ‘efectos secundarios’ no deseados: en ausencia de una solicitud de cambio de atributo, la red latente a latente asignará un vector latente a sí mismo, lo que aumenta aún más la persistencia estable de la identidad del objetivo.
Reconocimiento Facial
Un problema recurrente con los editores de rostros GAN y basados en codificador/decodificador de los últimos años ha sido que las transformaciones aplicadas tienden a degradar la semejanza. Para combatir esto, el proyecto de Adobe utiliza una red de reconocimiento facial incrustada llamada FaceNet como discriminador.

Arquitectura del proyecto, ver abajo a la mitad izquierda para la inclusión de FaceNet. Fuente: Latente a Latente: Un mapeador aprendido para la edición de preservación de identidad de múltiples atributos faciales en imágenes generadas por StyleGAN, OpenAccess.
(En una nota personal, esto parece un movimiento alentador hacia la integración de sistemas de identificación y reconocimiento de expresiones faciales estándar en redes generativas, probablemente la mejor manera de superar el mapeo ciego píxel a píxel que domina las arquitecturas de deepfakes actuales a expensas de la fidelidad de la expresión y otros dominios importantes en el sector de generación de rostros.)
Acceso a Todas las Áreas en el Espacio Latente
Otra característica impresionante de la arquitectura es su capacidad para viajar arbitrariamente entre transformaciones potenciales en el espacio latente, a voluntad del usuario. Varios sistemas anteriores que proporcionaron interfaces de exploración a menudo dejaban al usuario esencialmente “frotando” entre líneas de tiempo de transformación de características fijas – impresionante, pero a menudo una experiencia bastante lineal o prescriptiva.

De Mejorando el equilibrio de GAN mediante el aumento de la conciencia espacial: aquí el usuario frota a través de una serie de puntos de transición potenciales entre dos ubicaciones en el espacio latente, pero dentro de los confines de ubicaciones preentrenadas en el espacio latente. Para aplicar otros tipos de transformación basados en el mismo material, es necesario la reconfiguración y/o el entrenamiento. Fuente: https://genforce.github.io/eqgan/
Además de ser receptivo a imágenes de usuario completamente nuevas, el usuario también puede “congelar” manualmente los elementos que desean conservar durante el proceso de transformación. De esta manera, el usuario puede asegurarse de que (por ejemplo) los fondos no cambien o que los ojos se mantengan abiertos o cerrados.
Datos
La red de regresión de atributos se entrenó en tres redes: FFHQ, CelebAMask-HQ, y una red generada por GAN local obtenida mediante la muestra de 400,000 vectores del espacio Z de StyleGAN-V2.
Las imágenes fuera de la distribución (OOD) se filtraron, y los atributos se extrajeron utilizando la Face API de Microsoft, y el conjunto de imágenes resultante se dividió 90/10, lo que dejó 721,218 imágenes de entrenamiento y 72,172 imágenes de prueba para comparar.
Pruebas
Aunque la red experimental se configuró inicialmente para acomodar 35 transformaciones potenciales, se redujeron a ocho para realizar pruebas analógicas contra los marcos comparables InterFaceGAN, GANSpace y StyleFlow.
Los ocho atributos seleccionados fueron Edad, Calvicie, Barba, Expresión, Género, Gafas, Alcance y Inclinación. Fue necesario reconfigurar los marcos competidores para ciertos de los ocho atributos que no estaban provisionados en la distribución original, como agregar calvicie y barba a InterFaceGAN.
Como se esperaba, se produjo un mayor nivel de desacoplamiento en las arquitecturas rivales. Por ejemplo, en una prueba, InterFaceGAN y StyleFlow cambiaron el género del sujeto cuando se les pidió que aplicaran edad:

Dos de los marcos competidores incluyeron un cambio de género en la transformación ‘edad’, también cambiando el color del cabello sin la solicitud directa del usuario.
Además, dos de los rivales encontraron que las gafas y la edad son facetas inseparables:
No es una victoria uniforme para la investigación: como se puede ver en el video acompañante incrustado al final del artículo, el marco es el menos efectivo cuando intenta extrapolar ángulos diversos (inclinación), mientras que GANSpace tiene un mejor resultado general para edad y la imposición de gafas. El marco latente a latente empató con GANSpace y StyleFlow en cuanto a la adición de alcance (ángulo de la cabeza).

Resultados calculados en función de una calibración del detector de rostros MTCNN. Los resultados más bajos son mejores.
Para más detalles y una mejor resolución de los ejemplos, consulte el video acompañante del artículo a continuación.
Publicado por primera vez el 16 de febrero de 2022.














