Ángulo de Anderson

Un sistema de inteligencia artificial que puede hacer que las imágenes de las personas sean más ‘hermosas’

mm
Añade Unite.AI a tus fuentes preferidas en Google
Background image: DALL-E 2 'Award-winning 8K photo of the most beautiful Caucasian catwalk model in the world' - https://labs.openai.com/s/kRXusxOR5GcYyb6pqZjNH2AA

Investigadores de China han desarrollado un nuevo sistema de mejora de imágenes basado en inteligencia artificial que es capaz de hacer que las imágenes de una persona sean más ‘hermosas’, basado en un enfoque novedoso de aprendizaje por refuerzo.

El nuevo enfoque utiliza una 'red de predicción de belleza facial' para iterar a través de variaciones en una imagen basada en una serie de factores, entre los que 'la iluminación' y las posiciones de los ojos pueden ser factores críticos. Aquí, las fuentes originales (a la izquierda de cada columna) son del sistema EigenGAN, con los nuevos resultados a la derecha de estos. Fuente: https://arxiv.org/pdf/2208.04517.pdf

El nuevo enfoque utiliza una ‘red de predicción de belleza facial’ para iterar a través de variaciones en una imagen basada en una serie de factores, entre los que ‘la iluminación’ y las posiciones de los ojos pueden ser factores críticos. Aquí, las fuentes originales (a la izquierda de cada columna) son del sistema EigenGAN, con los nuevos resultados a la derecha de estos. Fuente: https://arxiv.org/pdf/2208.04517.pdf

La técnica se basa en innovaciones descubiertas para el generador EigenGAN, otro proyecto chino, de 2021, que hizo avances notables en la identificación y el control de los diversos atributos semánticos dentro del espacio latente de las Redes Adversarias Generativas (GANs).

El generador EigenGAN de 2021 fue capaz de individuar conceptos de alto nivel como 'color de cabello' dentro del espacio latente de una red adversaria generativa. El nuevo trabajo se basa en este instrumento innovador para entregar un sistema que puede 'embellecer' las imágenes de origen, pero sin cambiar la identidad reconocible – un problema en los enfoques anteriores. Fuente: https://arxiv.org/pdf/2104.12476.pdf

El generador EigenGAN de 2021 fue capaz de individuar conceptos de alto nivel como ‘color de cabello’ dentro del espacio latente de una red adversaria generativa. El nuevo trabajo se basa en este instrumento innovador para entregar un sistema que puede ’embellecer’ las imágenes de origen, pero sin cambiar la identidad reconocible – un problema en los enfoques anteriores. Fuente: https://arxiv.org/pdf/2104.12476.pdf

El sistema utiliza una ‘red de puntuación estética’ derivada de SCUT-FBP5500 (SCUT), un conjunto de datos de referencia de 2018 para la predicción de belleza facial, de la Universidad de Tecnología de China del Sur en Guangzhou.

Del artículo de 2018 'SCUT-FBP5500: Un conjunto de datos de referencia diverso para la predicción de belleza facial multi-paradigmática', que ofreció una 'red de predicción de belleza facial' (FBP) capaz de clasificar caras en términos de atractivo percibido, pero que no podía transformar o 'mejorar' las caras. Fuente: https://arxiv.org/pdf/1801.06345.pdf

Del artículo de 2018 ‘SCUT-FBP5500: Un conjunto de datos de referencia diverso para la predicción de belleza facial multi-paradigmática’, que ofreció una ‘red de predicción de belleza facial’ (FBP) capaz de clasificar caras en términos de atractivo percibido, pero que no podía transformar o ‘mejorar’ las caras. Fuente: https://arxiv.org/pdf/1801.06345.pdf

A diferencia del nuevo trabajo, el proyecto de 2018 no puede ejecutar transformaciones, pero contiene juicios de valor algorítmicos para 5.500 caras, proporcionados por 60 etiquetadores de género mixto (una división 50/50). Estos se han incorporado al nuevo sistema como un discriminador efectivo, para informar transformaciones que probablemente mejoren el ‘atractivo’ de una imagen.

Es interesante que el nuevo artículo se titule Generación de caras hermosas caucásicas controladas por atributos mediante aprendizaje por refuerzo guiado por estética. La razón por la que todas las razas excepto la caucásica están excluidas del sistema (considerando también que los investigadores mismos son chinos) es porque los datos de origen para SCUT se inclinan notablemente hacia fuentes asiáticas (4.000 asiáticos divididos uniformemente entre hombres y mujeres, 1.500 caucásicos divididos uniformemente entre hombres y mujeres), lo que hace que la ‘persona promedio’ en ese conjunto de datos tenga cabello y ojos marrones.

Por lo tanto, para acomodar la variación de color al menos dentro de una raza, fue necesario excluir el componente asiático de los datos originales, o ir al gasto considerable de reconstruir los datos para desarrollar un método que podría no haber funcionado. Además, la variación en las percepciones culturales de la belleza inevitablemente significa que tales sistemas necesitarán algún grado de configurabilidad geográfica en cuanto a lo que constituye ‘atractivo’.

Atributos pertinentes

Para determinar los factores principales que contribuyen a una foto ‘atractiva’ de una persona, los investigadores también probaron el efecto de varios cambios en las imágenes, en términos de cómo tales mejoras aumentaron la percepción algorítmica de ‘belleza’. Descubrieron que al menos uno de los aspectos es más central para la buena fotografía que para la buena genética:

Además de la iluminación, los aspectos que tuvieron el mayor impacto en la puntuación de belleza fueron los flequillos (que, en el caso de los hombres, pueden ser equivalentes a tener todo el cabello), la postura del cuerpo y la disposición de los ojos (donde el compromiso con el punto de vista de la cámara es un estímulo para el atractivo).

(En cuanto al ‘color de lápiz de labios’, el nuevo sistema, que puede funcionar efectivamente en presentaciones de género masculino y femenino, no individúa la apariencia de género, sino que confía en el sistema de discriminador novedoso como un ‘filtro’ en este respecto)

Método

La función de recompensa en el mecanismo de aprendizaje por refuerzo en el nuevo sistema está impulsada por una regresión simple sobre los datos SCUT, que produce predicciones de belleza facial.

El sistema de entrenamiento itera sobre las imágenes de entrada de datos (en la parte inferior izquierda del esquema a continuación). Inicialmente, un modelo ResNet18 preentrenado (entrenado en ImageNet) extrae características de las cinco imágenes idénticas (‘y’). A continuación, una acción transformadora potencial se deriva del estado oculto de una capa completamente conectada (GRUCell, en la imagen a continuación), y las transformaciones se aplican, lo que conduce a cinco imágenes alteradas que se alimentan en la red de puntuación estética, cuyas clasificaciones, al estilo de Darwin, determinarán qué variaciones se desarrollarán y cuáles se descartarán.

Una ilustración general del flujo de trabajo para el nuevo sistema.

Una ilustración del flujo de trabajo para el nuevo sistema.

La red de puntuación estética utiliza un módulo de atención de canal eficiente (ECA), mientras que una adaptación de una instancia preentrenada de EfficientNet-B4 se encarga de extraer 1.792 características de cada imagen.

Después de la normalización a través de una función de activación ReLU, se obtiene un vector de cuatro dimensiones de regreso del módulo ECA, que se aplana a un vector unidimensional después de la activación y promediación adaptativa. Finalmente, los resultados se alimentan en la red de regresión, que recupera una puntuación estética.

Una comparación cualitativa de la salida del sistema. En la fila inferior, vemos la suma agregada de todos los aspectos individuados que han sido identificados por el método EigenGAN y posteriormente mejorados. Las puntuaciones FID promedio para las imágenes están a la izquierda de las filas de imágenes (más alto es mejor).

Una comparación cualitativa de la salida del sistema. En la fila inferior, vemos la suma agregada de todos los aspectos individuados que han sido identificados por el método EigenGAN y posteriormente mejorados. Las puntuaciones FID promedio para las imágenes están a la izquierda de las filas de imágenes (más alto es mejor).

Pruebas y estudio de usuario

Se evaluaron cinco variantes del método propuesto algorítmicamente (ver imagen a continuación), con puntuaciones de distancia de Fréchet (FID, controvertidas en algunos cuarteles) asignadas a un total de 1.000 imágenes que pasaron por el sistema.

Los investigadores señalan que mejorar la iluminación logró una mejor puntuación de atractivo para los sujetos en las fotos que varios otros cambios ‘obvios’ posibles (es decir, al aspecto real de la persona representada).

Hasta cierto punto, probar el sistema de esta manera está limitado por las excentricidades de los datos SCUT, que no tienen muchas ‘sonrisas brillantes’, y los autores argumentan que esto podría sobrevalorar excesivamente el aspecto ‘enigmático’ más típico en los datos, en comparación con las preferencias probables de los usuarios finales objetivo (presumiblemente, en este caso, un mercado occidental).

No obstante, desde que todo el sistema se basa en las opiniones promedio de solo 60 personas (en el artículo EigenGAN), y desde que la calidad que se estudia está lejos de ser empírica, se podría argumentar que el procedimiento es más sólido que el conjunto de datos.

Aunque se trata muy brevemente en el artículo, las imágenes del EigenGAN y las cinco variantes del sistema se mostraron en un estudio de usuario limitado (ocho participantes), que se les pidió que seleccionaran la ‘mejor imagen’ (se evitó la palabra ‘atractiva’).

Arriba, la interfaz de usuario presentada al pequeño grupo de estudio; abajo, los resultados.

Arriba, la interfaz de usuario presentada al pequeño grupo de estudio; abajo, los resultados.

Los resultados indican que la salida del nuevo sistema logró la tasa de selección más alta entre los participantes (‘MAES’ en la imagen de arriba).

La búsqueda (inútil?) de la belleza

La utilidad de tal sistema es difícil de establecer, a pesar de lo que parece ser un lugar notable de esfuerzo de efecto en China hacia estos objetivos. Ninguno se describe en la nueva publicación.

El artículo EigenGAN anterior sugiere* que un sistema de reconocimiento de belleza podría usarse en sistemas de recomendación de maquillaje facial, cirugía estética, embellecimiento de la cara, o recuperación de imágenes basada en contenido.

Presumiblemente, tal enfoque también podría usarse en sitios de citas, por parte de los usuarios, para ‘mejorar’ sus propias fotos de perfil en una ‘foto afortunada’, como alternativa a usar fotos antiguas, o fotos de otras personas.

Asimismo, los sitios de citas también podrían ‘puntuar’ a sus clientes para crear calificaciones y incluso niveles de acceso restringido, aunque esto presumiblemente solo funcionaría a través de una captura de autenticación de vivo, en lugar de fotos presentadas (que también podrían ser ‘mejoradas’ por los clientes, si el enfoque se volviera popular).

En publicidad, un método algorítmico para evaluar la belleza (una tecnología predicha por el fallecido autor de ciencia ficción Michael Crichton en su película de 1982 Looker) podría usarse para seleccionar la salida creativa no mejorada más probable de atraer a una audiencia objetivo, mientras que la capacidad de maximizar realmente el impacto estético de las imágenes de caras, sin sobrescribirlos al estilo de los deepfakes, podría mejorar las imágenes ya efectivas destinadas a atraer el interés público.

El nuevo trabajo está respaldado por la Fundación Nacional de Ciencias Naturales de China, el Proyecto de Fondos Abiertos del Laboratorio Estatal de Gestión y Control de Sistemas Complejos, y el Proyecto de Investigación de Filosofía y Ciencias Sociales del Ministerio de Educación de China, entre otros patrocinadores.

 

* Muchas de las recomendaciones del artículo EigenGAN apuntan hacia un libro comercialmente disponible de 2016 titulado ‘Modelos informáticos para el análisis de la belleza facial’, en lugar de recursos académicos.

Publicado por primera vez el 11 de agosto de 2022.

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai