Ángulo de Anderson

La búsqueda de la belleza por parte de la IA

mm
Añade Unite.AI a tus fuentes preferidas en Google
AI-generated image featuring a woman whose face is being analyzed by a Terminator-style HUD. GPT-1.5.

Un nuevo sistema de evaluación de belleza impulsado por IA califica la atractividad de las caras, mientras se entrena más rápido que los modelos de aprendizaje profundo típicos, lo que podría hacer que la puntuación de belleza automatizada a gran escala sea más práctica.

 

La predicción de belleza facial (FBP) es un negocio grande y un hilo bastante fuerte en la literatura de investigación. Aunque rompe prácticamente todos los principios detrás de combatir los sesgos en la IA y las prácticas de aprendizaje automático, y aunque en muchos sentidos apoya la objetificación y el reduccionismo en las percepciones algorítmicas de las mujeres, sin embargo, atrae el interés de varias industrias de varios miles de millones de dólares, la mayoría de las cuales están dirigidas directamente a las mujeres, como los cosméticos, la cirugía facial cosmética, las transmisiones en vivo y la moda, entre otras:

Mujeres calificadas del 1 al 5, del artículo 'Asian Female Facial Beauty Prediction Using Deep Neural Networks via Transfer Learning and Multi-Channel Feature Fusion'. Fuente - https://www.semanticscholar.org/paper/Asian-Female-Facial-Beauty-Prediction-Using-Deep-Zhai-Huang/59776a6fb0642de5338a3dd9bac112194906bf30

Mujeres calificadas del 1 al 5, del artículo ‘Asian Female Facial Beauty Prediction Using Deep Neural Networks via Transfer Learning and Multi-Channel Feature Fusion’. Fuente

Más allá de estos enclaves empresariales obviamente centrados en las mujeres, la publicidad y varias otras industrias, incluyendo el entretenimiento y la publicación, tienen intereses notables en comprender qué es lo que tanto los hombres como las mujeres consideran ‘atractivo’, necesariamente en una base por cultura.

El hecho de que las percepciones agregadas de belleza varíen en diferentes regiones significa que no se pueden obtener conjuntos de datos definitivos y aplicables a nivel global, y que la nueva investigación debe ser either parroquial o concentrarse en métodos de ‘alto nivel’ que puedan aplicarse en diversas franjas de datos culturales.

Una interfaz para un sistema de evaluación de belleza facial para el proyecto SCUT-FBP de 2015. Fuente - https://arxiv.org/pdf/1511.02459

Una interfaz para un sistema de evaluación de belleza facial para el proyecto SCUT-FBP de 2015. Fuente

A menudo, la ubicación geográfica no es la única restricción, ya que los conjuntos de datos centrados en la atractividad pueden tener dificultades para proporcionar la misma eficacia en diferentes géneros, o pueden haber sido recopilados con una aplicación específica en mente – y esto puede restringir el uso de la colección en otros dominios.

Por ejemplo, en 2025 informé sobre el desarrollo de un conjunto de datos relativamente grande (100,000+ identidades) para evaluar la atractividad en transmisiones en vivo, cuyos estándares de recorte cercano pueden necesitar una adaptación notable para proyectos más amplios, a pesar del enorme esfuerzo detrás de la iniciativa.

Representación facial

Como puede ser evidente a partir de los enlaces y las imágenes anteriores, los organismos de investigación asiáticos a menudo no operan bajo las mismas restricciones culturales que sus homólogos occidentales, que estarían bajo presión para atreverse a publicar una ilustración científica que califique a cinco mujeres occidentales desde la menos hasta la más atractiva, como vemos en el estudio ilustrado anterior estudio.

Puede argumentarse que donde los sistemas de este tipo de origen asiático se han demostrado efectivos en público, sin miedo a la censura local, los intereses occidentales pueden utilizar o adaptar dicha investigación en implementaciones privadas y propietarias. La tarea de ‘calificar a las mujeres’ en ese escenario se representa en un lugar donde se puede perseguir sin crítica.

Ya sea que esto sea común o que los sistemas equivalentes occidentales menos publicitados tienden a desarrollarse lejos de la colaboración de código abierto y de la supervisión pública, es razonable asumir que el objetivo es de interés global, debido al gran número de sectores profesionales que pueden o podrían beneficiarse de evaluaciones precisas de atractividad.

Supervivencia del más apto

Puede parecer que los grandes corpora que se pueden extraer de la web, como Tik Tok, Instagram y YouTube, serían excelentes árbitros de belleza, correlacionando seguidores, likes y tráfico con atractividad, ya que esta es una asociación común y razonable (aunque con algunas excepciones).

De manera similar, las colecciones existentes – como ImageNet y LAION – que presentan actores y modelos que han ‘llegado a la cima’ – generalmente presentan individuos atractivos (aunque a menudo con demasiados puntos de datos de demasiadas personas), lo que permite que los mecanismos culturales más amplios actúen como un proxy para la atractividad.

Sin embargo, esto no tiene en cuenta los cambios en los gustos en lo que la gente considera atractivo con el tiempo (ni siquiera geográficamente). Por lo tanto, nuevamente, se necesitan sistemas de alto nivel y agnósticos de datos, no colecciones individuales y especiosas que fallen para reflejar los gustos cambiantes.

Piel combinada

La última entrada académica para abordar estos desafíos proviene de China, donde se combinan aprendizaje de transferencia y Sistema de Aprendizaje Amplio (BLS) para abordar el comercio tradicional entre precisión y costo computacional.

Las redes neuronales convencionales tienden a lograr resultados fuertes solo con un entrenamiento pesado, mientras que los sistemas más ligeros como BLS se entrenan rápidamente, pero luchan por capturar suficiente detalle. El nuevo trabajo cubre esta brecha utilizando un modelo visual preentrenado para extraer características faciales, que luego se pasan a un sistema BLS para la puntuación, lo que permite que las características se reutilicen en lugar de aprenderse desde cero, manteniendo el entrenamiento eficiente:

Imágenes de muestra del conjunto de datos LSAFBD, que muestra caras femeninas agrupadas por puntuaciones de belleza humanas asignadas del 1 al 5, donde las calificaciones se derivaron de múltiples anotadores y se utilizaron como etiquetas supervisadas para el entrenamiento y la evaluación de los modelos de predicción de belleza facial en variaciones de pose, iluminación y apariencia. Fuente - https://arxiv.org/pdf/2603.16930

Imágenes de muestra del conjunto de datos LSAFBD, que muestra caras femeninas agrupadas por puntuaciones de belleza humanas asignadas del 1 al 5. Las calificaciones se obtuvieron de múltiples anotadores y se utilizaron como etiquetas supervisadas para el entrenamiento y la evaluación de los modelos de predicción de belleza facial en variaciones de pose, iluminación y apariencia. Fuente

La primera de las dos variantes introducidas en el trabajo (E-BLS, véase a continuación), alimenta las características extraídas directamente al sistema ligero, mientras que la segunda, ER-BLS (también véase a continuación), agrega un paso intermedio simple que estandariza y refina esas características antes de la evaluación, lo que ayuda a mejorar la consistencia sin ralentizar el proceso.

Las pruebas realizadas por los autores demuestran, según afirman, que su enfoque es superior a cualquiera de los métodos por separado y a otros métodos competidores.

El nuevo artículo se titula Predicción de belleza facial que combina aprendizaje de transferencia y sistema de aprendizaje amplio, y proviene de seis investigadores de la Universidad Wuyi, Jiangmen.

Método

El mencionado Sistema de Aprendizaje Amplio es una alternativa ligera a las redes neuronales profundas, que salta la pila de múltiples capas, y en su lugar extiende el aprendizaje a través de un conjunto amplio de conexiones más simples, lo que permite que los modelos se entrenen rápidamente – pero generalmente a costa de perder detalles visuales más finos.

La primera de las dos variantes, E-BLS, combina aprendizaje de transferencia basado en EfficientNet con BLS, extrayendo características visuales detalladas de una cara y luego pasándolas a BLS, lo que implica una predicción final que evita la necesidad de entrenar una red neuronal profunda completa desde cero:

Esquema de arquitectura para el modelo E-BLS, que muestra cómo las imágenes faciales de los conjuntos de datos de destino, como SCUT-FBP5500 y LSAFBD, se pasan primero a través de un extractor de características EfficientNet preentrenado, cuyos parámetros se transfieren desde ImageNet y se mantienen fijos, antes de que los mapas de características resultantes se alimenten a un sistema BLS, donde los nodos de características y los nodos de mejora se combinan a través de pesos entrenables para producir la puntuación de belleza facial final.

Esquema de arquitectura para el modelo E-BLS.

EfficientNet, preentrenado en ImageNet-1k, y en gran medida mantenido sin cambios, convierte cada imagen de entrada en un conjunto compacto de valores de características que describen la cara de una manera estructurada, mientras que BLS toma esos valores y los procesa a través de una red de nodos simples y aleatoriamente conectados que transforman y combinan la información, antes de producir la puntuación de atractividad final.

Como BLS no depende de estructuras en capas profundas, E-BLS se puede actualizar agregando más nodos en lugar de volver a entrenar todo el sistema. Esto mantiene el entrenamiento rápido y facilita la mejora del modelo a medida que se introduce nueva información.

La segunda de las dos variantes, ER-BLS, se basa en E-BLS al insertar una etapa de procesamiento adicional entre el extractor de características EfficientNet y BLS, con el objetivo de mejorar cómo se preparan esas características extraídas antes de ser utilizadas para la predicción:

Arquitectura del modelo ER-BLS, donde las imágenes faciales se procesan mediante un extractor de características EfficientNet preentrenado, luego se refinan a través de una capa de conexión que utiliza pooling, normalización y transformación de función de base radial (RBF). La salida se pasa luego al sistema BLS para producir la puntuación de belleza facial final.

Arquitectura del modelo ER-BLS.

En lugar de pasar las características raw de EfficientNet directamente a BLS, ER-BLS primero las pasa a través de una capa de refinamiento que estandariza y reforma los datos, lo que ayuda a reducir el ruido y a hacer que las características sean más consistentes en diferentes imágenes. Este paso está diseñado para mejorar cómo se generaliza el sistema, especialmente cuando las caras varían en iluminación, pose u otras condiciones visuales que pueden introducir inestabilidad en las predicciones.

Las características refinadas se pasan luego al mismo sistema BLS utilizado en E-BLS, donde los nodos de características y los nodos de mejora transforman y combinan la información para producir la puntuación de atractividad final.

Datos y pruebas

Para probar su enfoque, los autores utilizaron el conjunto de datos SCUT-FBP5500, una colección de predicción de belleza facial de la Universidad del Sur de China, que contiene 5,500 imágenes faciales frontales a 350x350px, con diversas razas, géneros y edades:

Imágenes faciales de muestra del conjunto de datos SCUT-FBP5500, calificadas del 1 al 5 en atractividad.

Imágenes faciales de muestra del conjunto de datos SCUT-FBP5500, calificadas del 1 al 5 en atractividad.

Cada imagen se calificó con una puntuación de belleza por 60 voluntarios, en una escala del 1 al 5, que va desde extremadamente poco atractiva (1) hasta extremadamente atractiva (5):

La división de proporciones de imágenes por calificación de belleza.

La división de proporciones de imágenes por calificación de belleza.

La otra base de datos utilizada fue el conjunto de datos de belleza femenina asiática a gran escala (LSAFBD), una colección recopilada por los autores mismos.

Imágenes faciales de muestra del conjunto de datos LSAFBD, calificadas del 1 al 5 en atractividad.

Imágenes faciales de muestra del conjunto de datos LSAFBD, calificadas del 1 al 5 en atractividad.

La colección consta de 80,000 imágenes no etiquetadas a una resolución de 144x144px, con variaciones en pose y fondo, así como en edad. Estas fueron calificadas por 75 voluntarios según los mismos criterios que el conjunto de datos anterior, esta vez en una escala del 0 al 4:

Las divisiones para el conjunto de datos LSAFBD.

Las divisiones para el conjunto de datos LSAFBD.

Cada conjunto de datos se dividió en segmentos de entrenamiento y prueba en una proporción de 8/20, y se utilizó validación cruzada para estabilizar los resultados en diferentes ejecuciones. El componente BLS se configuró a través del número de ventanas de características; el número de nodos por ventana; y el número de nodos de mejora, con Hyperopt utilizado para buscar combinaciones efectivas.

Para establecer una referencia, se entrenó un modelo BLS estándar bajo configuraciones idénticas, después de lo cual se introdujeron una serie de modelos de aprendizaje de transferencia, incluyendo ResNet50, Inception-V3, DenseNet121, InceptionResNetV2, EfficientNetB7, MobileNetV2, NASNet, y Xception – todos inicializados con pesos de ImageNet-1k, y entrenados con sus capas finales desbloqueadas.

El entrenamiento utilizó una tasa de aprendizaje de 0,001 (reducida cuando el progreso se estancaba), y un tamaño de lote de 16, a lo largo de 50 épocas, con regularización y activación lineal rectificada (ReLU) aplicada en todo momento.

El rendimiento se evaluó utilizando precisión y correlación de Pearson, junto con el tiempo total de entrenamiento, con los resultados promediados en cinco ejecuciones.

Los autores informan que la configuración de entrenamiento fue una CPU Intel-i7 de 3,6 GHz y 64GB de RAM en una ‘computadora de escritorio’:

Comparación de rendimiento en SCUT-FBP5500, donde E-BLS y ER-BLS logran una precisión competitiva contra modelos de CNN profundos, incluyendo ResNet50, EfficientNetB7, InceptionV3 y Xception, mientras requieren significativamente menos tiempo de entrenamiento – destacando las ganancias de eficiencia al combinar aprendizaje de transferencia con un Sistema de Aprendizaje Amplio.

Comparación de rendimiento en SCUT-FBP5500, donde E-BLS y ER-BLS logran una precisión competitiva contra modelos de CNN profundos, incluyendo ResNet50, EfficientNetB7, InceptionV3 y Xception, mientras requieren significativamente menos tiempo de entrenamiento – destacando las ganancias de eficiencia al combinar aprendizaje de transferencia con un Sistema de Aprendizaje Amplio.

Los resultados indicaron que E-BLS mejoró la precisión del 65,85% al 73,13%, mientras que ER-BLS alcanzó el 74,69%, superando a todos los modelos comparados. El tiempo de entrenamiento permaneció notablemente más bajo que el de los CNN profundos, en aproximadamente 1.300 segundos, versus varios miles o más de 25.000 segundos.

Para las pruebas en LSAFBD, los resultados mostraron que E-BLS mejoró la precisión sobre el modelo BLS simple, mientras que ER-BLS alcanzó la mayor precisión entre todos los métodos comparados:

Rendimiento en LSAFBD, donde ER-BLS y E-BLS entregan una precisión más alta que todos los modelos de referencia y de aprendizaje de transferencia, mientras requieren solo una fracción de su tiempo de entrenamiento, indicando una ventaja consistente en eficiencia sin sacrificar la calidad predictiva.

Rendimiento en LSAFBD, donde ER-BLS y E-BLS entregan una precisión más alta que todos los modelos de referencia y de aprendizaje de transferencia, mientras requieren solo una fracción de su tiempo de entrenamiento, indicando una ventaja consistente en eficiencia sin sacrificar la calidad predictiva.

Ambas variantes mantuvieron un tiempo de entrenamiento sustancialmente más bajo que los modelos de CNN profundos, lo que indica un equilibrio más eficiente entre rendimiento y costo computacional.

Conclusión

Esta es algo de una publicación de ‘retroceso’, como se evidencia por su uso de favoritos pre-boom como las CNN, y por el equipo de entrenamiento de nivel más bajo que he encontrado en un artículo nuevo en muchos años.

No obstante, se ocupa de un objetivo sorprendentemente resistente en visión por computadora; uno que toca profundamente la experiencia humana y la interpretación subjetiva, y que exige un esquema que trascienda las tendencias estéticas del momento, y que pueda proporcionar una pipeline verdaderamente resistente para la tarea.

 

Publicado por primera vez el jueves 19 de marzo de 2026

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai