Ângulo de Anderson

Estimativa de Atração Facial para Transmissões ao Vivo

mm
Adicione Unite.AI às suas fontes preferidas no Google
Image by ChatGPT, with superimposed image from the paper https://arxiv.org/pdf/2501.02509

Até o momento, a Previsão de Atração Facial (FAP) tem sido estudada principalmente no contexto de pesquisas psicológicas, na indústria de beleza e cosméticos e no contexto de cirurgia plástica. É um campo de estudo desafiador, pois os padrões de beleza tendem a ser nacionais em vez de globais.

Isso significa que nenhum conjunto de dados baseado em IA é viável, pois as médias obtidas por amostragem de faces/avaliações de todas as culturas seriam muito tendenciosas (onde as nações mais populosas ganhariam tração adicional), ou aplicáveis a nenhuma cultura (onde a média das múltiplas raças/avaliações equivaleria a nenhuma raça real).

Em vez disso, o desafio é desenvolver metodologias conceituais e fluxos de trabalho nos quais os dados específicos de país ou cultura possam ser processados, para permitir o desenvolvimento de modelos de FAP eficazes por região.

Os casos de uso da FAP em pesquisas de beleza e psicologia são bastante marginais, ou específicos da indústria; portanto, a maioria dos conjuntos de dados curados até o momento contém apenas dados limitados, ou não foram publicados.

A disponibilidade fácil de previsores de atração online, principalmente direcionados a públicos ocidentais, não necessariamente representam o estado da arte em FAP, que parece ser atualmente dominado por pesquisas da Ásia Oriental (primariamente China), e conjuntos de dados da Ásia Oriental.

Exemplos de conjuntos de dados da Ásia Oriental para FAP.

Exemplos de conjuntos de dados da Ásia Oriental para FAP. Fonte: https://www.semanticscholar.org/paper/Asian-Female-Facial-Beauty-Prediction-Using-Deep-Zhai-Huang/59776a6fb0642de5338a3dd9bac112194906bf30

Usos comerciais mais amplos para a estimativa de beleza incluem aplicativos de namoro online e sistemas de IA generativos projetados para “retocar” imagens reais de pessoas (já que tais aplicações exigem um padrão quantificado de beleza como métrica de eficácia).

Desenhando Rostos

Indivíduos atraentes continuam a ser um ativo valioso na publicidade e na construção de influência, tornando os incentivos financeiros nesses setores uma clara oportunidade para avançar nos conjuntos de dados e frameworks de FAP de ponta.

Por exemplo, um modelo de IA treinado com dados do mundo real para avaliar e classificar a beleza facial poderia potencialmente identificar eventos ou indivíduos com alto potencial de impacto publicitário. Essa capacidade seria especialmente relevante em contextos de transmissão de vídeo ao vivo, onde métricas como “seguidores” e “curtidas” atualmente servem apenas como indicadores implícitos da capacidade de um indivíduo (ou mesmo de um tipo facial) de capturar uma audiência.

Isso é uma métrica superficial, é claro, e a voz, a apresentação e o ponto de vista também desempenham um papel significativo na reunião da audiência. Portanto, a curadoria dos conjuntos de dados de FAP exige supervisão humana, bem como a capacidade de distinguir atração facial de “atração espúria” (sem a qual, influenciadores fora do domínio, como Alex Jones, poderiam acabar afetando a curva média de FAP para uma coleção projetada apenas para estimar a beleza facial).

LiveBeauty

Para abordar a escassez de conjuntos de dados de FAP, pesquisadores da China estão oferecendo o primeiro conjunto de dados de FAP em larga escala, contendo 100.000 imagens de faces, juntamente com 200.000 anotações humanas que estimam a beleza facial.

Amostras do novo conjunto de dados LiveBeauty.

Amostras do novo conjunto de dados LiveBeauty. Fonte: https://arxiv.org/pdf/2501.02509

Intitulado LiveBeauty, o conjunto de dados apresenta 10.000 identidades diferentes, todas capturadas de (não especificadas) plataformas de transmissão ao vivo em março de 2024.

Os autores também apresentam o FPEM, um método de FAP multi-modal novo. O FPEM integra conhecimento facial holístico e recursos estéticos multi-modais via um Módulo de Prioridade de Atração Personalizada (PAPM), um Módulo de Codificador de Atração Multi-Modal (MAEM) e um Módulo de Fusão de Modalidades Cruzadas (CMFM).

O artigo afirma que o FPEM alcança um desempenho de ponta no novo conjunto de dados LiveBeauty e em outros conjuntos de dados de FAP. Os autores observam que a pesquisa tem aplicações potenciais para melhorar a qualidade de vídeo, recomendação de conteúdo e retoque facial em transmissões ao vivo.

Os autores também prometem tornar o conjunto de dados disponível “em breve” – embora deva ser admitido que quaisquer restrições de licenciamento inerentes ao domínio de origem parecem prováveis de serem transmitidas para a maioria dos projetos aplicáveis que possam utilizar o trabalho.

O novo artigo é intitulado Previsão de Atração Facial em Transmissões ao Vivo: Um Novo Padrão e Método Multi-Modal e vem de dez pesquisadores da Alibaba Group e da Universidade Jiao Tong de Xangai.

Método e Dados

A partir de cada transmissão de 10 horas das plataformas de transmissão ao vivo, os pesquisadores coletaram uma imagem por hora para as primeiras três horas. As transmissões com as visualizações de página mais altas foram selecionadas.

Os dados coletados foram então submetidos a várias etapas de pré-processamento. A primeira delas é medição do tamanho da região facial, que usa o modelo de detecção de faces baseado em CPU de 2018 FaceBoxes para gerar uma caixa delimitadora em torno dos lineamentos faciais. O pipeline garante que o lado mais curto da caixa delimitadora exceda 90 pixels, evitando regiões faciais pequenas ou não claras.

A segunda etapa é detecção de borramento, que é aplicada à região facial usando a variância do operador Laplaciano no canal de altura (Y) da crop facial. Essa variância deve ser maior que 10, o que ajuda a filtrar imagens borrosas.

A terceira etapa é estimativa da pose facial, que usa o modelo de estimativa de pose de 2021 3DDFA-V2:

Exemplos do modelo de estimativa 3DDFA-V2.

Exemplos do modelo de estimativa 3DDFA-V2. Fonte: https://arxiv.org/pdf/2009.09960

Aqui, o fluxo de trabalho garante que o ângulo de inclinação da face recortada não seja maior que 20 graus, e o ângulo de guinada não seja maior que 15 graus, o que exclui faces com poses extremas.

A quarta etapa é avaliação da proporção facial, que também usa as capacidades de segmentação do modelo 3DDFA-V2, garantindo que a região facial recortada seja maior que 60% da imagem, excluindo imagens em que a face não é proeminente. i.e., pequena na imagem geral.

Finalmente, a quinta etapa é remoção de caracteres duplicados, que usa um modelo de reconhecimento facial de ponta (não atribuído) para casos em que a mesma identidade aparece em mais de uma das três imagens coletadas para um vídeo de 10 horas.

Avaliação Humana e Anotação

Vinte anotadores foram recrutados, consistindo em seis homens e 14 mulheres, refletindo as demografias da plataforma de transmissão ao vivo utilizada*. As faces foram exibidas na tela de 6,7 polegadas de um iPhone 14 Pro Max, em condições de laboratório consistentes.

A avaliação foi dividida em 200 sessões, cada uma das quais empregou 50 imagens. Os sujeitos foram solicitados a avaliar a atração facial das amostras em uma escala de 1 a 5, com um intervalo de cinco minutos entre cada sessão, e todos os sujeitos participaram de todas as sessões.

Portanto, a totalidade das 10.000 imagens foi avaliada por vinte sujeitos humanos, resultando em 200.000 anotações.

Análise e Pré-Processamento

Primeiramente, foi realizada uma pós-avaliação dos sujeitos usando a razão de outliers e Coeficiente de Correlação de Postos de Spearman (SROCC). Os sujeitos cujas avaliações tinham um SROCC menor que 0,75 ou uma razão de outliers maior que 2% foram considerados não confiáveis e foram removidos, com 20 sujeitos finalmente obtidos..

Em seguida, foi computada uma Pontuação de Opinião Média (MOS) para cada imagem facial, calculando a média das avaliações obtidas pelos sujeitos válidos. A MOS serve como o rótulo de atração verdadeiro para cada imagem, e a pontuação é calculada pela média de todas as avaliações individuais de cada sujeito válido.

Finalmente, a análise das distribuições de MOS para todas as amostras, bem como para as amostras femininas e masculinas, indicou que elas exibiam uma forma de estilo gaussiano, que é consistente com as distribuições de atração facial do mundo real:

Exemplos de distribuições de MOS do LiveBeauty.

Exemplos de distribuições de MOS do LiveBeauty.

A maioria dos indivíduos tende a ter uma atração facial média, com menos indivíduos nos extremos de muito baixa ou muito alta atração.

Além disso, a análise dos valores de sesgo e curtose mostrou que as distribuições eram caracterizadas por caudas finas e concentradas em torno da pontuação média, e que a alta atração era mais prevalente entre as amostras femininas nos vídeos de transmissão ao vivo coletados.

Arquitetura

Uma estratégia de treinamento em duas etapas foi utilizada para o modelo de FAP multi-modal melhorado (FPEM) e a Fase de Fusão Híbrida no LiveBeauty, dividida em quatro módulos: um Módulo de Prioridade de Atração Personalizada (PAPM), um Módulo de Codificador de Atração Multi-Modal (MAEM), um Módulo de Fusão de Modalidades Cruzadas (CMFM) e um Módulo de Fusão de Decisão (DFM).

Esquema conceitual para o pipeline de treinamento do LiveBeauty.

Esquema conceitual para o pipeline de treinamento do LiveBeauty.

O módulo PAPM recebe uma imagem como entrada e extrai recursos visuais multi-escala usando um Swin Transformer, e também extrai recursos faciais conscientes usando um modelo FaceNet pré-treinado. Esses recursos são então combinados usando um bloco de atenção cruzada para criar um recurso de “atração” personalizado.

Também na Fase de Treinamento Preliminar, o MAEM usa uma imagem e descrições de texto de atração, aproveitando CLIP para extrair recursos estéticos semióticos multi-modais.

As descrições de texto são na forma de ‘uma foto de uma pessoa com {a} atração’ (onde {a} pode ser ruim, pobre, justa, boa ou perfeita). O processo estima a semelhança coseno entre as incorporações textuais e visuais para chegar a uma probabilidade de nível de atração.

Na Fase de Fusão Híbrida, o CMFM refina as incorporações textuais usando o recurso de atração personalizado gerado pelo PAPM, gerando assim incorporações textuais personalizadas. Em seguida, usa uma estratégia de regressão de semelhança para fazer uma previsão.

Finalmente, o DFM combina as previsões individuais do PAPM, MAEM e CMFM para produzir uma única pontuação de atração final, com o objetivo de alcançar um consenso sólido

Funções de Perda

Para métricas de perda, o PAPM é treinado usando uma perda L1, uma medida da diferença absoluta entre a pontuação de atração prevista e a pontuação de atração real (verdadeira).

O módulo MAEM usa uma função de perda mais complexa que combina uma perda de pontuação (LS) com uma perda de classificação combinada (LR). A perda de classificação (LR) compreende uma perda de fidelidade (LR1) e uma perda de classificação bidirecional (LR2).

LR1 compara a atração relativa de pares de imagens, enquanto LR2 garante que a distribuição de probabilidade prevista de níveis de atração tenha um pico único e diminua em ambas as direções. Essa abordagem combinada visa otimizar tanto a pontuação precisa quanto a classificação correta de imagens com base na atração.

O CMFM e o DFM são treinados usando uma perda L1 simples.

Testes

Nos testes, os pesquisadores compararam o LiveBeauty com nove abordagens anteriores: ComboNet; 2D-FAP; REX-INCEP; CNN-ER (apresentado em REX-INCEP); MEBeauty; AVA-MLSP; TANet; Dele-Trans; e EAT.

Métodos de avaliação de estética de imagem (IAA) que seguem um protocolo de avaliação estética de imagem (IAA) também foram testados. Esses incluíam ViT-B; ResNeXt-50; e Inception-V3.

Além do LiveBeauty, os outros conjuntos de dados testados foram SCUT-FBP5000 e MEBeauty. Abaixo, as distribuições de MOS desses conjuntos de dados são comparadas:

Distribuições de MOS dos conjuntos de dados de referência.

Distribuições de MOS dos conjuntos de dados de referência.

Respectivamente, esses conjuntos de dados convidados foram divididos 60%-40% e 80%-20% para treinamento e teste, separadamente, para manter a consistência com seus protocolos originais. O LiveBeauty foi dividido em uma base de 90%-10%.

Para a inicialização do modelo no MAEM, VT-B/16 e GPT-2 foram usados como os codificadores de imagem e texto, respectivamente, inicializados por configurações do CLIP. Para o PAPM, Swin-T foi usado como um codificador de imagem treinável, de acordo com SwinFace.

O otimizador AdamW foi usado, e um agendador de taxa de aprendizado foi definido com aquecimento linear sob um esquema de anulação cosseno. As taxas de aprendizado diferiram ao longo das fases de treinamento, mas cada uma teve um tamanho de lote de 32, por 50 épocas.

Resultados dos testes

Resultados dos testes

Os resultados dos testes nos três conjuntos de dados de FAP são mostrados acima. Desses resultados, o artigo afirma:

‘Nosso método proposto alcança o primeiro lugar e supera o segundo lugar por cerca de 0,012, 0,081, 0,021 em termos de valores de SROCC nos conjuntos de dados LiveBeauty, MEBeauty e SCUT-FBP5500, respectivamente, o que demonstra a superioridade do nosso método proposto.

‘Os métodos IAA são inferiores aos métodos FAP, o que manifesta que os métodos de avaliação estética genérica ignoram os recursos faciais envolvidos na natureza subjetiva da atração facial, levando a um desempenho ruim nas tarefas FAP.’

‘O desempenho de todos os métodos cai significativamente no MEBeauty. Isso ocorre porque as amostras de treinamento são limitadas e os rostos são etnicamente diversos no MEBeauty, indicando que há uma grande diversidade na atração facial.

‘Todos esses fatores tornam a previsão da atração facial no MEBeauty mais desafiadora.’

Considerações Éticas

Pesquisas sobre atração são uma empreitada potencialmente divisiva, pois ao estabelecer supostos padrões empíricos de beleza, tais sistemas tenderão a reforçar vieses em torno de idade, raça e muitas outras seções de pesquisa de visão computacional relacionadas a humanos.

Pode-se argumentar que um sistema de FAP é intrinsicamente propenso a reforçar e perpetuar perspectivas parciais e tendenciosas sobre atração. Esses julgamentos podem surgir de anotações lideradas por humanos – frequentemente realizadas em escalas muito limitadas para generalização de domínio eficaz – ou de análise de padrões de atenção em ambientes online, como plataformas de transmissão, que são, arguivelmente, longe de serem meritocráticos.

 

* O artigo se refere ao domínio de origem não nomeado em ambos, singular e plural.

Publicado pela primeira vez na quarta-feira, 8 de janeiro de 2025

Escritor em aprendizado de máquina, especialista em síntese de imagem humana. Antigo chefe de conteúdo de pesquisa da Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: martin@martinanderson.ai