Ângulo de Anderson

Disney combina CGI com renderização neural para enfrentar o “Vale da Estranheza”

mm
Adicione Unite.AI às suas fontes preferidas no Google

A divisão de pesquisa em IA da Disney desenvolveu um método híbrido para simulação facial de qualidade cinematográfica, combinando as vantagens do render neural facial com a consistência de uma abordagem baseada em CGI.

O artigo ainda em preparação tem o título Rendering with Style: Combining Traditional and Neural Approaches for High Quality Face Rendering e é apresentado em um novo vídeo de 10 minutos no canal Disney Research do YouTube (incorporado ao final deste artigo*).

Malhas combinadas com renderizações faciais neurais. Fonte: https://www.youtube.com/watch?v=TwpLqTmvqVk

Malhas combinadas com renderizações faciais neurais. Veja a incorporação de vídeo ao final do artigo para mais detalhes e qualidade. Fonte: https://www.youtube.com/watch?v=TwpLqTmvqVk

Como observa o vídeo, o render neural de rostos (incluindo deepfakes) pode gerar olhos e interiores da boca muito mais realistas do que o CGI consegue, enquanto as texturas faciais geradas por CGI são mais consistentes e adequadas para produção de VFX de nível cinematográfico.

Por isso, a Disney está experimentando deixar o gerador neural StyleGan2 da NVIDIA cuidar das características ao redor de um rosto e dos elementos “críticos para a vida”, como os olhos, enquanto sobrepõe pele facial CGI consistente e elementos relacionados ao resultado.

Do vídeo (veja ao final do artigo), o conceito arquitetônico por trás da abordagem híbrida da Disney, onde uma malha CGI tradicional, do tipo usado para recriar a ‘jovem’ Carrie Fisher e o falecido Peter Cushing em Rogue One (2016), é integrada a ambientes faciais renderizados neuralmente.

Do vídeo (veja ao final do artigo), o conceito arquitetônico por trás da abordagem híbrida da Disney, onde uma malha CGI tradicional, do tipo usado para recriar a ‘jovem’ Carrie Fisher e o falecido Peter Cushing em Rogue One (2016), é integrada a ambientes faciais renderizados neuralmente.

O vídeo faz uma referência tácita à crítica frequente sobre a falta de autenticidade e o efeito do ‘vale da estranheza’ da recriação em CGI do falecido ator britânico Star Wars Peter Cushing em Rogue One (2016), reconhecendo:

‘[Ainda] há uma enorme lacuna entre o que as pessoas podem capturar e renderizar facilmente e os doubles digitais fotorrealistas finais, completos com cabelo, olhos e interior da boca. Para fechar essa lacuna, geralmente é necessário muito trabalho manual de artistas qualificados.’

Na realidade, mesmo os sistemas de captura facial mais modernos não tentam recriar olhos, interiores da boca ou cabelo, que apresentam problemas de autenticidade nessas técnicas (olhos) ou de consistência temporal (cabelo).

O vídeo ilustra o que os artistas de VFX receberão após uma sessão típica de captura facial moderna. Olhos, cabelo, pelos faciais e interiores da boca precisarão ser tratados por equipes separadas na cadeia de produção.

O vídeo ilustra o que os artistas de VFX receberão após uma sessão típica de captura facial moderna. Olhos, cabelo, pelos faciais e interiores da boca precisarão ser tratados por equipes separadas na cadeia de produção.

Controle de Iluminação

A abordagem híbrida também traz benefício no relighting – um desafio notável para o render neural de rostos, já que as superposições de pele CGI podem ser reluzidas com mais facilidade.

Uma versão animada da abordagem CGI/Neural.

Uma versão animada da abordagem CGI/Neural.

Em ambientes mais desafiadores, como gravações externas, os pesquisadores desenvolveram um método de preenchimento ao redor de uma espécie de zona desmilitarizada que circunda a pessoa que está sendo ‘criada’.

Uma margem preta é gerada para permitir uma ‘tela’ para o preenchimento das partes externas da identidade e integrar a pele CGI na saída combinada CGI/neural.

Uma margem preta é gerada para permitir uma ‘tela’ para o preenchimento das partes externas da identidade e integrar a pele CGI na saída combinada CGI/neural.

O vídeo observa:

‘[O] render neural não corresponde perfeitamente à restrição de fundo. – ele serve apenas como guia, já que otimizar componentes humanos realistas como cabelo, olhos e dentes é o objetivo principal. Mais desafiador é tentar manter uma identidade consistente, enquanto se altera a iluminação do ambiente.’

Criando Malhas CGI a partir de Renderizações Neurais

A equipe de pesquisa também desenvolveu um autoencoder variacional treinado em um (não especificado) grande banco de dados de imagens faciais 3D, e afirma que ele pode gerar malhas faciais 3D ‘aleatórias, porém plausíveis’ a partir de dados de verdade-terra.

Existem limitações que essa pesquisa precisa superar, incluindo a dificuldade de manter o cabelo temporalmente consistente nas renderizações neurais, e o vídeo (veja abaixo) mostra vários exemplos de cabelo que muda rapidamente em um panorama, de outra forma consistente, ao redor de um rosto CGI/neural.

A consistência temporal na renderização de vídeo neural é um problema muito mais amplo do que apenas o da Disney, e parece provável que iterações posteriores desse sistema recorram a adicionar cabelo ‘na pós-produção’, ou a diversas outras abordagens possíveis para geração de cabelo, em vez de esperar que uma nova técnica neural resolva isso.

Usos para Geração de Conjuntos de Dados

O método também é proposto como uma forma potencial de gerar dados sintéticos e enriquecer o panorama de conjuntos de imagens faciais, que nos últimos anos se tornou perigosamente monótono.

A Disney imagina a nova técnica preenchendo conjuntos de imagens faciais.

A Disney imagina a nova técnica preenchendo conjuntos de imagens faciais.

‘[Cada] resultado fotorrealista que geramos tem uma geometria subjacente correspondente e mapas de aparência, renderizados a partir de pontos de vista de câmera desconhecidos com iluminação conhecida. Essa informação de ‘verdade-terra’ pode ser vital para treinar aplicações subsequentes, como reconstrução facial 3D monocular, reconhecimento facial ou compreensão de cena. Assim, cada render de resultado pode ser considerado uma amostra de dados, e podemos gerar muitas variações de muitos indivíduos diferentes.’

‘Além disso, mesmo para uma única pessoa renderizada em uma única expressão, com um único ponto de vista e iluminação, podemos gerar variações aleatórias do render fotorrealista variando a semente de randomização durante a otimização.’

Os pesquisadores observam que essa diversidade de saída configurável pode ser útil no treinamento de aplicações de reconhecimento facial, concluindo:

‘[Nosso] método consegue aproveitar a tecnologia atual de captura, modelagem e renderização de pele facial, e criar automaticamente renders faciais fotorrealistas completos que correspondem à identidade, expressão e configuração de cena desejadas. Essa abordagem tem aplicações em renderização facial para cinema e entretenimento, economizando trabalho manual de artistas, e também para geração de dados em diferentes áreas de deep learning.’

Para uma análise mais aprofundada da nova abordagem, confira o vídeo de 10 minutos lançado hoje:

https://www.unite.ai/wp-content/uploads/2021/11/dataset-generation.jpg

 * O link do vídeo original foi substituído por outro aparentemente idêntico 8 horas após a publicação deste artigo. Eu alterei todos os links relevantes, pois não há vestígios do vídeo original.

 

8:24 GMT+2 – Vídeo substituído, pois foi trocado pelo canal Disney Research do YouTube por algum motivo.

Escritor em aprendizado de máquina, especialista em síntese de imagens humanas. Ex‑chefe de conteúdo de pesquisa na Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Website: martinanderson.ai
Contato: martin@martinanderson.ai