Ângulo de Anderson

NeRF: Colaboração entre Facebook e Universidade Desenvolve Síntese de Vídeo Estático/Dinâmico Misto

mm
Adicione Unite.AI às suas fontes preferidas no Google

Uma colaboração entre o Instituto Politécnico e Universidade Estadual da Virgínia e o Facebook resolveu um dos principais desafios na síntese de vídeo NeRF: misturar livremente imagens e vídeos estáticos e dinâmicos em Campos de Radiância Neural (NeRF) de saída.

O sistema pode gerar cenas navegáveis que apresentam elementos de vídeo dinâmicos e ambientes estáticos, cada um gravado em locais, mas separados em facetas controláveis de um ambiente virtual:

Além disso, ele alcança isso a partir de um único ponto de vista, sem a necessidade do tipo de matriz de câmeras que pode vincular iniciativas como esta a um ambiente de estúdio.

O artigo, intitulado Síntese de Visão Dinâmica a Partir de Vídeo Monocular Dinâmico, não é o primeiro a desenvolver um fluxo de trabalho NeRF monocular, mas parece ser o primeiro a treinar simultaneamente um modelo de tempo variável e um modelo de tempo estático a partir da mesma entrada, e a gerar um quadro que permite que o vídeo em movimento exista dentro de um local NeRF ‘pré-mapeado’, semelhante ao tipo de ambientes virtuais que frequentemente encapsulam atores em produções de SF de alto orçamento.

Além do D-NeRF

Os pesquisadores tiveram que basicamente recriar a versatilidade do NeRF Dinâmico (D-NeRF) com apenas um ponto de vista, e não a multiplicidade de câmeras que o D-NeRF usa. Para resolver isso, eles previram o fluxo de cena para frente e para trás e usaram essas informações para desenvolver um campo de radiância distorcido que é temporalmente consistente.

Com apenas um ponto de vista, foi necessário usar análise de fluxo óptico 2D para obter pontos 3D em quadros de referência. O ponto 3D calculado é então alimentado de volta na câmera virtual para estabelecer um ‘fluxo de cena’ que combina o fluxo óptico calculado com o fluxo óptico estimado.

No momento do treinamento, os elementos dinâmicos e estáticos são reconciliados em um modelo completo como facetas separadamente acessíveis.

Ao incluir um cálculo de perda de ordem de profundidade, o modelo e aplicando uma regularização rigorosa da previsão do fluxo de cena no D-NeRF, o problema do blur de movimento é muito mitigado.

Embora a pesquisa tenha muito a oferecer em termos de regularização do cálculo NeRF, e melhore significativamente a destreza e a facilidade de exploração para a saída de um único ponto de vista, de pelo menos igual nota é a separação e reintegração novas dos elementos NeRF dinâmicos e estáticos.

Dependendo de uma câmera única, tal sistema não pode replicar a visão panóptica de configurações de matriz de câmeras NeRF, mas pode ir a qualquer lugar, e sem um caminhão.

NeRF – Estático ou Vídeo?

Recentemente, olhamos para algumas pesquisas impressionantes de NeRF da China que conseguem separar elementos em uma cena NeRF dinâmica capturada com 16 câmeras.

ST-NeRF

ST-NeRF (acima) permite que o visualizador reposicione elementos individuais em uma cena capturada, e até mesmo redimensioná-los, alterar sua taxa de reprodução, congelá-los ou executá-los em reverso. Além disso, o ST-NeRF permite que o usuário ‘role’ por qualquer parte do arco de 180 graus capturado pelas 16 câmeras.

No entanto, os pesquisadores do artigo ST-NeRF concedem em conclusão que o tempo sempre está funcionando em alguma direção sob este sistema, e que é difícil alterar a iluminação e aplicar efeitos a ambientes que são realmente vídeo, em vez de ambientes NeRF ‘estaticamente mapeados’ que em si não contêm componentes móveis e não precisam ser capturados como vídeo.

Ambientes NeRF Estáticos Altamente Editáveis

Uma cena NeRF estática, agora isolada de qualquer segmento de vídeo em movimento, é mais fácil de tratar e aumentar de várias maneiras, incluindo a reiluminação, como proposto anteriormente este ano por NeRV (Campos de Reflexão e Visibilidade Neural para Reiluminação e Síntese de Visão), que oferece um passo inicial para alterar a iluminação e/ou a textura de um ambiente ou objeto NeRF:

Reiluminação de um objeto NeRF com NeRV. Fonte: https://www.youtube.com/watch?v=4XyDdvhhjVo

Reiluminação de um objeto NeRF com NeRV. Fonte: https://www.youtube.com/watch?v=4XyDdvhhjVo

Retexturização em NeRV, incluindo efeitos especulares fotorealistas. Como a base do array de imagens é estática, é mais fácil processar e aumentar uma faceta NeRF desta forma do que abranger o efeito em uma faixa de quadros de vídeo, tornando o pré-processamento inicial e o treinamento eventual mais leves e fáceis.

Retexturização em NeRV, incluindo efeitos especulares fotorealistas. Como a base do array de imagens é estática, é mais fácil processar e aumentar uma faceta NeRF desta forma do que abranger o efeito em uma faixa de quadros de vídeo, tornando o pré-processamento inicial e o treinamento eventual mais leves e fáceis.

Escritor em aprendizado de máquina, especialista em síntese de imagens humanas. Ex‑chefe de conteúdo de pesquisa na Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Website: martinanderson.ai
Contato: martin@martinanderson.ai