Ângulo de Anderson
Renderização Neural: NeRF Dá um Passeio ao Ar Livre

Uma colaboração entre o Google Research e a Universidade de Harvard desenvolveu um novo método para criar vídeo neural de 360 graus de cenas completas usando Neural Radiance Fields (NeRF). A abordagem inovadora aproxima o NeRF de um uso abstrato casual em qualquer ambiente, sem ficar restrito a modelos de mesa ou cenários interiores fechados.

Veja o final do artigo para o vídeo completo. Fonte: https://www.youtube.com/watch?v=zBSH-k9GbV4
Mip-NeRF 360 pode lidar com fundos estendidos e objetos ‘infinitos’ como o céu, porque, ao contrário da maioria das iterações anteriores, define limites na forma como os raios de luz são interpretados e cria limites de atenção que justificam tempos de treinamento normalmente longos. Veja o novo vídeo complementar incorporado ao final deste artigo para mais exemplos e uma visão aprofundada do processo.
O novo artigo tem o título Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance Fields e é liderado por Jon Barron, Senior Staff Research Scientist no Google Research.
Para entender a inovação, é necessário ter uma compreensão básica de como funciona a síntese de imagens baseada em campos de radiação neural.
O que é NeRF?
É problemático descrever uma rede NeRF em termos de ‘vídeo’, pois ela se assemelha mais a um ambiente virtual totalmente realizado em 3D, porém baseado em IA, onde múltiplos pontos de vista a partir de fotos individuais (incluindo quadros de vídeo) são usados para costurar uma cena que tecnicamente existe apenas no espaço latente de um algoritmo de aprendizado de máquina – mas do qual podem ser extraídos, a vontade, um número extraordinário de pontos de vista e vídeos.

Uma representação dos múltiplos pontos de captura de câmera que fornecem os dados que o NeRF monta em uma cena neural (mostrada à direita).
As informações derivadas das fotos contribuintes são treinadas em uma matriz semelhante a uma grade de voxels tradicional em fluxos de trabalho CGI, na qual cada ponto no espaço 3D recebe um valor, tornando a cena navegável.

Uma matriz de voxels tradicional coloca informações de pixels (que normalmente existem em um contexto 2D, como a grade de pixels de um arquivo JPEG) em um espaço tridimensional. Fonte: ResearchGate
Depois de calcular o espaço intersticial entre as fotos (se necessário), o caminho de cada pixel possível de cada foto contribuinte é efetivamente ‘rastreado por raios’ e recebe um valor de cor, incluindo um valor de transparência (sem o qual a matriz neural seria completamente opaca ou completamente vazia).
Assim como as grades de voxels, e ao contrário do espaço de coordenadas 3D baseado em CGI, o ‘interior’ de um objeto ‘fechado’ não tem existência em uma matriz NeRF. Você pode abrir um kit de bateria CGI e olhar dentro, se quiser; mas, no que diz respeito ao NeRF, a existência do kit de bateria termina quando o valor de opacidade de sua superfície é igual a ‘1’.
Uma Visão Mais Ampla de um Pixel
Mip-NeRF 360 é uma extensão da pesquisa de março de 2021, que efetivamente introduziu anti-serrilhamento eficiente ao NeRF sem superamostragem exaustiva.
Tradicionalmente, o NeRF calcula apenas um caminho de pixel, o que tende a produzir o tipo de ‘jaggies’ que caracterizavam os primeiros formatos de imagem da internet, bem como os sistemas de jogos anteriores. Essas bordas serrilhadas foram resolvidas por vários métodos, geralmente envolvendo a amostragem de pixels adjacentes e a obtenção de uma representação média.
Como o NeRF tradicional amostra apenas aquele único caminho de pixel, o Mip-NeRF introduziu uma área de captura ‘cônica’, como uma tocha de feixe amplo, que fornece informações suficientes sobre pixels adjacentes para produzir anti-serrilhamento econômico com detalhes aprimorados.

A captura cônica que o Mip-NeRF usa é dividida em troncos cônicos (imagem inferior), que são ainda ‘borrados’ para criar espaços gaussianos vagos que podem ser usados para calcular a precisão e o aliasing de um pixel. Fonte: https://www.youtube.com/watch?v=EpH175PY1A0
A melhoria em relação a uma implementação padrão de NeRF foi notável:

Mip-NeRF (direita), lançado em março de 2021, oferece detalhes aprimorados por meio de um pipeline de aliasing mais abrangente, porém econômico, ao invés de apenas ‘borrar’ os pixels para evitar bordas serrilhadas. Fonte: https://jonbarron.info/mipnerf/
NeRF Ilimitado
O artigo de março deixou três problemas sem solução em relação ao uso do Mip-NeRF em ambientes ilimitados que podem incluir objetos muito distantes, como céus. O novo artigo resolve isso aplicando uma deformação ao estilo Kalman aos Gaussians do Mip-NeRF.
Em segundo lugar, cenas maiores exigem maior poder de processamento e tempos de treinamento prolongados, o que o Mip-NeRF 360 resolve ‘destilando’ a geometria da cena com um pequeno perceptron multicamadas (MLP) de ‘proposta’, que pré-delimita a geometria prevista por um grande MLP NeRF padrão. Isso acelera o treinamento em um fator de três.
Por fim, cenas maiores tendem a tornar a discretização da geometria interpretada ambígua, resultando no tipo de artefatos que os jogadores reconhecem quando a saída do jogo ‘rasga’. O novo artigo aborda isso criando um novo regularizador para os intervalos de raios do Mip-NeRF.
À direita, vemos artefatos indesejados no Mip-NeRF devido à dificuldade de delimitar uma cena tão grande. À esquerda, vemos que o novo regularizador otimizou a cena o suficiente para remover essas perturbações.
Para saber mais sobre o novo artigo, assista ao vídeo abaixo e também à introdução em vídeo de março de 2021 ao Mip-NeRF. Você também pode saber mais sobre a pesquisa em NeRF consultando nossa cobertura até agora.
https://www.unite.ai/tag/nerf/
Originalmente publicado em 25 de novembro de 2021
21 de dezembro de 2021, 12:25pm – Vídeo substituído. – MA












