Ângulo de Anderson

Renderização Neural: NeRF Dá um Passeio ao Ar Livre

mm
Adicione Unite.AI às suas fontes preferidas no Google

Uma colaboração entre o Google Research e a Universidade de Harvard desenvolveu um novo método para criar vídeo neural de 360 graus de cenas completas usando Neural Radiance Fields (NeRF). A abordagem inovadora aproxima o NeRF de um uso abstrato casual em qualquer ambiente, sem ficar restrito a modelos de mesa ou cenários interiores fechados.

Source: https://www.youtube.com/watch?v=zBSH-k9GbV4

Veja o final do artigo para o vídeo completo. Fonte: https://www.youtube.com/watch?v=zBSH-k9GbV4

Mip-NeRF 360 pode lidar com fundos estendidos e objetos ‘infinitos’ como o céu, porque, ao contrário da maioria das iterações anteriores, define limites na forma como os raios de luz são interpretados e cria limites de atenção que justificam tempos de treinamento normalmente longos. Veja o novo vídeo complementar incorporado ao final deste artigo para mais exemplos e uma visão aprofundada do processo.

O novo artigo tem o título Mip-NeRF 360: Unbounded Anti-Aliased Neural Radiance Fields e é liderado por Jon Barron, Senior Staff Research Scientist no Google Research.

Para entender a inovação, é necessário ter uma compreensão básica de como funciona a síntese de imagens baseada em campos de radiação neural.

O que é NeRF?

É problemático descrever uma rede NeRF em termos de ‘vídeo’, pois ela se assemelha mais a um ambiente virtual totalmente realizado em 3D, porém baseado em IA, onde múltiplos pontos de vista a partir de fotos individuais (incluindo quadros de vídeo) são usados para costurar uma cena que tecnicamente existe apenas no espaço latente de um algoritmo de aprendizado de máquina – mas do qual podem ser extraídos, a vontade, um número extraordinário de pontos de vista e vídeos.

A depiction of the multiple camera capture points that provide the data which NeRF assembles into a neural scene (pictured right).

Uma representação dos múltiplos pontos de captura de câmera que fornecem os dados que o NeRF monta em uma cena neural (mostrada à direita).

As informações derivadas das fotos contribuintes são treinadas em uma matriz semelhante a uma grade de voxels tradicional em fluxos de trabalho CGI, na qual cada ponto no espaço 3D recebe um valor, tornando a cena navegável.

A traditional voxel matrix places pixel information (which normally exists in a 2D context, such as the pixel grid of a JPEG file) into a three-dimensional space. Source: https://www.researchgate.net/publication/344488704_Processing_and_analysis_of_airborne_full-waveform_laser_scanning_data_for_the_characterization_of_forest_structure_and_fuel_properties

Uma matriz de voxels tradicional coloca informações de pixels (que normalmente existem em um contexto 2D, como a grade de pixels de um arquivo JPEG) em um espaço tridimensional. Fonte: ResearchGate

Depois de calcular o espaço intersticial entre as fotos (se necessário), o caminho de cada pixel possível de cada foto contribuinte é efetivamente ‘rastreado por raios’ e recebe um valor de cor, incluindo um valor de transparência (sem o qual a matriz neural seria completamente opaca ou completamente vazia).

Assim como as grades de voxels, e ao contrário do espaço de coordenadas 3D baseado em CGI, o ‘interior’ de um objeto ‘fechado’ não tem existência em uma matriz NeRF. Você pode abrir um kit de bateria CGI e olhar dentro, se quiser; mas, no que diz respeito ao NeRF, a existência do kit de bateria termina quando o valor de opacidade de sua superfície é igual a ‘1’.

Uma Visão Mais Ampla de um Pixel

Mip-NeRF 360 é uma extensão da pesquisa de março de 2021, que efetivamente introduziu anti-serrilhamento eficiente ao NeRF sem superamostragem exaustiva.

Tradicionalmente, o NeRF calcula apenas um caminho de pixel, o que tende a produzir o tipo de ‘jaggies’ que caracterizavam os primeiros formatos de imagem da internet, bem como os sistemas de jogos anteriores. Essas bordas serrilhadas foram resolvidas por vários métodos, geralmente envolvendo a amostragem de pixels adjacentes e a obtenção de uma representação média.

Como o NeRF tradicional amostra apenas aquele único caminho de pixel, o Mip-NeRF introduziu uma área de captura ‘cônica’, como uma tocha de feixe amplo, que fornece informações suficientes sobre pixels adjacentes para produzir anti-serrilhamento econômico com detalhes aprimorados.

The conical cone catchment that Mip-NeRF uses is sliced up into conical frustums (below), which is further 'blurred' to represent a vaguer Gaussian space that can be used to calculate the accuracy and aliasing of a pixel. Source: https://www.youtube.com/watch?v=EpH175PY1A0

A captura cônica que o Mip-NeRF usa é dividida em troncos cônicos (imagem inferior), que são ainda ‘borrados’ para criar espaços gaussianos vagos que podem ser usados para calcular a precisão e o aliasing de um pixel. Fonte: https://www.youtube.com/watch?v=EpH175PY1A0

A melhoria em relação a uma implementação padrão de NeRF foi notável:

Mip-NeRF (right), released in março de 2021, provides improved detail through a more comprehensive but economical aliasing pipeline, rather than just 'blurring' pixels to avoid jagged edges. Source: https://jonbarron.info/mipnerf/

Mip-NeRF (direita), lançado em março de 2021, oferece detalhes aprimorados por meio de um pipeline de aliasing mais abrangente, porém econômico, ao invés de apenas ‘borrar’ os pixels para evitar bordas serrilhadas. Fonte: https://jonbarron.info/mipnerf/

NeRF Ilimitado

O artigo de março deixou três problemas sem solução em relação ao uso do Mip-NeRF em ambientes ilimitados que podem incluir objetos muito distantes, como céus. O novo artigo resolve isso aplicando uma deformação ao estilo Kalman aos Gaussians do Mip-NeRF.

Em segundo lugar, cenas maiores exigem maior poder de processamento e tempos de treinamento prolongados, o que o Mip-NeRF 360 resolve ‘destilando’ a geometria da cena com um pequeno perceptron multicamadas (MLP) de ‘proposta’, que pré-delimita a geometria prevista por um grande MLP NeRF padrão. Isso acelera o treinamento em um fator de três.

Por fim, cenas maiores tendem a tornar a discretização da geometria interpretada ambígua, resultando no tipo de artefatos que os jogadores reconhecem quando a saída do jogo ‘rasga’. O novo artigo aborda isso criando um novo regularizador para os intervalos de raios do Mip-NeRF.

On the right, we see unwanted artifacts in Mip-NeRF due to the difficulty in bounding such a large scene. On the left, we see that the new regularizer has optimized the scene well enough to remove these disturbances.

À direita, vemos artefatos indesejados no Mip-NeRF devido à dificuldade de delimitar uma cena tão grande. À esquerda, vemos que o novo regularizador otimizou a cena o suficiente para remover essas perturbações.

Para saber mais sobre o novo artigo, assista ao vídeo abaixo e também à introdução em vídeo de março de 2021 ao Mip-NeRF. Você também pode saber mais sobre a pesquisa em NeRF consultando nossa cobertura até agora.

https://www.unite.ai/tag/nerf/

Originalmente publicado em 25 de novembro de 2021
21 de dezembro de 2021, 12:25pm – Vídeo substituído. – MA

Escritor em aprendizado de máquina, especialista em síntese de imagens humanas. Ex‑chefe de conteúdo de pesquisa na Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Website: martinanderson.ai
Contato: martin@martinanderson.ai