Ângulo de Anderson

ST-NeRF: Composição e Edição para Síntese de Vídeo

mm
Adicione Unite.AI às suas fontes preferidas no Google
ST-NeRF

Um consórcio de pesquisa chinês desenvolveu técnicas para trazer capacidades de edição e composição para um dos setores de síntese de imagem mais quentes da pesquisa nos últimos anos – Campos de Radiância Neural (NeRF). O sistema é intitulado ST-NeRF (Campo de Radiância Neural Coerente Espaço-Temporal).

O que parece ser uma panorâmica de câmera física na imagem abaixo é, na verdade, apenas um usuário “rolando” por pontos de vista em conteúdo de vídeo que existe em um espaço 4D. O POV não está bloqueado para o desempenho das pessoas retratadas no vídeo, cujos movimentos podem ser vistos de qualquer parte de um raio de 180 graus.

ST-NeRF

Cada faceta dentro do vídeo é um elemento capturado discretamente, composto em uma cena coesa que pode ser explorada dinamicamente.

As facetas podem ser duplicadas livremente dentro da cena, ou redimensionadas:

ST-NeRF

Além disso, o comportamento temporal de cada faceta pode ser facilmente alterado, desacelerado, executado em reverso ou manipulado de várias maneiras, abrindo o caminho para arquiteturas de filtros e um nível extremamente alto de interpretabilidade.

Duas facetas NeRF separadas executadas em velocidades diferentes na mesma cena. Fonte: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Duas facetas NeRF separadas executadas em velocidades diferentes na mesma cena. Fonte: https://www.youtube.com/watch?v=Wp4HfOwFGP4

Não há necessidade de rotoscopiar performers ou ambientes, ou ter performers executarem seus movimentos cegamente e fora do contexto da cena pretendida. Em vez disso, as filmagens são capturadas naturalmente por meio de uma matriz de 16 câmeras de vídeo que cobrem 180 graus:

16 câmeras ST-NeRF

Os três elementos retratados acima, as duas pessoas e o ambiente, são distintos e destacados apenas para fins ilustrativos. Cada um pode ser trocado e cada um pode ser inserido na cena em um ponto anterior ou posterior em sua linha do tempo de captura individual.

Os três elementos retratados acima, as duas pessoas e o ambiente, são distintos e destacados apenas para fins ilustrativos. Cada um pode ser trocado e cada um pode ser inserido na cena em um ponto anterior ou posterior em sua linha do tempo de captura individual.

ST-NeRF é uma inovação na pesquisa em Campos de Radiância Neural (NeRF), um quadro de aprendizado de máquina pelo qual capturas de múltiplos pontos de vista são sintetizadas em um espaço virtual navegável por meio de treinamento extensivo (embora a captura de um único ponto de vista também seja um sub-setor da pesquisa em NeRF).

Campos de Radiância Neural funcionam reunindo múltiplos pontos de vista de captura em um único espaço 3D coeso e navegável, com as lacunas entre a cobertura estimadas e renderizadas por uma rede neural. Onde o vídeo (em vez de imagens estáticas) é usado, os recursos de renderização necessários são frequentemente consideráveis. Fonte: https://www.matthewtancik.com/nerf

Campos de Radiância Neural funcionam reunindo múltiplos pontos de vista de captura em um único espaço 3D coeso e navegável, com as lacunas entre a cobertura estimadas e renderizadas por uma rede neural. Onde o vídeo (em vez de imagens estáticas) é usado, os recursos de renderização necessários são frequentemente consideráveis. Fonte: https://www.matthewtancik.com/nerf

O interesse em NeRF se tornou intenso nos últimos nove meses, e uma lista mantida pelo Reddit de trabalhos derivados ou exploratórios em NeRF atualmente lista sessenta projetos.

 

Apenas alguns dos muitos ramos do artigo original NeRF. Fonte: https://crossminds.ai/graphlist/nerf-neural-radiance-fields-ai-research-graph-60708936c8663c4cfa875fc2/

Apenas alguns dos muitos ramos do artigo original NeRF. Fonte: https://crossminds.ai/graphlist/nerf-neural-radiance-fields-ai-research-graph-60708936c8663c4cfa875fc2/

Treinamento Acessível

O artigo é uma colaboração entre pesquisadores da Universidade de Tecnologia de Xangai e DGene Digital Technology, e foi aceito com algum entusiasmo no Open Review.

ST-NeRF oferece várias inovações sobre as iniciativas anteriores em espaços de vídeo navegáveis derivados de ML. Não menos, ele alcança um alto nível de realismo com apenas 16 câmeras. Embora o DyNeRF do Facebook use apenas duas câmeras a mais do que isso, ele oferece um arco de navegação muito mais restrito.

Um exemplo do ambiente DyNeRF do Facebook, com um campo de movimento mais limitado e mais câmeras por pé quadrado necessárias para reconstruir a cena. Fonte: https://neural-3d-video.github.io

Um exemplo do ambiente DyNeRF do Facebook, com um campo de movimento mais limitado e mais câmeras por pé quadrado necessárias para reconstruir a cena. Fonte: https://neural-3d-video.github.io

Além de falta a capacidade de editar e compor facetas individuais, o DyNeRF é particularmente caro em termos de recursos computacionais. Em contraste, os pesquisadores chineses afirmam que o custo de treinamento para seus dados sai em algum lugar entre $900-$3.000, em comparação com os $30.000 para o modelo de geração de vídeo de ponta DVDGAN e sistemas intensivos como o DyNeRF.

Os revisores também notaram que o ST-NeRF faz uma grande inovação ao desacoplar o processo de aprendizado de movimento do processo de síntese de imagem. Essa separação é o que permite a edição e a composição, com as abordagens anteriores restritivas e lineares em comparação.

Embora 16 câmeras sejam uma matriz muito limitada para uma meia-circunferência de visão, os pesquisadores esperam reduzir esse número ainda mais em trabalhos posteriores por meio do uso de fundos estáticos pré-escaneados e abordagens de modelagem de cena mais orientadas a dados. Eles também esperam incorporar capacidades de re-iluminação, uma inovação recente na pesquisa em NeRF.

Abordando Limitações do ST-NeRF

No contexto de artigos acadêmicos de CS que tendem a descartar a usabilidade real de um novo sistema em um parágrafo final descartável, até mesmo as limitações que os pesquisadores reconhecem para o ST-NeRF são incomuns.

Eles observam que o sistema não pode atualmente individuar e renderizar objetos específicos em uma cena, porque as pessoas nas filmagens são segmentadas em entidades individuais por meio de um sistema projetado para reconhecer humanos e não objetos – um problema que parece facilmente resolvido com YOLO e frameworks semelhantes, com o trabalho mais difícil de extrair vídeo humano já realizado.

Embora os pesquisadores notem que atualmente não é possível gerar movimento lento, parece haver pouco que impeça a implementação disso usando inovações existentes em interpolação de quadros, como DAIN e RIFE.

Como em todas as implementações de NeRF e em muitos outros setores da pesquisa de visão computacional, o ST-NeRF pode falhar em instâncias de oclusão severa, onde o assunto é temporariamente obscurecido por outra pessoa ou objeto e pode ser difícil de rastrear continuamente ou re-adquirir com precisão após. Como em outros lugares, essa dificuldade pode ter que aguardar soluções upstream. Enquanto isso, os pesquisadores admitem que a intervenção manual é necessária nesses quadros ocluídos.

Finalmente, os pesquisadores observam que os procedimentos de segmentação humana atualmente dependem de diferenças de cor, o que pode levar à colação involuntária de duas pessoas em um bloco de segmentação – um obstáculo que não está limitado ao ST-NeRF, mas é intrínseco à biblioteca sendo usada, e que talvez possa ser resolvido por análise de fluxo óptico e outras técnicas emergentes.

Publicado pela primeira vez em 7 de maio de 2021.

Escritor em aprendizado de máquina, especialista em síntese de imagem humana. Antigo chefe de conteúdo de pesquisa da Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: [email protected]