Modelos e plataformas de IA
Imagem de Salpicos: Uma Tentativa de Reconstrução 3D de Visão Única Ultra-Rápida
A reconstrução 3D de objetos com redes convolucionais tem demonstrado capacidades notáveis. Os modelos de reconstrução 3D de visão única geram o modelo 3D de qualquer objeto usando uma única imagem como referência, tornando-se um dos tópicos de pesquisa mais quentes em visão computacional.

Por exemplo, vamos considerar a motocicleta na imagem acima. Gerar sua estrutura 3D requer um pipeline complexo que combina pistas de imagens de baixo nível com informações semânticas de alto nível e conhecimento sobre o arranjo estrutural das partes.
Devido ao processo complexo, a reconstrução 3D de visão única tem sido um grande desafio em visão computacional. Em uma tentativa de melhorar a eficiência da reconstrução 3D de visão única, os desenvolvedores trabalharam no Imagem de Salpicos, um método que visa alcançar a construção ultra-rápida de forma 3D e aparência 3D dos objetos. Em seu núcleo, o framework Imagem de Salpicos usa o método de Splatting Gaussiano para analisar representações 3D, aproveitando a velocidade e a qualidade que ele oferece.
Recentemente, o método de Splatting Gaussiano foi implementado por vários modelos de reconstrução multi-visão para renderização em tempo real, escalabilidade aprimorada e treinamento rápido. No entanto, o Imagem de Salpicos é o primeiro framework a implementar o método de Splatting Gaussiano para tarefas de reconstrução de visão única.
Neste artigo, exploraremos como o framework Imagem de Salpicos emprega o Splatting Gaussiano para alcançar a reconstrução 3D de visão única ultra-rápida. Vamos começar.
Imagem de Salpicos: Uma Tentativa de Reconstrução 3D de Visão Única Ultra-Rápida
Como mencionado anteriormente, o Imagem de Salpicos é uma abordagem ultra-rápida para a reconstrução 3D de objetos de visão única com base no método de Splatting Gaussiano. O Imagem de Salpicos é o primeiro framework de visão computacional a implementar o Splatting Gaussiano para a geração de objetos 3D monocular, pois tradicionalmente, o Splatting Gaussiano tem sido usado para a reconstrução 3D de objetos multi-visão. No entanto, o que distingue o framework Imagem de Salpicos de métodos anteriores é que é uma abordagem baseada em aprendizado, e a reconstrução em teste só requer a avaliação direta da rede neural.
O Imagem de Salpicos depende fundamentalmente das qualidades de renderização do Splatting Gaussiano e da alta velocidade de processamento para gerar reconstruções 3D. O framework Imagem de Salpicos apresenta um design simples: o framework usa uma rede neural de imagem para imagem 2D para prever um Gaussiano 3D por pixel de imagem de entrada e mapeia a imagem de entrada para um Gaussiano 3D por pixel. Os Gaussianos 3D resultantes têm a forma de uma imagem, conhecida como a Imagem de Salpicos, e esses Gaussianos também fornecem uma representação de 360 graus da imagem.

Embora o processo seja simples e direto, existem alguns desafios importantes enfrentados pelo framework Imagem de Salpicos ao usar o Splatting Gaussiano para gerar Gaussianos 3D para representações 3D de visão única. O primeiro grande obstáculo é projetar uma rede neural que aceite a imagem de um objeto como entrada e gere uma mistura de Gaussianos que representem todos os lados da imagem como saída.
Para superar isso, o Imagem de Salpicos aproveita o fato de que, embora a mistura de Gaussianos gerada seja um conjunto ou uma coleção desordenada de itens, ela ainda pode ser armazenada em uma estrutura de dados ordenada. Portanto, o framework usa uma imagem 2D como um contêiner para os Gaussianos 3D como resultado de cada pixel no contêiner contendo os parâmetros de um Gaussiano, incluindo suas propriedades como forma, opacidade e cor.
Ao armazenar conjuntos de Gaussianos 3D em uma imagem, o framework Imagem de Salpicos é capaz de reduzir os obstáculos de reconstrução enfrentados ao aprender uma rede neural de imagem para imagem. Ao usar essa abordagem, o processo de reconstrução pode ser implementado apenas utilizando operadores 2D eficientes em vez de depender de operadores 3D. Além disso, no framework Imagem de Salpicos, a representação 3D é uma mistura de Gaussianos 3D, permitindo que ele explore as vantagens de velocidade de renderização e eficiência de memória oferecidas pelo Splatting Gaussiano, o que melhora a eficiência tanto no treinamento quanto na inferência.
Ao longo do caminho, o framework Imagem de Salpicos não só gera representações 3D de visão única, mas também demonstra notável eficiência, pois pode ser treinado até em uma única GPU em benchmarks de objetos 3D padrão. Além disso, o framework Imagem de Salpicos pode ser estendido para aceitar várias imagens como entrada. Ele consegue isso registrando as misturas de Gaussianos individuais em uma referência comum e, em seguida, combinando as misturas de Gaussianos previstas de vistas individuais.
Do ponto de vista empírico, é digno de nota que o framework Imagem de Salpicos pode produzir uma reconstrução de 360 graus do objeto, mesmo que veja apenas um lado do objeto. O framework, então, aloca diferentes Gaussianos em um bairro 2D para diferentes partes do objeto 3D para codificar as informações de 360 graus geradas na imagem 2D.
Para resumir, o framework Imagem de Salpicos é
- Uma abordagem nova para gerar reconstruções 3D de objetos de visão única, transportando a abordagem de Splatting Gaussiano.
- Estende o método para a reconstrução 3D de objetos multi-visão.
- Alcança o desempenho de reconstrução 3D de objetos de estado da arte em benchmarks padrão com velocidade e qualidade excepcionais.
Imagem de Salpicos: Metodologia e Arquitetura
Splatting Gaussiano
Como mencionado anteriormente, o Splatting Gaussiano é o método principal implementado pelo framework Imagem de Salpicos para gerar reconstruções 3D de objetos de visão única. Em termos simples, o Splatting Gaussiano é um método de rasterização para reconstruir imagens 3D e renderizar imagens em tempo real com múltiplos pontos de vista.

O Splatting Gaussiano 3D primeiro usa o conjunto de imagens de entrada para gerar uma nuvem de pontos. O Splatting Gaussiano, então, usa as imagens de entrada para estimar os parâmetros externos da câmera, como inclinação e posição, correspondendo os pixels entre as imagens, e esses parâmetros são usados para computar a nuvem de pontos.

Além disso, a função de opacidade e a função de cor no Splatting Gaussiano fornecem um campo de radiação com a direção de visão do ponto 3D. O framework, então, renderiza o campo de radiação em uma imagem integrando as cores observadas ao longo do raio que passa pelo pixel.
Imagem de Salpicos
O componente de renderizador mapeia o conjunto de Gaussianos 3D para uma imagem. Para realizar a reconstrução 3D de visão única, o framework, então, busca uma função inversa para os Gaussianos 3D que reconstrói a mistura de Gaussianos 3D a partir de uma imagem.
Agora, pode-se especular sobre como o framework Imagem de Salpicos pode reconstruir a representação 3D de um objeto, mesmo que tenha acesso a apenas uma de suas vistas? Em tempo real, o framework Imagem de Salpicos aprende a usar alguns dos Gaussianos disponíveis para reconstruir a vista e usa os Gaussianos restantes para reconstruir automaticamente as partes não vistas da imagem.
Perda de Nível de Imagem
Uma grande vantagem de explorar a velocidade e a eficiência oferecidas pelo método de Splatting Gaussiano é que ele permite que o framework renderize todas as imagens em cada iteração, mesmo para lotes com tamanho de lote relativamente maior.
Normalização de Escala
É desafiador estimar o tamanho de um objeto olhando para uma única vista, e é uma tarefa desafiadora resolver essa ambiguidade quando é treinado com uma perda. O mesmo problema não é observado em conjuntos de dados sintéticos, pois todos os objetos são renderizados com intrínsecas da câmera idênticas e os objetos estão a uma distância fixa da câmera, o que ajuda a resolver a ambiguidade.
Cor Dependente de Visão
Para representar cores dependentes de visão, o framework Imagem de Salpicos usa harmônicas esféricas para generalizar as cores além do modelo de cor de Lambert. Para qualquer Gaussiano específico, o modelo define coeficientes que são previstos pela rede e as harmônicas esféricas.
Arquitetura de Rede Neural
A maioria da arquitetura do mapeador que mapeia a imagem de entrada para a combinação de Gaussiano é idêntica ao processo usado no framework SongUNet. A última camada na arquitetura é substituída por uma camada de convolução 1×1 com o modelo de cor determinando a largura dos canais de saída.
Para reconstruir representações 3D com multi-visão, o framework Imagem de Salpicos aplica a mesma rede a cada vista de entrada e, em seguida, usa a abordagem de visão para combinar as reconstruções individuais. Além disso, para facilitar a coordenação eficiente e a troca de informações entre as vistas na rede, o framework Imagem de Salpicos faz duas modificações na rede.
Imagem de Salpicos: Experimentos e Resultados
O framework Imagem de Salpicos mede a qualidade de suas reconstruções avaliando a qualidade de síntese de vista nova, pois o framework usa a vista de origem e renderiza a forma 3D para vistas alvo não vistas para realizar reconstruções.
Desempenho de Reconstrução 3D de Visão Única
A tabela a seguir demonstra o desempenho do modelo Imagem de Salpicos na tarefa de reconstrução 3D de visão única no benchmark ShapeNet.

Como pode ser observado, o framework Imagem de Salpicos supera todos os métodos de reconstrução determinísticos em termos de pontuações LPIPS e SSIM. As pontuações indicam que o modelo Imagem de Salpicos gera imagens com reconstruções mais nítidas.
A imagem a seguir demonstra a força qualitativa do framework Imagem de Salpicos, e como pode ser visto, o modelo gera reconstruções com geometrias finas e interessantes e captura os detalhes das vistas de condicionamento.

A imagem a seguir mostra que as reconstruções geradas pelo framework Imagem de Salpicos não só são mais nítidas, mas também têm melhor precisão do que os modelos anteriores, especialmente em condições não convencionais com estruturas finas e visibilidade limitada.

Reconstrução 3D Multi-Visão
Para avaliar suas capacidades de reconstrução 3D multi-visão, o framework Imagem de Salpicos é treinado no conjunto de dados SpaneNet-SRN Cars para previsões de duas vistas. Os métodos existentes usam condicionamento de pose de câmera absoluta para tarefas de reconstrução 3D multi-visão, o que significa que o modelo aprende a confiar principalmente na orientação canônica do objeto no objeto.

Pensamentos Finais
Neste artigo, discutimos o Imagem de Salpicos, um método que visa alcançar a construção ultra-rápida de forma 3D e aparência 3D dos objetos. Em seu núcleo, o framework Imagem de Salpicos usa o método de Splatting Gaussiano para analisar representações 3D, aproveitando a velocidade e a qualidade que ele oferece. O framework Imagem de Salpicos processa imagens usando uma arquitetura de rede neural 2D pronta para usar para prever uma pseudo-imagem que contém um Gaussiano colorido por pixel. Ao usar o método de Splatting Gaussiano, o framework Imagem de Salpicos é capaz de combinar renderização rápida com inferência rápida, resultando em treinamento rápido e avaliação mais rápida em benchmarks reais e sintéticos.












