Ângulo de Anderson

Dados Sintéticos: Pontuando a Lacuna de Oclusão com Grand Theft Auto

mm
Adicione Unite.AI às suas fontes preferidas no Google

Pesquisadores da Universidade de Illinois criaram um novo conjunto de dados de visão computacional que utiliza imagens sintéticas geradas por um motor de jogo Grand Theft Auto para ajudar a resolver um dos obstáculos mais espinhosos na segmentação semântica – reconhecer objetos que estão apenas parcialmente visíveis em imagens e vídeos de origem.

Para isso, como descrito no artigo, os pesquisadores utilizaram o motor de jogo GTA-V para gerar um conjunto de dados sintéticos que não apenas apresenta um número recorde de instâncias de oclusão, mas também apresenta segmentação semântica perfeita e rotulagem, e leva em consideração informações temporais de uma maneira que não é abordada por conjuntos de dados de código aberto semelhantes.

Compreensão Completa da Cena

O vídeo abaixo, publicado como material de apoio à pesquisa, ilustra as vantagens de uma compreensão completa 3D de uma cena, na qual objetos obscurecidos são conhecidos e expostos na cena em todas as circunstâncias, permitindo que o sistema de avaliação aprenda a associar vistas parcialmente ocluídas com o objeto inteiro (rotulado).

Fonte: http://sailvos.web.illinois.edu/_site/index.html

O conjunto de dados resultante, chamado SAIL-VOS 3D, é afirmado pelos autores como o primeiro conjunto de dados de malha de vídeo sintética com anotação quadro a quadro, segmentação de nível de instância, profundidade de cena real e anotações 2D delineadas por caixas delimitadoras.

Fonte (Clique para ampliar)

As anotações do SAIL-VOS 3D incluem profundidade, segmentação modal de nível de instância e amodal, rótulos semânticos e malhas 3D. Os dados incluem 484 vídeos que totalizam 237.611 quadros na resolução 1280×800, incluindo transições de tomada.

Acima, os quadros CGI originais; segunda linha, segmentação de nível de instância; terceira linha, segmentação amodal, que ilustra a profundidade da compreensão da cena e transparência disponível nos dados. Fonte

Acima, os quadros CGI originais; segunda linha, segmentação de nível de instância; terceira linha, segmentação amodal, que ilustra a profundidade da compreensão da cena e transparência disponível nos dados. Fonte (Clique para ampliar)

O conjunto se divide em 6.807 clipes com uma média de 34,6 quadros cada, e os dados são anotados com 3.460.213 instâncias de objetos originadas a partir de 3.576 modelos de malha no motor de jogo GTA-V. Esses são atribuídos a um total de 178 categorias semânticas.

Reconstrução de Malha e Rotulagem Automatizada

Como pesquisas de conjunto de dados posteriores provavelmente ocorrerão em imagens do mundo real, as malhas no SAIL-VOS 3D são geradas pelo framework de aprendizado de máquina, em vez de derivadas do motor de jogo GTA-V.

Com uma compreensão programática e essencialmente 'holográfica' da representação completa da cena, as imagens do SAIL-VOS 3D podem sintetizar representações de objetos normalmente ocultados por oclusões, como o braço do personagem que gira aqui, de uma maneira que dependeria de muitas instâncias representativas em imagens do mundo real. Fonte: https://arxiv.org/pdf/2105.08612.pdf

Com uma compreensão programática e essencialmente ‘holográfica’ da representação completa da cena, as imagens do SAIL-VOS 3D podem sintetizar representações de objetos normalmente ocultados por oclusões, como o braço do personagem que gira aqui, de uma maneira que dependeria de muitas instâncias representativas em imagens do mundo real. (Clique para ampliar) Fonte: https://arxiv.org/pdf/2105.08612.pdf

Como cada objeto no mundo GTA-V contém um ID único, o SAIL-VOS recupera esses do motor de renderização usando a biblioteca de hook de script GTA-V. Isso resolve o problema de reaquisição do assunto se ele deixar o campo de visão temporariamente, pois a rotulagem é persistente e confiável. Há 162 objetos disponíveis no ambiente, que os pesquisadores mapearam para um número correspondente de classes.

Variedade de Cenas e Objetos

Muitos dos objetos no motor de jogo GTA-V são comuns na natureza, e portanto o inventário SAIL-VOS contém uma sorte de 60% das classes presentes no conjunto de dados MS-COCO de 2014 da Microsoft, frequentemente utilizado MS-COCO dataset.

O conjunto de dados SAIL-VOS inclui uma grande variedade de cenas internas e externas sob diferentes condições climáticas, com personagens vestindo roupas variadas.

O conjunto de dados SAIL-VOS inclui uma grande variedade de cenas internas e externas sob diferentes condições climáticas, com personagens vestindo roupas variadas. (Clique para ampliar)

Apllicabilidade

Para garantir a compatibilidade com a pesquisa geral nessa área e confirmar que essa abordagem sintética pode beneficiar projetos não sintéticos, os pesquisadores avaliaram o conjunto de dados usando a abordagem de detecção baseada em quadros empregada para MS-COCO e o desafio de classes de objetos visuais PASCAL de 2012, com precisão média como métrica.

Os pesquisadores descobriram que o pré-treinamento no conjunto de dados SAIL-VOS melhora o desempenho da interseção sobre a união (IoU) em 19%, com uma melhoria correspondente no desempenho do VideoMatch, de 55% para 74% em dados não vistos.

No entanto, em casos de oclusão extrema, houve ocasiões em que todos os métodos mais antigos permaneceram incapazes de identificar um objeto ou pessoa, embora os pesquisadores prevejam que isso possa ser remediado no futuro examinando quadros adjacentes para estabelecer a razão para a máscara amodal.

Nas duas imagens da direita, algoritmos de segmentação tradicionais falharam em identificar a figura feminina a partir da porção muito limitada de sua cabeça que está visível. Inovações posteriores com avaliação de fluxo óptico podem melhorar esses resultados.

Nas duas imagens da direita, algoritmos de segmentação tradicionais falharam em identificar a figura feminina a partir da porção muito limitada de sua cabeça que está visível. Inovações posteriores com avaliação de fluxo óptico podem melhorar esses resultados. (Clique para ampliar)

Escritor em aprendizado de máquina, especialista em síntese de imagem humana. Antigo chefe de conteúdo de pesquisa da Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: martin@martinanderson.ai