Ángulo de Anderson

Datos Sintéticos: Cubriendo la Brecha de Occlusión con Grand Theft Auto

mm
Añade Unite.AI a tus fuentes preferidas en Google

Investigadores de la Universidad de Illinois han creado un nuevo conjunto de datos de visión por computadora que utiliza imágenes sintéticas generadas por el motor de juego Grand Theft Auto para ayudar a resolver uno de los obstáculos más espinosos en la segmentación semántica: reconocer objetos que solo son parcialmente visibles en imágenes y videos de origen.

Con este fin, como se describe en el documento, los investigadores han utilizado el motor de juego GTA-V para generar un conjunto de datos sintéticos que no solo cuenta con un número récord de instancias de occlusión, sino que también cuenta con una segmentación semántica y etiquetado perfectos, y tiene en cuenta la información temporal de una manera que no es abordada por conjuntos de datos de código abierto similares.

Comprensión Completa de la Escena

El video a continuación, publicado como material de apoyo para la investigación, ilustra las ventajas de una comprensión completa 3D de una escena, en la que los objetos ocultos son conocidos y expuestos en la escena en todas las circunstancias, lo que permite al sistema de evaluación aprender a asociar vistas parcialmente ocultas con el objeto completo (etiquetado).

Fuente: http://sailvos.web.illinois.edu/_site/index.html

El conjunto de datos resultante, llamado SAIL-VOS 3D, es considerado por los autores como el primer conjunto de datos de video de malla sintética con anotación de fotograma a fotograma, segmentación de instancia, profundidad de verdad para vistas de escena y anotaciones 2D delineadas por cajas delimitadoras.

Fuente (Haga clic para ampliar)

Las anotaciones de SAIL-VOS 3D incluyen profundidad, segmentación modal de instancia y amodal, etiquetas semánticas y mallas 3D. Los datos incluyen 484 videos que suman 237,611 fotogramas a una resolución de 1280×800, incluyendo transiciones de toma.

Arriba, los fotogramas CGI originales; segunda fila, segmentación de instancia; tercera fila, segmentación amodal, que ilustra la profundidad de la comprensión de la escena y la transparencia disponibles en los datos. Fuente

Arriba, los fotogramas CGI originales; segunda fila, segmentación de instancia; tercera fila, segmentación amodal, que ilustra la profundidad de la comprensión de la escena y la transparencia disponibles en los datos. Fuente (Haga clic para ampliar)

El conjunto se divide en 6,807 clips con un promedio de 34.6 fotogramas cada uno, y los datos están anotados con 3,460,213 instancias de objeto originadas a partir de 3,576 modelos de malla en el motor de juego GTA-V. Estos se asignan a un total de 178 categorías semánticas.

Reconstrucción de Malla y Etiquetado Automatizado

Dado que la investigación de conjuntos de datos posteriores probablemente se realizará en imágenes del mundo real, las mallas en SAIL-VOS 3D se generan mediante el marco de aprendizaje automático, en lugar de derivarse del motor de juego GTA-V.

Con una comprensión programática y esencialmente 'holográfica' de la representación completa de la escena, las imágenes de SAIL-VOS 3D pueden sintetizar representaciones de objetos que normalmente están ocultos por occlusiones, como el brazo del personaje que se da la vuelta aquí, de una manera que de otra manera dependería de muchas instancias representativas en metraje del mundo real. Fuente: https://arxiv.org/pdf/2105.08612.pdf

Con una comprensión programática y esencialmente ‘holográfica’ de la representación completa de la escena, las imágenes de SAIL-VOS 3D pueden sintetizar representaciones de objetos que normalmente están ocultos por occlusiones, como el brazo del personaje que se da la vuelta aquí, de una manera que de otra manera dependería de muchas instancias representativas en metraje del mundo real. (Haga clic para ampliar) Fuente: https://arxiv.org/pdf/2105.08612.pdf

Dado que cada objeto en el mundo de GTA-V contiene un ID único, SAIL-VOS recupera estos del motor de renderizado utilizando la biblioteca de hook de script de GTA-V. Esto resuelve el problema de volver a adquirir el sujeto si sale temporalmente del campo de visión, ya que el etiquetado es persistente y confiable. Hay 162 objetos disponibles en el entorno, que los investigadores mapearon a un número correspondiente de clases.

Variedad de Escenas y Objetos

Muchos de los objetos en el motor de juego GTA-V son comunes en la naturaleza, y por lo tanto el inventario de SAIL-VOS contiene una afortunada 60% de las clases presentes en el conjunto de datos MS-COCO de Microsoft de 2014, frecuentemente utilizado MS-COCO.

El conjunto de datos SAIL-VOS incluye una gran variedad de escenas interiores y exteriores en diferentes condiciones climáticas, con personajes que llevan ropa variada.

El conjunto de datos SAIL-VOS incluye una gran variedad de escenas interiores y exteriores en diferentes condiciones climáticas, con personajes que llevan ropa variada. (Haga clic para ampliar)

Aplicabilidad

Para garantizar la compatibilidad con la investigación general en este área y confirmar que este enfoque sintético puede beneficiar a proyectos no sintéticos, los investigadores evaluaron el conjunto de datos utilizando el enfoque de detección basado en fotogramas empleado para MS-COCO y el desafío PASCAL Visual Object Classes (VOC) de 2012, con precisión promedio como métrica.

Los investigadores encontraron que el entrenamiento previo en el conjunto de datos SAIL-VOS mejora el rendimiento de la intersección sobre la unión (IoU) en un 19%, con una mejora correspondiente en el rendimiento de VideoMatch, desde el 55% hasta el 74% en datos no vistos.

Sin embargo, en casos de occlusión extrema, hubo ocasiones en que todos los métodos anteriores permanecieron incapaces de identificar un objeto o persona, aunque los investigadores pronostican que esto podría ser solucionado en el futuro examinando fotogramas adyacentes para establecer la razón del máscara amodal.

En las dos imágenes de la derecha, los algoritmos de segmentación tradicionales no han podido identificar la figura femenina a partir de la porción muy limitada de su cabeza que es visible. Las innovaciones posteriores con la evaluación de flujo óptico pueden mejorar estos resultados.

En las dos imágenes de la derecha, los algoritmos de segmentación tradicionales no han podido identificar la figura femenina a partir de la porción muy limitada de su cabeza que es visible. Las innovaciones posteriores con la evaluación de flujo óptico pueden mejorar estos resultados. (Haga clic para ampliar)

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai