Anderson의 관점
합성 데이터: 그랜드 테프트 오토로 오clusion 갭을 메우다

일리노이 대학교의 연구자들은 그랜드 테프트 오토 게임 엔진으로 생성된 합성 이미지 데이터셋을 사용하여 의미론적 분할의 가장 어려운 문제 중 하나인 부분적으로 가려진 객체를 인식하는 것을 도와주는 새로운 컴퓨터 비전 데이터셋을 만들었습니다.
이 목적으로, 연구 논문에 설명된 대로, 연구자들은 GTA-V 비디오 게임 엔진을 사용하여 합성 데이터셋을 생성했으며, 이는 기록적인 수의 occlusion 인스턴스를 특징으로 하며, 완벽한 의미론적 분할과 레이블링을 제공하며, 다른 오픈 소스 데이터셋에서 다루지 않는 시간 정보를 제공합니다.
완전한 장면 이해
아래 비디오는 연구를 지원하는 자료로 발행되었으며, 완전한 3D 장면 이해의 장점을 보여주며, 가려진 객체가 모든 상황에서 알려져 있고 노출되어 있으므로 평가 시스템이 부분적으로 가려진 뷰를 전체 객체와 연결하는 것을 학습할 수 있습니다.
출처: http://sailvos.web.illinois.edu/_site/index.html
결과적으로 생성된 데이터셋인 SAIL-VOS 3D는 프레임별 주석, 인스턴스 수준 분할, 장면 뷰의 깊이 및 2D 주석을 제공하는 최초의 합성 비디오 메시 데이터셋이라고 주장됩니다.

출처 (클릭하여 확대)
SAIL-VOS 3D의 주석에는 깊이, 인스턴스 수준 모달 및 아모달 분할, 의미론적 레이블 및 3D 메시가 포함됩니다. 데이터에는 484개의 비디오가 총 237,611개의 프레임으로 구성되어 있으며, 1280×800 해상도에서 촬영되었으며, 샷 전환도 포함되어 있습니다.

위에 원래 CGI 프레임; 두 번째 행, 인스턴스 수준 분할; 세 번째 행, 아모달 분할, 이는 데이터에서 사용할 수 있는 장면 이해의 깊이와 투명성을 보여줍니다. 출처 (클릭하여 확대)
데이터셋은 6,807개의 클립으로 구성되며, 각 클립은 평균 34.6개의 프레임으로 구성되어 있습니다. 데이터는 3,576개의 GTA-V 게임 엔진의 메시 모델에서 유래된 3,460,213개의 객체 인스턴스로 주석이 달려 있으며, 총 178개의 의미론적 카테고리로 분류됩니다.
메시 재구성 및 자동 레이블링
나중에 데이터셋 연구가 실제 세계 이미지에서 수행될 가능성이 있으므로, SAIL-VOS 3D의 메시는 GTA-V 엔진에서 파생된 것이 아니라 기계 학습 프레임워크에 의해 생성됩니다.

전체 장면 표현에 대한 프로그램 방식 및 본질적으로 ‘홀로그래픽’ 이해로, SAIL-VOS 3D 이미지는 일반적으로 가려진 객체의 표현을 합성할 수 있으며, 예를 들어 이곳에서 돌아가는 캐릭터의遠側 팔과 같은 오clusion에 의해 가려진 객체의 표현을 합성할 수 있습니다. (클릭하여 확대) 출처: https://arxiv.org/pdf/2105.08612.pdf
GTA-V 세계의 각 객체에는 고유한 ID가 있으므로, SAIL-VOS는 GTA-V 스크립트 후크 라이브러리를 사용하여 렌더링 엔진에서 이러한 ID를 가져옵니다. 이는 객체가 일시적으로 화면 밖으로 이동하더라도 레이블링이 지속적이고 신뢰할 수 있게 됩니다. 환경에는 162개의 객체가 있으며, 연구자들은 이를 해당 클래스 수와 일치시켰습니다.
다양한 장면과 객체
GTA-V 엔진의 많은 객체는 자연에서 흔히 볼 수 있으므로, SAIL-VOS 인벤토리에는 마이크로소프트의 2014년 MS-COCO 데이터셋에 있는 클래스의 60%가 포함되어 있습니다.
적용 가능성
일반적인 연구와의 호환성을 보장하고, 합성 접근 방식이 비합성 프로젝트에도ประโยชน을 제공할 수 있음을 확인하기 위해, 연구자들은 MS-COCO와 2012년 PASCAL Visual Object Classes (VOC) Challenge에서 사용된 프레임 기반 감지 접근 방식을 사용하여 데이터셋을 평가했으며, 평균 정밀도를 지표로 사용했습니다.
연구자들은 SAIL-VOS 데이터셋을 사전 훈련하면 IoU가 19% 개선되고, VideoMatch 성능도 55%에서 74%로 개선된다는 것을 발견했습니다.
그러나 극단적인 occlusion의 경우, 전통적인 방법이 객체나 사람을 식별하지 못하는 경우가 있었으며, 연구자들은 이것이 향후 amodal 마스크를 위해 인접한 프레임을 조사함으로써 해결될 수 있다고 예측했습니다.














