Sudut Anderson

Data Sintetis: Membantu Mengatasi Kesenjangan Oklusi dengan Grand Theft Auto

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Peneliti di Universitas Illinois telah menciptakan dataset visi komputer baru yang menggunakan citra sintetis yang dihasilkan oleh mesin game Grand Theft Auto untuk membantu menyelesaikan salah satu hambatan paling sulit dalam segmentasi semantik – mengenali objek yang hanya sebagian terlihat dalam gambar dan video sumber.

Untuk tujuan ini, seperti yang dijelaskan dalam makalah, peneliti telah menggunakan mesin game GTA-V untuk menghasilkan dataset sintetis yang tidak hanya menampilkan jumlah instance oklusi yang sangat besar, tetapi juga menampilkan segmentasi semantik dan pelabelan yang sempurna, dan mempertimbangkan informasi temporal dengan cara yang tidak ditangani oleh dataset sumber terbuka yang serupa.

Pemahaman Adegan Lengkap

Video di bawah, dipublikasikan sebagai bahan pendukung untuk penelitian, menggambarkan kelebihan pemahaman adegan 3D yang lengkap, di mana objek yang tersembunyi diketahui dan terbuka dalam adegan dalam semua keadaan, memungkinkan sistem evaluasi untuk mempelajari mengasosiasikan tampilan oklusi sebagian dengan objek lengkap (yang dilabeli).

Sumber: http://sailvos.web.illinois.edu/_site/index.html

Dataset yang dihasilkan, disebut SAIL-VOS 3D, diklaim oleh penulis sebagai dataset video mesh sintetis pertama dengan anotasi frame-by-frame, segmentasi tingkat instance, kedalaman tanah untuk tampilan adegan dan anotasi 2D yang dibatasi oleh kotak pembatas.

Sumber (Klik untuk memperbesar)

Anotasi SAIL-VOS 3D termasuk kedalaman, segmentasi tingkat instance, dan segmentasi amodal, label semantik, dan mesh 3D. Data ini mencakup 484 video dengan total 237.611 frame pada resolusi 1280×800, termasuk transisi shot.

Di atas, frame CGI asli; baris kedua, segmentasi tingkat instance; baris ketiga, segmentasi amodal, yang menggambarkan kedalaman pemahaman adegan dan transparansi yang tersedia dalam data. Sumber

Di atas, frame CGI asli; baris kedua, segmentasi tingkat instance; baris ketiga, segmentasi amodal, yang menggambarkan kedalaman pemahaman adegan dan transparansi yang tersedia dalam data. Sumber (Klik untuk memperbesar)

Dataset ini terdiri dari 6.807 klip dengan rata-rata 34,6 frame per klip, dan data ini dianotasi dengan 3.460.213 instance objek yang berasal dari 3.576 model mesh dalam mesin game GTA-V. Ini diberi label ke dalam total 178 kategori semantik.

Rekonstruksi Mesh dan Pelabelan Otomatis

Karena penelitian dataset selanjutnya kemungkinan akan dilakukan pada citra dunia nyata, mesh dalam SAIL-VOS 3D dihasilkan oleh kerangka kerja pembelajaran mesin, bukan diambil dari mesin game GTA-V.

Dengan pemahaman programatis dan esensial 'holografik' dari representasi adegan lengkap, citra SAIL-VOS 3D dapat mensintesis representasi objek yang biasanya tersembunyi oleh oklusi, seperti lengan karakter yang berputar di sini, dengan cara yang tidak akan bergantung pada banyak contoh dalam footage dunia nyata. Sumber: https://arxiv.org/pdf/2105.08612.pdf

Dengan pemahaman programatis dan esensial ‘holografik’ dari representasi adegan lengkap, citra SAIL-VOS 3D dapat mensintesis representasi objek yang biasanya tersembunyi oleh oklusi, seperti lengan karakter yang berputar di sini, dengan cara yang tidak akan bergantung pada banyak contoh dalam footage dunia nyata. (Klik untuk memperbesar) Sumber: https://arxiv.org/pdf/2105.08612.pdf

Karena setiap objek dalam dunia GTA-V memiliki ID unik, SAIL-VOS mengambilnya dari mesin rendering menggunakan library hook skrip GTA-V. Ini memecahkan masalah mengambil kembali subjek jika subjek tersebut meninggalkan bidang pandangan sementara, karena pelabelan yang persisten dan dapat diandalkan. Terdapat 162 objek yang tersedia dalam lingkungan, yang peneliti peta ke jumlah kelas yang sesuai.

Varian Adegan dan Objek

Banyak objek dalam mesin game GTA-V umum di alam, dan oleh karena itu, inventori SAIL-VOS berisi 60% kelas yang hadir dalam dataset MS-COCO 2014 yang sering digunakan oleh Microsoft.

Dataset SAIL-VOS mencakup berbagai adegan interior dan eksterior dalam berbagai kondisi cuaca, dengan karakter mengenakan pakaian yang beragam.

Dataset SAIL-VOS mencakup berbagai adegan interior dan eksterior dalam berbagai kondisi cuaca, dengan karakter mengenakan pakaian yang beragam. (Klik untuk memperbesar)

Keteraplikasian

Untuk memastikan kompatibilitas dengan penelitian umum dalam bidang ini, dan untuk mengonfirmasi bahwa pendekatan sintetis ini dapat menguntungkan proyek non-sintetis, peneliti mengevaluasi dataset menggunakan pendekatan deteksi berbasis frame yang digunakan untuk MS-COCO dan PASCAL Visual Object Classes (VOC) Challenge 2012, dengan presisi rata-rata sebagai metrik.

Peneliti menemukan bahwa pelatihan awal pada dataset SAIL-VOS meningkatkan kinerja Intersection over Union (IoU) sebesar 19%, dengan peningkatan kinerja VideoMatch yang sesuai, dari 55% menjadi 74% pada data yang tidak terlihat.

Namun, dalam kasus oklusi ekstrem, ada kesempatan di mana semua metode lama tetap tidak dapat mengidentifikasi objek atau orang, meskipun peneliti meramalkan bahwa ini dapat diperbaiki di masa depan dengan memeriksa frame yang berdekatan untuk menetapkan alasan masker amodal.

Di dua gambar kanan, algoritma segmentasi tradisional gagal mengidentifikasi figur wanita dari bagian kepala yang sangat terbatas yang terlihat. Inovasi selanjutnya dengan evaluasi aliran optik mungkin dapat meningkatkan hasil ini.

Di dua gambar kanan, algoritma segmentasi tradisional gagal mengidentifikasi figur wanita dari bagian kepala yang sangat terbatas yang terlihat. Inovasi selanjutnya dengan evaluasi aliran optik mungkin dapat meningkatkan hasil ini. (Klik untuk memperbesar)

Penulis tentang pembelajaran mesin, spesialis domain sintesis gambar manusia. Mantan kepala konten penelitian di Metaphysic.ai, hingga pembubarannya ke dalam Brahma.ai DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai