Anderson’un Açısı

Sentetik Veri: Grand Theft Auto ile Gizli Nesneleri Tanıma Arasındaki Açığı Kapatmak

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Illinois Üniversitesi’ndeki araştırmacılar, sentetik görüntüler oluşturmak için Grand Theft Auto oyun motorunu kullanan yeni bir bilgisayar görme veri seti oluşturdular. Bu, nesnelerin yalnızca kısmen görülebildiği kaynak görüntülerde ve videolarda nesneleri tanıma gibi bir dizi zorlu engelin çözümüne yardımcı olur.

Bu amaçla, makalede açıklandığı gibi, araştırmacılar GTA-V video oyunu motorunu kullanarak sentetik bir veri seti oluşturdular. Bu veri seti, yalnızca rekor sayıda gizli örnek içermekle kalmaz, aynı zamanda mükemmel anlamsal segmentasyon ve etiketleme sunar ve benzer açık kaynaklı veri setlerinde ele alınmayan zaman bilgisi sağlar.

Tam Sahne Anlama

Araştırmayla ilgili olarak yayınlanan aşağıdaki video, bir sahnenin 3D理解ünün avantajlarını gösterir. Gizli nesneler bilinir ve her durumda sahnedeki tüm nesnelerle birlikte açıklanır. Bu, değerlendirme sisteminin kısmen gizli görüntüleri tam (etiketli) nesnelerle ilişkilendirmeyi öğrenmesini sağlar.

Kaynak: http://sailvos.web.illinois.edu/_site/index.html

Elde edilen veri seti, SAIL-VOS 3D olarak adlandırılır ve çerçeveden çerçeveye anotasyon, örnek düzeyinde segmentasyon, sahne görüntülerinin derinlik bilgisi ve 2D anotasyonlar sunar.

Kaynak (Büyütmek için tıklayın)

SAIL-VOS 3D anotasyonları, derinlik, örnek düzeyinde mod ve amodal segmentasyon, anlamsal etiketler ve 3D meshleri içerir. Veri, 484 video ve 237.611 çerçeve içerir.

Üstte, orijinal CGI çerçeveleri; ikinci satır, örnek düzeyinde segmentasyon; üçüncü satır, amodal segmentasyon, sahne anlayışının derinliğini ve şeffaflığını gösterir.

Üstte, orijinal CGI çerçeveleri; ikinci satır, örnek düzeyinde segmentasyon; üçüncü satır, amodal segmentasyon, sahne anlayışının derinliğini ve şeffaflığını gösterir. Kaynak (Büyütmek için tıklayın)

Veri seti, 6.807 klipten oluşur ve her klibin ortalama 34,6 çerçevesi vardır. Veri, 3.576 mesh modelinden elde edilen 3.460.213 nesne örneğiyle etiketlenmiştir.

Mesh Oluşturma ve Otomatik Etiketleme

Gelecekteki veri seti araştırmalarının gerçek dünya görüntülerinde gerçekleşmesi muhtemeldir. Bu nedenle, SAIL-VOS 3D’deki meshler, GTA-V motorundan değil, makine öğrenimi çerçevesi tarafından oluşturulur.

SAIL-VOS 3D görüntüleri, nesnelerin programatik ve essiz bir şekilde anlaşılmasını sağlar.

SAIL-VOS 3D görüntüleri, nesnelerin programatik ve essiz bir şekilde anlaşılmasını sağlar. (Büyütmek için tıklayın) Kaynak: https://arxiv.org/pdf/2105.08612.pdf

Her GTA-V dünyasındaki nesne benzersiz bir ID içerir. SAIL-VOS, bu ID’leri GTA-V script hook kütüphanesini kullanarak rendering motorundan alır. Bu, nesnenin geçici olarak görüş alanından çıkması durumunda etiketlemenin kalıcı ve güvenilir olmasını sağlar. Ortamda 162 nesne mevcuttur ve araştırmacılar bunları karşılık gelen sınıflara eşler.

Çeşitli Sahneler ve Nesneler

GTA-V motorundaki birçok nesne doğada yaygın olarak bulunur. Bu nedenle, SAIL-VOS envanteri, Microsoft’un 2014 yılında yayımladığı MS-COCO veri setindeki sınıfların %60’ını içerir.

SAIL-VOS veri seti, çeşitli iç ve dış sahneleri farklı hava koşullarında ve karakterlerin çeşitli kıyafetler giydikleri durumları içerir.

SAIL-VOS veri seti, çeşitli iç ve dış sahneleri farklı hava koşullarında ve karakterlerin çeşitli kıyafetler giydikleri durumları içerir. (Büyütmek için tıklayın)

Uygulama

Araştırmacılar, sentetik yaklaşımın gerçek dünya projelerine de fayda sağlayabileceğini doğrulamak için SAIL-VOS veri setini, MS-COCO ve 2012 PASCAL Visual Object Classes (VOC) Challenge için kullanılan çerçeve tabanlı algılama yaklaşımıyla değerlendirdiler.

Araştırmacılar, SAIL-VOS veri setini kullanarak önce eğitim verilerinin performansını %19 oranında artırdıklarını ve VideoMatch performansını %55’ten %74’e çıkardıklarını buldular.

Ancak, aşırı gizli durumlarda, geleneksel yöntemlerin nesne veya kişiyi tanımlayamadığı durumlar oldu. Araştırmacılar, bu sorunun gelecekte komşu çerçeveleri inceleyerek amodal maskenin nedenini belirleyerek çözülebileceğini öngördüler.

Sağdaki iki görüntüde, geleneksel segmentasyon algoritmaları, yalnızca başının çok sınırlı bir kısmının görülebildiği kadın figürünü tanımlayamadı. Gelecekteki optik akış değerlendirmesi bu sonuçları iyileştirebilir.

Sağdaki iki görüntüde, geleneksel segmentasyon algoritmaları, yalnızca başının çok sınırlı bir kısmının görülebildiği kadın figürünü tanımlayamadı. Gelecekteki optik akış değerlendirmesi bu sonuçları iyileştirebilir. (Büyütmek için tıklayın)

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai