Anderson’un Açısı
Sentetik Veri: Grand Theft Auto ile Gizli Nesneleri Tanıma Arasındaki Açığı Kapatmak

Illinois Üniversitesi’ndeki araştırmacılar, sentetik görüntüler oluşturmak için Grand Theft Auto oyun motorunu kullanan yeni bir bilgisayar görme veri seti oluşturdular. Bu, nesnelerin yalnızca kısmen görülebildiği kaynak görüntülerde ve videolarda nesneleri tanıma gibi bir dizi zorlu engelin çözümüne yardımcı olur.
Bu amaçla, makalede açıklandığı gibi, araştırmacılar GTA-V video oyunu motorunu kullanarak sentetik bir veri seti oluşturdular. Bu veri seti, yalnızca rekor sayıda gizli örnek içermekle kalmaz, aynı zamanda mükemmel anlamsal segmentasyon ve etiketleme sunar ve benzer açık kaynaklı veri setlerinde ele alınmayan zaman bilgisi sağlar.
Tam Sahne Anlama
Araştırmayla ilgili olarak yayınlanan aşağıdaki video, bir sahnenin 3D理解ünün avantajlarını gösterir. Gizli nesneler bilinir ve her durumda sahnedeki tüm nesnelerle birlikte açıklanır. Bu, değerlendirme sisteminin kısmen gizli görüntüleri tam (etiketli) nesnelerle ilişkilendirmeyi öğrenmesini sağlar.
Kaynak: http://sailvos.web.illinois.edu/_site/index.html
Elde edilen veri seti, SAIL-VOS 3D olarak adlandırılır ve çerçeveden çerçeveye anotasyon, örnek düzeyinde segmentasyon, sahne görüntülerinin derinlik bilgisi ve 2D anotasyonlar sunar.

Kaynak (Büyütmek için tıklayın)
SAIL-VOS 3D anotasyonları, derinlik, örnek düzeyinde mod ve amodal segmentasyon, anlamsal etiketler ve 3D meshleri içerir. Veri, 484 video ve 237.611 çerçeve içerir.

Üstte, orijinal CGI çerçeveleri; ikinci satır, örnek düzeyinde segmentasyon; üçüncü satır, amodal segmentasyon, sahne anlayışının derinliğini ve şeffaflığını gösterir. Kaynak (Büyütmek için tıklayın)
Veri seti, 6.807 klipten oluşur ve her klibin ortalama 34,6 çerçevesi vardır. Veri, 3.576 mesh modelinden elde edilen 3.460.213 nesne örneğiyle etiketlenmiştir.
Mesh Oluşturma ve Otomatik Etiketleme
Gelecekteki veri seti araştırmalarının gerçek dünya görüntülerinde gerçekleşmesi muhtemeldir. Bu nedenle, SAIL-VOS 3D’deki meshler, GTA-V motorundan değil, makine öğrenimi çerçevesi tarafından oluşturulur.

SAIL-VOS 3D görüntüleri, nesnelerin programatik ve essiz bir şekilde anlaşılmasını sağlar. (Büyütmek için tıklayın) Kaynak: https://arxiv.org/pdf/2105.08612.pdf
Her GTA-V dünyasındaki nesne benzersiz bir ID içerir. SAIL-VOS, bu ID’leri GTA-V script hook kütüphanesini kullanarak rendering motorundan alır. Bu, nesnenin geçici olarak görüş alanından çıkması durumunda etiketlemenin kalıcı ve güvenilir olmasını sağlar. Ortamda 162 nesne mevcuttur ve araştırmacılar bunları karşılık gelen sınıflara eşler.
Çeşitli Sahneler ve Nesneler
GTA-V motorundaki birçok nesne doğada yaygın olarak bulunur. Bu nedenle, SAIL-VOS envanteri, Microsoft’un 2014 yılında yayımladığı MS-COCO veri setindeki sınıfların %60’ını içerir.

SAIL-VOS veri seti, çeşitli iç ve dış sahneleri farklı hava koşullarında ve karakterlerin çeşitli kıyafetler giydikleri durumları içerir. (Büyütmek için tıklayın)
Uygulama
Araştırmacılar, sentetik yaklaşımın gerçek dünya projelerine de fayda sağlayabileceğini doğrulamak için SAIL-VOS veri setini, MS-COCO ve 2012 PASCAL Visual Object Classes (VOC) Challenge için kullanılan çerçeve tabanlı algılama yaklaşımıyla değerlendirdiler.
Araştırmacılar, SAIL-VOS veri setini kullanarak önce eğitim verilerinin performansını %19 oranında artırdıklarını ve VideoMatch performansını %55’ten %74’e çıkardıklarını buldular.
Ancak, aşırı gizli durumlarda, geleneksel yöntemlerin nesne veya kişiyi tanımlayamadığı durumlar oldu. Araştırmacılar, bu sorunun gelecekte komşu çerçeveleri inceleyerek amodal maskenin nedenini belirleyerek çözülebileceğini öngördüler.













