Anderson’un Açısı

Sürüş Simülasyonlarının Fotoğrafçılık Gerçekçiliğini Generatif Karşıt Ağlar ile Geliştirme

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

ABD ve Çin arasında yeni bir araştırma girişimi, sürüş simülatörlerinin gerçekçiliğini artırmak için Generatif Karşıt Ağlar (GAN’lar) kullanımını önerdi.

Sürüş simülatörleri için fotoğrafik gerçekçi POV sürüş senaryoları üretme challenge’ine yeni bir yaklaşım getiren araştırmacılar, CycleGAN tabanlı sistemlerin daha fotoğrafik gerçekçi çıktılarını, daha geleneksel olarak üretilen unsurlarla birleştiren melez bir yöntem geliştirdiler. Bu unsurlar, sürücünün bakış açısına göre gözlemlenen yol işaretleri ve araçlar gibi, daha fazla ayrıntı ve tutarlılık gerektirir.

Hybrid Generative Neural Graphics (HGNG) offer a new direction for driving simulations that retains the accuracy of 3D models for essential elements (such as road markings and vehicles), while playing to the strengths of GANs in generating interesting and non-repetitive background and ambient detail. Source

Hybrid Generative Neural Graphics (HGNG) offer a new direction for driving simulations that retains the accuracy of 3D models for essential elements (such as road markings and vehicles), while playing to the strengths of GANs in generating interesting and non-repetitive background and ambient detail. Source

Sistem, Hybrid Generative Neural Graphics (HGNG) olarak adlandırılmaktadır ve geleneksel, CGI tabanlı bir sürüş simülatöründen sınırlı çıktı alır ve bunu bir GAN pipeline’ına enjekte eder. NVIDIA SPADE framework’ü, çevre oluşturma işini devralır.

Araştırmacılara göre, avantaj, sürüş ortamlarının daha çeşitli hale gelmesidir, bu da daha immersif bir deneyim sağlar. Şu anda, CGI çıkışını fotoğrafik gerçekçi nöral rendering çıkışına dönüştürmek, tekrarlanan desenlerin problemine çözüm getiremez, çünkü orijinal footage, model ortamlarının sınırları ve tekrarlanan tekstür ve mesh’lerin eğiliminden dolayı kısıtlanmıştır.

Source: https://www.youtube.com/watch?v=0fhUJT21-bs

Converted footage from the 2021 paper ‘Enhancing photorealism enhancement’, which remain dependent on CGI-rendered footage, including the background and general ambient detail, constraining the variety of environment in the simulated experience. Source: https://www.youtube.com/watch?v=P1IcaBn3ej0

Makalede denir*:

‘Bir geleneksel sürüş simülatörünün doğruluğu, bilgisayar grafikleri pipeline’ının kalitesine bağlıdır, bu da 3D modeller, tekstürler ve bir rendering motoründen oluşur. Yüksek kaliteli 3D modeller ve tekstürler için zanaatkarlık gerekir, ayrıca rendering motoru, gerçekçi bir şekilde ışık ve gölgeleme için karmaşık fizik hesaplamaları gerçekleştirmelidir.’

Yeni makale Photorealism in Driving Simulations: Blending Generative Adversarial Image Synthesis with Rendering olarak adlandırılmaktadır ve Ohio Eyalet Üniversitesi’nden ve Çin’in Chongqing şehrindeki Chongqing Changan Automobile Co Ltd’den araştırmacılardan gelmektedir.

Arka Plan Materyali

HGNG, girdi CGI üretilen sahnenin semantik düzenini, kısmen render edilen ön plan materyali ile GAN üretilen ortamları birleştiren melez bir yöntemle dönüştürür. Araştırmacılar, modelleri eğitmek için çeşitli veri setleri denediler, ancak en etkili olanı, principalmente Karlsruhe şehrinin sürücü POV materyallerini içeren KITTI Vision Benchmark Suite oldu.

HGNG generates a semantic segmentation layout from CGI-rendered output, and then interposes SPADE, with varying style encodings, to create random and diverse photorealistic background imagery, including nearby objects in urban scenes. The new paper states that repetitive patterns, which are common to resource-constrained CGI pipelines, 'break immersion' for human drivers using a simulator, and that the more variegated backgrounds that a GAN can provide alleviates this problem.

HGNG, CGI render edilen çıktıdan bir semantik segmentasyon düzeni oluşturur ve ardından değişken stil kodlamaları ile SPADE’yi araya koyarak, kentsel sahnelerdeki yakın nesneleri içeren rastgele ve çeşitli fotoğrafik gerçekçi arka plan görüntüleri oluşturur. Yeni makale, tekrarlanan desenlerin, kaynak kısıtlamalı CGI pipeline’larına ortak olduğu ve bir GAN’ın sağlayabileceği daha çeşitli arka planların bu problemi hafiflettiğini belirtir.

Araştırmacılar, Conditional GAN (cGAN) ve CYcleGAN (CyGAN) olarak adlandırılan generatif ağları denediler ve her birinin güçlü ve zayıf yanları olduğunu buldular: cGAN, eşleştirilmiş veri setleri gerektirir, CyGAN ise gerektirmez. Ancak, CyGAN şu anda geleneksel simülatörlerdeki devlet-sanatını geçemez, domaine adaptasyon ve döngü tutarlılığındaki daha fazla geliştirmeye ihtiyaç duyulmaktadır. Bu nedenle, cGAN, en iyi sonuçları şu anda elde etmektedir.

The conceptual architecture of HGNG.

HGNG’nin kavramsal mimarisi.

HGNG nöral grafik pipeline’ında, 2D temsilciler CGI sentezlenen sahnelerden oluşur. GAN akışına geçen nesneler, CGI rendering’den gelen ‘temel’ unsurlara sınırlıdır, bunlar yol işaretleri ve araçlardır, bunlar bir GAN tarafından şu anda yeterli temporal tutarlılık ve bütünlükte render edilemez. cGAN sentezlenen görüntü, kısmi fizik tabanlı render ile birleştirilir.

Testler

Sistemi test etmek için, araştırmacılar Cityscapes üzerinde eğitilen SPADE’yi kullanarak, sahnenin semantik düzenini fotoğrafik gerçekçi çıktıya dönüştürdüler. CGI kaynağı, Unreal Engine 4 (UE4) kullanan açık kaynaklı sürüş simülatörü CARLA’dan geldi.

Output from the open source driving simulator CARLA. Source: https://arxiv.org/pdf/1711.03938.pdf

Çevrimiçi açık kaynaklı sürüş simülatörü CARLA’nın çıktısı. Source: https://arxiv.org/pdf/1711.03938.pdf

Araştırmacılar, UE4’ün gölgelendirme ve aydınlatma motoru tarafından sağlanan semantik düzen ve kısmen render edilen görüntüleri kullandılar, yalnızca araçlar ve yol işaretleri çıktı olarak verildi. Birleştirme, Transient Attributes Database üzerinde eğitilen bir GP-GAN örneği ile gerçekleştirildi ve tüm deneyler bir NVIDIA RTX 2080 ile 8 GB GDDR6 VRAM kullanarak çalıştırıldı.

Araştırmacılar, semantik retention için test ettiler – çıktı görüntüsünün ilk semantik segmentasyon maskesine karşılık gelme yeteneği.

Yukarıdaki test görüntülerinde, ‘sadece render’ görüntüsünde (alt sol), tam render gerçekçi gölgeler elde edilemez. Araştırmacılar, burada (sarı daire) ağaçların yol üzerine düşen gölgelerinin DeepLabV3 (kullanılan semantik segmentasyon framework’ü) tarafından ‘yol’ içeriği olarak yanlış sınıflandırıldığını belirtirler.

Orta sütun akışında, cGAN oluşturulan araçların yeterli tutarlı tanımına sahip olmadığını görürüz (kırmızı daire). Sağdaki sütun akışında, birleştirilmiş görüntü orijinal semantik tanıma uyarken, temel CGI tabanlı unsurları korur.

Gerçekçiliği değerlendirmek için, araştırmacılar Frechet Inception Distance (FID) olarak adlandırılan bir performans ölçütü kullandılar, çünkü bu, eşleştirilmiş veya eşleştirilmemiş veriler üzerinde çalışabilir.

Üç veri seti, gerçek olarak kullanıldı: Cityscapes, KITTI ve ADE20K.

Çıktı görüntüleri, FID puanları kullanılarak birbirleriyle ve fizik tabanlı (yani CGI) pipeline ile karşılaştırıldı, ayrıca semantik retention da değerlendirildi.

Yukarıdaki sonuçlar, semantik retention ile ilgilidir ve daha yüksek puanlar daha iyidir, cGAN piramit tabanlı yaklaşım (araştırmacılar tarafından test edilen birkaç pipeline’den biri) en yüksek puanı elde etti.

Yukarıdaki sonuçlar, FID puanlarına ilişkindir ve HGNG, KITTI veri setini kullanarak en yüksek puanı elde etti.

‘Sadece render’ yöntemi ( [23] olarak işaretlenmiştir) CARLA’nın CGI akışına aittir ve fotoğrafik gerçekçi olması beklenmez.

Niteliksel sonuçlar, geleneksel rendering motoru (‘c’ olarak işaretlenmiştir) üzerinde, uzak arka plan bilgisi gibi gerçekçi olmayan unsurları gösterir, ayrıca ayrıntılı modellere ve sadece zamanında mesh yüklemesine ihtiyaç duyar, ayrıca diğer işlem yoğun işlemler gerekir. Orta sütunda (b), cGAN’ın temel unsurlar için yeterli tanım elde edemediğini görürüz. Önerilen birleştirilmiş çıktı (a), araç ve yol tanımının iyi olduğunu, ayrıca ambiente ortamın çeşitli ve fotoğrafik gerçekçi olduğunu gösterir.

Makale, GAN üretilen rendering pipeline’ının temporal tutarlılığının, daha büyük kentsel veri setleri kullanılarak artırılabileceğini ve bu yöndeki gelecekteki çalışmaların, pahalı nöral dönüşümlerin yerine daha gerçekçi ve çeşitli bir alternatif sunabileceğini belirtir.

 

* Yazarların inline alıntılarını hiperlink’lere dönüştürdüm.

İlk olarak 23 Temmuz 2022’de yayımlandı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai