Unghiul lui Anderson

Îmbunătățirea fotorealismului simulărilor de conducere cu rețele adversative generative

mm
Adaugă Unite.AI la sursele tale preferate pe Google

O nouă inițiativă de cercetare între Statele Unite și China a propus utilizarea rețelelor adversative generative (GAN) pentru a crește realismul simulatoarelor de conducere.

Într-o abordare inovatoare a provocării de a produce scenarii de conducere fotorealiste, cercetătorii au dezvoltat o metodă hibridă care combină avantajele diferitelor abordări, amestecând ieșirile mai fotorealiste ale sistemelor bazate pe CycleGAN cu elemente generate convențional, care necesită un nivel mai mare de detaliu și coerență, cum ar fi marcajele rutiere și vehiculele observate din punctul de vedere al șoferului.

Grafica neurală generativă hibridă (HGNG) oferă o nouă direcție pentru simulările de conducere, care păstrează acuratețea modelului 3D pentru elementele esențiale (cum ar fi marcajele rutiere și vehiculele), în timp ce utilizează avantajele GAN în generarea unor detalii de fundal și ambient interesante și ne-repetitive. Sursa

Grafica neurală generativă hibridă (HGNG) oferă o nouă direcție pentru simulările de conducere, care păstrează acuratețea modelului 3D pentru elementele esențiale (cum ar fi marcajele rutiere și vehiculele), în timp ce utilizează avantajele GAN în generarea unor detalii de fundal și ambient interesante și ne-repetitive. Sursa

Sistemul, numit Grafică neurală generativă hibridă (HGNG), injectează ieșiri limitate dintr-un simulator de conducere convențional, bazat pe CGI, într-un flux GAN, unde framework-ul NVIDIA SPADE preia generarea mediului.

Avantajul, conform autorilor, este că mediile de conducere vor deveni potențial mai diverse, creând o experiență mai imersivă. În prezent, chiar și conversia ieșirii CGI în ieșire neurală fotorealistică nu poate rezolva problema repetiției, deoarece filmarea originală care intră în pipeline-ul neural este constrânsă de limitele mediilor modelate și tendința de a repeta texturi și mesh-uri.

Sursa: https://www.youtube.com/watch?v=0fhUJT21-bs

Imagini convertite din articolul ‘Îmbunătățirea fotorealismului’, care rămân dependente de filmarea CGI, inclusiv fundalul și detaliile ambientale, limitând varietatea mediului în experiența simulată. Sursa: https://www.youtube.com/watch?v=P1IcaBn3ej0

Articolul afirmă*:

‘Fidelitatea unui simulator de conducere convențional depinde de calitatea pipeline-ului de grafică computerizată, care constă în modele 3D, texturi și un motor de rendering. Modelele 3D și texturile de înaltă calitate necesită artizanat, în timp ce motorul de rendering trebuie să ruleze calcule fizice complicate pentru reprezentarea realistă a luminii și umbrelor.’

Noul articol se intitulează Fotorealism în simulările de conducere: Combinarea sintezei de imagini adversative generative cu rendering și provine de la cercetători de la Departamentul de Inginerie Electrică și Informatică de la Universitatea de Stat Ohio și Chongqing Changan Automobile Co Ltd din Chongqing, China.

Materiale de fundal

HGNG transformă layout-ul semantic al unei scene generate de CGI prin amestecarea materialului de prim-plan parțial renderizat cu medii generate de GAN. Deși cercetătorii au experimentat cu diverse seturi de date pentru antrenarea modelelor, cel mai eficient s-a dovedit a fi KITTI Vision Benchmark Suite, care conține în principal capturi de material din punctul de vedere al șoferului din orașul Karlsruhe, Germania.

HGNG generează un layout semantic din ieșirea renderizată de CGI și apoi intervine cu SPADE, cu codări de stil variate, pentru a crea imagini de fundal fotorealiste și diverse, inclusiv obiecte din apropiere în scenele urbane. Noul articol afirmă că modelele repetitive, care sunt comune în pipeline-urile CGI cu resurse limitate, 'rup imersia' pentru șoferii care utilizează un simulator, și că fundalurile mai variate pe care le poate oferi un GAN pot allevia această problemă.

HGNG generează un layout semantic din ieșirea renderizată de CGI și apoi intervine cu SPADE, cu codări de stil variate, pentru a crea imagini de fundal fotorealiste și diverse, inclusiv obiecte din apropiere în scenele urbane. Noul articol afirmă că modelele repetitive, care sunt comune în pipeline-urile CGI cu resurse limitate, ‘rup imersia’ pentru șoferii care utilizează un simulator, și că fundalurile mai variate pe care le poate oferi un GAN pot allevia această problemă.

Cercetătorii au experimentat atât cu GAN condițional (cGAN), cât și cu CycleGAN (CyGAN) ca rețele generative, descoperind în final că fiecare are avantaje și dezavantaje: cGAN necesită seturi de date pereche, iar CyGAN nu. Cu toate acestea, CyGAN nu poate în prezent depăși stadiul actual în simulatoarele convenționale, în așteptarea unor îmbunătățiri suplimentare în adaptarea de domeniu și consistență ciclică. Prin urmare, cGAN, cu cerințele sale suplimentare de date pereche, obține cele mai bune rezultate în prezent.

Arhitectura conceptuală a HGNG.

Arhitectura conceptuală a HGNG.

În pipeline-ul de grafică neurală HGNG, reprezentările 2D sunt formate din scene sintetizate de CGI. Obiectele care sunt transmise prin GAN din rendering-ul CGI sunt limitate la ‘elemente esențiale’, inclusiv marcajele rutiere și vehiculele, pe care un GAN nu le poate renderiza în prezent la o coerență temporală și integritate adecvată pentru un simulator de conducere. Imaginea sintetizată de cGAN este apoi amestecată cu renderul parțial bazat pe fizică.

Teste

Pentru a testa sistemul, cercetătorii au utilizat SPADE, antrenat pe Cityscapes, pentru a converti layout-ul semantic al scenei în ieșire fotorealistică. Sursa CGI a provenit de la simulatorul de conducere open source CARLA, care utilizează Unreal Engine 4 (UE4).

Ieșire de la simulatorul de conducere open source CARLA. Sursa: https://arxiv.org/pdf/1711.03938.pdf

Ieșire de la simulatorul de conducere open source CARLA. Sursa: https://arxiv.org/pdf/1711.03938.pdf

Motorul de umbrire și iluminare al UE4 a furnizat layout-ul semantic și imaginile parțial renderizate, cu doar vehicule și marcaje de bandă output. Amestecarea a fost realizată cu o instanță GP-GAN antrenată pe Transient Attributes Database, iar toate experimentele au fost rulate pe un NVIDIA RTX 2080 cu 8 GB de GDDR6 VRAM.

Cercetătorii au testat pentru retenția semantică – capacitatea imaginii de ieșire de a corespunde mascații semantice inițiale de segmentare, care a fost destinată să servească ca șablon pentru scenă.

În imaginile de test de mai sus, vedem că în imaginea ‘render doar’ (stânga jos), renderul complet nu obține umbre plauzibile. Cercetătorii notează că aici (cercul galben) umbrele copacilor care cad pe trotuar au fost clasificate greșit de DeepLabV3 (framework-ul de segmentare semantică utilizat pentru aceste experimente) ca ‘conținut de drum’.

În coloana din mijloc, vedem că vehiculele create de cGAN nu au suficientă definiție consistentă pentru a fi utilizate într-un simulator de conducere (cercul roșu). În coloana din dreapta, imaginea amestecată se conformează definiției semantice originale, păstrând în același timp elementele esențiale bazate pe CGI.

Pentru a evalua realismul, cercetătorii au utilizat Distanța de începtare Frechet (FID) ca metrică de performanță, deoarece poate opera pe date pereche sau nepereche.

Trei seturi de date au fost utilizate ca adevăruri de referință: Cityscapes, KITTI și ADE20K.

Imaginile de ieșire au fost comparate între ele utilizând scoruri FID, iar retenția semantică a fost evaluată și ea.

În rezultatele de mai sus, care se referă la retenția semantică, scorurile mai mari sunt mai bune, cu abordarea piramidală bazată pe CGAN (una dintre pipeline-urile testate de cercetători) obținând cel mai mare scor.

Rezultatele de mai sus se referă la scorurile FID, cu HGNG obținând cel mai mare scor prin utilizarea setului de date KITTI.

Metoda ‘Doar render’ (notată ca [23]) se referă la ieșirea de la CARLA, un flux CGI care nu este așteptat să fie fotorealistic.

Rezultatele calitative pe motorul de rendering convențional (‘c’ în imaginea de mai sus) prezintă informații de fundal irealiste, cum ar fi copaci și vegetație, necesitând modele detaliate și încărcarea mesh-ului în timp real, precum și alte proceduri consumatoare de procesor. În mijloc (b), vedem că cGAN nu reușește să obțină o definiție adecvată pentru elementele esențiale, mașini și marcaje rutiere. În ieșirea amestecată propusă (a), definiția vehiculului și a marcajelor rutiere este bună, în timp ce mediul ambiental este divers și fotorealistic.

Articolul concluzionează prin a sugera că coerența temporală a secțiunii generate de GAN din pipeline-ul de rendering ar putea fi crescută prin utilizarea unor seturi de date urbane mai mari și că munca viitoare în această direcție ar putea oferi o alternativă reală la transformările neurale costisitoare ale fluxurilor bazate pe CGI, oferind în același timp o realitate și o diversitate mai mare.

 

* Conversia mea a citărilor inline ale autorilor în legături.

Publicat pentru prima dată pe 23 iulie 2022.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai