Andersonin kulma

Ajamissimulaattorien fotorealistisuuden parantaminen generatiivisilla vastakkaisilla verkoilla

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Uusi tutkimushanke Yhdysvalloissa ja Kiinassa on ehdottanut generatiivisten vastakkaiden verkkoihin (GAN) perustuvan menetelmän käyttämistä ajamissimulaattorien realismin parantamiseksi.

Tutkijat ovat kehittäneet hybridimenetelmän, joka yhdistää CycleGAN-pohjaisen järjestelmän fotorealistisemman tulosteen konventionaalisten menetelmien kanssa, jotka vaativat tarkempaa yksityiskohtaisuutta ja johdonmukaisuutta, kuten tiemerkintöjä ja ajajan näkökulmasta havaittuja ajoneuvoja.

Hybrid Generative Neural Graphics (HGNG) tarjoaa uuden suunnan ajamissimulaattoreille, joka yhdistää 3D-mallien tarkkuuden olennaisille elementeille (kuten tiemerkintöjä ja ajoneuvoja) GANien vahvuuksiin taustan ja ympäristön yksityiskohtaisuuden luomisessa.

Hybrid Generative Neural Graphics (HGNG) tarjoaa uuden suunnan ajamissimulaattoreille, joka yhdistää 3D-mallien tarkkuuden olennaisille elementeille (kuten tiemerkintöjä ja ajoneuvoja) GANien vahvuuksiin taustan ja ympäristön yksityiskohtaisuuden luomisessa. Lähde

Järjestelmä, joka on nimeltään Hybrid Generative Neural Graphics (HGNG), injektoi rajoitetun tulosteen konventionaalista, CGI-pohjaisesta ajamissimulaattorista GAN-pipelineen, jossa NVIDIA SPADE-kehys hoitaa ympäristön luomisen.

Etuna on, että ajoympäristöt tulevat mahdollisesti monipuolisemmiksi, luoden immersiivisemman kokemuksen. Nykyisin jopa muuttaminen CGI-tulostetta fotorealistiseksi neuronaaliseen renderöintiin ei voi ratkaista toistuvuuden ongelmaa, koska alkuperäinen materiaali, joka syötetään neuronaaliseen putkeen, on rajoitettu malliympäristöjen rajoituksilla ja niiden taipumukseen toistaa tekstuureja ja verkkomalleja.

Lähde: https://www.youtube.com/watch?v=0fhUJT21-bs

Muunnettu materiaali vuoden 2021 julkaisusta ‘Fotorealistisuuden parantaminen’, joka edelleen riippuu CGI-renderöidystä materiaalista, mukaan lukien tausta ja yleinen ympäristö, rajoittaen ympäristön monipuolisuutta simuloitussa kokemuksessa. Lähde: https://www.youtube.com/watch?v=P1IcaBn3ej0

Tutkimusraportti toteaa*:

‘Perinteisen ajamissimulaattorin uskottavuus riippuu sen tietokonegrafiikan laadusta, joka koostuu 3D-malleista, tekstuureista ja renderöintimoottorista. Laadukkaat 3D-mallit ja tekstuurit vaativat taituruutta, kun taas renderöintimoottori on suoritettava monimutkaisia fysiikan laskelmia valaistuksen ja varjostuksen realistisen esittämiseksi.’

Uusi tutkimusraportti on nimeltään Fotorealistisuus ajamissimulaatioissa: Generatiivisen vastakkaisen kuvansynteesin yhdistäminen renderöintiin, ja se on tehty Ohio State Universityn sähkö- ja tietotekniikan laitoksella ja Chongqing Changan Automobile Co Ltd:llä Kiinassa.

Taustamateriaali

HGNG muuttaa syötteenä olevan CGI-materiaalin semanttisen rakenteen yhdistämällä osittain renderöityä etualan materiaalia GAN-luodun ympäristön kanssa. Vaikka tutkijat kokeilivat useita eri tietoja mallien koulutukseen, tehokkain osoittautui KITTI-näkötestisarja, joka koostuu pääasiassa saksalaisen Karlsruhen kaupungin ajajan näkökulmasta otetuista kuvista.

HGNG luo semanttisen segmentoinnin rakenteen CGI-renderöidystä tulostosta ja sitten interponoi SPADE:n, joka luo satunnaisen ja monipuolisen fotorealistisen taustakuvan, mukaan lukien lähialueen esineet kaupunkimaisemissa. Tutkimusraportti toteaa, että toistuvat kuviot, jotka ovat yleisiä resursseja rajoittavissa CGI-pipelineissa, 'rikkovat immersiivisyyden' ihmisten käyttäessä simulaattoria, ja että GANin tarjoama monipuolisempi tausta lievittää tätä ongelmaa.

HGNG luo semanttisen segmentoinnin rakenteen CGI-renderöidystä tulostosta ja sitten interponoi SPADE:n, joka luo satunnaisen ja monipuolisen fotorealistisen taustakuvan, mukaan lukien lähialueen esineet kaupunkimaisemissa. Tutkimusraportti toteaa, että toistuvat kuviot, jotka ovat yleisiä resursseja rajoittavissa CGI-pipelineissa, ‘rikkovat immersiivisyyden’ ihmisten käyttäessä simulaattoria, ja että GANin tarjoama monipuolisempi tausta lievittää tätä ongelmaa.

Tutkijat kokeilivat sekä ehdollista GANia (cGAN) että CYcleGANia (CyGAN) generatiivisina verkkoina, ja totesivat lopulta, että kummallakin on vahvuuksia ja heikkouksia: cGAN vaatii parittuja tietoja, ja CyGAN ei. Kuitenkin CyGAN ei voi tällä hetkellä ylittää perinteisten simulaattorien nykyistä tasoa, odottamassa edelleen parannuksia alustojen sovittamisessa ja syklisen johdonmukaisuuden parantamisessa. Siksi cGAN, jolla on lisäksi parittuja tietoja, saa parhaat tulokset tällä hetkellä.

HGNG:n käsitteellinen arkkitehtuuri.

HGNG:n käsitteellinen arkkitehtuuri.

HGNG:n neuronaalisessa grafiikkaputkessa 2D-esitykset muodostetaan CGI-syntetisoiduista kohtauksista. GAN-pipeen CGI-renderöidystä materiaalista siirtyvät vain ‘olennaiset’ elementit, kuten tiemerkintöjä ja ajoneuvoja, joita GAN itse ei voi tällä hetkellä renderöidä riittävällä ajalllisella johdonmukaisuudella ja eheyydellä ajamissimulaattorille. cGAN-syntetisoitu kuva yhdistetään sitten osittain fysiikkaan perustuvan renderöinnin kanssa.

Testit

Tutkijat testasivat järjestelmää käyttämällä SPADE:a, joka oli koulutettu Cityscapes-tietojoukossa, muuttaakseen kohtauksen semanttista rakennetta fotorealistiseksi tulosteksi. CGI-lähtö tuli avoimen lähdekoodin ajamissimulaattorista CARLA, joka hyödyntää Unreal Engine 4 (UE4):ää.

Ajamissimulaattori CARLA:n tulostetta. Lähde: https://arxiv.org/pdf/1711.03938.pdf

Ajamissimulaattori CARLA:n tulostetta. Lähde: https://arxiv.org/pdf/1711.03938.pdf

UE4:n varjostus- ja valaistusmoottori tarjosi semanttisen rakenteen ja osittain renderöidyt kuvat, joissa vain ajoneuvot ja tiemerkintöjä renderöitiin. Yhdistäminen tehtiin GP-GAN-instanssilla, joka oli koulutettu Transient Attributes Database-tietojoukossa, ja kaikki kokeet suoritettiin NVIDIA RTX 2080-laiteella, jossa oli 8 GB GDDR6-muistia.

Tutkijat testasivat semanttista säilyttämistä – tulosteen kykyä vastata alkuperäistä semanttista segmentointimaskia, joka oli tarkoitus olla kohtauksen rakenteen mallina.

Yllä olevissa testikuvissa nähdään, että ‘vain renderöinti’-kuva (alhaalla vasemmalla) ei saavuta uskottavia varjoja. Tutkijat toteavat, että tässä (keltainen ympyrä) puitten varjot, jotka osuvat jalankulkijoiden polulle, luokiteltiin virheellisesti DeepLabV3-semanttisen segmentoinnin kehyksellä ‘tiemerkintöjen’ sisällöksi.

Keskipylväässä nähdään, että cGAN:lla luodut ajoneuvot eivät ole riittävän määrättyjä ollakseen käytettävissä ajamissimulaattorissa (punainen ympyrä). Oikeimmassa pylväässä yhdistetty kuva noudattaa alkuperäistä semanttista määritystä, säilyttäen samalla olennaiset CGI-pohjaiset elementit.

Tutkijat käyttivät Frechet Inception Distance (FID) -mittaria realismin arvioimiseksi, koska se voi toimia parittaisilla tai parittamattomilla tiedoilla.

Kolme tietojoukkoa käytettiin vertailukohtana: Cityscapes, KITTI ja ADE20K.

Tulostekuvat verrattiin toisiinsa FID-pisteiden avulla ja vertailtiin myös fysiikkaan perustuvaan putkeen, samalla kun semanttista säilyttämistä arvioitiin.

Yllä olevissa tuloksissa, jotka liittyvät semanttiseen säilyttämiseen, korkeammat pisteet ovat parempia, ja cGAN-pyramidi-pohjainen lähestymistapa (yksi useista putkista, joita tutkijat testasivat) sai korkeimman pisteen.

Yllä olevat tulokset liittyvät FID-pisteisiin, ja HGNG sai korkeimman pisteen KITTI-tietojoukon avulla.

‘Vain renderöinti’-menetelmä (merkitty [23]) liittyy CARLA:n tulostetta, joka on CGI-pohjainen putki, jota ei odoteta olevan fotorealistinen.

Laadulliset tulokset perinteisessä renderöintimoottorissa (‘c’ yllä olevassa kuvassa) osoittavat epärealistista kaukaisen taustan tietoja, kuten puita ja kasvillisuutta, vaatien tarkkoja malleja ja just-in-time mesh-latausta sekä muita prosessorinvaativia menettelyjä. Keskellä (b) nähdään, että cGAN ei saavuta riittävää määrättyyttä olennaisille elementeille, kuten autoille ja tiemerkintöille. Ehdotetussa yhdistetyssä tulostessa (a) ajoneuvon ja tiemerkintöjen määrätys on hyvä, ja ympäristö on monipuolinen ja fotorealistinen.

Tutkimusraportti päättyy ehdottamalla, että GAN-luodun osan renderöintiputken ajallinen johdonmukaisuus voitaisiin parantaa käyttämällä suurempia kaupunkitietoja, ja että tulevaisuuden työ tässä suunnassa voisi tarjota todellisen vaihtoehdon kalliille neuronaalisille muunnoksille CGI-pohjaisissa virtauksissa, tarjoamalla samalla suurempaa realismita ja monipuolisuutta.

 

* Käännökseni alkuperäisten tekijöiden sisäisistä viittauksista hyperlinkkeihin.

Julkaistu ensimmäisen kerran 23. heinäkuuta 2022.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai