Andersons vinkel
Konvertering av LiDAR til foto-realistiske bilder med en Generative Adversarial Network

Tidligere denne uken ble det publisert en video som viser en Tesla autopilot-system som kolliderer direkte med siden av et stanset kjøretøy på en motorvei i juni 2021. Det faktum at bilen var mørk og vanskelig å se, har ført til diskusjon om begrensningene ved å bruke datavisjon i autonome kjøresituasjoner.

Videoen som ble publisert i desember 2021 viser øyeblikket da ulykken skjedde. Kilde: https://twitter.com/greentheonly/status/1473307236952940548
Selv om video-komprimeringen i den vidt delt videoen gir en litt forsterket inntrykk av hvor raskt det immobiliserte lastebilet “snøt” opp på sjåføren i dette tilfelle, viser en høykvalitetsvideo av samme hendelse at en fullt våken sjåfør også ville ha hatt vanskelig for å reagere med annet enn et tregt sving eller delvis effektiv bremsing.
Videoen bidrar til kontroversen rundt Teslas beslutning om å fjerne radar-sensorene for Autopilot, annonsert i mai 2021, og deres holdning til å favorisere visjon-baserte systemer over andre ekko-lokasjonsteknologier, som LiDAR.
Tilfeldigvis tilbyr en ny forskningsartikkel fra Israel denne uken en tilnærming til å kombinere LiDAR- og datavisjons-domener, ved å konvertere LiDAR-punktskyer til foto-realistiske bilder med hjelp av en Generative Adversarial Network (GAN).

I det nye prosjektet fra Israel, blir svarte biler identifisert i LiDAR-bilder og konvertert til en ‘dagslys’-scenario for datavisjons-basert analyse, lignende tilnærmingen som Tesla følger for utviklingen av sin Autopilot-system. Kilde: https://arxiv.org/pdf/2112.11245.pdf
Forfatterne skriver:
‘Våre modeller lærte hvordan de kunne forutsi realistiske bilder fra bare punktskyer, selv bilder med svarte biler.
‘Svarte biler er vanskelige å detektere direkte fra punktskyer på grunn av deres lave refleksivitet. Denne tilnærmingen kan bli brukt i fremtiden for å utføre visuell objektgjenkjenning på foto-realistiske bilder generert fra LiDAR-punktskyer.’
Foto-Realistiske, LiDAR-baserte Bildestrømmer
Den nye artikkelen har tittelen Generering av foto-realistiske bilder fra LiDAR-punktskyer med Generative Adversarial Networks, og kommer fra syv forskere ved tre israelske akademiske institusjoner, sammen med seks forskere fra Israel-baserte Innoviz Technologies.
Forskerne satte ut til å oppdage om GAN-basert syntetisk billedproduksjon kunne produseres i en passende rate fra punktskyene generert av LiDAR-systemer, så at den påfølgende strømmen av bilder kunne bli brukt i objektgjenkjenning og semantisk segmentering-arbeidsflyter.
Data
Den sentrale ideen, som i så mange nye [x]>[x] bilde-oversettelsesprosjekter, er å trene en algoritme på parrede data, hvor LiDAR-punktsky-bilder (som avhenger av enhets-emitert lys) blir trent mot en tilsvarende ramme fra en front-kamera.
Ettersom videoen ble tatt på dagen, hvor et datavisjons-system kan lett individuere en ellers-uløselig svart bil (som den Tesla kolliderte med i juni), burde denne treningen gi en sentral sannhet som er mer motstandsdyktig mot mørke forhold.
Datasettet ble samlet inn med en InnovizOne LiDAR-sensor, som tilbyr en 10fps eller 15fps-opptakshastighet, avhengig av modell.

LiDAR-data fanget av en Innoviz-enhet. Kilde: https://www.youtube.com/watch?v=wmcaf_VpsQI
Det resulterende datasettet inneholdt rundt 30 000 bilder og 200 000 samlede 3D-punkter. Forskerne utførte to tester: en hvor punktsky-data bare inneholdt refleksivitetsinformasjon; og en annen, hvor punktsky-data hadde to kanaler, en for refleksivitet og en for avstand.
For det første eksperimentet, ble GANen trent til 50 epoker, utover hvilket overfitting ble sett som et problem.

GAN-genererte bilder fra det første eksperimentet. Til venstre, punktsky-data; i midten, faktiske rammeverk fra fanget video, brukt som sannhet; høyre, de syntetiske representasjonene skapt av den Generative Adversarial Network.
Forfatterne skriver:
‘Testsettet er en fullstendig ny innspilling som GANene aldri har sett før testen. Dette ble forutsagt ved å bruke bare refleksivitetsinformasjon fra punktskyen.
‘Vi valgte å vise rammeverk med svarte biler fordi svarte biler vanligvis er vanskelige å detektere fra LiDAR. Vi kan se at generatoren lærte å generere svarte biler, sannsynligvis fra kontekstuell informasjon, på grunn av det faktum at fargene og de eksakte formene på objekter i forutsagte bilder ikke er identiske som i de virkelige bildene.’
For det andre eksperimentet, trente forfatterne GANen til 40 epoker med en batch-størrelse på 1, og fikk en lignende presentasjon av ‘representative’ svarte biler, hovedsakelig fra kontekst. Denne konfigurasjonen ble også brukt til å generere en video som viser GAN-generert video (avbildet øverst, i eksempelbildet under) sammen med sannhets-videoen.
Evaluering
Den vanlige prosessen for evaluering og sammenligning med eksisterende state-of-the-art var ikke mulig med dette prosjektet, på grunn av dets unike natur. I stedet utviklet forskerne en egen metode for å måle hvor godt bildene ble generert, basert på hvor godt bilene ble representert i de genererte bildene.
De valgte 100 par LiDAR/genererte bilder fra hver sett og delte antall bilbilder i kildebildet med antall bilbilder i de syntetiske dataene, og fikk en målestokk fra 0 til 1.
Forfatterne skriver:
‘Scoringsverdien i begge eksperimentene var mellom 0,7 og 0,8. Dette indikerer at de fleste bilene som er til stede i sannhetsbildene også er til stede i de forutsagte bildene.’
Forskerne konkluderte med at deteksjonen av svarte kjøretøy, som er et problem for både datavisjons-baserte systemer og for LiDAR, kan påvirkes ved å identifisere en mangel på data for deler av bildet:
‘Det faktum at i forutsagte bilder, fargeinformasjon og eksakte former på objekter ikke er identiske med sannhetsbildene, antyder at forutsagnet av svarte biler hovedsakelig er avledet fra kontekstuell informasjon og ikke fra LiDAR-refleksiviteten selv.
‘Vi foreslår at, i tillegg til det konvensjonelle LiDAR-systemet, et annet system som genererer foto-realistiske bilder fra LiDAR-punktskyer skulle kjøre samtidig for visuell objektgjenkjenning i sanntid.’
Forskerne planlegger å utvikle arbeidet videre, med større datasett.
Latens og den travle SDV-prosesseringsstakken
En kommentator på den vidt delt Twitter-posten om Autopilot-ulykken estimerte at, med en hastighet på rundt 75 mph (110 fot per sekund), en videostrøm som opererte med 20fps ville bare dekke 5,5 fot per ramme. Men hvis kjøretøyet kjørte med Teslas nyeste hård- og programvare, ville rammehastigheten vært 36fps (for hovedkameraet), noe som setter evalueringshastigheten til 110 fot per sekund (tre fot per ramme).
Bortsett fra kostnader og ergonomi, er problemet med å bruke LiDAR som et supplementært datastrøm den enorme skalaen av informasjonstrafikken til SDV-prosesseringsrammeverket. Kombinert med den kritiske naturen av oppgaven, ser dette ut til å ha tvunget radar og LiDAR ut av Autopilot-stakken til fordel for bilde-baserte evalueringmetoder.
Derfor ser det ut til å være usannsynlig at et system som bruker LiDAR – som i seg selv ville bidra til en prosesseringsflaskehals på Autopilot – for å inferere foto-realistiske bilder er gjennomførbart fra Teslas synspunkt.
Tesla-gründer Elon Musk er ingen blankettkritiker av LiDAR, som han påpeker blir brukt av SpaceX for dokkingsprosedyrer, men mener at teknologien er ‘meningsløs’ for selvkjørende kjøretøy. Musk foreslår at en okklusjons-penetrerende bølgelengde, som den ~4mm presisjonsradaren, ville være mer nyttig.
Men per juni 2021, er Tesla-kjøretøy ikke utstyrt med radar heller. Det ser ikke ut til å være mange prosjekter som er designet for å generere bildestrømmer fra radar på samme måte som det nåværende israelske prosjektet forsøker (selv om USAs energidepartement sponsede ett forsøk på radar-basert GAN-bilde i 2018).
Først publisert 23. desember 2021.












