Andersons vinkel
Omvandling af LiDAR til foto-realistiske billeder med en Generativ Adversarial Network

Tidligere på ugen blev der offentliggjort billeder, der viser et Tesla autopilot-system, der kører direkte ind i siden af et standsede køretøj på en motorvej i juni 2021. Det faktum, at bilen var mørk og svær at se, har ført til diskussioner om begrænsningerne ved at anvende computer vision i selvstyrende køretøjer.

Billeder offentliggjort i december 2021 viser øjeblikket med sammenstød. Kilde: https://twitter.com/greentheonly/status/1473307236952940548
Selvom video-kompressionen i de vidt delt billeder giver en lidt overdreven indtryk af, hvor hurtigt det immobiliserede lastvogn “sneg” sig ind på chaufføren i dette tilfælde, viser en højere kvalitets video af samme begivenhed, at en fuldt opmærksom chauffør også ville have haft svært ved at reagere med andet end et sent sving eller semi-effektivt bremse.
Billederne tilføjer kontroversen om Teslas beslutning om at fjerne radar-sensorer til Autopilot, annonceret i maj 2021, og deres holdning til at favorisere vision-baserede systemer over andre echo-location-teknologier, såsom LiDAR.
Tilfældigtvis tilbyder en ny forskningsrapport fra Israel denne uge en tilgang til at kombinere LiDAR- og computer-vision-domænerne ved at konvertere LiDAR-punktskyer til foto-realistiske billeder med brug af en Generativ Adversarial Network (GAN).

I det nye projekt fra Israel er sorte biler identificeret i LiDAR-billeder konverteret til en ‘dagslys’-scenarie for computer-vision-baserede analyser, lignende den tilgang, som Tesla forfølger for udviklingen af sin Autopilot-system.
Forskerne skriver:
‘Vore modeller har lært at forudsige realistisk udseende billeder fra kun punkt-skydata, selv billeder med sorte biler.
‘Sorte biler er svære at detektere direkte fra punkt-skyer på grund af deres lave niveau af reflektivitet. Denne tilgang kan muligvis anvendes i fremtiden til at udføre visuel objektgenkendelse på foto-realistiske billeder genereret fra LiDAR-punktskyer.’
Foto-Realistiske, LiDAR-baserede Billedstrømme
Den nye rapport har titlen Generering af foto-realistiske billeder fra LiDAR-punktskyer med Generative Adversarial Networks og kommer fra syv forskere ved tre israelske akademiske fakulteter samt seks forskere fra Israel-baserede Innoviz Technologies.
Forskerne satte sig for at opdage, om GAN-baseret syntetisk billedskabelse kunne produceres i en passende rate fra punktskyer genereret af LiDAR-systemer, således at den efterfølgende billedstrøm kunne anvendes i objektgenkendelse og semantisk segmentering arbejdsgange.
Data
Den centrale idé, som i så mange nye [x]>[x] billedtranslitterationsprojekter, er at træne en algoritme på parret data, hvor LiDAR-punktskyer (der afhænger af enhed-emitteende lys) trænes mod en tilsvarende ramme fra en frontmonteret kamera.
Da optagelserne blev taget i dagslys, hvor et computer-vision-system kan lettere individuere en ellers-uløselig sort bil (såsom den, som Tesla kørte ind i i juni), burde denne træning give en central sandhed, der er mere modstandsdygtig over for mørke forhold.
Data blev indsamlet med en InnovizOne LiDAR-sensor, der tilbyder en 10fps eller 15fps optagelseshastighed, afhængigt af model.

LiDAR-data indsamlet med en Innoviz-enhed. Kilde: https://www.youtube.com/watch?v=wmcaf_VpsQI
Det resulterende dataset indeholdt omkring 30.000 billeder og 200.000 indsamlede 3D-punkter. Forskerne udførte to tests: en, hvor punktskydata kun indeholdt reflektivitetsinformation; og en anden, hvor punktskydata havde to kanaler, en for reflektivitet og en for afstand.
For den første eksperiment, blev GAN trænet til 50 epocher, hvorefter overfitning blev set som et problem.

GAN-creerede billeder fra den første eksperiment. Til venstre, punktskydata; i midten, faktiske rammer fra optaget footage, brugt som sandhed; højre, de syntetiske repræsentationer skabt af Generative Adversarial Network.
Forskerne skriver:
‘Test-sættet er en helt ny optagelse, som GAN’erne aldrig har set før testen. Dette blev forudsagt ved kun at bruge reflektivitetsinformation fra punktskyen.
‘Vi valgte at vise rammer med sorte biler, fordi sorte biler normalt er svære at detektere fra LiDAR. Vi kan se, at generatoren har lært at generere sorte biler, sandsynligvis fra kontekstuel information, på grund af det faktum, at farverne og de præcise former af objekter i forudsagte billeder ikke er identiske som i de virkelige billeder.’
For den anden eksperiment, trænede forfatterne GAN til 40 epocher med en batch-størrelse på 1, hvilket resulterede i en lignende præsentation af ‘repræsentative’ sorte biler, hovedsageligt fra kontekst. Denne konfiguration blev også brugt til at generere en video, der viser GAN-genererede billeder (billedet ovenfor) sammen med sandhedsfootage.
Evaluering
Den sædvanlige proces for evaluering og sammenligning med eksisterende state-of-the-art var ikke mulig med dette projekt, på grund af dets unikke natur. I stedet udviklede forskerne en brugerdefineret metode til at måle, i hvilken udstrækning biler (mindre og flygtige dele af kildefootage) er repræsenteret i output-billederne.
De valgte 100 par af LiDAR/genererede billeder fra hvert sæt og delte effektivt antallet af bilbilleder, der er til stede i kildefootage, med antallet af bilbilleder, der er til stede i de syntetiske data, hvilket resulterede i en metrisk skala fra 0 til 1.
Forskerne skriver:
‘Scoren i begge eksperimenter var mellem 0,7 og 0,8. Når man tager i betragtning, at den generelle kvalitet af de forudsagte billeder er lavere end de virkelige billeder (det er generelt sværere at detektere objekter i lavkvalitetsbilleder), indikerer denne score, at den overvældende majoritet af biler, der er til stede i sandhedsbillederne, også er til stede i de forudsagte billeder.’
Forskerne konkluderede, at detektionen af sorte køretøjer, der er et problem for både computer-vision-baserede systemer og for LiDAR, kan påvirkes ved at identificere en mangel på data for dele af billedet:
‘Det faktum, at i forudsagte billeder, farveinformation og præcise former ikke er identiske med sandhedsbillederne, antyder, at forudsigelsen af sorte biler hovedsageligt stammer fra kontekstuel information og ikke fra LiDAR-reflektiviteten af punkterne selv.
‘Vi foreslår, at der, ud over det konventionelle LiDAR-system, også køres et andet system, der genererer foto-realistiske billeder fra LiDAR-punktskyer, samtidigt for visuel objektgenkendelse i realtid.’
Forskerne har til hensigt at udvikle arbejdet i fremtiden med større datasæt.
Latens og den Overfyldte SDV-behandlingsstak
En kommentator på den meget delt Twitter-post om Autopilot-ulykken estimerede, at hvis køretøjet kørte med omkring 75 mph (110 fod per sekund), ville en video-feed, der opererede med 20fps, kun dække 5,5 fod per ramme. Men hvis køretøjet kørte med Teslas nyeste hardware og software, ville billedhastigheden have været 36fps (for hovedkameraet), hvilket satte evalueringshastigheden til 110 fod per sekund (tre fod per ramme).
Ud over omkostninger og ergonomi er problemet med at bruge LiDAR som en supplerende datastrøm den enorme informations-“trafikprop” af sensorinput til SDV-behandlingsrammen. Kombineret med den kritiske natur af opgaven, synes dette at have tvunget radar og LiDAR ud af Autopilot-stakken til fordel for billed-baserede evalueringmetoder.
Derfor synes det usandsynligt, at et system, der bruger LiDAR – hvilket i sig selv ville tilføje en behandlingsprop på Autopilot – til at slutte foto-realistiske billeder, er gennemførligt fra Teslas synspunkt.
Tesla-stifter Elon Musk er ingen blank kritiker af LiDAR, som han påpeger, bruges af SpaceX til dokningsprocedurer, men mener, at teknologien er ‘pointløs’ for selvstyrende køretøjer. Musk foreslår, at en gennemtrængende bølgelængde, såsom den ~4mm præcision radar, ville være mere nyttig.
Men pr. juni 2021 er Teslas køretøjer ikke udstyret med radar heller. Der synes ikke at være mange projekter, der er designede til at generere billedstrømme fra radar på samme måde, som det nuværende israelske projekt forsøger (selvom USAs energidepartement sponsorerede et forsøg på radar-kilder GAN-billeder i 2018).
Først offentliggjort den 23. december 2021.












