Andersons vinkel
Omvandling av LiDAR till foto-realistiska bilder med hjälp av en Generativ Adversarial Network

För några dagar sedan släpptes en video som visar hur Teslas autopilot-system körde rakt in i en stillastående bil på en motorväg i juni 2021. Det faktum att bilen var svår att se på grund av mörkret har väckt diskussioner om begränsningarna med att använda datorseende i autonoma körscenarier.

Videon som släpptes i december 2021 visar ögonblicket av kollisionen. Källa: https://twitter.com/greentheonly/status/1473307236952940548
Även om videokomprimeringen i den vida delade videon ger en något överdriven bild av hur snabbt den immobiliserade lastbilen “smög sig” på föraren i detta fall, visar en högkvalitativ video av samma händelse att en fullt vaken förare också skulle ha haft svårt att reagera med annat än ett sena sväng eller semi-effektivt bromsande.
Videon bidrar till kontroversen kring Teslas beslut att ta bort radarsensorer för Autopilot, som meddelades i maj 2021, och deras inställning till att föredra vision-baserade system över andra ekolokaliseringstekniker, såsom LiDAR.
Samtidigt presenterar en ny forskningsartikel från Israel en metod för att kombinera LiDAR- och datorseendedomäner genom att omvandla LiDAR-punktmoln till foto-realistiska bilder med hjälp av en Generativ Adversarial Network (GAN).

I det nya projektet från Israel identifieras svarta bilar i LiDAR-bilder och omvandlas till en ‘dagsljus’-scenario för datorseende-baserad analys, liknande den metod som Tesla följer för utvecklingen av sitt Autopilot-system. Källa: https://arxiv.org/pdf/2112.11245.pdf
Författarna skriver:
‘Våra modeller lärde sig att förutsäga realistiska bilder från endast punktmolnsdata, även bilder med svarta bilar.
‘Svarta bilar är svåra att upptäcka direkt från punktmoln på grund av deras låga reflektivitet. Denna metod kan användas i framtiden för att utföra visuell objektigenkänning på foto-realistiska bilder genererade från LiDAR-punktmoln.’
Foto-realistiska, LiDAR-baserade bildströmmar
Den nya artikeln har titeln Generering av foto-realistiska bilder från LiDAR-punktmoln med Generativa Adversariala Nätverk och kommer från sju forskare vid tre israeliska akademiska institutioner, tillsammans med sex forskare från Israel-baserade Innoviz Technologies.
Forskarna satte som mål att upptäcka om GAN-baserad syntetisk bild kunde produceras i en lämplig takt från punktmolnen genererade av LiDAR-system, så att den efterföljande bildströmmen kunde användas i objektigenkänning och semantisk segmentering.
Idén är, liksom i många nya [x]>[x] bildöversättningsprojekt, att träna en algoritm på parvis data, där LiDAR-punktbilder (som förlitar sig på enhets-emitterat ljus) tränas mot en matchande ram från en främre kamera.
Eftersom videon togs på dagen, där ett datorseende-system kan mer lätt identifiera en annars svår att upptäcka svart bil (såsom den som Teslan körde in i i juni), bör denna träning ge en central sanning som är mer motståndskraftig mot mörka förhållanden.
Data samlades in med en InnovizOne LiDAR-sensor, som erbjuder en 10fps eller 15fps inspelningstakt, beroende på modell.

LiDAR-data som samlats in med en Innoviz-enhet. Källa: https://www.youtube.com/watch?v=wmcaf_VpsQI
Det resulterande datasetet innehöll cirka 30 000 bilder och 200 000 insamlade 3D-punkter. Forskarna utförde två tester: ett där punktmolnsdata endast innehöll reflektivitetsinformation, och ett andra där punktmolnsdata hade två kanaler, en för reflektivitet och en för avstånd.
För det första experimentet tränades GAN till 50 epocher, bortom vilket överanpassning sågs som ett problem.

GAN-skapade bilder från det första experimentet. Till vänster, punktmolnsdata; i mitten, faktiska ramar från inspelad video, använd som grundtruth; höger, de syntetiska representationerna skapade av Generativa Adversarial Network.
Författarna skriver:
‘Testmängden är en helt ny inspelning som GAN har aldrig sett tidigare. Detta förutsågs med endast reflektivitetsinformation från punktmolnet.
‘Vi valde att visa ramar med svarta bilar eftersom svarta bilar vanligtvis är svåra att upptäcka från LiDAR. Vi kan se att generatorn lärde sig att generera svarta bilar, troligen från kontextuell information, på grund av det faktum att färgerna och de exakta formerna på objekt i förutsagda bilder inte är identiska som i de verkliga bilderna.’
För det andra experimentet tränade författarna GAN till 40 epocher med en batchstorlek på 1, vilket resulterade i en liknande presentation av “representativa” svarta bilar, huvudsakligen från kontext. Denna konfiguration användes också för att generera en video som visar GAN-genererad video (avbildad ovan, i exemplet nedan) tillsammans med grundtruth-videon.
Utvardering
Den sedvanliga processen för utvärdering och jämförelse med befintliga state-of-the-art var inte möjlig med detta projekt, på grund av dess unika natur. Istället utvecklade forskarna en anpassad metric som berör omfattningen av hur bilar (mindre och flyktiga delar av källvideon) representeras i utdata-videon.
De valde 100 par LiDAR/genererade bilder från varje uppsättning och delade effektivt antalet bilbilder som finns i källvideon till antalet som finns i den syntetiska datan som producerades, vilket resulterade i en metric-skala från 0 till 1.
Författarna skriver:
‘Poängen i båda experimenten var mellan 0,7 och 0,8. Med tanke på det faktum att den allmänna kvaliteten på de förutsagda bilderna är lägre än de verkliga bilderna (det är svårare att upptäcka objekt i lägre kvalitetsbilder), indikerar denna poäng att den överväldigande majoriteten av bilar som finns i grundtruth också finns i de förutsagda bilderna.’
Forskarna drog slutsatsen att upptäckten av svarta fordon, som är ett problem för både datorseende-baserade system och för LiDAR, kan påverkas av att identifiera en brist på data för delar av bilden:
‘Det faktum att i förutsagda bilder, färginformation och exakta former inte är identiska med grundtruth, tyder på att förutsägelsen av svarta bilar i huvudsak är härledd från kontextuell information och inte från LiDAR-reflektiviteten hos punkterna själva.
‘Vi föreslår att, utöver det konventionella LiDAR-systemet, ett andra system som genererar foto-realistiska bilder från LiDAR-punktmoln skulle köra samtidigt för visuell objektigenkänning i realtid.’
Forskarna avser att utveckla arbetet i framtiden, med större dataset.
En kommentator på den vida delade Twitter-inlägget om Autopilot-kraschen uppskattade att, med en hastighet på cirka 75 mph (110 fot per sekund), en videoström som opererar vid 20fps endast skulle täcka 5,5 fot per ram. Men om fordonet körde med Teslas senaste hårdvara och programvara, skulle ramsfrekvensen ha varit 36fps (för huvudkameran), vilket sätter utvärderingshastigheten till 110 fot per sekund (tre fot per ram).
Förutom kostnad och ergonomi är problemet med att använda LiDAR som en supplementär dataström den renodlade skalan av den informativa “trafikstockningen” av sensorinmatning till SDV-behandlingsramverket. Kombinerat med den kritiska naturen av uppgiften, verkar detta ha tvingat radar och LiDAR ut ur Autopilot-stacken till förmån för bildbaserade utvärderingsmetoder.
Därför verkar det osannolikt att ett system som använder LiDAR – som i sig skulle lägga till en bearbetningsflaskhals på Autopilot – för att härleda foto-realistiska bilder är genomförbart från Teslas synvinkel.
Teslas grundare Elon Musk är ingen blankettkritiker av LiDAR, som han påpekar används av SpaceX för dockningsförfaranden, men anser att tekniken är “meningslös” för självkörande fordon. Musk föreslår att en occlusion-penetrerande våglängd, såsom den ~4mm precisionen för radar, skulle vara mer användbar.
Men, från och med juni 2021, är Teslas fordon inte utrustade med radar heller. Det verkar inte finnas många projekt som är utformade för att generera bildströmmar från radar på samma sätt som det aktuella israeliska projektet försöker (även om den amerikanska energidepartementet sponsrade ett försök för radar-källa GAN-bilder 2018).
Publicerad första gången den 23 december 2021.












