Andersons hoek
Conversie van LiDAR naar foto-realistische beelden met een Generatief Adversariaal Netwerk

Earlier deze week werd beeldmateriaal uitgebracht dat laat zien hoe een Tesla -autopilotsysteem frontaal tegen een stilstaand voertuig op een snelweg botste in juni 2021. Het feit dat de auto donker was en moeilijk te onderscheiden, heeft discussie opgeroepen over de beperkingen van het vertrouwen op computerzicht in autonome rijscenariosen.

Beeldmateriaal dat in december 2021 is uitgebracht, toont het moment van impact. Bron: https://twitter.com/greentheonly/status/1473307236952940548
Hoewel video-compressie in het breed gedeelde beeldmateriaal een enigszins overdreven indruk geeft van hoe snel het stilgezette voertuig ‘opdook’ bij de bestuurder in dit geval, toont een hogere kwaliteit video van hetzelfde evenement aan dat een volledig alerte bestuurder ook zou hebben gestructureerd om te reageren met niets anders dan een late zwenking of semi-effectief remmen.
De beeldmateriaal voegt zich bij de controverse rond Tesla’s beslissing om radar-sensoren voor Autopilot te verwijderen, aangekondigd in mei 2021, en zijn standpunt over het favoriseren van visie-gebaseerde systemen boven andere echo-locatie technologieën, zoals LiDAR.
Door toeval biedt een nieuw onderzoeksrapport van Israel deze week een aanpak om de LiDAR- en computerzichtdomeinen te overbruggen, door LiDAR-puntswolken om te zetten in foto-realistische beelden met behulp van een Generatief Adversariaal Netwerk (GAN).

In het nieuwe project van Israel worden zwarte auto’s die in LiDAR-beelden zijn geïdentificeerd, omgezet in een ‘daglicht’-scenario voor computerzicht-gebaseerde analyses, vergelijkbaar met de aanpak die Tesla nastreeft voor de ontwikkeling van zijn Autopilot-systeem. Bron: https://arxiv.org/pdf/2112.11245.pdf
De auteurs verklaren:
‘Onze modellen hebben geleerd om realistisch uitziende beelden te voorspellen vanuit alleen puntwolkgegevens, zelfs beelden met zwarte auto’s.
‘Zwarte auto’s zijn moeilijk rechtstreeks te detecteren vanuit puntwolken vanwege hun lage reflectiviteit. Deze aanpak kan in de toekomst worden gebruikt om visuele objectherkenning uit te voeren op foto-realistische beelden gegenereerd vanuit LiDAR-puntwolken.’
Foto-realistische, LiDAR-gebaseerde beeldstromen
Het nieuwe rapport heeft de titel Genereren van foto-realistische beelden vanuit LiDAR-puntwolken met Generatieve Adversariale Netwerken, en komt van zeven onderzoekers aan drie Israëlische academische faculteiten, samen met zes onderzoekers van het in Israel gevestigde bedrijf Innoviz Technologies.
De onderzoekers wilden ontdekken of GAN-gebaseerde synthetische beelden tegen een geschikte snelheid konden worden geproduceerd vanuit de puntwolken gegenereerd door LiDAR-systemen, zodat de daaropvolgende beeldstroom kon worden gebruikt in objectherkenning- en semantische segmentatie-workflows.
Gegevens
Het centrale idee, zoals in zoveel nieuwe [x]>[x] beeldtransliteratieprojecten, is om een algoritme te trainen op gekoppelde gegevens, waarbij LiDAR-puntwolkbeelden (die afhankelijk zijn van door het apparaat uitgezonden licht) worden getraind tegen een overeenkomende frame van een voorwaarts gerichte camera.
Daar het beeldmateriaal overdag is opgenomen, waar een computerzichtsysteem een moeilijk te vinden, geheel zwarte auto (zoals de auto waar de Tesla in juni 2021 tegen botste) gemakkelijker kan individualiseren, zou deze training een centrale waarheid moeten bieden die minder gevoelig is voor donkere omstandigheden.
De gegevens werden verzameld met een InnovizOne LiDAR-sensor, die een framesnelheid van 10fps of 15fps biedt, afhankelijk van het model.

LiDAR-gegevens vastgelegd door een Innoviz-apparaat. Bron: https://www.youtube.com/watch?v=wmcaf_VpsQI
Het resulterende dataset bevatte ongeveer 30.000 beelden en 200.000 verzamelde 3D-punten. De onderzoekers voerden twee tests uit: één waarbij de puntwolkgegevens alleen reflectiviteitsinformatie bevatten; en een tweede, waarbij de puntwolkgegevens twee kanalen hadden, één voor reflectiviteit en één voor afstand.
Voor het eerste experiment werd de GAN getraind tot 50 epochs, waarna overfitting een probleem werd.

GAN-gegenereerde beelden uit het eerste experiment. Links, puntwolkgegevens; in het midden, daadwerkelijke frames uit opgenomen beeldmateriaal, gebruikt als grondwaarheid; rechts, de synthetische voorstellingen gegenereerd door het Generatief Adversariaal Netwerk.
De auteurs merken op:
‘De testset is een compleet nieuwe opname die de GAN’s nooit eerder hebben gezien. Dit werd voorspeld met behulp van alleen reflectiviteitsinformatie van de puntwolk.
‘We hebben gekozen om frames met zwarte auto’s te laten zien, omdat zwarte auto’s meestal moeilijk te detecteren zijn vanuit LiDAR. We kunnen zien dat de generator heeft geleerd om zwarte auto’s te genereren, waarschijnlijk vanuit contextuele informatie, vanwege het feit dat de kleuren en de exacte vormen van objecten in de voorspelde beelden niet identiek zijn aan die in de echte beelden.’
Voor het tweede experiment trainden de auteurs de GAN tot 40 epochs met een batchgrootte van 1, wat resulteerde in een soortgelijke presentatie van ‘representatieve’ zwarte auto’s, die grotendeels uit context werden verkregen. Deze configuratie werd ook gebruikt om een video te genereren die de GAN-gegenereerde beelden (bovenaan, in het voorbeeldbeeld hieronder) toont, samen met de grondwaarheidsbeelden.
Evaluatie
Het gebruikelijke proces van evaluatie en vergelijking met bestaande state-of-the-art was niet mogelijk met dit project, vanwege zijn unieke aard. In plaats daarvan ontwikkelden de onderzoekers een aangepaste metric met betrekking tot de mate waarin auto’s (kleine en voorbijgaande delen van de bronbeelden) worden weergegeven in de uitvoerbeelden.
Zij selecteerden 100 paren LiDAR/ gegenereerde beelden uit elke set en deelden effectief het aantal auto-beelden aanwezig in de bronbeelden door het aantal aanwezig in de synthetische gegevens die werden gegenereerd, waardoor een metrische schaal van 0 tot 1 ontstond.
De auteurs verklaren:
‘De score in beide experimenten lag tussen 0,7 en 0,8. Gezien het feit dat de algemene kwaliteit van de voorspelde beelden lager is dan die van de echte beelden (het is over het algemeen moeilijker om objecten te detecteren in beelden van lagere kwaliteit), geeft deze score aan dat de overgrote meerderheid van de auto’s die aanwezig zijn in de grondwaarheid, ook aanwezig zijn in de voorspelde beelden.’
De onderzoekers concludeerden dat de detectie van zwarte voertuigen, die een probleem vormt voor zowel computerzicht-gebaseerde systemen als voor LiDAR, kan worden uitgevoerd door een gebrek aan gegevens voor secties van het beeld:
‘Het feit dat in voorspelde beelden, kleurinformatie en exacte vormen niet identiek zijn aan de grondwaarheid, suggereert dat de voorspelling van zwarte auto’s voornamelijk wordt afgeleid van contextuele informatie en niet van de LiDAR-reflectiviteit van de punten zelf.
‘We suggereren dat, naast het conventionele LiDAR-systeem, een tweede systeem dat foto-realistische beelden gegenereert vanuit LiDAR-puntwolken, tegelijkertijd zou moeten worden uitgevoerd voor visuele objectherkenning in real-time.’
De onderzoekers zijn van plan om het werk in de toekomst verder te ontwikkelen, met grotere datasets.
Latentie en de drukke SDV-verwerkingstack
Een commentator op de veel gedeelde Twitter-post van de Autopilot-crash schatte dat, met een snelheid van ongeveer 120 km/u (180 voet per seconde), een video-feed die tegen 20fps werkt, slechts 1,7 meter per frame zou dekken. Echter, als het voertuig Tesla’s laatste hardware en software zou hebben, zou de framefrequentie 36fps (voor de hoofdcamera) zijn, waardoor de evaluatiesnelheid op 180 voet per seconde (drie voet per frame) zou komen.
Naast de kosten en ergonomie is het probleem met het gebruik van LiDAR als aanvullende gegevensstroom de enorme hoeveelheid informatie die naar de SDV-verwerkingframework moet worden verwerkt. In combinatie met de kritieke aard van de taak lijkt dit radar en LiDAR uit de Autopilot-stack te hebben verwijderd ten gunste van beeld-gebaseerde evaluatiemethoden.
Daarom lijkt het onwaarschijnlijk dat een systeem dat LiDAR gebruikt – wat op zichzelf al een verwerkingsbottleneck voor Autopilot zou toevoegen – om foto-realistische beelden af te leiden, haalbaar is vanuit Tesla’s perspectief.
Tesla-oprichter Elon Musk is geen absolute criticus van LiDAR, die hij aangeeft wordt gebruikt door SpaceX voor dockingsprocedures, maar vindt dat de technologie ‘zonder waarde’ is voor zelfrijdende voertuigen. Musk stelt dat een doorbraak-golflengte, zoals de ~4mm van precisieradar, nuttiger zou zijn.
Evenwel, vanaf juni 2021 zijn Tesla-voertuigen niet uitgerust met radar. Er lijken op dit moment weinig projecten te zijn die zijn ontworpen om beeldstromen te genereren vanuit radar op dezelfde manier als het huidige Israëlische project (hoewel het Amerikaanse ministerie van Energie één poging sponsorde voor radar-gebaseerde GAN-beelden in 2018).
Publicatie op 23 december 2021.












