Unghiul lui Anderson
Conversia LiDAR în Imagini Foto-Realiste cu o Rețea Adversarială Generativă

La începutul acestei săptămâni, a fost lansat un film care arată un sistem de pilotaj automat Tesla care se ciocnește direct cu o mașină oprită pe o autostradă în iunie 2021. Faptul că mașina era întunecată și dificil de discernut a provocat discuții despre limitările încrederii în viziunea computerizată în scenariile de conducere autonomă.

Filmul lansat în decembrie 2021 arată momentul impactului. Sursă: https://twitter.com/greentheonly/status/1473307236952940548
Deși compresia video în filmul larg răspândit dă o impresie ușor exagerată despre cât de repede mașina imobilizată “a apărut” în fața șoferului în acest caz, un film de calitate superioară a aceluiași eveniment demonstrează că un șofer complet atent ar fi avut dificultăți în a răspunde cu altceva decât o manevră tardivă sau o frânare semi-eficientă.
Filmul adaugă la controversa din jurul deciziei Tesla de a înlătura senzorii radar pentru Autopilot, anunțată în mai 2021, și poziția sa cu privire la favorizarea sistemelor bazate pe viziune în detrimentul altor tehnologii de eco-locare, cum ar fi LiDAR.
Prin coincidență, o nouă lucrare de cercetare din Israel, lansată săptămâna aceasta, oferă o abordare pentru a combina domeniile LiDAR și viziunea computerizată, prin conversia norilor de puncte LiDAR în imagini foto-reale cu ajutorul unei rețele adverse generative (GAN).

În noul proiect din Israel, mașinile negre identificate în imagini LiDAR sunt convertite într-un scenariu ‘zi’ pentru analize bazate pe viziunea computerizată, similar cu abordarea pe care Tesla o urmează pentru dezvoltarea sistemului său Autopilot. Sursă: https://arxiv.org/pdf/2112.11245.pdf
Autorii afirmă:
‘Modelele noastre au învățat să prevadă imagini realiste din datele norului de puncte, chiar și imagini cu mașini negre.
‘Mașinile negre sunt dificil de detectat direct din norul de puncte din cauza nivelului lor scăzut de reflectivitate. Această abordare ar putea fi utilizată în viitor pentru recunoașterea obiectelor vizuale pe imagini foto-reale generate din nori de puncte LiDAR.’
Imagini Foto-Reale, Bazate pe LiDAR
Noua lucrare, intitulată Generarea de imagini foto-reale din nori de puncte LiDAR cu rețele adverse generative, provine de la șapte cercetători de la trei facultăți academice israeliene, împreună cu șase cercetători de la Innoviz Technologies din Israel.
Cercetătorii au încercat să descopere dacă imagini sintetice bazate pe GAN pot fi produse la o rată adecvată din norii de puncte generați de sistemele LiDAR, astfel încât fluxul de imagini rezultat să poată fi utilizat în fluxuri de lucru de recunoaștere a obiectelor și segmentare semantică.
Date
Ideea centrală, ca și în multe alte proiecte de transliterare a imaginilor, este de a antrena un algoritm pe date pereche, unde imagini nor de puncte LiDAR (care se bazează pe lumina emisă de dispozitiv) sunt antrenate împotriva unui cadru corespunzător dintr-o cameră frontală.
Deoarece filmarea a fost făcută în timpul zilei, unde un sistem de viziune computerizată poate individua mai ușor un vehicul negru (cum a fost cazul cu mașina în care Tesla s-a ciocnit în iunie), acest antrenament ar trebui să ofere o bază solidă care este mai rezistentă la condiții întunecate.
Datele au fost colectate cu un senzor LiDAR InnovizOne, care oferă o rată de capturare de 10fps sau 15fps, în funcție de model.

Date LiDAR capturate de un dispozitiv Innoviz. Sursă: https://www.youtube.com/watch?v=wmcaf_VpsQI
Rezultatul a fost un set de date care conține aproximativ 30.000 de imagini și 200.000 de puncte 3D colectate. Cercetătorii au efectuat două teste: unul în care datele norului de puncte conțineau doar informații de reflectivitate; și un al doilea, în care datele norului de puncte aveau două canale, unul pentru reflectivitate și unul pentru distanță.
Pentru primul experiment, GAN a fost antrenat pentru 50 de epoci, după care s-a observat suprantrenarea.

Imagini create de GAN din primul experiment. În stânga, date nor de puncte; în mijloc, cadre reale din filmarea capturată, utilizate ca bază de adevăr; dreapta, reprezentările sintetice create de rețeaua adversarială generativă.
Autorii comentează:
‘Setul de test este o înregistrare complet nouă pe care GAN nu a văzut-o niciodată înainte de test. Acesta a fost prezis utilizând doar informații de reflectivitate din norul de puncte.
‘Am ales să arătăm cadre cu mașini negre pentru că mașinile negre sunt de obicei dificil de detectat din LiDAR. Putem vedea că generatorul a învățat să genereze mașini negre, probabil din informații contextuale, din cauza faptului că culorile și formele exacte ale obiectelor din imagini prezise nu sunt identice cu cele din imagini reale.’
Pentru al doilea experiment, autorii au antrenat GAN pentru 40 de epoci, la o dimensiune a lotului de 1, obținând o prezentare similară a ‘reprezentărilor’ mașinilor negre, obținute în mare parte din context. Această configurație a fost utilizată și pentru a genera un film care arată imagini generate de GAN (prezentate sus, în imaginea de exemplu de mai jos) împreună cu filmarea de bază de adevăr.
Evaluare
Procesul obișnuit de evaluare și comparare cu cele mai bune rezultate actuale nu a fost posibil în acest proiect, din cauza naturii sale unice. În schimb, cercetătorii au conceput o metrică personalizată cu privire la măsura în care mașinile (părți minore și trecătoare ale filmării sursă) sunt reprezentate în filmarea de ieșire.
Ei au selectat 100 de perechi de imagini LiDAR/Generate din fiecare set și au împărțit efectiv numărul de imagini cu mașini prezente în filmarea sursă la numărul de imagini prezente în datele sintetice produse, producând o scară metrică de la 0 la 1.
Autorii afirmă:
‘Scorul în ambele experimente a fost între 0,7 și 0,8. Luând în considerare faptul că calitatea generală a imaginilor prezise este mai mică decât cea a imaginilor reale (este mai dificil în general să detectați obiecte în imagini de calitate mai mică), acest scor indică faptul că majoritatea mașinilor prezente în filmarea de bază de adevăr sunt prezente în imaginile prezise.’
Cercetătorii au concluzionat că detectarea vehiculelor negre, care este o problemă atât pentru sistemele bazate pe viziunea computerizată, cât și pentru LiDAR, poate fi realizată prin identificarea unei lipsi de date pentru secțiuni ale imaginii:
‘Faptul că în imaginile prezise, informațiile de culoare și formele exacte ale obiectelor nu sunt identice cu cele din filmarea de bază de adevăr, sugerează că prezicerea mașinilor negre se bazează în principal pe informații contextuale și nu pe reflectivitatea punctelor LiDAR în sine.
‘Sugerez că, pe lângă sistemul LiDAR convențional, un al doilea sistem care generează imagini foto-reale din nori de puncte LiDAR ar trebui să ruleze simultan pentru recunoașterea obiectelor vizuale în timp real.’
Cercetătorii intenționează să dezvolte lucrarea în viitor, cu seturi de date mai mari.
Latency și Stiva Aglomerată de Procesare SDV
Un comentator pe postarea de pe Twitter a accidentului Autopilot a estimat că, călătorind cu aproximativ 75 mph (110 picioare pe secundă), un flux de video care rulează la 20fps ar acoperi doar 5,5 picioare pe cadru. Cu toate acestea, dacă vehiculul rulează cu cel mai recent hardware și software Tesla, rata de cadre ar fi fost de 36fps (pentru camera principală), ceea ce stabilește rata de evaluare la 110 picioare pe secundă (trei picioare pe cadru).
Pe lângă cost și ergonomie, problema utilizării LiDAR ca flux de date suplimentar este scala uriașă a “ambuteiajului” informațional de intrare în cadrul framework-ului de procesare SDV. În combinație cu natura critică a sarcinii, acest lucru pare să fi forțat radarul și LiDAR să fie scoase din stiva Autopilot în favoarea metodelor de evaluare bazate pe imagine.
Prin urmare, pare puțin probabil ca un sistem care utilizează LiDAR – care în sine ar adăuga la o blocaj de procesare în Autopilot – pentru a infera imagini foto-reale să fie fezabil din punctul de vedere al Tesla.
Founderul Tesla, Elon Musk, nu este un critic înfocat al LiDAR, pe care el subliniază că este utilizat de SpaceX pentru proceduri de andocare, dar consideră că tehnologia este ‘inutilă’ pentru vehicule autonome. Musk sugerează că o lungime de undă care pătrunde în ocultație, cum ar fi cea de ~4mm a radarului de precizie, ar fi mai utilă.
Cu toate acestea, începând cu iunie 2021, vehiculele Tesla nu sunt echipate cu radar. Nu par a fi multe proiecte concepute pentru a genera fluxuri de imagini din radar în același mod în care încearcă proiectul israelian actual (deși Departamentul de Energie al SUA a sponsorizat o încercare de a genera imagini GAN din surse radar în 2018).
Publicat pentru prima dată pe 23 decembrie 2021.












