Kąt Andersona
Konwersja LiDAR na zdjęcia o wysokiej jakości z wykorzystaniem sieci generatywnej i przeciwnej

W zeszłym tygodniu opublikowano nagranie, które pokazuje, jak system autopilota Tesli uderzył prosto w bok zatrzymanego pojazdu na autostradzie w czerwcu 2021 roku. Fakt, że samochód był ciemny i trudny do rozpoznania, wywołał dyskusję na temat ograniczeń polegania na komputerowym widzeniu w scenariuszach jazdy autonomicznej.

Nagranie opublikowane w grudniu 2021 roku pokazuje moment uderzenia. Źródło: https://twitter.com/greentheonly/status/1473307236952940548
Mimo że kompresja wideo w szeroko rozpowszechnionym nagraniu daje nieco wyolbrzymiony wrażenie, jak szybko zatrzymany ciągnik “wynurzył się” w tym przypadku, nagranie o wyższej jakości tego samego zdarzenia pokazuje, że nawet całkowicie czujny kierowca miałby trudności z reakcją inną niż spóźniona skręt lub półskuteczne hamowanie.
Nagranie to dodaje do kontrowersji wokół decyzji Tesli o usunięciu czujników radarowych dla Autopilota, ogłoszonej w maju 2021 roku, oraz jej stanowiska w sprawie preferowania systemów opartych na widzeniu nad innymi technologiami echolokacji, takimi jak LiDAR.
Przez przypadek, nowy artykuł badawczy z Izraela przedstawia podejście, które pozwala na mostowanie domen LiDAR i komputerowego widzenia, poprzez konwersję chmur punktów LiDAR na zdjęcia o wysokiej jakości z wykorzystaniem sieci generatywnej i przeciwnej (GAN).

W nowym projekcie z Izraela, czarne samochody wykryte w nagraniu LiDAR są konwertowane na “scenariusz dziennej” dla analiz opartych na komputerowym widzeniu, podobnie jak to, co Tesla robi w ramach rozwoju swojego systemu Autopilota. Źródło: https://arxiv.org/pdf/2112.11245.pdf
Autorzy stwierdzają:
‘Nasze modele nauczyły się przewidywać realistyczne obrazy z samych chmur punktów, nawet obrazy z czarnymi samochodami.
‘Czarne samochody są trudne do wykrycia bezpośrednio z chmur punktów z powodu ich niskiego poziomu odbicia. To podejście może być użyte w przyszłości do rozpoznawania obiektów wizualnych na zdjęciach o wysokiej jakości wygenerowanych z chmur punktów LiDAR.’
Zdjęcia o wysokiej jakości, oparte na LiDAR
Nowy artykuł badawczy nosi tytuł Generowanie zdjęć o wysokiej jakości z chmur punktów LiDAR z wykorzystaniem sieci generatywnej i przeciwnej, i pochodzi od siedmiu badaczy z trzech izraelskich wydziałów akademickich, wraz z sześcioma badaczami z izraelskiej firmy Innoviz Technologies.
Badacze postanowili sprawdzić, czy syntetyczne obrazy mogą być wytwarzane w odpowiedniej szybkości z chmur punktów generowanych przez systemy LiDAR, tak aby następnie mogły być one użyte w przetwarzaniu obiektów i segmentacji semantycznej.
Dane
Główna idea, jak w wielu nowych projektach transliteracji obrazu, polega na tym, aby przeszkolić algorytm na danych sparowanych, gdzie obrazy chmur punktów LiDAR (które polegają na świetle emitowanym przez urządzenie) są szkolone przeciwko odpowiadającemu kadrowi z kamery przedniej.
Ponieważ nagranie zostało wykonane w ciągu dnia, gdzie system komputerowego widzenia może łatwiej rozpoznać czarny samochód (taki jak ten, w który uderzył Tesla w czerwcu), to szkolenie powinno dostarczyć centralną prawdę, która jest bardziej odporna na ciemne warunki.
Dane zostały zebrane przy użyciu czujnika LiDAR InnovizOne, który oferuje szybkość przechwytywania 10 klatek na sekundę lub 15 klatek na sekundę, w zależności od modelu.

Dane LiDAR przechwycone przez urządzenie Innoviz. Źródło: https://www.youtube.com/watch?v=wmcaf_VpsQI
Wynikowy zestaw danych zawierał około 30 000 obrazów i 200 000 punktów 3D. Badacze przeprowadzili dwa testy: jeden, w którym dane chmury punktów zawierały tylko informacje o odbiciu; i drugi, w którym dane chmury punktów miały dwa kanały, po jednym dla odbicia i odległości.
Dla pierwszego eksperymentu, sieć GAN została przeszkolona do 50 epok, po czym nastąpiło przeuczenie.

Obrazy wygenerowane przez sieć GAN w pierwszym eksperymencie. Po lewej, dane chmury punktów; w środku, rzeczywiste klatki z nagrania, użyte jako prawda; po prawej, syntetyczne reprezentacje wygenerowane przez sieć GAN.
Autorzy komentują:
‘Zestaw testowy jest zupełnie nowym nagraniem, które sieci GAN nigdy wcześniej nie widziały. To zostało przewidziane z wykorzystaniem tylko informacji o odbiciu z chmury punktów.
‘Wybraliśmy pokazać klatki z czarnymi samochodami, ponieważ czarne samochody są zwykle trudne do wykrycia z LiDAR. Można zobaczyć, że generator nauczył się generować czarne samochody, prawdopodobnie z informacji kontekstowych, z powodu faktu, że kolory i dokładne kształty obiektów w przewidywanych obrazach nie są identyczne jak w rzeczywistych obrazach.’
Dla drugiego eksperymentu, autorzy przeszkolili sieć GAN do 40 epok przy rozmiarze partii 1, co dało podobne przedstawienie “przedstawicielskich” czarnych samochodów, uzyskanych głównie z kontekstu. Ta konfiguracja została również użyta do wygenerowania wideo, które pokazuje nagranie wygenerowane przez sieć GAN (pokazane powyżej, w przykładowym obrazie poniżej) wraz z nagraniem prawdy.
Ocena
Zwykły proces oceny i porównania z istniejącym stanem sztuki nie był możliwy w tym projekcie, ze względu na jego unikalną naturę. Zamiast tego badacze opracowali niestandardową miarę dotyczącą stopnia, w jakim samochody (drobne i ulotne części nagrania) są reprezentowane w wyjściowym nagraniu.
Wybrali 100 par obrazów LiDAR/wygenerowanych z każdego zestawu i podzielili liczbę obrazów samochodów obecnych w nagraniu źródłowym przez liczbę obecnych w syntetycznych danych, co dało skalę miary od 0 do 1.
Autorzy stwierdzają:
‘Wynik w obu eksperymentach wyniósł między 0,7 a 0,8. Biorąc pod uwagę fakt, że ogólna jakość przewidywanych obrazów jest niższa niż rzeczywistych obrazów (jest to ogólnie trudniejsze do wykrycia obiektów w obrazach o niższej jakości), ten wynik wskazuje, że ogromna większość samochodów obecnych w prawdzie jest również obecna w przewidywanych obrazach.’
Badacze doszli do wniosku, że wykrywanie czarnych pojazdów, które jest problemem zarówno dla systemów opartych na komputerowym widzeniu, jak i dla LiDAR, może być osiągnięte przez identyfikację braku danych dla sekcji obrazu:
‘Fakt, że w przewidywanych obrazach informacje o kolorze i dokładne kształty obiektów nie są identyczne jak w prawdzie, sugeruje, że przewidywanie czarnych samochodów jest w dużej mierze pochodną informacji kontekstowych, a nie samej odbicia LiDAR.
‘Sugerujemy, że oprócz konwencjonalnego systemu LiDAR, drugi system, który generuje obrazy o wysokiej jakości z chmur punktów LiDAR, powinien działać równolegle do rozpoznawania obiektów wizualnych w czasie rzeczywistym.’
Badacze zamierzają rozwijać tę pracę w przyszłości, z większymi zestawami danych.
Opóźnienie i zatłoczony stos przetwarzania SDV
Jeden z komentujących na szeroko rozpowszechnionym poście na Twitterze o wypadku Autopilota oszacował, że, poruszając się z prędkością około 120 km/h (180 stóp na sekundę), strumień wideo o częstotliwości 20 klatek na sekundę pokrywałby tylko 1,7 metra na klatkę. Jednakże, jeśli pojazd był wyposażony w najnowsze urządzenia i oprogramowanie Tesli, częstotliwość klatek wynosiłaby 36 klatek na sekundę (dla głównej kamery), co dawałoby szybkość oceny na poziomie 180 stóp na sekundę (3 stopy na klatkę).
Ponadto, problemem z użyciem LiDAR jako dodatkowego strumienia danych jest ogromna skala “zatoru informacyjnego” wejścia danych do ramy przetwarzania SDV. W połączeniu z krytyczną naturą zadania, wydaje się, że to zmusiło radar i LiDAR do wycofania się z stosu Autopilota na rzecz metod oceny opartych na obrazie.
W związku z tym wydaje się mało prawdopodobne, że system wykorzystujący LiDAR – który sam w sobie dodawałby do wąskiego gardła przetwarzania w Autopilocie – do wnioskowania o zdjęciach o wysokiej jakości, jest wykonalny z punktu widzenia Tesli.
Założyciel Tesli, Elon Musk, nie jest bezwzględnym krytykiem LiDAR, który zauważa, że technologia ta jest używana przez SpaceX do procedur dokowania, ale uważa, że jest “bezcelowa” dla pojazdów samochodowych. Musk sugeruje, że długość fali przenikającej osłony, taka jak ~4mm precyzyjnego radaru, byłaby bardziej przydatna.
Jednakże, od czerwca 2021 roku, pojazdy Tesli nie są wyposażone w radar. Nie wydaje się, aby istniały projekty, które generują strumienie obrazów z radaru w taki sam sposób, jak obecny projekt izraelski (chociaż Departament Energii USA sponsorował jeden próbę radaru źródłowego GAN w 2018 roku).
Pierwotnie opublikowane 23 grudnia 2021.












