Anderson’un Açısı
LiDAR’ı Foto-Gerçek Görüntülere Dönüştürmek için Oluşturucu Karşıt Ağ

Geçen hafta, bir Tesla otomatik pilot sistemi’nin 2021 Haziran’ında bir otoyolda duran bir araca doğrudan çarptığını gösteren bir video yayımlandı. Aracın karanlık ve zor seçilebiliyor olması, otonom sürüş senaryolarında bilgisayar vizyonuna güvenmenin sınırları hakkında tartışmaya neden oldu.

Aralık 2021’de yayımlanan video, çarpma anını gösteriyor. Kaynak: https://twitter.com/greentheonly/status/1473307236952940548
Video sıkıştırma, yaygın olarak paylaşılan videoda, immobilize edilmiş kamyonun sürücüye nasıl “sürpriz” bir şekilde yaklaştığını biraz abartmış olsa da, aynı olayın daha yüksek kaliteli bir videosu, tam olarak uyanık bir sürücünün de sadece geç bir dönüş veya yarı etkili frenleme ile cevap verebileceğini gösteriyor.
Tesla’nın, Mayıs 2021’de duyurduğu, Otomatik Pilot için radar sensörlerini kaldırma kararına ve LiDAR gibi diğer echo-location teknolojileri yerine vizyon tabanlı sistemleri tercih etme tutumuna ilişkin tartışmalara bu video da eklenmiştir.
İsrail’den bu hafta gelen bir yeni araştırma makalesi, LiDAR ve bilgisayar vizyonu alanlarını birleştirmek için bir yaklaşım sunuyor. Bu yaklaşım, LiDAR nokta bulutlarını foto-gerçek görüntülere dönüştürmek için Oluşturucu Karşıt Ağ (GAN) kullanıyor.

İsrail’den yeni projede, LiDAR görüntülerindeki siyah arabalar, bilgisayar vizyonu tabanlı analizler için ‘gündüz’ senaryosuna dönüştürülüyor. Kaynak: https://arxiv.org/pdf/2112.11245.pdf
Araştırmacılar şöyle diyor:
‘Modellerimiz, sadece nokta bulut verisinden gerçekçi görünen görüntüleri.predict edebildi. Hatta siyah arabalı görüntüler bile.
‘Siyah arabalar, düşük yansıtma seviyeleri nedeniyle doğrudan nokta bulutlarından tespit edilmeleri zor. Bu yaklaşım, gelecekte LiDAR nokta bulutlarından üretilen foto-gerçek görüntüler üzerinde görsel nesne tanıma için kullanılabilir.’
Foto-Gerçek, LiDAR Tabanlı Görüntü Akışları
Yeni makale, Oluşturucu Karşıt Ağlar ile LiDAR Nokta Bulutlarından Foto-Gerçek Görüntüler Üretimi başlığını taşıyor ve İsrail’deki üç akademik kurumdan yedi araştırmacı ile İsrail merkezli Innoviz Technologies’ ten altı araştırmacının ortak çalışması.
Araştırmacılar, LiDAR sistemleri tarafından üretilen nokta bulutlarından sentetik görüntülerin, nesne tanıma ve anlamsal segmentasyon işlemlerinde kullanılacak bir hızda üretilebileceğini keşfetmek için bir GAN tabanlı yaklaşım geliştirdiler.
Veri
Bu projenin temel fikri, birçok yeni [x] > [x] görüntü transliterasyon projesinde olduğu gibi, LiDAR nokta bulut görüntülerini (cihazdan yayılan ışıkla çalışan) bir ön kamera çerçevesiyle eşleştirerek bir algoritmayı eğitmek.
Çekilen görüntüler gündüz saatlerinde çekildiği için, bir bilgisayar vizyonu sistemi daha kolay bir şekilde individuate edebilir, bu da daha az zorlu bir temel gerçeklik sağlar.
Veriler, 10fps veya 15fps hızında çekim yapabilen InnovizOne LiDAR sensörü ile toplandı.

Innoviz cihazıyla alınan LiDAR verileri. Kaynak: https://www.youtube.com/watch?v=wmcaf_VpsQI
Elde edilen veri seti yaklaşık 30.000 görüntü ve 200.000 toplu 3D nokta içeriyordu. Araştırmacılar iki test gerçekleştirdi: birincisi, nokta bulut verilerinin sadece yansıtma bilgilerini taşıdığı bir test ve ikincisi, nokta bulut verilerinin yansıtma ve mesafe bilgilerini taşıdığı bir test.
İlk deney için, GAN 50 epoch’a kadar eğitildi, daha sonra overfitting sorunu görüldü.

İlk deneyden GAN tarafından oluşturulan görüntüler. Solda, nokta bulut verileri; ortada, gerçek çekimlerden alınan çerçeveler, temel gerçeklik olarak kullanıldı; sağda, Oluşturucu Karşıt Ağ tarafından oluşturulan sentetik temsiller.
Araştırmacılar şöyle diyor:
‘Test kümesi, GAN’lerin daha önce hiç görmediği tamamen yeni bir kayıt. Bu, sadece nokta bulutlarının yansıtma bilgilerinden.predict edildi. ‘
‘Siyah arabaları göstermek için çerçeveler seçtik, çünkü siyah arabalar genellikle LiDAR’dan tespit edilmeleri zor. Gördüğünüz gibi, oluşturucu, siyah arabaları, muhtemelen bağlamsal bilgilerden dolayı üretmeyi öğrendi, çünkü predicted görüntülerdeki renk ve şekiller gerçek görüntülerdekiyle aynı değil.’
İkinci deney için, araştırmacılar GAN’i 40 epoch’a kadar, batch size 1’de eğitti ve benzer bir şekilde ‘temsil edilen’ siyah arabaları elde etti. Bu yapılandırma, aynı zamanda GAN tarafından oluşturulan görüntüleri (yukarıdaki örnek görüntüde gösterilen) temel gerçeklik görüntüleri ile birlikte gösteren bir video oluşturmak için kullanıldı.
Değerlendirme
Bu projenin benzersiz doğası nedeniyle, mevcut durumun state-of-the-art ile karşılaştırılması mümkün olmadı. Bunun yerine araştırmacılar, çıktı görüntülerinde araçların temsil edilme oranını ölçen bir özel ölçüt geliştirdiler.
100 adet LiDAR/Üretilen görüntü çiftini seçtiler ve temel gerçeklik görüntülerindeki araç sayısını sentetik verideki araç sayısına böldüler, 0 ile 1 arasında bir ölçek elde ettiler.
Araştırmacılar şöyle diyor:
‘Her iki deneydeki skor 0.7 ile 0.8 arasında oldu. Gerçek görüntülerin genel kalitesinin, predicted görüntülerin kalitesinden daha yüksek olduğu dikkate alındığında, bu skor, temel gerçeklikte bulunan araçların büyük çoğunluğunun predicted görüntülerde de bulunduğunu gösteriyor.’
Araştırmacılar, siyah araçların tespitinin, hem bilgisayar vizyonu tabanlı sistemler hem de LiDAR için bir problem olduğunu, ancak bu problemi, görüntülerdeki veri eksikliğini tespit ederek çözebileceklerini belirtiyorlar:
‘Predicted görüntülerde, renk bilgileri ve exact şekiller, gerçek görüntülerdekiyle aynı değil. Bu, siyah arabaların tespitinin, LiDAR noktalarının yansıtma bilgilerinden değil, daha çok bağlamsal bilgilerden dolayı yapıldığını gösteriyor. ‘
‘LiDAR sistemine ek olarak, LiDAR nokta bulutlarından foto-gerçek görüntüler üreten bir ikinci sistemin, gerçek zamanlı görsel nesne tanıma için eş zamanlı olarak çalışabileceğini öneriyoruz.’
Araştırmacılar, gelecekte daha büyük veri setleri ile çalışmayı planlıyorlar.
Gecikme ve Kalabalık SDV İşleme Yığını
Paylaşılan Twitter postunun yorumcularından biri, yaklaşık 75mph (110 feet/saniye) hızda seyahat ederken, 20fps’lik bir video akışının sadece 5.5 feet/frame’i kapsayabileceğini tahmin etti. Ancak, eğer araç Tesla’nın son donanım ve yazılımını kullanıyorsa, kamera 36fps (ana kamera için) hızında çalışacaktı, bu da 110 feet/saniye (3 feet/frame) değerine karşılık gelir.
Lidar’ın ek bir veri akışı olarak kullanılmasıyla ilgili sorun, sadece maliyet ve ergonomi değil, aynı zamanda sensör girişinin SDV işleme çerçevesine olan büyük ölçekli “trafik sıkışıklığı”dır. Bu, kritik bir görev olan otonom sürüş için radar ve LiDAR’ı görüntü tabanlı değerlendirme yöntemlerine tercih etmelerine neden olmuş gibi görünüyor.
Dolayısıyla, LiDAR’ı foto-gerçek görüntülere dönüştürmek için kullanan bir sistemin, Tesla’nın bakış açısına göre uygulanabilir görünmesi düşük bir olasılık.
Tesla’nın kurucusu Elon Musk, LiDAR’ı tamamen reddetmiyor, ancak otonom araçlar için “anlamsız” olduğunu düşünüyor. Musk, bir occlusion-penetrating wavelength, örneğin ~4mm precision radarın, daha faydalı olacağını söylüyor.
Ancak, Haziran 2021 itibarıyla, Tesla araçları radar ile donatılmıyor. Şu anda, İsrail projesinin denediği gibi radar’dan görüntü akışları üreten projelerin sayısı çok az görünüyor (ABD Enerji Bakanlığı, 2018’de radar kaynaklı GAN görüntüleri için bir girişimi destekledi).
İlk olarak 23 Aralık 2021’de yayımlandı.












