มุมมองของ Anderson

การแปลง LiDAR เป็นภาพ Photo-Real ด้วยเครือข่าย Generative Adversarial

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

เมื่อต้นสัปดาห์ที่ผ่านมา มีการเผยแพร่คลิปวิดีโอ คลิปวิดีโอ ที่แสดงถึงระบบ Autopilot ของ Tesla ที่ชนเข้ากับยานพาหนะที่หยุดนิ่งอยู่บนถนนสูงในเดือนมิถุนายน 2021 ความจริงที่ว่ายานพาหนะนั้นมีสีดำและยากที่จะสังเกตเห็นได้ทำให้เกิดการอภิปราย การอภิปราย เกี่ยวกับข้อจำกัดของการอาศัยการมองเห็นของคอมพิวเตอร์ในสถานการณ์การขับขี่อัตโนมัติ

คลิปวิดีโอที่เผยแพร่ในเดือนธันวาคม 2021 แสดงถึงช่วงเวลาของการชน

คลิปวิดีโอที่เผยแพร่ในเดือนธันวาคม 2021 แสดงถึงช่วงเวลาของการชน Source: https://twitter.com/greentheonly/status/1473307236952940548

แม้ว่าคลิปวิดีโอที่มีการบีบอัดจะทำให้ได้ภาพที่เกินจริงเล็กน้อยเกี่ยวกับวิธีการที่รถบรรทุกที่หยุดนิ่ง “หลบ” ไปยังคนขับในกรณีนี้ แต่คลิปวิดีโอที่มีคุณภาพสูงกว่าของเหตุการณ์เดียวกันแสดงให้เห็นว่าคนขับที่ตื่นตัวเต็มที่ก็จะยังคงพบปัญหาในการตอบสนองด้วยการหักเลี้ยวหรือการเบรกที่ไม่เพียงพอ

คลิปวิดีโอนี้เพิ่มความขัดแย้งเกี่ยวกับการตัดสินใจของ Tesla ในการ ลบรाडาร์ สำหรับ Autopilot ซึ่งประกาศในเดือนพฤษภาคม 2021 และทัศนคติในการ เลือกระบบที่อาศัยการมองเห็น มากกว่าเทคโนโลยี echo-location เช่น LiDAR

โดยความบังเอิญ วิจัยใหม่จากอิสราเอลในเดือนนี้เสนอวิธีการที่จะรวมโดเมน LiDAR และการมองเห็นของคอมพิวเตอร์ โดยการแปลง LiDAR point clouds เป็นภาพ photo-real ด้วยการใช้เครือข่าย Generative Adversarial (GAN)

ในโครงการใหม่จากอิสราเอล รถยนต์สีดำที่ระบุใน LiDAR footage ถูกแปลงเป็น 'สถานการณ์กลางวัน' สำหรับการวิเคราะห์โดยอาศัยการมองเห็นของคอมพิวเตอร์

ในโครงการใหม่จากอิสราเอล รถยนต์สีดำที่ระบุใน LiDAR footage ถูกแปลงเป็น ‘สถานการณ์กลางวัน’ สำหรับการวิเคราะห์โดยอาศัยการมองเห็นของคอมพิวเตอร์ Source: https://arxiv.org/pdf/2112.11245.pdf

นักวิจัยระบุว่า:

‘โมเดลของเราทำให้สามารถคาดการณ์ภาพที่มีลักษณะเหมือนจริงจากข้อมูล point cloud ได้ แม้กระทั่งภาพที่มีรถยนต์สีดำ’

‘รถยนต์สีดำมีความยากในการตรวจจับโดยตรงจาก point cloud เนื่องจากมีการสะท้อนแสง thấp การเข้าใกล้นี้อาจใช้ในการจดจำวัตถุโดยการมองเห็นของคอมพิวเตอร์บนภาพ photo-real ที่สร้างจาก LiDAR point clouds’

ภาพ Photo-Real ที่สร้างจาก LiDAR

วิจัยใหม่ วิจัยใหม่ มีชื่อเรื่องว่า การสร้างภาพ photo-real จาก LiDAR point clouds ด้วยเครือข่าย Generative Adversarial และมาจากนักวิจัย 7 คนจาก 3 สถาบันการศึกษาอิสราเอล ร่วมกับนักวิจัย 6 คนจาก Innoviz Technologies

นักวิจัยตั้งเป้าที่จะค้นหาว่า GAN สามารถสร้างภาพสังเคราะห์ได้จาก point clouds ที่สร้างโดย LiDAR systems ในอัตราที่เหมาะสม เพื่อให้สามารถใช้ในการจดจำวัตถุและแบ่งส่วนข้อมูลได้

ข้อมูล

แนวคิดหลักคือการฝึกโมเดลบนข้อมูลที่จับคู่กัน โดย LiDAR point cloud images (ที่อาศัยแสงจากอุปกรณ์) ถูกฝึกกับเฟรมที่ตรงกันจากกล้องหน้า

เนื่องจากคลิปวิดีโอนี้ถ่ายทำในเวลากลางวัน ซึ่งระบบการมองเห็นของคอมพิวเตอร์สามารถแยกยานพาหนะสีดำที่ยากจะสังเกตได้ (เช่น ยานพาหนะที่ Tesla ชนในเดือนมิถุนายน) การฝึกนี้ควรให้ข้อมูลพื้นฐานที่มีความน่าเชื่อถือมากกว่าในสถานการณ์ที่มีแสงไม่เพียงพอ

ข้อมูลนี้ถูกเก็บโดยใช้ LiDAR sensor InnovizOne ซึ่งมีอัตราการบันทึก 10fps หรือ 15fps ขึ้นอยู่กับรุ่น

ข้อมูล LiDAR ที่บันทึกโดยอุปกรณ์ Innoviz

ข้อมูล LiDAR ที่บันทึกโดยอุปกรณ์ Innoviz Source: https://www.youtube.com/watch?v=wmcaf_VpsQI

ชุดข้อมูลที่ได้ประกอบด้วยภาพประมาณ 30,000 ภาพและจุด 3D ประมาณ 200,000 จุด นักวิจัยได้ทำการทดลองสองครั้ง: ครั้งแรกโดยใช้ข้อมูล point cloud ที่มีเพียงข้อมูลการสะท้อนแสง และครั้งที่สองโดยใช้ข้อมูล point cloud ที่มีทั้งข้อมูลการสะท้อนแสงและข้อมูลระยะทาง

ในการทดลองครั้งแรก GAN ถูกฝึกเป็น 50 epochs หลังจากที่พบว่ามีการ overfitting

ภาพที่สร้างโดย GAN จากการทดลองครั้งแรก

ภาพที่สร้างโดย GAN จากการทดลองครั้งแรก

นักวิจัยระบุว่า:

‘ชุดข้อมูลทดสอบเป็นบันทึกใหม่ที่ GAN ไม่เคยเห็นมาก่อน การคาดการณ์นี้ทำได้โดยใช้เพียงข้อมูลการสะท้อนแสงจาก point cloud’

‘เราเลือกแสดงเฟรมที่มีรถยนต์สีดำเพราะรถยนต์สีดำมักยากที่จะตรวจจับจาก LiDAR เราสามารถเห็นว่าเครื่องกำเนิดได้เรียนรู้ที่จะสร้างรถยนต์สีดำ โดยอาจมาจากข้อมูลบริบท เนื่องจากสีและรูปร่างของวัตถุในภาพที่คาดการณ์ไม่เหมือนกับในภาพจริง’

ในการทดลองครั้งที่สอง นักวิจัยฝึก GAN เป็น 40 epochs โดยมีขนาด batch 1 ซึ่งให้ผลลัพธ์ที่คล้ายกันในการสร้างรถยนต์สีดำจากข้อมูลบริบท

การประเมิน

กระบวนการประเมินและการเปรียบเทียบกับผลงานที่ดีที่สุดในปัจจุบันไม่สามารถทำได้ในโครงการนี้ เนื่องจากมีลักษณะเฉพาะตัว นักวิจัยจึงออกแบบมาตรการประเมินแบบกำหนดเองเกี่ยวกับระดับที่รถยนต์ถูกแสดงในภาพที่สร้างขึ้น

พวกเขาเลือก 100 คู่ของ LiDAR/ภาพที่สร้างขึ้นจากแต่ละชุดและแบ่งจำนวนภาพรถยนต์ที่มีอยู่ในภาพที่สร้างขึ้นออกเป็นจำนวนภาพรถยนต์ที่มีอยู่ในข้อมูลจริง โดยให้มาตรการประเมินระหว่าง 0 ถึง 1

นักวิจัยระบุว่า:

‘คะแนนในการทดลองทั้งสองอยู่ระหว่าง 0.7 ถึง 0.8 เมื่อพิจารณาว่าคุณภาพโดยรวมของภาพที่คาดการณ์ไว้นั้นต่ำกว่าภาพจริง (โดยทั่วไปแล้วการตรวจจับวัตถุในภาพที่มีคุณภาพต่ำกว่านั้นยากกว่า) คะแนนนี้บ่งชี้ว่ารถยนต์ส่วนใหญ่ที่ปรากฏในภาพจริงก็ปรากฏในภาพที่คาดการณ์ไว้’

นักวิจัยสรุปว่าการตรวจจับรถยนต์สีดำ ซึ่งเป็นปัญหาสำหรับทั้งระบบการมองเห็นของคอมพิวเตอร์และ LiDAR สามารถทำได้โดยการตรวจจับ การขาด ข้อมูลในบางส่วนของภาพ:

‘การคาดการณ์รถยนต์สีดำในภาพที่คาดการณ์ไว้น่าจะมาจากข้อมูลบริบท ไม่ใช่จากข้อมูลการสะท้อนแสงจาก LiDAR’

‘เราขอแนะนำว่า除了ระบบ LiDAR ที่มีอยู่แล้ว ระบบที่สองที่สร้างภาพ photo-real จาก LiDAR point clouds ควรทำงานพร้อมกันสำหรับการจดจำวัตถุโดยการมองเห็นของคอมพิวเตอร์แบบเรียลไทม์’

นักวิจัยตั้งเป้าที่จะพัฒนางานนี้ในอนาคต โดยใช้ชุดข้อมูลที่ใหญ่ขึ้น

ความล่าช้าและกระบวนการประมวลผล SDV ที่แออัด

ผู้แสดงความคิดเห็นในโพสต์ทวิตเตอร์ที่มีการแชร์อย่างกว้างขวางเกี่ยวกับการชนของ Autopilot คาดการณ์ว่า หากรถยนต์เดินทางด้วยความเร็วประมาณ 75mph (110 ฟุตต่อวินาที) ฟีดวิดีโอที่ทำงานที่ 20fps จะครอบคลุมเพียง 5.5 ฟุตต่อเฟรม อย่างไรก็ตาม หากรถยนต์ใช้ฮาร์ดแวร์และซอฟต์แวร์ล่าสุดของ Tesla อัตราเฟรมจะอยู่ที่ 36fps (สำหรับกล้องหลัก) ซึ่งทำให้อัตราการประเมินอยู่ที่ 110 ฟุตต่อวินาที (สามฟุตต่อเฟรม)

นอกเหนือจากปัญหาเรื่องต้นทุนและอุปกรณ์แล้ว ปัญหาในการใช้ LiDAR เป็นข้อมูลเสริมคือปริมาณข้อมูลที่มากเกินไปที่เข้าสู่กระบวนการประมวลผล SDV ซึ่งรวมกับลักษณะที่สำคัญของงาน ทำให้ LiDAR และราดาร์ถูกตัดออกจากกระบวนการ Autopilot เพื่อใช้วิธีการประเมินโดยอาศัยภาพแทน

ดังนั้น จึงดูไม่น่าจะเป็นไปได้ที่ระบบที่ใช้ LiDAR เพื่อสร้างภาพ photo-real จะเป็นไปได้จากมุมมองของ Tesla

ผู้ก่อตั้ง Tesla เอลอน มัสก์ ไม่ได้วิพากษ์วิจารณ์ LiDAR โดยตรง ซึ่งเขาระบุว่า ใช้โดย SpaceX สำหรับกระบวนการเชื่อมต่อ แต่เขาพิจารณาว่าเทคโนโลยีนี้ ‘ไม่มีประโยชน์’ สำหรับรถยนต์ไร้คนขับ มัสก์แนะนำว่าความยาวคลื่นที่สามารถทะลุทะลวงได้ เช่น ราดาร์ที่มีความแม่นยำ ~4mm จะมีประโยชน์มากกว่า

อย่างไรก็ตาม ในเดือนมิถุนายน 2021 รถยนต์ Tesla ไม่ได้ติดตั้งราดาร์ ไม่มีโครงการที่ออกแบบมาเพื่อสร้างภาพสตรีมจากราดาร์เหมือนกับโครงการอิสราเอลในปัจจุบัน (แม้ว่ากระทรวงพลังงานสหรัฐฯ สนับสนุน โครงการหนึ่งสำหรับภาพสตรีมจากราดาร์ในปี 2018)

 

เผยแพร่ครั้งแรกเมื่อวันที่ 23 ธันวาคม 2021

 

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai