Góc nhìn Anderson
Chuyển đổi LiDAR sang Hình ảnh Photo-Real với Mạng Đối nghịch Sinh

Tuần trước, đoạn video đã được phát hành cho thấy hệ thống tự lái của Tesla va chạm trực tiếp vào bên cạnh một chiếc xe bị đình chỉ trên đường cao tốc vào tháng 6 năm 2021. Việc chiếc xe bị tối và khó phân biệt đã促 đẩy thảo luận về hạn chế của việc dựa vào tầm nhìn máy tính trong các tình huống lái xe tự động.

Đoạn video phát hành vào tháng 12 năm 2021 cho thấy khoảnh khắc va chạm. Nguồn: https://twitter.com/greentheonly/status/1473307236952940548
Mặc dù việc nén video trong đoạn video được chia sẻ rộng rãi cho một ấn tượng hơi phóng đại về việc chiếc xe bị đình chỉ ‘lén’ vào trong trường hợp này, một đoạn video chất lượng cao hơn của cùng một sự kiện cho thấy rằng một tài xế hoàn toàn cảnh giác cũng sẽ gặp khó khăn trong việc phản ứng với bất kỳ điều gì ngoài một cú đánh lái muộn màng hoặc phanh hiệu quả một phần.
Đoạn video này thêm vào tranh cãi xung quanh quyết định của Tesla loại bỏ cảm biến radar cho Autopilot, được công bố vào tháng 5 năm 2021, và quan điểm của họ về ưu tiên hệ thống dựa trên tầm nhìn hơn các công nghệ định vị khác, chẳng hạn như LiDAR.
Ngẫu nhiên, một bài báo nghiên cứu mới từ Israel tuần này cung cấp một cách tiếp cận để kết hợp giữa lĩnh vực LiDAR và tầm nhìn máy tính, bằng cách chuyển đổi điểm mây LiDAR thành hình ảnh photo-real với sự giúp đỡ của một Mạng Đối nghịch Sinh (GAN).

Trong dự án mới từ Israel, các xe hơi màu đen được xác định trong hình ảnh LiDAR được chuyển đổi thành một kịch bản ‘ban ngày’ cho các phân tích dựa trên tầm nhìn máy tính, tương tự như cách tiếp cận mà Tesla đang theo đuổi để phát triển hệ thống Autopilot của mình. Nguồn: https://arxiv.org/pdf/2112.11245.pdf
Các tác giả tuyên bố:
‘Các mô hình của chúng tôi đã học cách dự đoán hình ảnh thực tế từ chỉ dữ liệu điểm mây, thậm chí cả hình ảnh có xe hơi màu đen.
‘Xe hơi màu đen khó phát hiện trực tiếp từ điểm mây vì mức phản xạ thấp của chúng. Cách tiếp cận này có thể được sử dụng trong tương lai để thực hiện nhận dạng đối tượng hình ảnh trên hình ảnh photo-realistic được tạo ra từ điểm mây LiDAR.’
Hình ảnh Photo-Real, Dòng hình ảnh LiDAR-Based
Bài báo mới này có tiêu đề Tạo hình ảnh Photo-realistic từ Điểm mây LiDAR với Mạng Đối nghịch Sinh, và đến từ bảy nhà nghiên cứu tại ba khoa học Israel, cùng với sáu nhà nghiên cứu từ Công ty Innoviz Technologies của Israel.
Các nhà nghiên cứu đã đặt ra để khám phá xem liệu hình ảnh tổng hợp dựa trên GAN có thể được sản xuất tại một tốc độ phù hợp từ điểm mây được tạo ra bởi hệ thống LiDAR, để dòng hình ảnh sau đó có thể được sử dụng trong các công việc nhận dạng đối tượng và phân đoạn ngữ nghĩa.
Dữ liệu
Ý tưởng trung tâm, như trong nhiều dự án chuyển đổi hình ảnh mới [x]>[x], là đào tạo một thuật toán trên dữ liệu được ghép nối, nơi hình ảnh điểm mây LiDAR (phụ thuộc vào ánh sáng phát ra bởi thiết bị) được đào tạo chống lại một khung hình tương ứng từ một máy ảnh phía trước.
vì đoạn video được quay vào ban ngày, nơi một hệ thống tầm nhìn máy tính có thể dễ dàng nhận dạng một chiếc xe hơi màu đen (như chiếc xe mà Tesla va chạm vào tháng 6), việc đào tạo này nên cung cấp một sự thật cơ bản mà ít bị ảnh hưởng bởi điều kiện tối.
Dữ liệu được thu thập với cảm biến LiDAR InnovizOne, cung cấp tốc độ thu thập 10fps hoặc 15fps, tùy thuộc vào mô hình.

Dữ liệu LiDAR được thu thập bởi thiết bị Innoviz. Nguồn: https://www.youtube.com/watch?v=wmcaf_VpsQI
Kết quả tập dữ liệu chứa khoảng 30.000 hình ảnh và 200.000 điểm 3D thu thập được. Các nhà nghiên cứu đã thực hiện hai thử nghiệm: một trong đó dữ liệu điểm mây chỉ mang thông tin phản xạ; và một thứ hai, trong đó dữ liệu điểm mây có hai kênh, một cho phản xạ và một cho khoảng cách.
Đối với thử nghiệm đầu tiên, GAN được đào tạo đến 50 kỷ, sau đó quá trình đào tạo bị ảnh hưởng bởi vấn đề quá拟 hợp.

Hình ảnh được tạo ra bởi GAN từ thử nghiệm đầu tiên. Ở bên trái, dữ liệu điểm mây; ở giữa, khung hình thực tế từ đoạn video được thu thập, được sử dụng làm sự thật; bên phải, các biểu diễn tổng hợp được tạo ra bởi Mạng Đối nghịch Sinh.
Các tác giả nhận xét:
‘Tập thử nghiệm là một bản ghi hoàn toàn mới mà GAN chưa từng thấy trước khi thử nghiệm. Điều này được dự đoán chỉ sử dụng thông tin phản xạ từ điểm mây.
‘Chúng tôi đã chọn hiển thị các khung hình có xe hơi màu đen vì xe hơi màu đen thường khó phát hiện từ LiDAR. Chúng tôi có thể thấy rằng bộ tạo đã học cách tạo ra xe hơi màu đen, có lẽ từ thông tin ngữ cảnh, vì màu sắc và hình dạng chính xác của các đối tượng trong hình ảnh dự đoán không giống hệt như trong hình ảnh thực.
Đối với thử nghiệm thứ hai, các tác giả đã đào tạo GAN đến 40 kỷ với kích thước batch là 1, dẫn đến một trình bày tương tự về ‘đại diện’ xe hơi màu đen được thu được chủ yếu từ ngữ cảnh. Cấu hình này cũng được sử dụng để tạo ra một video cho thấy hình ảnh được tạo ra bởi GAN (hình trên, trong hình ảnh mẫu dưới đây) cùng với đoạn video thực.
Đánh giá
Quá trình đánh giá và so sánh với các phương pháp hiện tại không thể thực hiện được với dự án này, do tính chất độc đáo của nó. Thay vào đó, các nhà nghiên cứu đã tạo ra một thước đo tùy chỉnh liên quan đến mức độ mà xe hơi (các phần nhỏ và ngắn hạn của đoạn video nguồn) được thể hiện trong đoạn video đầu ra.
Họ đã chọn 100 cặp hình ảnh LiDAR/Generated từ mỗi tập và hiệu quả chia số lượng hình ảnh xe hơi có mặt trong đoạn video nguồn cho số lượng hình ảnh có mặt trong dữ liệu tổng hợp được tạo ra, tạo ra một thang đo từ 0 đến 1.
Các tác giả tuyên bố:
‘Điểm số trong cả hai thử nghiệm nằm giữa 0,7 và 0,8. Xem xét việc chất lượng chung của hình ảnh dự đoán thấp hơn hình ảnh thực (nó khó hơn để phát hiện đối tượng trong hình ảnh chất lượng thấp), điểm số này cho thấy rằng đa số xe hơi có mặt trong sự thật cơ bản cũng có mặt trong hình ảnh dự đoán.’
Các nhà nghiên cứu kết luận rằng việc phát hiện xe hơi màu đen, vốn là một vấn đề đối với cả hệ thống dựa trên tầm nhìn máy tính và LiDAR, có thể được thực hiện bằng cách xác định thiếu dữ liệu cho các phần của hình ảnh:
‘Việc trong hình ảnh dự đoán, thông tin màu sắc và hình dạng không giống hệt như trong hình ảnh thực, cho thấy rằng việc dự đoán xe hơi màu đen chủ yếu được suy ra từ thông tin ngữ cảnh và không từ thông tin phản xạ của LiDAR.
‘Chúng tôi đề xuất rằng, ngoài hệ thống LiDAR thông thường, một hệ thống thứ hai tạo ra hình ảnh photo-realistic từ điểm mây LiDAR sẽ chạy đồng thời cho nhận dạng đối tượng hình ảnh trong thời gian thực.’
Các nhà nghiên cứu dự định sẽ phát triển công việc trong tương lai, với các tập dữ liệu lớn hơn.
Độ trễ, và Bộ xử lý SDV Đông đúc
Một người bình luận trên bài đăng Twitter được chia sẻ rộng rãi về vụ va chạm Autopilot ước tính rằng, khi di chuyển với tốc độ khoảng 75mph (110 feet một giây), một luồng video hoạt động tại 20fps chỉ bao phủ 5,5 feet mỗi khung hình. Tuy nhiên, nếu xe đang chạy phần cứng và phần mềm mới nhất của Tesla, tốc độ khung hình sẽ là 36fps (cho máy ảnh chính), đặt tốc độ đánh giá tại 110 feet một giây (ba feet mỗi khung hình).
Bên cạnh chi phí và ergonomics, vấn đề khi sử dụng LiDAR như một luồng dữ liệu bổ sung là quy mô lớn của ‘lưu lượng thông tin’ của đầu vào cảm biến đến khuôn khổ xử lý SDV. Kết hợp với tính chất quan trọng của nhiệm vụ, điều này dường như đã buộc radar và LiDAR ra khỏi ngăn xếp Autopilot ủng hộ các phương pháp đánh giá dựa trên hình ảnh.
Vì vậy, dường như không có khả năng một hệ thống sử dụng LiDAR – vốn sẽ thêm vào một nút thắt xử lý trên Autopilot – để suy ra hình ảnh photo-realistic là khả thi từ quan điểm của Tesla.
Người sáng lập Tesla, Elon Musk, không phải là một người chỉ trích hoàn toàn LiDAR, mà lưu ý rằng công nghệ này được sử dụng bởi SpaceX cho các thủ tục dock, nhưng cho rằng công nghệ này là ‘vô ích’ cho xe tự lái. Musk đề xuất rằng một bước sóng xuyên suất, chẳng hạn như ~4mm của radar chính xác, sẽ hữu ích hơn.
Tuy nhiên, tính đến tháng 6 năm 2021, xe Tesla không được trang bị radar. Hiện tại, dường như không có nhiều dự án được thiết kế để tạo ra luồng hình ảnh từ radar theo cách tương tự như dự án Israel hiện tại (mặc dù Bộ Năng lượng Hoa Kỳ tài trợ một nỗ lực để tạo ra hình ảnh GAN từ radar vào năm 2018).
Được xuất bản lần đầu vào ngày 23 tháng 12 năm 2021.












