Góc nhìn Anderson

Cải thiện tính chân thực của mô phỏng lái xe với mạng đối kháng sinh

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Một sáng kiến nghiên cứu mới giữa Mỹ và Trung Quốc đã đề xuất sử dụng mạng đối kháng sinh (GANs) để tăng tính chân thực của mô phỏng lái xe.

Trong một cách tiếp cận mới để sản xuất các kịch bản lái xe từ góc nhìn của người lái một cách chân thực, các nhà nghiên cứu đã phát triển một phương pháp kết hợp giữa đầu ra của hệ thống dựa trên CycleGAN với các yếu tố được tạo ra một cách thông thường, đòi hỏi mức độ chi tiết và nhất quán cao hơn, chẳng hạn như dấu hiệu đường bộ và phương tiện được quan sát từ góc nhìn của người lái.

Hình ảnh mô phỏng lái xe chân thực hơn

Hình ảnh mô phỏng lái xe chân thực hơn Nguồn

Hệ thống, được gọi là Hybrid Generative Neural Graphics (HGNG), tiêm đầu ra hạn chế từ một mô phỏng lái xe dựa trên CGI vào một đường ống GAN, nơi khuôn khổ SPADE của NVIDIA thực hiện công việc tạo môi trường.

Ưu điểm, theo các tác giả, là môi trường lái xe sẽ trở nên đa dạng hơn, tạo ra một trải nghiệm nhập vai hơn. Hiện tại, ngay cả việc chuyển đổi đầu ra CGI sang đầu ra kết xuất thần kinh không thể giải quyết vấn đề về sự lặp lại, vì footage gốc nhập vào đường ống thần kinh bị hạn chế bởi giới hạn của môi trường mô hình và xu hướng lặp lại kết cấu và lưới.

Nguồn: https://www.youtube.com/watch?v=0fhUJT21-bs

Nguồn: https://www.youtube.com/watch?v=P1IcaBn3ej0

The bài báo cho biết*:

‘Độ trung thực của một mô phỏng lái xe thông thường phụ thuộc vào chất lượng của đường ống đồ họa máy tính, bao gồm các mô hình 3D, kết cấu và một bộ máy kết xuất. Các mô hình 3D và kết cấu chất lượng cao đòi hỏi sự thủ công, trong khi bộ máy kết xuất phải chạy các tính toán vật lý phức tạp để thể hiện ánh sáng và bóng một cách thực tế.’

The bài báo mới có tiêu đề Photorealism in Driving Simulations: Blending Generative Adversarial Image Synthesis with Rendering, và đến từ các nhà nghiên cứu tại Bộ phận Điện và Máy tính tại Đại học bang Ohio, và Chongqing Changan Automobile Co Ltd ở Chongqing, Trung Quốc.

Background Material

HGNG biến đổi bố cục ngữ nghĩa của một cảnh được tạo ra bởi CGI bằng cách trộn các vật thể được kết xuất một phần với môi trường được tạo ra bởi GAN. Mặc dù các nhà nghiên cứu đã thử nghiệm với các tập dữ liệu khác nhau để đào tạo các mô hình, nhưng tập dữ liệu hiệu quả nhất đã chứng minh là KITTI Vision Benchmark Suite, chủ yếu bao gồm các cảnh được quay từ góc nhìn của người lái từ thị trấn Karlsruhe của Đức.

HGNG tạo ra một bố cục ngữ nghĩa từ đầu ra được kết xuất bởi CGI, và sau đó chèn SPADE, với các mã hóa phong cách khác nhau, để tạo ra hình ảnh nền photorealistic ngẫu nhiên và đa dạng, bao gồm cả các vật thể gần đó trong các cảnh đô thị. Bài báo mới cho biết rằng các mẫu lặp lại, phổ biến trong các đường ống CGI bị hạn chế về tài nguyên, 'phá vỡ sự nhập vai' của người lái sử dụng mô phỏng, và rằng các nền đa dạng hơn mà GAN có thể cung cấp có thể giảm thiểu vấn đề này.

HGNG tạo ra một bố cục ngữ nghĩa từ đầu ra được kết xuất bởi CGI, và sau đó chèn SPADE, với các mã hóa phong cách khác nhau, để tạo ra hình ảnh nền photorealistic ngẫu nhiên và đa dạng, bao gồm cả các vật thể gần đó trong các cảnh đô thị.

Các nhà nghiên cứu đã thử nghiệm với cả Conditional GAN (cGAN) và CYcleGAN (CyGAN) như các mạng sinh, và cuối cùng đã phát hiện ra rằng mỗi mạng có điểm mạnh và điểm yếu: cGAN đòi hỏi các tập dữ liệu được ghép đôi, và CyGAN thì không. Tuy nhiên, CyGAN không thể hiện được kết quả tốt nhất trong các mô phỏng thông thường, chờ đợi các cải tiến hơn nữa trong sự thích nghi về miền và sự nhất quán của chu kỳ. Do đó, cGAN, với yêu cầu dữ liệu ghép đôi bổ sung, đạt được kết quả tốt nhất tại thời điểm này.

Kiến trúc khái niệm của HGNG.

Kiến trúc khái niệm của HGNG.

Trong đường ống đồ họa thần kinh HGNG, các biểu diễn 2D được hình thành từ các cảnh được tạo ra bởi CGI. Các vật thể được truyền qua đến dòng chảy GAN từ việc kết xuất CGI được hạn chế ở các yếu tố ‘cần thiết’, bao gồm cả dấu hiệu đường bộ và phương tiện, mà GAN không thể kết xuất tại mức nhất quán và toàn vẹn về thời gian cho một mô phỏng lái xe. Hình ảnh được tổng hợp bởi cGAN sau đó được trộn với kết xuất dựa trên vật lý một phần.

Tests

Để kiểm tra hệ thống, các nhà nghiên cứu đã sử dụng SPADE, được đào tạo trên Cityscapes, để chuyển đổi bố cục ngữ nghĩa của cảnh thành đầu ra photorealistic. Nguồn CGI đến từ mô phỏng lái xe mã nguồn mở CARLA, tận dụng Unreal Engine 4 (UE4).

Đầu ra từ mô phỏng lái xe mã nguồn mở CARLA. Nguồn: https://arxiv.org/pdf/1711.03938.pdf

Đầu ra từ mô phỏng lái xe mã nguồn mở CARLA. Nguồn: https://arxiv.org/pdf/1711.03938.pdf

Bộ máy kết xuất và bóng của UE4 cung cấp bố cục ngữ nghĩa và hình ảnh được kết xuất một phần, với chỉ phương tiện và dấu hiệu đường bộ được xuất. Sự trộn lẫn được thực hiện với một GP-GAN được đào tạo trên Transient Attributes Database, và tất cả các thí nghiệm được chạy trên một NVIDIA RTX 2080 với 8 GB GDDR6 VRAM.

Các nhà nghiên cứu đã kiểm tra giữ lại ngữ nghĩa – khả năng của hình ảnh đầu ra tương ứng với mặt nạ phân đoạn ngữ nghĩa ban đầu được dự định làm mẫu cho cảnh.

Trong hình ảnh kiểm tra trên, chúng ta thấy rằng trong hình ảnh ‘chỉ kết xuất’ (phía dưới bên trái), kết xuất đầy đủ không đạt được bóng một cách thực tế. Các nhà nghiên cứu lưu ý rằng ở đây (vòng tròn vàng) bóng của cây cối rơi xuống vỉa hè được phân loại sai bởi DeepLabV3 (khung phân đoạn ngữ nghĩa được sử dụng cho các thí nghiệm này) là ‘nội dung đường bộ’.

Trong cột giữa, chúng ta thấy rằng phương tiện được tạo ra bởi cGAN không có đủ định nghĩa nhất quán để được sử dụng trong một mô phỏng lái xe (vòng tròn đỏ). Trong cột bên phải, hình ảnh được trộn kết hợp với định nghĩa ngữ nghĩa ban đầu, trong khi vẫn giữ lại các yếu tố CGI dựa trên.

Để đánh giá tính chân thực, các nhà nghiên cứu đã sử dụng Frechet Inception Distance (FID) như một chỉ số hiệu suất, vì nó có thể hoạt động trên dữ liệu ghép đôi hoặc không ghép đôi.

Ba tập dữ liệu được sử dụng làm chân thực: Cityscapes, KITTI, và ADE20K.

Các hình ảnh đầu ra được so sánh với nhau bằng cách sử dụng điểm FID, và so với đường ống dựa trên vật lý (tức là CGI), trong khi giữ lại ngữ nghĩa cũng được đánh giá.

Trong kết quả trên, liên quan đến giữ lại ngữ nghĩa, điểm số cao hơn là tốt hơn, với phương pháp dựa trên kim tự tháp cGAN (một trong số các đường ống được kiểm tra bởi các nhà nghiên cứu) đạt điểm cao nhất.

Kết quả trên liên quan đến điểm FID, với HGNG đạt điểm cao nhất thông qua việc sử dụng tập dữ liệu KITTI.

Phương pháp ‘Chỉ kết xuất’ (được ký hiệu là [23]) liên quan đến đầu ra từ CARLA, một dòng CGI không được kỳ vọng là photorealistic.

Kết quả định tính trên bộ máy kết xuất thông thường (‘c’ trong hình ảnh trên) cho thấy thông tin nền xa không thực tế, chẳng hạn như cây cối và thực vật, trong khi đòi hỏi các mô hình chi tiết và tải lưới vừa đúng lúc, cũng như các thủ tục xử lý khác. Trong hình ảnh giữa (b), chúng ta thấy rằng cGAN không thể đạt được định nghĩa đủ cho các yếu tố cần thiết, xe và dấu hiệu đường bộ. Trong hình ảnh được trộn đề xuất (a), định nghĩa xe và đường bộ là tốt, trong khi môi trường xung quanh là đa dạng và photorealistic.

Bài báo kết luận bằng cách đề xuất rằng sự nhất quán về thời gian của phần được tạo ra bởi GAN trong đường ống kết xuất có thể được tăng lên thông qua việc sử dụng các tập dữ liệu đô thị lớn hơn, và rằng công việc trong tương lai theo hướng này có thể cung cấp một giải pháp thay thế thực sự cho việc chuyển đổi thần kinh tốn kém của các dòng CGI, trong khi cung cấp sự chân thực và đa dạng hơn.

 

* Tôi đã chuyển đổi các trích dẫn nội tuyến của tác giả thành siêu liên kết.

Được xuất bản lần đầu vào ngày 23 tháng 7 năm 2022.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai