มุมมองของ Anderson
การปรับปรุงความสมจริงของการจำลองการขับขี่ด้วยเครือข่าย Generative Adversarial

โครงการวิจัยใหม่ระหว่างสหรัฐอเมริกาและจีนได้เสนอการใช้เครือข่าย Generative Adversarial (GANs) เพื่อเพิ่มความสมจริงของซิมูเลเตอร์การขับขี่
ในแนวทางใหม่ในการสร้างสถานการณ์การขับขี่จากมุมมองของคนขับ (POV) ที่มีความสมจริงภาพนิ่ง นักวิจัยได้พัฒนา phương phápไฮบริดที่ใช้ประโยชน์จากความเข้มแข็งของแนวทางที่แตกต่างกัน โดยผสมผลลัพธ์ที่มีความสมจริงภาพนิ่งมากกว่าของระบบ CycleGAN-based กับองค์ประกอบที่สร้างขึ้นตามแบบแผน ซึ่งต้องการระดับความแม่นยำและความสอดคล้องที่สูงกว่า เช่น สัญลักษณ์บนถนนและยานพาหนะที่สังเกตเห็นจากมุมมองของคนขับ

Hybrid Generative Neural Graphics (HGNG) เสนอทางเลือกใหม่สำหรับการจำลองการขับขี่ที่รักษาความแม่นยำของโมเดล 3 มิติสำหรับองค์ประกอบที่จำเป็น (เช่น สัญลักษณ์บนถนนและยานพาหนะ) ในขณะเดียวกันก็ใช้ประโยชน์จากความเข้มแข็งของ GANs ในการสร้างรายละเอียดพื้นหลังและรายละเอียดโดยรอบที่น่าสนใจและไม่ซ้ำกัน Source
ระบบที่เรียกว่า Hybrid Generative Neural Graphics (HGNG) จะฉีดผลลัพธ์ที่จำกัดจากซิมูเลเตอร์การขับขี่แบบ CGI เข้าไปในพายพไลน์ GAN โดยที่เฟรมเวิร์ก SPADE ของ NVIDIA จะรับหน้าที่สร้างสภาพแวดล้อม
ข้อได้เปรียบตามที่นักวิจัยระบุ คือ สภาพแวดล้อมการขับขี่จะมีความหลากหลายมากขึ้น ทำให้เกิดประสบการณ์ที่สมจริงยิ่งขึ้น ในปัจจุบัน แม้ว่าการแปลงเอาต์พุต CGI ไปเป็นเอาต์พุตการเรนเดอร์แบบเนอรัลไม่สามารถแก้ปัญหาเรื่องการซ้ำกันของรายละเอียดพื้นหลังและวัตถุโดยรอบได้ เนื่องจากฟุตเทจต้นฉบับที่เข้าสู่พายพไลน์แบบเนอรัลมีข้อจำกัดจากโมเดลสภาพแวดล้อมและแนวโน้มที่จะซ้ำกันของเท็กซ์เจอร์และเมช

ฟุตเทจที่แปลงจากเอกสารวิจัยในปี 2021 ‘การเพิ่มความสมจริง’ ซึ่งยังคงพึ่งพาฟุตเทจ CGI-เรนเดอร์ รวมถึงพื้นหลังและรายละเอียดโดยรอบ ซึ่งจำกัดความหลากหลายของสภาพแวดล้อมในประสบการณ์จำลองSource: https://www.youtube.com/watch?v=P1IcaBn3ej0
เอกสารวิจัยระบุว่า*:
‘ความถูกต้องของซิมูเลเตอร์การขับขี่แบบดั้งเดิมขึ้นอยู่กับคุณภาพของพายพไลน์กราฟิกคอมพิวเตอร์ ซึ่งประกอบด้วยโมเดล 3 มิติ เท็กซ์เจอร์ และเครื่องเรนเดอร์ โมเดล 3 มิติและเท็กซ์เจอร์ที่มีคุณภาพสูงต้องการทักษะศิลปะ ในขณะที่เครื่องเรนเดอร์ต้องทำการคำนวณฟิสิกส์ที่ซับซ้อนสำหรับการแสดงภาพแสงและเงาในลักษณะที่สมจริง’
เอกสารวิจัยใหม่เรื่อง Photorealism in Driving Simulations: Blending Generative Adversarial Image Synthesis with Rendering นี้มาจากนักวิจัยที่ภาควิชาวิศวกรรมไฟฟ้าและคอมพิวเตอร์ มหาวิทยาลัยรัฐโอไฮโอ และบริษัท Chongqing Changan Automobile Co Ltd ในเมืองฉงชิ่ง ประเทศจีน
Background Material
HGNG จะเปลี่ยนแปลงโครงสร้างเชิงความหมายของฉากที่สร้างจาก CGI โดยการผสมวัสดุพื้นหน้าบางส่วนกับสภาพแวดล้อมที่สร้างโดย GAN

HGNG สร้างโครงสร้างเชิงความหมายจากเอาต์พุต CGI-เรนเดอร์ แล้วแทรก SPADE โดยมีการเข้ารหัสสไตล์ที่แตกต่างกัน เพื่อสร้างภาพพื้นหลังและรายละเอียดโดยรอบที่มีความสมจริงและหลากหลาย
นักวิจัยได้ทดลองกับชุดข้อมูลต่างๆ เพื่อฝึกโมเดล แต่ชุดข้อมูล KITTI Vision Benchmark Suite ซึ่งมีภาพจากมุมมองของคนขับเป็นส่วนใหญ่จากเมือง Karlsruhe ประเทศเยอรมนี เป็นชุดข้อมูลที่มีประสิทธิภาพสูงสุด
Tests
ในการทดสอบระบบ นักวิจัยได้ใช้ SPADE ที่ฝึกจากชุดข้อมูล Cityscapes เพื่อแปลงโครงสร้างเชิงความหมายของฉากให้เป็นเอาต์พุตที่มีความสมจริง
เอาต์พุตจากซิมูเลเตอร์การขับขี่แบบเปิดโอเพ่นซอร์ส CARLA ซึ่งใช้เครื่องเรนเดอร์ Unreal Engine 4 (UE4) เป็นแหล่งที่มาของโครงสร้างเชิงความหมายและภาพที่เรนเดอร์บางส่วน โดยมีเพียงยานพาหนะและเครื่องหมายบนถนนเท่านั้นที่ถูกส่งออก
การผสมผสานได้ทำโดยใช้ GP-GAN ที่ฝึกจากฐานข้อมูล Transient Attributes และทดสอบบนการ์ดจอ NVIDIA RTX 2080 พร้อมหน่วยความจำ GDDR6 8 GB
นักวิจัยได้ทดสอบระบบสำหรับการรักษาความหมายเชิงความหมาย (semantic retention) ซึ่งเป็นความสามารถของภาพเอาต์พุตที่จะสอดคล้องกับแมสค์เชิงความหมายที่ตั้งใจไว้สำหรับฉาก
ในภาพทดสอบด้านบน เราจะเห็นว่าในภาพ “เรนเดอร์เท่านั้น” (ด้านล่างซ้าย) การเรนเดอร์เต็มไม่ได้รับเงาในลักษณะที่สมจริง นักวิจัยสังเกตว่าในบริเวณที่วงกลมสีเหลือง เงาของต้นไม้ที่ตกลงบนถนนถูกจำแนกโดย DeepLabV3 (เฟรมเวิร์กการแบ่งส่วนเชิงความหมายที่ใช้ในการทดสอบ) ว่าเป็น “ถนน” โดยไม่ถูกต้อง
ในคอลัมน์กลาง เราจะเห็นว่ายานพาหนะที่สร้างโดย cGAN ไม่มีการกำหนดที่ชัดเจนพอที่จะใช้ได้ในซิมูเลเตอร์การขับขี่ (วงกลมสีแดง) ในคอลัมน์ด้านขวาสุด ภาพที่ผสมผสานสอดคล้องกับการกำหนดเชิงความหมายดั้งเดิม ในขณะเดียวกันก็รักษาองค์ประกอบ CGI-เรนเดอร์ที่จำเป็น
ในการประเมินความสมจริง นักวิจัยใช้ Frechet Inception Distance (FID) เป็นมาตรการแสดงผล เนื่องจากสามารถทำงานกับข้อมูลที่จับคู่หรือไม่จับคู่ได้
ใช้ฐานข้อมูลสามชุดเป็นข้อมูลอ้างอิง: Cityscapes, KITTI และ ADE20K
ภาพเอาต์พุตถูกเปรียบเทียบกันโดยใช้คะแนน FID และกับพายพไลน์แบบฟิสิกส์ (เช่น CGI) ในขณะเดียวกันก็ประเมินการรักษาความหมายเชิงความหมาย

ผลลัพธ์ด้านบนซึ่งเกี่ยวข้องกับการรักษาความหมายเชิงความหมาย มีคะแนนสูงสุดเป็นค่าที่ดีที่สุด โดยวิธีการแบบพีระมิด cGAN ได้คะแนนสูงสุด

ผลลัพธ์ที่เห็นด้านบนเกี่ยวข้องกับคะแนน FID โดยที่ HGNG ได้คะแนนสูงสุดจากการใช้ฐานข้อมูล KITTI
วิธีการ “เรนเดอร์เท่านั้น” (แสดงเป็น [23]) เกี่ยวข้องกับเอาต์พุตจาก CARLA ซึ่งเป็นพายพไลน์ CGI ที่ไม่คาดหวังว่าจะมีความสมจริง
ผลลัพธ์เชิงคุณภาพบนเครื่องเรนเดอร์แบบดั้งเดิม (‘c’ ในภาพด้านบน) แสดงรายละเอียดพื้นหลังที่ไม่สมจริง เช่น ต้นไม้และพืชพรรณ ซึ่งต้องการโมเดลที่มีรายละเอียดและโหลดเมชในเวลาจริง นอกจากนี้ยังต้องมีการประมวลผลที่ต้องใช้พลังประมวลผลสูง ในขณะที่ในภาพกลาง (b) เราจะเห็นว่า cGAN ไม่สามารถให้การกำหนดที่ชัดเจนพอที่จะใช้ได้ในซิมูเลเตอร์การขับขี่ ในภาพที่ผสมผสานที่เสนอ (a) การกำหนดของยานพาหนะและเครื่องหมายบนถนนที่ดี ในขณะที่สภาพแวดล้อมมีความหลากหลายและสมจริง
เอกสารวิจัยสรุปโดยเสนอว่าความสอดคล้องเชิงเวลาของส่วน GAN-สร้างในพายพไลน์การเรนเดอร์สามารถเพิ่มขึ้นโดยใช้ชุดข้อมูลเมืองที่ใหญ่ขึ้น และงานในอนาคตในแนวทางนี้อาจเสนอทางเลือกที่แท้จริงต่อการแปลงแบบเนอรัลที่มีค่าใช้จ่ายสูงของสตรีม CGI-เบส ในขณะเดียวกันก็ให้ความสมจริงและความหลากหลายที่มากกว่า
* การแปลงอ้างอิงอินไลน์ของผู้เขียนให้เป็นลิงก์แบบไฮเปอร์
ตีพิมพ์ครั้งแรกเมื่อวันที่ 23 กรกฎาคม 2022














