ผู้นำทางความคิด

การบิดเบือนที่คุณมองไม่เห็น: ทำไมระบบกล้อง ADAS ถึงล้มเหลวในสนามและวิธีที่แมชชีนเลิร์นนิงที่ได้รับข้อมูลจากฟิสิกส์เปลี่ยนแปลงสิ่งนี้

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

สิ่งที่ฉันทำเหมือนกับการทำนายว่าคู่แว่นตาจะบิดเบือนการมองเห็นของคุณอย่างไรก่อนที่คุณจะสวมใส่ — แต่ผลลัพธ์ของการพลาดไม่ได้เป็นแค่ปวดหัว มันคือเหตุการณ์การเบรกฉุกเฉินที่ล้มเหลวที่ความเร็ว 110 km/h

มันเกิดขึ้นในช่วงปลายของรอบการตรวจสอบการออกแบบเมื่อความล้มเหลวปรากฏ — การบิดเบือนเลนส์เชิงรัศมีและเชิงสัมผัสอย่างรุนแรงในกล้องหน้า ADAS ที่ตรวจพบเพียงหลังจากที่การยอมรับการประกอบแสงได้ถูกล็อกกับผู้จำหน่าย การแก้ไขต้องปรับออฟเซ็ตระหว่างอิมเมเจอร์กับเมานท์เลนส์ด้วยมือ, ทำการทดสอบ MTF และการบิดเบือนกริดใหม่, และจัดการความเสี่ยงของไมล์สโตนโปรแกรมที่ต่อเนื่องจากความล้มเหลว DV ในขั้นตอนสุดท้าย สาเหตุหลักไม่ได้เป็นข้อบกพร่องการผลิตหรือข้อผิดพลาดการออกแบบโดยลำพัง มันเป็นสิ่งที่มีโครงสร้างมากกว่า: การจำแนกการบิดเบือนของกล้องเป็นการตอบสนองอย่างเต็มที่เมื่อต้นแบบทางกายภาพมีอยู่แล้ว, ก็สายเกินไปที่จะปรับแก้สแต็กออปติคัลอย่างประหยัด

เหตุการณ์นั้นดึงฉันเข้าสู่การเรียนรู้ของเครื่องโดยตรง หาก CNN ที่ฝึกด้วยแผนที่การบิดเบือนที่สร้างโดย GAN สามารถตรวจจับความเสี่ยงการบิดเบือนแบบบาร์เรล, พินชูชัน, และมัสท์เชจากพารามิเตอร์การออกแบบแสงก่อนที่เลนส์ใดจะถูกผลิต, ความประหลาดใจจาก DV จะถูกกำจัดอย่างสมบูรณ์ นั่นคือปัญหาที่ฉันใช้หลายปีที่ผ่านมาเพื่อสร้าง: การใช้การจำลองฟิสิกส์และ AI เพื่อทำนายว่าความร้อนและความเครียดเชิงกลจะทำให้ระบบออปติกของกล้องบิดเบือนอย่างไรตลอดอายุการใช้งานของยานยนต์, เพื่อให้ความล้มเหลวได้รับการแก้ไขในขั้นคิดแนวคิดแทนที่จะถูกค้นพบที่ประตูการผลิต

ต่อไปนี้คือสิ่งที่ฉันได้เรียนรู้ — เกี่ยวกับสถาปัตยกรรม, ข้อมูล, โหมดความล้มเหลว, และช่องว่างระหว่างวิธีที่อุตสาหกรรมนี้พูดถึง AI กับวิธีที่ AI ปฏิบัติงานจริงในระบบการผลิต

สถาปัตยกรรม: ฮาร์ดแวร์พบกับ ML

ระบบที่ฉันรู้ลึกที่สุดคือแพลตฟอร์มกล้องหน้า ADAS ที่ใช้งานในหลายโปรแกรม OEM — โมดูลที่มีความสำคัญต่อความปลอดภัย ซึ่งฟิสิกส์ของการประกอบแสงและประสิทธิภาพของไพรไลน์แมชชีนเลิร์นนิงด้านการรับรู้นั้นไม่สามารถแยกจากกันได้

สแต็กฮาร์ดแวร์เริ่มต้นด้วยกระบอกเลนส์หลายชิ้น (การออกแบบ 6–8 ชิ้นขึ้นอยู่กับรูปแบบ FOV) ที่ติดตั้งบนอิมเมเจอร์ CMOS ผ่านโครงกลไกที่แม่นยำ การจับคู่มุมรังสีหลักระหว่างรูรับแสงออกของเลนส์และอาเรย์ไมโครเลนส์ของอิมเมเจอร์เป็นข้อจำกัดการจัดตำแหน่งที่สำคัญ — ความไม่ตรงกันเป็นแหล่งหลักของเงามุมและการบิดเบือนที่ขึ้นกับสนามมุม อิมเมเจอร์ส่งเฟรมแบบ Bayer ดิบไปยัง ISP ที่จัดการการถอดโมซาอิก, การลดสัญญาณรบกวน, และการแก้ไขเงาเลนส์ก่อน SoC การรับรู้

ไพรไลน์การตรวจจับการบิดเบือนของ ML อยู่ก่อนการทำต้นแบบทางกายภาพ การไหลของข้อมูล:

  • สังเคราะห์ พื้นที่พารามิเตอร์แสง (รัศมีความโค้งของเลนส์, ระยะห่างของชิ้นส่วน ความคลาดเคลื่อน, มุมเอียงของอิมเมเจอร์, ความเบี่ยงของมุมรังสีหลัก)
  • ที่มีเงื่อนไขจากฟิสิกส์ cGAN พร้อมตัวสร้าง U-Net ที่สังเคราะห์เฟรมบิดเบือนที่สมจริง ทั่วทั้งมุมมองเต็ม (FOV)
  • ResNet-50 CNN classifier ที่ฝึกด้วยภาพความแรงของเกรเดียนต์เพื่อตรวจจับ รูปแบบการบิดเบือนแบบบาร์เรล, พินชูชัน, และมัสท์เช
  • การบิดเบือน คะแนนความเสี่ยงและแผนที่ความร้อนเชิงพื้นที่ — ทำเครื่องหมายพื้นที่ FOV ที่มีความเสี่ยงสูง ก่อนที่เลนส์ทางกายภาพใดจะถูกผลิต

ทำไมต้องใช้ cGAN ที่มีเงื่อนไขจากฟิสิกส์แทน DC-GAN ธรรมดา? DC-GAN สร้างภาพจากเวกเตอร์แฝงสุ่ม — มันเรียนรู้การแจกแจงมาร์จินัลของภาพฝึก, ไม่ใช่การแจกแจงเงื่อนไขที่ให้สถานะการบิดเบือน FEA เฉพาะ สำหรับการสังเคราะห์แผนที่การบิดเบือน ความแตกต่างนี้เป็นสิ่งสำคัญ cGAN ที่มีเงื่อนไขจากฟิสิกส์พร้อมตัวสร้าง U-Net จะกำหนดทั้งตัวสร้างและตัวจำแนกบนสนามการบิดเบือน FEA อินพุต, บังคับโมเดลให้เรียนรู้การแมปจากสถานะการบิดเบือนทางกายภาพไปยังรูปแบบการบิดเบือนแสง การเชื่อมต่อข้ามของ U-Net รักษาเกรเดียนต์การบิดเบือนระดับซับพิกเซลที่มุม FOV ที่ตัวเข้ารหัส‑ถอดรหัสมาตรฐานสูญเสียผ่านการลดขนาดต่อเนื่อง — และเกรเดียนต์มุมเหล่านั้นเป็นสัญญาณหลักสำหรับการทำนายความล้มเหลวของ DV.

ทำไมไม่ใช้ CNN แบบรีเกรสชันล้วน? โมเดลรีเกรสชันลดค่า mean squared error ทั้งหมดในชุดฝึก, ทำให้ค่าสูงสุดของการบิดเบือนที่มุมถูกประเมินต่ำอย่างเป็นระบบ GAN มีเป้าหมายเชิงศัตรูที่ผลักดันตัวสร้างให้ผลิตแผนที่การบิดเบือนที่คมชัดและคอนทราสต์สูง — ซึ่งโดยบังเอิญรักษาค่าสูงสุดที่โมเดลรีเกรสชันทำให้เรียบลง เมื่อเกณฑ์ความล้มเหลวของ DV เป็นขอบเขตที่แน่นอน (MTF50 มุม < 25% หรือการบิดเบือน > 3 px ในท้องถิ่น), การประเมินต่ำของค่าสูงสุดไม่ใช่ข้อผิดพลาดแบบระมัดระวัง แต่เป็นการพยากรณ์ความล้มเหลวที่พลาดไป

เมตริกที่สำคัญจริงๆ

เมตริกประสิทธิภาพของระบบแสงและ ML ถูกติดตามร่วมกัน, เนื่องจากการมีเพียงอย่างใดอย่างหนึ่งโดยไม่มีอีกอย่างหนึ่งถือว่าไม่ครบถ้วน

คุณภาพการรับรู้แสง

  • MTF50: เป้าหมาย ≥45–50% ที่ศูนย์ภาพ, ≥30% ที่มุม. ความล้มเหลวของ DV ถูกกระตุ้นเมื่อ MTF50 ที่มุม <25% หรือการลดลงจากศูนย์ถึงมุม เกิน 40% — จุดที่อัลกอริธึมการรับรู้ต่อจากนี้ สูญเสียการตรวจจับขอบที่เชื่อถือได้ในส่วนรอบนอกของ FOV.
  • เรขาคณิต การบิดเบือน: เป้าหมาย ≤2 px RMS ทั่วทั้ง FOV. ความล้มเหลว DV ที่ 3 px ในพื้นที่ท้องถิ่น การบิดเบือนหรือเบี่ยงเบน ≥1.5–2% จากโมเดลการฉายภาพอุดมคติ — ซึ่งการออกจากเลนและข้อผิดพลาดในการประมาณระยะห่างของวัตถุ กลายเป็นประเด็นที่เกี่ยวกับความปลอดภัย.
  • ความร้อน เสถียรภาพ: ช่วงการทำงาน −40°C ถึง +85°C. การเคลื่อนที่ของภาพที่ยอมรับได้ ≤1–2 px (≈5–10 µm ที่ระนาบเซนเซอร์). ความล้มเหลว DV ที่การเคลื่อนที่ 3 px หรือ ความไม่เชิงเส้นเป็นสัญญาณสำคัญ: การเคลื่อนที่เชิงเส้นสามารถแก้ไขด้วยเฟิร์มแวร์; การไหลของความไม่เชิงเส้นทำให้ เมทริกซ์การสอบเทียบโดยเนื้อแท้เป็นโมฆะโดยสมบูรณ์.

ประสิทธิภาพของโมเดล ML

  • การตรวจจับ: เป้าหมาย mAP ≥0.90, IoU ≥0.75–0.80. ได้ mAP 0.92–0.95, IoU 0.78–0.85 บนชุดตรวจสอบสังเคราะห์ที่แยกออก.
  • ข้อผิดพลาด อัตรา: เป้าหมาย FPR ≤5%, FNR ≤3%. ได้ FPR 3–5%, FNR 2–3%. ความไม่สมดุลเป็นเจตนา — ความล้มเหลวการบิดเบือนที่พลาด (FN) ใน โปรแกรมกล้องที่สำคัญต่อความปลอดภัยเป็นแย่กว่าความผิดพลาดเท็จ การเตือนที่ทำให้ต้องมีการตรวจสอบวิศวกรรมที่ไม่จำเป็น.
  • การฝึก สุขภาพ: การสมดุลการสูญเสียของ generator/discriminator ถูกติดตามตลอดการฝึก GAN ผ่าน TensorBoard. Discriminator ที่ล่มเป็นความล้มเหลวที่อันตรายที่สุด ของการฝึก — ถูกจับได้เร็วโดยการตรวจสอบความมั่นใจของ discriminator ทั่วชุดย่อย.

ปัญหาที่ยากที่สุดที่ฉันได้แก้ไข

ความล้มเหลวที่ซับซ้อนที่สุดที่ฉันวินิจฉัยไม่ใช่ข้อบกพร่องเดียว — มันคือ ความล้มเหลวการเชื่อมต่อความร้อน–กลศาสตร์–แสง ซึ่งใช้เวลา 6–8 สัปดาห์ในการแยกสลายอย่างเต็มที่โดยทีมสี่ทีมและในที่สุดต้องตรวจสอบสมมติฐานที่ฝังอยู่ในโปรแกรมตั้งแต่ขั้นตอนแนวคิด.

อาการเป็นเรื่องตรงไปตรงมา: MTF50 ที่มุมตกต่ำกว่าเกณฑ์ความล้มเหลว DV 25% ระหว่างการแช่ความร้อนที่ +85°C, และ รูปแบบการบิดเบือนแบบไม่เชิงเส้นปรากฏซึ่งไม่มีที่อุณหภูมิห้อง. ความไม่เชิงเส้นเป็นสัญญาณเตือนสำคัญ — การเคลื่อนที่เชิงเส้นที่เกิดจากความร้อนสามารถแก้ไขได้ในเมทริกซ์การสอบเทียบโดยเนื้อแท้, แต่การบิดเบือนแบบไม่เชิงเส้นทำให้การสอบเทียบเป็นโมฆะโดยสมบูรณ์และไม่สามารถแก้ไขด้วยเฟิร์มแวร์ในการผลิตได้.

ลำดับการวินิจฉัย

  • IR เทอร์โมกราฟี เปิดเผยความแตกต่างของการกระจายความร้อนที่ไม่สม่ำเสมอทั่วท่อเลนส์ — การให้ความร้อนแบบไม่สมมาตรเนื่องจากความนำความร้อนที่แตกต่างระหว่าง วัสดุของโครงและชั้นเชื่อมกาว.
  • FEA การจำลองการขยายตัวตามความร้อน คาดการณ์การเบี่ยงศูนย์ของเลนส์ 12–15 µm ที่ +85°C, เนื่องจาก CTE ความไม่ตรงกันระหว่างอีพ็อกซี่ UV‑cure กับโครงอะลูมิเนียม. สำคัญคือ, กาวแสดง การไหล ภายใต้การโหลดความร้อนต่อเนื่อง — ขึ้นกับเวลา, ไม่สามารถฟื้นคืนได้ การเปลี่ยนรูป.
  • การทนทาน การวิเคราะห์การสแตค‑อัพ เปิดเผยว่าการเบี่ยงศูนย์นี้, เมื่อรวมกับ imager ตามสเปค ความคลาดเคลื่อนความสูงการนั่ง (±8 µm), ทำให้รังสีหลักที่รวมกัน การเบี่ยงเบนมุมเกินกรวยการยอมรับของไมโครเลนส์ imager. ไม่มี ผู้ร่วมเดียวที่ล้มเหลวอย่างโดดเดี่ยว.

การแก้ไขต้องการการเปลี่ยนแปลงสามอย่างที่ประสานกัน: ปรับสูตรเลนส์ใหม่เพื่อกระจายการชดเชยความโค้งของสนาม, ปรับรูปทรงของจุดเชื่อมใหม่เพื่อ ลดคานแรง CTE, และการปรับเครื่องมือของผู้จำหน่ายเล็กน้อยสำหรับช่องเชื่อมของโครง. รอบความร้อน DV เพิ่มเติมหนึ่งรอบยืนยันการฟื้นฟู. ผลกระทบต่อโปรแกรม: ความล่าช้าของเป้าหมาย 2–3 สัปดาห์, รอบทดสอบ DV/PV เพิ่มเติมหนึ่งรอบ.

โหมดความล้มเหลือที่เข้าสู่การผลิตแทบไม่มีเลยที่ตรงกับการวิเคราะห์กรณีปกติของคุณ. พวกมันคือที่ขอบเขตของสมมติฐานของคุณ — ที่โมเดลของระบบของคุณหยุดแม่นยำ.

ความล้มเหลือนี้ได้กำหนดท่อการตรวจจับ ML โดยตรง. หากการคาดการณ์การบิดรูปความร้อนของ FEA ถูกเชื่อมโยงกับโมเดลการบิดเบือนที่ฝึกฝนที่ CV, ความเสี่ยงการไหลของกาวจะถูกระบุเป็นพื้นที่ FOV ที่มีความเสี่ยงสูงก่อนที่ต้นแบบเดียวจะถูกสร้างขึ้น.

ปัญหาข้อมูลที่ไม่มีใครพูดถึง

ปัญหาข้อมูลที่ยุ่งเหยิงที่สุดที่ฉันแก้ไขคือ ป้ายกำกับที่ไม่สอดคล้องและขาดหายในชุดข้อมูลการฝึก GAN สังเคราะห์ — และสิ่งที่ทำให้มันยากจริง ๆ คือป้ายกำกับเหล่านั้นได้มาจากฟิสิกส์ ไม่ได้จากการอธิบายของมนุษย์. ความแตกต่างนั้นเปลี่ยนแปลงทุกอย่างเกี่ยวกับพฤติกรรมของข้อผิดพลาดของป้ายกำกับ.

ชุดข้อมูลประกอบด้วยการจำลอง FEA 180 รายการที่สร้างคู่ภาพสังเคราะห์ 18,000 คู่ — ฟิลด์ความร้อนและการบิดรูปเป็นอาเรย์ .npy, คู่กับแผนที่บิดเบือน .png และไฟล์ master labels.csv. มีโหมดความล้มเหลวสามแบบที่ต้องการการแทรกแซงของไพพ์ไลน์อย่างชัดเจน:

  • FEA ความไม่ตรงกันของความละเอียดกริด: ความหนาแน่นของเมชที่ไม่สม่ำเสมอทำให้เกิดความต่อเนื่องเชิงพื้นที่เมื่อ แปลงเป็นกริดอินพุต CNN ที่สม่ำเสมอ. วิธีแก้: scipy griddata พร้อม การอินเทอร์โพเลชันแบบคิวบิกแทนการรีแซมปลิงแบบบิลิเนียร์.
  • ไม่สมบูรณ์ การส่งออกการจำลอง: การรัน FEA สิ้นสุดก่อนกำหนดและเขียนไฟล์ .npy ส่วนหนึ่งที่มีฟิลด์ NaN หรืออาร์เรย์การเปลี่ยนรูปเป็นศูนย์ — ผลลัพธ์ที่เป็นไปไม่ได้ทางกายภาพที่ จะสอนโมเดลว่าการบิดเบือนใด ๆ ไม่ถูกต้องสำหรับอินพุตความร้อนสุดขีด แก้ไข: สแกนหลังการสร้างเพื่อทิ้งส่วนที่เป็น NaN >0.1% และกรณีฟิลด์ศูนย์.
  • การจัดตำแหน่ง การแปลงที่ไม่ตรงกัน: ข้อผิดพลาดการจัดดัชนีแบบ off-by-one ในการแปลงพิกัดจาก FEA ไปยังภาพ ส่งผลกระทบต่อประมาณ 6–8% ของตัวอย่าง — ถูกจับได้ระหว่างการตรวจสอบด้วยสายตา การตรวจสอบการซ้อนแผนที่บิดเบือน, ที่ไม่สามารถมองเห็นได้โดยระบบอัตโนมัติ การตรวจสอบ.

ความไม่สมดุลของการกระจายก็มีความสำคัญเท่าเดิม: ชุดข้อมูลมีน้ำหนักเกินในกรณีความร้อนปานกลาง (20°C–60°C) และขาดแคลนอย่างรุนแรงที่ขอบสุด (−40°C และ +85°C) — ซึ่งตรงกับสภาวะการทำงานที่กำหนดการผ่าน/ไม่ผ่านของ DV อย่างแม่นยำ ตัวอย่างขอบกรณีพิเศษเพิ่มอีก 800 ตัวอย่างที่สร้างใหม่ด้วยมือเพื่อเพิ่มสัดส่วนกรณีขอบจาก 2.2% เป็น 6.8% ของจำนวนตัวอย่างทั้งหมด.

สรุป: ป้ายกำกับที่ได้จากฟิสิกส์ไม่ได้เชื่อถือได้โดยอัตโนมัติ. ความไม่เสถียรเชิงตัวเลข, ความไม่ตรงกันของความละเอียด, และข้อผิดพลาดระบบพิกัดทำให้เกิดเสียงรบกวนของป้ายกำกับที่สัมพันธ์กับเงื่อนไขอินพุตเฉพาะ — ซึ่งทำให้โมเดลมีอคติอย่างแม่นยำในสถานการณ์ที่คุณต้องการการทำนายที่เชื่อถือได้ที่สุด.

ความเสี่ยงที่อุตสาหกรรมมองข้าม

นอกเหนือจากความเสี่ยงที่ได้รับการบันทึกอย่างชัดเจนเกี่ยวกับการเปลี่ยนแปลงการกระจาย, ความลำเอียงของอัลกอริทึม, และการโจมตีแบบกดขี่, อุตสาหกรรม ADAS กำลังประเมินค่าต่ำเกินไปเกี่ยวกับ การเคลื่อนที่ของการสอบเทียบในระหว่างการให้บริการที่เกิดจากการวนรอบความร้อนและการเสื่อมสภาพเชิงกล.

ระบบกล้องได้รับการตรวจสอบภายใต้เงื่อนไข SOP — ชุดที่กำหนดของสภาวะความร้อน, กลไก, และสิ่งแวดล้อมที่กล้องต้องทนต่อเมื่อการผลิตเสร็จสิ้น การตรวจสอบนี้เข้มงวด อย่างไรก็ตาม สิ่งที่ไม่ได้ครอบคลุมคือผลสะสมของการวนรอบความร้อนซ้ำ ๆ, การไหลของวัสดุ, การผ่อนคลายความเครียดของการติดตั้ง, และการสั่นสะเทือนบนถนนที่เกิดขึ้นตลอด 100,000 กิโลเมตรและสิบปีของการใช้งานยานพาหนะ.

กลไกนี้เข้าใจได้ดี: การไหลของกาวและความไม่ตรงกันของ CTE ระหว่างวัสดุที่แตกต่างกันทำให้เกิดการเปลี่ยนแปลงตำแหน่งสัมพันธ์ระหว่างเลนส์และอิมเมเจอร์อย่างช้าและขึ้นกับเวลา หลังจากสามปีของการวนรอบอุณหภูมิระหว่าง −30°C ถึง +70°C, แบร์เรลของเลนส์อาจเคลื่อนที่ 8–12 µm เมื่อเทียบกับอิมเมเจอร์ เมทริกซ์การสอบเทียบภายในที่เก็บไว้ใน ECU จะไม่แสดงภาพออปติกทางกายภาพอย่างแม่นยำอีกต่อไป การประมาณระยะห่างของวัตถุจะแสดงอคติอย่างเป็นระบบ — เล็กพอที่ไม่สามารถมองเห็นได้ในเฟรมเดียว, แต่ใหญ่พอที่ส่งผลต่อเกณฑ์การเปิดใช้งานระบบเบรกฉุกเฉินอัตโนมัติที่ความเร็วบนทางหลวง.

การตอบสนองของอุตสาหกรรมยังไม่เพียงพอในสองประการ: การสอบเทียบซ้ำเป็นระยะไม่ได้มาตรฐาน (ไม่มีช่วงเวลาการสอบเทียบกล้องที่กำหนดไว้, แม้จะมีการเข้าใจกลไกการเสื่อมสภาพตามเวลาอย่างชัดเจน), และ การตรวจสอบในระหว่างการให้บริการไม่ได้เป็นข้อบังคับ (SOTIF แก้ไขปัญหาการทำงานไม่เพียงพอที่ SOP; ไม่ได้แก้ไขการเสื่อมสภาพการทำงานตลอดอายุการใช้งาน).

ผลลัพธ์คือการมีโหมดความล้มเหลวที่ซ่อนอยู่: ยานพาหนะในสนามที่ระบบรับรู้ทำงานบนเมทริกซ์การสอบเทียบที่ล้าสมัย, ลดลงด้วยระดับที่แต่ละกรณีอาจอยู่ต่ำกว่าขีดจำกัดแต่เมื่อรวมกันแล้วมีความหมายอย่างมากในกองยานพาหนะขนาดใหญ่.

ตำนานที่อาจทำให้คนตาย

ตำนานที่แพร่หลายและอันตรายที่สุดในระบบอัตโนมัติคือว่า ความแม่นยำรวมของโมเดลที่สูงขึ้นแปลตรงไปตรงมาว่าระบบจะปลอดภัยยิ่งขึ้น.

mAP คือค่าเฉลี่ยของชุดข้อมูลประเมินตามการกระจายของคลาสและสถานการณ์ มันให้ค่าน้ำหนักเท่ากันกับทุกตัวอย่าง ระบบ ADAS ที่ผลิตจริงไม่ได้เจอสถานการณ์ด้วยความถี่เท่ากัน — มันเจอการรักษาเลนบนทางหลวงบ่อยกว่าการเจอเด็กที่ถูกบังบางส่วนวิ่งเข้าถนนจากด้านหลังยานจอดอยู่หมื่นเท่า โมเดลที่เพิ่ม mAP ขึ้น 0.02 ด้วยการปรับปรุงเล็กน้อยในสถานการณ์ปกติที่เกิดบ่อยแต่ไม่เปลี่ยนแปลงในสถานการณ์ที่หายากและสำคัญต่อความปลอดภัยไม่ได้ปรับปรุงความปลอดภัยอย่างมีนัยสำคัญ มันเพียงแค่ปรับปรุงเมตริกซ์.

ฉันได้สังเกตเห็นเรื่องนี้โดยตรง โมเดลที่ให้ค่า mAP 0.95 บนมาตรฐานเบนช์มาร์คยังสามารถสร้างผลลบเท็จที่มั่นใจสูงในกรณีการผสมผสานของมุมแสงอาทิตย์, การเสื่อมสภาพของเส้นแบ่งเลน, และรูปทรงของยานที่ข้อมูลการฝึกไม่ได้แทนที่อย่างเพียงพอ ผลลบเท็จที่ความเร็ว 110 km/h นี้เป็นเหตุการณ์ด้านความปลอดภัย ค่า mAP 0.95 ไม่ได้ป้องกันมัน.

สิ่งที่จริง ๆ กำหนดความน่าเชื่อถือในระบบรับรู้ที่สำคัญต่อความปลอดภัยคือชุดคุณสมบัติที่แตกต่าง:

  • ความรุนแรง และความสามารถในการตรวจจับโหมดความล้มเหลว — โมเดลล้มเหลวโดยเงียบหรือผลิตผลลัพธ์ที่ความเชื่อมั่นต่ำ ซึ่งทำให้เกิดการสลับไปใช้ระบบสำรอง?
  • พฤติกรรม กรณีขอบ ที่ขอบเขตของโดเมนการออกแบบการทำงาน
  • ระดับระบบ การทำซ้ำ ที่จับความล้มเหลวของการรับรู้ก่อนที่มันจะกระจายไปยังการควบคุม ผลลัพธ์
  • ที่ผ่านการสอบเทียบ ความไม่แน่นอน — ว่าโมเดลรู้ว่าตัวเองไม่รู้อะไร

อุตสาหกรรมต้องเปลี่ยน mAP ซึ่งเป็นมาตรการสื่อสารความปลอดภัยหลักเป็น การรายงานประสิทธิภาพตามสถานการณ์ — ตัวชี้วัดแยกต่างหากสำหรับสภาวะปกติ, สภาวะเซ็นเซอร์เสื่อม, คลาสวัตถุหายาก, และสถานการณ์ขอบเขต ODD — พร้อมการวิเคราะห์โหมดความล้มเหลวอย่างชัดเจน. จนกว่าการเปลี่ยนแปลงนี้จะเกิดขึ้น, โครงการต่าง ๆ จะยังคงส่งมอบระบบที่ดูน่าประทับใจทางสถิติแต่บางครั้งอาจอันตรายในสถานการณ์ที่สำคัญที่สุด.

สิ่งที่ฉันจะบอกวิศวกรรุ่นใหม่พรุ่งนี้

บทเรียนสำคัญที่สุดที่ไม่มีหลักสูตรระดับบัณฑิตศึกษาใส่ใจสอนอย่างชัดเจน: โมเดลไม่ล้มเหลวโดยลำพัง ระบบล้มเหลว

คุณสามารถใช้เวลา 6 เดือนในการสร้างโมเดลการรับรู้ที่ได้ mAP 0.93 พร้อมกราฟการสูญเสียที่เรียบและค่า IoU ที่มั่นคง. จากนั้นคุณนำไปใช้งานกับฮาร์ดแวร์กล้องจริงและมันล้มเหลวในวิธีที่ไม่มีความเกี่ยวข้องกับสถาปัตยกรรมของโมเดล. การ การสอบเทียบกล้องโดยตรง ถูกอัปเดตครั้งสุดท้ายที่สภาพอุณหภูมิเฉพาะ 15°C ห่างจากอุณหภูมิการทำงานของคุณ. สายข้อมูลมีการแปลงพิกัดที่ทำให้เกิดการเลื่อน 1 พิกเซลที่มุมมองของ FOV. สคริปต์การเตรียมภาพใช้การทำให้เป็นมาตรฐานที่แตกต่างเล็กน้อยจากสายการฝึกที่ใช้. สิ่งเหล่านี้ไม่ใช่ปัญหาโมเดล. ทั้งหมดเป็นการทำลายประสิทธิภาพของระบบ.

โดยปฏิบัติ: สำหรับทุกโครงการใหม่, ก่อนจะสัมผัสโมเดล, ตรวจสอบเส้นทางข้อมูลทั้งหมดตั้งแต่เอาต์พุตของเซ็นเซอร์จนถึงป้ายกำกับการฝึก และถามในแต่ละขั้นตอนว่า — สมมติฐานของขั้นตอนนี้คืออะไร, และเมื่อไหร่สมมติฐานนั้นจะล้มเหลว? คำตอบจะบอกคุณมากกว่าที่ระบบจะล้มเหลวในขั้นตอนการผลิตกว่าการทดลองสถาปัตยกรรมใด ๆ.

ผลกระทบเชิงวิศวกรรมที่แท้จริงมาจากการตัดกันของฟิสิกส์, ข้อมูล, และข้อจำกัดของระบบ — ไม่ใช่จากประสิทธิภาพของโมเดลโดยลำพัง. นั่นคือส่วนที่คุณจะไม่เห็นในประวัติย่อ, แต่เป็นที่ที่วิศวกรรมจริงเกิดขึ้น.

ทิศทางของสาขานี้ในอนาคต

ในสามปีข้างหน้า, การสร้างข้อมูลสังเคราะห์ และการบูรณาการดิจิทัลทวินจะกลายเป็นแนวปฏิบัติมาตรฐาน ในสายพัฒนากล้อง ADAS, ไม่ใช่แค่ความสามารถในการวิจัย. โมเดล ML ที่ได้รับข้อมูลเชิงฟิสิกส์โดยฝังหลักการออปติกและกลศาสตร์เป็นข้อจำกัดสถาปัตยกรรมจะมาแทนที่วิธีการที่พึ่งพาข้อมูลอย่างเดียวสำหรับการทำนายคุณภาพการรับรู้. การสอบเทียบอัตโนมัติบนอุปกรณ์ — ใช้ผลลัพธ์การรับรู้ของกล้องเองเพื่อตรวจจับและชดเชยการเปลี่ยนแปลงภายใน — จะย้ายจากต้นแบบการวิจัยสู่คุณลักษณะการผลิต.

สิ่งที่ จะไม่ถูกแก้ไข คือปัญหาเคสขอบหางยาว. พื้นที่เชิงประกอบของสถานการณ์ความล้มเหลวหลายอย่าง — การเสื่อมสภาพของเซ็นเซอร์ที่ตัดกับรูปทรงถนนที่ไม่ปกติที่ตัดกับสภาพอากาศหายากที่ตัดกับพฤติกรรมผู้ใช้ถนนที่ไม่เป็นมาตรฐาน — ไม่ลดลงอย่างเชิงเส้นตามขนาดชุดข้อมูล. มันลดลงได้ดีที่สุดตามกฎกำลัง, และหางของมันแทบจะไม่มีที่สิ้นสุด. สมมติฐานว่าการขยายขนาดจะขจัดปัญหานี้คือสิ่งที่ฉันมองว่าอันตรายที่สุดในความคิดของอุตสาหกรรมในปัจจุบัน. การตอบสนองของวิศวกรรมไม่ใช่แค่เพิ่มข้อมูลเท่านั้น; มันคือการกำหนดขอบเขตการออกแบบการทำงานอย่างระมัดระวัง, การตรวจจับความล้มเหลวที่แข็งแรง, และการสื่อสารอย่างตรงไปตรงมาถึงผู้ใช้ปลายทางเกี่ยวกับสิ่งที่ระบบเหล่านี้ไม่สามารถจัดการได้อย่างเชื่อถือได้.

การสื่อสารอย่างตรงไปตรงมนั้นเป็นส่วนที่อุตสาหกรรมยังคงลังเลที่สุดในการนำเสนอ.

Vijayababu Pulla เป็นวิศวกรด้านกล้อง ADAS & AI/ML ที่มีประสบการณ์ด้านวิศวกรรมระบบยานยนต์กว่า 12 ปี รวมถึงกว่า 2 ปีในตำแหน่งหัวหน้าวิศวกรกล้อง ADAS ที่ผู้จัดจำหน่ายระดับ Tier-1 ซึ่งสนับสนุนโครงการของ GM, Stellantis และ Mazda เขามีปริญญาโทสาขาปัญญาประดิษฐ์และการเรียนรู้ของเครื่องจาก Colorado State University – Global (GPA 3.94) งานของเขาครอบคลุมการสร้างข้อมูลสังเคราะห์ด้วย GAN, สถาปัตยกรรม cGAN ที่ปรับตามฟิสิกส์สำหรับการทำนายการบิดเบือนของภาพ, การรวมเซนเซอร์, และการจำลองเส้นทางด้วย Transformer เขาตั้งอยู่ที่ Ann Arbor, MI.