มุมมองของ Anderson

การสร้างเส้นทางสำหรับผู้ตาบอดด้วย Machine Learning

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

การวิจัยใหม่จากเยอรมนีเสนอระบบพกพาที่ใช้ GPU เพื่อช่วยให้ผู้ที่มีปัญหาการมองเห็นสามารถเดินไปในโลกแห่งความเป็นจริงได้ ระบบนี้แก้ไขปัญหาที่สำคัญในการทำงานของวิชั่นคอมพิวเตอร์แบบเรียลไทม์ – การระบุวัตถุที่มีความโปร่งใส เช่น แก้ว และอุปสรรคอื่นๆ

บทความวิจัย นี้ จากสถาบันเทคโนโลยีแห่งคาร์ลส์รูเอ์ ให้รายละเอียดเกี่ยวกับการสร้างระบบที่สวมใส่ได้ ซึ่งเรียกว่า Trans4Trans โดยประกอบด้วยแว่นตาสมาร์ทที่เชื่อมต่อกับเคส GPU พกพา ซึ่งเป็นคอมพิวเตอร์แบบพกพาที่มีน้ำหนักเบา ซึ่งสามารถบันทึกภาพ RGB และภาพลึกที่ 640×480 พิกเซลในกระแสที่ไม่หยุดนิ่ง ซึ่งจะถูกส่งผ่านเฟรมเวิร์กการแบ่งส่วนแบบเชิงความหมาย

เซ็นเซอร์มือถือในระบบ Trans4Trans. Source: https://arxiv.org/pdf/2107.03172.pdf

เซ็นเซอร์มือถือในระบบ Trans4Trans. Source: https://arxiv.org/pdf/2107.03172.pdf

ความสามารถในการให้ข้อมูลย้อนกลับทางสัมผัสของระบบได้รับการเพิ่มขึ้นโดยใช้หูฟังที่ส่งเสียงผ่านกระดูก ซึ่งจะส่งเสียงย้อนกลับเมื่อมีอุปสรรคในบริเวณใกล้เคียง

ระบบ Trans4Trans ยังได้รับการทดสอบบนแพลตฟอร์ม HoloLens 2 ของ Microsoft โดยสามารถแบ่งส่วนและระบุอุปสรรคที่อาจเป็นอันตราย เช่น ประตูแก้วได้อย่างสมบูรณ์และต่อเนื่อง

Trans4Trans ทำงานบน HoloLens 2.

Trans4Trans ทำงานบน HoloLens 2.

สถาปัตยกรรม

Trans4Trans ใช้วิธีการแบบคู่ โดยใช้ทั้ง โครงข่ายประสาทเทียมแบบ Transformer ทั้งแบบเข้ารหัสและแบบถอดรหัส และใช้โมดูล Transformer Pairing Module (TPM) ที่สามารถรวบรวมแผนที่คุณลักษณะที่สร้างโดยการฝังตัวของส่วนแบ่งที่หนาแน่น ในขณะที่โครงข่ายประสาทเทียมแบบ Transformer ที่ใช้ในการถอดรหัสสามารถวิเคราะห์แผนที่คุณลักษณะจากเครื่องมือเข้ารหัสที่จับคู่กันได้อย่างต่อเนื่อง

สถาปัตยกรรมของ Trans4Trans.

สถาปัตยกรรมของ Trans4Trans.

ฮาร์ดแวร์

แว่นตาที่ใช้ในระบบมีเซ็นเซอร์ RealSense R200 RGB-D ในขณะที่เครื่องแม่ข่ายมี Jetson AGX Xavier NVIDIA GPU ที่ออกแบบสำหรับระบบฝังตัว โดยมี 384 CUDA คอร์และ 48 Tensor คอร์

การป้องกันการอัดแน่นทาง认知ของผู้ใช้

ระบบต้องสร้างสมดุลระหว่างความถี่ของข้อมูลที่เหมาะสมและข้อมูลที่มากเกินไป เนื่องจากผู้สวมต้องสามารถแยกแยะสภาพแวดล้อมได้อย่างชัดเจนผ่านการให้ข้อมูลย้อนกลับทางเสียงและการสั่น

การทดสอบ Trans4Trans

ระบบ Trans4Trans ได้รับการทดสอบบนชุดข้อมูลสองชุดเกี่ยวกับการแบ่งส่วนวัตถุที่มีความโปร่งใส: Trans10K-V2 จากมหาวิทยาลัยฮ่องกง et al ซึ่งมีภาพวัตถุที่มีความโปร่งใส 10,428 ภาพสำหรับการยืนยัน การฝึกอบรม และการทดสอบ; และชุดข้อมูล Stanford2D3D ซึ่งมีภาพวัตถุที่มีความโปร่งใส 70,496 ภาพที่ถ่ายที่ความละเอียด 1080×1080

ภาพและหน้ากากที่สอดคล้องกันจากชุดข้อมูล Trans10k. Source: https://arxiv.org/pdf/2101.08461.pdf

ภาพและหน้ากากที่สอดคล้องกันจากชุดข้อมูล Trans10k. Source: https://arxiv.org/pdf/2101.08461.pdf

ในการทดสอบ Trans4Trans ยังสามารถแบ่งส่วนวัตถุที่มีความโปร่งใสที่ถูกจัดประเภทผิดโดย Trans2Seg initiative ที่ปล่อยออกมาในต้นปี 2021 โดยนักวิจัยเดียวกัน ในขณะที่ต้องการ GFLOPS น้อยกว่าในการคำนวณและแบ่งส่วนพื้นผิว

ไม่เหมือนกับ Trans2Seq ซึ่งใช้เครื่องมือเข้ารหัสแบบ CNN และโครงข่ายประสาทเทียมแบบ Transformer สำหรับการถอดรหัส Trans4Trans ใช้โครงข่ายประสาทเทียมแบบ Transformer ทั้งสำหรับการเข้ารหัสและถอดรหัส โดยสามารถทำผลงานได้ดีกว่าวิธีการก่อนหน้าและปรับปรุงผลงานบน PVT ได้อย่างมาก

อัลกอริทึมยังสามารถทำผลงานได้ดีที่สุดสำหรับชั้นวัตถุที่มีความโปร่งใสจำนวนหนึ่ง รวมถึง กระปุก, หน้าต่าง, ประตู, ถ้วย, กล่อง และ ขวด โดยใช้โครงข่ายประสาทเทียมแบบ Transformer ทั้งสำหรับการเข้ารหัสและถอดรหัส โดยสามารถทำผลงานได้ดีกว่าวิธีการก่อนหน้าและปรับปรุงผลงานบน PVT ได้อย่างมาก โดยใช้โครงข่ายประสาทเทียมแบบ Transformer ทั้งสำหรับการเข้ารหัสและถอดรหัส ซึ่งสามารถทำผลงานได้ดีกว่าวิธีการก่อนหน้าและปรับปรุงผลงานบน PVT ได้อย่างมาก และยังสามารถแบ่งส่วนวัตถุที่มีความโปร่งใสที่ถูกจัดประเภทผิดโดย Trans2Seg ได้อย่างแม่นยำ

นักเขียนเกี่ยวกับเครื่องมือการเรียนรู้ของเครื่อง และผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์ อดีตหัวหน้าเนื้อหาวิจัยที่ Metaphysic.ai จนกระทั่งถูกยุบเข้ากับ Brahma.ai ของ DNEG
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai