โมเดลและแพลตฟอร์ม AI

เทคนิคใหม่ช่วยให้ AI ระบุวัตถุ 3 มิติ

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

นักวิจัยจากมหาวิทยาลัยแห่งรัฐนอร์ทแคโรไลนาได้พัฒนาเทคนิคใหม่ที่ช่วยให้โปรแกรม AI สามารถระบุวัตถุ 3 มิติได้ดีขึ้น เทคนิคนี้เรียกว่า MonoCon และช่วยให้ AI เรียนรู้ว่าวัตถุ 3 มิติเหล่านั้นเกี่ยวข้องกันอย่างไรในพื้นที่ 3 มิติ โดยใช้ภาพ 2 มิติ

MonoCon มีศักยภาพในการใช้งานในหลายๆ ด้าน รวมถึงช่วยให้รถยนต์ไร้คนขับสามารถนำทางผ่านวัตถุอื่นๆ ได้ดีขึ้น โดยใช้ภาพ 2 มิติที่ได้รับจากกล้องบนรถยนต์ และอาจใช้ในการผลิตและหุ่นยนต์

Tianfu Wu เป็นนักวิจัยหลักของ งานวิจัย และเป็นรองศาสตราจารย์สาขาวิศวกรรมไฟฟ้าและคอมพิวเตอร์ที่มหาวิทยาลัยแห่งรัฐนอร์ทแคโรไลนา

“เราอาศัยอยู่ในโลก 3 มิติ แต่เมื่อเราถ่ายรูป มันจะบันทึกโลกนั้นในภาพ 2 มิติ” Wu กล่าว

“โปรแกรม AI ได้รับข้อมูลทางภาพจากกล้อง ดังนั้นหากเราต้องการให้ AI สื่อสารกับโลก เราต้องแน่ใจว่ามันสามารถตีความสิ่งที่ภาพ 2 มิติสามารถบอกได้เกี่ยวกับพื้นที่ 3 มิติ ในการวิจัยนี้ เราเน้นไปที่ส่วนหนึ่งของความท้าทายนี้: วิธีการที่เราจะได้ AI ระบุวัตถุ 3 มิติ — เช่น คนหรือรถยนต์ — ในภาพ 2 มิติ และวางวัตถุเหล่านั้นในพื้นที่” Wu กล่าวต่อ

รถยนต์ไร้คนขับ

รถยนต์ไร้คนขับมักใช้ lidar เพื่อนำทางในพื้นที่ 3 มิติ lidar ซึ่งใช้เลเซอร์ในการวัดระยะทาง มีราคาแพง ซึ่งหมายความว่าระบบอัตโนมัติไม่ได้รวมการซ้ำซ้อนมากนัก การติดตั้งเซ็นเซอร์ lidar หลายสิบตัวบนรถยนต์ไร้คนขับที่ผลิตจำนวนมากจะมีราคาแพงมาก

“แต่ถ้ารถยนต์ไร้คนขับสามารถใช้ข้อมูลทางภาพเพื่อนำทางผ่านพื้นที่ได้ คุณสามารถสร้างการซ้ำซ้อนได้” Wu กล่าว “เนื่องจากกล้องมีราคาถูกกว่า lidar มาก จึงเป็นไปได้ทางเศรษฐกิจที่จะรวมกล้องเพิ่มเติม — สร้างการซ้ำซ้อนในระบบและทำให้มันปลอดภัยและแข็งแกร่งยิ่งขึ้น

“นี่คือการประยุกต์ใช้จริง แต่เราก็ตื่นเต้นเกี่ยวกับการพัฒนาพื้นฐานของงานนี้ด้วย: การที่เราจะได้ข้อมูล 3 มิติจากวัตถุ 2 มิติ”

การฝึกอบรม AI

MonoCon สามารถระบุวัตถุ 3 มิติในภาพ 2 มิติก่อนที่จะวางวัตถุใน “กล่องขอบเขต” ซึ่งบอก AI เกี่ยวกับขอบเขตภายนอกของวัตถุ

“สิ่งที่ทำให้การทำงานของเราต่างจากคนอื่นคือวิธีการฝึกอบรม AI ของเรา ซึ่งสร้างขึ้นจากเทคนิคการฝึกอบรมก่อนหน้านี้” Wu กล่าว “เช่นเดียวกับการพยายามก่อนหน้านี้ เราวางวัตถุในกล่องขอบเขต 3 มิติขณะฝึกอบรม AI แต่นอกจากจะขอให้ AI คาดการณ์ระยะทางจากกล้องถึงวัตถุและขนาดของกล่องขอบเขตแล้ว เรายังขอให้ AI คาดการณ์ตำแหน่งของแต่ละจุดของกล่องและระยะห่างจากจุดศูนย์กลางของกล่องขอบเขตในสองมิติ เรียกว่า ‘บริบทเสริม’ และเราพบว่ามันช่วยให้ AI ระบุและคาดการณ์วัตถุ 3 มิติจากภาพ 2 มิติได้อย่างแม่นยำยิ่งขึ้น

“วิธีการที่เราเสนอได้รับแรงบันดาลใจจากทฤษฎีบทที่รู้จักกันดีในทฤษฎีการวัด Cramér-Wold theorem และอาจใช้ได้กับการทำนายผลลัพธ์ที่มีโครงสร้างอื่นๆ ในการมองเห็นคอมพิวเตอร์”

MonoCon ถูกทดสอบด้วยชุดข้อมูลมาตรฐานที่ใช้กันอย่างแพร่หลายชื่อ KITTI

“ในเวลาที่เราส่งงานวิจัยนี้ MonoCon ทำงานได้ดีกว่าโปรแกรม AI อื่นๆ หลายสิบตัวที่มีจุดมุ่งหมายเพื่อแยกข้อมูล 3 มิติของรถยนต์จากภาพ 2 มิติ” Wu กล่าว

ทีมงานจะขยายกระบวนการนี้โดยใช้ข้อมูลที่ใหญ่ขึ้น

“เรากำลังขยายกระบวนการนี้และทำงานกับข้อมูลที่ใหญ่ขึ้นเพื่อประเมินและปรับแต่ง MonoCon สำหรับการใช้งานในรถยนต์ไร้คนขับ” Wu กล่าว “เรายังต้องการสำรวจการประยุกต์ใช้ในด้านการผลิต เพื่อดูว่าเราสามารถปรับปรุงประสิทธิภาพของงาน เช่น การใช้หุ่นยนต์แขนได้หรือไม่”

Alex McFarland เป็นนักข่าวและนักเขียน AI ที่สำรวจการพัฒนาล่าสุดในด้านปัญญาประดิษฐ์ เขาได้ร่วมงานกับสตาร์ทอัพ AI และสื่อสิ่งพิมพ์ต่างๆ ทั่วโลก