โมเดลและแพลตฟอร์ม AI

Intel Labs พัฒนาเทคโนโลยีการมองเห็นของคอมพิวเตอร์ด้วยโมเดล AI 2 รุ่นใหม่

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

VI-Depth 1.0 และ MiDaS 3.1 เป็นโมเดล AI ที่เปิดเผยต้นฉบับ ซึ่งสามารถปรับปรุงการประมาณการความลึกสำหรับการมองเห็นของคอมพิวเตอร์ได้

การประมาณการความลึกเป็นงานที่ท้าทายสำหรับการมองเห็นของคอมพิวเตอร์ ซึ่งจำเป็นต้องใช้ในการสร้างแอปพลิเคชันต่างๆ ในด้านหุ่นยนต์ ความเป็นจริงเสริม (AR) และความเป็นจริงเสมือน (VR) วิธีแก้ปัญหาแบบเดิมๆ มักจะประสบปัญหาในการประมาณการระยะทางอย่างถูกต้อง ซึ่งเป็นประเด็นสำคัญในการช่วยวางแผนการเคลื่อนไหวและหลีกเลี่ยงอุปสรรคเมื่อใช้การนำทางด้วยภาพ นักวิจัยที่ Intel (INTC ) Labs ได้พัฒนาโมเดล AI 2 รุ่นสำหรับการประมาณการความลึกแบบมอนโอคิวลาร์: หนึ่งสำหรับการประมาณการความลึกแบบวิชวล-อินเนอร์เชียล และอีกหนึ่งสำหรับการประมาณการความลึกสัมพัทธ์ที่มีความแข็งแกร่ง (RDE)

โมเดล RDE ล่าสุด MiDaS เวอร์ชัน 3.1 สามารถคาดการณ์ความลึกสัมพัทธ์ที่มีความแข็งแกร่งโดยใช้ภาพเดียวเป็นข้อมูลเข้า เนื่องจากได้รับการฝึกอบรมจากชุดข้อมูลขนาดใหญ่และหลากหลาย จึงสามารถทำงานได้อย่างมีประสิทธิภาพในงานและสภาพแวดล้อมที่หลากหลาย เวอร์ชันล่าสุดของ MiDaS ปรับปรุงความแม่นยำของโมเดลสำหรับการประมาณการความลึกสัมพัทธ์โดยประมาณ 30% โดยใช้ชุดข้อมูลฝึกอบรมที่ใหญ่ขึ้นและโครงสร้างncoderที่ได้รับการปรับปรุง

MiDaS ได้ถูกนำไปใช้ในหลายโครงการ โดยเฉพาะอย่างยิ่ง Stable Diffusion 2.0 ซึ่งสามารถใช้ฟังก์ชัน depth-to-image ที่อนุมานความลึกของภาพเข้าและสร้างภาพใหม่โดยใช้ข้อมูลข้อความและความลึก ตัวอย่างเช่น Scottie Fox นักสร้างดิจิทัลได้ใช้การผสมผสานระหว่าง Stable Diffusion และ MiDaS เพื่อสร้างสภาพแวดล้อม VR 360 องศา เทคโนโลยีนี้อาจนำไปสู่การประยุกต์ใช้ใหม่ๆ ในด้านเสมือน เช่น การสร้างภาพเหตุการณ์จริงสำหรับคดีในศาล สภาพแวดล้อมการรักษาพยาบาล และเกมที่มีการมีส่วนร่วมสูง

ในขณะที่ RDE มีการทั่วไปและเป็นประโยชน์ แต่การขาดมาตราส่วนทำให้ความเป็นประโยชน์ลดลงสำหรับงานที่ต้องการความลึกแบบเมตริก เช่น การทำแผนที่ การวางแผน การนำทาง การรู้จำวัตถุ การสร้างภาพ 3 มิติ และการแก้ไขภาพ นักวิจัยที่ Intel Labs ได้พัฒนาโมเดล AI อีกหนึ่งรุ่นชื่อ VI-Depth เพื่อแก้ปัญหานี้

VI-Depth เป็นไปเป็นโมเดลการประมาณการความลึกแบบวิชวล-อินเนอร์เชียลที่รวมการประมาณการความลึกแบบมอนโอคิวลาร์และวิชวล-อินเนอร์เชียลออดิโอเมทริกซ์ (VIO) เพื่อสร้างการประมาณการความลึกแบบเมทริกที่มีความหนาแน่น วิธีนี้ให้การประมาณการความลึกที่แม่นยำ ซึ่งสามารถช่วยในการสร้างภาพเหตุการณ์จริง การทำแผนที่ และการควบคุมวัตถุ

การรวมข้อมูลอินเนอร์เชียลสามารถช่วยแก้ปัญหาเรื่องมาตราส่วน ความสอดคล้องระดับโลกจะกำหนดมาตราส่วนระดับโลกที่เหมาะสม ในขณะที่การปรับมาตราส่วนแบบท้องถิ่น (SML) ทำงานที่ระดับท้องถิ่นและดันหรือดึงภูมิภาคไปสู่ความลึกแบบเมตริกที่ถูกต้อง โครงสร้าง SML ใช้ MiDaS เป็นโครงสร้างncoderหลัก ในการรวมโมเดลแบบโมดูลาร์ VI-Depth รวมการประมาณการความลึกแบบขับเคลื่อนด้วยข้อมูลกับการคาดการณ์ความลึกสัมพัทธ์ของ MiDaS พร้อมกับการวัดของหน่วยวัดอินเนอร์เชียล (IMU) การรวมแหล่งข้อมูลเหล่านี้ทำให้ VI-Depth สามารถสร้างการประมาณการความลึกแบบเมทริกที่มีความหนาแน่นและเชื่อถือได้สำหรับทุกพิกเซลในภาพ

MiDaS 3.1 และ VI-Depth 1.0 เปิดเผยต้นฉบับภายใต้ลิขสิทธิ์ MIT ที่เปิดเผยต้นฉบับบน GitHub

สำหรับข้อมูลเพิ่มเติม โปรดอ้างอิง “Vision Transformers for Dense Prediction” และ “Towards Robust Monocular Depth Estimation: Mixing Datasets for Zero-shot Cross-dataset Transfer

ดาเนียลเป็นผู้สนับสนุนอย่างมากเกี่ยวกับวิธีที่ AI จะมาเปลี่ยนแปลงทุกสิ่งทุกอย่างในอนาคต เขาเต็มไปด้วยเทคโนโลยีและใช้ชีวิตเพื่อทดลองอุปกรณ์ใหม่ๆ