โมเดลและแพลตฟอร์ม AI
นักวิจัยใช้การเรียนรู้เชิงลึกเพื่อแปลงภาพสถานที่สำคัญให้เป็น 4D

นักวิจัยจากมหาวิทยาลัยคอร์เนลล์ ได้พัฒนาวิธีการใหม่ที่ใช้การเรียนรู้เชิงลึกเพื่อแปลงภาพสถานที่สำคัญให้เป็น 4D ทีมนักวิจัยได้ใช้ภาพถ่ายที่มีอยู่ในสถานที่ท่องเที่ยว เช่น Trevi Fountain ในกรุงโรม และผลลัพธ์ที่ได้คือภาพ 3D ที่สามารถเคลื่อนไหวและแสดงการเปลี่ยนแปลงของสถานที่ตามเวลา
วิธีการใหม่นี้สามารถนำเข้าและสร้างภาพจากภาพถ่ายที่ไม่มีการระบุและไม่มีวันที่ และเป็นก้าวสำคัญสำหรับการมองเห็นของคอมพิวเตอร์
งานวิจัยนี้มีชื่อว่า “Crowdsampling the Plenoptic Function” และได้นำเสนอในการประชุมสัมมนาเกี่ยวกับการมองเห็นของคอมพิวเตอร์แห่งยุโรป ซึ่งจัดขึ้นระหว่างวันที่ 23-28 สิงหาคม
โนอาห์ สเนวェลี เป็นรองศาสตราจารย์สาขาวิทยาการคอมพิวเตอร์ที่คอร์เนลล์เทค และเป็นผู้เขียนบทความหลัก อีกทั้งยังมีนักวิจัยอื่นๆ เช่น Zhengqi Li นักศึกษาระดับ博士จากคอร์เนลล์ และ Abe Davis ผู้ช่วยศาสตราจารย์สาขาวิทยาการคอมพิวเตอร์
“มันเป็นวิธีการใหม่ในการสร้างแบบจำลองของสถานที่ที่ไม่เพียงแต่ทำให้คุณสามารถเคลื่อนไหวและดูสถานที่จากมุมต่างๆ แต่ยังให้คุณควบคุมการเปลี่ยนแปลงของสถานที่ตามเวลา” สเนวェลี กล่าว
“ถ้าคุณไปเที่ยว Trevi Fountain ในวันหยุดของคุณ สถานที่จะดูแตกต่างกันไปตามเวลา — ในตอนกลางคืนจะถูก照明ด้วยไฟจากด้านล่าง และในตอนบ่ายจะถูกส่องแสงโดยดวงอาทิตย์ เว้นแต่ว่าคุณจะไปในวันที่มีเมฆ” เขา tiếp tục “เราสามารถเรียนรู้การเปลี่ยนแปลงของสถานที่ตามเวลาและสภาพอากาศจากภาพถ่ายที่ไม่มีการระบุและไม่มีวันที่ และทำให้คุณสามารถสำรวจสถานที่ได้จากมุมต่างๆ และเวลาใดๆ”
ข้อจำกัดของการมองเห็นของคอมพิวเตอร์แบบดั้งเดิม
เนื่องจากมีหลายสิ่งที่ต้องถูกสร้างแบบจำลองในสถานที่ จึงทำให้การมองเห็นของคอมพิวเตอร์แบบดั้งเดิมไม่สามารถสร้างแบบจำลองของสถานที่ได้อย่างแม่นยำ
“โลกแห่งความเป็นจริงมีความหลากหลายมากในด้านสภาพแวดล้อมและวัสดุ — สิ่งที่มันเงา น้ำ โครงสร้างบาง” สเนวェลี กล่าว
นอกจากนี้ การมองเห็นของคอมพิวเตอร์แบบดั้งเดิมยังต้องเผชิญกับข้อมูลที่ไม่สอดคล้องกัน ฟังก์ชัน Plenoptic คือการแสดงภาพของสถานที่จากทุกมุมมองในพื้นที่และเวลา แต่ในการสร้างแบบจำลองนี้ ต้องใช้กล้องเว็บแคมหลายร้อยตัวในสถานที่ และต้องบันทึกตลอดทั้งวันและคืน ซึ่งเป็นงานที่ต้องใช้ทรัพยากรมากเมื่อพิจารณาจากจำนวนสถานที่ที่ต้องสร้างแบบจำลอง
การเรียนรู้จากภาพถ่ายอื่นๆ
เพื่อแก้ปัญหานี้ ทีมนักวิจัยได้พัฒนาวิธีการใหม่
“อาจไม่มีภาพถ่ายที่ถ่ายในเวลา 4 โมงเย็นจากมุมมองนี้ในฐานข้อมูล ดังนั้นเราจึงต้องเรียนรู้จากภาพถ่ายที่ถ่ายในเวลา 9 โมงเย็นจากที่อื่น และภาพถ่ายที่ถ่ายในเวลา 4:03 น. จากที่อื่น” สเนวェลี กล่าว “และเราก็ไม่รู้ว่าภาพถ่ายเหล่านี้ถ่ายเมื่อไหร่ แต่ด้วยการเรียนรู้เชิงลึก เราสามารถอนุมานได้ว่าสถานที่จะดูเหมือนอย่างไรในเวลาและที่ใดๆ”
นักวิจัยได้แนะนำการแสดงภาพใหม่เรียกว่า Deep Multiplane Images เพื่อสร้างแบบจำลองของสถานที่ใน 4 มิติ ซึ่งรวมถึง 3 มิติและเวลา
ตามที่สเนวェลี กล่าว “เราสามารถใช้แนวคิดที่ถูกประดิษฐ์ขึ้นสำหรับการสร้างเอฟเฟกต์ 3D ในการแอนิเมชั่น 2D เพื่อสร้างเอฟเฟกต์ 3D ในสถานที่จริง และสร้างภาพ Deep Multiplane Images โดยการปรับให้เหมาะสมกับการวัดที่ไม่สอดคล้องกันจากภาพถ่ายของนักท่องเที่ยว”
การศึกษานี้แสดงให้เห็นว่าโมเดลที่ได้รับการฝึกสามารถสร้างแบบจำลองของสถานที่ได้จากภาพถ่าย 50,000 ภาพจากแหล่งต่างๆ ทีมนักวิจัยเชื่อว่ามันจะมีผลกระทบในหลายๆ ด้าน รวมถึงการวิจัยการมองเห็นของคอมพิวเตอร์และการท่องเที่ยวเสมือนจริง
“คุณสามารถรู้สึกเหมือนอยู่ที่นั่นจริงๆ” สเนวェลี กล่าว “มันทำงานได้ดีสำหรับสถานที่หลายแห่ง”
โครงการนี้ได้รับการสนับสนุนจากอดีต CEO ของ Google (GOOGL ) และนักอนุรักษ์ Eric Schmidt รวมถึง Wendt Schmidt
https://www.youtube.com/watch?v=MAVFKWX8LYo&feature=emb_title












