โมเดลและแพลตฟอร์ม AI

นักวิจัยพัฒนาเทคนิคใหม่สำหรับการปรับปรุงภาพที่เสื่อมสภาพ

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google

ทีมนักวิจัยจาก Yale-NUS College ได้พัฒนาแนวทางใหม่ด้านการมองเห็นของคอมพิวเตอร์และการเรียนรู้เชิงลึกเพื่อดึงข้อมูลที่แม่นยำยิ่งขึ้นจากภาพที่มีคุณภาพต่ำใน视频ที่เกิดจากปัจจัยสิ่งแวดล้อม เช่น ฝนและเงื่อนไขเวลากลางคืน นอกจากนี้ยังได้ปรับปรุงความแม่นยำของการประมาณค่าพื้นฐานมนุษย์ 3 มิติใน视频

เทคโนโลยีการมองเห็นของคอมพิวเตอร์ ซึ่งใช้ในแอปพลิเคชัน เช่น ระบบเฝ้าระวังอัตโนมัติ, ยานพาหนะอัตโนมัติ และเครื่องมือสุขภาพและการรักษาระยะห่างทางสังคม มักได้รับผลกระทบจากปัจจัยสิ่งแวดล้อม ซึ่งอาจทำให้เกิดปัญหากับข้อมูลที่ดึงออกมา

การวิจัยใหม่นี้ได้นำเสนอที่ การประชุมสัมมนาเกี่ยวกับการมองเห็นของคอมพิวเตอร์และการรับรู้รูปแบบ (CVPR) ปี 2021

ผลกระทบต่อสิ่งแวดล้อมต่อภาพ

สภาพแวดล้อม เช่น แสงสว่างที่มีน้อยและผลกระทบของแสงสว่างที่มนุษย์สร้างขึ้น เช่น แสงส่องสว่าง, แสงสว่างและแสงไฟส่องสว่าง มีผลต่อภาพเวลากลางคืน ภาพฝนยังได้รับผลกระทบจากเส้นฝนหรือการสะสมฝน

รองศาสตราจารย์ Robby Tan จาก Yale-NUS College เป็นผู้นำทีมวิจัย

“ระบบการมองเห็นของคอมพิวเตอร์หลายระบบ เช่น ระบบเฝ้าระวังอัตโนมัติและรถยนต์ขับเคลื่อนอัตโนมัติ ขึ้นอยู่กับการมองเห็นที่ชัดเจนของวิดีโอเข้ามาเพื่อทำงานได้ดี ตัวอย่างเช่น รถยนต์ขับเคลื่อนอัตโนมัติไม่สามารถทำงานได้ดีในฝนที่หนัก และระบบเฝ้าระวังอัตโนมัติของ CCTV มักล้มเหลวในเวลากลางคืน โดยเฉพาะอย่างยิ่งหากฉากมีความมืดหรือมีแสงสว่างหรือแสงไฟส่องสว่างที่มีน้อย” รองศาสตราจารย์ Tan กล่าว

ทีมวิจัยได้พึ่งพาการศึกษาสองแบบที่แนะนำอัลกอริทึมการเรียนรู้เชิงลึกเพื่อปรับปรุงคุณภาพของวิดีโอเวลากลางคืนและวิดีโอฝน

การศึกษาที่หนึ่งเน้นการเพิ่มความสว่างในขณะเดียวกันก็ยังดับเสียงและผลกระทบของแสงสว่าง เช่น แสงส่องสว่าง, แสงสว่างและแสงไฟส่องสว่าง เพื่อสร้างภาพเวลากลางคืนที่ชัดเจน เทคนิคใหม่นี้มีจุดมุ่งหมายเพื่อปรับปรุงความชัดเจนในภาพและวิดีโอเวลากลางคืนเมื่อมีแสงสว่างที่ไม่สามารถหลีกเลี่ยงได้ ซึ่งวิธีการที่มีอยู่ยังไม่ได้ทำ

ในประเทศที่ฝนมีมาก การสะสมฝนมีผลเสียต่อการมองเห็นในวิดีโอ การศึกษาที่สองได้พยายามแก้ไขปัญหานี้โดยการแนะนำวิธีการที่ใช้การปรับแต่งเฟรม ซึ่งช่วยให้ได้ข้อมูลภาพที่ดีขึ้นโดยไม่ถูกกระทบจากเส้นฝน ซึ่งมักจะปรากฏแบบสุ่มในเฟรมต่างๆ ทีมวิจัยได้ใช้กล้องที่เคลื่อนไหวเพื่อใช้การประมาณค่าความลึก ซึ่งช่วยลบรอยฝนออก วิธีการที่พัฒนาขึ้นใหม่สามารถลบรอยฝนและรอยฝนที่มีผลกระทบต่อการมองเห็นได้พร้อมๆ กัน ในขณะที่วิธีการที่มีอยู่มุ่งเน้นไปที่การลบรอยฝนเท่านั้น

ภาพ: Yale-NUS College

การประมาณค่าพื้นฐานมนุษย์ 3 มิติ

พร้อมกับเทคนิคใหม่ๆ ทีมวิจัยได้นำเสนอการวิจัยเกี่ยวกับการประมาณค่าพื้นฐานมนุษย์ 3 มิติ ซึ่งสามารถใช้ในระบบเฝ้าระวังวิดีโอ, การเล่นเกมวิดีโอ และการถ่ายทอดกีฬาทางโทรทัศน์

การประมาณค่าพื้นฐานมนุษย์ 3 มิติจากวิดีโอที่ถ่ายจากกล้องเดียวได้รับการวิจัยอย่างมากในช่วงไม่กี่ปีที่ผ่านมา ไม่เหมือนกับวิดีโอที่ถ่ายจากกล้องหลายตัว วิดีโอที่ถ่ายจากกล้องเดียวมีความยืดหยุ่นและสามารถถ่ายจากกล้องโทรศัพท์มือถือได้

อย่างไรก็ตาม กิจกรรมที่มีระดับสูง เช่น บุคคลหลายคนในฉากเดียวกัน มีผลต่อความแม่นยำในการตรวจจับมนุษย์ โดยเฉพาะอย่างยิ่งเมื่อบุคคลเหล่านั้นโต้ตอบกันอย่างใกล้ชิดหรือทับซ้อนกันในวิดีโอที่ถ่ายจากกล้องเดียว

การวิจัยที่สามของทีมได้ประมาณค่าพื้นฐานมนุษย์ 3 มิติจากวิดีโอโดยการรวมวิธีการที่มีอยู่สองวิธี ซึ่งเป็นวิธีการจากบนลงล่างและจากล่างขึ้นบน วิธีการใหม่นี้ให้ผลการประมาณค่าที่น่าเชื่อถือมากกว่าในสถานการณ์ที่มีหลายคน และสามารถจัดการระยะห่างระหว่างบุคคลได้ดีขึ้น

“ในขั้นตอนต่อไปของการวิจัยการประมาณค่าพื้นฐานมนุษย์ 3 มิติของเรา ซึ่งได้รับการสนับสนุนจาก National Research (NRC ) Foundation เราจะมุ่งเน้นไปที่การปกป้องข้อมูลความเป็นส่วนตัวของวิดีโอ สำหรับวิธีการเพิ่มความชัดเจนของภาพ เราตั้งเป้าที่จะช่วยให้เกิดความก้าวหน้าในด้านการมองเห็นของคอมพิวเตอร์ ซึ่งเป็นสิ่งสำคัญต่อหลายๆ แอปพลิเคชันที่สามารถส่งผลกระทบต่อชีวิตประจำวันของเรา เช่น การทำให้รถยนต์ขับเคลื่อนอัตโนมัติทำงานได้ดีขึ้นในสถานการณ์สภาพอากาศที่ไม่เหมาะสม” รองศาสตราจารย์ Tan กล่าว

Alex McFarland เป็นนักข่าวและนักเขียน AI ที่สำรวจการพัฒนาล่าสุดในด้านปัญญาประดิษฐ์ เขาได้ร่วมงานกับสตาร์ทอัพ AI และสื่อสิ่งพิมพ์ต่างๆ ทั่วโลก