มุมมองของ Anderson
ข้อมูลสังเคราะห์: สะพานช่องว่างการบดบังด้วย Grand Theft Auto

นักวิจัยจากมหาวิทยาลัยอิลลินอยส์ได้สร้างชุดข้อมูลการมองเห็นของคอมพิวเตอร์ใหม่ที่ใช้ภาพสังเคราะห์ที่สร้างโดยเครื่องยนต์เกม Grand Theft Auto เพื่อช่วยแก้ปัญหาที่ยากที่สุดในการแบ่งส่วนเชิงความหมาย – การตระหนักวัตถุที่มองเห็นไม่เต็มที่ในภาพและวิดีโอต้นกำเนิด
เพื่อจุดประสงค์นี้ ตามที่อธิบายไว้ใน เอกสาร นักวิจัยได้ใช้เครื่องยนต์เกม GTA-V เพื่อสร้างชุดข้อมูลสังเคราะห์ที่ไม่เพียงแต่มีจำนวนกรณีการบดบังที่มากที่สุดเท่านั้น แต่ยังมีการแบ่งส่วนเชิงความหมายและป้ายกำกับที่สมบูรณ์แบบ และคำนึงถึงข้อมูลเชิงเวลาในลักษณะที่ไม่ได้รับการแก้ไขโดยชุดข้อมูลที่เปิดให้ใช้งานที่คล้ายกัน
การทำความเข้าใจฉากที่สมบูรณ์
วิดีโอด้านล่างที่เผยแพร่เป็นวัสดุสนับสนุนการวิจัย แสดงถึงข้อได้เปรียบที่มีการทำความเข้าใจฉาก 3 มิติที่สมบูรณ์แบบ โดยวัตถุที่บดบังถูกรู้จักและเปิดเผยในฉากในทุกกรณี ทำให้ระบบที่ประเมินสามารถเรียนรู้เพื่อเชื่อมโยงการมองเห็นที่บดบังบางส่วนกับวัตถุทั้งหมด (ที่มีป้ายกำกับ)
แหล่งที่มา: http://sailvos.web.illinois.edu/_site/index.html
ชุดข้อมูลที่ได้รับซึ่งเรียกว่า SAIL-VOS 3D อ้างว่าเป็นชุดข้อมูลวิดีโอเมชสังเคราะห์แรกที่มีการทำเครื่องหมายเฟรมต่อเฟรม การแบ่งส่วนระดับอินสแตนซ์ ความลึกของภาพที่แท้จริงสำหรับมุมมองของฉาก และการทำเครื่องหมาย 2 มิติที่กำหนดโดยกล่องล้อมรอบ

แหล่งที่มา (คลิกเพื่อขยาย)
การทำเครื่องหมายของ SAIL-VOS 3D รวมถึงความลึก ระดับอินสแตนซ์ โหมดและ การทำเครื่องหมายที่ไม่มีรูปแบบ ป้ายกำกับเชิงความหมาย และเมช 3 มิติ ข้อมูลรวม 484 วิดีโอจำนวน 237,611 เฟรมที่ความละเอียด 1280×800 รวมถึงการเปลี่ยนช็อต

ด้านบน คือเฟรม CGI ต้นฉบับ; แถวที่สอง คือการแบ่งส่วนระดับอินสแตนซ์; แถวที่สาม คือการทำเครื่องหมายที่ไม่มีรูปแบบ ซึ่งแสดงถึงความลึกของการทำความเข้าใจฉากและความโปร่งใสที่มีอยู่ในข้อมูล แหล่งที่มา (คลิกเพื่อขยาย)
ชุดข้อมูลนี้แบ่งออกเป็น 6,807 คลิป โดยมีเฟรมเฉลี่ย 34.6 เฟรมต่อคลิป และข้อมูลนี้มีการทำเครื่องหมาย 3,460,213 อินสแตนซ์ของวัตถุซึ่งมาจาก 3,576 โมเดลเมชในเครื่องยนต์เกม GTA-V ซึ่งถูกกำหนดให้เป็น 178 หมวดหมู่เชิงความหมาย
การสร้างเมชและป้ายกำกับอัตโนมัติ
เนื่องจากการวิจัยชุดข้อมูลในอนาคตอาจเกิดขึ้นบนภาพที่แท้จริง เมชใน SAIL-VOS 3D จึงถูกสร้างขึ้นโดยใช้เฟรมเวิร์กการเรียนรู้ของเครื่องจักร แทนที่จะมาจากเครื่องยนต์เกม GTA-V

ด้วยความเข้าใจโปรแกรมและแทบจะเป็น ‘โฮโลกราฟิก’ ของการแสดงฉากทั้งหมด ภาพ SAIL-VOS 3D สามารถสังเคราะห์ภาพแทนของวัตถุที่ซ่อนอยู่โดยการบดบัง เช่น แขนของตัวละครที่กำลังหมุนตัวในภาพนี้ ในลักษณะที่จะพึ่งพาหลายตัวอย่างในภาพที่แท้จริง (คลิกเพื่อขยาย) แหล่งที่มา: https://arxiv.org/pdf/2105.08612.pdf
เนื่องจากวัตถุแต่ละชิ้นในโลกของ GTA-V มี ID ที่เป็นเอกลักษณ์ SAIL-VOS จึงสามารถรับ ID เหล่านี้จากเครื่องยนต์เรนเดอร์โดยใช้ไลบรารีฮุกของ GTA-V สิ่งนี้ช่วยแก้ปัญหาในการรับวัตถุอีกครั้งหากวัตถุออกจากมุมมองชั่วคราว เนื่องจากการทำเครื่องหมายเป็นแบบคงเส้นและเชื่อถือได้ มี 162 วัตถุในสภาพแวดล้อมที่นักวิจัยได้กำหนดให้เป็นชั้นเรียนที่สอดคล้องกัน
ความหลากหลายของฉากและวัตถุ
วัตถุหลายชิ้นในเครื่องยนต์เกม GTA-V เป็นธรรมชาติ และดังนั้นจึงมี 60% ของชั้นเรียนที่มีอยู่ในชุดข้อมูล MS-COCO ของ Microsoft ที่ใช้บ่อยในปี 2014

ชุดข้อมูล SAIL-VOS รวมถึงฉากภายในและภายนอกที่หลากหลายภายใต้สภาพอากาศที่แตกต่างกัน โดยมีตัวละครสวมเสื้อผ้าที่หลากหลาย (คลิกเพื่อขยาย)
ความสามารถในการใช้งาน
เพื่อให้แน่ใจว่าเข้ากันได้กับการวิจัยทั่วไปในพื้นที่นี้ และเพื่อยืนยันว่าการเข้าใกล้สังเคราะห์นี้สามารถให้ประโยชน์ต่อโครงการที่ไม่ใช่สังเคราะห์ นักวิจัยได้ประเมินชุดข้อมูลโดยใช้วิธีการตรวจจับตามเฟรมที่ใช้กับ MS-COCO และ การประกวดวัตถุเชิงภาพ PASCAL Visual Object Classes (VOC) ปี 2012 โดยมีการใช้ความแม่นยำโดยเฉลี่ยเป็นเมตริก
นักวิจัยพบว่าการฝึกอบรมล่วงหน้าบนชุดข้อมูล SAIL-VOS ทำให้ประสิทธิภาพของการตรวจจับวัตถุโดยใช้ IoU ดีขึ้น 19% โดยมีการปรับปรุงประสิทธิภาพของ VideoMatch จาก 55% เป็น 74% บนข้อมูลที่ไม่เคยเห็นมาก่อน
อย่างไรก็ตาม ในกรณีการบดบังที่รุนแรง มีบางครั้งที่วิธีการเก่าไม่สามารถระบุวัตถุหรือบุคคลได้ แต่นักวิจัยคาดการณ์ว่าสิ่งนี้สามารถแก้ไขได้ในอนาคตโดยการตรวจสอบเฟรมที่อยู่ติดกันเพื่อกำหนดเหตุผลของการทำเครื่องหมายที่ไม่มีรูปแบบ













