มุมมองของ Anderson
การปรับปรุงการลบพื้นหลัง AI โดยไม่ต้องมีการทำเครื่องหมายของมนุษย์ที่มีค่าใช้จ่ายสูง

การวิจัยใหม่แสดงให้เห็นว่า AI สามารถตัดคนออกจากวิดีโอได้อย่างสะอาดโดยไม่ต้องมีการทำเครื่องหมายของมนุษย์ที่มีค่าใช้จ่ายสูง ซึ่งจะช่วยปรับปรุงคุณภาพและเสถียรภาพ
ส่วนใหญ่ของเราจะได้สัมผัสกับการถูก “ตัดออก” จากพื้นหลังผ่านฟิลเตอร์การเปลี่ยนพื้นหลัง/บดบังพื้นหลังที่ง่ายๆ บนวิดีโอแชท และเราอาจจะสังเกตเห็นข้อจำกัดของระบบเหล่านั้น ซึ่งได้รับการฝึกฝนจากกรณีที่พบได้บ่อยที่สุดใน会议วิดีโอ และไม่ค่อยทนต่อสิ่งที่ “ไม่คาดคิด” หรือแม้แต่ “คาดคิด” เช่น นิ้ว

ตัวอย่างทั่วไปของระบบการถอดพื้นหน้าโดยใช้ AI ที่ตัดพื้นหลังออกไปมากเกินไป. แหล่งที่มา
วิธีที่ง่ายที่สุดและเป็นที่นิยมมากขึ้นในการแก้ปัญหานี้คือการ ปรับแต่ง โมเดลที่มีอยู่แล้วบนข้อมูลที่อาจพบได้โดยระบบ
สองชุดข้อมูลที่มีการทำเครื่องหมายอย่างหนักเป็นพื้นฐานของวิธีแก้ปัญหาที่นำเสนอในเอกสารปี 2020 เรื่อง ‘การทำพื้นหลังแบบเรียลไทม์ด้วยความละเอียดสูง’. แหล่งที่มา
อย่างไรก็ตาม ข้อมูลดังกล่าวต้องได้รับการทำเครื่องหมายโดยมนุษย์ ซึ่งมีค่าใช้จ่ายสูงและใช้เวลานาน และในกรณีนี้จะส่งผลให้ได้เครื่องมือที่เฉพาะเจาะจงและไม่ค่อยทั่วไปซึ่งมีค่าใช้จ่ายสูงและไม่สามารถใช้ได้กับงานอื่นๆ
ไม่เช่นนั้น การพัฒนาวิธีการ “เฉพาะจุด” ของประเภทนี้เป็นวิธีที่สั้นที่สุดในการได้ผลลัพธ์ที่มีประสิทธิภาพในหลายโดเมน ไม่ใช่แค่วิดีโอและภาพเท่านั้น
ตัดออก!
เมื่อเร็วๆ นี้ มีความสนใจที่เพิ่มขึ้นในการใช้ Segment Anything (SAM) เพื่อให้ได้การถอดพื้นหน้าโดยอัตโนมัติและละเอียด
คลิกเพื่อเล่นตามความจำเป็น ตัวอย่างของพื้นหน้าที่ถูกสร้างขึ้นโดยโมเดล Segment Anything – เหมาะสำหรับการทำเครื่องหมาย แต่ไม่ดีพอสำหรับการตัดพื้นหลังแหล่งที่มา
การเสนอใหม่จากจีนได้เสนอวิธีการที่ซับซ้อนมากขึ้นในการใช้โมเดล SAM เพื่อให้ได้กระบวนการถอดพื้นหน้าที่ดีกว่า – โดยการผสมผสานตัวติดตามพื้นฐาน เช่น SAM กับสะพานการเสนอพื้นที่ที่มีหัวทำพื้นหน้าเฉพาะ
คลิกเพื่อเล่นตามความจำเป็น จากเว็บไซต์เสริมที่รองรับเอกสารใหม่ ตัวอย่างวิดีโอที่แสดงถึงความซับซ้อนของวิธีการของนักวิจัยแหล่งที่มา
สิ่งสำคัญที่สุดคือ ระบบใหม่นี้ฝึกฝนบนภาพ ไม่ใช่วิดีโอ และไม่ต้องการการทำเครื่องหมายเพิ่มเติมโดยมนุษย์ – สิ่งที่เป็นอุปสรรคทั่วไปต่อความก้าวหน้าในโดเมน AI นี้และโดเมนอื่นๆ
ตัวอย่างของการทำพื้นหน้าภาพและวิดีโอที่ได้รับจากวิธีการใหม่ โดยมีกรณีที่ท้าทาย เช่น ผม สีใส และการเคลื่อนไหว แสดงพร้อมกับลำดับในโลกแห่งความเป็นจริงที่วิธีการนี้ให้ผลลัพธ์ที่ “สะอาด” และ “มีเสถียรภาพ” มากกว่าวิธีการก่อนหน้า. แหล่งที่มา
ด้วยโมเดลทดลองสามแบบที่สร้างขึ้นสำหรับการทำงานนี้ ผู้เขียนอ้างว่าได้ผลลัพธ์ที่ดีกว่าในงานนี้ ในขณะที่ยังคงความสามารถในการทั่วไปที่สูงกว่าของโมเดลพื้นฐาน ซึ่งหมายความว่าวิธีการนี้ให้ผลลัพธ์ที่เป็นแบบ “ทั่วไป” พร้อมความสามารถพิเศษ ไม่ใช่เครื่องมือที่มุ่งเน้นไปที่งานเดียว
ผู้เขียนระบุว่า:
‘การทดลองที่ครอบคลุมแสดงให้เห็นว่า SAM2Matting ได้ผลลัพธ์ที่ดีกว่า (SOTA) ทั้งการทำพื้นหน้าภาพและวิดีโอ โดยมีการประเมินวิดีโอด้วยวิธีการ “zero-shot”‘
‘ผลลัพธ์ “ในโลกแห่งความเป็นจริง” ที่กว้างขวางยิ่งขึ้นแสดงให้เห็นถึงการยอมรับของมันในสถานการณ์โลกแห่งความเป็นจริงที่มีการเคลื่อนไหวเร็ว พื้นหลังที่ซับซ้อน และการยึดติดของวัตถุ (เช่น คนขี่จักรยาน)’
‘นอกจากนี้ ส่วนประกอบการทำพื้นหน้าของเรามีขนาดเล็กและทำงานได้อย่างมีประสิทธิภาพ ซึ่งช่วยให้ SAM2.1-Tiny สามารถทำงานได้ที่ 40 FPS บนวิดีโอ 1080p 200 فریم โดยใช้หน่วยความจำ GPU น้อยกว่า 5GB’
เอกสารใหม่ เรื่องนี้ มีชื่อว่า SAM2Matting: การทำพื้นหน้าภาพและวิดีโอที่ทั่วไป และมาจากผู้เขียนสี่คนจากมหาวิทยาลัยฟูแดนและมหาวิทยาลัยการเงินและเศรษฐศาสตร์แห่งเซี่ยงไฮ้ งานนี้มี คลังเก็บ GitHub ซึ่งในขณะเขียนนี้ได้เผยแพร่จุดตรวจสอบของตัวแปรต่างๆ โค้ดการอนุมาน และการดемоแบบโต้ตอบ โดยมีการสัญญาว่าจะเผยแพร่โค้ดฝึกอบรม
วิธีการ
วิธีการของผู้เขียนแยกการติดตามออกจากการถอดพื้นหน้าโดยละเอียด โดยใช้ตัวติดตามการแบ่งวิดีโอ (VOS) เพื่อสร้างหน้ากากที่มีความสอดคล้องกันในแต่ละเฟรม ในขณะที่การทำพื้นหน้าแบบเฉพาะจะทำให้ขอบเขตมีความแม่นยำ
ภาพรวมของกระบวนการ โดยที่คำสั่งและวิดีโอเข้าไปในตัวติดตามการแบ่งวิดีโอเพื่อสร้างหน้ากากที่มีขนาดใหญ่ ซึ่งจะถูกทำให้ละเอียดโดยตัวตรวจจับ ROI และแปลงเป็น trimap ก่อนที่จะสร้างหน้ากากที่มีรายละเอียดสูงโดยใช้การคาดการณ์แบบหลายขนาด
ตัวตรวจจับ ROI จะระบุพื้นที่ที่มีรายละเอียดหรือสีใส และแปลงสิ่งเหล่านั้นเป็น trimap (หน้ากากสามพื้นที่ที่แบ่งพื้นหน้า พื้นหลัง และพื้นที่ที่ไม่แน่นอน) เพื่อชี้นำการปรับแต่ง หลังจากนั้น ตัวคาดการณ์ Alpha แบบก้าวหน้าจะสร้างหน้ากากสุดท้ายโดยใช้กระบวนการแบบก้าวหน้าหลายขนาด
ระบบการทำพื้นหน้าแบบเดิมๆ มักจะกำหนดพื้นที่ที่ต้องสนใจโดยใช้การดำเนินการแบบเรขาคณิตแบบง่ายๆ หรือโดยการนำหน้ากากมาใช้โดยตรง – วิธีการที่อาจพลาดรายละเอียดหรือรวมพื้นที่ที่ไม่ต้องการการปรับแต่ง
ดอกเบี้ยทบต้น
ในทางกลับกัน ตัวตรวจจับ ROI ที่เสนอใหม่นี้รับพื้นที่นี้เป็นงานจำแนกพิกเซลต่อพิกเซล (คือ การพิจารณาพิกเซลแต่ละพิกเซลในภาพเป็นการตัดสินใจแยกกัน และกำหนดป้ายกำกับตามว่ามันอยู่ในพื้นที่ที่สำคัญต่อการทำพื้นหน้าหรือไม่) ที่รวมหน้ากาก VOS, เฟรมปัจจุบัน และคุณลักษณะภาพหลายขนาด เพื่อแยกพื้นที่ที่สำคัญต่อการทำพื้นหน้าได้อย่างแม่นยำ
ในแนวทางใหม่นี้ หน้ากาก ROI ที่คาดการณ์ไว้จะถูกแปลงเป็น trimap “เทียม” ที่แยกพื้นหน้าและพื้นหลังที่แน่นอนออกจากพื้นที่ที่ไม่แน่นอน โดยใช้หน้ากากตัวติดตามเพื่อกำหนดพื้นที่ที่ทราบ และทำเครื่องหมาย ROI เป็นไม่แน่นอน เพื่อให้กระบวนการถัดไปสามารถมุ่งเน้นไปที่ขอบเขตที่ต้องมีการแก้ไข
การปรับแต่งจะถูกจัดการโดยตัวคาดการณ์ Alpha แบบก้าวหน้า ซึ่งรับกระบวนการทำพื้นหน้าเป็นกระบวนการแบบก้าวหน้า โดยส่งผลลัพธ์ระหว่างกลางจากขนาดที่ใหญ่กว่าไปยังขนาดที่เล็กกว่า โดยที่แต่ละขั้นตอนใช้ภาพ trimap และการประมาณการก่อนหน้าเพื่อปรับปรุงโครงสร้างและกู้คืนรายละเอียดที่ละเอียด
ในขั้นสุดท้าย ผลลัพธ์ที่มีความละเอียดสูงสุดจะถูกขยายขนาดเพื่อสร้างหน้ากากที่สมบูรณ์ ซึ่งช่วยให้สามารถกำหนดรูปร่างที่กว้างได้ตั้งแต่แรก และรายละเอียดที่เล็กกว่า เช่น ผมและสีใส จะถูกแก้ไขในขั้นตอนหลัง
ระหว่างการฝึกอบรม ผู้เขียนได้แช่แข็งตัวติดตาม VOS ในขณะที่ฝึก เฉพาะส่วนประกอบการทำพื้นหน้า บนข้อมูลภาพคุณภาพสูง – ทำให้รายละเอียดที่ละเอียดสามารถถูกปรับปรุงโดยไม่ทำให้ความสอดคล้องของตัวติดตามเสียหาย การดูแลจะถูกนำไปใช้สำหรับแต่ละเฟรม โดยพื้นที่ที่สนใจจะถูกกำหนดจากหน้ากาก alpha ที่แท้จริง และใช้เพื่อชี้นำการเรียนรู้ ในขณะที่ตัวตรวจจับ ROI ถูกฝึกด้วยการขาดทุนที่ออกแบบมาเพื่อส่งเสริมการจำแนกขอบเขตที่แม่นยำ และลดอาการปะที่ไม่เรียบ
สำหรับการประมาณค่า อัลฟา การขาดทุนจะถูกนำไปใช้หลายขนาดเพื่อปรับปรุงรายละเอียดทีละขั้น พร้อมกับข้อจำกัดเพิ่มเติมที่ตั้งใจจะรักษาหน้ากากที่คาดการณ์ไว้ให้สอดคล้องกับหน้ากากเดิม – ช่วยรักษาโครงสร้างและ ป้องกัน พื้นที่ที่ว่างหรือแตกในผลลัพธ์สุดท้าย
ข้อมูลและการทดสอบ
ใช้ข้อมูลชุดภาพทำพื้นหน้าแปดชุดสำหรับการทดลองครั้งแรก: I-HIM50K; P3M-10k; CelebAHairMask-HQ; AIM-500; Distinctions-646; AM-2K; UHRIM; และ RefMatte; และพัฒนาสามรูปแบบของวิธี “Sam2Matting” เป็นตัวติดตาม VOS โดยใช้ SAM2.1-Tiny; SAM2.1-Base+; และ SAM3 ที่มุ่งเน้นไปที่แนวคิด
ส่วนประกอบตัวติดตามถูกแช่แข็ง ในขณะที่ส่วนประกอบการทำพื้นหน้าเพียงอย่างเดียวที่ได้รับการปรับให้เหมาะสม ทั้งรุ่นได้รับการฝึกฝนเป็นเวลา 5 epochs บน GPU NVIDIA A6000 สี่ตัว แต่ละตัวมีการจัดสรร VRAM 48GB ใช้ขนาด batch 32 ภายใต้ AdamW ตัววัดที่ใช้คือ ความแตกต่างสัมบูรณ์เฉลี่ย (MAD); ความผิดพลาดสี่เหลี่ยมเฉลี่ย (MSE); อนุพันธ์ (Grad); การเชื่อมต่อ (Conn); และ dtSSD (สำหรับการทำพื้นหน้าวิดีโอเท่านั้น)
การทดสอบเชิงปริมาณ
ผู้เขียนเริ่มต้นด้วยการทดสอบเชิงปริมาณของระบบใหม่บนการทำพื้นหน้าภาพ โดยใช้มาตรฐาน P3M-500-NP; AM-2K (‘GFM’ ในผลลัพธ์); MAM (‘Matte Anything’ ในผลลัพธ์); E2E-HIM; Lightweight; และ PPM-100 (‘MODNet’ ในผลลัพธ์):
ผลลัพธ์เชิงปริมาณบนมาตรฐานการทำพื้นหน้าภาพที่ P3M-500-NP, AM-2K และ PPM-100 โดยมีค่าลดน้อยกว่าแสดงถึงผลลัพธ์ที่ดีกว่าทั้งมาตรการ และผลลัพธ์ที่ดีที่สุด ที่สองที่สุด และสามที่สุดจะเน้นด้วยสีแดง ส้ม และเหลือง ตามลำดับ
จากผลลัพธ์เหล่านี้ เอกสารระบุว่า:
‘ตามที่แสดง [ด้านบน] ทั้งสามรูปแบบของ SAM2Matting มีประสิทธิภาพเหนือกว่าผลลัพธ์ก่อนหน้าอย่างต่อเนื่องในมาตรการต่างๆ เช่น SAM2.1-Tiny ได้ MAD ต่ำกว่า MAM 11.48 ใน P3M-500-NP’
ผู้เขียนยืนยันว่าผลลัพธ์ทั่วทั้งกระดานแสดงให้เห็นว่าวิธีการนี้บรรลุผลลัพธ์ที่ดีกว่าผ่านการออกแบบแนวคิดหลัก ไม่ใช่ระดับการดูแลข้อมูล
สำหรับการทำพื้นหน้าวิดีโอ SAM2Matting ได้รับการประเมินบน V-HIM60 และ VideoMatte ในการกำหนดค่า “zero-shot” เทียบกับระบบที่ฝึกฝนบน วิดีโอที่มีชื่อ MatAnyone2, MatAnyone, MaGGIe, FTP-VM และ RVM โดยมีการรายงานผลลัพธ์ที่ดีกว่าทั้งสองชุดข้อมูล
ทั้งหมดนี้ สามรูปแบบบันทึกข้อผิดพลาดที่ต่ำกว่าใน MAD, MSE, Grad, Conn และ dtSSD โดยที่ SAM3 บรรลุผลลัพธ์ที่ดีที่สุดโดยรวม ในขณะที่ค่า dtSSD ที่ต่ำที่สุดดูเหมือนจะบ่งบอกถึงความสอดคล้องระหว่างเฟรมต่อเฟรมที่ดีกว่า
ผลลัพธ์เชิงปริมาณบนมาตรฐานการทำพื้นหน้าวิดีโอที่ V-HIM60 และ VideoMatte โดยใช้การกำหนดค่า ‘zero-shot’ โดยมีค่าลดน้อยกว่าแสดงถึงผลลัพธ์ที่ดีกว่าทั้งมาตรการ และผลลัพธ์ที่ดีที่สุด ที่สองที่สุด และสามที่สุดจะเน้นด้วยสีแดง ส้ม และเหลือง ตามลำดับ
ผู้เขียนอ้างว่าผลลัพธ์เหล่านี้สะท้อนถึงการออกแบบที่แยกออกจากกัน โดยที่ตัวติดตาม VOS รักษาโครงสร้างที่สอดคล้องกันในขณะที่ส่วนประกอบการทำพื้นหน้าเน้นไปที่รายละเอียดของขอบเขต ทำให้โมเดลที่ฝึกฝนบนภาพสามารถเอาชนะวิธีการฝึกฝนบน วิดีโอที่มีการดูแลอย่างเต็มที่
การทดสอบเชิงคุณภาพ
สำหรับการทำพื้นหน้ามนุษย์ในการทดสอบเชิงคุณภาพ ผู้เขียนพบว่า Sam2Matting มีประสิทธิภาพเหนือกว่าผลลัพธ์จากวิธีการอื่นๆ
การเปรียบเทียบเชิงคุณภาพบนการทำพื้นหน้ามนุษย์และวิดีโอในโลกแห่งความเป็นจริง โดยที่ SAM2Matting รักษาสายผมและพื้นที่ที่มีสีใสได้ดีกว่า RVM และ MatAnyone โดยให้ขอบเขตที่สะอาดและโครงสร้างที่หายไปน้อยกว่าในพื้นที่ที่ท้าทาย
ตามที่แสดงด้านล่าง ระบบการทำพื้นหน้าวิดีโอที่มีอยู่ เช่น MatAnyone2 และ MaGGIe ที่ได้รับการฝึกฝนบนชุดข้อมูลเฉพาะโดเมนและบ่อยครั้งบนชุดข้อมูลที่มีมนุษย์เป็นศูนย์กลาง มีความยากในการทั่วไปไปยังลำดับในโลกแห่งความเป็นจริง โดยเฉพาะอย่างยิ่งเมื่อจัดการกับวัตถุที่เคลื่อนไหวอย่างรวดเร็ว เช่น รากที่เติบโต ผีเสื้อที่มีสีใส และการหยดของน้ำที่รวดเร็ว
การเปรียบเทียบเชิงคุณภาพบนลำดับในโลกแห่งความเป็นจริง โดยที่ SAM2Matting รักษาโครงสร้างที่ละเอียดและความสอดคล้องระหว่างเฟรมได้ดีกว่า MatAnyone2 และ MaGGIe โดยเฉพาะอย่างยิ่งสำหรับวัตถุที่ไม่ใช่มนุษย์ การเคลื่อนไหวอย่างรวดเร็ว และองค์ประกอบที่มีสีใส เช่น น้ำ แก้ว และปีกของแมลง
ในทางกลับกัน SAM2Matting พิสูจน์แล้วว่าสามารถรักษาการติดตามที่เสถียรและถอดพื้นหน้าได้อย่างน่าเชื่อถือในสถานการณ์ที่ท้าทายเหล่านี้
สุดท้าย ตามที่แสดงในภาพด้านล่าง SAM2Matting จัดการกับวัตถุที่มีวัตถุแนบมา เช่น คนขี่จักรยานหรือคนถือไม้เล่นสกีได้อย่างมีประสิทธิภาพ ในขณะที่ยังบดบังรบกวนพื้นหลังที่อยู่ใกล้ๆ ได้ โดยได้รับประโยชน์จากข้อจำกัดความสอดคล้องของหน้ากากที่กล่าวถึงก่อนหน้านี้
การเปรียบเทียบเชิงคุณภาพบนลำดับที่มีวัตถุแนบมาและรบกวนพื้นหลัง โดยที่ SAM2Matting รักษาโครงสร้าง เช่น จักรยานและไม้เล่นสกี ได้ดีกว่า MatAnyone2 ในขณะที่ยังบดบังรบกวนพื้นหลังและรักษาเส้นรอบรูปที่สะอาดระหว่างเฟรม
สรุป
ความสำเร็จที่อธิบายไว้ในเอกสารใหม่นี้แสดงให้เห็นถึงระดับที่การทำพื้นหน้า ซึ่งเป็นหนึ่งในงานเก่าแก่ที่สุดในด้านการมองเห็นของคอมพิวเตอร์ ยังคงไม่ได้รับการแก้ไขและต้านทานการเข้าใกล้ที่ทั่วไป ในทำนองเดียวกันกับโมเดลการมองเห็นหลายๆ รูปแบบ ปัญหาก็คือว่าแอลกอริทึมการทำพื้นหน้าขึ้นอยู่กับความรู้ในโดเมนมากกว่าการปรับตัวให้เข้ากับวัตถุและสถานการณ์ที่ไม่เคยเห็นมาก่อน
ในขณะที่งานใหม่นี้เป็นก้าวหนึ่งจากความพึ่งพานั้น ยังคงมีระยะทางที่ยาวไกลในการเดินทาง โดยพิจารณาจากขอบเขตที่งานนี้ถูกฝังอยู่ในชีวิตประจำวันของเรา ผ่านพอร์ทัลวิดีโอแชท
เผยแพร่ครั้งแรกวันจันทร์ 13 กรกฎาคม 2569












