มุมมองของ Anderson
การลบวัตถุและบุคคลออกจากวิดีโอโดยใช้ AI

หาก AI มีส่วนจัดการ เด็กในภาพก็ไม่จำเป็นต้องอยู่ในฉากต่อไป
การลบบุคคลและวัตถุออกจากภาพและวิดีโอเป็นหัวข้อวิจัยสำคัญในงาน AI ที่เน้น VFX และมีทั้งชุดข้อมูลกับเฟรมเวิร์กเฉพาะเพิ่มขึ้นเรื่อยๆ ผลงานล่าสุดจาก Institute of Big Data แห่ง Fudan University ในจีนคือ EffectErase ระบบลบวัตถุจากวิดีโอที่ “รับรู้ผลกระทบ” ซึ่งผู้เขียนระบุว่าทำผลงานเหนือวิธีชั้นนำเดิมอย่างชัดเจน
วิดีโอด้านบนรวบรวมตัวอย่างจากเว็บไซต์โครงการ เว็บไซต์ต้นทางมีวิดีโอความละเอียดสูงที่เล่นอัตโนมัติจำนวนมากและอาจกระทบเสถียรภาพของเบราว์เซอร์ จึงสามารถดูวิดีโอ YouTube ที่ฝังไว้ท้ายบทความเป็นข้อมูลอ้างอิงที่สะดวกและครบถ้วนกว่า
งานใหม่นี้สร้างและคัดสรรฉากจริงกับฉากสังเคราะห์เกือบ 350 ฉาก โดยใช้ทั้งแหล่งข้อมูลสาธารณะ ภาพที่บันทึกด้วยอุปกรณ์เฉพาะ และเนื้อหาที่นำมาปรับใช้ในเวิร์กโฟลว์ซึ่งสร้างบน Blender 3D แบบโอเพนซอร์ส
ชุดข้อมูล Video Object Removal (VOR) แบบผสมเป็นฐานของ EffectErase ซึ่งสร้างบนระบบสร้างวิดีโอ Wan2.1 งานนี้ยังกำหนดเกณฑ์มาตรฐานใหม่สองชุด ได้แก่ VOR-Eval สำหรับตัวอย่างที่มีภาพจริงอ้างอิง และ VOR-Wild สำหรับตัวอย่างจริงที่ไม่มีภาพอ้างอิงดังกล่าว

การเปรียบเทียบขนาดชุดข้อมูล VOR ใหม่กับชุดข้อมูลก่อนหน้าที่ใกล้เคียงกัน แหล่งที่มา
นักวิจัยกล่าวว่าวิธีนี้ให้ผลลัพธ์ระดับแนวหน้าทั้งตามตัวชี้วัดเชิงปริมาณและการประเมินเชิงคุณภาพโดยมนุษย์ วิธีเดิมมักลบตัววัตถุได้แต่ยังเหลือเงา ภาพสะท้อน หรือการเปลี่ยนแสง ชุดข้อมูลใหม่จึงถูกสร้างขึ้นเพื่อแก้ข้อบกพร่องนี้โดยตรง

ตัวอย่างที่วิธีเดิมสนใจเฉพาะวัตถุเป้าหมายและไม่ลบร่องรอยรอง เช่น ภาพสะท้อนและเงา
บทความวิจัยชื่อ EffectErase: Joint Video Object Removal and Insertion for High-Quality Effect Erasing จัดทำโดยนักวิจัยสี่คนจาก College of Computer Science and Artificial Intelligence ของ Fudan University
วิธีการ
ชุดข้อมูล VOR แบบผสมถูกออกแบบให้ครอบคลุมสถานการณ์หลากหลายและผลทุกประเภทที่ต้องพิจารณาเมื่อลบบุคคลหรือวัตถุออกจากวิดีโอ

เฟรมคู่จากชุดข้อมูล VOR แสดงว่าการลบต้องครอบคลุมมากกว่าวัตถุที่มองเห็น ตัวอย่างรวมการบดบัง เงา การเปลี่ยนแสง ภาพสะท้อน และการเปลี่ยนรูปทางกายภาพ โดยแสดงภาพขณะมีวัตถุเทียบกับพื้นหลังสะอาดหลังลบ
ผู้เขียนกำหนด “การรบกวน” หลักห้าประเภท ได้แก่ การบดบัง ซึ่งรวมกระจกและควัน เงา แสงที่วัตถุสร้างหรือเปลี่ยนเส้นทาง ภาพสะท้อน และการเปลี่ยนรูป เช่น รอยยุบของเบาะที่ไม่ควรเหลืออยู่หลังลบบุคคลออก

กระบวนการสร้างชุดข้อมูล VOR ผสมฉากสังเคราะห์จาก Blender กับภาพจริง ฉากสังเคราะห์สร้างจากสภาพแวดล้อม วัตถุ และเส้นทางกล้องที่คัดเลือก ส่วนภาพจริงบันทึกในสภาพแวดล้อมหลากหลายและเพิ่มการเคลื่อนไหวแบบ Ken Burns จากนั้นใช้ SAM2 กับการปรับแก้ด้วยมือเพื่อสร้างวิดีโอฉากหน้า พื้นหลัง และมาสก์ที่ตรงกัน
ข้อมูลจริงบันทึกด้วยกล้องคงที่เป็นคู่ฉาก “มีวัตถุ” และ “ไม่มีวัตถุ” ครอบคลุมสภาพแวดล้อม ช่วงเวลา และสภาพอากาศหลายแบบ ส่วนข้อมูลสังเคราะห์เรนเดอร์จากหลายมุมมอง สร้างฉากหลายวัตถุ และใช้การเคลื่อนกล้องที่ซับซ้อนเหมือนภาพจริง นักวิจัยมองว่ากระบวนการนี้ละเอียดและใช้แรงงานมากกว่าชุดข้อมูล ROSE ที่คล้ายกัน
เพื่อเพิ่มความหลากหลายของการเคลื่อนไหว มีการใช้ เอฟเฟกต์ Ken Burns กับคู่ภาพที่ถ่ายจริง เพิ่มการแพน ซูม และการสั่นเล็กน้อยแบบถือกล้องภายใต้กฎ 14 ชุด โดยสุ่มรูปแบบการเคลื่อนไหวห้าแบบต่อหนึ่งคู่และรักษาพื้นที่ครอปให้อยู่ในเฟรมเดิม
ทีมงานขยายขนาดและความหลากหลายด้วยการรวมวัตถุสังเคราะห์กับการตั้งค่ากล้องหลายแบบ สร้างมาสก์จากจุดกำกับด้วยมือในคีย์เฟรม กระจายการแบ่งส่วนด้วย Segment Anything 2 (SAM2) แล้วทำความสะอาดและปรับแก้เพื่อให้ได้ชุดสามส่วนที่ตรวจสอบแล้ว ได้แก่ วิดีโอฉากหน้า วิดีโอพื้นหลัง และมาสก์
คอลเลกชันสุดท้ายมีวิดีโอรวม 145 ชั่วโมงจากวิดีโอคู่จริงและสังเคราะห์ 60,000 คู่ ครอบคลุมวัตถุ 366 คลาสใน 443 ฉาก
สถาปัตยกรรม EffectErase
เครือข่ายรับข้อมูลผ่าน Variational Auto-Encoder (VAE) และใช้ Wan2.1 ลดสัญญาณรบกวนในพื้นที่แฝง บนแกนหลักนี้มี Removal-Insertion Joint Learning ซึ่งฝึกงานลบกับงานแทรกร่วมกันในบริเวณเดียวกัน, Task-Aware Region Guidance (TARG) ซึ่งใช้โทเค็นวัตถุและงานกับ cross-attention และ Effect Consistency Loss ที่จัดแนวบริเวณผลกระทบของทั้งสองงาน

แผนผัง EffectErase ระหว่างการฝึก วิดีโอคู่ถูกเข้ารหัสในพื้นที่แฝงร่วม ผสมกับสัญญาณรบกวน และประมวลผลด้วย diffusion transformer ที่มี cross-attention รับรู้งาน ขณะที่ความสูญเสียด้านความสอดคล้องบังคับบริเวณลบและแทรกให้สนใจพื้นที่เดียวกัน
กระบวนการลบและแทรกใช้ diffusion backbone ร่วมกัน จึงเรียนรู้บริเวณที่ได้รับผลและเบาะแสโครงสร้างเดียวกัน วิดีโอที่มีวัตถุ วิดีโอพื้นหลังล้วน และมาสก์ถูกเข้ารหัสในพื้นที่แฝงก่อนเพิ่มสัญญาณรบกวน ตัวแปลงขนาดเล็กผสานคุณลักษณะที่มีสัญญาณรบกวนเข้ากับเงื่อนไขการลบหรือแทรก ทำให้สองงานแบ่งปันสัญญาณกำกับแต่ยังควบคุมแยกกันได้
TARG สร้างสัญญาณเฉพาะงานด้วยการรวมโทเค็นภาษากับคุณลักษณะภาพของวัตถุฉากหน้าที่สกัดด้วย CLIP แทนโทเค็นวัตถุทั่วไปด้วย embedding จากภาพจริง แล้วป้อนผ่าน cross-attention เพื่อให้โมเดลติดตามวัตถุและผลของมันในพื้นที่กับเวลา พร้อมสลับระหว่างงานลบและแทรกได้
Effect Consistency Loss บังคับให้สองกระบวนการมุ่งไปยังบริเวณเปลี่ยนแปลงเดียวกัน แผนที่ attention จากแต่ละสาขาถูกรวมเป็นแผนที่บริเวณแบบนุ่มและจัดแนวกับแผนที่ความแตกต่างระหว่างวิดีโอวัตถุกับพื้นหลัง ช่วยรักษาการเปลี่ยนแปลงละเอียดอย่างแสงและเงา และทำให้งานแทรกช่วยกำกับงานลบ
ข้อมูลและการทดสอบ
นักวิจัยเปรียบเทียบกับวิธี inpainting ภาพ วิดีโอ และการลบวัตถุ ได้แก่ OmniPaint, ObjectClear, VACE, DiffuEraser, ProPainter, ROSE และ MiniMax-Remover
Wan2.1 ถูกปรับด้วย LoRA บนชุดข้อมูล VOR ที่ความละเอียด 832×480 พิกเซล โดยสุ่ม 81 เฟรมต่อเนื่อง ซึ่งเป็นขีดจำกัดใช้งานจริงของ Wan ก่อนเกิดข้อผิดพลาด ฝึก 129,000 รอบด้วยขนาดแบตช์ 8 บน GPU H100 แปดตัวที่มี VRAM ตัวละ 80GB และใช้ LoRA rank 256
ชุดทดสอบภายนอกมีเพียง ROSE-Benchmark แบบสังเคราะห์ อีกสองชุดคือ VOR-Eval ซึ่งเป็นส่วนทดสอบของ VOR และ VOR-Wild ที่ประกอบด้วยวิดีโอจริง 195 รายการจากอินเทอร์เน็ตซึ่งมีวัตถุเคลื่อนไหว
ตัวชี้วัดคือ PSNR, SSIM, LPIPS และ FVD นอกจากนี้มีการศึกษาผู้ใช้กับวิดีโอที่สร้างจาก VOR-Wild 195 รายการ โดยเฉลี่ยคะแนนจากอาสาสมัคร 20 คน ทีมงานยังสร้าง QScore ซึ่งใช้โมเดลมัลติโมดัล Qwen-VL ประเมินว่าผลลัพธ์ยังเหลือร่องรอยวัตถุหรือไม่ได้ลบผลต่อสภาพแวดล้อม เช่น เงาและแสงหรือไม่

การเปรียบเทียบเชิงปริมาณบนเกณฑ์มาตรฐาน ROSE และ VOR โดยทำตัวหนาผลลัพธ์ดีที่สุดและขีดเส้นใต้ผลลัพธ์อันดับสอง
ผู้เขียนอธิบายว่าวิธี inpainting ภาพทำงานทีละเฟรมด้วยโมเดล 2D จึงรักษาความต่อเนื่องตามเวลาไม่ได้ ส่วนวิธี inpainting วิดีโอรุ่นใหม่ไม่ได้สร้างแบบจำลองผลข้างเคียงของวัตถุอย่างชัดเจนจึงลบได้ไม่เป็นธรรมชาติ วิธีลบวัตถุเดิมก็ขาดการเชื่อมโยงเชิงพื้นที่และเวลาระหว่างวัตถุกับผลของมัน จึงมักทิ้งสิ่งประดิษฐ์หรือร่องรอยไว้
EffectErase ทำผลงานระดับแนวหน้าในทุกชุดข้อมูลและตัวชี้วัด ได้คะแนน FVD ดีที่สุดซึ่งแสดงถึงความลื่นไหลและความสอดคล้องของวิดีโอ ทั้งยังได้ QScore และคะแนนจากผู้ใช้สูงที่สุด

การเปรียบเทียบเชิงคุณภาพบน VOR-Eval ในกรณีการบดบัง เงา แสง ภาพสะท้อน และการเปลี่ยนรูป วิธี inpainting ลบผลนอกมาสก์ได้ยาก ส่วนโมเดลลบวัตถุมักทิ้งร่องรอยที่เห็นได้ EffectErase ลบทั้งวัตถุเป้าหมายและผลที่เกี่ยวข้องได้สะอาดกว่า












