มุมมองของ Anderson

การ 修復 และแก้ไข ภาพมนุษย์ด้วย AI

mm
เพิ่ม Unite.AI ลงในแหล่งข้อมูลที่คุณต้องการบน Google
Montage of examples from supplementary material for the paper 'CompleteMe: Reference-based Human Image Completion' (https://liagm.github.io/CompleteMe/pdf/supp.pdf)

ความร่วมมือใหม่ระหว่าง University of California, Merced และ Adobe (ADBE ) นำเสนอความก้าวหน้าของเทคโนโลยี การเติมภาพบุคคล ซึ่งเป็นงานที่พยายามสร้างส่วนของร่างกายหรือเสื้อผ้าที่ถูกบังหรือหายไปขึ้นใหม่ เพื่อใช้กับการลองเสื้อผ้าเสมือนจริง แอนิเมชัน และการแก้ไขภาพถ่าย

Besides repairing damaged images or changing them at a user's whim, human image completion systems such as CompleteMe can impose novel clothing (via an adjunct reference image, as in the middle column in these two examples) into existing images. These examples are from the extensive supplementary PDF for the new paper. Source: https://liagm.github.io/CompleteMe/pdf/supp.pdf
นอกจากซ่อมแซมภาพที่เสียหายแล้ว CompleteMe ยังนำเสื้อผ้าจากภาพอ้างอิงมาวางในภาพเดิมได้ ตัวอย่างจากเอกสารเสริมของงานวิจัย

แนวทางใหม่นี้มีชื่อว่า CompleteMe: Reference-based Human Image Completion โดยใช้ภาพอ้างอิงเพิ่มเติมเพื่อบอกระบบว่าเนื้อหาใดควรแทนที่ส่วนที่ถูกบังหรือขาดหายของบุคคลในภาพ จึงเหมาะอย่างยิ่งกับระบบลองเสื้อผ้าเสมือนจริง

The CompleteMe system can conform reference content to the obscured or occluded part of a human image.
CompleteMe ปรับเนื้อหาจากภาพอ้างอิงให้เข้ากับส่วนของร่างกายที่ถูกบังในภาพต้นฉบับ

ระบบใช้สถาปัตยกรรม U-Net สองชุดและบล็อก Region-Focused Attention (RFA) เพื่อจัดสรรการประมวลผลไปยังบริเวณที่เกี่ยวข้องกับการบูรณะภาพโดยตรง นักวิจัยยังเสนอเกณฑ์มาตรฐานใหม่ที่ท้าทายสำหรับประเมินงานเติมภาพจากภาพอ้างอิง ซึ่งก่อนหน้านี้ยังไม่มีกรอบมาตรฐานร่วมกัน

ในการทดลองและการศึกษาผู้ใช้ที่มีขนาดเหมาะสม วิธีใหม่นำหน้าในตัวชี้วัดส่วนใหญ่และมีผลรวมดีที่สุด วิธีคู่แข่งบางระบบสับสนอย่างมากเมื่อจำเป็นต้องตีความเนื้อหาจากภาพอ้างอิง

From the supplementary material: the AnyDoor method has particular difficulty deciding how to interpret a reference image.
ตัวอย่างจากเอกสารเสริมแสดงว่า AnyDoor ตีความภาพอ้างอิงได้ยากในบางกรณี

“การทดลองอย่างกว้างขวางบนเกณฑ์มาตรฐานของเราแสดงว่า CompleteMe ทำได้ดีกว่าวิธีล้ำสมัยทั้งแบบใช้และไม่ใช้ภาพอ้างอิง ในด้านตัวชี้วัดเชิงปริมาณ ผลเชิงคุณภาพ และการศึกษาผู้ใช้ โดยเฉพาะฉากที่ยากซึ่งมีท่าทางซับซ้อน ลวดลายเสื้อผ้าละเอียด หรือเครื่องประดับโดดเด่น โมเดลให้ความสมจริงและความสอดคล้องเชิงความหมายที่เหนือกว่าอย่างสม่ำเสมอ”

อย่างไรก็ตาม พื้นที่ GitHub ของโครงการไม่มีโค้ดและไม่ได้สัญญาว่าจะเผยแพร่โค้ด ขณะที่หน้าโครงการขนาดเล็กทำให้ระบบนี้ดูเป็นสถาปัตยกรรมกรรมสิทธิ์

Further example of the new system's subjective performance against prior methods. More details later in the article.
การเปรียบเทียบเชิงคุณภาพเพิ่มเติมกับวิธีรุ่นก่อน

วิธีการ

กรอบ CompleteMe มี Reference U-Net สำหรับผสานข้อมูลอ้างอิงเข้าสู่กระบวนการ และ Cohesive U-Net สำหรับดำเนินขั้นตอนต่าง ๆ จนได้ผลลัพธ์สุดท้าย

The conceptual schema for CompleteMe. Source: https://arxiv.org/pdf/2504.20042
แผนภาพแนวคิดของสถาปัตยกรรม CompleteMe

ระบบเข้ารหัสภาพอินพุตที่มีมาสก์เป็นตัวแทนในปริภูมิแฝง ขณะเดียวกัน Reference U-Net ประมวลผลภาพอ้างอิงหลายภาพ ซึ่งแต่ละภาพแสดงบริเวณร่างกายต่างกัน เพื่อดึงคุณลักษณะเชิงพื้นที่อย่างละเอียด คุณลักษณะเหล่านี้ผ่านบล็อก RFA ใน Cohesive U-Net และถูกมาสก์ตามบริเวณที่สอดคล้องกัน ทำให้โมเดลสนใจเฉพาะส่วนที่เกี่ยวข้องในภาพอ้างอิง

จากนั้นระบบรวมคุณลักษณะที่ผ่านมาสก์กับคุณลักษณะความหมายระดับโลกจาก CLIP ผ่านกลไก cross-attention ที่แยกออกจากกัน จึงสร้างส่วนที่หายไปได้ทั้งรายละเอียดสูงและความสอดคล้องเชิงความหมาย เพื่อเพิ่มความสมจริงและความทนทาน กระบวนการสร้างมาสก์อินพุตจะสุ่มใช้ทั้งช่องตารางและมาสก์รูปร่างร่างกายมนุษย์ด้วยความน่าจะเป็นเท่ากัน ทำให้บริเวณที่ต้องเติมมีความซับซ้อนมากขึ้น

การใช้ภาพอ้างอิง

วิธีเติมภาพจากภาพอ้างอิงก่อนหน้านี้มักพึ่งตัวเข้ารหัสระดับความหมาย เช่น CLIP และ DINOv2 ซึ่งดึงคุณลักษณะโดยรวมจากภาพอ้างอิง แต่สูญเสียรายละเอียดเชิงพื้นที่ที่จำเป็นต่อการรักษาอัตลักษณ์อย่างแม่นยำ

From the release paper for the older DINOV2 approach, which is included in comparison tests in the new study: The colored overlays show the first three principal components from Principal Component Analysis (PCA), applied to image patches within each column, highlighting how DINOv2 groups similar object parts together across varied images. Despite differences in pose, style, or rendering, corresponding regions (like wings, limbs, or wheels) are consistently matched, illustrating the model's ability to learn part-based structure without supervision.. Source: https://arxiv.org/pdf/2304.07193
ตัวอย่างจากงาน DINOv2: สีแสดงองค์ประกอบหลักของแพตช์ภาพและการจับคู่ส่วนวัตถุที่คล้ายกัน

CompleteMe แก้ปัญหานี้ด้วย Reference U-Net เฉพาะทางที่เริ่มต้นจาก Stable Diffusion 1.5 แต่ไม่ใช้ขั้นตอนเพิ่มสัญญาณรบกวนของ diffusion ภาพอ้างอิงแต่ละภาพที่ครอบคลุมส่วนร่างกายต่างกันจะถูกเข้ารหัสเป็นคุณลักษณะแฝงละเอียดผ่าน U-Net นี้ ส่วนคุณลักษณะความหมายระดับโลกถูกดึงแยกด้วย CLIP และแคชไว้เพื่อใช้งานอย่างมีประสิทธิภาพระหว่างการผสานด้วย attention ระบบจึงรองรับภาพอ้างอิงหลายภาพอย่างยืดหยุ่นพร้อมรักษารายละเอียดรูปลักษณ์

การประสานองค์ประกอบ

Cohesive U-Net ซึ่งดัดแปลงจากรุ่น inpainting ของ Stable Diffusion 1.5 จัดการขั้นตอนสุดท้าย โดยรับภาพต้นฉบับที่มีมาสก์ในรูปแฝง คุณลักษณะเชิงพื้นที่จากภาพอ้างอิง และคุณลักษณะความหมายจากตัวเข้ารหัส CLIP บล็อก RFA รวมอินพุตเหล่านี้และนำความสนใจไปยังบริเวณสำคัญที่สุด ก่อนเข้า attention คุณลักษณะอ้างอิงจะถูกมาสก์เพื่อตัดส่วนที่ไม่เกี่ยวข้อง แล้วเชื่อมกับตัวแทนแฝงของภาพต้นฉบับ

CompleteMe ยังใช้กลไก cross-attention แบบแยกที่ดัดแปลงจากกรอบ IP-Adapter ทำให้โมเดลประมวลผลคุณลักษณะภาพที่มีรายละเอียดเชิงพื้นที่และบริบทความหมายกว้างผ่านสาย attention แยกกัน ก่อนรวมเป็นภาพบูรณะที่สอดคล้องกัน ผู้เขียนระบุว่าวิธีนี้รักษาทั้งอัตลักษณ์และรายละเอียดปลีกย่อยได้

IP-Adapter, part of which is incorporated into CompleteMe, is one of the most successful and often-leveraged projects from the last three tumultuous years of development in latent diffusion model architectures. Source: https://ip-adapter.github.io/
IP-Adapter ซึ่งเป็นส่วนหนึ่งที่นำมาปรับใช้ใน CompleteMe

เกณฑ์มาตรฐาน

เนื่องจากยังไม่มีชุดข้อมูลที่เหมาะกับการเติมภาพบุคคลจากภาพอ้างอิง นักวิจัยจึงสร้างเกณฑ์มาตรฐานของตนเอง โดยคัดคู่ภาพจากชุด WPose ซึ่งสร้างขึ้นสำหรับโครงการ UniHuman ของ Adobe Research ในปี 2023

Examples of poses from the Adobe Research 2023 UniHuman project. Source: https://github.com/adobe-research/UniHuman?tab=readme-ov-file#data-prep
ตัวอย่างท่าทางจากโครงการ UniHuman ของ Adobe Research ปี 2023

นักวิจัยวาดมาสก์ต้นฉบับด้วยตนเองเพื่อระบุบริเวณ inpainting และได้กลุ่มข้อมูลสามส่วน 417 กลุ่ม แต่ละกลุ่มประกอบด้วยภาพต้นฉบับ มาสก์ และภาพอ้างอิง

Two examples of groups derived initially from the reference WPose dataset, and curated extensively by the researchers of the new paper.
สองตัวอย่างของกลุ่มภาพที่คัดสรรจากชุดข้อมูล WPose

ผู้เขียนใช้โมเดลภาษาขนาดใหญ่ LLaVA สร้างพรอมต์ข้อความอธิบายภาพต้นฉบับ ตัวชี้วัดมีความครอบคลุมกว่างานทั่วไป ได้แก่ Peak Signal-to-Noise Ratio (PSNR), Structural Similarity Index (SSIM), Learned Perceptual Image Patch Similarity (LPIPS) สำหรับบริเวณที่มาสก์ ตลอดจนคะแนนความคล้ายจาก DINO, DreamSim และ CLIP

ข้อมูลและการทดสอบ

ผู้เขียนทดสอบด้วยทั้ง Stable Diffusion V1.5 รุ่นปกติและรุ่น inpainting ตัวเข้ารหัสภาพใช้โมเดล CLIP Vision ร่วมกับชั้น projection ซึ่งเป็นโครงข่ายขนาดเล็กสำหรับปรับเอาต์พุต CLIP ให้ตรงกับมิติคุณลักษณะภายในของโมเดล

การฝึกดำเนินไป 30,000 รอบบน GPU NVIDIA A100 จำนวนแปดตัว ใช้ Mean Squared Error (MSE) เป็นฟังก์ชันสูญเสีย ขนาดแบตช์ 64 และอัตราการเรียนรู้ 2×10-5 ส่วนประกอบบางอย่างถูกสุ่มตัดออกระหว่างฝึกเพื่อป้องกันการจำข้อมูลมากเกินไป

ชุดข้อมูลดัดแปลงจาก Parts to Whole ซึ่งมีพื้นฐานจาก DeepFashion-MultiModal

Examples from the Parts to Whole dataset, used in the development of the curated data for CompleteMe. Source: https://huanngzh.github.io/Parts2Whole/
ตัวอย่างจากชุดข้อมูล Parts to Whole ที่ใช้พัฒนาข้อมูลสำหรับ CompleteMe

“เราได้สร้างคู่ข้อมูลฝึกใหม่โดยใช้ภาพที่มีส่วนถูกบังร่วมกับภาพอ้างอิงหลายภาพ ซึ่งจับลักษณะต่าง ๆ ของรูปลักษณ์มนุษย์และมีป้ายข้อความสั้น แต่ละตัวอย่างครอบคลุมรูปลักษณ์หกประเภท ได้แก่ เสื้อผ้าท่อนบน เสื้อผ้าท่อนล่าง เสื้อผ้าทั้งตัว ผมหรือเครื่องสวมศีรษะ ใบหน้า และรองเท้า สำหรับกลยุทธ์มาสก์ ครึ่งหนึ่งใช้กริดสุ่ม 1–30 ครั้ง อีกครึ่งใช้มาสก์รูปร่างร่างกายเพื่อเพิ่มความซับซ้อน หลังจบกระบวนการ เราได้คู่ภาพ 40,000 คู่สำหรับการฝึก”

วิธีคู่แข่งที่ไม่ใช้ภาพอ้างอิง ได้แก่ LOHC และ BrushNet ส่วนวิธีที่ใช้ภาพอ้างอิง ได้แก่ Paint-by-Example, AnyDoor, LeftRefill และ MimicBrush

Results for the initial quantitative comparison.
ผลการเปรียบเทียบเชิงปริมาณเบื้องต้น

CompleteMe ได้คะแนนสูงสุดในตัวชี้วัดเชิงการรับรู้ส่วนใหญ่ ได้แก่ CLIP-I, DINO, DreamSim และ LPIPS ซึ่งวัดความสอดคล้องเชิงความหมายและความแม่นยำของรูปลักษณ์ระหว่างผลลัพธ์กับภาพอ้างอิง แต่ไม่ได้ชนะทุกตัวชี้วัด BrushNet ได้ CLIP-T สูงสุด, LeftRefill นำด้าน SSIM และ PSNR และ MimicBrush เหนือกว่าเล็กน้อยใน CLIP-I ความแตกต่างบางกรณีมีขนาดไม่มาก ผู้เขียนจึงอธิบายผลลัพธ์ว่าเป็นความแข็งแกร่งที่สมดุลทั้งด้านโครงสร้างและการรับรู้

ตัวอย่างเชิงคุณภาพมีจำนวนมากเกินกว่าจะนำเสนอทั้งหมด ผู้อ่านควรดูทั้งบทความต้นฉบับและเอกสารเสริมซึ่งมีกรณีเพิ่มเติมจำนวนมาก

Initial qualitative results presented in the main paper. Please refer to the source paper for better resolution.
ผลเชิงคุณภาพชุดแรกในบทความวิจัยหลัก

ผู้เขียนอธิบายว่า วิธีที่ไม่ใช้ภาพอ้างอิงสามารถสร้างเนื้อหาที่ดูสมเหตุผลในบริเวณมาสก์จากความรู้เดิมของโมเดลหรือพรอมต์ข้อความ แต่ไม่สามารถสร้างรายละเอียดเฉพาะ เช่น รอยสักหรือลวดลายเสื้อผ้าที่ไม่เหมือนใคร เพราะไม่มีภาพอ้างอิงนำทาง

การเปรียบเทียบถัดไปมุ่งที่ Paint-by-Example, AnyDoor, LeftRefill และ MimicBrush โดยให้ภาพอ้างอิงเพียงหนึ่งภาพกับพรอมต์ข้อความ

Qualitative comparison with reference-based methods. CompleteMe produces more realistic completions and better preserves specific details from the reference image. The red boxes highlight areas of particular interest.
การเปรียบเทียบกับวิธีที่ใช้ภาพอ้างอิง โดย CompleteMe รักษารายละเอียดเฉพาะได้ดีกว่า

“เมื่อได้รับภาพบุคคลที่มีมาสก์และภาพอ้างอิง วิธีอื่นสร้างเนื้อหาที่น่าเชื่อถือได้ แต่มักรักษาข้อมูลบริบทจากภาพอ้างอิงไม่แม่นยำ บางกรณีสร้างเนื้อหาที่ไม่เกี่ยวข้องหรือจับคู่ส่วนจากภาพอ้างอิงผิดตำแหน่ง ตรงกันข้าม CompleteMe เติมบริเวณมาสก์โดยรักษาข้อมูลเดิมอย่างแม่นยำและจับคู่ส่วนร่างกายที่สอดคล้องกันได้ถูกต้อง”

เพื่อประเมินความสอดคล้องกับการรับรู้ของมนุษย์ นักวิจัยจัดการศึกษาผู้ใช้ที่มีผู้ประเมิน 15 คนและคู่ตัวอย่าง 2,895 คู่ แต่ละคู่เปรียบเทียบผลของ CompleteMe กับหนึ่งในสี่ระบบอ้างอิง ผู้ประเมินพิจารณาคุณภาพภาพของบริเวณที่เติมและระดับการรักษาอัตลักษณ์จากภาพอ้างอิง ผลรวมด้านคุณภาพและอัตลักษณ์ทำให้ CompleteMe ได้ชัยชนะชัดเจนกว่า

Results of the user study.
ผลการศึกษาผู้ใช้

บทสรุป

จำนวนผลเชิงคุณภาพที่มากมหาศาลอาจทำให้จุดแข็งของงานนี้มองเห็นได้ยาก แต่การตรวจสอบอย่างใกล้ชิดแสดงว่า CompleteMe เป็นระบบที่มีประสิทธิภาพมากในสาขาการแก้ไขภาพด้วยโครงข่ายประสาทซึ่งแม้เฉพาะทางแต่มีการแข่งขันสูง ต้องซูมดู PDF ต้นฉบับจึงจะเห็นชัดว่าระบบปรับวัสดุอ้างอิงให้เข้ากับบริเวณที่ถูกบังได้ดีกว่าวิธีก่อนหน้าเกือบทุกกรณี

We strongly recommend the reader to carefully examine the initially confusing, if not overwhelming avalanche of results presented in the supplementary material.
ตัวอย่างจำนวนมากในเอกสารเสริมควรได้รับการตรวจสอบอย่างละเอียดในความละเอียดต้นฉบับ

* น่าสังเกตว่า Stable Diffusion V1.5 ซึ่งเก่ามากแล้วยังคงเป็นที่นิยมในหมู่นักวิจัย ส่วนหนึ่งเพราะเหมาะกับการทดสอบเทียบเคียงกับงานเดิม อีกส่วนเพราะถูกจำกัดน้อยและอาจฝึกได้ง่ายกว่ารุ่น Stable Diffusion อื่น อีกทั้งไม่มีข้อจำกัดแบบเดียวกับ Flux รุ่นโอเพนซอร์ส

† งานวิจัยไม่ได้ระบุ VRAM ของการ์ด แต่คาดว่าเป็น 40GB หรือ 80GB ต่อการ์ด

เผยแพร่ครั้งแรกวันอังคารที่ 29 เมษายน 2025

แหล่งข้อมูลและลิงก์ที่เกี่ยวข้อง

ผู้เขียนด้านการเรียนรู้ของเครื่อง, ผู้เชี่ยวชาญด้านการสังเคราะห์ภาพมนุษย์. อดีตหัวหน้าฝ่ายเนื้อหาการวิจัยที่ Metaphysic.ai, จนกระทั่งการรวมเข้าเป็น Brahma.ai ของ DNEG.
เว็บไซต์: martinanderson.ai
ติดต่อ: martin@martinanderson.ai