มุมมองของ Anderson
การ 修復 และแก้ไข ภาพมนุษย์ด้วย AI

ความร่วมมือใหม่ระหว่าง University of California, Merced และ Adobe (ADBE ) นำเสนอความก้าวหน้าของเทคโนโลยี การเติมภาพบุคคล ซึ่งเป็นงานที่พยายามสร้างส่วนของร่างกายหรือเสื้อผ้าที่ถูกบังหรือหายไปขึ้นใหม่ เพื่อใช้กับการลองเสื้อผ้าเสมือนจริง แอนิเมชัน และการแก้ไขภาพถ่าย

แนวทางใหม่นี้มีชื่อว่า CompleteMe: Reference-based Human Image Completion โดยใช้ภาพอ้างอิงเพิ่มเติมเพื่อบอกระบบว่าเนื้อหาใดควรแทนที่ส่วนที่ถูกบังหรือขาดหายของบุคคลในภาพ จึงเหมาะอย่างยิ่งกับระบบลองเสื้อผ้าเสมือนจริง

ระบบใช้สถาปัตยกรรม U-Net สองชุดและบล็อก Region-Focused Attention (RFA) เพื่อจัดสรรการประมวลผลไปยังบริเวณที่เกี่ยวข้องกับการบูรณะภาพโดยตรง นักวิจัยยังเสนอเกณฑ์มาตรฐานใหม่ที่ท้าทายสำหรับประเมินงานเติมภาพจากภาพอ้างอิง ซึ่งก่อนหน้านี้ยังไม่มีกรอบมาตรฐานร่วมกัน
ในการทดลองและการศึกษาผู้ใช้ที่มีขนาดเหมาะสม วิธีใหม่นำหน้าในตัวชี้วัดส่วนใหญ่และมีผลรวมดีที่สุด วิธีคู่แข่งบางระบบสับสนอย่างมากเมื่อจำเป็นต้องตีความเนื้อหาจากภาพอ้างอิง

“การทดลองอย่างกว้างขวางบนเกณฑ์มาตรฐานของเราแสดงว่า CompleteMe ทำได้ดีกว่าวิธีล้ำสมัยทั้งแบบใช้และไม่ใช้ภาพอ้างอิง ในด้านตัวชี้วัดเชิงปริมาณ ผลเชิงคุณภาพ และการศึกษาผู้ใช้ โดยเฉพาะฉากที่ยากซึ่งมีท่าทางซับซ้อน ลวดลายเสื้อผ้าละเอียด หรือเครื่องประดับโดดเด่น โมเดลให้ความสมจริงและความสอดคล้องเชิงความหมายที่เหนือกว่าอย่างสม่ำเสมอ”
อย่างไรก็ตาม พื้นที่ GitHub ของโครงการไม่มีโค้ดและไม่ได้สัญญาว่าจะเผยแพร่โค้ด ขณะที่หน้าโครงการขนาดเล็กทำให้ระบบนี้ดูเป็นสถาปัตยกรรมกรรมสิทธิ์

วิธีการ
กรอบ CompleteMe มี Reference U-Net สำหรับผสานข้อมูลอ้างอิงเข้าสู่กระบวนการ และ Cohesive U-Net สำหรับดำเนินขั้นตอนต่าง ๆ จนได้ผลลัพธ์สุดท้าย

ระบบเข้ารหัสภาพอินพุตที่มีมาสก์เป็นตัวแทนในปริภูมิแฝง ขณะเดียวกัน Reference U-Net ประมวลผลภาพอ้างอิงหลายภาพ ซึ่งแต่ละภาพแสดงบริเวณร่างกายต่างกัน เพื่อดึงคุณลักษณะเชิงพื้นที่อย่างละเอียด คุณลักษณะเหล่านี้ผ่านบล็อก RFA ใน Cohesive U-Net และถูกมาสก์ตามบริเวณที่สอดคล้องกัน ทำให้โมเดลสนใจเฉพาะส่วนที่เกี่ยวข้องในภาพอ้างอิง
จากนั้นระบบรวมคุณลักษณะที่ผ่านมาสก์กับคุณลักษณะความหมายระดับโลกจาก CLIP ผ่านกลไก cross-attention ที่แยกออกจากกัน จึงสร้างส่วนที่หายไปได้ทั้งรายละเอียดสูงและความสอดคล้องเชิงความหมาย เพื่อเพิ่มความสมจริงและความทนทาน กระบวนการสร้างมาสก์อินพุตจะสุ่มใช้ทั้งช่องตารางและมาสก์รูปร่างร่างกายมนุษย์ด้วยความน่าจะเป็นเท่ากัน ทำให้บริเวณที่ต้องเติมมีความซับซ้อนมากขึ้น
การใช้ภาพอ้างอิง
วิธีเติมภาพจากภาพอ้างอิงก่อนหน้านี้มักพึ่งตัวเข้ารหัสระดับความหมาย เช่น CLIP และ DINOv2 ซึ่งดึงคุณลักษณะโดยรวมจากภาพอ้างอิง แต่สูญเสียรายละเอียดเชิงพื้นที่ที่จำเป็นต่อการรักษาอัตลักษณ์อย่างแม่นยำ

CompleteMe แก้ปัญหานี้ด้วย Reference U-Net เฉพาะทางที่เริ่มต้นจาก Stable Diffusion 1.5 แต่ไม่ใช้ขั้นตอนเพิ่มสัญญาณรบกวนของ diffusion ภาพอ้างอิงแต่ละภาพที่ครอบคลุมส่วนร่างกายต่างกันจะถูกเข้ารหัสเป็นคุณลักษณะแฝงละเอียดผ่าน U-Net นี้ ส่วนคุณลักษณะความหมายระดับโลกถูกดึงแยกด้วย CLIP และแคชไว้เพื่อใช้งานอย่างมีประสิทธิภาพระหว่างการผสานด้วย attention ระบบจึงรองรับภาพอ้างอิงหลายภาพอย่างยืดหยุ่นพร้อมรักษารายละเอียดรูปลักษณ์
การประสานองค์ประกอบ
Cohesive U-Net ซึ่งดัดแปลงจากรุ่น inpainting ของ Stable Diffusion 1.5 จัดการขั้นตอนสุดท้าย โดยรับภาพต้นฉบับที่มีมาสก์ในรูปแฝง คุณลักษณะเชิงพื้นที่จากภาพอ้างอิง และคุณลักษณะความหมายจากตัวเข้ารหัส CLIP บล็อก RFA รวมอินพุตเหล่านี้และนำความสนใจไปยังบริเวณสำคัญที่สุด ก่อนเข้า attention คุณลักษณะอ้างอิงจะถูกมาสก์เพื่อตัดส่วนที่ไม่เกี่ยวข้อง แล้วเชื่อมกับตัวแทนแฝงของภาพต้นฉบับ
CompleteMe ยังใช้กลไก cross-attention แบบแยกที่ดัดแปลงจากกรอบ IP-Adapter ทำให้โมเดลประมวลผลคุณลักษณะภาพที่มีรายละเอียดเชิงพื้นที่และบริบทความหมายกว้างผ่านสาย attention แยกกัน ก่อนรวมเป็นภาพบูรณะที่สอดคล้องกัน ผู้เขียนระบุว่าวิธีนี้รักษาทั้งอัตลักษณ์และรายละเอียดปลีกย่อยได้

เกณฑ์มาตรฐาน
เนื่องจากยังไม่มีชุดข้อมูลที่เหมาะกับการเติมภาพบุคคลจากภาพอ้างอิง นักวิจัยจึงสร้างเกณฑ์มาตรฐานของตนเอง โดยคัดคู่ภาพจากชุด WPose ซึ่งสร้างขึ้นสำหรับโครงการ UniHuman ของ Adobe Research ในปี 2023

นักวิจัยวาดมาสก์ต้นฉบับด้วยตนเองเพื่อระบุบริเวณ inpainting และได้กลุ่มข้อมูลสามส่วน 417 กลุ่ม แต่ละกลุ่มประกอบด้วยภาพต้นฉบับ มาสก์ และภาพอ้างอิง

ผู้เขียนใช้โมเดลภาษาขนาดใหญ่ LLaVA สร้างพรอมต์ข้อความอธิบายภาพต้นฉบับ ตัวชี้วัดมีความครอบคลุมกว่างานทั่วไป ได้แก่ Peak Signal-to-Noise Ratio (PSNR), Structural Similarity Index (SSIM), Learned Perceptual Image Patch Similarity (LPIPS) สำหรับบริเวณที่มาสก์ ตลอดจนคะแนนความคล้ายจาก DINO, DreamSim และ CLIP
ข้อมูลและการทดสอบ
ผู้เขียนทดสอบด้วยทั้ง Stable Diffusion V1.5 รุ่นปกติและรุ่น inpainting ตัวเข้ารหัสภาพใช้โมเดล CLIP Vision ร่วมกับชั้น projection ซึ่งเป็นโครงข่ายขนาดเล็กสำหรับปรับเอาต์พุต CLIP ให้ตรงกับมิติคุณลักษณะภายในของโมเดล
การฝึกดำเนินไป 30,000 รอบบน GPU NVIDIA A100 จำนวนแปดตัว ใช้ Mean Squared Error (MSE) เป็นฟังก์ชันสูญเสีย ขนาดแบตช์ 64 และอัตราการเรียนรู้ 2×10-5 ส่วนประกอบบางอย่างถูกสุ่มตัดออกระหว่างฝึกเพื่อป้องกันการจำข้อมูลมากเกินไป
ชุดข้อมูลดัดแปลงจาก Parts to Whole ซึ่งมีพื้นฐานจาก DeepFashion-MultiModal

“เราได้สร้างคู่ข้อมูลฝึกใหม่โดยใช้ภาพที่มีส่วนถูกบังร่วมกับภาพอ้างอิงหลายภาพ ซึ่งจับลักษณะต่าง ๆ ของรูปลักษณ์มนุษย์และมีป้ายข้อความสั้น แต่ละตัวอย่างครอบคลุมรูปลักษณ์หกประเภท ได้แก่ เสื้อผ้าท่อนบน เสื้อผ้าท่อนล่าง เสื้อผ้าทั้งตัว ผมหรือเครื่องสวมศีรษะ ใบหน้า และรองเท้า สำหรับกลยุทธ์มาสก์ ครึ่งหนึ่งใช้กริดสุ่ม 1–30 ครั้ง อีกครึ่งใช้มาสก์รูปร่างร่างกายเพื่อเพิ่มความซับซ้อน หลังจบกระบวนการ เราได้คู่ภาพ 40,000 คู่สำหรับการฝึก”
วิธีคู่แข่งที่ไม่ใช้ภาพอ้างอิง ได้แก่ LOHC และ BrushNet ส่วนวิธีที่ใช้ภาพอ้างอิง ได้แก่ Paint-by-Example, AnyDoor, LeftRefill และ MimicBrush

CompleteMe ได้คะแนนสูงสุดในตัวชี้วัดเชิงการรับรู้ส่วนใหญ่ ได้แก่ CLIP-I, DINO, DreamSim และ LPIPS ซึ่งวัดความสอดคล้องเชิงความหมายและความแม่นยำของรูปลักษณ์ระหว่างผลลัพธ์กับภาพอ้างอิง แต่ไม่ได้ชนะทุกตัวชี้วัด BrushNet ได้ CLIP-T สูงสุด, LeftRefill นำด้าน SSIM และ PSNR และ MimicBrush เหนือกว่าเล็กน้อยใน CLIP-I ความแตกต่างบางกรณีมีขนาดไม่มาก ผู้เขียนจึงอธิบายผลลัพธ์ว่าเป็นความแข็งแกร่งที่สมดุลทั้งด้านโครงสร้างและการรับรู้
ตัวอย่างเชิงคุณภาพมีจำนวนมากเกินกว่าจะนำเสนอทั้งหมด ผู้อ่านควรดูทั้งบทความต้นฉบับและเอกสารเสริมซึ่งมีกรณีเพิ่มเติมจำนวนมาก

ผู้เขียนอธิบายว่า วิธีที่ไม่ใช้ภาพอ้างอิงสามารถสร้างเนื้อหาที่ดูสมเหตุผลในบริเวณมาสก์จากความรู้เดิมของโมเดลหรือพรอมต์ข้อความ แต่ไม่สามารถสร้างรายละเอียดเฉพาะ เช่น รอยสักหรือลวดลายเสื้อผ้าที่ไม่เหมือนใคร เพราะไม่มีภาพอ้างอิงนำทาง
การเปรียบเทียบถัดไปมุ่งที่ Paint-by-Example, AnyDoor, LeftRefill และ MimicBrush โดยให้ภาพอ้างอิงเพียงหนึ่งภาพกับพรอมต์ข้อความ

“เมื่อได้รับภาพบุคคลที่มีมาสก์และภาพอ้างอิง วิธีอื่นสร้างเนื้อหาที่น่าเชื่อถือได้ แต่มักรักษาข้อมูลบริบทจากภาพอ้างอิงไม่แม่นยำ บางกรณีสร้างเนื้อหาที่ไม่เกี่ยวข้องหรือจับคู่ส่วนจากภาพอ้างอิงผิดตำแหน่ง ตรงกันข้าม CompleteMe เติมบริเวณมาสก์โดยรักษาข้อมูลเดิมอย่างแม่นยำและจับคู่ส่วนร่างกายที่สอดคล้องกันได้ถูกต้อง”
เพื่อประเมินความสอดคล้องกับการรับรู้ของมนุษย์ นักวิจัยจัดการศึกษาผู้ใช้ที่มีผู้ประเมิน 15 คนและคู่ตัวอย่าง 2,895 คู่ แต่ละคู่เปรียบเทียบผลของ CompleteMe กับหนึ่งในสี่ระบบอ้างอิง ผู้ประเมินพิจารณาคุณภาพภาพของบริเวณที่เติมและระดับการรักษาอัตลักษณ์จากภาพอ้างอิง ผลรวมด้านคุณภาพและอัตลักษณ์ทำให้ CompleteMe ได้ชัยชนะชัดเจนกว่า

บทสรุป
จำนวนผลเชิงคุณภาพที่มากมหาศาลอาจทำให้จุดแข็งของงานนี้มองเห็นได้ยาก แต่การตรวจสอบอย่างใกล้ชิดแสดงว่า CompleteMe เป็นระบบที่มีประสิทธิภาพมากในสาขาการแก้ไขภาพด้วยโครงข่ายประสาทซึ่งแม้เฉพาะทางแต่มีการแข่งขันสูง ต้องซูมดู PDF ต้นฉบับจึงจะเห็นชัดว่าระบบปรับวัสดุอ้างอิงให้เข้ากับบริเวณที่ถูกบังได้ดีกว่าวิธีก่อนหน้าเกือบทุกกรณี

* น่าสังเกตว่า Stable Diffusion V1.5 ซึ่งเก่ามากแล้วยังคงเป็นที่นิยมในหมู่นักวิจัย ส่วนหนึ่งเพราะเหมาะกับการทดสอบเทียบเคียงกับงานเดิม อีกส่วนเพราะถูกจำกัดน้อยและอาจฝึกได้ง่ายกว่ารุ่น Stable Diffusion อื่น อีกทั้งไม่มีข้อจำกัดแบบเดียวกับ Flux รุ่นโอเพนซอร์ส
† งานวิจัยไม่ได้ระบุ VRAM ของการ์ด แต่คาดว่าเป็น 40GB หรือ 80GB ต่อการ์ด
เผยแพร่ครั้งแรกวันอังคารที่ 29 เมษายน 2025
แหล่งข้อมูลและลิงก์ที่เกี่ยวข้อง
- https://archive.is/ByS5y
- https://arxiv.org/pdf/2504.20042
- https://www.youtube.com/watch?v=NhdzGfB1q74
- https://github.com/LIAGM/CompleteMe
- https://liagm.github.io/CompleteMe/
- https://archive.is/72T3D
- https://www.tensorflow.org/guide/keras/understanding_masking_and_padding
- https://archive.is/pNUIw
- https://aclanthology.org/2021.emnlp-main.132/
- https://arxiv.org/pdf/2304.07193
- https://huggingface.co/stable-diffusion-v1-5/stable-diffusion-v1-5
- https://www.unite.ai/understanding-diffusion-models-a-deep-dive-into-generative-ai/
- https://huggingface.co/stable-diffusion-v1-5/stable-diffusion-inpainting/blob/main/sd-v1-5-inpainting.ckpt
- https://arxiv.org/pdf/2308.06721
- https://arxiv.org/pdf/2312.14985
- https://arxiv.org/pdf/2304.08485
- https://www.mathworks.com/help/vision/ref/psnr.html
- https://www.imatest.com/docs/ssim/
- https://archive.is/QRkZl#lpips
- https://arxiv.org/pdf/2306.09344
- https://arxiv.org/pdf/2103.00020
- https://www.geeksforgeeks.org/mean-squared-error/
- https://archive.is/8quL2#batchsize
- https://archive.is/GLL0R#learningrate
- https://archive.is/vYVVf
- https://huanngzh.github.io/Parts2Whole/
- https://www.cv-foundation.org/openaccess/content_cvpr_2016/papers/Liu_DeepFashion_Powering_Robust_CVPR_2016_paper.pdf
- https://dl.acm.org/doi/10.1609/aaai.v38i7.28578
- https://tencentarc.github.io/BrushNet/
- https://github.com/Fantasy-Studio/Paint-by-Example
- https://arxiv.org/pdf/2307.09481
- https://arxiv.org/pdf/2305.11577
- https://arxiv.org/pdf/2406.07547
- https://liagm.github.io/CompleteMe/pdf/supp.pdf
- https://anakin.ai/blog/can-flux-ai-generate-nsfw-images-its-complicated/












