มุมมองของ Anderson
การลองเสื้อผ้าเสมือนผ่าน AI

แบบจำลอง AI สามารถเปลี่ยนรูปภาพเดียวและรูปภาพเสื้อผ้าให้เป็นวิดีโอที่เคลื่อนไหวของบุคคลที่สวมชุดใหม่ โดยหลีกเลี่ยงข้อผิดพลาดที่พบในระบบสองขั้นตอนที่เก่ากว่า
หมวดหมู่ ‘ลองเสื้อผ้าเสมือน’ (VTON) ในการวิจัยด้านการมองเห็นของคอมพิวเตอร์เป็นหนึ่งในการแสวงหาที่ได้รับการสนับสนุนและได้รับการสนับสนุนมากที่สุดในเอกสารวิชาการ – ส่วนใหญ่เนื่องจากสามารถอนุมานได้จากความร่วมมือระหว่างอุตสาหกรรมและวิชาการที่ตีพิมพ์ทุกปี ว่าจุดมุ่งหมายนี้ได้รับการสนับสนุนจากอุตสาหกรรมแฟชั่นที่มีเงินทุนมาก

จากเอกสาร ‘Image-Based Virtual Try-On: A Survey’ ตัวอย่างของประเภทการแสดงบุคคล และบางส่วนของขั้นตอนการกรองและปรับแต่งที่แม้แต่ภาพที่ไม่มีรายละเอียดก็จะต้องผ่านไปสำหรับการลองเสื้อผ้าเสมือน (VTON) แหล่งที่มา
มีหลายรูปแบบในการลองเสื้อผ้าเสมือน เช่น การดึงเสื้อผ้าออกจากรูปภาพของบุคคล และ การรองรับบุคคลที่มีรูปร่างเต็มเมื่อจำเป็น บางระบบที่ใช้ภาพได้ถูกนำไปใช้ในเชิงพาณิชย์ที่แพลตฟอร์ม เช่น veesual.ai, wanna.fashion และ fashn.ai
สำหรับวิดีโอ แอป Doppl ของ Google Labs ได้ทดลองใช้ฟังก์ชันนี้ โดยเปิดตัว เมื่อฤดูร้อนปีที่แล้ว:
กรุณาคลิกเพื่อเล่นวิดีโอหากวิดีโอดังกล่าวไม่ได้เล่นอัตโนมัติ ตัวอย่างจากโครงการวิดีโอลองเสื้อผ้าเสมือนของ Google ที่ถูกยกเลิก แหล่งที่มา
อย่างไรก็ตาม Doppl ปิดให้บริการในเดือนเมษายน 2026 หลังจากได้รับการตอบรับที่ไม่ดีนัก โดยผู้ใช้จะถูกส่งไปยังบริการลองเสื้อผ้าเสมือนที่ใช้ภาพของบริษัทแทน:

โปรแกรมลองเสื้อผ้าเสมือนที่ใช้ภาพของ Google ซึ่งผู้ใช้จะถูกส่งไปยังที่นี่จากแพลตฟอร์ม Doppl ที่ถูกยกเลิก แหล่งที่มา
แม้ว่าจะมีแพลตฟอร์มบางแห่งที่ให้บริการลองเสื้อผ้าเสมือนที่ใช้วิดีโอ แต่ก็ไม่มีแพลตฟอร์มใดที่เกี่ยวข้องกับร้านค้าจริง และทั้งหมดเป็นผลิตภัณฑ์ระดับแนวหน้าที่ไม่เสถียรและบางแห่งมีลักษณะที่น่าสงสัย
ในขณะที่มีการวิจัยที่น่าสนใจหลายอย่างจากภาควิชาการ แต่ส่วนใหญ่เป็นระบบที่ซับซ้อนและยากต่อการนำไปใช้ในการผลิตที่มีความหน่วงต่ำและคุณภาพสูง:
กรุณาคลิกเพื่อเล่นวิดีโอหากวิดีโอดังกล่าวไม่ได้เล่นอัตโนมัติ ตัวอย่างจากโครงการ Fashion-VDM ปี 2024 . แหล่งที่มา
ความจริงแล้ว การทำให้เสื้อผ้าเข้ากับร่างกายของมนุษย์โดยไม่ทำให้เสื้อผ้าหรือร่างกายบิดเบี้ยว และยังคงเคลื่อนไหวที่มีประโยชน์ (ซึ่ง แสดงให้เห็นถึงด้านหลังของผลิตภัณฑ์เมื่อบุคคลหันหลัง) เป็นความท้าทายที่ยิ่งใหญ่สำหรับสภาพปัจจุบันของเทคโนโลยี
Vanast
เป็นความท้าทายที่งานวิจัยใหม่จากเกาหลีใต้พยายามที่จะแก้ไข โดยใช้โซลูชันที่รวมและเป็นเอกลักษณ์ในการวิเคราะห์เสื้อผ้า + บุคคล + การเคลื่อนไหว:
กรุณาคลิกเพื่อเล่นวิดีโอหากวิดีโอดังกล่าวไม่ได้เล่นอัตโนมัติ ตัวอย่างจากเว็บไซต์เสริมของโครงการ Vanast แหล่งที่มา
ระบบใหม่นี้ชื่อ Vanast ใช้เซตข้อมูลที่สร้างขึ้นเองซึ่งรวมถึงการบูรณาการและจัดระเบียบของทั้งสามปัจจัยที่จำเป็นในการทำงาน: เสื้อผ้า; บุคคล; และการเคลื่อนไหว:
คลิกเพื่อเล่น ตัวอย่างเพิ่มเติมจากเว็บไซต์โครงการ Vanast
ระบบใช้เฟรมเวิร์กที่หลากหลาย เช่น Flux, Qwen และ ChatGPT เพื่อสร้างเซตข้อมูล ‘สามส่วน’ ที่สามารถบอกระบบแบบสิ้นสุดต้นสาย-ปลายทางได้:

จากเอกสารใหม่ ตัวอย่างของจุดข้อมูลในเซตข้อมูลที่ใช้ในการสร้างและฝึกอบรม แหล่งที่มา –
เอกสารใหม่ ชื่อ Vanast: Virtual Try-On with Human Image Animation via Synthetic Triplet Supervision และมาจากนักวิจัยสี่คนจาก Seoul National University มีเว็บไซต์โครงการที่มีวิดีโอด้วย
วิธีการ
วัตถุประสงค์ที่ระบุไว้ของงานวิจัยคือการรวมสามด้านที่กล่าวมาข้างต้นเข้าด้วยกันในเฟรมเวิร์กแบบสิ้นสุดต้นสาย-ปลายทาง – ไม่ใช่แค่เพราะกระบวนการจะเป็นแบบไม่ต่อเนื่อง แต่ยังให้โอกาสแก่ส่วนต่างๆ ในการผสมผสานและโต้ตอบระหว่างการฝึกอบรมด้วย:

Vanast รวมรูปภาพบุคคลเดียว เสื้อผ้า และการเคลื่อนไหวเข้าด้วยกันเพื่อสร้างวิดีโอที่เคลื่อนไหวซึ่งบุคคลเดียวกันสวมชุดใหม่ โดยมีการควบคุมท่าทางเพื่อให้การเคลื่อนไหวสม่ำเสมอ และรักษาความเป็นบุคคลและรายละเอียดเสื้อผ้าไว้ระหว่างเฟรม
เพื่อให้บรรลุเป้าหมายนี้ ระบบจะใช้รูปภาพของชุดเสื้อผ้าเป้าหมาย; รูปภาพบุคคลที่สวมเสื้อผ้าแบบต่างๆ; วิดีโอการเคลื่อนไหวที่กำหนดว่าบุคคลควรเคลื่อนไหวอย่างไร; และคำสั่งด้วยข้อความที่อธิบายการกระทำและฉาก; และสร้างวิดีโอที่บุคคลเดียวกันปรากฏขึ้นโดยสวมชุดใหม่ โดยทำตามการเคลื่อนไหวที่กำหนด และรักษาความสม่ำเสมอระหว่างเฟรม
เซตข้อมูล
การฝึกอบรมสำหรับโครงการนี้ใช้ตัวอย่างที่จับคู่กันของภาพบุคคล เสื้อผ้า และวิดีโอของบุคคลที่เคลื่อนไหวโดยสวมเสื้อผ้าเหล่านั้น โดยใช้ สถาปัตยกรรมก่อนหน้า เพื่อให้ได้การควบคุมท่าทางที่เสถียรระหว่างเฟรม
เนื่องจากไม่มีเซตข้อมูลที่มีอยู่สาธารณะที่ตรงตามข้อกำหนดของโครงการ ข้อมูลจึงถูกเก็บจากเว็บไซต์ช้อปปิ้งออนไลน์ โดยให้แคชวิดีโอที่มีเสื้อผ้าหลากหลาย อย่างไรก็ตาม งานนี้ต้องการวิดีโอของบุคคลที่สวมชุดหลายชุด ซึ่งเป็นสิ่งที่หายากในข้อมูลธรรมชาติ และจำเป็นต้องสร้าง ข้อมูลสังเคราะห์
กระบวนการที่ใช้สามขั้นตอนประกอบด้วยการเลือกเฟรมที่เหมาะสมจากวิดีโอที่เก็บมา โดยใช้ Qwen2.5-VL Vision-Language Model (VLM) โดยมีการตัดและประเมินความเหมาะสม (เช่น ไม่มีการบดบัง บุคคลอยู่ในตำแหน่งที่ถูกต้อง ฯลฯ); และการสร้าง inpainting มาสก์สำหรับการแยกพื้นที่ที่ได้รับผลกระทบ – ซึ่งตามงานก่อนหน้า PERSE จะได้รับการจัดการโดย SDXL แบบจำลองการกระจาย

ภาพรวมของ Vanast pipeline ซึ่งภาพบุคคล เสื้อผ้า และวิดีโอการเคลื่อนไหวถูกเข้ารหัสและประมวลผลในแบบจำลองการแพร่กระจายวิดีโอที่รวมกัน ระบบจะสร้างแอนิเมชั่นที่รักษาความเป็นบุคคลและเสื้อผ้าไว้ และทำตามลำดับท่าทาง ในขณะที่การสร้างสามส่วนสังเคราะห์สนับสนุนการฝึกอบรม และการออกแบบแบบโมดูลคู่แยกแยะการเคลื่อนไหวออกจากการถ่ายโอนเสื้อผ้าเพื่อรักษาความสม่ำเสมอ
ในขั้นตอนที่สาม Qwen ถูกใช้อีกครั้งเพื่อจัดประเภทภาพตามเพศ และเฟรมเวิร์กการแพร่กระจายภาพ Flux ถูกใช้เพื่อสร้างการเปลี่ยนแปลงเสื้อผ้าในภาพ (เนื่องจาก Flux สามารถรวมองค์ประกอบเข้าด้วยกันได้) ส่วนคำสั่ง inpainting ถูกสร้างขึ้นโดย ChatGPT (รุ่นที่ไม่ระบุ)
เพื่อเพิ่มความหลากหลายของท่าทางและพื้นหลัง อัลกอริทึมถูกนำมาใช้เพื่อสร้างสามส่วนฝึกอบรมจากวิดีโอที่ไม่มีการควบคุม โดยใช้ HumanVid dataset กระบวนการเดียวกันนี้ถูกใช้ในการสร้างภาพบุคคลที่รักษาความเป็นบุคคลไว้
เนื่องจากไม่มีภาพเสื้อผ้าแบบสแตนด์อโลนที่มีอยู่ในวิดีโอนี้ ภาพเสื้อผ้าจึงถูกสร้างขึ้นโดยตรงจากฟุตเทจ เฟรมถูกตัวอย่างจากวิดีโอแต่ละคลิป และ Qwen ถูกใช้เพื่อประเมินความเหมาะสมสำหรับการมองเห็นด้านหน้า ก่อนที่จะเลือกตัวอย่างที่เหมาะสมที่สุดตามความชัดเจนของภาพ ความชัดเจนของภาพ ความน้อยของการบดบัง คุณภาพแสง และองค์ประกอบโดยรวม
พื้นที่เสื้อผ้าบนลำตัวถูกถอดออกโดยใช้ SegFormer และพื้นหลังถูกถอดออกเพื่อแยกเสื้อผ้า
เพื่อหลีกเลี่ยง ความลำเอียงด้านตำแหน่ง พื้นที่เสื้อผ้าถูกเลื่อนตำแหน่งแบบสุ่มภายในกล่องที่ล้อมรอบ และ Qwen ถูกใช้อีกครั้งเพื่อกรองการแบ่งส่วนที่ไม่น่าเชื่อถือ กระบวนการนี้สร้างภาพเสื้อผ้าสังเคราะห์ที่จับคู่กับการเคลื่อนไหวและความเป็นบุคคล ซึ่งช่วยให้สามารถสร้างสามส่วนได้จากวิดีโอที่ไม่มีการควบคุมในระดับใหญ่ และปรับปรุงความแข็งแกร่งในสถานการณ์จริงที่หลากหลาย
สถาปัตยกรรม
สถาปัตยกรรมแบบโมดูลคู่ถูกนำมาใช้เพื่อแก้ไขปัญหาการ การบรรลุ ที่ช้าและความสมดุลในการควบคุมที่อ่อนแอในระบบก่อนหน้าที่พยายามรวมเงื่อนไขทั้งหมดเข้าด้วยกัน วิธีการนี้ใช้แบบจำลองการแพร่กระจายวิดีโอจาก Wan และยังใช้จาก VACE โครงการ (ดูรายละเอียดด้านล่าง)
แบบจำลองถูกแบ่งออกเป็น โมดูลการเคลื่อนไหวของมนุษย์ (HAM) ซึ่งจัดการการเคลื่อนไหวและความเป็นบุคคลจากภาพบุคคลและข้อมูลท่าทาง; และ โมดูลการถ่ายโอนเสื้อผ้า (GTM) ซึ่งจัดการเสื้อผ้าจากภาพเสื้อผ้า โดยทั้งสองโมดูลใช้แบ็คโบนร่วมกัน ในขณะที่รวมคุณลักษณะในลักษณะที่กระจายและเชื่อมโยงเพื่อปรับปรุงการเตรียมการ
การฝึกอบรมถูกดำเนินการโดย การ凍แบ็คโบน และเพิ่มประสิทธิภาพเฉพาะพารามิเตอร์ของ HAM และ GTM โดยมีส่วนร่วมที่สมดุลระหว่างการบูรณาการคุณลักษณะ โดยใช้แบบจำลองการแพร่กระจายวิดีโอของ WAN เพื่อแปลงข้อมูลสามส่วนเข้าด้วยกัน
บริบทการเคลื่อนไหวที่ตระหนักถึงการเคลื่อนไหวถูกสร้างขึ้นโดยการรวมข้อมูลบุคคลและท่าทางตลอดเวลา ในขณะที่คุณลักษณะเสื้อผ้าถูกประมวลผลแยกกันและจัดตำแหน่งผ่านการฉายภาพไปยังคุณลักษณะที่ฝังตัว
แบบจำลองนี้ยังได้รับการขยายเพื่อรองรับ การแทรกแซงเสื้อผ้า โดยการรวมการแสดงของเสื้อผ้าสองชุดเพื่อสร้างการเปลี่ยนแปลงที่ราบรื่น ทำให้สามารถผสมผสานเสื้อผ้าระหว่างชุดเสื้อผ้าได้อย่างสม่ำเสมอและเป็นไปตามหลักเหตุผล โดยไม่ต้องมีการปรับให้เหมาะสมเพิ่มเติม
ข้อมูลและทดสอบ
แบบจำลองถูกฝึกอบรมด้วยวิดีโอ 9,135 คลิป โดยมีความยาวตั้งแต่ 3 ถึง 10 วินาที ซึ่งมาจาก ‘เว็บไซต์ช้อปปิ้ง’; เซตข้อมูลที่สร้างขึ้นเอง; และ HumanVid dataset
จากข้อมูลเหล่านี้ เซตข้อมูลทดสอบสองชุดถูกสร้างขึ้น: ‘เซตข้อมูลอินเทอร์เน็ต’ ซึ่งประกอบด้วยวิดีโอและภาพผลิตภัณฑ์จากห้างสรรพสินค้า; และเซตทดสอบอย่างเป็นทางการของ Alibaba’s ViViD dataset
เนื่องจากข้อมูล ViViD ไม่มีใบหน้า (ดูวิดีโอด้านบนเป็นตัวอย่าง ซึ่งเป็นเรื่องปกติในเอกสารการลองเสื้อผ้าเสมือน) ใบหน้าจึงถูกเพิ่มโดยใช้ Flux outpainting
เมตริกที่ใช้ในการประเมินคือ L1 loss; Peak Signal-to-Noise Ratio (PSNR); Structural Similarity Index (SSIM); Learned Perceptual Image Patch Similarity (LPIPS); Fréchet Inception Distance (FID); และ Fréchet Video Distance†† (FVD)
ระบบที่ถูกทดสอบสำหรับการถ่ายโอนเสื้อผ้า ได้แก่ OOTDiffusion; CatVTON; OmniTry; และ Any2AnyTryon สำหรับแบบจำลองการสร้างภาพจากวัตถุถูกทดสอบ VisualCloze; MOSAIC; และ UNO ของ ByteDance
สำหรับการทดสอบประเภทที่สอง ซึ่งรวมการลองเสื้อผ้าเสมือนที่ใช้ภาพและแบบจำลองการเคลื่อนไหวของภาพ การทำงานใหม่นี้สามารถบรรลุผลลัพธ์ที่ดีที่สุดได้

การเปรียบเทียบเชิงปริมาณกับการรวมกันของแบบจำลองการลองเสื้อผ้าเสมือนที่ใช้ภาพและแบบจำลองการเคลื่อนไหวของภาพในเซตข้อมูลอินเทอร์เน็ตและ ViViD โดยวิธีการที่เสนอได้แสดงผลลัพธ์ที่ดีที่สุดโดยรวมทั่วทั้งเมตริก โดยมีค่า SSIM เหลือเทียบเท่ากับผลลัพธ์ที่ดีที่สุด
ผู้เขียนเพิ่มเติม:
‘[แบบจำลองของเรา] ได้แสดงผลลัพธ์ที่ดีที่สุดในเมตริกทั้งหมดเมื่อเปรียบเทียบกับการรวมกันของแบบจำลองการสร้างภาพจากวัตถุและแบบจำลองการเคลื่อนไหว
‘ผลลัพธ์เชิงคุณภาพที่แสดงด้านล่างยืนยันเพิ่มเติมว่าวิธีการของเราสามารถสร้างการเคลื่อนไหวที่แม่นยำและถ่ายโอนเสื้อผ้าได้ดีที่สุด ในขณะที่รักษาความเป็นบุคคลไว้ได้ดีกว่าแบบจำลองการสร้างภาพจากวัตถุอื่นๆ ‘

การเปรียบเทียบเชิงคุณภาพในเซตข้อมูลอินเทอร์เน็ตและ ViViD กับแบบจำลองการสร้างภาพจากวัตถุและแบบจำลองการเคลื่อนไหว โดยวิธีการที่เสนอสามารถแสดงผลลัพธ์ที่แม่นยำที่สุดในด้านการเคลื่อนไหวและถ่ายโอนเสื้อผ้า ในขณะที่รักษาความเป็นบุคคลไว้ได้ดีกว่า VisualCloze, MOSAIC, UNO และ VACE
สรุป
แม้ว่าโครงการ Vanast จะบรรลุเป้าหมายที่เป็นแบบสิ้นสุดต้นสาย-ปลายทาง แต่การขาดรายละเอียดเกี่ยวกับการฝึกอบรมและการอนุมานของเอกสารอาจบ่งบอกว่านี่อาจไม่ใช่วิธีแก้ปัญหาที่คล่องตัวหรือคล่องแคล่วที่สุด ในความเป็นจริง การท้าทายดังกล่าวยังคงเป็นเรื่องที่ยากมากที่จะบรรลุผลในระบบที่ไม่ได้ปรับให้เหมาะสม – และยิ่งไปกว่านั้นในระบบที่ต้องการความหน่วงต่ำและราคาไม่แพงในการใช้งานในเชิงพาณิชย์..?
การลองเสื้อผ้าเสมือนเป็นหนึ่งในเป้าหมาย ‘ดวงจันทร์’ ของ AI ที่สถานะปัจจุบันของเทคโนโลยี ซึ่งได้รับการเผยแพร่ผ่านหัวข้อข่าวและผลลัพธ์ที่เลือกมา อาจทำให้เข้าใจผิดเกี่ยวกับความยากของงาน ซึ่งอาจจะถูกแก้ไขในอนาคตด้วยเทคโนโลยีที่ล้ำสมัยและเบากว่าแบบ Transformer
† มีให้บริการในสหรัฐอเมริกา และถูกปิดกั้นในหลายภูมิภาคอื่น หากไม่ใช่ทั้งหมด
†† ผู้เขียนอ้างถึง ‘VFID’ แต่ลิงก์ไปยังเอกสาร ViViD ซึ่งไม่สมเหตุสมผลตามที่ฉันเข้าใจ ด้วยเวลาที่จำกัดในการติดตาม ฉันถือว่าพวกเขาตั้งใจหมายถึง Fréchet Video Distance (FVD) และขาดเวลาเช่นกัน กรุณาติดต่อฉันสำหรับการแก้ไขตามความจำเป็น
ตีพิมพ์ครั้งแรกวันพุธที่ 8 เมษายน 2026












