زاوية Anderson
تجربة الملابس الجديدة من خلال الذكاء الاصطناعي

يمكن أن يحول نموذج الذكاء الاصطناعي الآن صورة واحدة وصور الملابس إلى فيديو متحرك لشخص يرتدي ملابس جديدة ، وتجنب الأخطاء الشائعة في الأنظمة القديمة ذات المرحلتين.
تعتبر فئة ‘تجربة الملابس الافتراضية’ (VTON) في أبحاث الرؤية الحاسوبية واحدة من أفضل الفئات تمويلًا وأكثرها إنتاجًا في الأدبيات – ويرجع ذلك بشكل رئيسي إلى أن هذا الهدف يحصل على تمويل كبير من صناعة الأزياء الغنية ، كما يمكن استخلاص ذلك من التعاونات الأكاديمية والصناعية التي تنشر كل عام:

من الورقة ‘تجربة الملابس الافتراضية بالصور: دراسة’ ، أمثلة لأنواع تمثيل الأشخاص ، وبعض مراحل الترشيح والتحسين التي يجب أن يمر بها حتى الصور الأساسية لتحقيق تجربة الملابس الافتراضية (VTON). المصدر
هناك العديد من الاختلافات حول الهدف ، مثل استخراج الملابس من صور الأشخاص ، و تكييف الشكل الأكبر عند الحاجة. تم تنفيذ بعض الأنظمة القائمة على الصور تجاريًا ، في منصات مثل veesual.ai و wanna.fashion و fashn.ai.
بالنسبة للفيديو ، قام تطبيق Doppl التجريبي من Google Labs بتجربة هذه الوظيفة ، حيث تم إطلاقه في الصيف الماضي:
الرجاء النقر للعب إذا لم يكن الفيديو يعمل تلقائيًا. مقتطفات من مشروع Google Doppl المهمَل. المصدر
然而 ، تم إغلاق Doppl في أبريل 2026 بعد استقبال بارد ، حيث يتم الآن إحالة المشاهدين إلى خدمة تجربة الملابس الافتراضية الخاصة بالصور فقط†:

برنامج تجربة الملابس الافتراضية الخاص بجووجل ، حيث يتم إحالة المستخدمين إليه من منصة Doppl المهمَلة. المصدر
على الرغم من وجود بعض المنصات التي تقدم تجربة الملابس الافتراضية مع الفيديو ، لا تبدو أي من هذه المنصات على أنها تابعة لمتجر حقيقي ؛ وجميعها منتجات “حافة التكنولوجيا” هامشية (وغالبًا ما تكون “مريبة”) التي تطرح رموز.
في حين أن هناك بعض المساعي المثيرة للاهتمام من قطاع البحث ، فهي في الغالب هياكل معقدة يصعب تنفيذها لاتخاذ إجراءات سريعة وذات جودة عالية:
الرجاء النقر للعب إذا لم يكن الفيديو يعمل تلقائيًا. من مشروع Fashion-VDM 2024 ، مثال على “نقل الملابس بدون رأس”. المصدر
الحقيقة هي أن مهمة تلبية الملابس لشخص حقيقي ، دون تشويه الملابس أو الشخص ، مع الحفاظ على نوع من الحركة الإيضاحية المفيدة (التي دقيقة تظهر ظهر المنتج عندما يلتفت الشخص ظهره) ، هي تحد هائل للوضع الحالي للتكنولوجيا:
Vanast
إنه تحد يحاول مشروع جديد من كوريا مواجهته ، من خلال استخدام حل متكامل وجديد تمامًا لتحليل الملابس + الشخص + الحركة:
الرجاء النقر للعب إذا لم يكن الفيديو يعمل تلقائيًا. أمثلة من موقع المواد الإضافية لمشروع Vanast. المصدر
النظام الجديد ، الذي يُسمى Vanast ، يستفيد من مجموعة بيانات مخصصة تتميز بدمج وتوحيج ثلاثة عوامل ضرورية لتحقيق المهمة: الملابس؛ الشخص؛ والحركة:
انقر للعب.مزيد من الأمثلة من موقع مشروع Vanast.
يستفيد النظام من إطارات متعددة مثل Flux و Qwen و ChatGPT ، لإنشاء مجموعة بيانات “ثلاثية” قادرة على إعلام هيكل من النهاية إلى النهاية:

من الورقة الجديدة ، أمثلة لنقاط بيانات مجموعة البيانات المستخدمة للإنشاء والتدريب. المصدر –
الورقة الجديدة بعنوان Vanast: تجربة الملابس الافتراضية مع تحريك الصور البشرية عبر الإشراف الثلاثي الاصطناعي ، وهي من تأليف أربعة باحثين من جامعة سول الوطنية. هناك أيضًا موقع مشروع يحتوي على فيديوهات موقع مشروع Vanast.
الطريقة
الهدف المعلن للمؤلفين في العمل هو دمج ثلاثة جوانب سابقة الذكر في إطار مرحلة واحدة – ليس فقط لأن العملية ستكون منفصلة ، ولكن أيضًا لأنها توفر للجوانب المختلفة فرصة أكبر للتفاعل أثناء التدريب ، مع نظرة إلى توليد أكثر تماسكًا:

يجمع Vanast صورة واحدة لشخص مع صور ملابس منفصلة ومرجع حركة لإنشاء تسلسل متحرك حيث يرتدي الشخص نفس الملابس الجديدة ، مع توجيه الوضع لضمان حركة متسقة مع الحفاظ على الهوية والتفاصيل الملابسية عبر الإطارات.
为了实现这一点 ، يقوم النظام بتحويل صور الملابس المستهدفة; صورة لشخص يرتدي ملابس مختلفة; فيديو مرجعي للحركة التي يجب على الشخص أن يتبعها; ونص يصف الإجراء والموقع; وينتج تسلسل فيديو كامل حيث يبدو الشخص أنه يرتدي الملابس الجديدة ، مع اتباع الحركة المحددة ، مع الحفاظ على كل إطار متسقًا بمرور الوقت.
على عكس فصل الملابس والتحريك إلى مراحل منفصلة – وهو النهج المتبع في معظم الأعمال المماثلة السابقة – يتعامل Vanast مع الملابس والهوية والحركة معًا في عملية واحدة ، مما يسمح لهذه العناصر بالتفاعل أثناء التوليد ، ويتقلص من أنواع عدم التطابق والINSTABILITY التي ظهرت في الطرق السابقة.
مجموعة البيانات
يستند التدريب على أمثلة متوافقة لصورة شخص وملابس معينة و فيديو لشخص يتحرك يرتدي تلك الملابس ، مع استخراج الحركة باستخدام هيكل سابق ، لتوفير توجيه الوضع المستقر عبر الإطارات:
في غياب مجموعة بيانات عامة تفي بالمتطلبات المشروع ، تم جمع البيانات من منصات التسوق عبر الإنترنت (غير محددة) ، مما يوفر ذخيرة من مقاطع الفيديو مع ملابس متنوعة. ومع ذلك ، فإن المهمة تتطلب مقاطع فيديو لشخص يرتدي ملابس متعددة ، وهو نادرًا ما يحدث في البيانات البرية ، مما استلزم إنشاء بيانات اصطناعية.
تمت عملية ثلاثية المراحل من خلال اختيار إطارات مناسبة من مقاطع الفيديو ، التي تمت معالجتها بواسطة نموذج Qwen2.5-VL ، مع تقليم مناسب وتقييم الملاءمة (أي لا توجد عوائق ، الشخص في الموضع الصحيح ، إلخ.) ؛ وإنشاء أقنعة تجديد مناسبة لفصل المناطق المتأثرة – والتي (وفقًا للعمل السابق PERSE) يتم处理ها بواسطة نموذج SDXL للاندماج.

نظرة عامة على خط أنابيب Vanast ، حيث يتم ترميز صورة شخص وصور ملابس ومرجع حركة في نموذج اندماج فيديو موحد. يولد النظام تحريكًا يحافظ على الهوية ، ويتابع تسلسل الوضع ، ويطبق الملابس المستهدفة ، مع دعم توليد الثلاثية الاصطناعية للتدريب ، وتصميم مزدوج الحوض لفصل التحريك عن نقل الملابس ، للحفاظ على الاتساق.
في المرحلة الثالثة ، يقوم Qwen مرة أخرى بتصنيف الصور حسب الجنس ، ويتم استخدام إطار Flux لإنشاء تعديلات على الملابس في الصورة (حيث يمكن ل Flux دمج عناصر输入 متعددة). تم курирование نصوص أقنعة التجديد بواسطة ChatGPT (الإصدار غير محدد).
为了 زيادة تنوع الوضع والخلفية ، تم تقديم خط أنابيب لإنشاء ثلاثيات التدريب من مقاطع فيديو في البرية ، باستخدام مجموعة بيانات HumanVid. تم استخدام نفس العملية لإنشاء صورة شخص يحافظ على الهوية.
由于 عدم وجود صورة ملابس منفصلة في هذه المقاطع ، تم синтез صور الملابس مباشرة من مقاطع الفيديو. تم عينة الإطارات من كل مقطع فيديو ، وتم استخدام Qwen لتقييمها من حيث الرؤية الأمامية ، قبل اختيار المرشح الأكثر ملاءمة ، بناءً على الرؤية الكاملة للجسم ، وضوح الصورة ، وعدم وجود عوائق ، وجودة الإضاءة ، والتركيبة العامة.
تم استخراج منطقة الملابس العلوية باستخدام SegFormer ، وإزالة الخلفية لفصل الملابس.
为了 تجنب الانحياز المكاني ، تم تحريك منطقة الملابس بشكل عشوائي داخل مربع الحدود ، وتم استخدام Qwen مرة أخرى لتصفية التصنيفات غير الموثوقة. هذا Produced صور ملابس اصطناعية متوافقة مع الحركة والهوية ، مما يسمح ببناء ثلاثيات كبيرة من بيانات فيديو غير منظم ، مع تحسين متانة عبر ظروف العالم الحقيقي المختلفة.
الهيكل
تم تقديم هيكل مزدوج الحوض لمواجهة الاندماج البطيء والتوازن الضعيف للمراقبة الذي لوحظ في الطرق السابقة التي حاولت دمج جميع الشروط. استفاد هذا النهج من متحول الاختلافات من Wan ، واعتمد أيضًا على مشروع VACE (انظر أدناه).
تم تقسيم النموذج إلى وحدة تحريك الإنسان (HAM) ، التي تتعامل مع الحركة والهوية من مدخلات الإنسان والوضع ؛ و وحدة نقل الملابس (GTM) ، التي تتعامل مع الملابس من صور الملابس. يشارك كلاهما في الوصول إلى العمود الفقري ، مع دمج الميزات بطريقة موزعة ومتسلسلة لتحسين الشروط.
تم إجراء التدريب عن طريق تجميد العمود الفقري وضبط معاملات HAM و GTM فقط ، مع توازن مساهماتهما خلال دمج الميزات. تم تحويل مدخلات مجموعة بيانات الثلاثية الاصطناعية إلى تمثيلات 潜 في الفضاء باستخدام محول WAN المتغير.
تم بناء السياق المتحرك من خلال دمج المعلومات البشرية والوضع عبر الوقت ، بينما تم معالجة ميزات الملابس بشكل منفصل ، وتم تسجيلها من خلال المشروع إلى تمثيلات التوكين.
تم تمديد النموذج أيضًا لدعم توليد الملابس. هنا ، تم دمج تمثيلات الملابس من ملابسين لإنشاء انتقالات سلسة ، مما يسمح بدمج متسق ومتسق بين عناصر الملابس ، دون تحسين إضافي.
البيانات والاختبارات
تم تدريب النموذج على 9135 مقطع فيديو ، بأطوال تتراوح من ثلاثة إلى عشرة ثوان ، تم الحصول عليها من مواقع التسوق المذكورة أعلاه ؛ مجموعة بيانات المؤلفين المولدة ؛ ومجموعة بيانات HumanVid.
من هذه ، تم إنشاء مجموعتين اختباريين: “مجموعة بيانات الإنترنت” ، التي تضم مقاطع فيديو وصور المنتجات من المولات؛ و جزء الاختبار الرسمي من مجموعة بيانات ViViD من Alibaba.
由于 مجموعة بيانات ViViD تفتقر إلى الوجوه (انظر المثال أعلاه ، وهو شائع جدًا في أدبيات تجربة الملابس الافتراضية) ، تمت إضافتها بواسطة Flux outpainting.
تم استخدام المعايير التالية: خسارة L1؛ نسبة الإشارة إلى الضوضاء البصرية (PSNR)؛ مؤشر التشابه الهيكلي (SSIM)؛ تشابه الصور المكتسبة (LPIPS)؛ مسافة الفريتش للانبثاق (FID)؛ و مسافة الفيديو الفريتش†† (FVD)
تم اختبار الأنظمة التالية لنقل الملابس: OOTDiffusion؛ CatVTON؛ OmniTry؛ و Any2AnyTryon. تم اختبار نماذج توليد الصور من الشخص إلى الصورة التالية: VisualCloze؛ MOSAIC؛ و UNO من ByteDance.
对于 المرحلة الثانية من تحريك الصور ، تم استخدام إطارات StableAnimator و DisPose.
كما تم اختبار VACE في سياق محدود (لأنها لا تدعم مباشرة الهدف) ، مع بعض الجهود لموازنة الوظيفية الناقصة:

مقارنة كمية مع مجموعات من نماذج الشخص إلى الصورة والتحريك على مجموعتي بيانات الإنترنت و ViViD ، حيث حقق الأسلوب المقترح أفضل أداء عبر جميع المعايير المعلنة. القيم المميزة تشير إلى أعلى درجة في كل عمود.
من بين النتائج الأولية المذكورة أعلاه ، يذكر المؤلفون ما يلي:
‘[نموذجنا] يحقق أفضل أداء عبر جميع المعايير عند مقارنته بمجموعات من نماذج الشخص إلى الصورة والتحريك. ‘
‘النتائج الكمية [الموضحة أدناه] تؤكد أيضًا أن我们的 نهج ينتج عنها تتبع وضع أكثر دقة ونقل ملابس ، مع الحفاظ على الهوية بصدق أكبر من جميع أسس الشخص إلى الصورة.’

مقارنة كمية على مجموعتي بيانات الإنترنت و ViViD مقابل أسس الشخص إلى الصورة والتحريك ، حيث يزعم المؤلفون أن أسلوبهم يقدم تتبع وضع أكثر دقة ونقل ملابس ، مع الحفاظ على الهوية بانتظام أكبر من VisualCloze و MOSAIC و UNO و VACE.
对于 الفئة الثانية من الاختبارات ، حيث تم اختبار مجموعات من تجربة الملابس الافتراضية بالصور والتحريك ، تمكن العمل الجديد من تحقيق أعلى درجة مرة أخرى:

مقارنة كمية مع مجموعات من نماذج تجربة الملابس الافتراضية بالصور والتحريك على مجموعتي بيانات الإنترنت و ViViD. حقق الأسلوب المقترح أفضل أداء عام عبر المعايير ، مع بقاء SSIM مشابهًا لأقوى أساس مقارن. القيم المميزة تشير إلى أعلى درجة.
يضيف المؤلفون:
‘المقارنات الكمية [الموضحة أدناه] تظهر أيضًا أن نتائجنا تشبه أكثر الواقع من بين جميع أسس تجربة الملابس الافتراضية بالصور.’

اختبارات كمية باستخدام أسس مقترنة من نماذج تجربة الملابس الافتراضية بالصور والتحريك.
الخلاصة
على الرغم من تحقيق مشروع Vanast حلًا من النهاية إلى النهاية منفصلاً ، فإن نقص الورقة في التفاصيل حول متطلبات الموارد التدريبية والاستدلال يشير إلى أن هذا قد لا يكون هو الحل الأكثر مرونة أو سرعة. في الحقيقة ، المهمة نفسها صعبة بشكل فادح لتحقيقها حتى في نظام غير محسّن – وأكثر من ذلك في تطبيق تجاري يحتاج إلى انخفاض في الوقت الفعلي ومدى ربحية التكلفة على نطاق واسع..؟
تجربة الملابس الافتراضية هي واحدة من أهداف الذكاء الاصطناعي “الطموح” التي يخفي فيها الحالة الحالية للتكنولوجيا ، كما يتم نشرها من خلال العناوين والنتائج المحددة ، صعوبة المهمة ، والتي قد يتم حلها في النهاية بواسطة تقنيات لاحقة وأخف من المتحولات.
† متاح في الولايات المتحدة ، محظور في العديد من المناطق الأخرى ، إن لم يكن جميعها.
†† يشير المؤلفون إلى ‘VFID’ ، ولكنهم يركنون فقط إلى ورقة ViViD ، والتي لا تبرر الإشارة ، على ما أستطيع أن أتبين ، مع وقت محدود لمتابعتها. افترضت أنهم يعنون في الواقع مسافة الفيديو الفريتش (FVD) ، وكانوا أيضًا قصيري الأجل. يرجى الاتصال بي لتقديم التعديلات حسب الضرورة.
نشر لأول مرة يوم الأربعاء ، 8 أبريل 2026












