Anderson का एंगल
वर्चुअल ट्राई-ऑन ऑफ न्यू क्लॉथ्स थ्रू एआई

एक एआई मॉडल अब एक फोटो और कपड़ों की छवियों को एक व्यक्ति के नए आउटफिट पहनने का एक चलता हुआ वीडियो बना सकता है, जो पुराने दो-चरण प्रणालियों में आम तौर पर पाए जाने वाले ग्लिट्चेस से बचता है।
कंप्यूटर विजन रिसर्च में ‘‘वर्चुअल ट्राई-ऑन’ (वीटीओएन)‘ श्रेणी सबसे अधिक वित्तपोषित और सबसे अधिक उत्पादक पीछा में से एक है – मुख्य रूप से इसलिए कि यह उद्योग/शैक्षणिक सहयोग प्रकाशित हर साल से पता चलता है, यह लक्ष्य अच्छी तरह से वित्तपोषित फैशन उद्योग से महत्वपूर्ण वित्तपोषण प्राप्त करता है:

पेपर ‘इमेज-आधारित वर्चुअल ट्राई-ऑन: एक सर्वेक्षण’ से व्यक्ति प्रतिनिधित्व प्रकार के उदाहरण, और कुछ फिल्टरिंग और रिफाइनिंग चरण जो यहां तक कि बुनियादी छवियों को भी वर्चुअल ट्राई-ऑन (वीटीओएन) के लिए गुजरना होगा। स्रोत
इस लक्ष्य के कई संस्करण हैं, जैसे कि लोगों की छवियों से कपड़े निकालना, और जब आवश्यक हो तो अधिक भरे हुए आकार को समायोजित करना। कुछ इमेज-आधारित सिस्टम व्यावसायिक रूप से वीसुअल.एआई, वैना.फैशन, और फैशएन.एआई जैसे प्लेटफार्मों पर लागू किए गए हैं।
वीडियो के लिए, गूगल लैब्स के प्रयोगात्मक डोप्पल ऐप ने इस कार्यक्षमता के साथ प्रयोग किया, जो पिछली गर्मियों में लॉन्च हुआ था:
वीडियो ऑटोप्ले नहीं हो रहा है तो कृपया खेलने के लिए क्लिक करें। गूगल डोप्पल वीडियो ट्राई-ऑन प्रोजेक्ट के छोड़े गए स्निपेट। स्रोत
हालांकि, डोप्पल अप्रैल 2026 में बंद हो जाता है एक ठंडा स्वागत के बाद, जिसमें दर्शकों को कंपनी की छवि-केवल ट्राई-ऑन सेवा† में भेज दिया जाता है:

गूगल का छवि-केवल ट्राई-ऑन प्रोग्राम, जहां उपयोगकर्ताओं को कंपनी के छोड़े गए डोप्पल प्लेटफॉर्म से भेजा जाता है। स्रोत
हालांकि वीडियो के साथ वर्चुअल ट्राई-ऑन प्रदान करने वाले कुछ प्लेटफॉर्म हैं, उनमें से कोई भी वास्तविक आउटलेट से संबद्ध नहीं लगता है; और वे सभी ‘ब्लीडिंग एज’, हाशिए पर (और अक्सर ‘संदेहास्पद’) टोकन-टाउटिंग उत्पाद हैं।
जबकि शोध क्षेत्र से कई दिलचस्प प्रयास हैं, वे पारंपरिक रूप से जटिल वास्तुकला हैं जो कम विलंबता और उच्च गुणवत्ता के लिए कार्यान्वित करना मुश्किल है:
वीडियो ऑटोप्ले नहीं हो रहा है तो कृपया खेलने के लिए क्लिक करें। 2024 फैशन-वीडीएम प्रोजेक्ट से ‘हेडलेस’ कपड़ों के हस्तांतरण का एक उदाहरण। स्रोत
सच्चाई यह है कि कपड़ों को एक वास्तविक व्यक्ति के अनुरूप बनाने का कार्य, जिसमें न तो कपड़े और न ही व्यक्ति विकृत हों, और साथ ही कुछ उपयोगी प्रदर्शनी गति (जो उत्पाद के पीछे को सटीक रूप से दिखाता है जब व्यक्ति अपनी पीठ घुमाता है), वर्तमान राज्य के लिए एक कठिन चुनौती है कला…
वनास्ट
यह एक चुनौती है जिसे कोरिया से एक नई पेपर द्वारा हल करने का प्रयास किया जा रहा है, जो कपड़े, व्यक्ति और गति को पार्स करने के लिए एक नई और पूरी तरह से एकीकृत समाधान का उपयोग कर रहा है:
वीडियो ऑटोप्ले नहीं हो रहा है तो कृपया खेलने के लिए क्लिक करें। वनास्ट प्रोजेक्ट की सहायक सामग्री साइट से उदाहरण। स्रोत
नया सिस्टम, जिसे वनास्ट कहा जाता है, एक कस्टम-निर्मित डेटासेट का लाभ उठाता है जिसमें तीनों कारकों को शामिल किया जाता है जो कार्य को पूरा करने के लिए आवश्यक हैं: कपड़े; व्यक्ति; और गति:
क्लिक करें और चलाएं। वनास्ट प्रोजेक्ट साइट से और उदाहरण।
सिस्टम फ्लक्स, क्वेन, और चैटजीपीटी जैसे विविध फ्रेमवर्क का लाभ उठाता है ताकि एक ‘ट्रिपल’ डेटासेट तैयार किया जा सके जो एक एंड-टू-एंड आर्किटेक्चर को सूचित कर सके:

नई पेपर से, डेटासेट डेटा बिंदु के उदाहरण जो पीढ़ी और प्रशिक्षण के लिए उपयोग किए जाते हैं। स्रोत –
नई पेपर का शीर्षक वनास्ट: वर्चुअल ट्राई-ऑन मानव छवि एनिमेशन के माध्यम से सिंथेटिक ट्रिपल पर्यवेक्षण है, और यह सियोल नेशनल यूनिवर्सिटी के चार शोधकर्ताओं से है। एक वीडियो से भरा प्रोजेक्ट साइट भी है।
विधि
लेखकों का इस कार्य में उल्लिखित उद्देश्य तीनों पहले उल्लिखित पहलुओं को एक ही चरण में एकीकृत करना है – न केवल इसलिए कि प्रक्रिया विविध होगी, बल्कि इसलिए भी कि यह विभिन्न पहलुओं को प्रशिक्षण के दौरान अधिक अवसर प्रदान करता है ताकि वे एक दूसरे के साथ जुड़ सकें और एक अधिक सुसंगत पीढ़ी के लिए एक दृष्टिकोण के साथ बातचीत कर सकें:

वनास्ट एक मानव फोटो, अलग-अलग कपड़ों की छवियों, और एक गति संदर्भ को एक चलती हुई क्रम में जोड़ता है जिसमें वही व्यक्ति नए आउटफिट पहनता है, पोज़ मार्गदर्शन के साथ स्थिर गति सुनिश्चित करता है, जबकि पहचान और कपड़ों के विवरण फ्रेमों में संरक्षित रहते हैं।
इसे प्राप्त करने के लिए, सिस्टम लक्ष्य कपड़ों की छवियों को लेता है; एक फोटो जिसमें व्यक्ति अलग-अलग कपड़े पहने हुए है; एक गति संदर्भ वीडियो जो परिभाषित करता है कि व्यक्ति को कैसे चलना चाहिए; और एक पाठ प्रॉम्प्ट जो क्रिया और सेटिंग का वर्णन करता है; और एक पूर्ण वीडियो अनुक्रम का उत्पादन करता है जिसमें वही व्यक्ति नए आउटफिट पहनता हुआ दिखाई देता है, जबकि लगाए गए गति का पालन करता है, प्रत्येक फ्रेम समय के साथ दृश्य रूप से सुसंगत रहता है。
पुराने कार्यों में अधिकांश के विपरीत, जिनमें ड्रेसिंग और एनिमेशन को अलग-अलग चरणों में विभाजित किया गया था, वनास्ट एक ही प्रक्रिया में कपड़े, पहचान, और गति को एक साथ संभालता है, जिससे इन तत्वों को पीढ़ी के दौरान बातचीत करने की अनुमति मिलती है, और उन प्रकार के मेल और अस्थिरता को कम करता है जो पहले के तरीकों में दिखाई देते थे।
डेटासेट
प्रोजेक्ट के लिए प्रशिक्षण एक जोड़ीदार उदाहरणों पर आधारित है जिसमें एक व्यक्ति छवि, संबंधित कपड़ों के आइटम, और एक वीडियो शामिल है जिसमें व्यक्ति उन कपड़ों को पहने हुए चलता है, जिसमें एक पिछले आर्किटेक्चर का उपयोग करके गति निकाली जाती है, ताकि फ्रेमों में स्थिर पोज़-मार्गदर्शन प्रदान किया जा सके。
एक सार्वजनिक रूप से उपलब्ध डेटासेट की अनुपस्थिति में, जो परियोजना की आवश्यकताओं को पूरा करता है, डेटा को (अनिर्दिष्ट) ऑनलाइन शॉपिंग प्लेटफार्मों से स्क्रैप किया गया था, जो विविध कपड़ों वाले वीडियो का एक कैश प्रदान करता था। हालांकि, कार्य के लिए वीडियो की आवश्यकता थी जिसमें एक ही व्यक्ति बहुत सारे आउटफिट पहने हुए हों, जो जंगली डेटा में एक दुर्लभ खोज है, और जिसने सिंथेटिक डेटा बनाने की आवश्यकता को जन्म दिया।
तीन-चरण प्रक्रिया में उपयुक्त उम्मीदवार फ्रेम का चयन शामिल था जो स्क्रैप किए गए वीडियो से, क्वेन2.5-वीएल विजन-लैंग्वेज मॉडल (वीएलएम) के माध्यम से, और उपयुक्त फसली और मूल्यांकन की सुविधा (अर्थात, कोई अवरोध नहीं, विषय सही स्थिति में, आदि); और उपयुक्त इनपेंटिंग मास्क बनाने के लिए जो प्रभावित क्षेत्रों को अलग करते हैं – जो (पिछले कार्य पेरस के अनुसार) एसडीएक्सएल डिफ्यूजन मॉडल द्वारा संभाला जाता है।

वनास्ट पाइपलाइन का अवलोकन, जहां एक मानव छवि, लक्ष्य गारमेंट छवियों और एक गति मार्गदर्शन वीडियो को एक एकीकृत वीडियो डिफ्यूजन मॉडल में संसाधित किया जाता है। सिस्टम एक एनिमेशन उत्पन्न करता है जो पहचान को संरक्षित करता है, पोज़ अनुक्रम का पालन करता है, और लक्ष्य गारमेंट लागू करता है, जबकि सिंथेटिक ट्रिपल पीढ़ी प्रशिक्षण का समर्थन करता है, और एक डुअल-मॉड्यूल डिज़ाइन एनिमेशन को गारमेंट ट्रांसफर से अलग करता है ताकि सुसंगतता बनी रहे।
तीसरे चरण में, क्वेन फिर से ड्यूटी पर आता है ताकि छवियों को लिंग के अनुसार वर्गीकृत किया जा सके, और लोकप्रिय फ्लक्स इमेज डिफ्यूजन फ्रेमवर्क का उपयोग तब किया जाता है ताकि एक छवि में कपड़ों में परिवर्तन किया जा सके (क्योंकि फ्लक्स एक से अधिक इनपुट तत्वों को एकत्र करने में सक्षम है)। इनपेंटिंग टेक्स्ट प्रॉम्प्ट चैटजीपीटी (संस्करण अनिर्दिष्ट) द्वारा क्यूरेट किए गए थे।
पोज़ और पृष्ठभूमि विविधता को और बढ़ाने के लिए, एक पाइपलाइन पेश की गई थी जो वाइल्ड वीडियो से प्रशिक्षण ट्रिपल का निर्माण करती थी, ह्यूमनविड डेटासेट का उपयोग करते हुए। उसी प्रक्रिया का उपयोग पहचान-संरक्षित मानव छवि को उत्पन्न करने के लिए किया गया था।
चूंकि इन वीडियो में कोई स्टैंडअलोन गारमेंट छवि नहीं थी, गारमेंट छवियों को सीधे फुटेज से सिंथेटिक रूप से बनाया गया था। प्रत्येक वीडियो से फ्रेम नमूने लिए गए, और क्वेन का उपयोग करके उन्हें फ्रंटल दृश्यता के लिए स्कोर किया गया, जिसके बाद सबसे उपयुक्त उम्मीदवार का चयन पूर्ण-शरीर दृश्यता, छवि स्पष्टता, न्यूनतम अवरोध, प्रकाश गुणवत्ता, और समग्र संरचना के आधार पर किया गया।
एक ऊपरी कपड़ों का क्षेत्र सेगफॉर्मर का उपयोग करके निकाला गया था, और पृष्ठभूमि को हटा दिया गया ताकि गारमेंट को अलग किया जा सके।
स्थितीय पूर्वाग्रह से बचने के लिए, गारमेंट क्षेत्र को यादृच्छिक रूप से अपने बाउंडिंग बॉक्स के भीतर स्थानांतरित किया गया था, और क्वेन का उपयोग अस्थिर खंडों को फिल्टर करने के लिए किया गया था। इस प्रक्रिया ने सिंथेटिक गारमेंट छवियों को गति और पहचान के साथ जोड़ा, जिससे असंरचित वीडियो डेटा से बड़े पैमाने पर ट्रिपल निर्माण संभव हुआ, जबकि विभिन्न वास्तविक दुनिया की स्थितियों में लचीलापन में सुधार हुआ।
वास्तुकला
एक दोहरी मॉड्यूल वास्तुकला पेश की गई थी ताकि उन पिछले तरीकों में देखी गई धीमी संगमन और कमजोर नियंत्रण संतुलन को संबोधित किया जा सके। दृष्टिकोण ने वान से टेक्स्ट-टू-वीडियो डिफ्यूजन ट्रांसफॉर्मर का लाभ उठाया, और वीएसीई प्रोजेक्ट (नीचे देखें) पर भी आकर्षित किया।
मॉडल को मानव एनिमेशन मॉड्यूल (एचएएम) में विभाजित किया गया था, जो मानव और पोज़ इनपुट से गति और पहचान को संभालता था; और गारमेंट ट्रांसफर मॉड्यूल (जीटीएम) में जो गारमेंट छवियों से कपड़ों को संभालता था। दोनों ने बैकबोन तक पहुंच साझा की, जबकि वितरित, कैस्केडिंग तरीके से विशेषताओं को एकीकृत किया, जिससे स्थिति में सुधार हुआ।
प्रशिक्षण बैकबोन को फ्रीज करके और केवल एचएएम और जीटीएम पैरामीटर को अनुकूलित करके किया गया था, उनके योगदानों को फीचर एकीकरण के दौरान संतुलित किया गया था। सिंथेटिक ट्रिपल डेटासेट से इनपुट वैन के वैरिएशनल ऑटोएनकोडर (वीएई) का उपयोग करके लेटेंट प्रतिनिधित्व में परिवर्तित किए गए थे।
मोशन-जागरूक संदर्भ को मानव और पोज़ जानकारी को समय के साथ मिलाकर बनाया गया था, जबकि गारमेंट विशेषताओं को अलग से संसाधित किया गया था, और टोकन एम्बेडिंग में प्रोजेक्शन के माध्यम से संरेखित किया गया था।
मॉडल को गारमेंट इंटरपोलेशन का समर्थन करने के लिए भी विस्तारित किया गया था। यहां, दो गारमेंट के प्रतिनिधित्व को मिलाकर चिकनी संक्रमण उत्पन्न किया जा सकता है, जिससे कपड़ों के आइटम के बीच सुसंगत और सुसंगत मिश्रण संभव हो जाता है, बिना किसी अतिरिक्त अनुकूलन के।
डेटा और परीक्षण
मॉडल को 9,135 वीडियो पर प्रशिक्षित किया गया था, जिनकी लंबाई तीन से दस सेकंड तक भिन्न थी, जो उपरोक्त ‘शॉपिंग मॉल साइट्स’; लेखकों के अपने उत्पन्न डेटासेट; और ह्यूमनविड डेटासेट से स्रोत थे।
इनसे दो मूल्यांकन डेटासेट स्थापित किए गए थे: ‘इंटरनेट डेटासेट’, जिसमें मॉल से वीडियो और उत्पाद छवियां शामिल थीं; और अलीबाबा के आधिकारिक परीक्षण विभाजन विविड डेटासेट।
चूंकि विविड डेटा में चेहरे नहीं हैं (ऊपर दिए गए वीडियो को देखें, जो वर्चुअल ट्राई-ऑन साहित्य में बहुत आम है), उन्हें फ्लक्स आउटपेंटिंग के माध्यम से जोड़ा गया था।
इस्तेमाल किए गए मेट्रिक्स में एल1 हानि; पीक सिग्नल-टू-नॉइज़ रेशियो (पीएसएनआर); संरचनात्मक समानता सूचकांक (एसएसआईएम); सीखा हुआ संवेदी छवि पैच समानता (एलपीआईपीएस); फ्रेचेट इन्सेप्शन दूरी (एफआईडी); और फ्रेचेट वीडियो दूरी†† (एफवीडी) शामिल थे।
परीक्षण किए गए गारमेंट ट्रांसफर सिस्टम में ओओटीडिफ्यूजन; कैटवीटीओएन; ओम्नीट्राई; और एनीटूएनीट्राई शामिल थे। विषय-से-छवि पीढ़ी मॉडल जो परीक्षण किए गए थे उनमें विजुअलक्लोज; मोज़ेक; और बाइटडांस का यूएनओ शामिल था।
दूसरे चरण के मानव छवि एनिमेशन के लिए, स्टेबल एनिमेटर और डिसपोज फ्रेमवर्क का उपयोग किया गया था।
एक अधिक सीमित संदर्भ में (क्योंकि यह सीधे तौर पर उद्देश्य का समर्थन नहीं करता है), वीएसीई का भी परीक्षण किया गया था, जिसमें कुछ प्रयास किए गए थे ताकि लापता कार्यक्षमता को संतुलित किया जा सके:

इंटरनेट और विविड डेटासेट पर विषय-से-छवि और एनिमेशन मॉडल के संयोजन के खिलाफ मात्रात्मक तुलना, जहां प्रस्तावित विधि सभी रिपोर्ट किए गए मेट्रिक्स में सर्वश्रेष्ठ प्रदर्शन हासिल करती है। बोल्ड मान प्रत्येक कॉलम में शीर्ष स्कोर को इंगित करते हैं।
लेखकों का कहना है:
‘[हमारा] मॉडल सभी मेट्रिक्स में विषय-से-छवि पीढ़ी मॉडल और एनिमेशन मॉडल के संयोजन के साथ तुलना में सर्वश्रेष्ठ प्रदर्शन हासिल करता है। ‘
‘गुणात्मक परिणाम [नीचे दिखाए गए] आगे से पुष्टि करते हैं कि हमारा दृष्टिकोण सबसे सटीक पोज़ अनुसरण और गारमेंट ट्रांसफर का उत्पादन करता है, जबकि पहचान को अधिक विश्वासपूर्वक बनाए रखता है सभी विषय-से-छवि-आधारित बेसलाइन की तुलना में।’

इंटरनेट और विविड डेटासेट पर विषय-से-छवि और एनिमेशन बेसलाइन के खिलाफ गुणात्मक तुलना, जहां प्रस्तावित विधि का दावा है कि यह अधिक सटीक पोज़ संरेखण और गारमेंट ट्रांसफर प्रदान करती है, जबकि पहचान को अधिक सुसंगत रूप से संरक्षित करती है विजुअलक्लोज, मोज़ेक, यूएनओ, और वीएसीई की तुलना में।
दूसरी श्रेणी के परीक्षणों के लिए, जहां छवि वर्चुअल ट्राई-ऑन और एनिमेशन मॉडल के संयोजन का परीक्षण किया गया था, नई कार्य फिर से सर्वश्रेष्ठ स्कोर हासिल करने में सक्षम थी:

इंटरनेट और विविड डेटासेट पर छवि-आधारित वर्चुअल ट्राई-ऑन और एनिमेशन मॉडल के संयोजन के खिलाफ मात्रात्मक तुलना, जहां प्रस्तावित विधि सभी मेट्रिक्स में सर्वश्रेष्ठ समग्र प्रदर्शन हासिल करती है, जबकि एसएसआईएम सबसे मजबूत बेसलाइन के साथ तुलनात्मक रहती है। बोल्ड मान सबसे उच्च स्कोर को इंगित करते हैं।
लेखकों का कहना है:
‘गुणात्मक तुलना [नीचे दिखाई गई] यह प्रदर्शित करती है कि हमारे परिणाम ग्राउंड ट्रुथ के सबसे करीब हैं सभी छवि वर्चुअल ट्राई-ऑन-आधारित बेसलाइन में।’

छवि वर्चुअल ट्राई-ऑन मॉडल के साथ वीटीओएन मॉडल के संयोजन का उपयोग करके गुणात्मक परीक्षण।
निष्कर्ष
हालांकि वनास्ट प्रोजेक्ट एक विविध एंड-टू-एंड समाधान प्राप्त करता है, पेपर में प्रशिक्षण और अनुमान संसाधन आवश्यकताओं के बारे में विवरण की कमी इंगित करती है कि यह समाधान सबसे अधिक लचीला या चपलता से नहीं हो सकता है। वास्तव में, चुनौती स्वयं एक गैर-ऑप्टिमाइज्ड सिस्टम में भी प्राप्त करने के लिए अत्यधिक कठिन है – और कितना अधिक एक व्यावसायिक तैनाती में जो कम विलंबता और पैमाने पर लागत प्रभावशीलता / आरओआई की आवश्यकता होगी..?
वर्चुअल ट्राई-ऑन एक ऐसा ‘मूनशॉट’ एआई लक्ष्य है जहां वर्तमान राज्य, जैसा कि विभिन्न हेडलाइंस और चेरी चुने गए परिणामों के माध्यम से प्रसारित किया जाता है, कार्य की वास्तविक कठिनाई को छुपाता है, जो शायद बाद में और हल्के प्रौद्योगिकियों द्वारा हल किया जाएगा ट्रांसफॉर्मर से।
† संयुक्त राज्य अमेरिका में उपलब्ध, कई अन्य क्षेत्रों में जियो-ब्लॉक किया गया, यदि सभी में नहीं।
†† लेखक ‘वीएफआईडी’ का उल्लेख करते हैं, लेकिन केवल विविड पेपर के लिए लिंक करते हैं, जो मेरे अनुसार, सीमित समय के साथ इस संदर्भ को सही ठहराने में असमर्थ है। मैंने माना है कि वे वास्तव में फ्रेचेट वीडियो दूरी (एफवीडी) का मतलब थे, और वे भी समय की कमी के कारण थे। कृपया संशोधनों के लिए मुझसे संपर्क करें, यदि आवश्यक हो।
पहली बार बुधवार, 8 अप्रैल, 2026 को प्रकाशित।












