Anderson का एंगल

चेहरे की आकर्षण भविष्यवाणी का अनुमान लाइवस्ट्रीम के लिए

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
Image by ChatGPT, with superimposed image from the paper https://arxiv.org/pdf/2501.02509

अब तक, चेहरे की आकर्षण भविष्यवाणी (FAP) मुख्य रूप से मनोवैज्ञानिक अनुसंधान, सौंदर्य और सौंदर्य उत्पादों के उद्योग, और सौंदर्य सर्जरी के संदर्भ में अध्ययन की गई है। यह एक चुनौतीपूर्ण क्षेत्र है, क्योंकि सौंदर्य के मानक राष्ट्रीय की तुलना में वैश्विक नहीं होते हैं।

इसका मतलब है कि कोई एक प्रभावी AI-आधारित डेटासेट व्यवहारिक नहीं है, क्योंकि सभी संस्कृतियों से चेहरों/रेटिंग्स के नमूनों से प्राप्त माध्य मूल्य बहुत पूर्वाग्रहित होंगे (जहां अधिक आबादी वाले देशों को अतिरिक्त ट्रैक्शन मिलेगा), या किसी भी संस्कृति के लिए लागू नहीं होगा (जहां कई नस्लों/रेटिंग्स के माध्य मूल्य वास्तव में किसी भी नस्ल के बराबर होंगे)।

इसके बजाय, चुनौती यह है कि देश या संस्कृति-विशिष्ट डेटा को संसाधित करने के लिए संकल्पनात्मक विधियों और कार्यप्रवाह विकसित करने की आवश्यकता है, जिससे प्रभावी प्रति-क्षेत्र FAP मॉडल विकसित किए जा सकें।

FAP के लिए सौंदर्य और मनोवैज्ञानिक अनुसंधान में उपयोग के मामले बहुत ही सीमित हैं; इसलिए, अधिकांश डेटासेट जो अब तक तैयार किए गए हैं, उनमें केवल सीमित डेटा है, या उन्हें प्रकाशित नहीं किया गया है।

ऑनलाइन आकर्षण पूर्वानुमान की आसान उपलब्धता, जो मुख्य रूप से पश्चिमी दर्शकों के लिए लक्षित है, आवश्यक रूप से FAP में राज्य की कला का प्रतिनिधित्व नहीं करती है, जो वर्तमान में पूर्वी एशियाई अनुसंधान (मुख्य रूप से चीन) द्वारा प्रभुत्व है, और संबंधित पूर्वी एशियाई डेटासेट।

2020 के पेपर 'एशियन फीमेल फेशियल ब्यूटी प्रेडिक्शन यूजिंग डीप न्यूरल नेटवर्क्स विया ट्रांसफर लर्निंग एंड मल्टी-चैनल फीचर फ्यूजन' से डेटासेट के उदाहरण। स्रोत: https://www.semanticscholar.org/paper/Asian-Female-Facial-Beauty-Prediction-Using-Deep-Zhai-Huang/59776a6fb0642de5338a3dd9bac112194906bf30

2020 के पेपर ‘एशियन फीमेल फेशियल ब्यूटी प्रेडिक्शन यूजिंग डीप न्यूरल नेटवर्क्स विया ट्रांसफर लर्निंग एंड मल्टी-चैनल फीचर फ्यूजन’ से डेटासेट के उदाहरण। स्रोत: https://www.semanticscholar.org/paper/Asian-Female-Facial-Beauty-Prediction-Using-Deep-Zhai-Huang/59776a6fb0642de5338a3dd9bac112194906bf30

सौंदर्य अनुमान के लिए व्यापक व्यावसायिक उपयोग में ऑनलाइन डेटिंग ऐप और जनरेटिव एआई सिस्टम शामिल हैं जो वास्तविक अवतार छवियों को सुंदर बनाने के लिए डिज़ाइन किए गए हैं (क्योंकि ऐसे अनुप्रयोगों के लिए एक मानक सौंदर्य की आवश्यकता होती है)।

चेहरे का चित्रण

आकर्षक व्यक्ति विज्ञापन और प्रभाव निर्माण में एक मूल्यवान संपत्ति बने हुए हैं, जो इन क्षेत्रों में वित्तीय प्रोत्साहन प्रदान करते हैं और FAP डेटासेट और फ्रेमवर्क को आगे बढ़ाने का अवसर प्रदान करते हैं।

उदाहरण के लिए, वास्तविक दुनिया के डेटा के साथ प्रशिक्षित एक AI मॉडल जो चेहरे की सुंदरता का मूल्यांकन और रेटिंग कर सकता है, संभावित रूप से विज्ञापन प्रभाव के लिए उच्च संभावना वाली घटनाओं या व्यक्तियों की पहचान कर सकता है। यह क्षमता लाइव वीडियो स्ट्रीमिंग संदर्भों में विशेष रूप से प्रासंगिक होगी, जहां मेट्रिक्स जैसे ‘फॉलोअर्स’ और ‘लाइक्स’ वर्तमान में केवल एक व्यक्ति (या यहां तक कि एक चेहरे के प्रकार) की दर्शकों को आकर्षित करने की क्षमता के संकेतक के रूप में कार्य करते हैं।

यह एक सतही मापदंड है, और आवाज, प्रस्तुति और दृष्टिकोण भी दर्शकों को आकर्षित करने में महत्वपूर्ण भूमिका निभाते हैं। इसलिए, FAP डेटासेट का संकलन मानव निरीक्षण की आवश्यकता है, साथ ही साथ चेहरे की सुंदरता और ‘स्पेसियस’ सुंदरता (जिसके बिना एलेक्स जोन्स जैसे आउट-ऑफ-डोमेन प्रभावित लोग FAP के लिए डिज़ाइन किए गए संग्रह के लिए FAP कर्व को प्रभावित कर सकते हैं) के बीच अंतर करने की क्षमता भी है।

लाइवब्यूटी

FAP डेटासेट की कमी को दूर करने के लिए, चीन के शोधकर्ता पहला बड़े पैमाने पर FAP डेटासेट प्रदान कर रहे हैं, जिसमें 100,000 चेहरे की छवियां और 200,000 मानव अनोटेशन शामिल हैं जो चेहरे की सुंदरता का अनुमान लगाते हैं।

नई लाइवब्यूटी डेटासेट से नमूने। स्रोत: https://arxiv.org/pdf/2501.02509

नई लाइवब्यूटी डेटासेट से नमूने। स्रोत: https://arxiv.org/pdf/2501.02509

लाइवब्यूटी नामक इस डेटासेट में 10,000 अलग-अलग पहचानें हैं, सभी मार्च 2024 में (अनिर्दिष्ट) लाइव स्ट्रीमिंग प्लेटफ़ॉर्म से कब्जा की गई हैं।

लेखक एक नए मल्टी-मॉडल FAP विधि की भी प्रस्तुति करते हैं, जिसे FPEM कहा जाता है। FPEM होलिस्टिक चेहरे की पूर्व ज्ञान और मल्टी-मॉडल सौंदर्य सेमांटिक विशेषताओं को एक व्यक्तिगत आकर्षण पूर्व मॉड्यूल (PAPM), एक मल्टी-मॉडल आकर्षण एनकोडर मॉड्यूल (MAEM), और एक क्रॉस-मॉडल फ्यूजन मॉड्यूल (CMFM) के माध्यम से एकीकृत करता है।

पेपर में यह दावा किया जाता है कि FPEM नए लाइवब्यूटी डेटासेट और अन्य FAP डेटासेट पर राज्य की कला प्रदर्शन प्राप्त करता है। लेखकों का उल्लेख है कि शोध के लाइव स्ट्रीमिंग में वीडियो गुणवत्ता में सुधार, सामग्री अनुशंसा, और चेहरे की रीटचिंग के लिए संभावित अनुप्रयोग हैं।

लेखक यह भी वादा करते हैं कि वे जल्द ही डेटासेट उपलब्ध कराएंगे – हालांकि यह स्वीकार किया जाना चाहिए कि स्रोत डोमेन में निहित लाइसेंस प्रतिबंध अधिकांश लागू परियोजनाओं पर लागू होने की संभावना है जो इस काम का उपयोग कर सकते हैं।

नई पेपर का शीर्षक लाइव स्ट्रीमिंग में चेहरे की आकर्षण भविष्यवाणी: एक नया बेंचमार्क और मल्टी-मॉडल विधि है, और यह अलीबाबा ग्रुप और शंघाई जियाओ टोंग विश्वविद्यालय के दस शोधकर्ताओं से आता है।

विधि और डेटा

प्रत्येक 10-घंटे के प्रसारण से शोधकर्ताओं ने पहले तीन घंटों के लिए प्रति घंटे एक छवि को चुना। उच्चतम पेज दृश्यों वाले प्रसारण चुने गए।

एकत्रित डेटा को तब कई पूर्व-प्रसंस्करण चरणों के अधीन किया गया। पहला चरण चेहरे क्षेत्र आकार माप है, जो 2018 के CPU-आधारित फेसबॉक्स डिटेक्शन मॉडल का उपयोग करके चेहरे की रेखाओं के चारों ओर एक बाउंडिंग बॉक्स उत्पन्न करता है। पाइपलाइन यह सुनिश्चित करती है कि बाउंडिंग बॉक्स की छोटी तरफ 90 पिक्सेल से अधिक है, जो छोटे या अस्पष्ट चेहरे क्षेत्रों को फिल्टर करने में मदद करती है।

दूसरा चरण धुंधलापन का पता लगाना है, जो चेहरे के क्षेत्र पर लागू किया जाता है और धुंधलापन का पता लगाने के लिए लैप्लासियन ऑपरेटर के विचलन का उपयोग करता है। यह विचलन 10 से अधिक होना चाहिए, जो धुंधली छवियों को फिल्टर करने में मदद करता है।

तीसरा चरण चेहरे की मुद्रा अनुमान है, जो 2021 के 3DDFA-V2 मुद्रा अनुमान मॉडल का उपयोग करता है:

3DDFA-V2 अनुमान मॉडल से उदाहरण। स्रोत: https://arxiv.org/pdf/2009.09960

3DDFA-V2 अनुमान मॉडल से उदाहरण। स्रोत: https://arxiv.org/pdf/2009.09960

यहां कार्यप्रवाह यह सुनिश्चित करता है कि काटी हुई छवि का पिच कोण 20 डिग्री से अधिक नहीं है, और याव कोण 15 डिग्री से अधिक नहीं है, जो अत्यधिक मुद्रा वाले चेहरों को बाहर कर देता है।

चौथा चरण चेहरे के अनुपात का मूल्यांकन है, जो 3DDFA-V2 मॉडल की सेगमेंटेशन क्षमताओं का भी उपयोग करता है, यह सुनिश्चित करता है कि काटी हुई चेहरे का क्षेत्र छवि के 60% से अधिक है, जो छवियों को बाहर कर देता है जहां चेहरा प्रमुख नहीं है।

अंत में, पांचवां चरण डुप्लिकेट चरित्र हटाना है, जो एक (अनिर्दिष्ट) राज्य के साथ एक फेस रिकग्निशन मॉडल का उपयोग करता है, जो तीन छवियों में से एक ही पहचान को हटा देता है जो 10 घंटे के वीडियो के लिए एकत्र की जाती हैं।

मानव मूल्यांकन और अनोटेशन

बीस अनोटेटरों को भर्ती किया गया, जिनमें छह पुरुष और 14 महिलाएं शामिल थीं, जो लाइव प्लेटफ़ॉर्म के जनसांख्यिकी को दर्शाती हैं।

मूल्यांकन 200 सत्रों में विभाजित किया गया था, प्रत्येक में 50 छवियां थीं। विषयों को 1-5 के स्कोर पर नमूनों की चेहरे की आकर्षण का मूल्यांकन करने के लिए कहा गया था, प्रत्येक सत्र के बीच पांच मिनट का ब्रेक लागू किया गया था, और सभी विषयों ने सभी सत्रों में भाग लिया।

इस प्रकार, 10,000 छवियों का मूल्यांकन बीस मानव विषयों द्वारा किया गया, जिससे 200,000 अनोटेशन प्राप्त हुए।

विश्लेषण और पूर्व-प्रसंस्करण

पहले, विषय पोस्ट-स्क्रीनिंग आउटलियर अनुपात और स्पीयरमैन के रैंक ऑर्डर संबंध सांख्यिकी (SROCC) का उपयोग करके की गई थी। जिन विषयों की रेटिंग में SROCC 0.75 से कम या आउटलियर अनुपात 2% से अधिक था, उन्हें अविश्वसनीय माना जाता था और हटा दिया गया था, जिससे अंततः 20 विषय प्राप्त हुए।

फिर, प्रत्येक चेहरे की छवि के लिए एक मीन ओपिनियन स्कोर (MOS) की गणना की गई, जो वैध विषयों द्वारा प्राप्त स्कोर को औसत करके की गई। MOS प्रत्येक छवि के लिए आकर्षण का मूल भूमि सत्य लेबल के रूप में कार्य करता है, और स्कोर की गणना प्रत्येक वैध विषय से प्राप्त सभी व्यक्तिगत स्कोर को औसत करके की जाती है।

अंत में, सभी नमूनों के लिए MOS वितरण का विश्लेषण, साथ ही महिला और पुरुष नमूनों के लिए, यह दर्शाता है कि वे गाउसियन-शैली के आकार को प्रदर्शित करते हैं, जो वास्तविक दुनिया के चेहरे की आकर्षण वितरण के अनुरूप है:

लाइवब्यूटी MOS वितरण के उदाहरण।

लाइवब्यूटी MOS वितरण के उदाहरण।

अधिकांश व्यक्तियों में औसत चेहरे की आकर्षण होती है, जिनमें से कम व्यक्ति बहुत कम या बहुत अधिक आकर्षण के चरम पर होते हैं।

इसके अलावा, विकृति और कुर्टोसिस मूल्यों का विश्लेषण यह दर्शाता है कि वितरण पतले पूंछ और औसत स्कोर के चारों ओर केंद्रित हैं, और महिला नमूनों में उच्च आकर्षण अधिक प्रचुर मात्रा में था एकत्रित लाइव स्ट्रीमिंग वीडियो में।

वास्तुकला

एक दो-चरण प्रशिक्षण रणनीति का उपयोग फेशियल प्रायर एन्हांस्ड मल्टी-मॉडल (FPEM) और लाइवब्यूटी में हाइब्रिड फ्यूजन फेज के लिए किया गया था, जो चार मॉड्यूल में विभाजित था: एक व्यक्तिगत आकर्षण पूर्व मॉड्यूल (PAPM), एक मल्टी-मॉडल आकर्षण एनकोडर मॉड्यूल (MAEM), एक क्रॉस-मॉडल फ्यूजन मॉड्यूल (CMFM), और एक निर्णय फ्यूजन मॉड्यूल (DFM)।

लाइवब्यूटी के प्रशिक्षण पाइपलाइन के लिए अवधारणात्मक योजना।

लाइवब्यूटी के प्रशिक्षण पाइपलाइन के लिए अवधारणात्मक योजना।

PAPM मॉड्यूल एक छवि को इनपुट के रूप में लेता है और एक स्विन ट्रांसफॉर्मर का उपयोग करके मल्टी-स्केल विज़ुअल विशेषताओं को निकालता है, और एक पूर्व-प्रशिक्षित फेसनेट मॉडल का उपयोग करके चेहरे-जागरूक विशेषताओं को निकालता है। इन विशेषताओं को तब एक क्रॉस-ध्यान ब्लॉक का उपयोग करके एक व्यक्तिगत ‘आकर्षण’ विशेषता बनाने के लिए जोड़ा जाता है।

प्रारंभिक प्रशिक्षण चरण में, MAEM एक छवि और आकर्षण के पाठ वर्णन का उपयोग करता है, जो CLIP का उपयोग करके मल्टी-मॉडल सौंदर्य सेमांटिक विशेषताओं को निकालता है।

पाठ वर्णन आकर्षण के रूप में होते हैं ‘एक व्यक्ति की तस्वीर जिसमें {a} आकर्षण है’ (जहां {a} बुरा, खराब, न्यायसंगत, अच्छा या उत्कृष्ट हो सकता है)। प्रक्रिया पाठ और दृश्य एम्बेडिंग के बीच कोसाइन समानता का अनुमान लगाती है ताकि आकर्षण स्तर की संभावना प्राप्त की जा सके।

हाइब्रिड फ्यूजन चरण में, CMFM व्यक्तिगत आकर्षण विशेषता द्वारा उत्पन्न पाठ एम्बेडिंग का उपयोग करके पाठ एम्बेडिंग को परिष्कृत करता है, जिससे व्यक्तिगत पाठ एम्बेडिंग उत्पन्न होती है। यह तब एक समानता प्रतिगमन रणनीति का उपयोग करके एक पूर्वानुमान बनाता है।

अंत में, DFM PAPM, MAEM, और CMFM से व्यक्तिगत पूर्वानुमानों को जोड़ती है ताकि एक एकल, अंतिम आकर्षण स्कोर प्राप्त किया जा सके, जिसका उद्देश्य एक स्थिर सहमति प्राप्त करना है।

हानि कार्य

हानि मेट्रिक्स के लिए, PAPM को एक L1 हानि का उपयोग करके प्रशिक्षित किया जाता है, जो अनुमानित आकर्षण स्कोर और वास्तविक (मूल) आकर्षण स्कोर के बीच абсолют अंतर का एक उपाय है।

MAEM मॉड्यूल एक अधिक जटिल हानि कार्य का उपयोग करता है जो एक स्कोरिंग हानि (LS) को एक मिलान वाली रैंकिंग हानि (LR) के साथ जोड़ता है। रैंकिंग हानि (LR) में एक विश्वास हानि (LR1) और एक दो-दिशा रैंकिंग हानि (LR2) शामिल है।

LR1 छवि जोड़ों की सापेक्ष आकर्षण की तुलना करता है, जबकि LR2 यह सुनिश्चित करता है कि अनुमानित आकर्षण स्तर का संभावना वितरण एक एकल शिखर और दोनों दिशाओं में घटता है। यह संयुक्त दृष्टिकोण आकर्षण के स्कोरिंग और रैंकिंग दोनों को अनुकूलित करने का लक्ष्य रखता है।

CMFM और DFM को एक सरल L1 हानि का उपयोग करके प्रशिक्षित किया जाता है।

परीक्षण

परीक्षण में, शोधकर्ताओं ने लाइवब्यूटी को नौ पिछले दृष्टिकोणों के खिलाफ पिट किया: कॉम्बोनेट; 2D-FAP; REX-INCEP; CNN-ER (REX-INCEP में विशेषता); MEBeauty; AVA-MLSP; TANet; Dele-Trans; और EAT.

बेसलाइन विधियों को छवि सौंदर्य मूल्यांकन (IAA) प्रोटोकॉल के अनुरूप भी परीक्षण किया गया था। इनमें ViT-B; ResNeXt-50; और Inception-V3 शामिल थे।

लाइवब्यूटी के अलावा, परीक्षण किए गए अन्य डेटासेट में SCUT-FBP5000 और MEBeauty शामिल थे। नीचे, इन डेटासेट के MOS वितरण की तुलना की गई है:

बेंचमार्क डेटासेट के MOS वितरण।

बेंचमार्क डेटासेट के MOS वितरण।

क्रमशः, इन अतिथि डेटासेट को 60%-40% और 80%-20% के लिए प्रशिक्षण और परीक्षण के लिए विभाजित किया गया था, क्रमशः, उनके मूल प्रोटोकॉल के साथ संगतता बनाए रखने के लिए। लाइवब्यूटी को 90%-10% के आधार पर विभाजित किया गया था।

MAEM में मॉडल प्रारंभीकरण के लिए, VT-B/16 और GPT-2 को क्रमशः छवि और पाठ एनकोडर के रूप में उपयोग किया गया था, जो CLIP से सेटिंग्स के साथ प्रारंभिक थे। PAPM के लिए, स्विन-T को एक प्रशिक्षित छवि एनकोडर के रूप में उपयोग किया गया था, जो स्विनफेस के अनुसार था।

अदामवी ऑप्टिमाइज़र का उपयोग किया गया था, और एक लर्निंग रेट शेड्यूलर एक रैखिक वार्म-अप के तहत एक कोसाइन एनीलिंग योजना के साथ सेट किया गया था। प्रशिक्षण चरणों में लर्निंग रेट भिन्न थे, लेकिन प्रत्येक का बैच आकार 32 था, 50 प्रशिक्षण युग के लिए।

परीक्षण परिणाम

परीक्षण परिणाम

तीन FAP डेटासेट पर परीक्षण के परिणाम ऊपर दिखाए गए हैं। इन परिणामों में, पेपर यह कहता है:

‘हमारी प्रस्तावित विधि पहले स्थान पर हासिल करती है और लाइवब्यूटी, मेब्यूटी और एससीयूटी-एफबीपी5500 पर क्रमशः एसआरओसीसी मूल्यों में 0.012, 0.081, 0.021 से दूसरे स्थान से आगे निकलती है, जो हमारी प्रस्तावित विधि की श्रेष्ठता को प्रदर्शित करती है। ‘

‘आईएए विधियां एफएपी विधियों की तुलना में कमजोर हैं, जो यह प्रदर्शित करती हैं कि सामान्य सौंदर्य मूल्यांकन विधियां चेहरे की विशेषताओं की विषयगत प्रकृति को नजरअंदाज करती हैं, जो एफएपी कार्यों पर खराब प्रदर्शन की ओर ले जाती हैं। ‘

‘सभी विधियों का प्रदर्शन मेब्यूटी पर काफी कम हो जाता है। यह इसलिए है क्योंकि मेब्यूटी में प्रशिक्षण नमूने सीमित हैं और चेहरे की विविधता नस्लीय रूप से विविध है, जो चेहरे की सुंदरता में बड़ी विविधता को दर्शाती है। ‘

‘इन सभी कारक मेब्यूटी में चेहरे की सुंदरता की भविष्यवाणी को अधिक चुनौतीपूर्ण बनाते हैं। ‘

नैतिक विचार

आकर्षण के अनुसंधान एक संभावित रूप से विभाजनकारी पीछा है, क्योंकि सौंदर्य के सुपरिभाषित मानकों की स्थापना में, ऐसी प्रणालियां आयु, नस्ल, और मानवों से संबंधित कंप्यूटर दृष्टि अनुसंधान के कई अन्य खंडों में पूर्वाग्रहों को मजबूत और प्रसारित करने की प्रवृत्ति रखती हैं।

यह तर्क दिया जा सकता है कि एक FAP प्रणाली स्वाभाविक रूप से पूर्वाग्रहित है और आकर्षण के बारे में आंशिक और पूर्वाग्रहित दृष्टिकोण को मजबूत और प्रसारित करने की प्रवृत्ति रखती है। ये निर्णय मानव-नेतृत्व वाली अनोटेशन से उत्पन्न हो सकते हैं – अक्सर स्केल पर किए जाते हैं जो प्रभावी डोमेन सामान्यीकरण के लिए सीमित हैं – या ऑनलाइन वातावरण जैसे स्ट्रीमिंग प्लेटफ़ॉर्म में ध्यान पैटर्न का विश्लेषण करके, जो तर्कसंगत रूप से मेरिटोक्रेटिक नहीं हैं।

* पेपर में स्रोत डोमेन/डोमेन का उल्लेख नामित और बहुवचन दोनों में किया गया है।

पहली बार बुधवार, 8 जनवरी 2025 को प्रकाशित।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai