Anderson का एंगल
एआई की सुंदरता की खोज

एक नए एआई-ड्रिवन सौंदर्य मूल्यांकन प्रणाली आकर्षक चेहरों की दर से, जबकि पारंपरिक गहरे शिक्षण मॉडल की तुलना में तेजी से प्रशिक्षण, संभावित रूप से बड़े पैमाने पर स्वचालित सौंदर्य-स्कोरिंग अधिक व्यावहारिक बना रही है।
फेसियल ब्यूटी प्रेडिक्शन (एफबीपी) एक बड़ा व्यवसाय है, और शोध साहित्य में एक मजबूत धागा है। भले ही यह एआई और मशीन लर्निंग प्रथाओं में पूर्वाग्रह का मुकाबला करने के पीछे लगभग हर सिद्धांत को तोड़ता है, और भले ही यह कई तरह से एल्गोरिदमिक धारणाओं में महिलाओं के उद्देश्य और कमी का समर्थन करता है, यह कई अरब डॉलर के उद्योगों के हित को आकर्षित करता है, जिनमें से अधिकांश सीधे महिलाओं के लिए हैं, जैसे कि सौंदर्य उत्पाद, सौंदर्य सurgery, लाइवस्ट्रीमिंग, और फैशन, अन्य लोगों के बीच:

महिलाओं को 1-5 से रेट किया गया, ‘एशियन फीमेल फेशियल ब्यूटी प्रेडिक्शन यूजिंग डीप न्यूरल नेटवर्क्स वाया ट्रांसफर लर्निंग एंड मल्टी-चैनल फीचर फ्यूजन’ शीर्षक के पेपर से। स्रोत
इन स्पष्ट महिला-केंद्रित व्यवसायिक घेरों के अलावा, विज्ञापन और कई अन्य उद्योग, जिनमें मनोरंजन और प्रकाशन शामिल हैं, आकर्षण की समझ में महत्वपूर्ण हित रखते हैं, जो कि पुरुषों और महिलाओं दोनों के लिए आवश्यक है, आवश्यक रूप से एक सांस्कृतिक आधार पर।
सौंदर्य की सामूहिक धारणाएं क्षेत्रों में भिन्न होती हैं, जिसका अर्थ है कि कोई निश्चित वैश्विक रूप से लागू होने वाले डेटासेट प्राप्त नहीं किए जा सकते हैं, और नए शोध को या तो स्थानीय रहना होगा या विभिन्न सांस्कृतिक डेटा के विविध स्वाथों में लागू किए जाने वाले ‘उच्च-स्तरीय’ तरीकों पर ध्यान केंद्रित करना होगा।

2015 एससीयूटी-एफबीपी परियोजना के लिए एक फेशियल ब्यूटी मूल्यांकन प्रणाली के लिए एक इंटरफेस。 स्रोत
अक्सर, भौगोलिक स्थान ही एकमात्र प्रतिबंध नहीं है, क्योंकि आकर्षण-केंद्रित डेटासेट लिंग या विशिष्ट अनुप्रयोग के लिए क्यूरेट किए जा सकते हैं – और यह संग्रह के उपयोग को अन्य क्षेत्रों में प्रतिबंधित कर सकता है।
उदाहरण के लिए, 2025 में मैंने रिपोर्ट की थी एक बड़े पैमाने पर (100,000+ पहचान) डेटासेट के विकास के बारे में लाइवस्ट्रीमिंग में आकर्षण का मूल्यांकन करने के लिए, जिसके करीबी मानकों को व्यापक परियोजनाओं में अनुकूलन की आवश्यकता हो सकती है,尽管 इस पहल के पीछे बड़े प्रयास के बावजूद।
फेशियल रेंडिशन
जैसा कि ऊपर दिए गए लिंक और छवियों से स्पष्ट है, एशियाई शोध निकाय अक्सर अपने पश्चिमी समकक्षों के रूप में एक ही सांस्कृतिक प्रतिबंधों के तहत काम नहीं कर रहे हैं, जो एक वैज्ञानिक चित्रण प्रकाशित करने के लिए साहस नहीं करेंगे जो पांच पश्चिमी महिलाओं को आकर्षक से कम से कम आकर्षक तक रेट करता है, जैसा कि हम ऊपर दिए गए अध्ययन में देखते हैं।
यह तर्क दिया जा सकता है कि जहां एशियाई मूल की ऐसी प्रणालियां सार्वजनिक रूप से प्रभावी साबित होती हैं, बिना स्थानीय आलोचना के डर के, पश्चिमी हित ऐसे शोध को निजी तौर पर अनुकूलित कर सकते हैं। इस स्थिति में, ‘महिलाओं को रेट करने’ का कार्य एक ऐसे स्थान पर रेंडिशन किया जाता है जहां इसका पीछा आलोचना के बिना किया जा सकता है।
चाहे यह सामान्य हो या कम प्रचारित पश्चिमी समकक्ष प्रणालियां खुले स्रोत सहयोग और सार्वजनिक जांच से दूर विकसित की जाती हैं, यह मानना उचित है कि लक्ष्य एक वैश्विक हित है, जो बड़ी संख्या में पेशेवर क्षेत्रों को आकर्षण के सटीक मूल्यांकन से लाभान्वित कर सकता है।
सर्वाइवल ऑफ द फिटेस्ट
यह लगता है कि टिक टॉक, इंस्टाग्राम और यूट्यूब जैसे विशाल वेब-स्क्रैपेबल कॉर्पोरा आकर्षण के उत्कृष्ट मध्यस्थ हो सकते हैं, जो अनुयायियों, पसंद और यातायात को आकर्षण से संबंधित करके ऐसा करते हैं, क्योंकि यह एक सामान्य और युक्तिसंगत संघ है (हालांकि कुछ अपवादों के साथ)।
इसी तरह, मौजूदा संग्रह – जैसे इमेजनेट और एलएआईओएन – जो अभिनेताओं और मॉडलों को प्रदर्शित करते हैं जो ‘शीर्ष पर चढ़े हैं’ – आमतौर पर आकर्षक व्यक्तियों को प्रदर्शित करेंगे (हालांकि अक्सर बहुत सारे डेटा बिंदु होते हैं जो बहुत कम लोगों के होते हैं), जो व्यापक सांस्कृतिक तंत्र को आकर्षण के लिए प्रॉक्सी के रूप में कार्य करने देते हैं।
हालांकि, यह आकर्षण में स्वाद के परिवर्तन के लिए खाता नहीं है जो लोग समय के साथ आकर्षक पाते हैं (भौगोलिक रूप से भी नहीं)। इसलिए, फिर से, उच्च-स्तरीय और डेटा-अज्ञेयवादी प्रणालियों की आवश्यकता है, न कि व्यक्तिगत और संदिग्ध संग्रह या क्यूरेशन जो बदलते स्वाद को प्रतिबिंबित करने में विफल रहेंगे।
कॉम्बिनेशन स्किन
इन चुनौतियों का सामना करने वाली नवीनतम अकादमिक प्रविष्टि चीन से आती है, जहां ट्रांसफर लर्निंग और ब्रॉड लर्निंग सिस्टम (बीएलएस) को आकर्षण के बीच के लंबे समय से चले आ रहे व्यापार-बंद को संबोधित करने के लिए जोड़ा जाता है। सटीकता और गणनात्मक लागत के बीच।
पारंपरिक न्यूरल नेटवर्क आमतौर पर केवल भारी प्रशिक्षण के साथ मजबूत परिणाम प्राप्त करते हैं, जबकि हल्के प्रणालियों जैसे बीएलएस तेजी से प्रशिक्षित होते हैं, लेकिन विस्तार से विवरण को पकड़ने के लिए संघर्ष करते हैं। यह नए काम इस अंतर को पाटने के लिए एक पूर्व-प्रशिक्षित दृश्य मॉडल का उपयोग करके चेहरे से विशेषताओं को निकालता है, जो तब एक तेजी से बीएलएस-आधारित प्रणाली में पारित किया जाता है, जो सुविधाओं को फिर से सीखने के बजाय पुन: उपयोग करने की अनुमति देता है, जबकि प्रशिक्षण को कुशल बनाए रखता है:

एलएसएफबीडी डेटासेट से नमूना छवियां, जो 1 से 5 तक मानव-निर्धारित सौंदर्य स्कोर द्वारा महिलाओं के चेहरों को समूहित करती हैं। रेटिंग कई अन्नोटेटर्स से प्राप्त की गई थीं और सौंदर्य स्कोर के रूप में उपयोग की गईं। स्रोत
काम में पेश की गई पहली दो विविधताओं में से, ई-बीएलएस (नीचे देखें), सीधे बीएलएस में निकाली गई विशेषताओं को खिलाता है, जबकि दूसरा, ईआर-बीएलएस (नीचे देखें), एक सरल मध्यवर्ती चरण जोड़ता है जो उन विशेषताओं को मानकीकृत और परिष्कृत करता है इससे पहले कि उन्हें मूल्यांकन के लिए उपयोग किया जाए, जो स्थिरता में सुधार करने में मदद करता है बिना प्रक्रिया को धीमा किए।
लेखकों द्वारा किए गए परीक्षण साबित करते हैं, वे दावा करते हैं, कि उनका दृष्टिकोण एक ही तरीके से और अन्य प्रतिस्पर्धी तरीकों से बेहतर है।
नई पेपर का शीर्षक फेशियल ब्यूटी प्रेडिक्शन फ्यूजिंग ट्रांसफर लर्निंग और ब्रॉड लर्निंग सिस्टम है, और वूयी विश्वविद्यालय, जियांगमेन के छह शोधकर्ताओं से आता है।
विधि
उपरोक्त ब्रॉड लर्निंग सिस्टम एक हल्के विकल्प है गहरे न्यूरल नेटवर्क के लिए, जो कई परतों को स्टैक करने से बचता है, और इसके बजाय सीखने को एक विस्तृत सेट के सरल कनेक्शन में फैलाता है, जो मॉडल को तेजी से प्रशिक्षित करने की अनुमति देता है – लेकिन आमतौर पर विस्तार से विवरण को याद करने की लागत पर।
दो विविधताओं में से, ई-बीएलएस, эффициентनेट-आधारित ट्रांसफर लर्निंग को बीएलएस के साथ जोड़ती है, एक चेहरे से विस्तृत दृश्य विशेषताओं को निकालती है, और फिर उन्हें बीएलएस में पारित करती है, जो एक अंतिम भविष्यवाणी को शामिल करती है जो एक पूर्ण गहरे न्यूरल नेटवर्क को प्रशिक्षित करने की आवश्यकता को समाप्त करती है स्क्रैच से:

ई-बीएलएस मॉडल के लिए आर्किटेक्चर योजना。
एफिसिएंटनेट, जो इमेजनेट-1के पर पूर्व-प्रशिक्षित है और बड़े पैमाने पर अपरिवर्तित रहता है, प्रत्येक इनपुट छवि को एक कॉम्पैक्ट सेट में परिवर्तित करता है फीचर मूल्य जो चेहरे को एक संरचित तरीके से वर्णित करते हैं, जबकि बीएलएस उन मूल्यों को लेता है और उन्हें एक नेटवर्क के माध्यम से संसाधित करता है सरल, यादृच्छिक रूप से जुड़े नोड जो जानकारी को बदलने और जोड़ने से पहले अंतिम आकर्षण स्कोर का उत्पादन करते हैं।
चूंकि बीएलएस गहरे परत वाले ढांचे पर निर्भर नहीं करता है, ई-बीएलएस को नए नोड जोड़कर अपडेट किया जा सकता है, न कि पूरी प्रणाली को फिर से प्रशिक्षित करके। यह प्रशिक्षण को तेजी से बनाए रखता है, और इसे नए डेटा के रूप में मॉडल में सुधार करना आसान बनाता है।
दो विविधताओं में से दूसरा, ईआर-बीएलएस, ई-बीएलएस पर बनाता है एक अतिरिक्त प्रसंस्करण चरण जोड़कर जो निकाली गई विशेषताओं को मानकीकृत और परिष्कृत करता है इससे पहले कि वे मूल्यांकन के लिए उपयोग किए जाएं:

ईआर-बीएलएस मॉडल की आर्किटेक्चर。
ईआर-बीएलएस में, एफिसिएंटनेट की निकाली गई विशेषताओं को सीधे बीएलएस में नहीं भेजा जाता है, बल्कि उन्हें पहले एक परिष्करण परत में पारित किया जाता है जो डेटा को मानकीकृत और पुन: आकार देता है, जो शोर को कम करने और विभिन्न छवियों में विशेषताओं को अधिक सुसंगत बनाने में मदद करता है। यह चरण सामान्यीकरण में सुधार करने के लिए डिज़ाइन किया गया है, खासकर जब चेहरे पोज़, प्रकाश या अन्य दृश्य स्थितियों में भिन्न होते हैं जो अन्यथा अनुमानों में अस्थिरता पेश कर सकते हैं।
परिष्कृत विशेषताओं को फिर ई-बीएलएस में उपयोग किए जाने वाले समान बीएलएस संरचना में पारित किया जाता है, जहां फीचर नोड और एन्हांसमेंट नोड जानकारी को बदलने और जोड़ने से पहले अंतिम आकर्षण स्कोर का उत्पादन करते हैं।
डेटा और परीक्षण
अपने दृष्टिकोण का परीक्षण करने के लिए, लेखकों ने एससीयूटी-एफबीपी5500 डेटासेट का लाभ उठाया, एक चेहरे की सुंदरता की भविष्यवाणी संग्रह दक्षिण चीन विश्वविद्यालय से, जिसमें 5,500 मुख्य चेहरे की छवियां 350x350px पर, विभिन्न जातियों, लिंग और उम्र के लोगों को प्रदर्शित करती हैं:

एससीयूटी-एफबीपी5500 डेटासेट से नमूना चेहरे की छवियां, जो 1 (बहुत कम आकर्षक) से 5 (बहुत आकर्षक) तक रेट की गई हैं।
प्रत्येक छवि को 60 स्वयंसेवकों द्वारा 1-5 के पैमाने पर एक सुंदरता स्कोर के साथ रेट किया गया था, जो बहुत कम आकर्षक (1) से बहुत आकर्षक (5) तक था:

सुंदरता रेटिंग द्वारा छवियों के अनुपात का विभाजन。
इस्तेमाल किया गया दूसरा डेटाबेस लार्ज-स्केल एशियन फीमेल ब्यूटी डेटासेट (एलएसएफबीडी) संग्रह था, जो लेखकों द्वारा स्वयं क्यूरेट किया गया था।

एलएसएफबीडी डेटासेट से नमूना चेहरे की छवियां, जो 1 (बहुत कम आकर्षक) से 5 (बहुत आकर्षक) तक रेट की गई हैं।
संग्रह में 80,000 अनलेबल्ड छवियां 144x144px रिजॉल्यूशन पर, पोज़ और पृष्ठभूमि में भिन्नता के साथ-साथ आयु में भी शामिल हैं। इन्हें 75 स्वयंसेवकों द्वारा पिछले डेटासेट के समान मानदंडों के लिए 0-4 के पैमाने पर रेट किया गया था:

एलएसएफबीडी डेटासेट के लिए विभाजन。
प्रत्येक डेटासेट को 8/20 के अनुपात में प्रशिक्षण और परीक्षण खंडों में विभाजित किया गया था, और क्रॉस-वैलिडेशन का उपयोग परिणामों को पुनरावृत्तियों में स्थिर करने के लिए किया गया था। बीएलएस घटक को फीचर विंडो की संख्या के माध्यम से कॉन्फ़िगर किया गया था; प्रति विंडो नोड की संख्या; और उन्नत नोड की संख्या, हाइपरऑप्ट का उपयोग प्रभावी संयोजनों की खोज के लिए किया गया था।
एक बेसलाइन स्थापित करने के लिए, एक मानक बीएलएस मॉडल को समान सेटिंग्स के तहत प्रशिक्षित किया गया था, जिसके बाद कई ट्रांसफर लर्निंग मॉडल पेश किए गए थे, जिनमें रेसनेट50, इन्सेप्शन-वी3, डेन्सनेट121, इन्सेप्शनरेसनेटवी2, एफिसिएंटनेटबी7, मोबाइलनेटवी2, एनएएसनेट, और एक्ससेप्शन – सभी इमेजनेट-1के वजन के साथ आरंभ किए गए, और उनके अंतिम परतों को अनफ्रोजन किया गया।
प्रशिक्षण में लर्निंग रेट 0.001 (जब प्रगति रुक जाती है तो कम किया जाता है) का उपयोग किया गया था, और बैच आकार 16, 50 epochs में, नियमितीकरण और रेक्टिफाइड लीनियर एक्टिवेशन (रीलू) लागू किया गया था।
प्रदर्शन का मूल्यांकन पियरसन संबंध के साथ सटीकता का उपयोग करके किया गया था, साथ ही कुल प्रशिक्षण समय, परिणाम पांच रन में औसतन थे।
लेखकों ने प्रशिक्षण सेटअप को एक इंटेल-आई7 3.6 गीगाहर्ट्ज सीपीयू और 64 जीबी रैम के साथ एक ‘डेस्कटॉप कंप्यूटर’ के रूप में रिपोर्ट किया:

एससीयूटी-एफबीपी5500 पर प्रदर्शन तुलना, जहां ई-बीएलएस और ईआर-बीएलएस गहरे सीएनएन मॉडल की तुलना में प्रतिस्पर्धी सटीकता हासिल करते हैं, जिनमें रेसनेट50, एफिसिएंटनेटबी7, इन्सेप्शन-वी3, और एक्ससेप्शन शामिल हैं, जबकि काफी कम प्रशिक्षण समय की आवश्यकता होती है – ब्रॉड लर्निंग सिस्टम के साथ ट्रांसफर लर्निंग को जोड़ने के लाभों को उजागर करते हैं।
परिणामों से पता चलता है कि ई-बीएलएस ने सटीकता को 65.85% से 73.13% तक बढ़ाया, जबकि ईआर-बीएलएस ने 74.69% तक पहुंच गया, जो सभी तुलना मॉडलों से बेहतर था। प्रशिक्षण समय गहरे सीएनएन की तुलना में काफी कम रहा, लगभग 1,300 सेकंड, कई हजार से अधिक 25,000 सेकंड तक।
एलएसएफबीडी पर परीक्षणों से पता चलता है कि ई-बीएलएस ने सादे बीएलएस की तुलना में सटीकता में सुधार किया, जबकि ईआर-बीएलएस ने सभी तुलना तरीकों में से उच्चतम सटीकता हासिल की:

एलएसएफबीडी पर प्रदर्शन, जहां ईआर-बीएलएस और ई-बीएलएस बेसलाइन और ट्रांसफर लर्निंग मॉडल की तुलना में उच्च सटीकता प्रदान करते हैं, जबकि केवल उनके प्रशिक्षण समय का एक अंश आवश्यक होता है, जो कि दक्षता में एक सुसंगत लाभ को इंगित करता है बिना पूर्वानुमान की गुणवत्ता का त्याग किए।
दोनों विविधताओं ने गहरे सीएनएन मॉडल की तुलना में काफी कम प्रशिक्षण समय बनाए रखा, जो एक अधिक कुशल संतुलन को इंगित करता है प्रदर्शन और गणनात्मक लागत के बीच।
निष्कर्ष
यह कुछ हद तक एक ‘पुरानी’ प्रकाशन है, जैसा कि इसके पूर्व-उछाल पसंदीदा जैसे सीएनएन का उपयोग करके साबित होता है, और इसके द्वारा उपयोग किए जाने वाले निम्न-स्तरीय प्रशिक्षण उपकरण, जो मैंने कई वर्षों में एक नए पेपर में मिले हैं।
फिर भी, यह कंप्यूटर दृष्टि में एक आश्चर्यजनक रूप से लचीला उद्देश्य से संबंधित है; जो मानव अनुभव और विषयगत व्याख्या पर भारी रूप से प्रभाव डालता है, और जो कि किसी योजना की मांग करता है जो कि क्षणिक सौंदर्य प्रवृत्तियों से परे हो सकती है, और जो कि इस कार्य के लिए वास्तव में लचीला पाइपलाइन प्रदान कर सकती है। पहली बार गुरुवार, 19 मार्च, 2026 को प्रकाशित किया गया।
पहली बार गुरुवार, 19 मार्च, 2026 को प्रकाशित किया गया।












