Anderson का एंगल

एआई फोटो के वर्ष का अनुमान लगा सकता है लोगों की उम्र से

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
An image from the source paper 'Photo Dating by Facial Age Aggregation', overlaid against an image of a desk surface with a 1974 calendar on it. Source: eBay and Source paper + Firefly V3.

नई रिसर्च से पता चलता है कि एआई लोगों के चेहरों का उपयोग करके फोटो के वर्ष का अनुमान लगा सकता है, ज्ञात जन्म वर्ष के साथ उम्र के अनुमान को जोड़कर वर्तमान दृश्य-आधारित विधियों को पार कर सकता है।

 

फोटो की तारीख का अनुमान लगाना पहले इतना मुश्किल नहीं था, क्योंकि बाल और कपड़ों के फैशन पहले तेजी से विकसित हो रहे थे। 80 के दशक के बाल और फैशन की दुनिया में तेजी से परिवर्तन हो रहा था, लेकिन यह परिवर्तन लगभग तीस साल पहले समाप्त हो गया, जिससे यह अनुमान लगाना मुश्किल हो गया कि फोटो किस वर्ष की है।

कुछ समय के लिए, यह संभव था कि फिल्म की रंग रिज़ॉल्यूशन और ग्रेन की विशेषताओं के आधार पर फोटो और फिल्मों की तारीख का अनुमान लगाया जा सके। इसके लिए किसी विशेषज्ञ की आवश्यकता नहीं थी; यदि आप पर्याप्त पुरानी फिल्में देखते हैं, तो सांस्कृतिक संकेत (जैसे संगीत, कार, फैशन, विषय आदि) अंततः दृश्य संकेतों के साथ जुड़ जाते हैं जो फिल्म स्टॉक शैलियों से जुड़े होते हैं:

फिल्म स्टॉक में सुधार के कारण त्वचा के टोन और प्रकाश शैलियों की श्रृंखला में विस्तार का एक चित्रण, जो समतल, सामने की सेटअप से अधिक प्राकृतिक और विविध दिखने वाले दृश्यों में बदल गया। [ स्रोत ] https://archive.is/3ZSjN (मेरा अपना लेख)

फिल्म स्टॉक में सुधार के कारण त्वचा के टोन और प्रकाश शैलियों की श्रृंखला में विस्तार का एक चित्रण, जो समतल, सामने की सेटअप से अधिक प्राकृतिक और विविध दिखने वाले दृश्यों में बदल गया। स्रोत

एक अतिरिक्त ‘एंकर’ फोटो की तारीख का अनुमान लगाने के लिए यह था कि क्या यह काले और सफेद में था – एक अर्थव्यवस्था जो डिजिटल फोटोग्राफी के लोकप्रिय होने के बाद इस शताब्दी की शुरुआत में अप्रासंगिक हो गई।

कई व्यावसायिक और प्रयोगात्मक प्रणालियाँ, जैसे कि मायहेरिटेज की सदस्यता से जुड़ी फोटोडेटर प्रयास करती हैं कि वे इन और विभिन्न अन्य मानदंडों का उपयोग करके फोटो की तारीख का अनुमान लगाएं।

मायहेरिटेज फोटोडेटर सदस्यता सेवा का एक फोटो अनुमान उदाहरण। स्रोत [ https://www.youtube.com/watch?v=2oVyLI6tBcY ]

मायहेरिटेज फोटोडेटर सदस्यता सेवा का एक फोटो अनुमान उदाहरण। स्रोत

अन्य स्पष्ट संकेतों के अभाव में, जैसे कि स्मार्टफोन या अन्य युग-विशिष्ट प्रौद्योगिकी, पिछले 15-25 वर्षों में ली गई फोटो की उम्र का अनुमान लगाने का सबसे अच्छा तरीका यह है कि यदि आप व्यक्ति (यानी, एक प्रसिद्ध व्यक्ति या शायद एक परिचित) से परिचित हैं, और उनकी उम्र का अनुमान लगा सकते हैं, जो एक अनुमानित वर्ष के बराबर होता है।

चेहरे की उम्र के रूप में संदर्भ

कंप्यूटर विजन के क्षेत्र में, और विभिन्न अन्य क्षेत्रों में (जैसे फोरेंसिक, संग्रह संसाधन, पत्रकारिता, डेटासेट वास्तुकला आदि), फोटो की उम्र निर्धारित करने की क्षमता एक प्रतिष्ठित लक्ष्य है, क्योंकि कई डिजिटल और विश्लेषणात्मक संग्रह उचित एनोटेशन और मेटाडेटा की कमी है, या यहां तक कि गलत मेटाडेटा भी हो सकते हैं जो पहले के गलत अनुमानों से हैं।

इसलिए, यदि एक एआई प्रणाली फोटो की समीक्षा उसी तरह कर सकती है जैसे हम अपने ऐतिहासिक संग्रहों पर विचार करते हैं और कहते हैं ‘हाँ, यह तब था जब…’। प्रश्न यह है कि क्या कोई हुक हो सकता है, जो सामान्य संकेतों के अभाव में?

चेक गणराज्य से एक नए शोध पत्र में इस दृष्टिकोण में एक प्रारंभिक पकड़ प्रदान करने का प्रयास किया गया है, एआई-आधारित उम्र मान्यता प्रणालियों का शोषण करके, जो चेहरे मान्यता प्रणालियों के साथ संयुक्त हैं जो एक सामान्य डेटाबेस से जुड़े हुए हैं (इस मामले में, एक आईएमडीबी-शैली का संग्रह जिसमें चेक कलाकार और फिल्म निर्माता शामिल हैं):

जोचिम, पुट इट इन द मैशीन (1974) का एक दृश्य, जो तारीख निर्धारण प्रक्रिया को दर्शाने के लिए उपयोग किया जाता है। मॉडल फोटो में ज्ञात व्यक्तियों का पता लगाता है, उनकी उम्र का अनुमान लगाने के लिए एक चेहरे की उम्र अनुमानित (दाएं कॉलम) का उपयोग करता है, और प्रत्येक व्यक्ति के जन्म वर्ष से उस मूल्य को घटाकर संभावित फोटो तारीखों पर एक संभावना वितरण उत्पन्न करता है। ग्राफ प्रत्येक उम्र अनुमान की संभावना को दर्शाते हैं, जिसमें व्यक्ति की वास्तविक उम्र को समय के साथ दर्शाने वाली डैश्ड लाइनें हैं। [ स्रोत ] https://arxiv.org/pdf/2511.05464

जोचिम, पुट इट इन द मैशीन (1974) का एक दृश्य, जो तारीख निर्धारण प्रक्रिया को दर्शाने के लिए उपयोग किया जाता है। मॉडल फोटो में ज्ञात व्यक्तियों का पता लगाता है, उनकी उम्र का अनुमान लगाने के लिए एक चेहरे की उम्र अनुमानित (दाएं कॉलम) का उपयोग करता है, और प्रत्येक व्यक्ति के जन्म वर्ष से उस मूल्य को घटाकर संभावित फोटो तारीखों पर एक संभावना वितरण उत्पन्न करता है। ग्राफ प्रत्येक उम्र अनुमान की संभावना को दर्शाते हैं, जिसमें व्यक्ति की वास्तविक उम्र को समय के साथ दर्शाने वाली डैश्ड लाइनें हैं। स्रोत

प्रणाली फोटो में ज्ञात व्यक्तियों का पता लगाकर काम करती है, उनकी उम्र का अनुमान लगाने के लिए एक चेहरे की उम्र अनुमानित का उपयोग करती है, और प्रत्येक व्यक्ति के जन्म वर्ष से उस मूल्य को घटाकर संभावित फोटो तारीखों पर एक संभावना वितरण उत्पन्न करती है। जब कई चेहरे मौजूद होते हैं, तो तारीख के अनुमान एक अंतिम पूर्वानुमान उत्पन्न करने के लिए एकत्रित किए जाते हैं।

विधि को चेको-स्लोवाक मूवी डेटाबेस (सीएसएफडी) से क्यूरेटेड छवियों पर परीक्षण किया गया था, जिसके परिणामस्वरूप दृष्टिकोण, लेखकों का दावा है, वर्तमान दृश्य-आधारित विधियों की तुलना में लगातार बेहतर सटीकता प्रदान करता है।

इस विधि के लिए एक केंद्रीय डेटाबेस की आवश्यकता होती है जिसमें व्यक्तियों के एक व्यापक समूह के बारे में ज्ञान होता है, इस मामले में एक आईएमडीबी-शैली का चेक मूवी डेटाबेस; लेकिन कोई भी समान संग्रह जिसमें पुष्टि की गई जन्म तिथियां और केंद्रीय तिथि-पुष्टि की गई घटनाएं हैं, एक समान परिणाम प्रदान कर सकती हैं।

लेख में कहा गया है:

‘अनोखे रूप से, हमारा डेटासेट एक ही छवि में कई व्यक्तियों के लिए एनोटेशन प्रदान करता है, जो बहु-चेहरे जानकारी एकत्रीकरण का अध्ययन करने में सक्षम बनाता है। हम एक संभाव्य ढांचे का प्रस्ताव करते हैं जो आधुनिक चेहरे पहचान और उम्र अनुमान मॉडल से दृश्य साक्ष्य को औपचारिक रूप से जोड़ता है, और करियर-आधारित समय पूर्ववर्ती को फोटो कैप्चर वर्ष का अनुमान लगाने के लिए। ‘

‘हमारे प्रयोग दर्शाते हैं कि कई चेहरों से साक्ष्य एकत्रीकरण लगातार प्रदर्शन में सुधार करता है और दृष्टिकोण मजबूत दृश्य-आधारित बेसलाइन को महत्वपूर्ण रूप से पार करता है, विशेष रूप से कई पहचानने योग्य व्यक्तियों वाली छवियों के लिए।’

लेख नया लेख है जिसका शीर्षक फोटो डेटिंग द्वारा चेहरे की उम्र एकत्रीकरण है, और यह चेक टेक्निकल यूनिवर्सिटी इन प्राग के दो शोधकर्ताओं से है, जिसमें बाद में कोड/डेटा रिलीज का वादा किया गया है।

विधि

फोटो लेने के समय का अनुमान लगाने के लिए, लेखकों की नई प्रणाली प्रत्येक पता लगाए गए चेहरे को देखती है और अनुमान लगाने का प्रयास करती है कि यह कौन हो सकता है, ज्ञात लोगों के डेटाबेस का उपयोग करते हुए। चूंकि एक व्यक्ति एक फोटो में केवल एक बार दिखाई दे सकता है, प्रणाली सभी संभावित पहचान संयोजनों की जांच करती है और उनके ज्ञात जन्म वर्ष का उपयोग करके प्रत्येक व्यक्ति की उम्र का अनुमान लगाने का प्रयास करती है।

इसके बाद, यह उन उम्रों को वापस काम करके सबसे संभावित वर्ष का अनुमान लगाने का प्रयास करता है जो उन उम्रों को संरेखित करेगा:

बाएं: प्रणाली उनके ज्ञात करियर के आधार पर पहचाने गए व्यक्तियों की एक समयरेखा बनाती है। दाएं: यह चेहरे की उम्र के अनुमान के साथ संयुक्त होकर फोटो लेने का एक अंतिम अनुमान उत्पन्न करता है।

बाएं: प्रणाली उनके ज्ञात करियर के आधार पर पहचाने गए व्यक्तियों की एक समयरेखा बनाती है। दाएं: यह चेहरे की उम्र के अनुमान के साथ संयुक्त होकर फोटो लेने का एक अंतिम अनुमान उत्पन्न करता है।

संभावित पहचान संयोजनों के बड़े पैमाने पर प्रबंधन के लिए, प्रणाली मानती है कि चेहरे स्वतंत्र हैं और प्रत्येक की उपस्थिति केवल उनकी पहचान और फोटो की तारीख पर निर्भर करती है।

फोटो लेने के समय का अनुमान लगाने के लिए, प्रणाली पहले प्रत्येक पता लगाए गए चेहरे की उम्र का अनुमान लगाने के लिए एनआईएसटी सीव्यूटी-002 मॉडल का उपयोग करती है, जो एक वीआईटी-बी/16 आर्किटेक्चर पर आधारित है और एक निजी डेटासेट पर प्रशिक्षित किया गया है (जो लेखकों का दावा है कि एनआईएसटी के फेस एनालिसिस टेक्नोलॉजी इवैल्यूएशन (एफएटीई) डेटाबेस में उच्च रैंकिंग रखता है)।

एक बार जब व्यक्ति का जन्म वर्ष ज्ञात हो जाता है, तो मॉडल उम्र अनुमान को फोटो वर्ष में परिवर्तित करता है bằng简单 रूप से उम्र को जन्म वर्ष में जोड़कर, जो संभावित कैप्चर वर्षों पर एक संभावना वितरण उत्पन्न करता है। चेहरे की पहचान के साथ मेल खाने का मूल्यांकन करने के लिए, प्रणाली उनके एम्बेडिंग की तुलना आर्कफेस स्पेस में करती है:

आर्कफेस, अब लोकप्रिय इनसाइटफेस मॉडल के लिए केंद्रीय योगदान वाली वास्तुकला, 2015 में शुरू की गई थी, जो चेहरे के मूल्यांकन में एक प्रभावशाली परियोजना बनने के लिए निर्धारित थी। [ स्रोत ] https://arxiv.org/pdf/1801.07698

आर्कफेस, अब लोकप्रिय इनसाइटफेस मॉडल के लिए केंद्रीय योगदान वाली वास्तुकला, 2015 में शुरू की गई थी, जो चेहरे के मूल्यांकन में एक प्रभावशाली परियोजना बनने के लिए निर्धारित थी। स्रोत

प्रत्येक पहचान को उनके संदर्भ चित्रों से बनाई गई एक औसत एम्बेडिंग द्वारा प्रतिनिधित्व किया जाता है। पहचान और एक परीक्षण चेहरे के बीच समानता को वॉन मिसेस फिशर वितरण का उपयोग करके मापा जाता है, जो यह मॉडल करता है कि पहचान के चित्र कितनी紧密ी से उस औसत एम्बेडिंग के आसपास क्लस्टर करते हैं। एक साझा तीक्ष्णता पैरामीटर यह नियंत्रित करता है कि प्रणाली उन क्लस्टर में कितनी विश्वास करती है, और इसका अनुमान पहचान के चित्रों पर एक छोड़-एक-बाहर रणनीति का उपयोग करके किया जाता है।

मॉडल पहचाने गए व्यक्ति की संभावित उपस्थिति का अनुमान लगाने के लिए पांच प्रकार के प्राथमिकता को परिभाषित करता है: समान; दशक; फिल्म; छवि; और एक उत्तल संयोजन प्राथमिकता जो सबसे मजबूत और सबसे कमजोर विकल्पों को मिलाती है, प्राथमिकता की ताकत के प्रति संवेदनशीलता का परीक्षण करने के लिए (यानी, प्राथमिकताओं की लचीलापन जब दबाव में होती है):

अनिश्चित चेहरों से निपटने के लिए, मॉडल में एक डिफ़ॉल्ट ‘अज्ञात’ पहचान शामिल है जिसमें असूचनात्मक वितरण होते हैं, जिसमें एम्बेडिंग स्थान में समतल चेहरे की संभावना होती है, और सभी वर्षों में एक समय पूर्ववर्ती होता है। यह अनिश्चित चेहरों को बिना पूर्वाग्रह के अनदेखा करने की अनुमति देता है:

खुले सेट स्थितियों में पूर्ण मॉडल का प्रदर्शन, जहां एक ही छवि में ज्ञात और अज्ञात चेहरे दोनों मौजूद हैं। माध्य पूर्ण त्रुटि (एमएई) अज्ञात पहचानों की संख्या के साथ बढ़ती है, लेकिन ज्ञात पहचानों की संख्या में वृद्धि के साथ लगातार सुधार करती है। प्रत्येक वर्ग का आकार नमूना गणना को इंगित करता है, जो यह दर्शाता है कि कम त्रुटि वाले कॉन्फ़िगरेशन डेटासेट वितरण में भी प्रमुख हैं।

जब छवि में कुछ चेहरे पहचाने नहीं जा सकते हैं। प्रत्येक वर्ग एक विशिष्ट संख्या में ज्ञात और अज्ञात पहचानों के लिए औसत तारीखिंग त्रुटि को दर्शाता है, जिसमें वर्ग का आकार यह दर्शाता है कि यह संयोजन डेटासेट में कितना सामान्य है। त्रुटि अज्ञात लोगों की संख्या के साथ बढ़ती है, लेकिन ज्ञात पहचानों की संख्या में वृद्धि के साथ गिरती है।

डेटा और परीक्षण

लेखकों ने अपने नए संग्रह को सीएसएफडी-1.6एम नाम दिया, जिसे उन्होंने उपरोक्त सीएसएफडी डेटासेट से बनाया था। डेटासेट का निर्माण कई लोगों वाले दृश्यों से किया गया था, जिसमें प्रत्येक चेहरे को पहचान और वर्ष द्वारा लेबल किया गया था। यह संरचना आवश्यक थी ताकि मॉडल को सिखाया जा सके कि चेहरे एक संदर्भ में कैसे संबंधित हैं।

चेको-स्लोवाक मूवी डेटाबेस से फिल्म रिलीज वर्ष का उपयोग यह अनुमान लगाने के लिए किया गया था कि प्रत्येक फोटो कब ली गई थी, प्रत्येक व्यक्ति को एक सार्वजनिक प्रोफाइल से मेल खाया गया था जिसमें उनका जन्म वर्ष और एक चित्र शामिल था।

इसके बाद, प्रत्येक चेहरे को ज्ञात पहचानों में से एक से मेल खाया गया, आर्कफेस का उपयोग करके चेहरे के एम्बेडिंग बनाने और प्रत्येक पहचान के लिए एक औसत एम्बेडिंग गणना करने के लिए:

इसके बाद, हंगेरियन एल्गोरिदम का उपयोग चेहरों को पहचानों के साथ सौंपने के लिए किया गया था, एम्बेडिंग समानता की तुलना करके, एससीआरएफडी-10जीई फ्रेमवर्क द्वारा पता लगाए गए चेहरों की संख्या के साथ मेल नहीं खाने पर समायोजन किया गया था।

सीएसएफडी-1.6एम डेटासेट के आँकड़े, जिसमें स्क्रैप्ड छवियों, पता लगाए गए चेहरों, पहचान मिलान, अंतिम एनोटेटेड नमूनों और उपलब्ध पहचान पूल की जानकारी शामिल है।

सीएसएफडी-1.6एम डेटासेट के आँकड़े, जिसमें स्क्रैप्ड छवियों, पता लगाए गए चेहरों, पहचान मिलान, अंतिम एनोटेटेड नमूनों और उपलब्ध पहचान पूल की जानकारी शामिल है।

मेल खाने वाले चेहरों को अस्वीकार कर दिया गया था यदि समानता बहुत कम थी या यदि अनुमानित उम्र बहुत अधिक उनकी ज्ञात उम्र से भिन्न थी, बड़े विषयों के लिए अधिक सहनशीलता की अनुमति दी गई थी, और चेहरों को गुणवत्ता या आकार द्वारा फिल्टर नहीं किया गया था।

लेखक निकटतम तुलनीय डेटासेट, आईएमडीबी-विकी की अपनी क्यूरेटेड सेट की श्रेष्ठता पर टिप्पणी करते हैं:

‘हमारा डेटासेट न केवल महत्वपूर्ण रूप से बड़ा है, बल्कि हमारे मॉडल द्वारा आवश्यक बहु-व्यक्ति दृश्यों से भी बना है। जबकि कोई वेब-स्क्रैप्ड डेटासेट लेबल शोर से मुक्त नहीं है, हमारी एनोटेशन पाइपलाइन डेटाबेस द्वारा प्रदान किए गए छवियों और पहचान प्रोफाइल के बीच स्पष्ट लिंक का लाभ उठाती है, उच्च-गुणवत्ता वाली पहचान असाइनमेंट के लिए लक्ष्य रखती है।’

उनके मूल्यांकन ने विभिन्न संस्करणों की तुलना की ताकि यह पता लगाया जा सके कि उनकी तारीख प्रणाली के लाभ कहां से आ रहे थे। एक मॉडल ने यह माना कि फोटो में कौन है, यह ज्ञान प्रदान करके प्रदर्शन की एक ऊपरी सीमा प्रदान की, जो पहचान पहचान की अनिश्चितता को दूर करता है, मॉडल के पूर्ण संस्करण ने तब पहचानों और तारीखों का संयुक्त अनुमान लगाया, विभिन्न पहचान असाइनमेंट के विकल्पों पर विचार करने से पहले एक अंतिम वर्ष का अनुमान लगाया।

एक सरलीकृत संस्करण ने एक ही पहचान कॉन्फ़िगरेशन का चयन किया बिना विकल्पों पर विचार किए, जो अभ्यास में लगभग उतना ही प्रभावी साबित हुआ।

इसके विपरीत, सबसे बुनियादी बेसलाइन ने प्रत्येक चेहरे को स्वतंत्र रूप से सौंपा और परिणामी उम्र-आधारित वर्ष के अनुमानों को जोड़ा, यह नहीं माना कि पहचान सामूहिक रूप से कितनी समझ में आती है।

चेहरों का उपयोग करके विधि के लाभों का परीक्षण करने के लिए, एक अलग मॉडल को सीधे पूरी छवि से तारीख का अनुमान लगाने के लिए प्रशिक्षित किया गया था। यह दृश्य-आधारित मॉडल वर्तमान में छवि तारीख अनुमान में उपयोग किए जाने वाले सबसे मजबूत वैकल्पिक दृष्टिकोण का गठन करता है, क्योंकि यह पूरी छवि में युग-विशिष्ट दृश्य पैटर्न सीख सकता है, न कि पहचान या उम्र पर निर्भर करता है।

मेट्रिक्स और डेटा

माध्य पूर्ण त्रुटि (एमएई) अनुमानित वर्ष और ज्ञात मैदान सत्य के बीच प्रयोगों के लिए केंद्रीय मीट्रिक थी।

डेटा को पांच भागों में विभाजित किया गया था, सुनिश्चित किया गया था कि एक ही फिल्म से सभी छवियां एक ही भाग में रहती हैं। तीन भागों का उपयोग प्रशिक्षण के लिए किया गया था, एक सत्यापन के लिए, और एक परीक्षण के लिए। इस पांच-गुना घुमाव को ओवरफिटिंग को रोकने के लिए लागू किया गया था।

चूंकि चेहरे-आधारित मॉडल इस डेटासेट पर प्रशिक्षित नहीं थे, इसलिए किसी विभाजन की आवश्यकता नहीं थी, और इसके बजाय उन्हें सीधे पूरे सीएसएफडी-1.6एम सेट पर मूल्यांकित किया गया था।

दृश्य मॉडल को एडम ऑप्टिमाइज़र के तहत 200 प्रशिक्षण युग के लिए प्रशिक्षित किया गया था, छवियों को 384×384 फसल में बदल दिया गया था।

परिणाम

लेख का परिणाम अनुभाग कई प्रदर्शन संकेतकों में विभाजित है, जिसमें कोई एक आउटस्टैंडिंग या केंद्रीय परीक्षण नहीं है। हालांकि, हम यहां कुछ सबसे प्रासंगिक परिणाम प्रस्तुत करेंगे।

सबसे महत्वपूर्ण परिणाम एक एकल संख्या नहीं है, बल्कि एक पैटर्न है: चेहरे एकत्रीकरण मॉडल (विशेष रूप से पूर्ण और टॉप-1 संस्करण) स्थिर रूप से दृश्य-आधारित दृश्य बेसलाइन को पार करते हैं जब दो या अधिक ज्ञात पहचान मौजूद होती हैं – भले ही दृश्य मॉडल को सीधे डेटासेट पर प्रशिक्षित किया गया हो।

प्राथमिकता के प्रभाव का मूल्यांकन करने के लिए, लेखकों ने अपने पूर्ण मॉडल के कई कॉन्फ़िगरेशन की तुलना की। सबसे मजबूत प्रदर्शन दशक प्राथमिकता का उपयोग करके प्राप्त किया गया था, जो निष्क्रिय मॉडल (जो किसी प्राथमिकता प्राथमिकता का उपयोग नहीं करता है) और समान प्राथमिकता (जो वर्षों पर कोई प्राथमिकता नहीं देता है) दोनों से काफी बेहतर प्रदर्शन करता है:

विभिन्न संख्या में चेहरों के साथ छवियों में प्रदर्शन में गिरावट। मॉडल जो वास्तविक समय प्राथमिकता जैसे दशक प्राथमिकता का उपयोग करते हैं, प्रभावित होने से बहुत कम प्रभावित होते हैं, जबकि निष्क्रिय और दृश्य बेसलाइन मॉडल समतल या बड़े समूहों के साथ खराब होते हैं। दृश्य-आधारित प्राथमिकताएं, जो परीक्षण-सेट आँकड़ों पर निर्भर करती हैं, प्राप्त करने योग्य प्रदर्शन की निचली सीमा को परिभाषित करती हैं।

विभिन्न संख्या में चेहरों के साथ छवियों में प्रदर्शन में गिरावट। मॉडल जो वास्तविक समय प्राथमिकता जैसे दशक प्राथमिकता का उपयोग करते हैं, प्रभावित होने से बहुत कम प्रभावित होते हैं, जबकि निष्क्रिय और दृश्य बेसलाइन मॉडल समतल या बड़े समूहों के साथ खराब होते हैं। दृश्य-आधारित प्राथमिकताएं, जो परीक्षण-सेट आँकड़ों पर निर्भर करती हैं, प्राप्त करने योग्य प्रदर्शन की निचली सीमा को परिभाषित करती हैं।

चेहरे की उम्र के अनुमान के लिए सीएसएफडी-1.6एम के मूल्य को प्रदर्शित करने के लिए, डेटासेट का उपयोग व्यापक कार्य के लिए प्रीट्रेनिंग संसाधन के रूप में किया गया था। एक मानक मूल्यांकन प्रोटोकॉल का पालन करते हुए, रेसनेट101 मॉडल को सीएसएफडी-1.6एम, आईएमडीबी-विकी और इमेजनेट पर प्रीट्रेन किया गया और फिर पांच लोकप्रिय बेंचमार्क पर मूल्यांकित किया गया:

पांच चेहरे की उम्र के अनुमान बेंचमार्क पर माध्य पूर्ण त्रुटि (प्लस माइनस मानक विचलन) इमेजनेट, आईएमडीबी-विकी और सीएसएफडी-1.6एम पर प्रीट्रेन किए गए मॉडल की तुलना में। कम मूल्य बेहतर प्रदर्शन को इंगित करते हैं। सीएसएफडी-1.6एम सभी बेंचमार्क पर सबसे मजबूत परिणाम प्रदान करता है।

पांच चेहरे की उम्र के अनुमान बेंचमार्क पर माध्य पूर्ण त्रुटि (प्लस माइनस मानक विचलन) इमेजनेट, आईएमडीबी-विकी और सीएसएफडी-1.6एम पर प्रीट्रेन किए गए मॉडल की तुलना में। कम मूल्य बेहतर प्रदर्शन को इंगित करते हैं। सीएसएफडी-1.6एम सभी बेंचमार्क पर सबसे मजबूत परिणाम प्रदान करता है।

सभी पांच डेटासेट पर, सीएसएफडी-1.6एम पर प्रीट्रेनिंग ने अन्य दो प्रीट्रेनिंग स्रोतों की तुलना में त्रुटि दर में सबसे बड़ा अंतर दिखाया, जो एएफएडी और सीएलएपी2016 पर सबसे मजबूत था, लेकिन पूरे बोर्ड में स्थिर रहा।

हम पाठक को स्रोत पत्र में परिणाम अनुभाग के बाकी हिस्सों के लिए संदर्भित करते हैं, जो व्यापक रूप से अपवर्जन अध्ययनों से भी संबंधित हैं।

निष्कर्ष

हालांकि नया पत्र जल्दी से घना और अनुपयोगी हो जाता है, संबोधित विषय कंप्यूटर विजन साहित्य में सबसे दिलचस्प और प्रासंगिक में से एक है – कम से कम इसलिए कि यह मानव विज्ञान और सांस्कृतिक अध्ययन में कुशलता से पार हो जाता है, जहां स्थिरांक को निर्धारित करना मुश्किल है।

 

* जैसे संगीत का विकास भी अपने परिवर्तन की दर को धीमा कर दिया है।

सोमवार, 10 नवंबर, 2025 को पहली बार प्रकाशित

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai