Anderson का एंगल
चित्र खोज परिणामों में लिंग और जाति बदलना मशीन लर्निंग के साथ

यूसी सैन डिएगो और एडोबी रिसर्च के बीच एक अनुसंधान सहयोग ने पारंपरिक रूप से वास्पी-प्रभुत्व वाले व्यवसायों के लिए चित्र खोज परिणामों में लिंग और जाति विविधता की कमी के लिए एक नवीन और सक्रिय समाधान का प्रस्ताव दिया है: जेनरेटिव एडवर्सेरियल नेटवर्क (GANs) का उपयोग ‘पूर्वाग्रह’ पेशों के लिए गैर-वास्तविक चित्र बनाने के लिए, जहां विषय का लिंग और/या जाति बदल दिया जाता है।
(ADBE )
इस उदाहरण में शोधकर्ताओं ने एक वांछित फोटो के लिए विशेषताओं को इनपुट किया है जो एक典型 कॉर्पस में उपलब्ध नहीं है या अनुचित तरीके से प्रस्तुत किया गया है। स्रोत
एक नए पेपर में, जिसका शीर्षक चित्र खोज में विविधता का सृजन और नियंत्रण है, लेखकों ने सुझाव दिया है कि पुनः रैंकिंग के माध्यम से पूर्वाग्रहित चित्र/विशेषता वर्गों जैसे प्लम्बर, मशीन ऑपरेटर, सॉफ्टवेयर इंजीनियर और कई अन्य को ठीक करने की सीमा है – और यह कि सिंथेटिक डेटा के साथ लिंग और जाति विविधता बढ़ाना इस चुनौती के लिए आगे का तरीका हो सकता है।
‘एक आदर्शवादी दुनिया की खोज में सामग्री उपयोगकर्ताओं को किसी भी पेशे को विभिन्न जाति और लिंग विशेषताओं के साथ प्रस्तुत करने का अवसर प्रदान करना आवश्यक है। कुछ पेशों, जाति और लिंग के संयोजन के लिए मौजूद सामग्री की सीमित पसंद एक चुनौती है। वर्तमान शोध जो खोज में पूर्वाग्रह से संबंधित है, वह मुख्य रूप से पुनः रैंकिंग एल्गोरिदम पर केंद्रित है।
‘हालांकि, ये तरीके नए सामग्री का निर्माण नहीं कर सकते हैं या फोटो में संरक्षित विशेषताओं के वितरण को बदल नहीं सकते हैं। इन समस्याओं को दूर करने के लिए, हम असंतुलित डेटासेट से कई विशेषताओं पर आधारित उच्च-निष्ठा चित्र पीढ़ी की एक नई कार्य का प्रस्ताव करते हैं। ‘
इस उद्देश्य के लिए, लेखकों ने विभिन्न GAN-आधारित चित्र संश्लेषण प्रणालियों के साथ प्रयोग किया है, अंततः StyleGan2 पर आधारित एक वास्तुकला पर बस गया है।

पेपर की पूरक सामग्री से, ‘पूर्वाग्रह’ पेशों के ‘समानीकरण’ चित्र-आधारित प्रस्तुतियों के दो उदाहरण, इस मामले में ‘कारपेंटर’ और ‘मशीन ऑपरेटर’। स्रोत
पर्याप्त रूप से या अनुचित रूप से प्रस्तुत किया गया
शोधकर्ताओं ने इस चुनौती को वास्तविक दुनिया के खोज परिणाम के रूप में फ्रेम किया है* गूगल इमेज खोज पर ‘प्लम्बर’ के लिए, यह देखते हुए कि छवि परिणाम युवा सफेद पुरुषों द्वारा प्रभुत्व है।

पेपर से, गूगल इमेज खोज में ‘प्लम्बर’ के लिए चयनित परिणाम, जनवरी 2021।
लेखकों ने नोट किया है कि ‘प्रशासक सहायक’, ‘क्लीनर’ और ‘मशीन ऑपरेटर’ जैसे विभिन्न पेशों के लिए इसी तरह के पूर्वाग्रह के संकेत हैं, जिसमें आयु, लिंग और जाति के लिए संबंधित पूर्वाग्रह हैं।
‘अप्रत्याशित रूप से, ऐसे सामाजिक पूर्वाग्रह के कारण, जाति और लिंग के कुछ संयोजनों में एक सामग्री भंडार में कुछ या कोई छवियां नहीं हो सकती हैं। उदाहरण के लिए, जब हमने ‘महिला काला (या अफ्रीकी अमेरिकी) मशीन ऑपरेटर’ या ‘पुरुष एशियाई प्रशासक सहायक’ खोजा, तो हमें [गूगल इमेज खोज] पर प्रासंगिक छवियां नहीं मिलीं। ‘
‘इसके अलावा, दुर्लभ मामलों में, जाति और लिंग के विशिष्ट संयोजन व्यक्तियों को अनुचित तरीके से चित्रित कर सकते हैं। हमने इस व्यवहार को ‘महिला एशियाई प्लम्बर’ या ‘महिला काला (या अफ्रीकी अमेरिकी) सुरक्षा गार्ड’ जैसे खोज प्रश्नों के लिए देखा। ‘
पेपर 2014 के एक अन्य अकादमिक सहयोग का हवाला देता है, जहां शोधकर्ताओं ने 96 पेशों के लिए शीर्ष 400 चित्र खोज परिणाम एकत्र किए। उस काम में पाया गया कि महिलाएं केवल 37% परिणामों का प्रतिनिधित्व करती हैं, और गैर-स्टीरियोटाइपिक छवियां केवल 22% हैं। 2019 के एक येल अध्ययन में पाया गया कि पांच साल बाद इन प्रतिशतों को क्रमशः 45% और 30% तक बढ़ा दिया गया था।
इसके अलावा, 2014 के अध्ययन ने कुछ पेशों में व्यक्तियों के यौनीकरण को चित्र खोज परिणामों में सेक्सी कारपेंटर समस्या के रूप में वर्गीकृत किया, जो पेशा पहचान के परिणामों को तिरछा कर सकता है।
बड़ा चित्र
लेखकों के लिए प्राथमिक चुनौती एक GAN-आधारित चित्र संश्लेषण प्रणाली का उत्पादन करने में थी जो 1024×1024 रिज़ॉल्यूशन पर आउटपुट दे सकती है, क्योंकि वर्तमान GAN और एन्कोडर/डिकोडर-आधारित चित्र संश्लेषण प्रणालियों में 512×512 बहुत बड़ा है।
हालांकि, लेखकों का कहना है कि निचले रिज़ॉल्यूशन को छवि खोज में प्राप्ति नहीं मिल सकती है, और उन्होंने उच्च-रिज़ॉल्यूशन छवियों को मांग पर आउटपुट करने में सक्षम विभिन्न GAN फ्रेमवर्क के साथ प्रयोग किया है, जो स्वीकार्य स्तर की प्रामाणिकता पर हैं।
जब यह निर्णय लिया गया कि StyleGan2 को अपनाना है, तो यह स्पष्ट हो गया कि परियोजना को उत्पन्न आउटपुट के उप-विशेषताओं (जैसे जाति, पेशा और लिंग) पर अधिक नियंत्रण की आवश्यकता होगी, जितना कि एक डिफ़ॉल्ट तैनाती अनुमति देती है। इसलिए, लेखकों ने पीढ़ी प्रक्रिया को बढ़ाने के लिए बहु-वर्ग स्थिति का उपयोग किया है।

निर्दिष्ट छवि जनरेटर की वास्तुकला, जिसे लेखक कहते हैं कि StyleGAN2 के लिए विशिष्ट नहीं है, बल्कि विभिन्न जनरेटर फ्रेमवर्क पर लागू किया जा सकता है।
जाति, लिंग और पेशा को नियंत्रित करने के लिए, वास्तुकला इन संयुक्त विशेषताओं का एक-शॉट एन्कोड y वेक्टर में इंजेक्ट करती है। इसके बाद, एक फीडफॉरवर्ड नेटवर्क इन विशेषताओं को एम्बेड करने के लिए उपयोग किया जाता है, ताकि वे पीढ़ी के समय पर उपेक्षित न हों।
लेखकों का कहना है कि StyleGAN2 को इस तरह से मैनिपुलेट करने की सीमाएं हैं, और अधिक बारीकी से परिणामों को बदलने के प्रयासों ने खराब छवि गुणवत्ता और यहां तक कि मोड कोलैप्स का कारण बना।
हालांकि, इन उपचारों ने वास्तुकला में निहित पूर्वाग्रह की समस्याओं का समाधान नहीं किया, जिसे शोधकर्ताओं को डेटासेट से कम प्रतिनिधित्व वाले इकाइयों को ओवरसैंपल करके संबोधित करना था, लेकिन ओवरफिटिंग के जोखिम के बिना, जो उत्पन्न छवि धाराओं की लचीलापन प्रभावित करेगा।
इसलिए, लेखकों ने StyleGAN2-ADA को अनुकूलित किया है, जो अनुकूली विवेचक पूरक (ADA) का उपयोग करता है, ताकि विवेचक को ओवरफिटिंग से रोका जा सके।
डेटा पीढ़ी और मूल्यांकन
चूंकि परियोजना का उद्देश्य नए, संश्लेषित डेटा का उत्पादन करना है, इसलिए शोधकर्ताओं ने 2014 की परियोजना की विधि को अपनाया, जिसमें उच्च जाति और लिंग पूर्वाग्रह वाले लक्ष्य पेशों का चयन किया गया था। चुने गए पेशे ‘कार्यकारी प्रबंधक’, ‘प्रशासक सहायक’, ‘नर्स’, ‘किसान’, ‘सैन्य व्यक्ति’, ‘सुरक्षा गार्ड’, ‘ट्रक चालक’, ‘क्लीनर’, ‘कारपेंटर’, ‘प्लम्बर’, ‘मशीन ऑपरेटर’, ‘तकनीकी सहायता व्यक्ति’, ‘सॉफ्टवेयर इंजीनियर’ और ‘लेखक’ थे।
लेखकों ने इन पेशों का चयन न केवल खोज परिणामों में पूर्वाग्रह की सीमा के आधार पर किया, बल्कि इसलिए भी कि उनमें से अधिकांश में एक पेशे से संबंधित विशिष्ट उपकरण या पर्यावरण की उपस्थिति जैसी कुछ दृश्य घटक होते हैं।
डेटासेट को एडोबी स्टॉक लाइब्रेरी से 10,000 छवियों से ईंधन मिला, जो आमतौर पर एक पेशा को वर्गीकृत करने का प्रयास करते समय 95% स्कोर या बेहतर प्राप्त करता था।
चूंकि कई छवियां लक्ष्य कार्य (अर्थात, वे लोगों को नहीं दिखाती हैं) के लिए उपयोगी नहीं थीं, मैनुअल फिल्टरिंग आवश्यक थी। इसके बाद, ResNet32-आधारित वर्गीकारक को FairFace पर पूर्व-प्रशिक्षित किया गया और लिंग और जाति के लिए छवियों को लेबल करने के लिए उपयोग किया गया, जिसमें क्रमशः 95.7% और 81.5% की औसत सटीकता प्राप्त की गई।
मॉडल को टेंसोरफ्लो में StyleGAN2 और StyleGAN2-ADA के मुख्य नेटवर्क के रूप में बनाया गया था। प्री-ट्रेनिंग को StyleGAN2 के पूर्व-प्रशिक्षित वजनों के साथ किया गया था, जो NVIDIA के Flickr-Faces-HQ Dataset (FFHQ) डेटासेट पर था, जिसे 34,000 पेशा-विशिष्ट छवियों के साथ बढ़ाया गया था, जिन्हें लेखकों ने Uncurated Stock-Occupation HQ (U-SOHQ) नामक एक अलग डेटासेट में एकत्र किया था।

अमेज़न मैकेनिकल टर्क मानव मूल्यांकन से एक नमूना हिट।
छवियों को चार वास्तुकला कॉन्फ़िगरेशन के तहत उत्पन्न की गईं, जिसमें Uniform+ ने अंततः FID (स्वचालित मूल्यांकन) और बाद के मूल्यांकन में अमेज़न मैकेनिकल टर्क श्रमिकों द्वारा सर्वोत्तम स्कोर प्राप्त किया।

विभिन्न तरीकों से उत्पन्न छवियों का मानव मूल्यांकन, जिसमें Uniform+ तरीका सबसे अधिक समझदार साबित हुआ और एक नए डेटासेट के आधार के रूप में इसका उपयोग किया गया।
पेपर में यह नहीं बताया गया है कि Stock-Occupation-HQ, Uniform+ से व्युत्पन्न पूर्ण डेटासेट, सार्वजनिक रूप से उपलब्ध कराया जाएगा या नहीं, लेकिन यह बताया गया है कि इसमें 8,113 HQ (1024×1024) छवियां हैं।
विस्तार
नया पेपर स्पष्ट रूप से संश्लेषित, ‘पुनः संतुलित’ छवियों को परिसंचरण में कैसे पेश किया जा सकता है, इस बारे में नहीं बात करता है। संभवतः, नए (लागत-मुक्त) कंप्यूटर दृष्टि डेटासेट को इस तरह की छवियों से भरना जो लेखकों ने बनाई हैं, पूर्वाग्रह की समस्या का समाधान करेगा, लेकिन यह भी अन्य प्रकार के शोध के लिए बाधाएं पैदा कर सकता है जो वास्तविक दुनिया के दृश्यों में लिंग और जाति समावेशन का मूल्यांकन करना चाहते हैं, जहां सिंथेटिक छवियां वास्तविक दुनिया की छवियों के साथ मिल जाती हैं।
सिंथेटिक डेटाबेस जैसे कि शोधकर्ताओं द्वारा उत्पादित, उच्च-रिज़ॉल्यूशन स्टॉक छवियों के रूप में कोई लागत के बिना उपलब्ध कराया जा सकता है, इस लागत-बचत प्रोत्साहन का उपयोग विस्तार के इंजन के रूप में किया जा सकता है।
परियोजना आयु-आधारित पूर्वाग्रह को संबोधित नहीं करती है, जो संभवतः भविष्य के शोध में रुचि का एक संभावित विषय हो सकता है।
* 5 जनवरी 2022 को कैप्चर की गई खोज, पेपर में उल्लिखित खोज जनवरी 2021 में की गई थी।
पहली बार 5 जनवरी 2022 को प्रकाशित।












