زاوية Anderson
تغيير الجنس والعرق في نتائج البحث عن الصور باستخدام التعلم الآلي

اقترح بحث تعاوني بين جامعة كاليفورنيا سان دييغو وأدوبي ريسيرش حلًا مبتكرًا ومتقدمًا لعدم وجود تنوع عرقي وجنسي في نتائج البحث عن الصور لمهن تقليدية تهيمن عليها الجماعات البيضاء: استخدام الشبكات التوليدية المعارضة (GANs) لإنشاء صور غير حقيقية لمهن “مُحيزة” ، حيث يتم تغيير جنس و / أو عرق الفرد.
(ADBE )
في هذا المثال من الورقة الجديدة ، أدخل الباحثون خصائص لمصورة مرغوبة التي لا تمثل في مجموعة عادية من المواد الصورية المتاحة ، أو تمثل بطريقة غير مناسبة (أي جنسانية أو تمثيل غير مناسب آخر). مصدر
في ورقة جديدة بعنوان توليد وضبط التنوع في بحث الصور ، يقترح المؤلفون أن هناك حدًا لمدى الذي يمكن أن يصل إليه إعادة ترتيب لتصحيح عدم التوازن بين فئات الصور / الميزات المُحيزة مثل السباك ، مشغل الآلة ، مهندس البرمجيات ، وغيرها الكثير – وربما يكون زيادة التنوع العرقي والجنساني مع البيانات الاصطناعية هو الطريق الأمام لهذه التحدي.
‘سعيًا لتحقيق عالم مثالي ، يجب تزويد مستخدمي المحتوى بفرصة لتقديم أي مهنة بميزات عرقية وجنسية متنوعة.然而 ، فإن الاختيار المحدود للمحتوى الحالي لبعض مجموعات المهنة والجنس والعرق يعرض تحديًا لمقدمي المحتوى. يركز البحث الحالي حول الانحياز في البحث بشكل رئيسي على خوارزميات إعادة الترتيب.
‘ومع ذلك ، لا يمكن لهذه الطرق إنشاء محتوى جديد أو تغيير التوزيع العام للميزات المحمية في الصور.为了 حل هذه المشكلات ، نقترح مهمة جديدة لتوليد الصور عالية الدقة مشروطة على سمات متعددة من مجموعات بيانات غير متوازنة. ‘
لتحقيق ذلك ، قام المؤلفون بتجربة مجموعة متنوعة من أنظمة التوليد الصوري القائمة على GANs ، و终于 استقروا على هيكل يعتمد على StyleGan2.

من المواد الإضافية للورقة ، مثالان لتمثيلات صورية “متساوية” لمهن متحيزة ، في هذه الحالة “النجار” و “مشغل الآلة”. مصدر
غير ممثلة أو تمثيل غير مناسب
يطرح الباحثون التحدي على أنه مشكلة في العالم الواقعي نتائج البحث عن “السباك”* على جوجل صورة ، حيث يلاحظون أن نتائج الصور تهيمن عليها الرجال البيض الشباب.

من الورقة ، نتائج بحث مختارة عن “السباك” على جوجل صورة ، يناير 2021.
يلاحظ المؤلفون أن هناك أدلة على انحياز مماثل لمجموعة من المهن ، مثل “مساعد إداري” و “نظافة” و “مشغل الآلة” ، مع تحيزات متوافقة للعمر والجنس والعرق.
‘غير مفاجئ ، بسبب هذا الانحياز الاجتماعي ، قد تفتقر بعض مجموعات العرق والجنس إلى صور أو تفتقر إليها في مستودع المحتوى. على سبيل المثال ، عندما بحثنا عن “سباك أنثى أسود (أو أفريقي أمريكي)” أو “مساعد إداري ذكر آسيوي” ، لم نجد صورًا ذات صلة على [جوجل صورة]. ‘
‘علاوة على ذلك ، في حالات نادرة ، يمكن أن تؤدي مجموعات معينة من الجنس والعرق إلى تمثيل الأفراد بطريقة غير مناسبة. لقد لاحظنا هذا السلوك عند استعلامات بحث مثل “سباك أنثى آسيوية” أو “حارس أمن أنثى سوداء (أو أفريقية أمريكية)”. ‘
تستشهد الورقة بتعاون أكاديمي آخر من عام 2014 ، حيث جمع الباحثون أفضل 400 نتيجة بحث عن الصور ل 96 مهنة. وجدت تلك الدراسة أن النساء يمثلن فقط 37٪ من النتائج ، والصور غير النمطية 22٪ فقط. دراسة أُجرِيَت في جامعة ييل عام 2019 وجدت أن خمس سنوات أضافت هذه النسب إلى 45٪ و 30٪ على التوالي.
بالإضافة إلى ذلك ، صنفت الدراسة عام 2014 تصنيف الأفراد في بعض المهن في نتائج بحث الصور على أنها مشكلة النجار الجذاب ، مع مثل هذه التصنيفات غير المناسبة التي قد تؤثر على نتائج تعرف المهنة.
الصورة الكبيرة
التحدي الرئيسي للمؤلفين كان في إنتاج نظام توليد صوري قائم على GANs قادر على إخراج صور بدقة 1024×1024 ، حيث في حالة الحالة الحالية للفن في GANs ونظم التوليد والفكودر القائمة على التشفير / الفك التشفير ، 512×512 هو فاخر.
然而 ، يذكر المؤلفون أن دقة أقل لا يمكن أن تتوقع الحصول على زخم في بحث الصور ، واختبروا مجموعة متنوعة من إطارات GANs التي يمكن أن تنتج صورًا بدقة عالية عند الطلب ، بمستوى مقبول من الصحة.
عندما تم اتخاذ قرار اعتماد StyleGan2 ، أصبح واضحًا أن المشروع سيتطلب سيطرة أكبر على الميزات الفرعية للخرج المُولَد (مثل العرق والمهنة والجنس) مما يسمح به التوزيع الافتراضي.

هيكل المولد الصوري المحدد ، الذي يذكر المؤلفون أنه ليس خاصًا ب StyleGAN2 ، ولكن يمكن تطبيقه عبر مجموعة من إطارات المولد.
为了 التحكم في عوامل العرق والجنس والمهنة ، يقوم الهيكل بحقن ترميز واحد لخصائص هذه الميزات المرتبطة في متجه y. بعد ذلك ، يتم استخدام شبكة تغذية للأمام لتحويل هذه الميزات ، بحيث لا يتم تجاهلها في وقت التوليد.
يلاحظ المؤلفون أن هناك حدودًا صعبة لمدى الذي يمكن أن يُمانع به StyleGAN2 ، وأن محاولات أكثر دقة لتعديل النتائج أدت إلى جودة صور أسوأ ، وحتى انهيار الوضع.
然而 ، لا تحل هذه الإصلاحات مشكلات الانحياز الضمني في الهيكل ، والتي كان على الباحثين معالجتها عن طريق عينة زائدة من الكيانات غير الممثلة في مجموعة البيانات ، دون المخاطرة بالتعرض للافراط في التعلم ، مما يؤثر على مرونة تيارات الصور المولدة.
لذلك ، قام المؤلفون بتعديل StyleGAN2-ADA ، الذي يستخدم تعزيز التمييز التكيفي (ADA) ، لمنع التمييز من التعلم الزائد.
توليد البيانات وتقييمها
منذ أن الهدف من المشروع هو توليد بيانات جديدة ، اعتمد الباحثون منهجية المشروع عام 2014 ، واختاروا عددًا من المهن المستهدفة التي تظهر فيها تحيز عرقي وجنسي عالٍ. المهن التي تم اختيارها كانت “مدير تنفيذي” و “مساعد إداري” و “ممرضة” و “فلاح” و “شخص عسكري” و “حارس أمن” و “سائق شاحنة” و “نظافة” و “نجار” و “سباك” و “مشغل آلة” و “دعم تقني” و “مهندس برمجيات” و “كاتب”.
اختار المؤلفون هذه المهن ليس فقط بناءً على مدى الانحياز المتصور في نتائج بحث الصور ، ولكن لأن معظمها يحتوي على بعض المكونات البصرية المحددة للمهنة ، مثل الزي أو وجود معدات أو بيئات محددة.
تم تغذية مجموعة البيانات ب 10,000 صورة من مكتبة أدوبي ستوك ، عادةً ما تحصل على درجة 95٪ أو أعلى عند محاولة تصنيف مهنة.
由于 أن العديد من الصور لم تكن مفيدة للمهمة المستهدفة (أي أنها لم تحتوي على أشخاص) ، كانت الترشيح اليدوي ضروريًا. بعد ذلك ، تم استخدام مصنف قائم على ResNet32 تم تدريبه مسبقًا على FairFace لتصنيف الصور حسب الجنس والعرق ، مع الحصول على دقة متوسطة تبلغ 95.7٪ للجنس و 81.5٪ للعرق. وبالتالي حصل الباحثون على علامات الصور للميزات الجنس: ذكر ، أنثى ، العرق: أبيض ، أسود ، آسيوي ، وعروش أخرى.
تم بناء النماذج باستخدام TensorFlow باستخدام StyleGAN2 و StyleGAN2-ADA كشبكات أساسية. تم إجراء التدريب المسبق باستخدام أوزان StyleGAN2 المُدربة مسبقًا على مجموعة بيانات NVIDIA’s Flickr-Faces-HQ (FFHQ) ، مع تعزيز 34,000 صورة محددة للمهنة التي جمعها المؤلفون في مجموعة بيانات منفصلة أطلقوا عليها Uncurated Stock-Occupation HQ (U-SOHQ).

مثال على مهمة من تقييم Mechanical Turk البشري.
تم توليد الصور في أربعة تكوينات من الهيكل ، مع الحصول على Uniform+ على أفضل النتائج في كل من FID (التقييم الآلي) ، وفي التقييم اللاحق بواسطة عمال Amazon Mechanical Turk. تم استخدام هذا ، إلى جانب دقة التصنيف ، كأداة أساسية للمetric الخاصة بهم ، بعنوان Attribute Matching Score.

تقييم بشري للصور المولدة بطرق مختلفة ، مع إثبات أن طريقة Uniform+ الأكثر إقناعًا ، وبالتالي أساسًا لمجموعة بيانات جديدة.
لا تذكر الورقة ما إذا كانت Stock-Occupation-HQ ، مجموعة البيانات الكاملة المستمدة من Uniform+ ، سوف يتم إتاحتها للجمهور ، ولكنها تشير إلى أن لديها 8,113 صورة HQ (1024×1024).
الانتشار
لا تتناول الورقة الجديدة بشكل صريح كيفية إدخال الصور المُولدة “المعاد توازنها” إلى التداول. من المفترض أن تُ解决 مشكلة الانحياز من خلال إتاحة قواعد بيانات اصطناعية مثل تلك التي أنتجها الباحثون كصور عالية الدقة مجانًا ، باستخدام هذا الحافز التكلفي كمحرك لانتشارها.
يمكن أن تُdistributed قواعد البيانات الاصطناعية مثل تلك التي أنتجها الباحثون كصور عالية الدقة مجانًا ، باستخدام هذا الحافز التكلفي كمحرك لانتشارها.
لا تتناول المشروع الانحياز القائم على العمر ، وهو موضوع محتمل للاهتمام في الأبحاث المستقبلية.
* البحث الملتقط تم إجراؤه في 5 يناير 2022 ، والبحث المذكور في الورقة تم إجراؤه في يناير 2021.
نشر لأول مرة في 5 يناير 2022.












