زاوية Anderson

تقدير تنبؤ الجاذبية الوجهية للبث المباشر

mm
أضف Unite.AI إلى مصادرك المفضلة على Google
Image by ChatGPT, with superimposed image from the paper https://arxiv.org/pdf/2501.02509

حتى الآن ، تم دراسة تنبؤ الجاذبية الوجهية (FAP) بشكل رئيسي في سياق البحث النفسي ، وفي صناعة الجمال والتنظيف ، وفي سياق الجراحة التجميلية. إنه مجال دراسة تحدي ، منذ معايير الجمال تميل إلى أن تكون وطنية وليست عالمية.

هذا يعني أن أي قاعدة بيانات فعالة تستند إلى الذكاء الاصطناعي ليست قابلة للتطبيق ، لأن المتوسطات التي تم الحصول عليها من عينة الوجوه / التقييمات من جميع الثقافات سوف تكون متحيزة للغاية (حيث سوف تكتسب الدول الأكثر سكانًا زخمًا إضافيًا) ، أو قابلة للتطبيق على لا ثقافة على الإطلاق (حيث سوف ي相当 متوسط المتوسط من عدة سباقات / تقييمات مع أي سباق حقيقي).

بدلاً من ذلك ، التحدي هو تطوير منهجيات概念ية وعمليات تتدفق فيها بيانات محددة لبلد أو ثقافة يمكن معالجتها ، لتمكين تطوير نماذج FAP الفعالة لكل منطقة.

استخدامات FAP في الجمال والبحث النفسي هامشية للغاية ، أو محددة بالصناعة ؛ لذلك ، تحتوي معظم مجموعات البيانات التي تم جمعها حتى الآن على بيانات محدودة فقط ، أو لم تنشر على الإطلاق.

السهولة في الحصول على تنبؤات الجاذبية الوجهية عبر الإنترنت ، والتي تهدف في الغالب إلى الجماهير الغربية ، لا تمثل بالضرورة حالة الفن في FAP ، والتي يبدو أنها تسيطر عليها الأبحاث الآسيوية الشرقية (بشكل رئيسي الصين) ، ومجموعات بيانات آسيوية شرقية.

أمثلة من ورقة 2020 'تنبؤ الجمال الوجهي الأنثوي الآسيوي باستخدام الشبكات العصبية العميقة عبر النقل والدمج المتعدد القنوات للميزات'. مصدر: https://www.semanticscholar.org/paper/Asian-Female-Facial-Beauty-Prediction-Using-Deep-Zhai-Huang/59776a6fb0642de5338a3dd9bac112194906bf30

أمثلة من ورقة 2020 ‘تنبؤ الجمال الوجهي الأنثوي الآسيوي باستخدام الشبكات العصبية العميقة عبر النقل والدمج المتعدد القنوات للميزات’. مصدر: https://www.semanticscholar.org/paper/Asian-Female-Facial-Beauty-Prediction-Using-Deep-Zhai-Huang/59776a6fb0642de5338a3dd9bac112194906bf30

تتضمن الاستخدامات التجارية الأكثر شمولاً لتقدير الجمال تطبيقات المواعدة عبر الإنترنت ، ونظم الذكاء الاصطناعي التوليدية المصممة لتعزيز الصور الحقيقية للأشخاص (منذ أن تتطلب مثل هذه التطبيقات معيارًا كميًا للجمال كأداة لقياس الفعالية).

رسم الوجوه

الأفراد الجذابون لا يزالون موردًا قيمًا في الإعلان وبناء النفوذ ، مما يجعل الحوافز المالية في هذه القطاعات فرصة واضحة لتقدم مجموعات بيانات FAP و الإطارات.

على سبيل المثال ، يمكن أن يحدد نموذج الذكاء الاصطناعي المدرب بالبيانات العالمية لتقييم وتصنيف الجمال الوجهي الأحداث أو الأفراد الذين لديهم إمكانية عالية للتأثير الإعلاني. سيكون هذا الخيار ذا صلة خاصة في سياق البث المباشر ، حيث تعمل مقاييس مثل “المتابعون” و “الإعجابات” حاليًا فقط كأدلة ضمنية على قدرة الفرد (أو حتى نوع الوجه) على جذب الجمهور.

هذا هو مقياس سطحي ، بالطبع ، والصوت والعرض والمنظور يلعبون أيضًا دورًا مهمًا في جمع الجمهور. لذلك ، يتطلب جمع بيانات FAP إشراف بشري ، بالإضافة إلى القدرة على التمييز بين الجمال الوجهي و “الجمال المزيف” (بدون ذلك ، يمكن للمؤثرين الخارجين عن النطاق مثل Alex Jones أن يؤثروا على منحنى FAP المتوسط ​​للمجموعة المصممة حصريًا لتقييم الجمال الوجهي).

LiveBeauty

للمواجهة نقص مجموعات بيانات FAP ، يقدم الباحثون من الصين أول مجموعة بيانات كبيرة الحجم من FAP ، تحتوي على 100000 صورة وجه ، إلى جانب 200000 تعليق بشري لتقدير الجمال الوجهي.

عينات من مجموعة بيانات LiveBeauty الجديدة. مصدر: https://arxiv.org/pdf/2501.02509

عينات من مجموعة بيانات LiveBeauty الجديدة. مصدر: https://arxiv.org/pdf/2501.02509

المسمى LiveBeauty ، تتميز المجموعة ب 10000 هوية مختلفة ، كلها تم التقاطها من منصات البث المباشر (غير محددة) في مارس 2024.

يقدم المؤلفون أيضًا FPEM ، وهو طريقة FAP متعددة الأوضاع جديدة. يدمج FPEM المعرفة السابقة الشاملة للوجه والميزات الجمالية متعددة الأوضاع عبر وحدة مسبقة للمعرفة الجمالية الشخصية (PAPM) ، ووحدة معالجة جمالية متعددة الأوضاع (MAEM) ، ووحدة دمج متعددة الأوضاع (CMFM).

يزعم الورقة أن FPEM يحقق أداءً على مستوى الدولة في مجموعة بيانات LiveBeauty الجديدة ، ومجموعات بيانات FAP الأخرى. يشير المؤلفون إلى أن البحث له تطبيقات محتملة لتحسين جودة الفيديو ، وتوصية المحتوى ، وتنقيح الوجه في البث المباشر.

كما وعد المؤلفون بنشر المجموعة قريباً – على الرغم من أنه يجب أن يُقر بأن أي قيود ترخيص متأصلة في المجال المصدر يبدو من المحتمل أن تنتقل إلى معظم المشاريع القابلة للتطبيق التي قد تستفيد من العمل.

الورقة الجديدة بعنوان تنبؤ الجمال الوجهي في البث المباشر: معيار جديد وطريقة متعددة الأوضاع ، ويأتي من عشرة باحثين عبر مجموعة Alibaba وجامعة شانغهاي جiao تóng.

الطريقة والبيانات

من كل بث مباشر لمدة 10 ساعات من منصات البث المباشر ، قام الباحثون بقطع صورة واحدة في الساعة للสาม ساعات الأولى. تم اختيار البث الذي لديه أعلى عدد من مشاهدات الصفحة.

خضعت البيانات التي تم جمعها إلى عدة مراحل من المعالجة المسبقة. الأولى هي قياس حجم منطقة الوجه ، والتي تستخدم نموذج FaceBoxes القائم على CPU لعام 2018 ل生成 مربع حدود حول ملامح الوجه. يضمن الخط أن جانب المربع الحدودي الأقصر يتجاوز 90 بكسل ، مما يمنع مناطق الوجه الصغيرة أو الغامضة.

الخطوة الثانية هي كشف التمويه ، وهو يُطبق على منطقة الوجه باستخدام تباين عامل Laplacian في قناة الارتفاع (Y) من المحصول الوجهي. يجب أن يكون هذا التباين أكبر من 10 ، مما يساعد في تصفية الصور المُبهمة.

الخطوة الثالثة هي تقدير موقف الوجه ، والتي تستخدم نموذج تقدير موقف الوجه 3DDFA-V2 لعام 2021:

أمثلة من نموذج تقدير موقف الوجه 3DDFA-V2. مصدر: https://arxiv.org/pdf/2009.09960

أمثلة من نموذج تقدير موقف الوجه 3DDFA-V2. مصدر: https://arxiv.org/pdf/2009.09960

هنا ، يضمن الخط أن زاوية الانحدار لمحصول الوجه المحصول لا تتجاوز 20 درجة ، وزاوية الدوران لا تتجاوز 15 درجة ، مما يستثني الوجوه ذات المواقف المتطرفة.

الخطوة الرابعة هي تقييم نسبة الوجه ، والتي تستخدم أيضًا قدرات التجزئة لنموذج 3DDFA-V2 ، مما يضمن أن نسبة منطقة الوجه المحصول أكبر من 60٪ من الصورة ، واستبعاد الصور التي لا يبرز فيها الوجه.

أخيرًا ، الخطوة الخامسة هي إزالة الشخصيات المكررة ، والتي تستخدم نموذج تعرف الوجه الحالي (غير محدد) ، لحالات تظهر فيها نفس الهوية في أكثر من صورة واحدة من الصور الثلاث التي تم جمعها لفيديو مدته 10 ساعات.

التقييم البشري والتعليق

تم توظيف عشرون معلقًا ، состоящих من ستة ذكور و 14 إناث ، مما يعكس демوغرافية المنصة الحية المستخدمة*. تم عرض الوجوه على شاشة iPhone 14 Pro Max مقاس 6.7 بوصة ، في ظروف معملية متسقة.

تم تقسيم التقييم عبر 200 جلسة ، كل منها يستخدم 50 صورة. تم طلب من الأشخاص تقييم جمال الوجه للعينات على مقياس من 1 إلى 5 ، مع فترة راحة مدتها خمس دقائق بين كل جلسة ، وجميع الأشخاص المشاركين في جميع الجلسات.

لذلك ، تم تقييم جميع الصور 10000 عبر 20 شخصًا ، وصولًا إلى 200000 تعليق.

التحليل والمعالجة المسبقة

أولاً ، تم إجراء فحص ما بعد العرض باستخدام نسبة المخالفات و معامل ارتباط الرتبة Spearman (SROCC). تم اعتبار الأشخاص الذين لديهم تقييمات أقل من 0.75 أو نسبة مخالفات أكبر من 2٪ غير موثوقين وتم إزالتهم ، مع الحصول على 20 شخصًا في النهاية..

ثم تم حساب درجة الرأي المتوسط ​​(MOS) لكل صورة ، عن طريق متوسط الدرجات التي حصل عليها الأشخاص الصالحون. تعمل MOS كعلامة جمال حقيقية لصورة كل ، وتم احتساب الدرجة عن طريق متوسط جميع الدرجات الفردية من كل شخص صالح.

أخيرًا ، أشار تحليل توزيعات MOS للعينات إلى أن لديهم شكلًا شبيهًا بالغاوسي ، وهو ما يتوافق مع توزيعات جمال الوجه في العالم الحقيقي:

أمثلة من توزيعات MOS في LiveBeauty.

أمثلة من توزيعات MOS في LiveBeauty.

يملك معظم الأفراد جمالًا وجهيًا متوسطًا ، مع عدد أقل من الأفراد في النهايات المتطرفة من الجمال الوجهي المنخفض أو المرتفع للغاية.

علاوة على ذلك ، أظهر تحليل الانحراف والذروة أن التوزيعات تميزها ذيول رقيقة ومركزة حول الدرجة المتوسطة ، وأن الجمال العالي كان أكثر شيوعًا بين العينات الأنثوية في مقاطع الفيديو المباشرة المجمعة.

الهيكل

تم استخدام استراتيجية تدريب مرحلية لنموذج FPEM ومرحلة الدمج الهجين في LiveBeauty ، مقسمة عبر أربعة وحدات: وحدة مسبقة للمعرفة الجمالية الشخصية (PAPM) ، وحدة معالجة جمالية متعددة الأوضاع (MAEM) ، وحدة دمج متعددة الأوضاع (CMFM) ووحدة دمج قرار (DFM).

المخطط المفاهيمي لخط أنابيب التدريب في LiveBeauty.

المخطط المفاهيمي لخط أنابيب التدريب في LiveBeauty.

تستخدم وحدة PAPM صورة كمدخل وتستخرج ميزات بصرية متعددة الحجم باستخدام Swin Transformer ، وتستخرج أيضًا ميزات الوجه باستخدام نموذج FaceNet المسبق التدريب. ثم يتم دمج هذه الميزات باستخدام كتلة الانتباه المتقاطع لإنشاء ميزة “جمال” شخصية.

في مرحلة التدريب الأولية ، تستخدم MAEM صورة ونصوص وصف الجمال ، مستفيدة من CLIP لاستخراج ميزات جمالية متعددة الأوضاع.

النصوص الوصفية للمواضيع تكون على شكل ‘صورة لشخص مع {a} جمال’ (حيث {a} يمكن أن يكون سيئ ، ضعيف ، عادل ، جيد أو مثالي). يتم تقدير عملية تقدير مماثلة بين التضمينات النصية والبصرية لتحقيق احتمالية مستوى الجمال.

في مرحلة الدمج الهجين ، تقوم CMFM بتحسين التضمينات النصية باستخدام ميزة الجمال الشخصية التي تم إنشاؤها بواسطة PAPM ، مما يؤدي إلى إنشاء تضمينات نصية شخصية. ثم تستخدم استراتيجية انحدار المماثلة لإنشاء تنبؤ.

أخيرًا ، تقوم DFM بدمج التنبؤات الفردية من PAPM و MAEM و CMFM لتحقيق درجة جمال نهائية واحدة ، بهدف تحقيق إجماع متين.

دالات الخسارة

للمقاييس الخسارة ، يتم تدريب PAPM باستخدام خسارة L1 ، وهي مقياس للفرق المطلق بين درجة الجمال التنبؤية ودرجة الجمال الفعلية (الجمال الحقيقي).

تستخدم وحدة MAEM دالة خسارة أكثر تعقيدًا التي تدمج خسارة التقييم (LS) مع خسارة التصنيف المدمجة (LR). تتكون خسارة التصنيف (LR) من خسارة الإخلاص (LR1) وخسارة التصنيف ثنائية الاتجاه (LR2).

تقييم LR1 العلاقات النسبية للجمال بين أزواج الصور ، في حين أن LR2 يضمن أن توزيع الاحتمالات التنبؤية لمستويات الجمال له قمة واحدة وينخفض في كلا الاتجاهين. يهدف هذا النهج المدمج إلى تحسين التقييم الدقيق وترتيب الصور وفقًا للجمال.

يتم تدريب CMFM و DFM باستخدام خسارة L1 البسيطة.

الاختبارات

في الاختبارات ، واجه الباحثون LiveBeauty تسعة نهجات سابقة: ComboNet؛ 2D-FAP؛ REX-INCEP؛ CNN-ER (ميزة في REX-INCEP)؛ MEBeauty؛ AVA-MLSP؛ TANet؛ Dele-Trans؛ و EAT.

كما تم اختبار أساليب Image Aesthetic Assessment (IAA) التي تتوافق مع بروتوكول IAA. كانت هذه ViT-B؛ ResNeXt-50؛ و Inception-V3.

بالإضافة إلى LiveBeauty ، تم اختبار مجموعتي البيانات التاليين: SCUT-FBP5000 و MEBeauty. فيما يلي ، يتم مقارنة توزيعات MOS لهذه المجموعات:

توزيعات MOS لمجموعات البيانات المرجعية.

توزيعات MOS لمجموعات البيانات المرجعية.

تم تقسيم هذه المجموعات الضيفة إلى 60٪ و 40٪ و 80٪ و 20٪ للتدريب والاختبار ، على التوالي ، للحفاظ على الاتساق مع بروتوكولاتها الأصلية. تم تقسيم LiveBeauty بنسبة 90٪ و 10٪.

لتهيئة النموذج في MAEM ، تم استخدام VT-B/16 و GPT-2 كمشفرات الصورة والنص ، على التوالي ، تم تهيئتها بإعدادات من CLIP. بالنسبة إلى PAPM ، تم استخدام Swin-T كمشفر صورة قابل للتدريب ، وفقًا لـ SwinFace.

تم استخدام محسّن AdamW ، ومجدول معدل التعلم مع إعدادات إعادة تسخين خطية تحت مخطط تسخين كوزي. تختلف معدلات التعلم عبر مراحل التدريب ، ولكن كل منها كان له حجم دفعة 32 ، لمدة 50 دورة.

نتائج الاختبارات

نتائج الاختبارات

تظهر نتائج الاختبارات على مجموعات بيانات FAP الثلاثة أعلاه. من بين هذه النتائج ، تنص الورقة على ما يلي:

‘الطريقة المقترحة تحقق المركز الأول وتفوق المركز الثاني بحوالي 0.012 و 0.081 و 0.021 من حيث قيم SROCC على LiveBeauty و MEBeauty و SCUT-FBP5500 على التوالي ، مما يظهر تفوق الطريقة المقترحة.

‘أساليب IAA أقل من أساليب FAP ، مما يدل على أن أساليب التقييم الجمالي العامة تتجاهل الميزات الوجهية المشاركة في الطبيعة الخاضعة للجمال الوجهي ، مما يؤدي إلى أداء سيئ على مهام FAP.

‘أداء جميع الأساليب ينخفض بشكل كبير على MEBeauty. هذا لأن العينات التدريبية محدودة والوجوه متنوعة عرقياً في MEBeauty ، مما يشير إلى وجود تنوع كبير في الجمال الوجهي.

‘جميع هذه العوامل تجعل تنبؤ الجمال الوجهي في MEBeauty أكثر تحديًا.’

الاعتبارات الأخلاقية

البحث في الجمال هو بحث قد يكون مثيرًا للانقسام ، منذ أن تميل هذه الأنظمة إلى تعزيز التحيزات حول العمر والعرق والعديد من أقسام البحث في الرؤية الحاسوبية المتعلقة بالبشر.

يمكن القول إن نظام FAP يعتمد بشكل nội على تعزيز وتعزيز وجهات النظر الجزئية والمتحيزة حول الجمال. قد تنشأ هذه الأحكام من تعليقات بشرية قادرة على التوجيه – غالبًا ما تتم على مقياس صغير جدًا للتحديد النطاقي – أو من تحليل أنماط الانتباه في البيئات عبر الإنترنت مثل منصات البث ، والتي ، بحجج معقولة ، بعيدة عن أن تكون ميريتوقراطية.

* الورقة تشير إلى المجال (المجالات) المصدر غير المسمى في كل من المفرد والجمع.

نشر لأول مرة يوم الأربعاء ، 8 يناير 2025

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai