زاوية Anderson
إنشاء أجسام ‘أفضل’ باستخدام الذكاء الاصطناعي

تقدم الأبحاث الجديدة من أكاديمية Alibaba DAMO إطار عمل مدفوع بالذكاء الاصطناعي لتحويل الصور بشكل تلقائي – وهو جهد نادر في قطاع الرؤية الحاسوبية الحالي الذي يهيمن عليه تحويلات الوجه مثل Deepfakes وGAN-based.

Inset in ‘result’ columns, the generated attention maps which define the areas to be amended. Source: https://arxiv.org/pdf/2203.04670.pdf
يستخدم الباحثون هيكلًا يستخدم تقدير وضع الهيكل العظمي لمواجهة التعقيد الأكبر الذي تواجهه أنظمة التركيب والتعديل على الصور في概念ية وتمثيل الصور الحالية ، على الأقل إلى مستوى من التفاصيل التي تسمح بالتعديل الانتقائي.

Estimated skeleton maps help to individuate and focus attention on areas of the body likely to be retouched, such as the upper arm area.
يسمح النظام في النهاية للمستخدم بتعيين معايير يمكن أن تغير مظهر الوزن أو الكتلة العضلية أو توزيع الوزن في الصور الكاملة أو الصور المتوسطة للأشخاص ، ويمكنه توليد تحويلات عشوائية على أجزاء الجسم الملبوسة أو العارية.

Left, the input image; middle, a heat-map of the derived attention areas; right, the transformed image.
الدوافع وراء هذا العمل هي تطوير عمليات تلقائية يمكن أن تحل محل التحويلات الرقمية الشاقة التي يقوم بها المصورون وفنيي الرسومات الإنتاجية في فروع مختلفة من الإعلام ، من الأزياء إلى الإخراج النمطي و المواد الدعائية.
بشكل عام ، يعترف المؤلفون بأن هذه التحويلات تطبق عادةً باستخدام تقنيات “التحويل” في برنامج Adobe Photoshop و محررات Bitmap التقليدية الأخرى ، وتستخدم تقريباً حصرياً على صور النساء. وبالتالي ، يتكون مجموعة البيانات المخصصة التي تم تطويرها لتسهيل العملية الجديدة في الغالب من صور للموضوعات الأنثوية:
‘نظرًا لأن تعديل الجسم يُطلب في الغالب من قبل النساء ، فإن معظم مجموعتنا تتكون من صور نسائية ، مع الأخذ في الاعتبار تنوع الأعمار والأجناس (أفريقي: آسيوي: كوكساني = 0.33:0.35:0.32) والوضع والملابس.’
المقال ، الذي يحمل عنوان Structure-Aware Flow Generation for Human Body Reshaping ، يأتي من خمسة مؤلفين مرتبطين بأكاديمية Alibaba العالمية DAMO.
تطوير المجموعة البيانية
كما هو الحال مع أنظمة التركيب والتعديل على الصور ، يتطلب هيكل المشروع مجموعة بيانات مخصصة. لجأت الباحثون إلى ثلاثة مصورين لإنشاء تحويلاتPhotoshop القياسية للصور المناسبة من موقع Stock Photography Unsplash ، مما أدى إلى مجموعة بيانات – تحمل عنوان BR-5K* – تتكون من 5000 صورة عالية الجودة بدقة 2K.
يشدد الباحثون على أن الهدف من التدريب على هذه المجموعة البيانية ليس إنتاج ميزات “مثالية” ومحسنة تتعلق بمؤشر الجاذبية أو المظهر المرغوب فيه ، ولكن لاستخراج الخريطة المركزية للميزات المرتبطة بالتحويلات المهنية للصور الجسدية.
然而 ، يقررون بأن التحويلات في النهاية تعكس عمليات تحويلية تترجم تقدمًا من “حقيقي” إلى مفهوم مسبق لـ “مثالي”:
‘ندعو ثلاثة فنانين محترفين لتعديل الأجسام باستخدام برنامج Photoshop بشكل مستقل ، بهدف تحقيق أشكال رشيقة تتوافق مع الجمال الشائع ، ونختار الأفضل كمرجع.’
由于 الإطار لا يتعامل مع الوجوه على الإطلاق ، تم تمييزها قبل إضافتها إلى المجموعة البيانية.
الهيكل والمفاهيم الأساسية
يتضمن سير عمل النظام إدخال صورة بدرجة عالية ، وتقليل دقتها إلى دقة منخفضة يمكن أن تتناسب مع الموارد الحاسوبية المتاحة ، واستخراج خريطة هيكل عظمي محسوبة (الرسم الثاني من اليسار في الصورة أدناه) ، بالإضافة إلى مجالات الانحدار الجزئي (PAFs) ، والتي تم اختراعها في عام 2016 من قبل معهد الروبوتات في جامعة كارنيجي ميلون (انظر الفيديو المرفق مباشرة أدناه).
تساعد مجالات الانحدار الجزئي في تحديد اتجاه الأطراف والارتباط العام بالإطار الهيكلي الأوسع ، مما يوفر للمشروع الجديد أداة محلية/انتباه إضافية.

From the 2016 Part Affinity Fields paper, predicted PAFs encode limb orientation as part of a 2D vector that also includes the general position of the limb. Source: https://arxiv.org/pdf/1611.08050.pdf
على الرغم من عدم صلة الخريطة الهيكلية الواضحة بمظهر الوزن ، فإنها مفيدة في توجيه العمليات التحويلية النهائية إلى أجزاء الجسم التي يجب تعديلها ، مثل الذراعين العلويين والخلف والفخذين.
بعد ذلك ، يتم إطعام النتائج إلى وحدة الانتباه الذاتي للانسيابية الهيكلية (SASA) في عنق الزجاجة المركزي للعملية (انظر الصورة أدناه).

تنظم وحدة SASA استمرارية مولد الانسياب الذي يغذي العملية ، وتنقل النتائج إلى وحدة التحويل (ثاني من اليمين في الصورة أعلاه) ، والتي تطبق التحويلات التي تمت من خلال التدريب على التنقيحات اليدوية المضمنة في المجموعة البيانية.

The Structure Affinity Self-Attention (SASA) module allocates attention to pertinent body parts, helping to avoid extraneous or irrelevant transformations.
تتم إعادة عينة الصورة الناتجة إلى دقة الأصل 2K ، باستخدام عمليات لا تختلف كثيرًا عن هيكل Deepfake القياسي عام 2017 الذي تم اشتقاق حزم شعبية مثل DeepFaceLab منه ؛ عملية العينة أيضًا شائعة في إطارات تحرير GAN.
تم نمذجة شبكة الانتباه للschema بعد Compositional De-Attention Networks (CODA) ، وهي تعاون أكاديمي بين الولايات المتحدة وسنغافورة مع Amazon AI و Microsoft.
الاختبارات
تم اختبار إطار العمل القائم على الانسياب ضد الطرق السابقة القائمة على الانسياب FAL و ATW ، بالإضافة إلى هيكليات الترجمة الصورية Pix2PixHD و GFLA ، مع SSIM, PSNR and LPIPS كأدوات تقييم.

Results of initial tests (arrow direction in headers indicates whether lower or higher figures are best).
استنادًا إلى هذه الأدوات التقييمية ، يتفوق نظام المؤلفين على الهياكل السابقة.

Selected results. Please refer to the original PDF linked in this article for higher resolution comparisons.
بالإضافة إلى المقاييس التلقائية ، أجرى الباحثون دراسة مستخدمين (العمود الأخير من جدول النتائج المذكور سابقًا) ، حيث تم عرض 30 سؤالاً على 40 مشاركًا بشكل عشوائي من مجموعة من 100 سؤال تتعلق بالصور التي تم إنتاجها عبر الطرق المختلفة. وافق 70٪ من المستجيبين على تقنية جديدة أكثر “جاذبية بصرية”.
التحديات
يمثل هذا المقال الجديد مغامرة نادرة في تحويل الجسم باستخدام الذكاء الاصطناعي. يهيمن قطاع التركيب الصوري حاليًا على توليد أجسام قابلة للتعديل باستخدام طرق مثل Neural Radiance Fields (NeRF) ، أو يركز على استكشاف الفضاء الكامن لشبكات الجانب المعاكس و潜力 المحول التلقائي للتعديل على الوجه.
يحدد مبادرة المؤلفين حاليًا إلى إنتاج تغييرات في الوزن المتصور ، ولم يتم تنفيذ أي تقنية تكميم للتعويض عن الخلفية التي يتم الكشف عنها عند تحويل صورة شخص.
然而 ، يقترحون أن تكنولوجيا تكميم الصورة ودمج الخلفية من خلال الاستدلال النصي يمكن أن تحل بسهولة مشكلة استعادة أجزاء العالم التي كانت مخفية في الصورة بسبب “النقص” البشري.

A proposed solution for restoring background that’s revealed by AI-driven fat reduction.
* يرجى ملاحظة أن المقال يحتوي على مواد إضافية توفر المزيد من التفاصيل حول المجموعة البيانية ، بالإضافة إلى أمثلة إضافية من المشروع ، ولكن لم يتم توفير موقع هذه المواد في المقال ، ولم يرد المؤلف الم対応 بعد على طلبنا للحصول على الوصول.
نشر لأول مرة في 10 مارس 2022.












