زاوية Anderson
تزوير أجسام ‘أفضل’ باستخدام الذكاء الاصطناعي

بحث جديد من أكاديمية Alibaba DAMO يقدم سير عمل مدفوع بالذكاء الاصطناعي لأتمتة إعادة تشكيل صور الأجسام – جهد نادر في قطاع الرؤية الحاسوبية المشغول حاليًا بـ التلاعب القائم على الوجه مثل الديب فيكس وتحرير الوجه.

إدراج في أعمدة ‘النتيجة’، خرائط الانتباه المولدة التي تحدد المناطق التي يجب تعديلها. المصدر: https://arxiv.org/pdf/2203.04670.pdf
يستخدم هيكل الباحثين تقدير وضعية الهيكل العظمي لمواجهة التعقيد الأكبر الذي تواجهه أنظمة توليد وتحرير الصور عند تصور وتحديد معلمات صور الأجسام الموجودة، على الأقل إلى مستوى من الدقة يسمح بالتحرير المعنوي والانتقائي.

خرائط الهيكل العظمي المقدرة تساعد على تمييز وتركيز الانتباه على مناطق الجسم التي من المحتمل تعديلها، مثل منطقة الذراع العلوية.
يُمكّن النظام المستخدم في النهاية من ضبط معلمات يمكنها تغيير مظهر الوزن أو كتلة العضلات أو توزيع الوزن في صور الأشخاص بطول كامل أو بطول متوسط، وهو قادر على توليد تحولات عشوائية على أجزاء الجسم الملبسة أو غير الملبسة.

اليسار، صورة الإدخال؛ الوسط، خريطة حرارية للمناطق الانتباه المستخلصة؛ اليمين، الصورة المعدلة.
الدافع وراء هذا العمل هو تطوير سير عمل آلي يمكنه استبدال التلاعبات الرقمية الشاقة التي يقوم بها المصورون وفنّانو الرسوم الإنتاجية في فروع الإعلام المتعددة، من الموضة إلى النشرات الأسلوبية ومواد دعائية.
بشكل عام، يقر المؤلفون أن هذه التحولات تُطبق عادةً باستخدام تقنيات “التمويه” في فوتوشوب وغيرها من محرّرات البتات التقليدية، وتُستَخدم تقريبًا حصريًا على صور النساء. وبالتالي، تتكون مجموعة البيانات المخصَّصة التي طُوِّرت لتسهيل العملية الجديدة أساسًا من صور للإناث:
‘نظرًا لأن تعديل الجسم يُرغب فيه أساسًا من قبل الإناث، فإن غالبية مجموعتنا هي صور إناث، مع مراعاة تنوع الأعمار والعرقيات (أفريقي:آسيوي:قوقازي = 0.33:0.35:0.32)، والوضعات، والملابس.’
الورقة بعنوان Structure-Aware Flow Generation for Human Body Reshaping، ومؤلفة من خمسة باحثين مرتبطين بأكاديمية Alibaba العالمية DAMO.
تطوير مجموعة البيانات
كما هو الحال عادةً مع أنظمة توليد وتحرير الصور، احتاج هيكل المشروع إلى مجموعة بيانات تدريب مخصَّصة. كلف المؤلفون ثلاثة مصورين بإنتاج تعديلات فوتوشوب قياسية على صور مناسبة من موقع الصور المخزنة Unsplash، مما أسفر عن مجموعة بيانات – بعنوان BR-5K* – تضم 5,000 صورة عالية الجودة بدقة 2K.
يؤكد الباحثون أن هدف التدريب على هذه المجموعة ليس إنتاج ميزات “مثالية” وعامة تتعلق بمؤشر الجاذبية أو المظهر المرغوب، بل استخراج خرائط الميزات المركزية المرتبطة بالتعديلات المهنية لصور الأجسام.
مع ذلك، يعترفون بأن التعديلات في النهاية تعكس عمليات تحويلية ترسم مسارًا من “الواقع” إلى مفهوم “مثالي” محدد مسبقًا:
‘ندعو ثلاثة فنانين محترفين لتعديل الأجسام باستخدام فوتوشوب بشكل مستقل، بهدف تحقيق أشكال نحيفة تتماشى مع الجماليات الشائعة، ونختار الأفضل كقيمة أساسية.’
نظرًا لأن الإطار لا يتعامل مع الوجوه على الإطلاق، فقد تم تمويه الوجوه قبل إدراجها في مجموعة البيانات.
العمارة والمفاهيم الأساسية
يتضمن سير عمل النظام إدخال صورة بورتريه عالية الدقة، تقليل دقتها إلى مستوى أدنى يتناسب مع موارد الحوسبة المتاحة، واستخراج وضعية خريطة الهيكل العظمي المقدرة (الشكل الثاني من اليسار في الصورة أدناه)، بالإضافة إلى حقول تقارب الأجزاء (PAFs)، التي تم ابتكارها عام 2016 من قبل معهد الروبوتات بجامعة كارنيجي ميلون (انظر الفيديو المضمّن أدناه).
تساعد حقول تقارب الأجزاء على تعريف اتجاه الأطراف والارتباط العام مع الإطار الهيكلي الأوسع، مما يوفّر للمشروع أداة إضافية للانتباه/التحديد.

من ورقة حقول تقارب الأجزاء لعام 2016، تُشفِّر PAFs المتوقعة اتجاه الطرف كجزء من متجه ثنائي الأبعاد يتضمن أيضًا الموقع العام للطرف. المصدر: https://arxiv.org/pdf/1611.08050.pdf
على الرغم من عدم صلتها الظاهرة بملامح الوزن، فإن خرائط الهيكل العظمي مفيدة في توجيه عمليات التحويل النهائية إلى أجزاء الجسم التي تحتاج إلى تعديل، مثل الذراعين العلويين، والمؤخرة، والفخذين.
بعد ذلك، تُغذَّى النتائج إلى وحدة الانتباه الذاتي لتقارب الهيكل (SASA) في نقطة الاختناق المركزية للعملية (انظر الصورة أدناه).

تنظم وحدة SASA اتساق مولد التدفق الذي يغذي العملية، ثم تُمرَّر النتائج إلى وحدة التشويه (الثانية من اليمين في الصورة أعلاه)، التي تُطبق التحولات المتعلمة من التدريب على التعديلات اليدوية المضمنة في مجموعة البيانات.

تُخصص وحدة الانتباه الذاتي لتقارب الهيكل (SASA) الانتباه للأجزاء ذات الصلة من الجسم، مما يساعد على تجنّب التحولات الزائدة أو غير ذات الصلة.
يُعاد بعد ذلك تكبير الصورة الناتجة إلى الدقة الأصلية 2K، باستخدام عمليات لا تختلف كثيرًا عن بنية الديب فيكس القياسية لعام 2017 التي استُندت إليها حزم شائعة مثل DeepFaceLab؛ كما تُستخدم عملية التكبير أيضًا في أطر تحرير GAN.
تم نمذجة شبكة الانتباه للمخطط بناءً على Compositional De-Attention Networks (CODA)، وهو تعاون أكاديمي بين الولايات المتحدة وسنغافورة عام 2019 مع Amazon (AMZN ) AI ومايكروسوفت.
الاختبارات
تم اختبار الإطار القائم على التدفق مقابل أساليب تدفق سابقة مثل FAL وAnimating Through Warping (ATW)، بالإضافة إلى بنى ترجمة الصور Pix2PixHD وGFLA، مع SSIM, PSNR and LPIPS كمعايير تقييم.

نتائج الاختبارات الأولية (اتجاه السهم في العناوين يشير إلى ما إذا كانت القيم الأقل أو الأعلى هي الأفضل).
استنادًا إلى هذه المعايير المتبناة، يتفوق نظام المؤلفين على البنى السابقة.
بالإضافة إلى المقاييس الآلية، أجرى الباحثون دراسة مستخدمين (العمود النهائي من جدول النتائج المعروض سابقًا)، حيث عُرض على 40 مشاركًا 30 سؤالًا تم اختيارها عشوائيًا من مجموعة مكونة من 100 سؤال تتعلق بالصور التي أنتجتها الأساليب المختلفة. فضل 70٪ من المستجيبين التقنية الجديدة باعتبارها أكثر “جاذبية بصريًا”.
التحديات
تمثل الورقة الجديدة رحلة نادرة إلى مجال تعديل الأجسام القائم على الذكاء الاصطناعي. يتركّز قطاع توليد الصور حاليًا إما على إنتاج أجسام قابلة للتعديل عبر أساليب مثل الحقول الإشعاعية العصبية (NeRF)، أو يتركّز على استكشاف الفضاء الكامن لشبكات GAN وإمكانات المشفرات الذاتية لتعديل الوجوه.
مبادرة المؤلفين محدودة حاليًا بإنتاج تغييرات في الوزن المتصور، ولم يطبقوا أي تقنية تعبئة (inpainting) يمكنها استعادة الخلفية التي تُكشف حتمًا عند تنحيف صورة شخص ما.
مع ذلك، يقترحون أن تقنيات تمويه البورتريه ودمج الخلفية عبر الاستدلال النسيجي قد تحل ببساطة مشكلة استعادة الأجزاء التي كانت مخفية في الصورة بسبب “العيوب” البشرية.

حل مقترح لاستعادة الخلفية التي تُكشف نتيجة تقليل الوزن المدفوع بالذكاء الاصطناعي.
* على الرغم من أن النسخة الأولية تشير إلى مواد إضافية تُقدِّم تفاصيل أكثر عن مجموعة البيانات، بالإضافة إلى أمثلة أخرى من المشروع، إلا أن موقع هذه المواد غير متوفر في الورقة، ولم يرد المؤلف المراسل بعد على طلبنا للوصول إليها.
نُشر لأول مرة في 10 مارس 2022.













