زاوية Anderson

تشكيل أنواع الجسم البشري مع تقنيات الذكاء الاصطناعي

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

يقدم مشروع بحثي جديد من الصين طريقة مبتكرة لتشكيل الجسم البشري في الصور، من خلال استخدام شبكة معمارية عصبونية مزدوجة منسقة، وموجهة بنموذج معماري، مما يسمح للمستخدم بتعديل الوزن والطول ونسبة الجسم في واجهة المستخدم التفاعلية.

تعديل معماري للشكل الجسمي، مع شريط التمرير لتعديل ثلاث سمات متاحة. مصدر: https://arxiv.org/pdf/2203.10496.pdf

تعديل معماري للشكل الجسمي، مع شريط التمرير لتعديل ثلاث سمات متاحة. مصدر: https://arxiv.org/pdf/2203.10496.pdf

يقدم هذا العمل عدة تحسينات على مشروع مشابه حديث من شركة Alibaba، حيث يمكنه تعديل الطول ونسبة الجسم بالإضافة إلى الوزن، ويحتوي على شبكة عصبونية مخصصة لملء الخلفية غير المرئية التي يمكن أن تظهر في صور الجسم النحيف. كما يحسن على طريقة معمارية سابقة لتعديل الشكل الجسمي من خلال إزالة الحاجة إلى تدخل بشري مكثف خلال صياغة التحويل.

يسمى هذا النظام NeuralReshaper، ويتوافق مع نموذج ثلاثي الأبعاد للجسم البشري في صورة مصدر، ثم يستخدم التشوهات في النموذج لتعديل الصورة الأصلية وفقًا للمعايير الجديدة.

يمكن للنظام التعامل مع تحويلات الجسم على الأشخاص الملابس وكذلك الأشخاص نصف عراة (أي في ملابس السباحة).

تحويلات من هذا النوع هي حاليًا من المواضيع التي تثير اهتمامًا شديدًا في قطاع أبحاث الذكاء الاصطناعي للأزياء، الذي أنتج العديد من منصات الشبكات العصبونية والمنصات الأخرى لتحويلات الورديات الافتراضية التي يمكن أن تتناسب مع شكل الجسم ونوعه.

تitled الورقة باسم تحويل الجسم البشري في الصورة الواحدة باستخدام الشبكات العصبونية، ويأتي من باحثين في جامعة تشجيانغ في هانجتشو، وكلية الإعلام الإبداعي في جامعة مدينة هونغ كونغ.

SMPL Fitting

يستخدم NeuralReshaper نموذج SMPL (Skinned Multi-Person Linear Model) الذي تم تطويره من قبل معهد ماكس بلانك للنظم الذكية وشركة Industrial Light and Magic في عام 2015.

نماذج SMPL البارامترية للبشر من تعاون Planck/ILM في عام 2015. مصدر: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

نماذج SMPL البارامترية للبشر من تعاون Planck/ILM في عام 2015. مصدر: https://files.is.tue.mpg.de/black/papers/SMPL2015.pdf

في المرحلة الأولى من العملية، يتم إنشاء نموذج SMPL من صورة مصدر يُراد تعديل الشكل الجسمي فيها. يتطابق النموذج مع الصورة وفقًا لمنهجية استعادة الشبكة البشرية التي اقترحها جامعة في ألمانيا والولايات المتحدة في عام 2018.

تتم حساب المعايير الثلاثة للتشوه (الوزن، والطول، ونسبة الجسم) في هذه المرحلة، جنبًا إلى جنب مع اعتبار معايير الكاميرا، مثل البعد البؤري. توفر النقاط الرئيسية ثنائية الأبعاد والتماثل المولّد للصورة الحدود التي يتم فيها تعديل الشكل الجسمي.

<img class="size-full wp-image-180831" src="https://www.unite.ai/wp-content/uploads/2022/03/smpl-reshaping.jpg" alt="مراحل تطبيق SMPL: إلى اليسار، الصورة الأصلية؛ ثانيًا من اليسار، النتيجة المثلى التي تم الحصول عليها من الطريقة المحددة في عام 2016؛ ثالثًا من اليسار، النتيجة المباشرة من نموذج الاسترجاع الشبكي البشري؛ رابعًا من اليمين، النتيجة التي تم الحصول عليها بعد تحسين النقاط الرئيسية ثنائية الأبعاد؛ وأخيرًا، إلى اليمين، التماثل النهائي بعد تحسين التماثل.مراحل تطبيق SMPL: إلى اليسار، الصورة الأصلية؛ ثانيًا من اليسار، النتيجة المثلى التي تم الحصول عليها من الطريقة المحددة في عام 2016؛ ثالثًا من اليسار، النتيجة المباشرة من نموذج الاسترجاع الشبكي البشري؛ رابعًا من اليمين، النتيجة التي تم الحصول عليها بعد تحسين النقاط الرئيسية ثنائية الأبعاد؛ وأخيرًا، إلى اليمين، التماثل النهائي بعد تحسين التماثل.

NeuralReshaper Architecture

يعمل NeuralReshaper على شبكتين عصبونيتين متوازيتين: محرك ترميز للخلفية التي تولد الشكل الجسمي المتحول، ومحرك ترميز للخلفية التي تركز على ملء المناطق الخلفية غير المرئية (في حالة، على سبيل المثال، تقليل حجم الجسم – انظر الصورة أدناه).

Training and Experiments

تم تنفيذ NeuralReshaper باستخدام PyTorch على جهاز NVIDIA 1080ti GPU مع 11 غيغابايت من ذاكرة الوصول العشوائي. تم تدريب الشبكة لمدة 100 دورة تحت خوارزمية Adam، مع ضبط خسارة المولّد على 0.0001 وضبط خسارة المنافس على 0.0004. تم تدريب الشبكة على مجموعة بيانات مخصصة خارجية (مشتقة من COCO وMPII وLSP) مع حجم دفعة 8، ومجموعة بيانات DeepFashion مع حجم دفعة 2.

على اليسار، الصور الأصلية؛ على اليمين، الإخراج المتحول لNeuralReshaper.

على اليسار، الصور الأصلية؛ على اليمين، الإخراج المتحول لNeuralReshaper.

Parametric Necessity

كما لاحظت الورقة، فإن تحويلات الصور الواحدة من هذا النوع تمثل مشكلة غير محددة في توليد الصور. يمكن لمنصات الشبكات العصبونية والمنصات الأخرى استخدام صور متوافقة (مثل المشاريع المخصصة لتحويلات Sketch>Photo وPhoto>Sketch).

然而، في هذه الحالة، سيتطلب ذلك صورًا متوافقة تampilkan نفس الأشخاص في تكوينات جسدية مختلفة، مثل صور “قبل وبعد” في إعلانات الحمية أو جراحة التجميل – بيانات صعبة الحصول عليها أو توليدها.

يمكن لشبكات الشبكات العصبونية التحويلية تدريبها على بيانات أكثر تنوعًا، وتأثير التحويلات من خلال البحث عن الاتجاه الكامن بين رمز الصورة الأصلية والفئة المرغوبة (في هذه الحالة “سمين”، “نحيف”، “طويل”، إلخ.). ومع ذلك، فإن هذا النهج محدود حاليًا لأغراض تحويل الجسم الدقيق.

تعد نماذج Neural Radiance Fields (NeRF) أكثر تقدمًا في محاكاة الجسم الكامل مقارنة بأغلب أنظمة الشبكات العصبونية، لكنها لا تزال محددة بالمشاهد ومتطلبة للموارد، مع القدرة المحدودة الحالية لتعديل أنواع الجسم بطريقة متقنة مثل NeuralReshaper والمشاريع السابقة (باستثناء تقليل حجم الجسم كله بالنسبة إلى بيئته).

يصعب التحكم في مساحة الشبكات العصبونية الكامنة؛ ولا تزال نماذج VAE لا تتعامل مع تعقيدات إعادة إنتاج الجسم الكامل؛ ويظل khả năng NeRF لتحويل الجسم البشري بشكل متسق وواقعي في مرحلة 初期.

لذلك يبدو أن دمج أساليب CGI التقليدية مثل SMPL سيستمر في قطاع أبحاث توليد الصور البشرية، كوسيلة لتحديد وتجميع الميزات والفئات والرموز الكامنة التي لم يتم فهم معاييرها وقابلية استغلالها بعد في هذه التكنولوجيات الناشئة.

نشر لأول مرة في 31 مارس 2022.

كاتب في مجال التعلم الآلي، متخصص في مجال 合成 الصور البشرية. السابق رئيس محتوى البحث في Metaphysic.ai، حتى حلولها في Brahma.ai التابعة لشركة DNEG.
المنصة الشخصية: martinanderson.ai
التواصل: [email protected]