زاوية Anderson
مطورو تيك توك يمحون الوجوه لتقنيات الواقع المعزز

ByteDance، الشركة متعددة الجنسيات الصينية وراء تيك توك، طورت طريقة جديدة لمحو الوجوه في الفيديو حتى يمكن فرض تشويه الهوية وتأثيرات غريبة أخرى على الأشخاص في تطبيقات الواقع المعزز. وتزعم الشركة أن التقنية قد تم دمجها بالفعل في منتجات تجارية للجوال، على الرغم من أنها لا تذكر أي منتجات.
مرة واحدة يتم محو الوجوه في الفيديو، هناك ما يكفي من “لوحة الوجه” لإنتاج تشويهات عين البوق، بالإضافة إلى وضع هويات أخرى محتملة. وتوفر الأمثلة المقدمة في ورقة جديدة من قبل باحثي ByteDance إمكانيات، بما في ذلك استعادة الميزات “المحو” في مختلف التكوينات الكوميدية (ومن المحتمل بعض التكوينات الغريبة):

بعض إمكانيات إعادة تكوين الوجه الواردة في ورقة ByteDance. مصدر: https://arxiv.org/pdf/2109.10760.pdf
في نهاية أغسطس، أصبح من المعروف أن تيك توك، أول تطبيق غير تابع لشركة فيسبوك يصل إلى ثلاثة مليارات تطبيق، قد أطلق تيك توك إيفكت ستوديو (حاليًا في نسخة بيتا مغلقة)، منصة لمطوري الواقع المعزز لإنشاء تأثيرات الواقع المعزز لتدفقات المحتوى على تيك توك.
بمعنى آخر، الشركة تحاول اللحاق بركب مجتمعات المطورين المماثلة في استوديو الواقع المعزز التابع لشركة فيسبوك و Snap AR، مع مجتمع أبحاث الواقع المعزز التابع لشركة آبل الذي من المتوقع أن يصبح قريبًا محفزًا بواسطة أجهزة جديدة خلال العام المقبل.
التعابير الفارغة
الورقة، التي تحمل عنوان FaceEraser: إزالة أجزاء الوجه للواقع المعزز، تشير إلى أن خوارزميات التعبئة/التكميل الحالية، مثل NVIDIA’s SPADE ، أكثر توجيهًا نحو إكمال الصور المنقوصة أو المنقوصة بشكل جزئي أكثر من أداء هذا الإجراء الغريب “المحو”، وأن المواد في قاعدة البيانات الحالية نادرة بشكل متوقع.
منذ أن لا توجد مجموعات بيانات حقيقية متاحة للأشخاص الذين لديهم مساحة صلبة من اللحم حيث يجب أن يكون وجههم، قام الباحثون بإنشاء بنية شبكة جديدة تسمى pixel-clone، والتي يمكن وضعها في نماذج التعبئة العصبية الحالية، والتي تحل مشاكل تتعلق باختلافات النسيج واللون التي تظهرها الطرق القديمة مثل StructureFlow و EdgeConnect.

هيكل عام لpixel-clone في خط أنابيب جديد.
为了 تدريب نموذج على “الوجوه الفارغة”، استثنى الباحثون الصور التي تحتوي على نظارات أو حيث يغطي الشعر الجبهة، منذ أن يكون الجزء بين خط الشعر والجبهة عادة أكبر مجموعة من البكسل التي يمكن أن توفر “مادة لصق” للخصائص المركزية للوجه.

تحضير الصور للتدريب. يتم قص منطقة الجبهة، بناءً على نقاط مفتاحية في تحديد محاذاة الوجه، وفلترها رأسياً وخياطتها.
يتم الحصول على صورة بحجم 256×256 بكسل، وهي حجم صغير بما يكفي لتدفقها إلى الفضاء الكامن لشبكة عصبية في دفعات كبيرة بما يكفي لتحقيق التعميم. وستستعادة التكبير الخوارزمي في وقت لاحق الدقة اللازمة للعمل في مساحة الواقع المعزز.
الهيكل
يتكون الشبكة من ثلاث شبكات داخلية، تتألف من إكمال الحواف، وpixel-clone، وشبكة تثبيت. يستخدم شبكة إكمال الحواف نفس هيكل المرسل والمستلم المستخدم في EdgeConnect (انظر أعلاه)، وكذلك في تطبيقي Deepfake الشائعين. يقلل المرسلون من حجم المحتوى الصوري مرتين، ويستعيد المرسلون أبعاد الصورة الأصلية.
يستخدم pixel-clone منهجية مرسلة-مستلمة معدلة، في حين تستخدم طبقة التثبيت هيكل U-Net، وهو تقنية تم تطويرها في الأصل لتصوير البيولوجي، والتي غالبًا ما تظهر في مشاريع أبحاث合成 الصور.
خلال تدفق التدريب، من الضروري تقييم دقة التحويلات، واعتمادًا على ذلك، تكرار المحاولات بشكل متكرر حتى التوافق. بهذا الغرض، يتم استخدام两个 مناهج تمييزية dựa على PatchGAN، كل منها يقيم الواقعية المحلية للصور بحجم 70×70 بكسل، مع خصم قيمة الواقعية للصورة بأكملها.
التدريب والبيانات
تتم تدريب شبكة إكمال الحواف بشكل مستقل في البداية، بينما يتم تدريب الشبكتين الأخريين معًا، بناءً على الأوزان الناتجة عن تدريب شبكة إكمال الحواف، والتي يتم تجميدتها خلال هذه الإجراء.
على الرغم من أن الورقة لا تنص صراحة على أن الأمثلة النهائية لتأثيرات التشويه هي الهدف الرئيسي للنموذج، إلا أنها تنفذ تأثيرات كوميدية مختلفة لاختبار متانة النظام، بما في ذلك إزالة الحواجب، وفتح الفم، وتقليل حجم الوجوه الفرعية وتأثيرات “الرسوم المتحركة” (كما هو موضح في الصورة السابقة).
تؤكد الورقة على أن “الوجوه المحوها تمكن من تطبيقات الواقع المعزز المختلفة التي تتطلب وضع عناصر مخصصة للمستخدم”، مما يشير إلى إمكانية تخصيص الوجوه مع عناصر مساهمة من طرف ثالث.
يتم تدريب النموذج على أقنعة من مجموعة FFHQ التي أنشأتها NVIDIA، والتي تحتوي على تنوع كاف من الأعمار والعرقيات والإضاءة وأوضاع الوجه وأساليبها لتحقيق تعميم مفيد. تحتوي المجموعة على 35,000 صورة و10,000 قناع للتدريب لتحديد مناطق التحويل، مع 4000 صورة و1000 قناع محجوزة لأغراض التحقق.

عينات تدريب.
يمكن للنموذج المدرب أداء الاستدلال على البيانات من مجموعة CelebA-HQ وVoxCeleb غير المرئية في عام 2017، ووجوه غير مقيدة غير مرئية من FFHQ، وأي وجوه غير مقيدة غير مرئية مقدمة له. تم تدريب الصور بحجم 256×256 بكسل على الشبكة في دفعات من 8 خلال محسّن Adam، الذي تم تنفيذه في PyTorch، ويعمل على وحدة معالجة رسومات Tesla V100 لمدة “2000,000 kỷ元”.

نتائج الاستدلال التي تم الحصول عليها على وجه حقيقي.
كما هو شائع في أبحاث合_synthesis_ الوجه، يجب على النظام التعامل مع فشل عرضي ناجم عن عوائق أو إغلاق مثل الشعر والإكسسوارات والنظارات والشعر الوجهي.
تختتم التقرير بالقول:
“لقد تم تطبيق نهجنا وتجسيده في المنتجات التجارية، ويعمل جيدًا في المنتجات التي تتمحور حول مدخلات المستخدم غير المقيدة.”












