زاوية Anderson

تحديد عمليات التلاعب بالصور الفوتوغرافية ل المشاهير من المناطق الخارجية للوجه

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

اقترح تعاون جديد بين مايكروسوفت وجامعة صينية طريقة جديدة لتحديد عمليات التلاعب بالصور الفوتوغرافية للمشاهير، من خلال الاستفادة من نقاط الضعف في تقنيات التلاعب الحالية لتحديد الهويات التي تم “إسقاطها” على أشخاص آخرين.

تسمى هذه الطريقة مُحَوِّل الهوية المتسقة (ICT)، وتعمل عن طريق مقارنة أجزاء الوجه الخارجية (الذقن، عظام الخد، خط الشعر، وغيرها من الخطوط الخارجية) بالجزء الداخلي من الوجه. يستفيد النظام من البيانات العامة المتاحة للصور الفوتوغرافية للمشاهير، مما يحد من فعاليتها إلى المشاهير الشهيرين، الذين تتوفر صورهم بكميات كبيرة في مجموعات الرؤية الحاسوبية المتاحة على نطاق واسع وعلى الإنترنت.

مناطق تغطية التلاعب بالصور الفوتوغرافية المزيفة عبر سبع تقنيات: DeepFake في FF+؛ DeepFake في كشف التلاعب بالصور الفوتوغرافية من جوجل؛ DeepFaceLab؛ Face2Face؛ FSGAN؛ وDF-VAE. مصدر: https://arxiv.org/pdf/2203.01318.pdf

مناطق تغطية التلاعب بالصور الفوتوغرافية المزيفة عبر سبع تقنيات: DeepFake في FF+؛ DeepFake في كشف التلاعب بالصور الفوتوغرافية من جوجل؛ DeepFaceLab؛ Face2Face؛ FSGAN؛ وDF-VAE. تُقدم حزم شائعة مثل DeepFaceLab وFaceSwap تغطية مماثلة. مصدر: https://arxiv.org/pdf/2203.01318.pdf

كما توضح الصورة أعلاه، فإن الطرق الشائعة الحالية لعمليات التلاعب بالصور الفوتوغرافية مقيدة بموارد محدودة، وتعتمد على وجوه مضيفة “متوافقة” لتقليل الأدلة على استبدال الوجه.

على الرغم من أن الطرق المختلفة قد تشمل الجبهة الكاملة وجزء كبير من منطقة الذقن وعظام الخد، إلا أنها مقيدة جميعًا داخل إطار الوجه المضيف.

خريطة التلاعب بالصور الفوتوغرافية التي تبرز الهويات 'الداخلية' و'الخارجية' المحسوبة بواسطة ICT. عندما يتم تحديد تطابق للوجه الداخلي ولكن لا تتطابق الهوية الخارجية، يقيم ICT الصورة على أنها كاذبة.

خريطة التلاعب بالصور الفوتوغرافية التي تبرز الهويات ‘الداخلية’ و’الخارجية’ المحسوبة بواسطة ICT. عندما يتم تحديد تطابق للوجه الداخلي ولكن لا تتطابق الهوية الخارجية، يقيم ICT الصورة على أنها كاذبة.

في الاختبارات، أثبت ICT قدرته على كشف محتوى التلاعب بالصور الفوتوغرافية في بيئات友ية للتلاعب بالصور الفوتوغرافية، مثل مقاطع الفيديو منخفضة الدقة، حيث يتم تدهور محتوى الفيديو بالكامل بسبب تشويهات الضغط، مما يساعد على إخفاء الأدلة المتبقية لعملية التلاعب بالصور الفوتوغرافية – وهو ظرف يربك العديد من طرق كشف التلاعب بالصور الفوتوغرافية الأخرى.

ICT يتفوق على المنافسين في التعرف على محتوى التلاعب بالصور الفوتوغرافية. انظر الفيديو المرفق في نهاية المقال لمزيد من الأمثلة وأفضل دقة. مصدر: https://www.youtube.com/watch?v=zgF50dcymj8

ICT يتفوق على المنافسين في التعرف على محتوى التلاعب بالصور الفوتوغرافية. انظر الفيديو المرفق في نهاية المقال لمزيد من الأمثلة وأفضل دقة. انظر الفيديو المصدر المرفق في نهاية المقال لمزيد من الأمثلة. مصدر: https://www.youtube.com/watch?v=zgF50dcymj8

الورقة البحثية المعنية بعنوان حماية المشاهير بمحول الهوية المتسقة، وهي من تأليف تسعة باحثين من جامعة العلوم والتكنولوجيا في الصين، ومايكروسوفت ريسيرش آسيا، ومايكروسوفت كلاود + إيه آي.

فجوة المصداقية

هناك على الأقل سببان لماذا تنظر خوارزميات التبادل الشهيرة مثل DeepFaceLab و FaceSwap إلى المناطق الخارجية للهويات المتبادلة.

أولاً، تدريب نماذج التلاعب بالصور الفوتوغرافية يعتبر عملية استهلاكية للزمن وموارد الحاسوب، وتحرير وجوه مضيفة “متوافقة” يحرر دورات حاسوبية وepochs لتركيزها على المناطق الداخلية غير المتغيرة نسبيًا من الوجه التي نستخدمها لتمييز الهوية (منذ المتغيرات مثل التقلبات في الوزن والتغيرات الناتجة عن الشيخوخة أقل احتمالاً لتغيير هذه السمات الأساسية للوجه في المدى القصير).

ثانيًا، فإن معظم نهج التلاعب بالصور الفوتوغرافية (وهو بالتأكيد الحال مع DeepFaceLab، وهو البرنامج الذي يستخدمه الممارسون الأكثر شهرة أو إثارة للجدل) لديهم القدرة المحدودة على تكرار حواف الوجه مثل منطقة الخد والذقن، ويتأثرون بالحقيقة التي أنهم مقيدون بحقيقة أن رمزهم المصدر السابق (2017) لم يعالج هذه القضية على نطاق واسع.

في الحالات التي لا تتطابق فيها الهويات جيدًا، يجب على خوارزمية التلاعب بالصور الفوتوغرافية “تعبئة” المناطق الخلفية حول الوجه، وهو ما تفعله بصور बदية على أفضل تقدير، حتى في أيدي أفضل المخادعين، مثل Ctrl Shift Face، الذي استخدم إنتاجهم في دراسات الورقة.

تحديد التلاعب بالصور الفوتوغرافية من خلال تحليل التوقيعات المختلفة لأنواع النماذج في إطار FaceSwap.

تحديد التلاعب بالصور الفوتوغرافية من خلال تحليل التوقيعات المختلفة لأنواع النماذج في إطار FaceSwap.

على النقيض من ذلك، يخلق هيكل ICT هويات منفصلة متداخلة لشخص، ويجب التحقق من كل منهما قبل أن يتم استنتاج الهوية بأكملها على أنها “صحيحة” أو صورية.

هيكل مراحل التدريب والاختبار ل ICT.

هيكل مراحل التدريب والاختبار ل ICT.

ينفذ انقسام الهويات بواسطة محول رؤية Transformer، الذي يؤدي تحديد الوجه قبل تقسيم المناطق المفتش عنها إلى رموز تنتمي إلى الهويات الداخلية أو الخارجية.

توزيع الباتشات بين المؤشرات الهوية المتوازية.

توزيع الباتشات بين المؤشرات الهوية المتوازية.

تنص الورقة على ما يلي:

‘لسوء الحظ، تميل طرق التحقق من الوجه الحالية إلى تحديد المنطقة الأكثر تمييزًا، أي الوجه الداخلي للتحقق، وتفشل في التقاط معلومات الهوية في الوجه الخارجي. مع محول الهوية المتسقة، نقوم بتدريب نموذج لتعلم زوج من متجهات الهوية، واحدة للوجه الداخلي والأخرى للوجه الخارجي، من خلال تصميم Transformer بحيث يمكن تعلم الهويات الداخلية والخارجية بشكل متزامن في نموذج موحد.

نظرًا لعدم وجود نموذج موجود لهذا بروتوكول التعريف، فقد ابتكر المؤلفون نوعًا جديدًا من خسارة الاتساق التي يمكن أن تعمل كمعيار للصحة. يتم إضافة “رمز الداخل” و “رمز الخارج” الناتجين عن نموذج استخراج الهوية إلى التضمينات الرقعية التقليدية التي تنتجها إطارات تحديد الوجه.

البيانات والتدريب

تم تدريب شبكة ICT على مجموعة بيانات مايكروسوفت ريسيرش MS-Celeb-1M، التي تحتوي على 10 ملايين صورة لوجوه المشاهير تغطي مليون هوية، بما في ذلك الممثلين والسياسيين والعديد من أنواع الشخصيات البارزة الأخرى. وفقًا لإجراء الطريقة السابقة Face X-ray (مبادرة أخرى من مايكروسوفت ريسيرش)، يتم إنشاء روتين إنشاء التلاعب بالصور الفوتوغرافية ل ICT عن طريق تبادل المناطق الداخلية والخارجية لوجوه من هذه المجموعة البيانية من أجل إنشاء مواد لاختبار الخوارزمية.

لإجراء هذه التبادل الداخلية، يتم تحديد ICT لصورتين في المجموعة البيانية التي تظهر مواقف رأس وسمات وجه متشابهة، ويتم إنشاء منطقة масك للسمات المركزية (التي يمكن فيها إجراء التبادل)، ويتم إجراء التلاعب بالصور الفوتوغرافية مع تصحيح لون RGB.

السبب في أن ICT مقيد بالتحديد للهويات المشاهير هو أنه يعتمد (في أكثر أشكاله فعالية) على مجموعة مرجعية جديدة تدمج متجهات وجه مشتقة من مجموعة مركزية (في هذه الحالة MS-Celeb-1M، على الرغم من أن المرجعية يمكن توسيعها إلى صور متاحة على الإنترنت، والتي من المرجح أن تتوفر فقط بكميات كافية لشخصيات عامة معروفة).

تعتبر هذه الأزواج من المتجهات المشتقة تمثيل “ميزات عالية المستوى”، مما يؤدي إلى عملية كشف التلاعب بالصور الفوتوغرافية أكثر احتمالاً للبقاء في بيئات محددة مثل مقاطع الفيديو منخفضة الدقة أو المعدلة.

الاختبارات

تم تدريب ICT على MS-Celeb-1M، ثم تم تقسيمه إلى نسخة مساعدة المرجع و “أعمى” من الخوارزمية، وتم اختباره ضد مجموعة من مجموعات البيانات والطرق المنافسة. وشملت هذه FaceForensics++ (FF++)، مجموعة من 1000 فيديو حقيقي ومتلاعب به، تم إنشاؤها عبر أربعة طرق بما في ذلك Face2Face وFaceSwap؛ وكشف التلاعب بالصور الفوتوغرافية من جوجل Deepfake Detection (DFD)، الذي يتكون أيضًا من آلاف فيديوهات التلاعب بالصور الفوتوغرافية التي أنشأتها جوجل؛ Celeb-DeepFake v1 (CD1)، التي تتميز ب 408 فيديو حقيقي و 795 فيديو مزيف، منخفض التلاعب، وCeleb-DeepFake v2، وهو امتداد ل V1 يحتوي على 590 فيديو حقيقي و 5,639 فيديو مزيف؛ والصين 2020 Deeper-Forensics (Deeper).

هذه هي مجموعات البيانات؛ كانت طرق الكشف في تحديات الاختبار Multi-task، MesoInc4، Capsule، Xception-c0، c2 (طريقة تستخدم في FF++)، FWA/DSP-FW من جامعة ألباني، Two-Branch، PCL+I2G، وطريقة التناقض السياقي ل Yuval Nirkin.

النَتائِجُ الأَكثَر وضوحًا من الاختبار هي أن الطرق المنافسة تتراجع بشكل كبير في الفعالية مع انخفاض دقة و جودة الفيديو. منذ أن يوجد بعض الاحتمالات الأكثر خطورة لاختراق التلاعب بالصور الفوتوغرافية لسلطاتنا التمييزية في مقاطع الفيديو غير عالية الدقة أو المعدلة، يبدو هذا نتيجة مهمة.

في الرسم البياني أعلاه، تشير الخطوط الزرقاء والحمراء إلى متانة طرق ICT للاهتراء في جميع المناطق باستثناء حجر الزاوية من الضوضاء الغاوسية (التي ليست احتمالاً في لقطات الفيديو من Zoom و الويبكام)، بينما تنخفض موثوقية الطرق المنافسة بشكل حاد.

في جدول النتائج أدناه، نرى فعالية طرق كشف التلاعب بالصور الفوتوغرافية المختلفة على مجموعات البيانات غير المرئية. تشير النتائج الرمادية والموسومة بالنجوم إلى مقارنة من النتائج المنشورة في المشاريع المغلقة المصدر، والتي لا يمكن التحقق منها خارجيًا. عبر معظم الإطارات القابلة للمقارنة، يتفوق ICT على طرق كشف التلاعب بالصور الفوتوغرافية المنافسة (المعروضة بالخط العريض) على مجموعات البيانات المجراة.

كاختبار إضافي، قام المؤلفون بتشغيل محتوى من قناة يوتيوب للمخادع المخادع Ctrl Shift Face، ووجدوا أن الطرق المنافسة تحقق درجات تحديد أقل بكثير:

من الملاحظ هنا أن طرق FF++ (Xception-c23) و FFD، التي تحقق بعض أعلى الدرجات عبر بعض بيانات الاختبار في اختبارات الورقة الجديدة، تحقق درجات أقل بكثير من ICT في سياق “عالمي” من محتوى التلاعب بالصور الفوتوغرافية ذي الجهد العالي.

يختم المؤلفون الورقة بالآمال أن توجيه نتائجها مجتمع كشف التلاعب بالصور الفوتوغرافية نحو مبادرات مماثلة تركز على ميزات عالية المستوى أكثر قابلية للتعميم، وبعيدًا عن “الحرب الباردة” لكشف الدلائل، حيث يتم إلغاء أحدث الطرق بانتظام بسبب التطورات في إطارات التلاعب بالصور الفوتوغرافية، أو بسبب عوامل أخرى تجعل هذه الطرق أقل متانة.

انظر الفيديو التكميلي المصاحب أدناه لمزيد من الأمثلة على ICT الذي يعرف محتوى التلاعب بالصور الفوتوغرافية التي غالبًا ما يخدع الطرق البديلة.

 

 

نُشر لأول مرة في 4 مارس 2022.

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]