زاوية Anderson
كشف عميق باستخدام السمات البيومترية الأصلية للإنسان

يقترح بحث جديد من قبل باحثين في إيطاليا وألمانيا طريقة لاكتشاف مقاطع الفيديو المزيفة باستخدام السلوك البيومتري للوجه والصوت، بدلاً من إنشاء نماذج لتحليل الفيديو أو حلول أخرى أكثر تكلفة.
يتطلب الإطار إدخال 10 مقاطع فيديو أو أكثر غير مزيفة ومتنوعة للفرد. ومع ذلك، لا يتطلب تدريبًا خاصًا أو إعادة تدريب أو تعزيز على مقاطع فيديو لكل حالة، حيث أن النموذج المدمج فيه قد مجرد المسافات المتجهة المحتملة بين مقاطع الفيديو الحقيقية والمزيفة بطريقة قابلة للتطبيق على نطاق واسع.

تعلم التباين يعتمد على نهج POI-Forensics. Source: https://arxiv.org/pdf/2204.03083.pdf
يسمى النهج POI-Forensics، ويعتمد على الإشارات الحركية والصوتية الفريدة للأفراد الحقيقيين الذين يتم تزييفهم.
على الرغم من أن نظامًا كهذا يمكن أن يسمح بإطارات تحقق آلي كامل، “مسبق”، للشخصيات العامة، مثل المشاهير والسياسيين ومؤثرين اليوتيوب وغيرهم من الأشخاص الذين يتوفر لديهم الكثير من المواد الفيديوية، يمكن أيضًا تعديله ليكون إطارًا يمكن أن يتيح للضحايا العاديين لتكنولوجيا التزييف أن يثبتوا عدم صحة الهجمات ضدهم.

تجسيدات لميزات مستخرجة من مقاطع فيديو حقيقية ومزيفة عبر أربعة مواضيع في POI-Forensics.
يزعم المؤلفون أن POI-Forensics يحقق حالة جديدة في كشف مقاطع الفيديو المزيفة. عبر مجموعة متنوعة من مجموعات البيانات الشائعة في هذا المجال، يُبلغ عن أن الإطار يحقق تحسنًا بنسبة 3٪ و 10٪ و 7٪ في درجات AUC لمقاطع الفيديو عالية الجودة وذات جودة منخفضة ومهاجمة، على التوالي. ويعهد الباحثون بنشر الرمز قريبًا.

أداء POI-Forensics مقابل إطارات SOTA المنافسة.
يصر المؤلفون على أن:
‘التدريب يتم بشكل حصري على مقاطع فيديو حقيقية، وبالتالي لا يعتمد الكاشف على أي طريقة تحرير محددة وينتج أعلى قدرة على التعميم. بالإضافة إلى ذلك، يمكن أن يكتشف طريقةنا كل من الهجمات أحادية الوضع (صوت فقط، فيديو فقط) ومتعددة الوضع (صوت-فيديو)، وهو متين ضد مقاطع الفيديو منخفضة الجودة أو التالفة من خلال بناء فقط على الميزات الدلالية عالية المستوى.’
سباق التسلح المزيف
لدحر نظام كشف مثل هذا، سيتطلب نظام التزييف البشري ونظام التخليق الصوتي القدرة على محاكاة على الأقل الإشارات البيومترية البصرية والصوتية من الهدف المقصود للتخليق – وهو تكنولوجيا بعيدة الأمد، ومن المحتمل أن تظل في نطاق الأنظمة المغلقة المكلفة والمملوكة لشركات المؤثرات البصرية، والتي سيكون لها ميزة التعاون والمشاركة من الأهداف المقصودة (أو ورثتهم، في حالة محاكاة الأشخاص المتوفيين).
الأساليب الناجحة والمعروفة للتزييف مثل FaceSwap و DeepFaceLab لا تملك حاليًا القدرة على إنشاء تقارب بيومتري دقيق.
تعتمد هذه الحزمتين على الترميز التلقائي. يمكن أن تستخدم أساليب التخليق البشري البديلة شبكة تباينية أو نهج حقل الإشعاع العصبي (NeRF) لتحقيق هوية بشرية؛ ومع ذلك، فإن كلا هذه الخطوط البحثية أمامها سنوات من العمل حتى تنتج فيديو بشري фотوحي.
باستثناء الصوت (الأصوات المزيفة)، فإن محاكاة البيومترية هي في أسفل قائمة التحديات التي تواجه تخليق الصور. في أي حال، لا يُنتج تكرار نغمة الصوت وخصائصها الأخرى تقليدًا لتناقضاته و “الدلالات”، أو الطريقة التي يستخدم بها الموضوع الحقيقي البناء الدلالي.
في Arxiv وحدها، يتم إصدار استراتيجيات كشف التزييف وابتكارات جديدة كل أسبوع. اعتمدت النهج الحديثة على التوافق بين الصوت والوجه، تخطيط نمط الثنائي المحلي (FF-LBPH)، إدراك الإنسان للأصوات المزيفة، تحليل حواف الوجه، التعويض عن تدهور الفيديو، و ‘الذخيرة الجنائية’ – من بين العديد من الآخرين.
النهج والبيانات والهيكل
يتبنى POI-Forensics نهجًا متعدد الوضع لتحقق الهوية، مستفيدًا من البيومترية الناعمة بناءً على الإشارات البصرية والصوتية. يحتوي الإطار على شبكات صوتية ومرئية منفصلة، والتي تشتق في النهاية بيانات متجهة مميزة يمكن مقارنتها بالسمات المماثلة المستخرجة من مقطع فيديو مزيف محتمل قيد الدراسة.
يمكن أن تتم التحليلات المنفصلة (صوتية أو مرئية) والتحليلات الإدماجية على مقاطع الفيديو المستهدفة، وصولًا في النهاية إلى دليل تشابه POI. تستند دالة الخسارة التباينية المستخدمة إلى تعاون أكاديمي في عام 2021 بين بحث جوجل وجامعة بوسطن وشركة سناب وMIT.
تم تقسيم مجموعة البيانات الأساسية على أساس الهوية. تم استخدام 4608 هويات للتدريب، مع 512 للتحقق. تم استبعاد 500 هوية مستخدمة في FakeAVCelebV2 (مرشح اختبار، انظر أدناه) للحصول على نتائج غير متجنسة.
تم تدريب الشبكتين لمدة 12 دورة مع حجم دفعة كبير بشكل غير عادي من 2304 دفعة في كل دورة، مع كل دفعة تتكون من 8×8 مقاطع فيديو – 8 مقاطع ل 8 هويات مختلفة. تم استخدام محسّن Adam مع انحلال الوزن المنفصل بمعدل تعلم 10^-4، ووزن انحلال 0.01.
الاختبار والنتائج
تم اختبار مجموعات بيانات التزييف التالية للمشروع: مجموعة بيانات تحدي كشف التزييف المسبق، التي تتميز bằng تبادلات الوجه عبر 68 موضوعًا، من بينهم 44 هوية تم اختيارها لأن لديها أكثر من تسعة مقاطع فيديو متعلقة، بإجمالي 920 مقطع فيديو حقيقي و 2925 مقطع فيديو مزيف؛ DeepFake-TIMIT، مجموعة بيانات قائمة على GAN تتميز ب 320 مقطع فيديو ل 32 موضوع، بإجمالي 290 مقطع فيديو حقيقي و 580 مقطع فيديو مزيف مدته أربع ثوان على الأقل؛ FakeAVCelebV2، التي تتكون من 500 مقطع فيديو حقيقي من Voxceleb2، و约 20,000 مقطع فيديو مزيف من مجموعات بيانات مختلفة، إلى التي تم إضافة صوت مزيف مع SV2TTS لتحقيق التوافق؛ و KoDF، مجموعة بيانات التزييف الكورية التي تتميز ب 403 هوية مزيفة من خلال FaceSwap و DeepFaceLab و FSGAN، بالإضافة إلى ثلاثة نماذج حركة أولية (FOMM).
يزعم المؤلفون:
‘نعتقد أن طريقةنا هي أول حجر زاوية؛ خاصةً، استخدام الميزات الدلالية عالية المستوى هو طريق واعد للبحث في المستقبل. بالإضافة إلى ذلك، يمكن أن يتم تعزيز التحليل المتعدد الوضع من خلال إدراج المزيد من المعلومات من مجالات أخرى مثل البيانات النصية.’
نُشر لأول مرة في 8 أبريل 2022.












