زاوية Anderson
كشف عمليات التزوير في مكالمات الفيديو باستخدام وظيفة الاهتزاز في الهاتف الذكي

أظهرت أبحاث جديدة من سنغافورة طريقة جديدة لاكتشاف ما إذا كان شخص ما على الطرف الآخر من أداة مكالمة فيديو على الهاتف الذكي يستخدم طرقًا مثل DeepFaceLive لتحقيق شخص آخر.
تمت تسمية هذه النهج الجديدة باسم SFake ، ويتخلى عن الطرق السلبية التي تستخدمها معظم الأنظمة ، ويتسبب في اهتزاز هاتف المستخدم (باستخدام آليات الاهتزاز نفسها المستخدمة في الهواتف الذكية) ، ويتسبب في تقليل وضوح الوجه.
على الرغم من أن أنظمة التزوير الحية قادرة على تكرار حركة التقليل ، طالما تم تضمين لقطات غير واضحة في بيانات التدريب ، أو على الأقل في بيانات ما قبل التدريب ، إلا أنها لا تستطيع الاستجابة بسرعة كافية لتقليل غير متوقع من هذا النوع ، وستستمر في إخراج مقاطع غير واضحة من الوجوه ، مما يفضح وجود مكالمة مؤتمرة مزورة.

لا يستطيع DeepFaceLive الاستجابة بسرعة كافية لمحاكاة التقليل الناتج عن اهتزاز الكاميرا. المصدر: https://arxiv.org/pdf/2409.10889v1
وجدت نتائج الاختبار على مجموعة بيانات قام الباحثون بإنشائها بأن SFake يتفوق على طرق الكشف عن عمليات التزوير في الفيديو الأخرى ، حتى عندما واجه ظروفًا صعبة ، مثل الحركة الطبيعية التي تحدث عندما يقوم الشخص الآخر في مكالمة فيديو بتشغيل الكاميرا بيده ، بدلاً من استخدام حامل هاتف ثابت.
الاحتياج المتزايد لاكتشاف عمليات التزوير في الفيديو
ازدادت الأبحاث حول اكتشاف عمليات التزوير في الفيديو مؤخرًا. في أعقاب سنوات من عمليات سرقة ناجحة باستخدام عمليات التزوير الصوتي ، في بداية هذا العام ، تم خداع موظف مالي لتحويل 25 مليون دولار إلى محتال كان يتحقق من شخص آخر في مكالمة فيديو مزورة.
على الرغم من أن نظام من هذا النوع يتطلب مستوى عالٍ من الوصول إلى الأجهزة ، إلا أن العديد من مستخدمي الهواتف الذكية قد اعتادوا بالفعل على خدمات التحقق المالية وخدمات التحقق الأخرى التي تطلب منهم تسجيل سمات الوجه الخاصة بهم لتحقق الوجه (في الواقع ، هذا جزء من عملية التحقق من هوية LinkedIn).
يبدو من المحتمل أن يتم تعزيز هذه الطرق بشكل متزايد لأنظمة مكالمات الفيديو ، حيث يستمر هذا النوع من الجريمة في الظهور في العناوين.
ت假نظ أنظمة الكشف عن عمليات التزوير في الوقت الفعلي لمكالمات الفيديو افتراضًا سيناريوًا ثابتًا ، حيث يستخدم المت沟اصل كاميرا ثابتة ، ولا يتوقع أي حركة أو تغييرات بيئية أو إضاءة زائدة. لا توفر مكالمة الهاتف الذكي مثل هذه الحالة “الثابتة”.
بدلاً من ذلك ، يستخدم SFake العديد من طرق الكشف لتعويض عدد كبير من المتغيرات البصرية في مكالمة فيديو على هاتف ذكي محمول ، ويبدو أنه أول مشروع بحثي يعالج هذه القضية باستخدام معدات اهتزاز قياسية مدمجة في الهواتف الذكية.
يُسمى الورقة Shaking the Fake: Detecting Deepfake Videos in Real Time via Active Probes ، ويأتي من两个 باحثين من جامعة نانيانغ التكنولوجية في سنغافورة.
الطريقة
تم تصميم SFake كخدمة قائمة على السحابة ، حيث يرسل تطبيق محلي بيانات إلى خدمة واجهة برمجة التطبيقات عن بُعد لمعالجتها ، وترسل النتائج обратًا.
然而 ، فإن حجمه الصغير البالغ 450 ميغابايت وطريقةه المُحسَّنة يسمحان بمعالجة كشف عمليات التزوير في الفيديو بالكامل على الجهاز نفسه ، في الحالات التي قد تسبب فيها اتصال الشبكة ضغطًا مفرطًا للصور المرسلة ، مما يؤثر على عملية التشخيص.
يعني تشغيل “الكل محلي” بهذه الطريقة أن النظام سيكون لديه وصول مباشر إلى تدفق الكاميرا للمستخدم ، دون الترميز التداخلي المرتبط عادةً بمكالمات الفيديو.
يتطلب متوسط وقت التحليل عينة فيديو مدتها أربعة ثوان ، خلالها يُطلب من المستخدم البقاء ساكناً ، وخلالها يرسل SFake “استكشافات” لتحريك اهتزاز الكاميرا في فترات زمنية عشوائية منتقاة لا يستطيع نظام مثل DeepFaceLive الاستجابة لها في الوقت المناسب.
(يجب التأكيد مرة أخرى على أن أي مهاجم لم يشملهم مجموعة بيانات التدريب على محتوى غير واضح غير محتمل أن يكون قادرًا على إنتاج نموذج يمكنه توليد تقليل حتى في ظروف أكثر ملاءمة ، وأن DeepFaceLive لا يستطيع ببساطة “إضافة” هذه الوظيفة إلى نموذج مدرب على مجموعة بيانات غير مدروسة جيدًا)
يختار النظام مناطق معينة من الوجه كمناطق محتملة لمحتوى عمليات التزوير ، مع استثناء العيون والحواجب (منذ أن يكون الوميض والحركة الوجهية في تلك المنطقة خارج نطاق الكشف عن التقليل ، وليس مؤشرًا مثاليًا).

مخطط مفاهيمي لـ SFake.
كما نرى في المخطط المفاهيمي أعلاه ، بعد اختيار أنماط اهتزاز مناسبة وغير قابلة للتنبؤ ، واختيار أفضل طول بؤري ، وإجراء تحقق الوجه (بما في ذلك الكشف عن معالم الوجه عبر مكون Dlib الذي يقدر 68 معلمًا للوجه بشكل قياسي) ، يشتق SFake التدرجات من الوجه المدخل ويركز على مناطق محددة من هذه التدرجات.
يتم الحصول على تسلسل التباين عن طريق تحليل كل إطار في مقطع الفيديو القصير قيد الدراسة بشكل متتالي ، حتى يتم الوصول إلى التسلسل “المثالي” ، ويتجاهل الباقي.
هذا يوفر ميزات مستخرجة يمكن استخدامها كمقياس لاحتمالية وجود محتوى مزور ، بناءً على قاعدة البيانات المدربة (التي سنأتي عليها بعد لحظة).
يتطلب النظام دقة صورة تبلغ 1920×1080 بكسل ، بالإضافة إلى متطلبات تكبير العدسة بنسبة 2x على الأقل. ويلاحظ البحث أن مثل هذه الدقة (وأعلى) مدعومة في Microsoft Teams وSkype وZoom وTencent Meeting.
معظم الهواتف الذكية لها كاميرا أمامية وكاميرا خلفية ، وغالبًا ما يكون لديها كاميرا واحدة فقط تتمتع بخصائص التكبير المطلوبة من SFake ؛ لذلك سيحتاج التطبيق إلى أن يستخدم المت沟اصل الكاميرا التي تفي بالمتطلبات.
الهدف هنا هو الحصول على النسبة الصحيحة من وجه المستخدم في تدفق الفيديو الذي سيتم تحليله من قبل النظام. ويلاحظ البحث أن متوسط المسافة التي تستخدمها النساء أجهزتهم المحمولة هي 34.7 سم ، وللرجال 38.2 سم (كما أُبلغ في Journal of Optometry) ، وأن SFake يعمل جيدًا في هذه المسافات.
نظرًا لأن الاستقرار مشكلة مع الفيديو المحمول ، ونظرًا لأن التقليل الناتج عن حركة اليد عائق أمام عمل SFake ، حاول الباحثون عدة طرق لتعويضها. كانت أكثر هذه الطرق نجاحًا هي حساب النقطة المركزية للمعالم المقدرة واستخدامها كـ “مؤشر” – تقنية استقرار خوارزمية بشكل فعال. من خلال هذه الطريقة ، تم الحصول على دقة بنسبة 92٪.
البيانات والاختبارات
نظرًا لأن keine مجموعات بيانات مناسبة موجودة لهذا الغرض ، قام الباحثون بإنشاء مجموعة بيانات خاصة بهم:
‘[نحن] نستخدم 8 علامات تجارية مختلفة من الهواتف الذكية لتسجيل 15 مشاركًا من جنسين وأعمار مختلفة لإنشاء مجموعة بياناتنا الخاصة. نضع الهاتف الذكي على حامل الهاتف على بعد 20 سم من المشارك ونتكبيره مرتين ، مع توجيهه إلى وجه المشارك ليشمل جميع ميزاته الوجهية أثناء اهتزاز الهاتف الذكي بنماط مختلفة.
‘للهواتف الذكية التي لا يمكن تكبير الكاميرا الأمامية ، نستخدم الكاميرا الخلفية كبديل. نسجل 150 فيديو طويلًا ، كل فيديو مدته 20 ثانية. افتراضيًا ، نفترض أن فترة الكشف تستمر 4 ثوان. نقص 10 مقاطع من 4 ثوان من فيديو طويل واحد عن طريق تقليل وقت البدء. لذلك ، نحصل على ما مجموعه 1500 مقطع حقيقي ، كل مقطع مدته 4 ثوان.
على الرغم من أن DeepFaceLive (رابط GitHub) كان الهدف الرئيسي للدراسة ، نظرًا لأنها حاليًا نظام التزوير المفتوح المصدر الأكثر استخدامًا ، إلا أن الباحثين شملوا أربع طرق أخرى لتدريب نموذج الكشف عنهم: Hififace؛ FS-GANV2؛ RemakerAI؛ و MobileFaceSwap – الأخير من هذه الخيارات هو خيار مناسب بشكل خاص ، نظرًا للبيئة المستهدفة.
تم استخدام 1500 فيديو مزور لتدريب النظام ، إلى جانب نفس العدد من مقاطع الفيديو الحقيقية والغير معدلة.
تم اختبار SFake ضد عدة مصنفات مختلفة ، بما في ذلك SBI؛ FaceAF؛ CnnDetect؛ LRNet؛ DefakeHop متغيرات؛ وخدمة الكشف عن عمليات التزوير في الفيديو المجانية على الإنترنت Deepaware. لكل من هذه الطرق المزورة ، تم تدريب 1500 فيديو مزور و 1500 فيديو حقيقي.
للمصنف الرئيسي ، تم استخدام شبكة عصبونية بسيطة ذات طبقتين مع دالة تنشيط ReLU. تم اختيار 1000 فيديو حقيقي و 1000 فيديو مزور بشكل عشوائي (على الرغم من أن مقاطع الفيديو المزورة كانت أمثلة DeepFaceLive حصريًا).
تم استخدام منحنى العلاقة بين الحساسية و النوعية (AUC/AUROC) ودقة (ACC) كمقاييس.
للتدريب والاستدلال ، تم استخدام NVIDIA RTX 3060 ، وتم تشغيل الاختبارات تحت نظام Ubuntu. تم تسجيل مقاطع الفيديو الاختبارية باستخدام Xiaomi Redmi 10x و Xiaomi Redmi K50 و OPPO Find x6 و Huawei Nova9 و Xiaomi 14 Ultra و Honor 20 و Google Pixel 6a و Huawei P60.
للموافقة مع طرق الكشف الحالية ، تم تنفيذ الاختبارات باستخدام PyTorch. النتائج الأولية موضحة في الجدول أدناه:

نتائج SFake مقابل الطرق الأخرى.
هنا يعلق المؤلفون:
‘في جميع الحالات ، تتجاوز دقة الكشف عن SFake 95٪. من بين خمس خوارزميات عمليات التزوير ، باستثناء Hififace ، يؤدي SFake بشكل أفضل ضد خوارزميات عمليات التزوير الأخرى من الطرق الست الأخرى للكشف. نظرًا لأن مصنفنا مدرب باستخدام صور مزورة تم إنشاؤها بواسطة DeepFaceLive ، يصل إلى أعلى معدل دقة يبلغ 98.8٪ عند الكشف عن عمليات التزوير بواسطة DeepFaceLive.
‘عندما يواجه وجوه مزورة تم إنشاؤها بواسطة RemakerAI ، يؤدي طرق الكشف الأخرى أداءً سيئًا. نحن نخمن أن هذا قد يكون بسبب الضغط التلقائي للفيديوهات عند تحميلها من الإنترنت ، مما يؤدي إلى فقدان تفاصيل الصورة وبالتالي يقلل من دقة الكشف. ومع ذلك ، لا يتأثر ذلك بالكشف عن SFake الذي يحقق دقة 96.8٪ في الكشف عن عمليات التزوير بواسطة RemakerAI.’
يلاحظ المؤلفون أيضًا أن SFake هو النظام الأكثر أداءً في سيناريو تكبير 2x المطبق على عدسة الكاميرا ، نظرًا لأن ذلك يزيد الحركة ، وهو سيناريو تحدي كبير. حتى في هذه الحالة ، تمكنت SFake من تحقيق دقة 84٪ و 83٪ ، على التوالي ، لمعاملات التكبير 2.5 و 3.
الختام
مشروع يستخدم نقاط الضعف في نظام عمليات التزوير الحية ضدها هو عرض منعش في عام تم حظيه بدراسات حول اكتشاف عمليات التزوير في الفيديو تمت تهيئتها بطرق قديمة.
في نهاية عام 2022 ، استخدم نظام آخر تغيرات سطوع الشاشة كحاك لاكتشاف عمليات التزوير؛ وفي نفس العام ، كان تجربتي لعدم khả năng DeepFaceLive في التعامل مع مناظير جانبية صعبة تلقى بعض الاهتمام من المجتمع.
DeepFaceLive هو الهدف الصحيح لمثل هذا المشروع ، نظرًا لأنها بالتأكيد محور الاهتمام الإجرامي فيما يتعلق بعمليات التزوير في مكالمات الفيديو.
然而 ، لقد رأيت مؤخرًا بعض الأدلة غير الرسمية التي تشير إلى أن نظام LivePortrait ، الذي يتمتع بشعبية كبيرة حاليًا في مجتمع التأثيرات البصرية ، يتعامل مع مناظير جانبية بشكل أفضل من DeepFaceLive ؛ كان من المثير للاهتمام لو تمت إضافته إلى هذه الدراسة.
نُشر لأول مرة يوم الثلاثاء ، 24 سبتمبر 2024





![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-400x240.jpg)
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-80x80.jpg)





