زاوية Anderson
بحث عن “البيسون والوزغ” في جمهور المستخدمين في الإعلان

مع وصول الإنفاق المقدر لقطاع الإعلان عبر الإنترنت إلى 740.3 مليار دولار في عام 2023، يسهل فهم سبب استثمار شركات الإعلان موارد كبيرة في هذا الفرع من أبحاث الرؤية الحاسوبية.
ورغم انغلاق القطاع وحرصه على حماية تقنياته، فإنه ينشر أحيانًا دراسات تكشف جانبًا من أعماله المتقدمة في التعرف على الوجوه وتتبع نظرات العين، بما في ذلك تقدير العمر الذي يمثل عنصرًا أساسيًا في التحليلات الديموغرافية.

يهم المعلنين تقدير العمر في البيئات الواقعية لاستهداف فئات عمرية محددة. في هذا المثال التجريبي لتقدير العمر تلقائيًا، يجري تتبع عمر الفنان بوب ديلان عبر السنوات. المصدر: https://arxiv.org/pdf/1906.03625
تعتمد هذه الدراسات، التي نادرًا ما تظهر في مستودعات عامة مثل Arxiv، على مشاركين جرى استقطابهم بصورة مشروعة، ثم تستخدم الذكاء الاصطناعي لتحديد مقدار تفاعل المشاهد مع الإعلان وطبيعة هذا التفاعل.

يُستخدم مدرج التدرجات الموجّهة (HoG) في مكتبة Dlib كثيرًا ضمن أنظمة تقدير ملامح الوجه. المصدر: https://www.computer.org/csdl/journal/ta/2017/02/07475863/13rRUNvyarN
الغريزة الحيوانية
يهتم قطاع الإعلان بتحديد الإيجابيات الكاذبة، أي الحالات التي يسيء فيها النظام التحليلي تفسير سلوك الشخص، كما يسعى إلى وضع معايير واضحة للحظة التي لا يعود فيها المشاهد منخرطًا بالكامل في المحتوى الإعلاني.
تركز دراسات الإعلان المعروض على الشاشات عادة على مشكلتين ضمن بيئتين: سطح المكتب والهاتف المحمول. ولكل بيئة خصائص تتطلب حلول تتبع مخصصة. أما المشكلتان فيُشار إليهما من منظور المعلن باسم سلوك البومة وسلوك السحلية، وهما طريقتان لا يمنح فيهما المشاهد الإعلان كامل انتباهه.

أمثلة على سلوكي «البومة» و«السحلية» لدى أحد المشاركين في مشروع بحثي إعلاني. المصدر: https://arxiv.org/pdf/1508.04028
إذا أدار المشاهد رأسه بالكامل بعيدًا عن الإعلان فهذا «سلوك البومة». وإذا ظل الرأس ثابتًا بينما انحرفت العينان عن الشاشة فهذا «سلوك السحلية». ويجب على أي نظام لتحليل الإعلانات الجديدة واختبارها في ظروف مضبوطة أن يرصد كلا السلوكين بدقة.
تتناول ورقة بحثية جديدة من Affectiva، التابعة لشركة SmartEye، هذه المسائل عبر بنية تجمع عدة أطر قائمة في مجموعة خصائص موحدة تغطي الظروف والاستجابات المحتملة، وتحاول التمييز بين المشاهد الملل والمتفاعل والشخص البعيد عن المحتوى المطلوب مشاهدته.

أمثلة على الإيجابيات الصحيحة والكاذبة التي اكتشفها نظام الانتباه الجديد لإشارات تشتيت مختلفة، مع عرض أجهزة سطح المكتب والهواتف بصورة منفصلة. المصدر: https://arxiv.org/pdf/2504.06237
يقول الباحثون:*
«لم تتناول سوى أبحاث محدودة مراقبة الانتباه أثناء الإعلانات عبر الإنترنت. ركزت تلك الدراسات على وضعية الرأس أو اتجاه النظر لاكتشاف انحرافه، لكنها أغفلت نوع الجهاز، وموضع الكاميرا نسبة إلى الشاشة، وحجم الشاشة؛ وهي عوامل تؤثر كثيرًا في اكتشاف الانتباه.»
«نقترح بنية ترصد مشتتات متعددة، ومنها النظر خارج الشاشة بسلوكي البومة والسحلية، والتحدث، والنعاس من خلال التثاؤب وإغلاق العينين طويلًا، وترك الشاشة من دون مراقبة.»
«تدمج طريقتنا خصائص مرتبطة بالجهاز، مثل نوعه وموضع الكاميرا وحجم الشاشة على الحاسوب واتجاه الكاميرا على الهاتف، مع تقدير النظرة الخام لتحسين دقة اكتشاف الانتباه.»
يحمل البحث الجديد عنوان Monitoring Viewer Attention During Online Ads، وأعده أربعة باحثين من Affectiva.
المنهج والبيانات
بسبب السرية والطبيعة مغلقة المصدر لهذه الأنظمة، لا تقارن الورقة الجديدة النهج المقترح مباشرة بالأنظمة المنافسة، بل تعرض النتائج في صورة دراسات استئصال تزيل مكونات محددة وتقيس أثرها. كما أنها لا تتبع تمامًا الصيغة المعتادة لأبحاث الرؤية الحاسوبية، لذلك نستعرضها وفق طريقة عرض المؤلفين.
يشدد الباحثون على أن عددًا قليلًا فقط من الدراسات عالج اكتشاف الانتباه في سياق الإعلانات عبر الإنترنت. ففي AFFDEX SDK، الذي يدعم التعرف الفوري على عدة وجوه، يُستنتج الانتباه من وضعية الرأس وحدها ويُصنف الشخص غير منتبه إذا تجاوزت زاوية رأسه حدًا معينًا.

مثال من AFFDEX SDK، وهو نظام من Affectiva يعتمد على وضعية الرأس مؤشرًا للانتباه. المصدر: https://www.youtube.com/watch?v=c2CWb5jHmbY
وفي دراسة عام 2019 بعنوان Automatic Measurement of Visual Attention to Video Content using Deep Learning، جرى وسم بيانات نحو 28 ألف مشارك لسلوكيات مثل النظر بعيدًا وإغلاق العينين والانشغال بأنشطة لا علاقة لها بالمحتوى، ثم دُرب نموذج CNN-LSTM على اكتشاف الانتباه من مظهر الوجه عبر الزمن.

مثال من ورقة 2019 يوضح حالات الانتباه التي تنبأ بها النظام لمشاهد يتابع محتوى فيديو. المصدر: https://www.jeffcohn.net/wp-content/uploads/2019/07/Attention-13.pdf.pdf
غير أن تلك الجهود لم تراع عوامل خاصة بالجهاز، مثل استخدام حاسوب أو هاتف، ولا حجم الشاشة أو موضع الكاميرا. ويركز AFFDEX على انحراف النظرة فقط، بينما حاول بحث 2019 رصد سلوكيات أوسع، لكن استخدام شبكة CNN سطحية واحدة ربما لم يكن كافيًا للمهمة.
كما أن كثيرًا من الأبحاث الشائعة لم يُحسّن لاختبار الإعلانات، الذي يختلف عن القيادة أو التعليم حيث تكون الكاميرا والمعايرة ثابتتين عادة. أما اختبارات الإعلانات فتستخدم إعدادات غير معايرة ونطاق النظرة المحدود لأجهزة سطح المكتب والهواتف.
لذلك صمم الباحثون بنية لاكتشاف انتباه المشاهد أثناء الإعلان بالاعتماد على مجموعتي أدوات تجاريتين: AFFDEX 2.0 وSmartEye SDK.

أمثلة على تحليل الوجه باستخدام AFFDEX 2.0. المصدر: https://arxiv.org/pdf/2202.12059
تستخرج الأدوات خصائص منخفضة المستوى، مثل تعابير الوجه ووضعية الرأس واتجاه النظر، ثم تحولها إلى مؤشرات أعلى مستوى تشمل موضع النظرة على الشاشة والتثاؤب والتحدث.
يحدد النظام أربعة أنواع من التشتيت: النظر خارج الشاشة، والنعاس، والتحدث، وترك الشاشة من دون مراقبة. كما يضبط تحليل النظرة وفق استخدام المشاهد لحاسوب مكتبي أو هاتف.
مجموعات البيانات: التحديق
استخدم الباحثون أربع مجموعات بيانات لتشغيل نظام اكتشاف الانتباه وتقييمه: ثلاث منها تركز بصورة منفصلة على النظرة والتحدث والتثاؤب، والرابعة مأخوذة من جلسات فعلية لاختبار الإعلانات وتضم مزيجًا من أنواع التشتيت.
ولأن العمل يتطلب بيانات خاصة، أنشئت مجموعة مخصصة لكل فئة من مستودع داخلي يضم ملايين الجلسات المسجلة لمشاركين شاهدوا إعلانات في المنزل أو مكان العمل عبر الويب وبعد موافقة مستنيرة. وبسبب شروط تلك الموافقات، لا يمكن إتاحة البيانات الجديدة للعامة.
لبناء بيانات النظرة، طُلب من المشاركين تتبع نقطة متحركة في أنحاء الشاشة، بما فيها الحواف، ثم النظر خارج الشاشة في أربعة اتجاهات: أعلى وأسفل ويسار ويمين، وتكرر التسلسل ثلاث مرات. وبذلك أمكن تحديد العلاقة بين الالتقاط والتغطية.

لقطات لمحفز فيديو النظرة على (أ) سطح المكتب و(ب) الهاتف. يعرض الإطاران الأول والثالث تعليمات تتبع نقطة متحركة، بينما يطلب الإطاران الثاني والرابع النظر بعيدًا عن الشاشة.
وُسمت مقاطع النقطة المتحركة بأنها «منتبهة»، ومقاطع النظر خارج الشاشة بأنها «غير منتبهة»، لتكوين أمثلة إيجابية وسلبية. واستمر كل فيديو نحو 160 ثانية، بدقتي 1920×1080 لسطح المكتب و608×1080 للهاتف.
جُمعت 609 مقاطع: 322 لسطح المكتب و287 للهاتف. وطبقت الوسوم تلقائيًا وفق محتوى الفيديو، ثم قُسمت البيانات إلى 158 عينة تدريب و451 عينة اختبار.
مجموعات البيانات: التحدث
يُعد الشخص غير منتبه في هذا السياق إذا تحدث لأكثر من ثانية، مع أن ذلك قد يكون تعليقًا عابرًا أو حتى سعالًا. ولأن البيئة المضبوطة لا تسجل الصوت ولا تحلله، يُستدل على الكلام من حركة معالم الوجه، وخصوصًا الفم.
أنشأ الباحثون مجموعة بصرية من جزأين. ضم الأول نحو 5,500 فيديو، ووسم ثلاثة مقيمين كل فيديو بأنه يتضمن كلامًا أو لا؛ استُخدم 4,400 للتدريب والتحقق و1,100 للاختبار. وضم الثاني 16 ألف جلسة موسومة تلقائيًا بحسب نوعها: 10,500 لمشاركين يشاهدون الإعلانات بصمت و5,500 لمشاركين يعبرون عن آرائهم في العلامات التجارية.
مجموعات البيانات: التثاؤب
يرى الباحثون أن مجموعات مثل YawDD وDriver Fatigue لا تناسب اختبار الإعلانات، لأنها تعرض تثاؤبًا مصطنعًا أو حركات وجه قد تختلط بالخوف وغيره.
استخدم الفريق 735 فيديو داخليًا لجلسات يُرجح أن يظهر فيها فتح الفك لأكثر من ثانية. ووسم ثلاثة مقيمين كل فيديو إلى تثاؤب نشط أو غير نشط. لم تتضمن سوى 2.6% من الإطارات تثاؤبًا فعليًا، ما يبرز اختلال الفئات؛ وقُسمت البيانات إلى 670 فيديو للتدريب و65 للاختبار.
مجموعات البيانات: التشتيت
استُخرجت بيانات التشتيت من مستودع اختبارات إعلانية شاهد فيها المشاركون إعلانات فعلية دون مهمة محددة. اختيرت عشوائيًا 520 جلسة، منها 193 على الهاتف و327 على سطح المكتب، ووسمها ثلاثة مقيمين إلى منتبهة أو غير منتبهة.
شملت السلوكيات غير المنتبهة النظر خارج الشاشة والتحدث والنعاس وترك الشاشة. وغطت الجلسات مناطق عالمية متنوعة، مع زيادة تسجيلات سطح المكتب بسبب مرونة وضع كاميرات الويب.
نماذج الانتباه
يعالج النموذج المقترح خصائص بصرية منخفضة المستوى، هي تعابير الوجه ووضعية الرأس واتجاه النظرة، تستخرج عبر AFFDEX 2.0 وSmartEye SDK. ثم تتحول إلى مؤشرات عالية المستوى، ويعالج كل مشتت مصنف ثنائي مستقل دُرب على مجموعته الخاصة.

مخطط النظام المقترح لمراقبة الانتباه.
يقرر نموذج النظرة ما إذا كان الشخص ينظر إلى الشاشة أو بعيدًا عنها باستخدام إحداثيات نظر مطبّعة ومعايرة منفصلة للحاسوب والهاتف. وتساعده آلة متجهات دعم خطية SVM مدربة على خصائص مكانية وزمنية، مع نافذة ذاكرة لتخفيف أثر التحولات السريعة في النظرة.
ولكشف الكلام دون صوت، يستخدم النظام مناطق الفم المقصوصة وشبكة 3D-CNN مدربة على مقاطع حوارية وغير حوارية، مع تنعيم زمني يقلل الإيجابيات الكاذبة الناتجة عن حركة فم قصيرة. أما التثاؤب فيُكتشف من صور الوجه الكامل بواسطة 3D-CNN مدربة على إطارات موسومة يدويًا.
يُكتشف ترك الشاشة من غياب الوجه أو وضعية رأس شديدة، وتتخذ شجرة قرار التنبؤ. وفي الحالة النهائية، إذا اكتشفت أي وحدة عدم الانتباه، يصنف المشاهد غير منتبه؛ وهو نهج يعطي الأولوية للحساسية ويضبط بصورة مستقلة للحاسوب والهاتف.
الاختبارات
اتبعت الاختبارات أسلوب الاستئصال، إذ أزيل كل مكون على حدة وقيس أثر غيابه في النتيجة.

فئات مختلفة من عدم الانتباه التي حددتها الدراسة.
اكتشف نموذج النظرة السلوك خارج الشاشة عبر ثلاث خطوات: تطبيع تقديرات النظرة الخام، وضبط الناتج، وتقدير حجم الشاشة للحواسيب المكتبية. وقيّم الباحثون أهمية كل خطوة على 226 فيديو لسطح المكتب و225 للهاتف باستخدام مقياسي G-mean وF1.

أداء نموذج النظرة الكامل مقارنة بإصدارات أزيلت منها خطوات معالجة منفردة.
انخفض الأداء في كل مرة حُذفت فيها خطوة. وكان التطبيع ذا قيمة خاصة على الحواسيب المكتبية، حيث يختلف موضع الكاميرا أكثر منه في الهواتف.
اختبرت الدراسة أيضًا قدرة الخصائص البصرية على توقع اتجاه كاميرا الهاتف. سجل موضع الوجه ووضعية الرأس ونظرة العين 0.75 و0.74 و0.60 على الترتيب، بينما بلغ دمجها 0.91، ما يوضح فائدة جمع عدة إشارات.
حقق نموذج الكلام، المدرب على المسافة الرأسية بين الشفتين، قيمة ROC-AUC قدرها 0.97 في مجموعة الاختبار الموسومة يدويًا و0.96 في المجموعة الأكبر الموسومة تلقائيًا. وحقق نموذج التثاؤب 96.6% باستخدام نسبة أبعاد الفم وحدها، وارتفع إلى 97.5% عند إضافة تنبؤات وحدات الحركة من AFFDEX 2.0.
صنف نموذج الشاشة المتروكة اللحظة بأنها غير منتبهة عندما عجز AFFDEX 2.0 وSmartEye معًا عن كشف وجه لأكثر من ثانية. وبعد وسم جميع أحداث «لا وجه» يدويًا واستبعاد الحالات الملتبسة، تبين أن 27% فقط منها نتجت عن مغادرة المستخدم للشاشة فعليًا.

الأسباب المتنوعة لعدم العثور على وجه في بعض الحالات.
«مع أن الشاشات المتروكة لم تمثل سوى 27% من الحالات التي شغلت إشارة غياب الوجه، فقد نشطت الإشارة لأسباب أخرى تدل على عدم الانتباه، مثل النظر خارج الشاشة بزاوية حادة أو الحركة المفرطة أو حجب الوجه بجسم أو باليد.»
في آخر الاختبارات الكمية، قيّم الباحثون أثر إضافة إشارات التشتيت تدريجيًا: النظر خارج الشاشة عبر النظرة ووضعية الرأس، والنعاس، والتحدث، وترك الشاشة. جرى الاختبار على بيانات التشتيت الحقيقية وعلى مجموعة فرعية من بيانات النظرة باستخدام G-mean وF1، مع استبعاد النعاس والكلام من تحليل بيانات النظرة لقلة صلتهما بهذا السياق.
تحسن اكتشاف الانتباه بصورة ثابتة مع إضافة أنواع التشتيت، وكان النظر خارج الشاشة، وهو الأكثر شيوعًا، أقوى خط أساس.

أثر إضافة إشارات تشتيت متنوعة إلى البنية.
«توضح النتائج أولًا أن دمج جميع إشارات التشتيت يحسن اكتشاف الانتباه. وثانيًا، يتسق التحسن على الحاسوب والهاتف. وتظهر جلسات الهاتف حركات رأس واضحة عند النظر بعيدًا، فيسهل اكتشافها ويكون الأداء أعلى من سطح المكتب.»
«كان تحسن إشارة النعاس محدودًا نسبيًا لأنه نادر، بينما كان أثر إشارة الشاشة المتروكة أكبر على الهواتف لأنها يمكن أن تُترك دون مراقبة بسهولة.»
قارن المؤلفون النموذج أيضًا بنظام AFFDEX 1.0 المستخدم سابقًا في اختبار الإعلانات، فتفوق كشف النظرة المعتمد على الرأس في النموذج الحالي على النظام القديم في نوعي الأجهزة.
«ينبع هذا التحسن من إدراج حركة الرأس في اتجاهي الانحراف والميل، ومن تطبيع وضعية الرأس لاستيعاب التغييرات الصغيرة. وجعلت حركات الرأس الواضحة في بيانات الهاتف الحقيقية نموذج الرأس لدينا قريبًا في أدائه من AFFDEX 1.0.»
واختتم الباحثون بجولة تقييم نوعي للأمثلة الآتية.

عينات من مخرجات نموذج الانتباه على الحاسوب والهاتف؛ يعرض كل صف إيجابيات صحيحة وكاذبة لأنواع مختلفة من التشتيت.
«تشير النتائج إلى أن نموذجنا يكتشف مشتتات مختلفة بفاعلية في البيئات غير المضبوطة. لكنه قد ينتج أحيانًا إيجابيات كاذبة في حالات طرفية، مثل إمالة الرأس بشدة مع بقاء النظر على الشاشة، أو حجب الفم، أو ضبابية العينين بشدة، أو الصور شديدة الإظلام للوجه.»
الخلاصة
تمثل النتائج تقدمًا محسوبًا لكنه مهم مقارنة بالأعمال السابقة. غير أن القيمة الأعمق للدراسة تكمن في اللمحة التي تقدمها عن السعي المستمر إلى استنتاج الحالة الداخلية للمشاهد. ورغم جمع البيانات بموافقة المشاركين، تشير المنهجية إلى أطر مستقبلية قد تتجاوز بيئات أبحاث السوق المنظمة.
وتزداد هذه الخلاصة القلقة وجاهة بسبب الطبيعة المنغلقة والمقيدة والمحروسة بشدة لهذا المسار البحثي.
* حوّل الكاتب إحالات المؤلفين داخل النص إلى روابط تشعبية.
نُشر أول مرة يوم الأربعاء 9 أبريل 2025.












