Anderson’un Açısı
‘Baykuşlar ve Kertenkeleler’i Bir Reklamverenin İzleyici Kitlesinde Aramak

Çevrimiçi reklamcılık sektörünün 2023 yılında 740,3 milyar ABD Doları harcadığı tahmin edildiğinden, reklam şirketlerinin bu belirli bilgisayar görüşü araştırma dalına önemli kaynaklar ayırmalarının nedenini anlamak kolaydır.
İzole ve korumacı olan endüstri, ara sıra yayınladığı çalışmalarla, yüz ve göz bakışını tanıyarak daha gelişmiş özel çalışmalar yaptığını ima etmektedir – bunlar arasında yaş tanıma da bulunmaktadır ve bu, demografik analiz istatistikleri için önemlidir:

Reklamcilerin belirli bir yaş demografisine ulaşmak istemesi durumunda, vahşi bir reklam bağlamında yaş tahmini önemlidir. Bu deneysel otomatik yüz yaş tahmini örneğinde, sanatçı Bob Dylan’ın yaşı yıllara göre izlenmektedir. Kaynak: https://arxiv.org/pdf/1906.03625
Bu çalışmalar, nadiren kamu depolarında görünen Arxiv gibi yerlerde, AI tarafından analiz için gerçek katılımcıları temel alır ve izleyici bir reklamla ne kadar ve nasıl etkileşimde bulunduğunu belirlemeyi amaçlar.

Dlib’in Histogram of Oriented Gradients (HoG) genellikle yüz tahmini sistemlerinde kullanılır. Kaynak: https://www.computer.org/csdl/journal/ta/2017/02/07475863/13rRUNvyarN
Hayvan İnsitnekleri
Bu bağlamda, doğal olarak, reklam endüstrisi, yanlış pozitifleri (analitik bir sistemin bir konunun eylemlerini yanlış yorumladığı durumlar) belirleme ve bir kişinin reklamı izlerken tamamen içerikle etkileşimde olmadığını belirlemek için net kriterler oluşturma ile ilgilenir.
Ekran tabanlı reklamcılık söz konusu olduğunda, çalışmalar genellikle iki problemi iki ortamda ele alır: ortamlar ‘masaüstü’ veya ‘mobil’dir ve her birinin özel izleme çözümlerine ihtiyacı vardır; ve sorunlar – reklamverenin bakış açısına göre – kuş davranışları ve kertenkele davranışları ile temsil edilir – yani, izleyicilerin reklamın önünde olmasına rağmen tam olarak dikkat etmemesi.

Reklam araştırması projesinin konusundaki ‘Baykuş’ ve ‘Kertenkele’ davranışları örnekleri. Kaynak: https://arxiv.org/pdf/1508.04028
Eğer reklamın önüne koyduğunuz reklamdan bakıyorsanız ve başınızla tamamen başka yöne bakıyorsanız, bu ‘kuş’ davranışıdır; eğer baş duruşunuz statikse ancak gözleriniz ekrandan uzaklaşıyorsa, bu ‘kertenkele’ davranışıdır. Reklam testlerinde ve kontrollü koşullarda, bu eylemler bir sistem tarafından yakalanması gereken temel eylemlerdir.
SmartEye’in Affectiva satın alma işleminin yeni bir makalesi, bu sorunları ele alan ve tüm gerekli koşullar ve olası tepkiler için birleştirilmiş ve birleştirilmiş bir özellikler kümesi sunan bir mimari sunmaktadır ve ayrıca bir izleyicinin bir reklamı izlerken sıkıldığını, ilgilendiğini veya içeriğe uzaklaştığını belirleyebilir.

Masaüstü ve mobil cihazlarda çeşitli dikkatsizlik sinyalleri için yeni dikkat sistemi tarafından tespit edilen doğru ve yanlış pozitifler örnekleri. Kaynak: https://arxiv.org/pdf/2504.06237
Yazarlar şöyle diyor:
‘Sınırlı araştırma çevrimiçi reklamlarda dikkat izlemeye odaklandı. Bu çalışmalar, dikkati dağılmış durumları belirlemek için baş duruşu veya göz bakışını tahmin etmeye odaklandı, ancak cihaz tipi (masaüstü veya mobil), kamera yerleştirme ve ekran boyutu gibi kritik parametreleri göz ardı etti. Bu faktörler dikkat algısını önemli ölçüde etkiler.’
‘Bu makalede, dikkat algılamayı kapsayan bir mimari öneriyoruz; bu, ekran dışı bakış, konuşma, uyuşukluk (esneyerek ve gözleri uzun süre kapatarak) ve ekranın terk edilmesini içeren çeşitli dikkatsizlik türlerini tespit etmeyi içerir. ‘
‘Önceki yaklaşımlardan farklı olarak, nossa yöntemi, ham göz tahmini ile birlikte cihaz özgü özellikler gibi özellikler entegre eder: cihaz tipi, kamera yerleştirme, ekran boyutu (masaüstü için) ve kamera yönü (mobil cihazlar için), dikkat algılama doğruluğunu artırmak için.’
Yeni çalışma başlıklıdır Çevrimiçi Reklamlar Sırasında İzleyici Dikkatini İzleme ve Affectiva’dan dört araştırmacının eseridir.
Yöntem ve Veri
Bu tür sistemlerin gizli ve kapalı kaynaklı doğası nedeniyle, yeni makale yazarların yaklaşımını doğrudan rakiplerle karşılaştırmaz, ancak yalnızca bulgularını soykütük çalışmaları olarak sunar; makale ayrıca Bilgisayar Görme literatürünün alışılmış formatına uymaz. Bu nedenle, araştırmayı sunulduğu şekliyle ele alacağız.
Yazarlar, dikkat algılamasının özellikle çevrimiçi reklamlar bağlamında yalnızca sınırlı sayıda çalışmaya konu olduğunu vurgulamaktadır. AFFDEX SDK gibi, gerçek zamanlı çoklu yüz tanıma sunan sistemlerde, dikkat yalnızca baş duruşundan çıkarılır ve katılımcılar, baş açıkları belirli bir eşiği geçtiğinde dikkatsiz olarak etiketlenir.

Affectiva sistemlerinden biri olan AFFDEX SDK’dan bir örnek, dikkat göstergesi olarak baş duruşuna güveniyor. Kaynak: https://www.youtube.com/watch?v=c2CWb5jHmbY
2019 işbirliği Derin Öğrenme Kullanarak Video İçeriğine Görsel Dikkat Otomatik Ölçümü, yaklaşık 28.000 katılımcıdan oluşan bir veri kümesi, çeşitli dikkatsiz davranışlar için etiketlenmiştir: ekrandan uzaklaşma, gözleri kapatma veya ilgili olmayan faaliyetlerde bulunma ve bir CNN-LSTM modeli, yüz görünümü üzerinden zaman içinde dikkat algılamak için eğitilmiştir.

2019 makalesinden, ekran上的 bir video içeriği izleyen bir izleyici için tahmin edilen dikkat durumları gösteren bir örnek. Kaynak: https://www.jeffcohn.net/wp-content/uploads/2019/07/Attention-13.pdf.pdf
Yazarlar, bu önceki çalışmaların cihaz özgü faktörleri hesaba katmadığını, yalnızca masaüstü veya mobil cihaz kullanımını değil, aynı zamanda ekran boyutu veya kamera yerleştirme gibi faktörleri de dikkate almadığını gözlemlemektedir. Ayrıca, AFFDEX sistemi yalnızca göz dağılmasını tespit etmekte ve diğer dikkatsizlik kaynaklarını göz ardı etmektedir, oysa 2019 çalışması daha geniş bir davranış kümesini tespit etmeye çalışmaktadır, ancak tek bir浅CNN kullanması bu görev için yetersiz olabilir.
Yazarlar, bu alanda en popüler araştırmaların reklam testi için optimize edilmemiş olduğunu, genellikle sabit kamera yerleştirme ve kalibrasyonu olan sürüş veya eğitim gibi alanlarda yapıldığını belirtmektedir.
Bu nedenle, yazarlar, iki ticari araç setini kullanarak çevrimiçi reklamlar sırasında izleyici dikkat algılaması için bir mimari geliştirmişlerdir: AFFDEX 2.0 ve SmartEye SDK.

AFFDEX 2.0’dan yüz analizi örnekleri. Kaynak: https://arxiv.org/pdf/2202.12059
Bu önceki çalışmalar, yüz ifadeleri, baş duruşu ve göz bakış yönü gibi düşük seviyeli özellikler çıkarır. Bu özellikler daha sonra, ekran上的 gaze konumu, esneme ve konuşma gibi daha yüksek seviyeli göstergelere dönüştürülür.
Sistem, dört dikkatsizlik türünü tanır: ekran dışı bakış; uyuşukluk; konuşma; ve izlenmeyen ekranlar. Ayrıca, gaze analizi, izleyicinin masaüstü mu mobil cihaz kullandığına bağlı olarak ayarlanır.
Veri Setleri: Göz
Yazarlar, dikkat algılama sistemini güçlendirmek ve değerlendirmek için dört veri setini kullanmışlardır: üçü gaze davranışı, konuşma ve esneme üzerine odaklanırken, dördüncü veri seti, çeşitli dikkatsizlik türlerinin karışımını içeren gerçek dünya reklam testi oturumlarından oluşmaktadır.
Çalışmanın özel gereksinimleri nedeniyle, her kategori için özel veri setleri oluşturulmuştur. Tüm derlenen veri setleri, milyonlarca kaydedilmiş oturum içeren bir özel depodan gelmektedir; bu depoda, ev veya işyeri ortamlarında, web tabanlı bir kurulum kullanarak, bilgilendirilmiş onay ile reklamları izleyen katılımcılar bulunmaktadır – ancak bu onay anlaşmalarının sınırlamaları nedeniyle, yeni çalışmanın veri setleri kamuoyuna açıklanamaz.
Göz veri setini oluşturmak için, katılımcılardan ekran上的 çeşitli noktaların,包括 kenarların上的 bir hareketli nokta izlemeleri ve ardından ekranın dört yöne (yukarı, aşağı, sola ve sağa) bakmaları istendi. Bu şekilde, yakalama ve kapsama arasındaki ilişki kuruldu:

Masaüstü (a) ve mobil (b) cihazlardaki gaze video stimulüsünün ekran görüntüleri. İlk ve üçüncü çerçeveler, hareketli bir nokta izleme talimatlarını gösterirken, ikinci ve dördüncü çerçeveler, ekranın dışına bakma talimatlarını gösterir.
Hareketli nokta segmentleri dikkatli olarak etiketlenirken, ekran dışı segmentler dikkatsiz olarak etiketlenmiştir, böylece hem pozitif hem de negatif örneklerin etiketli bir veri seti oluşturulmuştur.
Her video yaklaşık 160 saniye sürmekteydi, masaüstü ve mobil platformlar için ayrı ayrı versiyonlar oluşturulmuş ve her biri 1920×1080 ve 608×1080 çözünürlüklerine sahipti.
Toplam 609 video toplandı, bunların 322’si masaüstü ve 287’si mobil kayıtları içermektedir. Etiketler, video içeriğine dayalı olarak otomatik olarak uygulanmış ve veri seti ayrılmıştır, 158 eğitim örneği ve 451 test örneği oluşturulmuştur.
Veri Setleri: Konuşma
Bu bağlamda, ‘dikkatsizlik’ kriterlerinden biri, bir kişinin bir saniyeden fazla konuştuğudur (bu, anlık bir yorum veya hatta bir öksürük olabilir).
Kontrol edilen ortam, ses kaydı veya analizi yapmadığından, konuşma, tahmini yüz özellikleri içindeki iç hareketler gözlenerek varsayılır. Bu nedenle, yazarlar, konuşmayı ses olmadan tespit etmek için, yalnızca görsel girdiden oluşan bir veri seti oluşturmuşlardır, bu veri seti iç depodan gelmektedir ve iki parçaya ayrılmıştır: ilk parçada yaklaşık 5.500 video bulunmaktadır, bunların her biri üç etiketleyici tarafından konuşma veya konuşmama olarak etiketlenmiştir (bunlardan 4.400’ü eğitim ve doğrulama için, 1.100’ü test için kullanılmıştır).
İkinci parça, 16.000 oturumu içerir ve bunlar otomatik olarak etiketlenmiştir, 10.500’ü katılımcıların reklamları sessizce izlediğini, 5.500’ü ise markalar hakkında görüşlerini ifade ettiğini göstermektedir.
Veri Setleri: Esneme
Birkaç ‘esneme’ veri seti bulunsa da, YawDD ve Sürücü Yorgunluğu gibi, yazarlar, bunların reklam testi senaryoları için uygun olmadığını iddia etmektedirler, çünkü bunlar ya simüle edilmiş esneme içerir ya da yüz buruşmaları içerir ki bunlar korku veya diğer, esneme olmayan eylemlerle karıştırılabilir.
Bu nedenle, yazarlar, 735 videosunu iç koleksiyonlarından seçmişlerdir, muhtemelen çene düşmesi içeren oturumları seçmişlerdir ve her video üç etiketleyici tarafından etkin veya etkin olmayan esneme olarak etiketlenmiştir. Sadece %2,6’lık bir çerçeve aktif esnemeyi içeriyordu, bu da sınıf dengesizliğini vurgulamaktadır ve veri seti 670 eğitim videosu ve 65 test videosu olarak ayrılmıştır.
Veri Setleri: Dikkatsizlik
Dikkatsizlik veri seti de yazarların reklam testi depolarından gelmektedir, burada katılımcılar, atanmış görevler olmadan gerçek reklamları izlemişlerdir. Toplam 520 oturum (193’ü mobil, 327’si masaüstü ortamında) rastgele seçilmiş ve üç etiketleyici tarafından dikkatli veya dikkatsiz olarak etiketlenmiştir.
Dikkatsiz davranış, ekran dışı bakış, konuşma, uyuşukluk ve izlenmeyen ekranlar içerir. Oturumlar, dünyanın çeşitli bölgelerini kapsar, masaüstü kayıtları daha yaygın, esnek web kamerası yerleştirme nedeniyle.
Dikkat Modelleri
Önerilen dikkat modeli, yüz ifadeleri, baş duruşu ve göz bakış yönü gibi düşük seviyeli görsel özellikler işler – bunlar, yukarıda bahsedilen AFFDEX 2.0 ve SmartEye SDK aracılığıyla çıkarılır.
Bunlar daha sonra, her dikkatsizlik türünün kendi veri setine dayalı olarak eğitilen ayrı ikili sınıflandırıcılar tarafından işlenir ve yüksek seviyeli göstergelere dönüştürülür.

Önerilen izleme sisteminin şeması.
Göz modeli, normalize edilmiş gaze koordinatları kullanarak izleyici ekranı izliyor mu yoksa yoksa belirler, masaüstü ve mobil cihazlar için ayrı ayrı kalibrasyon yapılır. Bu süreci, uzaysal ve zamansal özelliklere dayalı bir doğrusal Destek Vektör Makinesi (SVM) destekler, bu da hızlı gaze değişikliklerini yumuşatmak için bir hafıza penceresi içerir.
Konuşma olmadan konuşmayı tespit etmek için sistem, kırpılmış ağız bölgeleri ve görsel girdiden eğitilmiş bir 3D-CNN kullanır, etiketler, oturum tipine dayalı olarak atanır ve zaman içinde düzeltilir, bu da kısa ağız hareketlerinden kaynaklanan yanlış pozitifleri azaltır.
Esneme tam yüz görüntü parçaları kullanılarak tespit edilir, bu da daha geniş yüz hareketini yakalamayı sağlar, ve esneme sıklığının düşük olması ve diğer ifadelerle benzerliği nedeniyle görev zorlu olmuştur.
Ekran terk bir yüzün veya aşırı baş duruşunun yokluğunda belirlenir ve tahminler bir karar ağacı tarafından yapılır.
Son dikkat durumu sabit bir kural kullanılarak belirlenir: herhangi bir modül dikkatsizlik tespit ederse, izleyici dikkatsiz olarak işaretlenir – bu yaklaşım, duyarlılığı önceliklendirmekte ve masaüstü ve mobil bağlamlar için ayrı ayrı ayarlanmaktadır.
Testler
Söylenildiği gibi, testler, bileşenlerin kaldırılması ve sonuç üzerindeki etkisinin not edildiği soykütük yöntemini takip eder.

Çalışmada tanımlanan farklı dikkatsizlik kategorileri.
Göz modeli, üç ana adımda ekran dışı davranışları tespit eder: ham gaze tahminlerini normalize etme, çıktıyı ince ayarlama ve masaüstü cihazlar için ekran boyutunu tahmin etme.
Her bir bileşenin önemini anlamak için, yazarlar bunları bireysel olarak kaldırır ve 226 masaüstü ve 225 mobil videoyu içeren iki veri setinde performansı değerlendirir. Sonuçlar, G-ortalama ve F1 puanları ile ölçülür ve aşağıdaki gibi gösterilir:

Tam göz modelinin performansı ve bireysel işleme adımlarının kaldırılmasıyla oluşan performans.
Her durumda, bir adım atlandığında performans düşmüştür. Normalleştirme, özellikle masaüstü cihazlarda, kamera yerleştirme daha değişken olduğunda, özellikle değerli olmuştur.
Çalışma ayrıca, görsel özelliklerin mobil kamera yönünü nasıl öngördüğünü değerlendirdi: yüz konumu, baş duruşu ve göz bakış yönü sırasıyla 0,75, 0,74 ve 0,60 puan aldı, bunların birleşimi 0,91 puanına ulaştı, bu da – yazarlara göre – birden fazla ipucunun entegrasyonunun avantajını vurgulamaktadır.
Konuşma modeli, dikey dudak mesafesi üzerinde eğitilmiş ve elle etiketlenmiş test setinde 0,97’lik bir ROC-AUC puanına ulaşmış, otomatik olarak etiketlenen daha büyük veri setinde 0,96 puanına ulaşmıştır, bu da her iki veri setinde tutarlı bir performans göstermiştir.
Esneme modeli, yalnızca ağız açıklık oranı kullanılarak %96,6’lık bir ROC-AUC puanına ulaşmış, bu puan, hareket birimi tahminleri ile birleştirildiğinde %97,5’e yükselmiştir.
İzlenmeyen ekran modeli, bir yüzün veya aşırı baş duruşunun yokluğunda dikkatsiz anları sınıflandırır ve tahminler bir karar ağacı tarafından yapılır. Yazarlar, gerçek dikkatsizlik veri setindeki tüm yüz bulunmayan olayları elle etiketlemiş ve her bir etkinliğin temel nedenini belirlemiştir – belirsiz durumlar (örneğin, kamera engelleme veya video bozulması) analizin dışında tutulmuştur.
Aşağıdaki sonuç tablosunda gösterildiği gibi, yalnızca %27’si kullanıcıların fiziksel olarak ekranı terk etmesi nedeniyle oluşmuştur.

Bazı durumlarda yüz bulunmama nedenleri çeşitlilik göstermektedir.
Makale şöyle diyor:
‘İzlenmeyen ekranlar, ‘yüz bulunamama’ sinyalini tetikleyen olayların yalnızca %27’sini oluşturuyor, ancak bu sinyal, ekranın dışına aşırı açıyla bakma, aşırı hareket etme veya yüzü önemli ölçüde engelleme gibi dikkatsizlik göstergesi olan diğer nedenlerle de tetiklenmektedir.’
Son nicel testte, yazarlar, farklı dikkatsizlik sinyallerini ilerleyici olarak eklemenin, gerçek dikkatsizlik veri seti ve göz veri setinin bir alt kümesindeki genel dikkat modelinin performansına nasıl etki ettiğini değerlendirdiler.
Testler, gerçek dikkatsizlik veri seti ve göz veri setinin bir alt kümesi üzerinde gerçekleştirilmiştir. G-ortalama ve F1 puanları, performansı ölçmek için kullanılmıştır (ancak uyuşukluk ve konuşma, bu bağlamda sınırlı ilgili olduklarından, göz veri seti analizi dışında tutulmuştur).
Aşağıdaki gibi gösterildiği gibi, dikkat algılaması, daha fazla dikkatsizlik türü eklendikçe tutarlı bir şekilde iyileşmiştir, ekran dışı bakış, en yaygın dikkatsizlik türü, en güçlü temel çizgisi sağlamıştır.

Mimariye çeşitli dikkatsizlik sinyallerini eklemenin etkisi.
Bu sonuçlardan, makale şöyle diyor:
‘Öncelikle, tüm dikkatsizlik sinyallerinin entegrasyonunun, dikkat algılamasını iyileştirdiğini söyleyebiliriz.
‘İkincisi, dikkat algılamasındaki iyileşme, hem masaüstü hem de mobil cihazlarda tutarlıdır. Üçüncüsü, gerçek veri setindeki mobil oturumlar, ekranın dışına baktıklarında önemli baş hareketleri gösterir, bu da mobil cihazlarda masaüstü cihazlara göre daha yüksek performansa yol açar. Dördüncüsü, uyuşukluk sinyalini eklemenin, diğer sinyallere kıyasla nispeten hafif bir iyileşme sağladığı görülmektedir, çünkü bu genellikle nadiren xảyar. ‘
‘Son olarak, izlenmeyen ekran sinyali, mobil cihazlarda masaüstü cihazlara göre daha büyük bir iyileşme sağlar, çünkü mobil cihazlar kolayca izlenmeden bırakılabilir.’
Yazarlar ayrıca, modelini, reklam testinde kullanılan önceki bir sistem olan AFFDEX 1.0 ile karşılaştırmış ve hatta mevcut modelin başa dayalı gaze algılaması, her iki cihaz tipinde AFFDEX 1.0’ı aşmıştır:
‘Bu iyileşme, hem yaw hem de pitch yönlerinde baş hareketlerini birleştirerek ve baş duruşunu küçük değişiklikleri hesaba katmak için normalize ederek elde edilmiştir. Gerçek mobil veri setindeki belirgin baş hareketleri, baş modelimizin AFFDEX 1.0 ile benzer bir performans göstermesini sağladı.’
Yazarlar, makaleyi, aşağıdaki gibi gösterilen bir nitel test turu ile kapatmaktadır.

Farklı dikkatsizlik türleri için doğru ve yanlış pozitif örnekleri gösteren dikkat modelinin örnek çıktıları, masaüstü ve mobil cihazlarda.
Yazarlar şöyle diyor:
‘Sonuçlar, modelimizin, kontrolsüz ortamlarda çeşitli dikkatsizlik türlerini etkili bir şekilde tespit ettiğini gösteriyor. Ancak, bazı kenar durumlarında, örneğin şiddetli baş eğimleri ekran上的 gaze üzerinde tutulurken, bazı ağız engelleme veya aşırı bulanık gözler veya ağır şekilde kararmış yüzler gibi durumlarda yanlış pozitifler üretebilir.’
Sonuç
Bu sonuçlar, önceki çalışmalara göre ölçülü ancak anlamlı bir ilerleme temsil etse de, çalışmanın daha derin değeri, izleyicinin iç durumuna erişme istikrarlı çabasına bir bakış sunmaktadır. Veriler, rıza ile toplanmış olsa da, yöntem, yapılandırılmış, pazar araştırması ayarlarının ötesine geçebilecek gelecek çerçevelere işaret etmektedir.
Bu rather paranoid sonuç, bu özel araştırma dalının kapalı, kısıtlı ve kıskançlıkla korunan doğası tarafından desteklenmektedir.
* Yazarların satırlarındaki alıntıların hyperlinklerine dönüştürülmesi.
Çarşamba, 9 Nisan 2025 tarihinde ilk kez yayınlandı.












