Andersons vinkel
På jakt etter ‘ugler og øgler’ i en annonsørs publikum

Siden det online annonsemarkedet estimeres å ha brukt 740,3 milliarder USD i 2023, er det lett å forstå hvorfor annonsebedrifter investerer betydelige ressurser i denne spesielle grenen av datavisjonsforskning.
Selv om industrien er lukket og beskyttet, publiserer den av og til studier som antyder mer avansert proprietær arbeid i ansikts- og øyegaze-gjenkjenning – inkludert aldersgjenkjenning, som er sentral for demografiske analytikkstatistikk:

Å estimere alder i en annonskontekst er av interesse for annonsører som måtte være rettet mot en bestemt demografisk gruppe. I dette eksperimentelle eksempelet på automatisk ansiktsaldersestimering, blir alderen til artisten Bob Dylan sporet over årene. Kilde: https://arxiv.org/pdf/1906.03625
Disse studiene, som sjelden dukker opp i offentlige repositorier som Arxiv, bruker legitimt rekrutterte deltakere som grunnlag for AI-drevet analyse som har som mål å bestemme i hvilken grad, og på hvilken måte, seeren engasjrer seg med en annons.

Dlibs Histogram of Oriented Gradients (HoG) brukes ofte i ansiktsanalyse-systemer. Kilde: https://www.computer.org/csdl/journal/ta/2017/02/07475863/13rRUNvyarN
Dyriske instinkter
I denne sammenheng er det naturlig at annonseindustrien er interessert i å bestemme feilpositive (tilfeller der et analytisk system misforstår en persons handlinger), og i å etablere klare kriterier for når personen som ser på deres reklamer ikke er fullt engasjert med innholdet.
Så langt det gjelder skjerm-basert annonsering, tenderer studiene til å fokusere på to problemer i to miljøer. Miljøene er ‘skrivebord’ eller ‘mobil’, hver med sine særegne karakteristika som krever tilpassede løsninger; og problemene – fra annonsørens synspunkt – representeres av ugle- og øgle-atferd – tendensen hos seerne til ikke å gi full oppmerksomhet til en annons som er foran dem.

Eksempler på ‘ugle’ og ‘øgle’-atferd i en deltaker i et annonseforskningsprosjekt. Kilde: https://arxiv.org/pdf/1508.04028
Hvis du ser bort fra den ønskede annonsen med hele hodet ditt, er dette ‘ugle-atferd’; hvis hodestillingen din er statisk, men øynene dine vandrer bort fra skjermen, er dette ‘øgle-atferd’. I forhold til analyser og testing av nye annonser under kontrollerte forhold, er disse essensielle handlinger for et system å kunne fange.
En ny artikkel fra SmartEyes Affectiva-overgang presenterer en arkitektur som utnytter flere eksisterende rammeverk for å levere en kombinerende og konkatenerende funksjonssett over alle de nødvendige forhold og mulige reaksjoner – og for å kunne si om en seer er kjedet, engasjert eller på noen måte fjern fra innholdet annonsøren ønsker dem å se.

Eksempler på sanne og feilpositive detektert av det nye oppmerksomhetssystemet for ulike distraksjonssignaler, vist separat for skrivebord og mobile enheter. Kilde: https://arxiv.org/pdf/2504.06237
Forfatterne skriver*:
‘Begrenset forskning har dykket ned i å overvåke oppmerksomhet under online-annonser. Mens disse studiene fokuserte på å estimere hodeposisjon eller blikkretning for å identifisere tilfeller av avledet blikk, ser de bort fra kritiske parametre som enhetstype (skrivebord eller mobil), kamera-plassering i forhold til skjermen og skjermstørrelse. Disse faktorene påvirker betydelig oppmerksomhetsdeteksjon.
‘I denne artikkelen foreslår vi en arkitektur for oppmerksomhetsdeteksjon som omfatter deteksjon av ulike distraktorer, inkludert både ugle- og øgle-atferd av å se bort fra skjermen, samt å snakke, å gape (gjennom å gape og forlenget øyelukking) og å forlate skjermen uberørt.
‘I motsetning til tidligere tilnærminger, integrerer vår metode enhetsspesifikke funksjoner som enhetstype, kamera-plassering, skjermstørrelse (for skrivebord) og kamera-orientering (for mobile enheter) med rå gaze-estimering for å forbedre oppmerksomhetsdeteksjonens nøyaktighet.’
Den nye artikkelen har tittelen Overvåking av seerens oppmerksomhet under online-annonser, og kommer fra fire forskere ved Affectiva.
Metode og data
Hovedsakelig på grunn av hemmelighold og lukket natur av slike systemer, sammenligner den nye artikkelen ikke forfatternes tilnærmning direkte med rivaler, men presenterer sine funn eksklusivt som ablasjonsstudier; artikkelen følger heller ikke den vanlige formaten for datavisjonslitteratur. Derfor skal vi se på forskningen som den presenteres.
Forfatterne betoner at bare et begrenset antall studier har behandlet oppmerksomhetsdeteksjon spesifikt i sammenheng med online-annonser. I AFFDEX SDK, som tilbyr sanntids multi-ansiktsgjenkjenning, antas oppmerksomhet utelukkende fra hodeposisjon, med deltakere merket som uoppmerksomme hvis hodevinkelen passerer en definert terskel.

Et eksempel fra AFFDEX SDK, et Affectiva-system som baserer seg på hodeposisjon som en indikator for oppmerksomhet. Kilde: https://www.youtube.com/watch?v=c2CWb5jHmbY
I 2019-samarbeidet Automatisk måling av visuell oppmerksomhet til videoinnhold ved hjelp av dyp læring, ble et datasett på rundt 28 000 deltakere annotert for ulike uoppmerksomme atferder, inkludert å se bort, å lukke øynene, eller å engasjere seg i andre aktiviteter, og en CNN-LSTM-modell ble trent for å detektere oppmerksomhet fra ansiktsuttrykk over tid.

Fra 2019-artikkelen, et eksempel som illustrerer forventede oppmerksomhetstilstander for en seer som ser på videoinnhold. Kilde: https://www.jeffcohn.net/wp-content/uploads/2019/07/Attention-13.pdf.pdf
Likevel observerer forfatterne at disse tidligere forsøkene ikke tok hensyn til enhetsspesifikke faktorer, som om deltakeren brukte en skrivebord- eller mobil enhet; heller ikke tok de hensyn til skjermstørrelse eller kamera-plassering. I tillegg fokuserer AFFDEX-systemet bare på å identifisere blikkavvik, og utelater andre kilder for distraksjon, mens 2019-arbeidet prøver å detektere en bredere sett av atferder – men bruken av en enkelt grunt CNN kan, ifølge artikkelen, ha vært utilstrekkelig for denne oppgaven.
Forfatterne observerer at noen av de mest populære forskningene i denne retningen ikke er optimalisert for annons-testing, som har andre behov sammenlignet med domener som kjøring eller utdanning – hvor kamera-plassering og kalibrering vanligvis er fikset på forhånd, i stedet for å operere i ukalibrerte oppsett, og innenfor den begrensede blikkavstanden til skrivebord og mobile enheter.
Derfor har de utviklet en arkitektur for å detektere seerens oppmerksomhet under online-annonser, ved å utnytte to kommersielle verktøy: AFFDEX 2.0 og SmartEye SDK.

Eksempler på ansiktsanalyse fra AFFDEX 2.0. Kilde: https://arxiv.org/pdf/2202.12059
Disse tidligere arbeidene trekker ut lav-nivå funksjoner som ansiktsuttrykk, hodeposisjon og blikkretning. Disse funksjonene blir deretter prosessert for å produsere høy-nivå indikatorer, inkludert blikkposisjon på skjermen; gape; og snakke.
Systemet identifiserer fire distraksjonstyper: blikk bort fra skjermen; sovighet; snakke; og uberørt skjerm. Det justerer også blikkanalyse basert på om seeren er på en skrivebord- eller mobil enhet.
Datasett: Blikk
Forfatterne brukte fire datasett for å drive og evaluere oppmerksomhetsdeteksjonssystemet: tre som fokuserte på blikkatferd, snakke og gape; og en fjerde som var trukket fra sanntids annons-testsessioner som inneholdt en blanding av distraksjonstyper.
På grunn av de spesifikke kravene til arbeidet, ble egne datasett opprettet for hver av disse kategoriene. Alle datasettene ble samlet inn fra et proprietært repository som inneholdt millioner av innspilte sessioner med deltakere som så på annonser i hjemme- eller arbeidsplass-miljøer, ved hjelp av et web-basert oppsett, med informert samtykke – og på grunn av begrensningene i disse samtykkesavtale, kan datasettene for det nye arbeidet ikke gjøres offentlig tilgjengelige.
For å konstruere blikk-datasettet, ble deltakerne bedt om å følge en flyttende punkt over ulike punkter på skjermen, inkludert kantene, og deretter å se bort fra skjermen i fire retninger (opp, ned, venstre og høyre) med sekvensen gjentatt tre ganger. På denne måten ble forholdet mellom fangst og dekning etablert:

Skjermbilder som viser blikkvideo-stimulansen på (a) skrivebord og (b) mobile enheter. Første og tredje rammer viser instruksjoner for å følge en flyttende punkt, mens andre og fjerde rammer instruerer deltakerne om å se bort fra skjermen.
De flyttende punkt-segmentene ble merket som oppmerksomme, og segmentene utenfor skjermen ble merket som uoppmerksomme, og produserte et merket datasett med både positive og negative eksempler.
Hver video varte omtrent 160 sekunder, med separate versjoner opprettet for skrivebord- og mobile plattformer, hver med oppløsninger på 1920×1080 og 608×1080, henholdsvis.
Totalt 609 videoer ble samlet inn, bestående av 322 skrivebord- og 287 mobile innspillinger. Etiketter ble påført automatisk basert på videoinnholdet, og datasettet delt inn i 158 treningseksempler og 451 for testing.
Datasett: Snakke
I denne sammenhengen er ett av kriteriene for å definere ‘uoppmerksomhet’ når en person snakker i lenger enn ett sekund (som kan være et midlertidig kommentar, eller til og med et host).
Ettersom den kontrollerte miljøet ikke registrerer eller analyserer lyd, antas snakke ved å observere indre bevegelser av estimerte ansiktslandemerker. Derfor ble et datasett basert utelukkende på visuell informasjon opprettet, trukket fra deres interne repository, og delt inn i to deler: den første delen inneholdt omtrent 5 500 videoer, hver manuelt merket av tre annotatorer som enten snakke eller ikke snakke (av disse ble 4 400 brukt til trening og validering, og 1 100 til testing).
Den andre delen bestod av 16 000 sessioner som ble automatisk merket basert på sessionstype: 10 500 viser deltakere som ser stille på annonser, og 5 500 viser deltakere som uttrykker meninger om merker.
Datasett: Gape
Selv om noen ‘gape’-datasett eksisterer, inkludert YawDD og Driver Fatigue, hevder forfatterne at ingen av disse er egnet for annons-test-scenarier, siden de enten inneholder simulerte gape eller inneholder ansiktsforvridninger som kan forveksles med frykt eller andre, ikke-gape-handlinger.
Derfor brukte forfatterne 735 videoer fra deres interne samling, og valgte sessioner som sannsynligvis inneholdt en underkjeve-bevegelse som varte lenger enn ett sekund. Hver video ble manuelt merket av tre annotatorer som enten viste aktiv eller inaktiv gape. Bare 2,6 prosent av rammer inneholdt aktive gape, og understreker klassens ubalanse, og datasettet ble delt inn i 670 treningvideoer og 65 for testing.
Datasett: Distraksjon
Distraksjons-datasettet ble også trukket fra forfatternes annons-test-repository, hvor deltakerne hadde sett på faktiske annonser uten noen tildelte oppgaver. Totalt 520 sessioner (193 på mobile og 327 på skrivebord-miljøer) ble tilfeldig valgt og manuelt merket av tre annotatorer som enten oppmerksomme eller uoppmerksomme.
Uoppmerksom atferd inkluderte blikk bort fra skjermen, snakke, sovighet og uberørt skjerm. Sessionene spenner over ulike regioner over hele verden, med skrivebord-innspillinger mer vanlige på grunn av fleksibel webcam-plassering.
Oppmerksomhetsmodeller
Den foreslåtte oppmerksomhetsmodellen prosesserer lav-nivå visuelle funksjoner, nemlig ansiktsuttrykk; hodeposisjon; og blikkretning – trukket ut gjennom ovennevnte AFFDEX 2.0 og SmartEye SDK.
Disse blir deretter konvertert til høy-nivå indikatorer, med hver distraktor håndtert av en separat binær klassifikator trent på sitt eget datasett for uavhengig optimalisering og evaluering.

Schema for det foreslåtte overvåkningssystemet.
Blikk-modellen bestemmer om seeren ser på eller bort fra skjermen ved hjelp av normaliserte blikkoordinater, med separate kalibreringer for skrivebord- og mobile enheter. Dette prosessen blir hjulpet av en lineær Support Vector Machine (SVM), trent på romlige og tidsmessige funksjoner, som inkorporerer en minne-vindu for å glatte ut raske blikk-bevegelser.
For å detektere snakke uten lyd, brukte systemet avkortede munn-regioner og en 3D-CNN trent på både konversasjonelle og ikke-konversasjonelle video-segmenter. Etiketter ble tildelt basert på sessionstype, med tidsmessig glatting som reduserte de feilpositive som kan resultere fra korte munn-bevegelser.
Gape ble detektert ved hjelp av fullt ansikts-bilder, for å fange bredere ansikts-bevegelser, med en 3D-CNN trent på manuelt merkte ramer (selv om oppgaven ble komplisert av gapes lavfrekvens i naturlig visning, og likheten med andre uttrykk).
Uberørt skjerm ble identifisert gjennom fravær av et ansikt eller ekstrem hodeposisjon, med prediksjoner gjort av en beslutningstre.
Endelig oppmerksomhetsstatus ble bestemt ved hjelp av en fast regel: hvis noen modul detekterte uoppmerksomhet, ble seeren merket uoppmerksom – en tilnærmning som prioriterer sensitivitet, og justert separat for skrivebord- og mobile kontekster.
Tester
Som nevnt tidligere, følger testene en ablativ metode, hvor komponenter fjernes og effekten på resultatet noteres.

Ulike kategorier av oppfattet uoppmerksomhet identifisert i studien.
Blikk-modellen identifiserte blikk bort fra skjermen gjennom tre nøkkel-steg: normalisering av rå blikkestimeringer, finjustering av utgangen og estimering av skjermstørrelse for skrivebord-enheter.
For å forstå viktigheten av hver komponent, fjernet forfatterne dem individuelt og evaluerte ytelsen på 226 skrivebord- og 225 mobile videoer trukket fra to datasett. Resultatene, målt med G-mean og F1-poeng, vises nedenfor:

Resultater som indikerer ytelsen til den fullstendige blikk-modellen, sammen med versjoner med individuelle prosess-steg fjernet.
I alle tilfeller sank ytelsen når en komponent ble fjernet. Normalisering viste seg å være spesielt verdifull på skrivebord, hvor kamera-plassering varierer mer enn på mobile enheter.
Studien evaluerte også hvordan visuelle funksjoner forutså mobile kamera-orientering: ansikts-plassering, hodeposisjon og øye-gaze scoret 0,75, 0,74 og 0,60, mens deres kombinasjon nådde 0,91, og understreker – ifølge forfatterne – fordelen ved å integrere multiple signaler.
Snakke-modellen, trent på vertikal leppe-avstand, oppnådde en ROC-AUC på 0,97 på det manuelt merkte testsettet, og 0,96 på det større automatisk merkte datasettet, og indikerer konsistent ytelse over begge.
Gape-modellen nådde en ROC-AUC på 96,6 prosent ved hjelp av munn-aspekt-forhold alene, som forbedret til 97,5 prosent når kombinert med handling-enhet-prediksjoner fra AFFDEX 2.0.
Den uberørte skjerm-modellen klassifiserte øyeblikk som uoppmerksomme når både AFFDEX 2.0 og SmartEye feilet i å detektere et ansikt i mer enn ett sekund. For å evaluere gyldigheten av dette, annoterte forfatterne manuelt alle slike ingen-ansikts-hendelser i reell distraksjons-datasettet, og identifiserte den underliggende årsaken til hver aktivering. Tvetydige tilfeller (slik som kamera-forstyrrelse eller video-forvrengning) ble ekskludert fra analysen.
Som vist i resultat-tabellen nedenfor, var bare 27 prosent av ‘ingen-ansikts’-aktiveringer på grunn av at brukerne fysisk forlot skjermen.

Forskjellige årsaker til at et ansikt ikke ble funnet, i visse tilfeller.
Artikkelen slutter med en (kanskje ganske formell) kvalitativ test-runde, vist nedenfor.

Eksempler på utdata fra oppmerksomhetsmodellen over skrivebord og mobile enheter, med hver rad som presenterer eksempler på sanne og feilpositive for ulike distraksjonstyper.
Forfatterne skriver:
‘Resultatene indikerer at vår modell effektivt detekterer ulike distraktorer i ukontrollerte miljøer. Likevel kan den av og til produsere feilpositive i visse ekstreme tilfeller, som ekstremt hode-tilting mens man beholder blikket på skjermen, noen munn-ocklusjoner, usedvanlig uklare øyne eller sterkt mørklagte ansiktsbilder. ‘
Konklusjon
Selv om resultatene representerer en målt, men meningsfull fremgang over tidligere arbeid, ligger den dypere verdien av studien i det glimt den gir inn i den vedvarende drivkraften for å få tilgang til seerens indre tilstand. Selv om dataene ble samlet inn med samtykke, peker metoden mot fremtidige rammeverk som kan utvides beyond strukturerte, marked-forsknings-miljøer.
Dette ganske paranoidiske konklusjon blir bare forsterket av den lukkede, begrensede og sjalu-beskyttede naturen til denne spesielle grenen av forskning.
* Min konvertering av forfatternes inline-citater til hyperlenker.
Først publisert onsdag, 9. april 2025












