Andersonův úhel
Hledání “sov a ještěrek” v publikační audienci

Odvětví online reklamy se odhaduje, že v roce 2023 vydalo 740,3 miliard USD, je proto snadné pochopit, proč reklamní společnosti investují značné prostředky do tohoto konkrétního směru počítačového vidění.
Navzdory tomu, že je tato oblast uzavřená a chráněná, publikuje občas studie, které naznačují pokročilejší proprietární práci v oblasti rozpoznávání obličeje a pohledu – včetně rozpoznávání věku, které je klíčové pro demografické statistiky:

Odhad věku v kontextu reklamy je zajímavý pro reklamní společnosti, které cílí na konkrétní demografickou skupinu. V tomto experimentálním příkladu automatického odhadu věku je sledován věk zpěváka Boba Dylana v průběhu let. Zdroj: https://arxiv.org/pdf/1906.03625
Tyto studie, které se zřídka objevují v veřejných repozitářích, jako je Arxiv, používají legitimně získané účastníky jako základ pro analýzu řízenou umělou inteligencí, která má za cíl určit, do jaké míry a jakým způsobem je divák zapojen do reklamy.

Dlib’s Histogram of Oriented Gradients (HoG) je často používán v systémech rozpoznávání obličeje. Zdroj: https://www.computer.org/csdl/journal/ta/2017/02/07475863/13rRUNvyarN
Animální instinkt
V tomto ohledu je pochopitelné, že se reklamní odvětví zajímá o stanovení falešných pozitivů (případů, kdy analytický systém mylně interpretuje jednání subjektu) a o stanovení jasných kritérií pro případ, kdy osoba sledující reklamy není plně zapojena do obsahu.
Co se týče reklamy založené na obrazovce, studie se obvykle zaměřují na dva problémy ve dvou prostředích. Prostředí jsou “desktop” nebo “mobilní”, každé z nich má své specifické charakteristiky, které vyžadují přizpůsobené řešení; a problémy – z pohledu reklamní společnosti – jsou reprezentovány chováním sovy a ještěrky – tendencí diváků nevěnovat plnou pozornost reklamě, která je před nimi.

Příklad chování sovy a ještěrky v rámci výzkumu reklamy. Zdroj: https://arxiv.org/pdf/1508.04028
Pokud se díváte odjinud než na cílenou reklamu celým svým tělem, jedná se o chování sovy; pokud vaše hlava zůstává statická, ale vaše oči bloudí od obrazovky, jedná se o chování ještěrky. Z hlediska analýzy a testování nových reklam v kontrolovaných podmínkách jsou tyto akce pro systém nezbytné.
Nová studie od SmartEye’s Affectiva představuje architekturu, která využívá několik existujících rámců k poskytování kombinovaného a konkatenuovaného souboru funkcí napříč všemi požadovanými podmínkami a možnými reakcemi – a k určení, zda je divák unaven, zapojen nebo vzdálený od obsahu, který reklamní společnost chce, aby sledoval.

Příklad pravdivých a falešných pozitivů detekovaných novým systémem pro různé signály rozptýlení, zobrazené samostatně pro desktopové a mobilní zařízení. Zdroj: https://arxiv.org/pdf/2504.06237
Autoři uvádějí*:
‘Omezený výzkum se zabýval monitorováním pozornosti během online reklam. Tyto studie se zaměřily na odhad hlavy nebo směru pohledu k identifikaci případů rozptýlení, ale zanedbaly kritické parametry, jako je typ zařízení (desktop nebo mobilní), umístění kamery vzhledem k obrazovce a velikost obrazovky. Tyto faktory významně ovlivňují detekci pozornosti. ‘
‘V tomto článku navrhujeme architekturu pro detekci pozornosti, která zahrnuje detekci různých rozptýlení, včetně chování sovy a ještěrky, odhlížení od obrazovky, spánku (prostřednictvím zívání a prodlouženého zavření očí) a opuštění obrazovky. ‘
‘Na rozdíl od předchozích přístupů naše metoda integruje zařízení-specifické funkce, jako je typ zařízení, umístění kamery, velikost obrazovky (pro desktopové počítače) a orientace kamery (pro mobilní zařízení), s hrubým odhadem pohledu pro zlepšení přesnosti detekce pozornosti.’
Nová práce je nazvána Monitorování pozornosti diváka během online reklam a pochází od čtyř výzkumníků z Affectiva.
Metoda a data
Z velké části kvůli utajení a uzavřené povaze těchto systémů nová studie neporovnává přístup autorů přímo s konkurencí, ale spíše prezentuje své výsledky výhradně jako ablační studie; ani tato studie se nedrží obvyklého formátu literatury počítačového vidění. Proto se budeme zabývat touto studií, jak je prezentována.
Autoři zdůrazňují, že pouze omezený počet studií se zabýval detekcí pozornosti specificky v kontextu online reklam. V AFFDEX SDK, který nabízí reálný čas multi-obličejové rozpoznávání, je pozornost odvozována pouze z polohy hlavy, s účastníky označenými jako nezapojení, pokud jejich úhel hlavy překročí stanovenou hranici.

Příklad z AFFDEX SDK, systému Affectiva, který se spoléhá na polohu hlavy jako indikátor pozornosti. Zdroj: https://www.youtube.com/watch?v=c2CWb5jHmbY
V spolupráci z roku 2019 Automatické měření vizuální pozornosti k videoobsahu pomocí hlubokého učení, dataset asi 28 000 účastníků byl annotován pro různé nezapojené chování, včetně odhlížení, zavírání očí nebo zapojení do nesouvisejících aktivit, a model CNN-LSTM byl vyškolován k detekci pozornosti z obličejového vzhledu v čase.

Z roku 2019, příklad ilustrující předpovězené stavy pozornosti pro diváka sledujícího videoobsah. Zdroj: https://www.jeffcohn.net/wp-content/uploads/2019/07/Attention-13.pdf.pdf
Však autoři poznamenávají, že tyto předchozí snahy nezohledňovaly zařízení-specifické faktory, jako je typ zařízení; ani nezohledňovaly velikost obrazovky nebo umístění kamery. Kromě toho se systém AFFDEX zaměřuje pouze na identifikaci rozptýlení pohledu a opomíjí jiné zdroje rozptýlení, zatímco práce z roku 2019 se snaží detekovat širší sadu chování – ale použití jediného mělkého CNN mohlo být, podle studie, nedostatečné pro tuto úlohu.
Autoři také poznamenávají, že některé z nejpopulárnějších studií v této oblasti nejsou optimalizovány pro testování reklam, které mají odlišné potřeby ve srovnání s doménami, jako je řízení nebo vzdělávání – kde je umístění kamery a kalibrace obvykle pevně stanoveny předem, spoléhají se na nekaliibrované nastavení a fungují v omezeném rozsahu pohledu desktopových a mobilních zařízení.
Proto autoři navrhli architekturu pro detekci pozornosti diváka během online reklam, využívající dvě komerční nástroje: AFFDEX 2.0 a SmartEye SDK.

Příklad analýzy obličeje z AFFDEX 2.0. Zdroj: https://arxiv.org/pdf/2202.12059
Tyto předchozí práce extrahují nízkoúrovňové funkce, jako jsou obličejové výrazy, poloha hlavy a směr pohledu. Tyto funkce jsou poté zpracovány k produkci vyšších indikátorů, včetně polohy pohledu na obrazovce; zívání; a mluvení.
Systém identifikuje čtyři typy rozptýlení: odhlížení od obrazovky; spánek; mluvení; a opuštění obrazovky. Také upravuje analýzu pohledu podle toho, zda je divák na desktopovém nebo mobilním zařízení.
Datasety: Pohled
Autoři použili čtyři datasety k napájení a vyhodnocení systému detekce pozornosti: tři se zaměřily individuálně na chování pohledu, mluvení a zívání; a čtvrtý byl získán z reálných testovacích relací s reklamami, obsahujících směs různých typů rozptýlení.
Vzhledem k specifickým požadavkům této práce byly vytvořeny vlastní datasety pro každou z těchto kategorií. Všechny datasety byly získány z proprietárního repozitáře s miliony zaznamenaných relací účastníků sledujících reklamy v domácím nebo pracovním prostředí, s informovaným souhlasem – a vzhledem k omezením těchto souhlasů, autoři uvádějí, že datasety pro tuto novou práci nemohou být veřejně dostupné.
Pro konstrukci datasetu pohledu byli účastníci požádáni, aby sledovali pohybující se tečku napříč různými body na obrazovce, včetně jejích okrajů, a poté odhlédnout od obrazovky ve čtyřech směrech (nahoru, dolů, vlevo a vpravo) sekvenci třikrát. Tímto způsobem byla stanovena souvislost mezi zachycením a pokrytím:

Snímky zobrazující video stimul pro pohled na (a) desktopu a (b) mobilním zařízení. První a třetí snímky zobrazují instrukce pro sledování pohybující se tečky, zatímco druhý a čtvrtý snímky instruují účastníky, aby odhlédli od obrazovky.
Segmenty s pohybující se tečkou byly označeny jako zapojení, a segmenty s odhlédnutím od obrazovky jako nezapojení, což vedlo k označenému datasetu obou pozitivních a negativních příkladů.
Každé video trvalo přibližně 160 sekund, s oddělenými verzemi vytvořenými pro desktopové a mobilní platformy, každá s rozlišením 1920×1080 a 608×1080, respectively.
Celkem bylo shromážděno 609 videí, zahrnujících 322 desktopových a 287 mobilních záznamů. Štítky byly aplikovány automaticky na základě obsahu videa, a dataset rozdělen do 158 trénovacích vzorků a 451 testovacích.
Datasety: Mluvení
V tomto kontextu je jedním z kritérií definujících “nezapojení” situace, kdy osoba mluví déle než jednu sekundu (což může být okamžité komentáře nebo dokonce kašel).
Pokud je kontrolované prostředí nezapíše ani neanalyzuje audio, mluvení je odvozováno pozorováním vnitřního pohybu odhadnutých obličejových značek. Proto autoři vytvořili dataset založený výhradně na vizuálním vstupu, získaný z jejich interního repozitáře, a rozdělený do dvou částí: první obsahovala asi 5 500 videí, každé ručně označené třemi anotátory jako mluvení nebo nemluvení (z nichž 4 400 bylo použito pro trénování a validaci a 1 100 pro testování).
Druhá část zahrnovala 16 000 relací automaticky označených na základě typu relace: 10 500 zahrnovalo účastníky, kteří tiše sledovali reklamy, a 5 500 ukázalo účastníky, kteří vyjadřovali názory na značky.
Datasety: Zívání
Ačkoli existují některé datasety pro zívání, včetně YawDD a Driver Fatigue, autoři tvrdí, že žádný z nich není vhodný pro scénáře testování reklam, protože buď obsahují simulovaná zívání nebo obsahují obličejové grimasy, které by mohly být zaměněny za strach nebo jiné, ne-zívající akce.
Proto autoři použili 735 videí ze své interní sbírky, vybraných relací, které pravděpodobně obsahovaly pokles čelisti trvající déle než jednu sekundu. Každé video bylo ručně označeno třemi anotátory jako aktivní nebo neaktivní zívání. Pouze 2,6 % snímků obsahovalo aktivní zívání, což podtrhuje nerovnováhu třídy, a dataset byl rozdělen do 670 trénovacích videí a 65 pro testování.
Datasety: Rozptýlení
Dataset rozptýlení byl také získán z repozitáře autorů, kde účastníci sledovali skutečné reklamy bez přiřazených úkolů. Celkem 520 relací (193 na mobilních a 327 na desktopových prostředích) bylo náhodně vybráno a ručně označeno třemi anotátory jako zapojení nebo nezapojení.
Nezapojené chování zahrnovalo odhlížení od obrazovky, mluvení, spánek, a opuštění obrazovky. Relace pocházely z různých regionů po celém světě, s desktopovými záznamy častějšími, kvůli flexibilnímu umístění webové kamery.
Modely pozornosti
Navrhovaný model pozornosti zpracovává nízkoúrovňové vizuální funkce, jmenovitě obličejové výrazy; poloha hlavy; a směr pohledu – extrahované prostřednictvím výše uvedených AFFDEX 2.0 a SmartEye SDK.
Tyto funkce jsou poté převedeny na vyšší indikátory, s každým rozptýlením zpracovaným samostatným binárním klasifikátorem, který je trénován na svém vlastním datasetu pro nezávislou optimalizaci a vyhodnocení.

Schéma navrhovaného monitorovacího systému.
Model pohledu určuje, zda divák sleduje nebo ne obrazovku, pomocí normalizovaných souřadnic pohledu, s oddělenou kalibrací pro desktopové a mobilní zařízení. Tento proces je podporován lineárním Support Vector Machine (SVM), trénovaným na prostorových a časových funkcích, který zahrnuje paměťové okno pro vyhlazení rychlých změn pohledu.
Pro detekci mluvení bez audio systém použil ořezané ústní oblasti a 3D-CNN trénovaný na konverzačních a nekonverzačních videosekvencích. Štítky byly přiřazeny na základě typu relace, s temporálním vyhlazením, které snižuje falešné pozitivy, které mohou vzniknout z krátkých pohybů úst.
Zívání bylo detekováno pomocí plných obličejových snímků, aby se zachytil širší obličejový pohyb, s 3D-CNN trénovaným na ručně označených snímcích (ačkoli úloha byla komplikována nízkou frekvencí zívání v přirozeném sledování a jeho podobností s jinými výrazy).
Opuštění obrazovky bylo identifikováno prostřednictvím absence obličeje nebo extrémní polohy hlavy, s předpověďmi provedenými pomocí rozhodovacího stromu.
Konečný stav pozornosti byl stanoven pomocí pevného pravidla: pokud kterýkoli modul detekoval nezapojení, divák byl označen jako nezapojený – přístup, který priorizuje citlivost, a je kalibrován samostatně pro desktopové a mobilní kontexty.
Testy
Jak bylo zmíněno dříve, testy následují ablační metodu, kde jsou komponenty odstraněny a je pozorován účinek na výsledek.

Různé kategorie vnímaného nezapojení identifikované ve studii.
Model pohledu identifikoval chování odhlížení od obrazovky prostřednictvím tří klíčových kroků: normalizace hrubých odhadů pohledu, jemné doladění výstupu a odhad velikosti obrazovky pro desktopové zařízení.
Pro pochopení důležitosti každé komponenty autoři odstranili je jednotlivě a vyhodnotili výkon na 226 desktopových a 225 mobilních videích ze dvou datasetů. Výsledky, měřené pomocí G-mean a F1 skóre, jsou uvedeny níže:

Výsledky ukazující výkon plného modelu pohledu, vedle verzí s jednotlivými kroky zpracování odstraněnými.
V každém případě výkon poklesl, když byl krok vynechán. Normalizace se ukázala jako zvláště cenná na desktopových zařízeních, kde se umístění kamery liší více než na mobilních zařízeních.
Studie také vyhodnotila, jak vizuální funkce předpovídaly mobilní kamerovou orientaci: umístění obličeje, poloha hlavy a směr pohledu dosáhly 0,75, 0,74 a 0,60, zatímco jejich kombinace dosáhla 0,91, což, podle autorů, zdůrazňuje výhodu integrace více podnětů.
Model mluvení, trénovaný na vertikální vzdálenosti rtů, dosáhl ROC-AUC 0,97 na ručně označeném testovacím datasetu a 0,96 na větším automaticky označeném datasetu, což naznačuje konzistentní výkon napříč oběma.
Model zívání dosáhl ROC-AUC 96,6 % pomocí pouze poměru úst, což se zlepšilo na 97,5 %, když byl kombinován s predikcemi akčních jednotek z AFFDEX 2.0.
Model opuštění obrazovky klasifikoval okamžiky jako nezapojení, když cả AFFDEX 2.0 a SmartEye selhaly při detekci obličeje po dobu delší než jednu sekundu. Pro vyhodnocení validity tohoto autoři ručně annotovali všechny takové události bez obličeje v reálném datasetu rozptýlení, identifikovali základní příčinu každé aktivace. Nejasné případy (jako je zablokování kamery nebo zkreslení videa) byly vyloučeny z analýzy.
Jako je ukázáno v tabulce výsledků níže, pouze 27 % aktivací “bez obličeje” bylo způsobeno tím, že uživatelé fyzicky opustili obrazovku.

Různé důvody, proč nebyla nalezena tvář, v určitých případech.
Práce uvádí:
‘Navzdory tomu, že opuštění obrazovky tvořilo pouze 27 % instancí, které spustily signál “bez obličeje”, byl aktivován pro jiné důvody, které naznačují nezapojení, jako je účastník, který se dívá od obrazovky s extrémním úhlem, provádí nadměrný pohyb nebo významně zakrývá obličej předmětem nebo rukou.’
V posledním z kvantitativních testů autoři vyhodnotili, jak postupné přidávání různých signálů rozptýlení – odhlížení od obrazovky (prostřednictvím pohledu a polohy hlavy), spánku, mluvení a opuštění obrazovky – ovlivnilo celkový výkon jejich modelu pozornosti.
Testování bylo provedeno na dvou datasetech: reálném datasetu rozptýlení a testovací podmnožině datasetu pohledu. G-mean a F1 skóre byly použity k měření výkonu (ačkoli spánek a mluvení byly vyloučeny z analýzy datasetu pohledu, kvůli jejich omezené relevance v tomto kontextu).
Jako je ukázáno níže, detekce pozornosti se zlepšila konzistentně, když byly přidány další typy rozptýlení, s odhlížení od obrazovky, nejčastějším rozptýlením, poskytujícím nejsilnější základní linii.

Účinek přidávání různých signálů rozptýlení do architektury.
Z těchto výsledků práce uvádí:
‘Z výsledků můžeme první uzavřít, že integrace všech signálů rozptýlení přispívá k lepší detekci pozornosti.
‘Druhý, zlepšení detekce pozornosti je konzistentní napříč oběma desktopovými a mobilními zařízeními. Třetí, mobilní relace v reálném datasetu ukazují významné pohyby hlavy, když se dívají pryč, které jsou snadno detekovány, vedoucí k lepšímu výkonu pro mobilní zařízení ve srovnání s desktopovými zařízeními. Čtvrtý, přidání signálu spánku má relativně malý vliv ve srovnání s jinými signály, protože je obvykle vzácné. ‘
‘Nakonec, signál opuštění obrazovky má relativně větší zlepšení na mobilních zařízeních ve srovnání s desktopovými zařízeními, protože mobilní zařízení lze snadno opustit.’
Autoři také srovnali svůj model s AFFDEX 1.0, předchozím systémem používaným v testování reklam – a dokonce i současný model detekce pohledu hlavy překonal AFFDEX 1.0 napříč oběma typy zařízení:
‘Toto zlepšení je výsledkem začlenění pohybů hlavy v obou směrech yaw a pitch, jakož i normalizace polohy hlavy, aby se zohlednily malé změny. Značné pohyby hlavy v reálném mobilním datasetu způsobily, že náš model hlavy funguje podobně jako AFFDEX 1.0.’
Autoři uzavírají práci s (možná poněkud formální) kvalitativní testovací rundou, uvedenou níže.

Ukázky výstupů z modelu pozornosti napříč desktopovými a mobilními zařízeními, s každým řádkem prezentujícím ukázky pravdivých a falešných pozitivů pro různé typy rozptýlení.
Autoři uvádějí:
‘Výsledky ukazují, že náš model efektivně detekuje různé rozptýlení v nekontrolovaných prostředích. Nicméně, může příležitostně produkovat falešné pozitivy v určitých krajních případech, jako je extrémní naklonění hlavy, zatímco se udržuje pohled na obrazovce, některé zakrytí úst nebo nadměrně rozmazané obličejové snímky, nebo silně ztmavené obličejové snímky. ‘
Závěr
Ačkoli výsledky představují měřený, ale významný pokrok oproti předchozím pracím, hlubší hodnota studie spočívá v pohledu, který nabízí do trvalého úsilí o přístup k vnitřnímu stavu diváka. Ačkoli data byla shromážděna s souhlasem, metodika naznačuje budoucí rámce, které by mohly překročit strukturovaná, tržní výzkumná prostředí.
Tato poněkud paranoidní závěr je pouze posílena uzavřenou, omezenou a žárlivě chráněnou povahou této konkrétní větve výzkumu.
* Moje konverze inline citací autorů na hypertextové odkazy.
První zveřejnění ve středu 9. dubna 2025












