Ángulo de Anderson

Buscando ‘Búhos y Lagartos’ en la Audiencia de un Anunciante

mm
Añade Unite.AI a tus fuentes preferidas en Google
Images from the paper 'Monitoring Viewer Attention During Online Ads' (https://arxiv.org/pdf/2504.06237)

Desde que el sector publicitario en línea se estima que gastó $740.3 mil millones de dólares estadounidenses en 2023, es fácil entender por qué las empresas publicitarias invierten considerables recursos en esta particular rama de la investigación de la visión por computadora.

Aunque es insular y protectora, la industria ocasionalmente publica estudios que sugieren un trabajo más avanzado y propietario en el reconocimiento facial y la dirección de la mirada – incluyendo reconocimiento de edad, central para las estadísticas de análisis demográfico:

Estimar la edad en un contexto publicitario en el mundo real es de interés para los anunciantes que pueden estar dirigidos a una demografía particular. En este ejemplo experimental de estimación automática de la edad facial, la edad del intérprete Bob Dylan se rastrea a lo largo de los años. Fuente: https://arxiv.org/pdf/1906.03625

Estimar la edad en un contexto publicitario en el mundo real es de interés para los anunciantes que pueden estar dirigidos a una demografía particular. En este ejemplo experimental de estimación automática de la edad facial, la edad del intérprete Bob Dylan se rastrea a lo largo de los años. Fuente: https://arxiv.org/pdf/1906.03625

Estos estudios, que rara vez aparecen en repositorios públicos como Arxiv, utilizan participantes legítimamente reclutados como base para el análisis impulsado por IA que apunta a determinar hasta qué punto, y de qué manera, el espectador se está involucrando con un anuncio.

El Histograma de Gradientes Orientados (HoG) de Dlib a menudo se utiliza en los sistemas de estimación facial. Fuente: https://www.computer.org/csdl/journal/ta/2017/02/07475863/13rRUNvyarN

El Histograma de Gradientes Orientados (HoG) de Dlib a menudo se utiliza en los sistemas de estimación facial. Fuente: https://www.computer.org/csdl/journal/ta/2017/02/07475863/13rRUNvyarN

Instinto Animal

En este sentido, naturalmente, la industria publicitaria está interesada en determinar falsos positivos (ocasiones en las que un sistema analítico malinterpreta las acciones de un sujeto), y en establecer criterios claros para cuando la persona que ve sus comerciales no se está involucrando completamente con el contenido.

En lo que respecta a la publicidad basada en pantalla, los estudios tienden a centrarse en dos problemas en dos entornos. Los entornos son ‘escritorio’ o ‘móvil’, cada uno de los cuales tiene características particulares que requieren soluciones de seguimiento personalizadas; y los problemas – desde el punto de vista del anunciante – están representados por comportamiento de búho y comportamiento de lagarto – la tendencia de los espectadores a no prestar atención completa a un anuncio que está frente a ellos.

Ejemplos de comportamiento de 'Búho' y 'Lagarto' en un sujeto de un proyecto de investigación publicitaria. Fuente: https://arxiv.org/pdf/1508.04028

Ejemplos de comportamiento de ‘Búho’ y ‘Lagarto’ en un sujeto de un proyecto de investigación publicitaria. Fuente: https://arxiv.org/pdf/1508.04028

Si estás mirando hacia afuera del anuncio intencionado con toda tu cabeza, esto es ‘comportamiento de búho’; si tu postura de cabeza es estática pero tus ojos se desvían de la pantalla, esto es ‘comportamiento de lagarto’. En términos de análisis y pruebas de nuevos anuncios en condiciones controladas, estas son acciones esenciales para que un sistema pueda capturar.

Un nuevo artículo de la adquisición de Affectiva por parte de SmartEye aborda estos problemas, ofreciendo una arquitectura que aprovecha varios marcos existentes para proporcionar un conjunto de características combinado y concatenado en todas las condiciones y reacciones posibles – y para poder determinar si un espectador está aburrido, comprometido o de alguna manera remoto del contenido que el anunciante desea que vea.

Ejemplos de verdaderos y falsos positivos detectados por el nuevo sistema de atención para varios señales de distracción, mostrados por separado para dispositivos de escritorio y móviles. Fuente: https://arxiv.org/pdf/2504.06237

Ejemplos de verdaderos y falsos positivos detectados por el nuevo sistema de atención para varios señales de distracción, mostrados por separado para dispositivos de escritorio y móviles. Fuente: https://arxiv.org/pdf/2504.06237

Los autores afirman*:

Limitada investigación ha profundizado en la medición de la atención durante los anuncios en línea. Mientras que estos estudios se centraron en estimar la postura de la cabeza o la dirección de la mirada para identificar instancias de mirada desviada, descuidan parámetros críticos como el tipo de dispositivo (escritorio o móvil), la colocación de la cámara con respecto a la pantalla y el tamaño de la pantalla. Estos factores influyen significativamente en la detección de la atención.

‘En este artículo, proponemos una arquitectura para la detección de la atención que abarca la detección de varios distractores, incluyendo tanto el comportamiento de búho y lagarto de mirar fuera de la pantalla, hablar, somnolencia (a través del bostezo y el cierre prolongado de los ojos) y dejar la pantalla sin atención.

‘A diferencia de los enfoques anteriores, nuestro método integra características específicas del dispositivo, como el tipo de dispositivo, la colocación de la cámara, el tamaño de la pantalla (para escritorios) y la orientación de la cámara (para dispositivos móviles) con la estimación cruda de la mirada para mejorar la precisión de la detección de la atención.’

El nuevo trabajo se titula Monitoreo de la Atención del Espectador durante los Anuncios en Línea, y proviene de cuatro investigadores de Affectiva.

Método y Datos

En gran medida debido a la secrecía y la naturaleza de código cerrado de dichos sistemas, el nuevo artículo no compara directamente el enfoque de los autores con los rivales, sino que presenta sus hallazgos exclusivamente como estudios de ablación; tampoco el artículo sigue en general el formato habitual de la literatura de Visión por Computadora. Por lo tanto, examinaremos la investigación tal como se presenta.

Los autores enfatizan que solo un número limitado de estudios han abordado específicamente la detección de la atención en el contexto de los anuncios en línea. En el SDK de AFFDEX, que ofrece reconocimiento de cara en tiempo real, la atención se infiere únicamente de la postura de la cabeza, con los participantes etiquetados como inatentos si el ángulo de su cabeza supera un umbral definido.

Un ejemplo del SDK de AFFDEX, un sistema de Affectiva que se basa en la postura de la cabeza como indicador de atención. Fuente: https://www.youtube.com/watch?v=c2CWb5jHmbY

Un ejemplo del SDK de AFFDEX, un sistema de Affectiva que se basa en la postura de la cabeza como indicador de atención. Fuente: https://www.youtube.com/watch?v=c2CWb5jHmbY

En la colaboración de 2019 Medición Automática de la Atención Visual al Contenido de Video utilizando Aprendizaje Profundo, un conjunto de datos de alrededor de 28,000 participantes se anotó para varios comportamientos inatentos, incluyendo mirar hacia afuera, cerrar los ojos o participar en actividades no relacionadas, y un modelo CNN-LSTM se entrenó para detectar la atención a partir de la apariencia facial con el tiempo.

Del artículo de 2019, un ejemplo que ilustra los estados de atención predichos para un espectador que ve contenido de video en una pantalla. Fuente: https://www.jeffcohn.net/wp-content/uploads/2019/07/Attention-13.pdf.pdf

Del artículo de 2019, un ejemplo que ilustra los estados de atención predichos para un espectador que ve contenido de video. Fuente: https://www.jeffcohn.net/wp-content/uploads/2019/07/Attention-13.pdf.pdf

Sin embargo, los autores observan que estos esfuerzos anteriores no tuvieron en cuenta factores específicos del dispositivo, como si el participante estaba utilizando un dispositivo de escritorio o móvil; ni consideraron el tamaño de la pantalla o la colocación de la cámara. Además, el sistema de AFFDEX se centra únicamente en identificar la desviación de la mirada y omite otras fuentes de distracción, mientras que el trabajo de 2019 intenta detectar un conjunto más amplio de comportamientos – pero su uso de una sola red neuronal convolucional (CNN) poco profunda puede, según el artículo, haber sido inadecuado para esta tarea.

Los autores observan que algunas de las investigaciones más populares en esta línea no están optimizadas para pruebas de anuncios, que tienen necesidades diferentes en comparación con dominios como la conducción o la educación – donde la colocación y la calibración de la cámara suelen ser fijas de antemano, en lugar de confiar en configuraciones no calibradas, y operar dentro del alcance limitado de la mirada de los dispositivos de escritorio y móviles.

Por lo tanto, han diseñado una arquitectura para detectar la atención del espectador durante los anuncios en línea, aprovechando dos kits de herramientas comerciales: AFFDEX 2.0 y SDK de SmartEye.

Ejemplos de análisis facial de AFFDEX 2.0. Fuente: https://arxiv.org/pdf/2202.12059

Ejemplos de análisis facial de AFFDEX 2.0. Fuente: https://arxiv.org/pdf/2202.12059

Estos trabajos anteriores extraen características de bajo nivel como expresiones faciales, postura de la cabeza y dirección de la mirada. Estas características se procesan para producir indicadores de nivel superior, incluyendo la posición de la mirada en la pantalla; el bostezo; y el habla.

El sistema identifica cuatro tipos de distracción: mirada fuera de la pantalla; somnolencia; habla; y pantallas sin atención. También ajusta el análisis de la mirada según si el espectador está en un dispositivo de escritorio o móvil.

Conjuntos de Datos: Mirada

Los autores utilizaron cuatro conjuntos de datos para alimentar y evaluar el sistema de detección de la atención: tres que se centran individualmente en el comportamiento de la mirada, el habla y el bostezo; y un cuarto extraído de sesiones de pruebas de anuncios en el mundo real que contienen una mezcla de tipos de distracción.

Debido a los requisitos específicos del trabajo, se crearon conjuntos de datos personalizados para cada una de estas categorías. Todos los conjuntos de datos recopilados se obtuvieron de un repositorio propietario que cuenta con millones de sesiones grabadas de participantes que ven anuncios en entornos de hogar o de trabajo, utilizando una configuración basada en la web, con consentimiento informado – y debido a las limitaciones de esos acuerdos de consentimiento, los autores afirman que los conjuntos de datos para el nuevo trabajo no pueden hacerse públicos.

Para construir el conjunto de datos de mirada, se pidió a los participantes que siguieran un punto en movimiento en varios puntos de la pantalla, incluyendo los bordes, y luego que miraran hacia afuera de la pantalla en cuatro direcciones (arriba, abajo, izquierda y derecha) con la secuencia repetida tres veces. De esta manera, se estableció la relación entre la captura y la cobertura:

Capturas de pantalla que muestran el estímulo de video de la mirada en (a) dispositivos de escritorio y (b) dispositivos móviles. Los primeros y terceros cuadros muestran instrucciones para seguir un punto en movimiento, mientras que los segundos y cuartos cuadros piden a los participantes que miren hacia afuera de la pantalla.

Capturas de pantalla que muestran el estímulo de video de la mirada en (a) dispositivos de escritorio y (b) dispositivos móviles. Los primeros y terceros cuadros muestran instrucciones para seguir un punto en movimiento, mientras que los segundos y cuartos cuadros piden a los participantes que miren hacia afuera de la pantalla.

Los segmentos del punto en movimiento se etiquetaron como atentos, y los segmentos fuera de la pantalla se etiquetaron como inatentos, produciendo un conjunto de datos etiquetado de ambos ejemplos positivos y negativos.

Cada video duró aproximadamente 160 segundos, con versiones separadas creadas para plataformas de escritorio y móviles, cada una con resoluciones de 1920×1080 y 608×1080, respectivamente.

Se recopilaron un total de 609 videos, que comprendían 322 grabaciones de escritorio y 287 grabaciones de móviles. Las etiquetas se aplicaron automáticamente en función del contenido del video, y el conjunto de datos se dividió en 158 muestras de entrenamiento y 451 para pruebas.

Conjuntos de Datos: Habla

En este contexto, uno de los criterios que definen ‘inatención’ es cuando una persona habla durante más de un segundo (lo que podría ser un comentario momentáneo o incluso una tos).

Dado que el entorno controlado no graba ni analiza audio, el habla se infiere observando el movimiento interno de los puntos de referencia faciales estimados. Por lo tanto, para detectar habla sin audio, los autores crearon un conjunto de datos basado enteramente en entrada visual, extraído de su repositorio interno, y dividido en dos partes: la primera de estas contenía aproximadamente 5,500 videos, cada uno etiquetado manualmente por tres annotadores como hablando o no hablando (de estos, 4,400 se utilizaron para el entrenamiento y la validación, y 1,100 para las pruebas).

La segunda parte comprendía 16,000 sesiones etiquetadas automáticamente en función del tipo de sesión: 10,500 presentaban a participantes que veían anuncios en silencio, y 5,500 mostraban a participantes que expresaban opiniones sobre marcas.

Conjuntos de Datos: Bostezo

Aunque existen algunos conjuntos de datos de bostezo, como YawDD y Fatiga del Conductor, los autores afirman que ninguno es adecuado para escenarios de pruebas de anuncios, ya que presentan bostezos simulados o contienen contorsiones faciales que podrían confundirse con miedo u otras acciones no relacionadas con el bostezo.

Por lo tanto, los autores utilizaron 735 videos de su colección interna, eligiendo sesiones que probablemente contuvieran un caída de la mandíbula que durara más de un segundo. Cada video se etiquetó manualmente por tres annotadores como activos o inactivos que bostezan. Solo el 2.6 por ciento de los cuadros contenían bostezos activos, lo que subraya el desequilibrio de clases, y el conjunto de datos se dividió en 670 videos de entrenamiento y 65 para pruebas.

Conjuntos de Datos: Distracción

El conjunto de datos de distracción también se extrajo del repositorio de pruebas de anuncios de los autores, donde los participantes habían visto anuncios reales sin tareas asignadas. Se seleccionaron aleatoriamente un total de 520 sesiones (193 en entornos móviles y 327 en entornos de escritorio) y se etiquetaron manualmente por tres annotadores como atentos o inatentos.

El comportamiento inatento incluyó mirada fuera de la pantalla, habla, somnolencia y pantallas sin atención. Las sesiones abarcaron diversas regiones de todo el mundo, con grabaciones de escritorio más comunes, debido a la colocación flexible de la cámara.

Modelos de Atención

El modelo de atención propuesto procesa características visuales de bajo nivel, a saber, expresiones faciales; postura de la cabeza; y dirección de la mirada – extraídas a través de los mencionados AFFDEX 2.0 y SDK de SmartEye.

Estas se convierten en indicadores de nivel superior, con cada distractor manejado por un clasificador binario separado entrenado en su propio conjunto de datos para la optimización y evaluación independientes.

Esquema para el sistema de monitoreo propuesto.

Esquema para el sistema de monitoreo propuesto.

El modelo de mirada determina si el espectador está mirando o no la pantalla utilizando coordenadas de mirada normalizadas, con calibración separada para dispositivos de escritorio y móviles. Un Máquina de Vectores de Soporte (SVM) lineal, entrenada en características espaciales y temporales, ayuda en este proceso, que incorpora una ventana de memoria para suavizar los cambios rápidos de la mirada.

Para detectar habla sin audio, el sistema utilizó regiones de la boca recortadas y una 3D-CNN entrenada en segmentos de video conversacionales y no conversacionales. Las etiquetas se asignaron en función del tipo de sesión, con suavizado temporal que reduce los falsos positivos que pueden resultar de movimientos breves de la boca.

Bostezo se detectó utilizando recortes de imagen de toda la cara, para capturar un movimiento facial más amplio, con una 3D-CNN entrenada en cuadros etiquetados manualmente (aunque la tarea se complicó por la baja frecuencia del bostezo en la visualización natural y por su similitud con otras expresiones).

Abandono de la pantalla se identificó mediante la ausencia de una cara o una postura de cabeza extrema, con predicciones hechas por un árbol de decisión.

Estado de atención final se determinó utilizando una regla fija: si algún módulo detectaba inatención, el espectador se marcaba como inatento – un enfoque que prioriza la sensibilidad, y ajustado por separado para contextos de escritorio y móviles.

Pruebas

Como se mencionó anteriormente, las pruebas siguen un método de ablación, donde se eliminan componentes y se observa el efecto en el resultado.

Categorías diferentes de inatención percibida identificadas en el estudio.

Categorías diferentes de inatención percibida identificadas en el estudio.

El modelo de mirada identificó el comportamiento fuera de la pantalla a través de tres pasos clave: normalizando las estimaciones crudas de la mirada, afinando la salida y estimando el tamaño de la pantalla para dispositivos de escritorio.

Para comprender la importancia de cada componente, los autores los eliminaron individualmente y evaluaron el rendimiento en 226 videos de escritorio y 225 videos móviles extraídos de dos conjuntos de datos. Los resultados, medidos por G-media y puntuación F1, se muestran a continuación:

Resultados que indican el rendimiento del modelo de mirada completo, junto con versiones con pasos de procesamiento individuales eliminados.

Resultados que indican el rendimiento del modelo de mirada completo, junto con versiones con pasos de procesamiento individuales eliminados.

En cada caso, el rendimiento disminuyó cuando se omitió un paso. La normalización resultó especialmente valiosa en los escritorios, donde la colocación de la cámara varía más que en los dispositivos móviles.

El estudio también evaluó cómo las características visuales predecían la orientación de la cámara móvil: la ubicación de la cara, la postura de la cabeza y la mirada de los ojos obtuvieron 0.75, 0.74 y 0.60, mientras que su combinación alcanzó 0.91, lo que, según los autores, destaca la ventaja de integrar múltiples señales.

El modelo de habla entrenado en la distancia vertical de los labios logró un ROC-AUC de 0.97 en el conjunto de datos de prueba etiquetado manualmente, y 0.96 en el conjunto de datos más grande etiquetado automáticamente, lo que indica un rendimiento consistente en ambos.

El modelo de bostezo alcanzó un ROC-AUC del 96.6 por ciento utilizando solo la relación de aspecto de la boca, lo que mejoró al 97.5 por ciento cuando se combinó con predicciones de unidades de acción de AFFDEX 2.0.

El modelo de pantalla sin atención clasificó los momentos como inatentos cuando tanto AFFDEX 2.0 como SmartEye no detectaron una cara durante más de un segundo. Para evaluar la validez de esto, los autores anotaron manualmente todos los eventos de “no cara” en el conjunto de datos de distracción real, identificando la causa subyacente de cada activación. Se excluyeron los casos ambiguos (como la obstrucción de la cámara o la distorsión del video) del análisis.

Como se muestra en la tabla de resultados a continuación, solo el 27 por ciento de las activaciones de “no cara” se debieron a que los usuarios físicamente abandonaron la pantalla.

Razones diversas obtenidas por las que no se encontró una cara en ciertas instancias.

Razones diversas obtenidas por las que no se encontró una cara, en ciertas instancias.

El artículo afirma:

‘A pesar de que las pantallas sin atención constituyeron solo el 27% de las instancias que activaron la señal de “no cara”, se activó por otras razones que indican inatención, como los participantes que miraban hacia afuera de la pantalla con un ángulo extremo, realizaban movimientos excesivos o ocultaban su cara significativamente con un objeto o mano.’

En la última de las pruebas cuantitativas, los autores evaluaron cómo la adición progresiva de diferentes señales de distracción – mirada fuera de la pantalla (a través de la mirada y la postura de la cabeza), somnolencia, habla y pantallas sin atención – afectó el rendimiento general del modelo de atención.

Las pruebas se llevaron a cabo en dos conjuntos de datos: el conjunto de datos de distracción real y un subconjunto de pruebas del conjunto de datos de mirada. Las puntuaciones G-media y F1 se utilizaron para medir el rendimiento (aunque la somnolencia y el habla se excluyeron del análisis del conjunto de datos de mirada, debido a su limitada relevancia en este contexto).

Como se muestra a continuación, la detección de la atención mejoró consistentemente a medida que se agregaban más tipos de distracción, con mirada fuera de la pantalla, el distractor más común, que proporcionó la línea de base más fuerte.

El efecto de agregar diversas señales de distracción a la arquitectura.

El efecto de agregar diversas señales de distracción a la arquitectura.

De estos resultados, el artículo afirma:

‘En primer lugar, podemos concluir que la integración de todas las señales de distracción contribuye a una mejor detección de la atención.

‘En segundo lugar, la mejora en la detección de la atención es consistente en ambos dispositivos de escritorio y móviles. En tercer lugar, las sesiones móviles en el conjunto de datos real muestran movimientos significativos de la cabeza al mirar hacia afuera, que son fáciles de detectar, lo que lleva a un mejor rendimiento en dispositivos móviles en comparación con los escritorios. En cuarto lugar, agregar la señal de somnolencia tiene una mejora relativamente leve en comparación con otras señales, ya que es raro que ocurra.

‘Finalmente, la señal de pantalla sin atención tiene una mejora relativamente mayor en dispositivos móviles en comparación con los escritorios, ya que los dispositivos móviles pueden ser fácilmente dejados sin atención.’

Los autores también compararon su modelo con AFFDEX 1.0, un sistema anterior utilizado en pruebas de anuncios – e incluso la detección de mirada basada en la cabeza del modelo actual superó a AFFDEX 1.0 en ambos tipos de dispositivos:

‘Esta mejora es el resultado de incorporar movimientos de la cabeza en ambas direcciones de guiñada y picado, así como normalizar la postura de la cabeza para tener en cuenta los cambios menores. Los movimientos significativos de la cabeza en el conjunto de datos móvil real han hecho que nuestro modelo de cabeza se desempeñe de manera similar a AFFDEX 1.0.’

Los autores cierran el artículo con una ronda de pruebas cualitativas (quizás un poco perfunctoria), que se muestra a continuación.

Salidas de ejemplo del modelo de atención en dispositivos de escritorio y móviles, con cada fila que presenta ejemplos de verdaderos y falsos positivos para diferentes tipos de distracción.

Salidas de ejemplo del modelo de atención en dispositivos de escritorio y móviles, con cada fila que presenta ejemplos de verdaderos y falsos positivos para diferentes tipos de distracción.

Los autores afirman:

‘Los resultados indican que nuestro modelo detecta eficazmente varios distractores en entornos no controlados. Sin embargo, puede producir falsos positivos en ciertos casos límite, como inclinaciones severas de la cabeza mientras se mantiene la mirada en la pantalla, algunas occlusiones de la boca, ojos borrosos o imágenes faciales muy oscuras. ‘

Conclusión

Aunque los resultados representan un avance medido pero significativo sobre el trabajo anterior, el valor más profundo del estudio radica en la visión que ofrece de la persistente búsqueda de acceso al estado interno del espectador. Aunque los datos se recopilaron con consentimiento, la metodología apunta hacia futuros marcos que podrían extenderse más allá de los entornos de investigación de mercado estructurados.

Esta conclusión un poco paranoica se ve reforzada por la naturaleza cerrada, restringida y celosamente protegida de esta particular rama de la investigación.

 

* Mi conversión de las citas en línea de los autores en hipervínculos.

Publicado por primera vez el miércoles 9 de abril de 2025

Escritor sobre aprendizaje automático, especialista en síntesis de imágenes humanas. Antiguo jefe de contenido de investigación en Metaphysic.ai, hasta su disolución en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai