Взгляд Anderson

Поиск «Сов и Ящериц» в Аудитории Рекламодателя

mm
Добавьте Unite.AI в избранные источники в Google
Images from the paper 'Monitoring Viewer Attention During Online Ads' (https://arxiv.org/pdf/2504.06237)

Поскольку онлайн-рекламный сектор, по оценкам, потратил 740,3 миллиарда долларов США в 2023 году, легко понять, почему рекламные компании вкладывают значительные ресурсы в эту конкретную ветвь исследований компьютерного зрения.

Хотя эта отрасль является замкнутой и защитной, она иногда публикует исследования, которые намекают на более продвинутые проприетарные работы в области распознавания лица и направления взгляда, включая распознавание возраста, которое является важным для демографической аналитики.

Оценка возраста в контексте рекламы является интересной для рекламодателей, которые могут нацеливаться на определенную демографическую группу. В этом экспериментальном примере автоматической оценки возраста отслеживается возраст исполнителя Боба Дилана на протяжении лет. Источник: https://arxiv.org/pdf/1906.03625

Оценка возраста в контексте рекламы является интересной для рекламодателей, которые могут нацеливаться на определенную возрастную демографическую группу. В этом экспериментальном примере автоматической оценки возраста отслеживается возраст исполнителя Боба Дилана на протяжении лет. Источник: https://arxiv.org/pdf/1906.03625

Эти исследования, которые редко появляются в публичных репозиториях, таких как Arxiv, используют легитимно набранных участников в качестве основы для анализа, основанного на ИИ, который направлен на определение степени и способа, которым зритель взаимодействует с рекламой.

Гистограмма направленных градиентов (HoG) от Dlib часто используется в системах оценки лица. Источник: https://www.computer.org/csdl/journal/ta/2017/02/07475863/13rRUNvyarN

Гистограмма направленных градиентов (HoG) от Dlib часто используется в системах оценки лица. Источник: https://www.computer.org/csdl/journal/ta/2017/02/07475863/13rRUNvyarN

Животный Инстинкт

В этом отношении естественно, что рекламная индустрия заинтересована в определении ложных положительных результатов (случаев, когда аналитическая система неправильно интерпретирует действия субъекта) и в установлении четких критериев для случаев, когда человек, смотрящий их рекламу, не полностью взаимодействует с контентом.

Что касается рекламы на экране, исследования обычно фокусируются на двух проблемах в двух средах. Среды – это «настольный компьютер» или «мобильный», каждая из которых имеет особые характеристики, требующие индивидуальных решений для отслеживания; и проблемы – с точки зрения рекламодателя – представлены поведением сов и ящериц – тенденцией зрителей не обращать полное внимание на рекламу, находящуюся перед ними.

Примеры поведения сов и ящериц в участнике проекта рекламных исследований. Источник: https://arxiv.org/pdf/1508.04028

Примеры поведения «Сов» и «Ящериц» в участнике проекта рекламных исследований. Источник: https://arxiv.org/pdf/1508.04028

Если вы смотрите в сторону от рекламы, находящейся перед вами, со всей головой, это поведение «совы»; если ваша поза головы статична, но ваши глаза блуждают от экрана, это поведение «ящерицы». В плане аналитики и тестирования новых рекламных роликов в контролируемых условиях эти действия являются важными для системы, чтобы их обнаружить.

Новая работа от SmartEye’s Affectiva Acquisition решает эти проблемы, предлагая архитектуру, которая использует несколько существующих фреймворков для предоставления объединенного и объединенного набора функций во всех необходимых условиях и возможных реакциях – и для определения, интересуется ли зритель контентом, который рекламодатель хочет, чтобы он смотрел.

Примеры истинных и ложных положительных результатов, обнаруженных новой системой внимания для различных сигналов отвлечения, показанных отдельно для настольных и мобильных устройств. Источник: https://arxiv.org/pdf/2504.06237

Примеры истинных и ложных положительных результатов, обнаруженных новой системой внимания для различных сигналов отвлечения, показанных отдельно для настольных и мобильных устройств. Источник: https://arxiv.org/pdf/2504.06237

Авторы заявляют*:

‘Ограниченные исследования изучали мониторинг внимания во время просмотра онлайн-рекламы. Хотя эти исследования фокусировались на оценке позы головы или направления взгляда для выявления случаев отвлечения внимания, они игнорируют важные параметры, такие как тип устройства (настольный компьютер или мобильное), размещение камеры относительно экрана и размер экрана. Эти факторы существенно влияют на обнаружение внимания.’

‘В этой работе мы предлагаем архитектуру для обнаружения внимания, которая включает обнаружение различных отвлекающих факторов, включая поведение «сов» и «ящериц» – взгляд за пределы экрана, говорение, сонливость (через зевание и длительное закрытие глаз) и оставление экрана без внимания.’

‘В отличие от предыдущих подходов, наш метод объединяет особенности устройства, такие как тип устройства, размещение камеры, размер экрана (для настольных компьютеров) и ориентация камеры (для мобильных устройств), с сырыми оценками взгляда для повышения точности обнаружения внимания.’

Новая работа называется Мониторинг внимания зрителя во время просмотра онлайн-рекламы и исходит от четырех исследователей из Affectiva.

Метод и Данные

В основном из-за секретности и закрытой природы таких систем, новая работа не сравнивает подход авторов напрямую с конкурентами, а представляет свои результаты исключительно как исследования удаления; ни работа не следует общему формату литературы компьютерного зрения. Поэтому мы рассмотрим исследование, как оно представлено.

Авторы подчеркивают, что только ограниченное количество исследований обратились к обнаружению внимания конкретно в контексте онлайн-рекламы. В AFFDEX SDK, который предлагает распознавание лица в реальном времени, внимание выводится исключительно из позы головы, с участниками, помеченными как невнимательные, если их угол головы превышает определенный порог.

Пример из AFFDEX SDK, системы Affectiva, которая полагается на позу головы как индикатор внимания. Источник: https://www.youtube.com/watch?v=c2CWb5jHmbY

Пример из AFFDEX SDK, системы Affectiva, которая полагается на позу головы как индикатор внимания. Источник: https://www.youtube.com/watch?v=c2CWb5jHmbY

В 2019 году Автоматическое измерение визуального внимания к видеоконтенту с помощью глубокого обучения, набор данных из примерно 28 000 участников был аннотирован для различных невнимательных поведений, включая взгляд в сторону, закрытие глаз или занятие нерелевантными действиями, и модель CNN-LSTM была обучена для обнаружения внимания из внешности лица во времени.

Из 2019 года, пример, иллюстрирующий предсказанные состояния внимания для зрителя, смотрящего видеоконтент на экране. Источник: https://www.jeffcohn.net/wp-content/uploads/2019/07/Attention-13.pdf.pdf

Из 2019 года, пример, иллюстрирующий предсказанные состояния внимания для зрителя, смотрящего видеоконтент. Источник: https://www.jeffcohn.net/wp-content/uploads/2019/07/Attention-13.pdf.pdf

Однако авторы отмечают, что эти предыдущие усилия не учитывали факторы, специфичные для устройства, такие как то, использовал ли участник настольный компьютер или мобильное устройство; ни они не учитывали размер экрана или размещение камеры. Кроме того, система AFFDEX фокусируется только на выявлении отвлечения внимания и опускает другие источники отвлечения, в то время как работа 2019 года пытается обнаружить более широкий набор поведений – но ее использование единой мелкой CNN может, по мнению авторов, быть недостаточным для этой задачи.

Авторы отмечают, что некоторые из наиболее популярных исследований в этой области не оптимизированы для тестирования рекламы, которое имеет другие потребности по сравнению с такими областями, как вождение или образование – где размещение и калибровка камеры обычно фиксируются заранее, полагаясь вместо этого на некалиброванные настройки и работающие в ограниченном диапазоне взгляда настольных и мобильных устройств.

Следовательно, они разработали архитектуру для обнаружения внимания зрителя во время просмотра онлайн-рекламы, используя два коммерческих набора инструментов: AFFDEX 2.0 и SmartEye SDK.

Примеры анализа лица из AFFDEX 2.0. Источник: https://arxiv.org/pdf/2202.12059

Примеры анализа лица из AFFDEX 2.0. Источник: https://arxiv.org/pdf/2202.12059

Эти предыдущие работы извлекают низкоуровневые функции, такие как выражения лица, поза головы и направление взгляда. Эти функции затем обрабатываются для производства более высокоуровневых индикаторов, включая положение взгляда на экране; зевание; и говорение.

Система выявляет четыре типа отвлечения: взгляд за пределы экрана; сонливость; говорение; и необслуживаемые экраны. Она также корректирует анализ взгляда в зависимости от того, находится ли зритель на настольном компьютере или мобильном устройстве.

Наборы Данных: Взгляд

Авторы использовали четыре набора данных для питания и оценки системы обнаружения внимания: три, фокусирующихся индивидуально на поведении взгляда, говорении и зевании; и четвертый, полученный из реальных сессий тестирования рекламы, содержащих смесь типов отвлечения.

Из-за конкретных требований работы были созданы пользовательские наборы данных для каждой из этих категорий. Все наборы данных были получены из проприетарного репозитория, содержащего миллионы записанных сессий участников, смотрящих рекламу в домашних или рабочих условиях, с информированным согласием – и из-за ограничений этих соглашений, авторы заявляют, что наборы данных для новой работы не могут быть сделаны публично доступными.

Для создания набора данных взгляда участникам было предложено следовать за движущейся точкой по различным точкам на экране, включая его края, и затем посмотреть в сторону от экрана в четырех направлениях (вверх, вниз, влево и вправо) с повторением последовательности три раза. Таким образом, была установлена связь между захватом и покрытием:

Скриншоты, показывающие стимул видео взгляда на (а) настольном компьютере и (б) мобильном устройстве. Первый и третий кадры отображают инструкции следовать за движущейся точкой, в то время как второй и четвертый подсказывают участникам посмотреть в сторону от экрана.

Скриншоты, показывающие стимул видео взгляда на (а) настольном компьютере и (б) мобильном устройстве. Первый и третий кадры отображают инструкции следовать за движущейся точкой, в то время как второй и четвертый подсказывают участникам посмотреть в сторону от экрана.

Сегменты с движущейся точкой были помечены как внимательные, а сегменты за пределами экрана – как невнимательные, в результате чего получился помеченный набор данных как положительных, так и отрицательных примеров.

Каждое видео длилось примерно 160 секунд, с отдельными версиями, созданными для настольных и мобильных платформ, каждая с разрешением 1920×1080 и 608×1080 соответственно.

Было собрано в общей сложности 609 видео, состоящих из 322 видео на настольном компьютере и 287 видео на мобильном устройстве. Метки были применены автоматически на основе содержания видео, и набор данных разделен на 158 обучающих образцов и 451 образец для тестирования.

Наборы Данных: Говорение

В этом контексте одним из критериев, определяющих «невнимательность», является когда человек говорит дольше одной секунды (что может быть моментальным комментарием или даже кашлем).

Поскольку контролируемая среда не записывает или анализирует аудио, говорение выводится путем наблюдения за внутренним движением оцененных ориентиров лица. Следовательно, для обнаружения говорения без аудио авторы создали набор данных, основанный исключительно на визуальном входе, полученный из их внутреннего репозитория и разделенный на две части: первая содержала примерно 5 500 видео, каждое из которых было вручную помечено тремя аннотаторами как говорение или не говорение (из них 4 400 использовались для обучения и проверки, и 1 100 для тестирования).

Вторая часть состояла из 16 000 сессий, автоматически помеченных на основе типа сессии: 10 500 сессий включали участников, смотрящих рекламу молча, и 5 500 сессий включали участников, выражающих мнения о брендах.

Наборы Данных: Зевание

Хотя существуют некоторые наборы данных зевания, включая YawDD и Driver Fatigue, авторы утверждают, что ни один из них не подходит для сценариев тестирования рекламы, поскольку они либо содержат симулированные зевания, либо содержат лица, которые могут быть перепутаны с страхом или другими, не связанными с зеванием действиями.

Следовательно, авторы использовали 735 видео из своего внутреннего собрания, выбрав сессии, которые, вероятно, содержат опускание челюсти более чем на одну секунду. Каждое видео было вручную помечено тремя аннотаторами как активное или неактивное зевание. Только 2,6% кадров содержали активные зевания, подчеркивая несбалансированность классов, и набор данных был разделен на 670 обучающих видео и 65 для тестирования.

Наборы Данных: Отвлечение

Набор данных отвлечения также был получен из репозитория авторов, где участники смотрели фактическую рекламу без назначенных задач. Было случайным образом выбрано в общей сложности 520 сессий (193 на мобильных устройствах и 327 на настольных компьютерах) и вручную помечено тремя аннотаторами как внимательные или невнимательные.

Невнимательное поведение включало взгляд за пределы экрана, говорение, сонливость и необслуживаемые экраны. Сессии охватывали разные регионы по всему миру, с записями на настольном компьютере более распространенными из-за гибкого размещения веб-камеры.

Модели Внимания

Предлагаемая модель внимания обрабатывает низкоуровневые визуальные функции, а именно выражения лица; позу головы; и направление взгляда – извлеченные через вышеупомянутые AFFDEX 2.0 и SmartEye SDK.

Эти функции затем преобразуются в более высокоуровневые индикаторы, с каждым отвлекающим фактором, обрабатываемым отдельным бинарным классификатором, обученным на своем собственном наборе данных для независимой оптимизации и оценки.

Схема предложенной системы мониторинга.

Схема предложенной системы мониторинга.

Модель взгляда определяет, смотрит ли зритель на экран или нет, используя нормализованные координаты взгляда, с отдельной калибровкой для настольных и мобильных устройств. Этот процесс облегчается линейной Машиной опорных векторов (SVM), обученной на пространственных и временных функциях, которая включает в себя окно памяти для сглаживания быстрых изменений взгляда.

Для обнаружения говорения без аудио система использовала обрезанные области рта и 3D-CNN, обученную на разговорных и неразговорных видео-сегментах. Метки были присвоены на основе типа сессии, с временным сглаживанием, уменьшающим ложные положительные результаты, которые могут возникнуть из-за кратковременных движений рта.

Зевание обнаруживалось с помощью полных кадров лица, для захвата более широкого движения лица, с 3D-CNN, обученной на вручную помеченных кадрах (хотя задача была осложнена низкой частотой зевания в естественном просмотре и его сходством с другими выражениями).

Оставление экрана без внимания определялось путем отсутствия лица или крайней позы головы, с прогнозами, сделанными с помощью дерева решений.

Окончательный статус внимания определялся с помощью фиксированного правила: если любой модуль обнаружил невнимательность, зритель был помечен как невнимательный – подход, отдающий приоритет чувствительности, и настроенный отдельно для настольных и мобильных контекстов.

Тесты

Как упоминалось ранее, тесты следуют методу удаления, где компоненты удаляются, и их влияние на результат отмечается.

Различные категории воспринимаемого невнимания, выявленные в исследовании.

Различные категории воспринимаемого невнимания, выявленные в исследовании.

Модель взгляда выявляла поведение за пределами экрана через три ключевых шага: нормализацию сырых оценок взгляда, тонкую настройку вывода и оценку размера экрана для настольных устройств.

Для понимания важности каждого компонента авторы удалили их индивидуально и оценили производительность на 226 видео на настольном компьютере и 225 видео на мобильном устройстве, полученных из двух наборов данных. Результаты, измеренные с помощью G-mean и F1 баллов, показаны ниже:

Результаты, показывающие производительность полной модели взгляда, а также версий с удаленными индивидуальными шагами обработки.

Результаты, показывающие производительность полной модели взгляда, а также версий с удаленными индивидуальными шагами обработки.

В каждом случае производительность снижалась, когда шаг был опущен. Нормализация оказалась особенно ценна на настольных компьютерах, где размещение камеры варьируется больше, чем на мобильных устройствах.

Исследование также оценило, как визуальные функции предсказывали ориентацию камеры на мобильных устройствах: положение лица, поза головы и направление взгляда получили 0,75, 0,74 и 0,60, в то время как их комбинация достигла 0,91, подчеркивая – по мнению авторов – преимущество объединения нескольких сигналов.

Модель говорения достигла ROC-AUC 0,97 на вручную помеченном тестовом наборе и 0,96 на более крупном автоматически помеченном наборе данных, указывая на последовательную производительность в обоих.

Модель зевания достигла ROC-AUC 96,6% с помощью только соотношения рта, которое улучшилось до 97,5%, когда было объединено с предсказаниями единиц действия от AFFDEX 2.0.

Модель необслуживаемого экрана классифицировала моменты как невнимательные, когда и AFFDEX 2.0, и SmartEye не смогли обнаружить лицо более чем на одну секунду. Для оценки действительности этого авторы вручную аннотировали все такие события «нет лица» в реальном наборе данных отвлечения, определяя основную причину каждого срабатывания. Неоднозначные случаи (такие как заслонение камеры или искажение видео) были исключены из анализа.

Как показано в таблице результатов ниже, только 27% срабатываний «нет лица» были вызваны пользователями, которые физически покинули экран.

Различные причины, по которым лицо не было найдено в определенных случаях.

Различные причины, по которым лицо не было найдено, в определенных случаях.

В работе говорится:

‘Несмотря на то, что необслуживаемые экраны составили только 27% случаев, срабатывающих сигнал «нет лица», он был активирован по другим причинам, указывающим на невнимательность, таким как участники, смотрящие за пределы экрана под экстремальным углом, чрезмерное движение или значительное заслонение лица объектом/рукой.’

В последнем из количественных тестов авторы оценили, как постепенное добавление различных сигналов отвлечения – взгляда за пределы экрана (через взгляд и позу головы), сонливости, говорения и необслуживаемых экранов – влияло на общую производительность их модели внимания.

Тестирование проводилось на двух наборах данных: реальном наборе данных отвлечения и тестовом подмножестве набора данных взгляда. Баллы G-mean и F1 использовались для измерения производительности (хотя сонливость и говорение были исключены из анализа набора данных взгляда из-за их ограниченной актуальности в этом контексте).

Как показано ниже, обнаружение внимания улучшилось последовательно при добавлении более типов отвлечения, с взглядом за пределы экрана как наиболее распространенным отвлекающим фактором, обеспечивающим сильную базовую линию.

Влияние добавления различных сигналов отвлечения на архитектуру.

Влияние добавления различных сигналов отвлечения на архитектуру.

Из этих результатов работа гласит:

‘Из результатов мы можем заключить, что интеграция всех сигналов отвлечения способствует улучшению обнаружения внимания.

‘Во-вторых, улучшение обнаружения внимания последовательно на обоих настольных и мобильных устройствах. В-третьих, мобильные сессии в реальном наборе данных показывают значительные движения головы при взгляде в сторону, которые легко обнаруживаются, что приводит к более высокой производительности для мобильных устройств по сравнению с настольными компьютерами. В-четвертых, добавление сигнала сонливости имеет относительно небольшое улучшение по сравнению с другими сигналами, поскольку оно обычно редко происходит.

‘Наконец, сигнал необслуживаемого экрана имеет относительно большее улучшение на мобильных устройствах по сравнению с настольными компьютерами, поскольку мобильные устройства могут быть легко оставлены без внимания.’

Авторы также сравнили свою модель с AFFDEX 1.0, предыдущей системой, использованной в тестировании рекламы – и даже модель головного взгляда текущей модели превосходила AFFDEX 1.0 на обоих типах устройств:

‘Это улучшение является результатом включения движений головы в обоих направлениях yaw и pitch, а также нормализации позы головы для учета незначительных изменений. Значительные движения головы в реальном мобильном наборе данных привели к тому, что наша модель головы работает аналогично AFFDEX 1.0.’

Авторы завершают работу (возможно, довольно формальным) качественным раундом тестирования, показанным ниже.

Примеры вывода модели внимания на настольных и мобильных устройствах, с каждым рядом, представляющим примеры истинных и ложных положительных результатов для различных типов отвлечения.

Примеры вывода модели внимания на настольных и мобильных устройствах, с каждым рядом, представляющим примеры истинных и ложных положительных результатов для различных типов отвлечения.

Авторы заявляют:

‘Результаты показывают, что наша модель эффективно обнаруживает различные отвлекающие факторы в неконтролируемых условиях. Однако она может иногда производить ложные положительные результаты в определенных крайних случаях, таких как сильное наклонение головы при сохранении взгляда на экране, некоторые заслонения рта, чрезмерно размытые глаза или сильно затемненные изображения лица. ‘

Заключение

Хотя результаты представляют собой измеренный, но значимый шаг вперед по сравнению с предыдущей работой, более глубокая ценность исследования заключается в том, что оно предлагает взгляд на постоянную тенденцию к доступу к внутреннему состоянию зрителя. Хотя данные были собраны с согласия, методология указывает на будущие рамки, которые могут выйти за пределы структурированных, рыночных исследований.

Это довольно параноидальное заключение только укрепляется замкнутой, ограниченной и ревностно защищенной природой этой конкретной ветви исследований.

 

* Мое преобразование внутренних цитат авторов в гиперссылки.

Опубликовано впервые в среду, 9 апреля 2025 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai