Взгляд Anderson
ИИ помогает нервным докладчикам «читать комнату» во время видеоконференций

В 2013 году опрос о распространенных фобиях показал, что перспектива публичных выступлений была хуже, чем перспектива смерти для большинства респондентов. Этот синдром известен как глоссофобия.
COVID-индуцированная миграция с «личных» встреч на онлайн-видеоконференции на платформах such как Zoom и Google Spaces не улучшила ситуацию. Когда встреча содержит большое количество участников, наши естественные способности оценить угрозы нарушаются из-за низкокачественных рядов и икон участников, а также трудности в чтении тонких визуальных сигналов лицевых выражений и языка тела. Например, Skype оказался плохой платформой для передачи невербальных сигналов.
Эффекты публичных выступлений на интерес и реакцию аудитории хорошо документированы и интуитивно очевидны для большинства из нас. Неясная реакция аудитории может заставить докладчиков колебаться и прибегать к заполнению речи, не зная, встречаются ли их аргументы с согласием, презрением или безразличием, часто создавая неудобную ситуацию как для докладчика, так и для его слушателей.
Под давлением неожиданного сдвига в сторону онлайн-видеоконференций, вызванного ограничениями и мерами предосторожности COVID, проблема, вероятно, становится хуже, и за последние пару лет в сообществах компьютерного зрения и аффективных исследований было предложено несколько смягчающих схем обратной связи аудитории.
Аппаратно-ориентированные решения
Большинство из них, однако, включают дополнительное оборудование или сложное программное обеспечение, которое может вызвать проблемы с конфиденциальностью или логистикой – относительно дорогое или иным образом ограниченный подход, предшествующий пандемии. В 2001 году MIT предложил Galvactivator, носимое устройство, которое выводит эмоциональное состояние участника аудитории, протестированное во время однодневного симпозиума.

Из 2001 года, MIT’s Galvactivator, который измерял кожную проводимость в попытке понять настроения и вовлеченность аудитории. Источник: https://dam-prod.media.mit.edu/x/files/pub/tech-reports/TR-542.pdf
Большая часть академической энергии также была посвящена возможному развертыванию «кликеров» в качестве системы обратной связи аудитории (ARS), меры для увеличения активного участия аудитории (которая автоматически увеличивает вовлеченность, поскольку заставляет зрителя взять на себя роль активного узла обратной связи), но которая также была задумана как средство поощрения докладчика.
Другие попытки «связать» докладчика и аудиторию включали мониторинг частоты сердечных сокращений, использование сложного носимого оборудования для использования электроэнцефалографии, «метры аплодисментов», компьютерно-видимую распознавание эмоций для сидящих работников, и использование эмотиконов, отправленных аудиторией во время выступления докладчика.

Из 2017 года, EngageMeter, совместный академический исследовательский проект LMU Мюнхена и Университета Штутгарта. Источник: http://www.mariamhassib.net/pubs/hassib2017CHI_3/hassib2017CHI_3.pdf
Как подпроект прибыльной области аналитики аудитории, частный сектор проявил особый интерес к оценке и отслеживанию взгляда – системам, в которых каждый участник аудитории (который может в свою очередь в конечном итоге иметь возможность выступить), подвергается окулярному отслеживанию в качестве индекса вовлеченности и одобрения.
Все эти методы довольно высокоинтенсивны. Многие из них требуют специального оборудования, лабораторных условий, специализированного и самодельного программного обеспечения, а также подписки на дорогие коммерческие API – или любую комбинацию этих ограничительных факторов.
Следовательно, разработка минималистичных систем, основанных на общих инструментах для видеоконференций, стала интересной за последние 18 месяцев.
Отчетность об одобрении аудитории дискретно
Для этого новое исследовательское сотрудничество между Университетом Токио и Университетом Карнеги-Меллона предлагает новую систему, которая может использовать стандартные инструменты видеоконференций (такие как Zoom) с помощью веб-камеры, оснащенной веб-сайтом, на котором запускается легкое программное обеспечение для оценки взгляда и позы. Таким образом, даже необходимость в локальных браузерных плагинах избегается.
Кивки и оцененные движения внимания пользователя переводятся в представительную информацию, которая визуализируется обратно докладчику, позволяя провести «живой» тест на степень, в которой содержание привлекает аудиторию – и также, по крайней мере, приблизительный индикатор периодов дискурса, где докладчик может терять интерес аудитории.

С CalmResponses, внимание и кивки пользователя добавляются в пул обратной связи аудитории и переводятся в визуальное представление, которое может принести пользу докладчику. См. встроенное видео в конце статьи для более подробной информации и примеров. Источник: https://www.youtube.com/watch?v=J_PhB4FCzk0
Во многих академических ситуациях, таких как онлайн-лекции, студенты могут быть совершенно не видны докладчику, поскольку они не включили свои камеры из-за стеснения своей фона или текущего вида. CalmResponses может устранить эту проблему, сообщая о том, как докладчик смотрит на содержание, и если он кивает, без необходимости включать камеру.
Статья озаглавлена CalmResponses: Отображение коллективных реакций аудитории в удаленной коммуникации, и является совместной работой двух исследователей из Университета Токио и одного из Университета Карнеги-Меллона.
Авторы предлагают живую веб-демо и выпустили исходный код на GitHub.
Фреймворк CalmResponses
Интерес CalmResponses к киванию, а не к другим возможным положениям головы, основан на исследованиях (некоторые из которых восходят к эпохе Дарвина), которые показывают, что более 80% всех движений головы слушателей состоят из кивания (даже когда они выражают несогласие). В то же время движения глаз были показаны многими исследованиями как надежный индикатор интереса или вовлеченности.
CalmResponses реализован с помощью HTML, CSS и JavaScript и состоит из трех подсистем: клиента аудитории, клиента докладчика и сервера. Клиент аудитории передает данные о взгляде или движении головы пользователя через WebSockets на облачную платформу Heroku.

Кивание аудитории визуализируется справа в анимированном движении под CalmResponses. В этом случае визуализация движения доступна не только докладчику, но и всей аудитории. Источник: https://arxiv.org/pdf/2204.02308.pdf
Для раздела отслеживания глаз проекта исследователи использовали WebGazer, легкое, основанное на JavaScript браузерное решение для отслеживания глаз, которое может работать с низкой задержкой直接 с веб-сайта (см. ссылку выше для реализации исследователей).
Поскольку необходимость простой реализации и грубого, агрегированного распознавания реакции перевешивает необходимость высокой точности в оценке взгляда и позы, входные данные о позе сглаживаются по средним значениям перед рассмотрением для общей оценки реакции.
Действие кивания оценивается через библиотеку JavaScript clmtrackr, которая подгоняет модели лица к обнаруженным лицам в изображениях или видео через регуляризированный сдвиг ориентиров. Для целей экономии и низкой задержки только обнаруженный ориентир для носа активно отслеживается в реализации авторов, поскольку это достаточно для отслеживания действий кивания.

Движение кончика носа пользователя создает след, который вносит вклад в пул обратной связи аудитории, связанной с киванием, визуализируемой в агрегированной форме для всех участников.
Тепловая карта
Хотя активность кивания представлена динамическими движущимися точками (см. изображения выше и видео в конце), внимание визуализируется в терминах тепловой карты, которая показывает докладчику и аудитории, где находится общий фокус внимания на общем экране презентации или видеоконференции.

Все участники могут видеть, где фокусируется общее внимание. Статья не упоминает, доступна ли эта функциональность, когда пользователь может видеть «галерею» других участников, что может показать ложный фокус на одном участнике по различным причинам.
Тесты
Для CalmResponses были сформулированы два тестовых окружения в виде неявного исследования абляции, с использованием трех различных наборов обстоятельств: в «Условии Б» (базовом), авторы воспроизвели типичную онлайн-лекцию для студентов, где большинство студентов держали свои веб-камеры выключенными, и докладчик не имел возможности видеть лица аудитории; в «Условии CR-E», докладчик мог видеть обратную связь взгляда (тепловые карты); в «Условии CR-N», докладчик мог видеть и кивание, и активность взгляда аудитории.
Первый экспериментальный сценарий включал условие Б и условие CR-E; второй включал условие Б и условие CR-N. Обратная связь была получена как от докладчиков, так и от аудитории.
В каждом эксперименте оценивались три фактора: объективная и субъективная оценка презентации (включая самоотчетный опросник докладчика о его чувствах о том, как прошла презентация); количество событий «заполнения речи», указывающих на моментальную неуверенность и колебания; и качественные комментарии. Эти критерии являются общими оценщиками качества речи и тревоги докладчика.
Тестовый пул состоял из 38 человек в возрасте от 19 до 44 лет, включая 29 мужчин и 9 женщин со средним возрастом 24,7 года, все японцы или китайцы и все свободно говорящие на японском языке. Они были случайным образом разделены на пять групп по 6-7 участников, и ни один из субъектов не знал друг друга лично.
Тесты проводились на Zoom, с пятью докладчиками, выступающими в первом эксперименте, и шестью во втором.

Условия заполнения помечены оранжевыми коробками. В целом, содержание заполнения уменьшилось в разумной пропорции к увеличению обратной связи аудитории от системы.
Исследователи отмечают, что у одного докладчика количество заполнителей значительно уменьшилось, и что в «Условии CR-N» докладчик редко произносил фразы заполнения. См. статью для получения очень подробных и детальных результатов; однако, наиболее заметные результаты были в субъективной оценке докладчиков и участников аудитории.
Комментарии аудитории включали:
«Я чувствовал, что я был вовлечен в презентации» [AN2], «Я не был уверен, что речи докладчиков были улучшены, но я чувствовал чувство единства от визуализации движений головы других» [AN6].
«Я не был уверен, что речи докладчиков были улучшены, но я чувствовал чувство единства от визуализации движений головы других».
Исследователи отмечают, что система вводит новый вид искусственной паузы в презентации докладчика, поскольку докладчик склонен обращаться к визуальной системе для оценки обратной связи аудитории перед продолжением дальше.
Они также отмечают вид «эффекта белого халата», трудноизбежного в экспериментальных обстоятельствах, где некоторые участники чувствовали себя ограниченными возможными проблемами безопасности, связанными с биометрическими данными.
Заключение
Одним из заметных преимуществ такой системы является то, что все нестандартные вспомогательные технологии, необходимые для такого подхода, полностью исчезают после завершения их использования. Нет никаких остаточных браузерных плагинов, которые необходимо удалять, или которые могут вызвать сомнения в умах участников относительно того, должны ли они остаться на своих системах; и нет необходимости направлять пользователей через процесс установки (хотя веб-фреймворк требует минуты или двух первоначальной калибровки пользователя), или ориентироваться в возможности того, что пользователи не имеют достаточных разрешений для установки локального программного обеспечения, включая браузерные дополнения и расширения.
Хотя оцененные лицевые и глазные движения не так точны, как они могли бы быть в обстоятельствах, где используются специальные локальные фреймворки машинного обучения (например, серия YOLO), этот почти бесшовный подход к оценке аудитории обеспечивает достаточную точность для широкого анализа настроений и позиции в типичных сценариях видеоконференций. Прежде всего, это очень дешево.
Посмотрите на связанное видео проекта ниже для более подробной информации и примеров.
Опубликовано впервые 11 апреля 2022 года.












