Погляд Anderson
Штучний інтелект допомагає нервовим ораторам «читати аудиторію» під час відеоконференцій

У 2013 році опитування щодо поширених фобій показало, що перспектива публічних виступів була гіршою за перспективу смерті для більшості респондентів. Ця синдром називається глоссофобією.
Ковід-інспірована міграція з «особистих» зустрічей до онлайн-зум-конференцій на платформах, таких як Zoom і Google Spaces, несподівано не покращила ситуацію. Коли на зустрічі присутня велика кількість учасників, наші природні можливості оцінки загрози порушуються низькою роздільною здатністю рядів і ікон учасників, а також труднощами у читанні тонких візуальних сигналів обличчя і мови тіла. Наприклад, Skype виявився поганою платформою для передачі невербальних сигналів.
Ефекти публічних виступів на сприйняття інтересу та реакції аудиторії добре задокументовані на даний момент, і інтуїтивно очевидні для більшості з нас. Неясна реакція аудиторії може змусити ораторів коливатися і повернутися до заповнювальної мови, не знаючи, чи їхні аргументи зустрічаються з погодженням, зневагою чи байдужістю, часто роблячи досвід незручним як для оратора, так і для слухачів.
Під тиском несподіваної зміни до онлайн-відеоконференцій, викликаної ковід-обмеженнями та попередженнями, проблема, ймовірно, погіршується, і за останні пару років у сфері комп’ютерного бачення та досліджень емоцій було запропоновано кілька поліпшених схем зворотного зв’язку аудиторії.
Апаратні рішення
Більшість із них, однак, включають додаткове обладнання або складне програмне забезпечення, яке може викликати проблеми з приватністю або логістикою – відносно дорогий або інший ресурсоємний підхід, який передував пандемії. У 2001 році MIT запропонував Гальвактиватор, носимий пристрій, який витікає емоційний стан учасника аудиторії, випробуваний під час одноденної симпозіуму.

З 2001 року, Гальвактиватор MIT, який вимірював реакцію провідності шкіри в спробі зрозуміти настрій і залученість аудиторії. Джерело: https://dam-prod.media.mit.edu/x/files/pub/tech-reports/TR-542.pdf
Була витрачена велика кількість академічної енергії на можливе розгортання «клікерів» як системи реакції аудиторії (ARS), заходу для збільшення активної участі аудиторії (що автоматично збільшує залученість, оскільки примушує глядача до ролі активного вузла зворотного зв’язку), але який також був задуманий як засіб заохочення ораторів.
Інші спроби «з’єднати» оратора та аудиторію включали мониторинг частоти серцевих скорочень, використання складного носимого обладнання для використання електроенцефалографії, «мір метрів аплодисментів», комп’ютерно-оптичне визнання емоцій для працівників, що сидять за столом, і використання емотиконів, надісланих аудиторією під час промови оратора.

З 2017 року, EngageMeter, спільний академічний дослідницький проєкт LMU Мюнхена та Університету Штутгарта. Джерело: http://www.mariamhassib.net/pubs/hassib2017CHI_3/hassib2017CHI_3.pdf
Як підпursuit вигідної області аналізу аудиторії, приватний сектор проявив особливий інтерес до оцінки погляду та відстеження – систем, де кожен учасник аудиторії (який згодом може мати besoin говорити), піддається окулярному відстежуванню як індексу залученості та схвалення.
Всі ці методи досить високофрикційні. Багато з них вимагають спеціального обладнання, лабораторних умов, спеціального та саморобного програмного забезпечення, а також підписку на дорогі комерційні API – або будь-яку комбінацію цих обмежувальних факторів.
Отже, розвиток мінімалістських систем, заснованих на простих інструментах для відеоконференцій, став цікавим за останні 18 місяців.
Дискретне повідомлення про схвалення аудиторії
Для цього нове дослідницьке співробітництво між Університетом Токіо та Університетом Карнегі-Меллон пропонує нову систему, яка може використовувати стандартні інструменти відеоконференцій (наприклад, Zoom) лише за допомогою веб-сайту з веб-камерою, на якому запущено легке програмне забезпечення для оцінки погляду та пози. Таким чином навіть необхідність локальних браузерних плагінів відміняється.
Кивки та оцінка уваги користувача перекладаються в представницькі дані, які візуалізуються для оратора, дозволяючи здійснити «живий» тест на ступінь, у якій вміст залучає аудиторію – і принаймні приблизний індикатор періодів дискурсу, де оратор може втрачати інтерес аудиторії.

З CalmResponses, увага користувача та кивки додаються до пула зворотного зв’язку аудиторії та перекладаються у візуальну репрезентацію, яка може бути корисною для оратора. Дивіться вкладений відео в кінці статті для більшої кількості деталей та прикладів. Джерело: https://www.youtube.com/watch?v=J_PhB4FCzk0
У багатьох академічних ситуаціях, таких як онлайн-лекції, студенти можуть бути повністю невидимими для оратора, оскільки вони не включили свої веб-камери через самосвідомість щодо свого фону або поточного вигляду. CalmResponses може подолати цю інакше колючу перешкоду для зворотного зв’язку оратора, повідомляючи про те, як оратор дивиться на вміст, і чи киває, без жодної необхідності увімкнути камеру.
Стаття називається CalmResponses: Відображення колективних реакцій аудиторії в дистанційній комунікації, і є спільною роботою двох дослідників з Університету Токіо та одного з Університету Карнегі-Меллон.
Автори пропонують живу веб-демонстрацію та випустили джерельний код на GitHub.
Фреймворк CalmResponses
Інтерес CalmResponses до кивків, а не інших можливих положень голови, заснований на дослідженнях (деякі з яких датуються часами Дарвіна), які свідчать про те, що понад 80% усіх рухів голови слухачів складаються з кивків (навіть коли вони виражають незгоду). Водночас рухи очей були показані багатьма студіями надійним індексом інтересу чи залученості.
CalmResponses реалізований за допомогою HTML, CSS та JavaScript, і складається з трьох підсистем: клієнта аудиторії, клієнта оратора та сервера. Клієнт аудиторії передає дані про рух очей або голови користувача з веб-камери через WebSockets над хмарною платформою Heroku.

Кивки аудиторії візуалізовані праворуч у анімованому русі під CalmResponses. У цьому випадку візуалізація руху доступна не лише оратору, а й всій аудиторії. Джерело: https://arxiv.org/pdf/2204.02308.pdf
Для частини проекту, пов’язаної з відстежуванням очей, дослідники використали WebGazer, легке, засноване на JavaScript браузерне відстежування очей, яке може працювати з низькою затримкою безпосередньо з веб-сайту (дивіться посилання вище для власної веб-реалізації дослідників).
Оскільки необхідність простої реалізації та грубого визнання реакції переважає необхідність високої точності оцінки погляду та пози, дані про позу вводяться в середнє значення перед тим, як бути розглянутими для загальної оцінки реакції.
Дія кивків оцінюється за допомогою бібліотеки JavaScript clmtrackr, яка підходить до виявлених облич у зображеннях або відео через регуляризовану зміну орієнтації. Для економії та низької затримки лише виявлений орієнтір для носа активно контролюється у реалізації авторів, оскільки це достатньо для відстежування дій кивків.

Рух положення носа користувача створює слід, який додається до пула реакції аудиторії, пов’язаної з кивками, візуалізованої у агрегованій формі для всіх учасників.
Теплова карта
Хоча дія кивків представлена динамічними рухливими точками (див. зображення вище та відео в кінці), увага візуалізується у вигляді теплової карти, яка показує оратору та аудиторії, де загальне місце уваги зосереджено на спільному екрані презентації або відеоконференції.

Всі учасники можуть бачити, де зосереджена загальна увага користувача. Стаття не згадує, чи ця функціональність доступна, коли користувач може бачити «галерею» інших учасників, що може показати хибну увагу на одному учаснику з різних причин.
Тести
Було сформульовано два тестових середовища для CalmResponses у вигляді неявного дослідження видалення, за допомогою трьох різноманітних обставин: у «Умові Б» (базовій), автори відтворили типову онлайн-лекцію студентів, де більшість студентів тримали свої веб-камери вимкненими, і оратор не мав можливості бачити обличчя аудиторії; у «Умові CR-E», оратор міг бачити зворотний зв’язок погляду (теплову карту); у «Умові CR-N», оратор міг бачити як кивки, так і діяльність погляду аудиторії.
Перший експериментальний сценарій складався з умов Б і CR-E; другий складався з умов Б і CR-N. Зворотний зв’язок був отриманий як від ораторів, так і від аудиторії.
У кожному експерименті оцінювалися три фактори: об’єктивна та суб’єктивна оцінка презентації (включаючи самоопитування оратора щодо його почуттів про те, як пройшла презентація); кількість подій «заповнювальної мови», що вказує на тимчасову невпевненість і коливання; і якісні коментарі. Ці критерії є поширеними оцінювачами якості мови та тривоги оратора.
Тестовий басейн складався з 38 осіб у віці від 19 до 44 років, у складі 29 чоловіків і дев’яти жінок із середнім віком 24,7 роки, усіх японців або китайців, і всіх, хто вільно володіє японською мовою. Їх випадково розділили на п’ять груп по 6-7 учасників, і жоден з учасників не знав один одного особисто.
Тести проводилися на Zoom, з п’ятьма ораторами, які читали лекції в першому експерименті та шістьма в другому.

Умови заповнювальної мови позначені оранжевими коробками. Загалом, вміст заповнювальної мови впав у розумній пропорції до збільшення зворотного зв’язку аудиторії від системи.
Дослідники відзначають, що у одного оратора кількість заповнювальної мови значно зменшилася, і що в «Умові CR-N» оратор рідко вимовляв фрази заповнювальної мови. Дивіться статтю для дуже детального та гранульованого результату; однак найбільш виразні результати були у суб’єктивній оцінці ораторів та учасників аудиторії.
Коментарі аудиторії включали:
‘Я відчував, що беру участь у презентаціях” [AN2], “Я не був впевнений, чи покращилися промови ораторів, але я відчував відчуття єдності з візуалізацією рухів голови інших.’ [AN6]
‘Я не був впевнений, чи покращені промови ораторів, але я відчував відчуття єдності з візуалізацією рухів голови інших.’
Дослідники відзначають, що система вводить новий вид штучної паузи у презентацію оратора, оскільки оратор схильний звертатися до візуальної системи для оцінки зворотного зв’язку аудиторії перед тим, як продовжити далі.
Вони також відзначають певний «ефект білого халата», який важко уникнути в експериментальних обставинах, де деякі учасники відчували себе обмеженими через можливі безпекові наслідки моніторингу біометричних даних.
Висновок
Одна з помітних переваг системи, подібної до цієї, полягає в тому, що всі нестандартні допоміжні технології, необхідні для такого підходу, повністю зникають після закінчення їхнього використання. Не залишається жодних залишкових браузерних плагінів для видалення, або щоб викликати сумніви в учасників щодо того, чи повинні вони залишитися на своїх системах; і немає необхідності спрямовувати користувачів через процес установки (хоча веб-фреймворк вимагає хвилини або двох хвилин первинної калібрування користувачем), або щоб орієнтуватися у можливості того, що користувачі не мають достатніх дозволів для встановлення локального програмного забезпечення, включаючи браузерні додатки та розширення.
Хоча оцінені рухи обличчя та очей не такі точні, як вони могли б бути в обставинах, коли використовуються спеціальні локальні фреймворки машинного навчання (наприклад, серія YOLO), цей майже безтерічний підхід до оцінки аудиторії забезпечує достатню точність для широкого аналізу настрою та позиції в типових відеоконференційних сценаріях. Передусім, це дуже дешево.
Перегляньте пов’язане відео проєкту нижче для більшої кількості деталей та прикладів.
Перше опубліковане 11 квітня 2022 року.












