Andersonův úhel

AI pomáhá nervózním řečníkům “číst místnost” během videokonferencí

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

V roce 2013 byl proveden průzkum na běžné fobie a bylo zjištěno, že perspektiva veřejného projevu byla horší než perspektiva smrti pro většinu respondentů. Tento syndrom je znám jako glossophobia.

COVID-19 vyvolaná migrace z “osobních” setkání na online konference na platformách, jako je Zoom a Google Spaces, překvapivě nezlepšila situaci. Pokud se setkání skládá z velkého počtu účastníků, naše přirozené schopnosti posuzování hrozby jsou oslabeny nízkým rozlišením řad a ikon účastníků a obtížemi při čtení jemných vizuálních signálů obličeje a těla. Skype, například, se ukázal jako špatná platforma pro přenos neverbálních signálů.

Účinky veřejného projevu na vnímaný zájem a odezvu jsou dobře zdokumentovány a intuitivně zřejmé pro většinu z nás. Neprůhledná odezva publika může způsobit, že řečníci budou váhat a uchýlit se k vyplňovacímu projevu, nevědouce, zda jejich argumenty jsou setkávány s dohodou, opovržením nebo nezájmem, často vytvářejíce nepříjemnou zkušenost pro řečníka i jeho posluchače.

Pod tlakem neočekávaného posunu směrem k online videokonferencím inspirovaným omezeními a preventivními opatřeními proti COVID-19 se problém zřejmě zhoršuje, a několik zmírňujících schémat zpětné vazby publika bylo navrženo v komunitách počítačového vidění a affectu během posledních pár let.

Hardwarově orientovaná řešení

Většina z nich však vyžaduje další vybavení nebo komplexní software, který může vyvolat otázky týkající se ochrany osobních údajů nebo logistiky – relativně nákladný nebo jinak omezený přístup, který předchází pandemii. V roce 2001 navrhla MIT Galvactivator, zařízení nošené na ruce, které odhaduje emocionální stav účastníka publika, testované během celodenního symposia.

Z roku 2001, MIT's Galvactivator, který měřil kožní vodivost v pokusu porozumět postojům a zapojení publika. Zdroj: https://dam-prod.media.mit.edu/x/files/pub/tech-reports/TR-542.pdf

Z roku 2001, MIT’s Galvactivator, který měřil kožní vodivost v pokusu porozumět postojům a zapojení publika. Zdroj: https://dam-prod.media.mit.edu/x/files/pub/tech-reports/TR-542.pdf

Velká část akademické energie byla také věnována možnému nasazení “klikacích” zařízení jako systémů pro odezvu publika (ARS), opatření ke zvýšení aktivní účasti publika (což automaticky zvyšuje zapojení, protože donutí diváka přijmout roli aktivního uzlu zpětné vazby), ale které bylo také viděno jako prostředek k povzbuzení řečníků.

Další pokusy “spojit” řečníka a publikum zahrnovaly monitorování srdeční frekvence, použití komplexního vybavení nošeného na těle k využití elektroencefalografie, “metrů potlesku”, počítačově-vizualizované rozpoznávání emocí pro zaměstnance u stolů, a použití emotikonů odeslaných publikem během projevu řečníka.

Z roku 2017, EngageMeter, společný akademický výzkumný projekt z LMU Mnichov a Univerzity ve Stuttgartu. Zdroj: http://www.mariamhassib.net/pubs/hassib2017CHI_3/hassib2017CHI_3.pdf

Z roku 2017, EngageMeter, společný akademický výzkumný projekt z LMU Mnichov a Univerzity ve Stuttgartu. Zdroj: http://www.mariamhassib.net/pubs/hassib2017CHI_3/hassib2017CHI_3.pdf

Jako pod-pursuit lukrativního oblasti analýzy publika se soukromý sektor zvláště zajímal o odhad a sledování pohledu – systémy, kde je každý člen publika (který může v budoucnu muset mluvit), podroben okulárnímu sledování jako indexu zapojení a souhlasu.

Všechny tyto metody jsou poměrně vysoce-frakční. Mnoho z nich vyžaduje speciální vybavení, laboratorní prostředí, specializované a na míru vyrobené softwarové rámce a předplatné drahých komerčních API – nebo jakoukoli kombinaci těchto omezujících faktorů.

Takže se vývoj minimalistických systémů založených na málo více než běžných nástrojích pro videokonferenci stal zajímavým za posledních 18 měsíců.

Zpráva o souhlasu publika diskrétně

K tomuto účelu nabízí nová výzkumná spolupráce mezi Univerzitou v Tokiu a Univerzitou Carnegie Mellon nový systém, který může být připojen k standardním nástrojům pro videokonferenci (jako je Zoom) pomocí pouze webové stránky s webovou kamerou, na které běží lehký software pro odhad pohledu a postoje. Tímto způsobem je dokonce i potřeba místních prohlížečových pluginů vyhnuta.

Používátky a odhadované pohyby očí jsou přeloženy do reprezentativních dat, která jsou vizualizována zpět řečníkovi, umožňující “živou” zkoušku rozsahu, v jakém je obsah zapojuje publikum – a také alespoň vágní ukazatelé období diskuse, kde řečník může ztrácet zájem publika.

S CalmResponses, pozornost uživatele a kývání je přidáno do fondu zpětné vazby publika a přeloženo do vizuální reprezentace, která může prospět řečníkovi. Viz vložené video na konci článku pro více detailů a příkladů. Zdroj: https://www.youtube.com/watch?v=J_PhB4FCzk0

S CalmResponses, pozornost uživatele a kývání je přidáno do fondu zpětné vazby publika a přeloženo do vizuální reprezentace, která může prospět řečníkovi. Viz vložené video na konci článku pro více detailů a příkladů. Zdroj: https://www.youtube.com/watch?v=J_PhB4FCzk0

V mnoha akademických situacích, jako jsou online přednášky, mohou studenti být zcela neviditelní pro řečníka, protože nemají zapnuté kamery kvůli sebekontrole nad pozadím nebo současným vzhledem. CalmResponses může řešit tuto jinak trnitou překážku zpětné vazby řečníka tím, že hlásí, co ví o tom, jak řečník vypadá na obsah, a zda kývá, bez potřeby, aby divák aktivoval kameru.

Článek se jmenuje CalmResponses: Zobrazení kolektivní reakce publika vzdálené komunikaci a je společnou prací dvou výzkumníků z Univerzity v Tokiu a jednoho z Carnegie Mellon.

Autorům nabízí živou webovou demonstraci a uvolnili zdrojový kód na GitHubu.

Rámec CalmResponses

Zájem CalmResponses o kývání, na rozdíl od jiných možných dispozic hlavy, je založen na výzkumu (některém z nich sahajícím až do éry Darwina) že více než 80 % všech pohybů hlavy posluchačů se skládá z kývání (i když jsou vyjadřují nesouhlas). Současně byly pohyby očí prokázány v mnoha studiích jako spolehlivý index zájmu nebo zapojení.

CalmResponses je implementován pomocí HTML, CSS a JavaScriptu a skládá se ze tří subsystémů: klienta publika, klienta řečníka a serveru. Klient publika předává data o pohybu očí nebo pohybu hlavy z webové kamery přes WebSockets přes cloudovou aplikaci Heroku.

Kývání publika vizualizováno na pravé straně v animovaném pohybu pod CalmResponses. V tomto případě je vizualizace pohybu dostupná nejen řečníkovi, ale celému publiku.

Kývání publika vizualizováno na pravé straně v animovaném pohybu pod CalmResponses. Zdroj: https://arxiv.org/pdf/2204.02308.pdf

Pro část projektu týkající se sledování očí výzkumníci použili WebGazer, lehký, JavaScriptový framework pro sledování očí, který může běžet s nízkou latencí přímo z webové stránky (viz odkaz výše pro webovou implementaci výzkumníků).

Pokud je potřeba jednoduché implementace a hrubé, agregované rozpoznání reakce převáží nad potřebou vysoké přesnosti v odhadu pohledu a postoje, vstupní data postoje jsou vyhlazena podle průměrných hodnot předtím, než jsou považována za celkovou reakci.

Akce kývání je vyhodnocena prostřednictvím JavaScriptové knihovny clmtrackr, která přizpůsobuje obličejové modely detekovaným obličejům v obrazech nebo videích prostřednictvím pravidelného landmark mean-shift. Pro účely ekonomie a nízké latence je pouze detekovaný landmark pro nos aktivně monitorován v implementaci autorů, protože to stačí k sledování akcí kývání.

Pohyb nosu uživatele vytváří stopu, která přispívá do fondu reakce publika související s kýváním, vizualizované v agregované podobě pro všechny účastníky.

Pohyb nosu uživatele vytváří stopu, která přispívá do fondu reakce publika související s kýváním, vizualizované v agregované podobě pro všechny účastníky.

Teplotní mapa

Zatímco aktivita kývání je reprezentována dynamickými tečkami (viz obrázky výše a video na konci), pozornost je hlášena formou teplotní mapy, která ukazuje řečníkovi a publiku, kde je obecný locus pozornosti zaměřen na sdílenou prezentaci nebo videokonferenční prostředí.

Všichni účastníci mohou vidět, kde je obecná pozornost uživatele zaměřena. Článek nezmiňuje, zda je tato funkčnost dostupná, když uživatel může vidět

Všichni účastníci mohou vidět, kde je obecná pozornost uživatele zaměřena.

Testy

Dva testovací prostředí byly vytvořeny pro CalmResponses ve formě implicitní ablační studie, pomocí tří různých sad okolností: v “Podmínkách B” (základní), autoři replikovali typickou online studentskou přednášku, kde většina studentů má vypnuté kamery a řečník nemá možnost vidět tváře publika; v “Podmínkách CR-E”, řečník mohl vidět zpětnou vazbu pohledu (teplotní mapy); v “Podmínkách CR-N”, řečník mohl vidět jak kývání, tak aktivitu pohledu od publika.

První experimentální scénář zahrnoval podmínku B a podmínku CR-E; druhý zahrnoval podmínku B a podmínku CR-N. Zpětná vazba byla získána od řečníků i publika.

V každém experimentu byly vyhodnoceny tři faktory: objektivní a subjektivní hodnocení prezentace (včetně samoohodnotícího dotazníku řečníka týkajícího se jeho pocitů o tom, jak prezentace proběhla); počet událostí “vyplňovacího” projevu, indikativního momentální nejistoty a váhání; a kvalitativní komentáře. Tyto kritéria jsou obvyklé odhadovatelé kvality projevu a úzkosti řečníka.

Testovací skupina se skládala z 38 lidí ve věku 19-44 let, tvořených 29 muži a devíti ženami s průměrným věkem 24,7 let, všichni japonští nebo čínští a všichni mluvící japonštinu. Byli náhodně rozděleni do pěti skupin po 6-7 účastnících a žádný z účastníků se osobně neznal.

Testy byly provedeny na Zoomu, s pěti řečníky, kteří přednesli prezentace v prvním experimentu a šesti v druhém.

Podmínky vyplňovacího projevu označené oranžovými rámečky. Obecně klesal obsah vyplňovacího projevu v rozumném poměru ke zvýšené zpětné vazbě od systému.

Podmínky vyplňovacího projevu označené oranžovými rámečky.

Výzkumníci poznamenali, že jeden řečníkova vyplňovací projevy se podstatně snížily a že v “Podmínkách CR-N” řečník zřídka vyslovil vyplňovací věty. Viz článek pro velmi podrobné a granulární výsledky; nicméně, nejvýraznější výsledky byly v subjektivním hodnocení od řečníků a účastníků publika.

Komentáře od publika zahrnovaly:

‘Cítil jsem, že jsem byl zapojen do prezentací’, ‘Cítil jsem jednotu z vizualizace pohybů hlavy ostatních’.

‘Cítil jsem jednotu z vizualizace pohybů hlavy ostatních’.

Výzkumníci poznamenali, že systém zavádí nový druh umělé pauzy do prezentace řečníka, protože řečník je nakloněn odkázat se na vizuální systém, aby zhodnotil zpětnou vazbu publika, než bude pokračovat dále.

Také poznamenali jistý “bílý plášťový efekt”, který je obtížné vyhnout se v experimentálních okolnostech, kde někteří účastníci cítili omezení možnými bezpečnostními důsledky monitorování biometrických dat.

Závěr

Jednou z výhod systému, jako je tento, je, že všechny nestandardní pomocné technologie potřebné pro takový přístup zcela zmizí po jejich použití. Není třeba odstraňovat žádných prohlížečových pluginů, nebo pochybovat v myslích účastníků, zda by měly zůstat na svých systémech; a není třeba vést uživatele procesem instalace (ačkoli webový rámec vyžaduje minutu nebo dvě počáteční kalibrace uživatelem), nebo navigovat možnost, že uživatelé nemají dostatečná oprávnění k instalaci místního softwaru, včetně prohlížečových pluginů a rozšíření.

Přestože vyhodnocené obličejové a oční pohyby nejsou tak přesné, jako by mohly být v okolnostech, kde by se používaly specializované místně-orientované rámce strojového učení (jako série YOLO), tento téměř bezproblémový přístup k hodnocení publika poskytuje dostatečnou přesnost pro širokou analýzu postoje a stanoviska v typických scénářích videokonferencí. Především je to velmi levné.

Viz související projektové video níže pro další podrobnosti a příklady.

Poprvé publikováno 11. dubna 2022.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai