Unghiul lui Anderson
Inteligența artificială ajută vorbitorii nervoși să “citească încăperea” în timpul videoconferințelor

În 2013, un sondaj privind fobiile comune a determinat că perspectiva vorbirii publice era mai rea decât perspectiva morții pentru majoritatea respondenților. Sindromul este cunoscut sub numele de glossofobie.
Migrația determinată de COVID de la întâlnirile “față în față” la conferințele online Zoom pe platforme precum Zoom și Google Spaces nu a îmbunătățit, surprinzător, situația. Atunci când ședința conține un număr mare de participanți, abilitățile noastre naturale de evaluare a amenințărilor sunt afectate de rândurile și iconele cu rezoluție scăzută ale participanților și de dificultatea de a citi semnalele vizuale subtile ale expresiilor faciale și limbajului corporal. De exemplu, s-a constatat că Skype este o platformă slabă pentru transmiterea de semnale non-verbale.
Efectele asupra performanței de vorbire publică a interesului și răspunsului perceput sunt bine documentate și, în mod intuitiv, evidente pentru majoritatea dintre noi. Răspunsul opac al audienței poate determina vorbitorii să ezite și să recurgă la discurs de umplutură, fără să știe dacă argumentele lor întâlnesc acordul, disprețul sau indiferența, făcând adesea o experiență inconfortabilă atât pentru vorbitor, cât și pentru ascultători.
Sub presiunea neașteptată a schimbării către videoconferințe online inspirate de restricțiile și precauțiile COVID, problema este, probabil, în curs de agravare, iar o serie de scheme de feedback de audiență ameliorative au fost sugerate în comunitățile de cercetare a viziunii și afectului în ultimii doi ani.
Soluții axate pe hardware
Majoritatea acestor soluții implică, totuși, echipamente suplimentare sau software complex care pot ridica probleme de confidențialitate sau logistică – abordări cu costuri relativ ridicate sau altfel limitate de resurse care preced pandemia. În 2001, MIT a propus Galvactivatorul, un dispozitiv purtat pe mână care inferă starea emoțională a participantului la audiență, testat în timpul unui simpozion de o zi.

Din 2001, Galvactivatorul MIT, care a măsurat răspunsul de conductivitate a pielii în încercarea de a înțelege sentimentul și angajamentul audienței. Sursă: https://dam-prod.media.mit.edu/x/files/pub/tech-reports/TR-542.pdf
O cantitate semnificativă de energie academică a fost dedicată, de asemenea, posibilei implementării “apăsătoarelor” ca sistem de răspuns al audienței (ARS), o măsură pentru a crește participarea activă a audienței (care crește automat implicarea, deoarece forțează vizionarul în rolul unui nod de feedback activ), dar care a fost, de asemenea, imaginat ca un mijloc de încurajare a vorbitorilor.
Alte încercări de a “conecta” vorbitorul și audiența au inclus monitorizarea ritmului cardiac, utilizarea unor echipamente complexe purtabile pentru a valorifica electroencefalografia, “măsurători de aplauze”, recunoașterea emoțiilor bazată pe viziunea computerului pentru lucrătorii de birou și utilizarea emoticoanelor trimise de audiență în timpul discursului vorbitorului.

Din 2017, EngageMeter, un proiect de cercetare academică comun al Universității Ludwig Maximilian din München și al Universității din Stuttgart. Sursă: http://www.mariamhassib.net/pubs/hassib2017CHI_3/hassib2017CHI_3.pdf
Ca o sub-încercare a zonei lucrative a analizei audienței, sectorul privat a manifestat un interes deosebit pentru estimarea și urmărirea privirii – sisteme în care fiecare membru al audienței (care, la rândul său, ar putea trebui să vorbească), este supus urmăririi oculare ca indice al implicării și aprobării.
Toate aceste metode sunt destul de “grele”. Multe dintre ele necesită echipamente personalizate, medii de laborator, software specializat și personalizat și abonamente la API-uri comerciale scumpe – sau orice combinație a acestor factori restrictivi.
Prin urmare, dezvoltarea unor sisteme minimaliste bazate pe unelte comune pentru videoconferințe a devenit de interes în ultimele 18 luni.
Raportarea aprobării audienței în mod discret
Pentru aceasta, o nouă colaborare de cercetare între Universitatea din Tokyo și Universitatea Carnegie Mellon oferă un sistem nou care poate fi conectat la unelte standard de videoconferință (cum ar fi Zoom) utilizând doar un site web cu webcam activat pe care rulează software de estimare a privirii și a poziției, cu o complexitate redusă. În acest fel, chiar și nevoia de plugin-uri de browser locale este evitată.
Înclinările și atenția estimată a utilizatorului sunt transpuse în date reprezentative care sunt visualizate înapoi către vorbitor, permițând un “test live” al gradului în care conținutul angajează audiența – și, de asemenea, cel puțin un indicator vag al perioadelor de discurs în care vorbitorul ar putea pierde interesul audienței.

Cu CalmResponses, atenția și înclinarea utilizatorului sunt adăugate la un pool de feedback al audienței și transpuse într-o reprezentare vizuală care poate beneficia vorbitorul. Sursă: https://www.youtube.com/watch?v=J_PhB4FCzk0
În multe situații academice, cum ar fi prelegerile online, studenții pot fi complet invizibili pentru vorbitor, deoarece nu și-au activat camerele din cauza rușinii față de fundalul sau aspectul lor actual. CalmResponses poate aborda această problemă spinosă a feedback-ului vorbitorului fără a necesita ca vizionarul să activeze camera.
Articolul se intitulează CalmResponses: Afішarea reacțiilor colective ale audienței în comunicarea la distanță și este o lucrare comună între doi cercetători de la Universitatea din Tokyo și unul de la Carnegie Mellon.
Autorii oferă o demonstrație live pe web și au lansat codul sursă pe GitHub.
Cadru CalmResponses
Interesul CalmResponses pentru înclinare, și nu pentru alte dispoziții ale capului, se bazează pe cercetări (unele dintre ele datând din era lui Darwin) care indică faptul că mai mult de 80% din toate mișcările capului ascultătorilor sunt alcătuite din înclinări (chiar și atunci când exprimă dezacord). În același timp, mișcările privirii au fost demonstrate peste numeroase studii a fi un indice fiabil al interesului sau implicării.
CalmResponses este implementat cu HTML, CSS și JavaScript și cuprinde trei subsisteme: un client de audiență, un client de vorbitor și un server. Clientul de audiență transmite datele privirii sau mișcării capului de la webcamul utilizatorului prin WebSockets peste platforma de aplicații cloud Heroku.

Înclinarea audienței este vizualizată pe dreapta într-o mișcare animată sub CalmResponses. Sursă: https://arxiv.org/pdf/2204.02308.pdf
Pentru secțiunea de urmărire a privirii a proiectului, cercetătorii au utilizat WebGazer, un cadru de urmărire a privirii ușor, bazat pe JavaScript, care poate rula cu latență scăzută direct de pe un site web (vezi linkul de mai sus pentru implementarea web-based a cercetătorilor).
Deoarece nevoia de implementare simplă și recunoaștere a răspunsului agregat depășește nevoia de acuratețe ridicată a estimării privirii și poziției, datele de intrare ale poziției sunt netezite în funcție de valorile medii înainte de a fi luate în considerare pentru estimarea răspunsului general.
Acțiunea de înclinare este evaluată prin biblioteca JavaScript clmtrackr, care ajustează modele faciale la fețele detectate în imagini sau videoclipuri prin deplasare regulată a punctelor de reper. În scopul economiei și al latenței scăzute, doar punctul de reper detectat pentru nas este monitorizat activ în implementarea autorilor, deoarece acesta este suficient pentru a urmări acțiunile de înclinare.

Mișcarea vârfului nasului utilizatorului creează un traseu care contribuie la pool-ul de răspuns al audienței legat de înclinare.
Hartă de căldură
În timp ce activitatea de înclinare este reprezentată de puncte dinamice în mișcare (vezi imaginile de mai sus și videoul de la sfârșit), atenția vizuală este raportată în termeni de o hartă de căldură care arată vorbitorului și audienței unde se concentrează locusul general de atenție pe ecranul de prezentare sau mediu de videoconferință partajat.

Toți participanții pot vedea unde se concentrează atenția generală a utilizatorului.
Teste
Două medii de test au fost formulate pentru CalmResponses sub forma unui studiu de ablație tacit, utilizând trei seturi variate de împrejurări: în “Condiția B” (bază), autorii au replicat o prelegere online tipică a studenților, în care majoritatea studenților țin camerele web închise, iar vorbitorul nu are posibilitatea de a vedea fețele audienței; în “Condiția CR-E”, vorbitorul putea vedea feedback-ul privirii (hărți de căldură); în “Condiția CR-N”, vorbitorul putea vedea atât activitatea de înclinare, cât și de privire a audienței.
Primul scenariu experimental a cuprins condiția B și condiția CR-E; al doilea a cuprins condiția B și condiția CR-N. S-a obținut feedback de la ambele părți, atât de la vorbitori, cât și de la audiență.
În fiecare experiment, trei factori au fost evaluați: evaluarea obiectivă și subiectivă a prezentării (inclusiv un chestionar auto-raportat de la vorbitor cu privire la sentimentele sale despre cum a decurs prezentarea); numărul de evenimente de “discurs de umplutură”, indicativ al insecurității și ezitării momentane; și comentarii calitative. Acești criterii sunt comuni estimatori ai calității discursului și anxietății vorbitorului.
Grupul de test a cuprins 38 de persoane cu vârste cuprinse între 19 și 44 de ani, alcătuit din 29 de bărbați și 9 femei, cu o vârstă medie de 24,7 ani, toți japonezi sau chinezi și toți fluenti în limba japoneză. Ei au fost împărțiți aleatoriu în cinci grupuri de 6-7 participanți și niciunul dintre subiecți nu se cunoșteau personal.
Testele au fost efectuate pe Zoom, cu cinci vorbitori care au prezentat prezentări în primul experiment și șase în al doilea.

Condiții de umplutură marcate cu cutii portocalii.
Cercetătorii notează că un vorbitor a redus semnificativ numărul de umpluturi și că, în “Condiția CR-N”, vorbitorul a rareori rostit fraze de umplutură. Vezi articolul pentru rezultatele foarte detaliate și granulare raportate; cu toate acestea, cele mai semnificative rezultate au fost în evaluarea subiectivă a vorbitorilor și participanților la audiență.
Comentariile audienței au inclus:
‘M-am simțit implicat în prezentări’ [AN2], ‘Nu am fost sigur că discursurile vorbitorilor au fost îmbunătățite, dar am simțit un sentiment de unitate din mișcările de înclinare ale celorlalți.’ [AN6]
‘Nu am fost sigur că discursurile vorbitorilor au fost îmbunătățite, dar am simțit un sentiment de unitate din mișcările de înclinare ale celorlalți.’
Cercetătorii notează că sistemul introduce o nouă pauză artificială în prezentarea vorbitorului, deoarece vorbitorul este înclinat să se refere la sistemul vizual pentru a evalua feedback-ul audienței înainte de a continua.
Ei notează, de asemenea, un fel de “efect de halat alb”, dificil de evitat în circumstanțele experimentale, în care unii participanți s-au simțit constrânși de implicațiile de securitate posibile ale monitorizării datelor biometrice.
Concluzie
Un avantaj notabil al unui sistem de acest fel este că toate tehnologiile auxiliare ne-standard necesare pentru o astfel de abordare dispar complet după ce utilizarea lor este terminată. Nu există plugin-uri de browser reziduale de deconectat sau care să ridice îndoieli în mintea participanților cu privire la faptul că ar trebui să rămână pe sistemele lor respective; și nu există nevoia de a ghida utilizatorii prin procesul de instalare (deși cadrul web-based necesită aproximativ un minut sau două de calibrare inițială a utilizatorului), sau de a naviga posibilitatea ca utilizatorii să nu aibă permisiuni adecvate pentru a instala software local, inclusiv extensii și add-on-uri bazate pe browser.
Deși estimările faciale și oculare evaluate nu sunt la fel de precise cum ar fi putut fi în circumstanțe în care s-ar fi utilizat cadre de învățare automată dedicate (cum ar fi seria YOLO), această abordare aproape fără frecare a evaluării audienței oferă o acuratețe suficientă pentru analiza sentimentului și a atitudinii în scenarii tipice de videoconferință. Mai presus de toate, este foarte ieftin.
Vezi videoul proiectului asociat de mai jos pentru mai multe detalii și exemple.
Publicat pentru prima dată pe 11 aprilie 2022.












