Η γωνία του Anderson
Το AI Βοηθά τους Νερβικούς Ομιλητές να ‘Διαβάσουν τον Χώρο’ κατά τη Διάρκεια των Βιντεοκονφεράνς

Το 2013, μια δημοσκόπηση για τις κοινές φοβίες κατέληξε στο συμπέρασμα ότι η προοπτική της δημόσιας ομιλίας ήταν χειρότερη από την προοπτική του θανάτου για την πλειονότητα των απαντησάντων. Το σύνδρομο αυτό είναι γνωστό ως γλωσσοφοβία.
Η μεταφορά από τις προσωπικές συναντήσεις στις διαδικτυακές συνεδριάσεις Zoom σε πλατφόρμες όπως το Zoom και το Google Spaces, λόγω της πανδημίας, δεν έχει βελτιώσει την κατάσταση. Όταν η συνάντηση περιλαμβάνει μεγάλο αριθμό συμμετεχόντων, οι φυσικές μας ικανότητες αξιολόγησης της απειλής είναι ελαττωμένες από τις χαμηλής ανάλυσης σειρές και εικονίδια συμμετεχόντων, καθώς και τη δυσκολία ανάγνωσης των λεπτών οπτικών σημάτων της εκφράσεως και της σωματικής γλώσσας. Για παράδειγμα, το Skype έχει βρεθεί να είναι μια κακή πλατφόρμα για τη μεταφορά μη λεκτικών σημάτων.
Οι επιπτώσεις στην απόδοση της δημόσιας ομιλίας από την αντίληψη του ενδιαφέροντος και της ανταπόκρισης είναι καλά τεκμηριωμένες μέχρι τώρα και είναι εννοητά προφανείς για την πλειονότητα μας. Η αδιαφανής ανταπόκριση του κοινού μπορεί να προκαλέσει στους ομιλητές διστακτικότητα και να τους οδηγήσει σε γέμισμα λόγου, αγνοώντας εάν οι επιχειρήσεις τους συναντούν με συμφωνία, περιφρόνηση ή αδιαφορία, συχνά καθιστώντας την εμπειρία άβοη για cả τον ομιλητή και τους ακροατές.
Υπό την πίεση της απροσδόκητης μετατόπισης προς τις διαδικτυακές βιντεοκονφεράνς που ενέπνευσε η πανδημία, το πρόβλημα είναι ολοένα και πιο επιβαρυντικό, και έχουν προταθεί πολλά αποθεματικά σχήματα ανταπόκρισης του κοινού στις κοινότητες της υπολογιστικής όρασης και της έρευνας των συναισθημάτων τα τελευταία δύο χρόνια.
Λύσεις με Προσάρτηση σε Υλικό
Οι περισσότερες από αυτές, ωστόσο, απαιτούν πρόσθετο εξοπλισμό ή σύνθετο λογισμικό που μπορεί να προκαλέσει προβλήματα ιδιωτικότητας ή λογιστικής – σχετικά υψηλό κόστος ή άλλοι περιορισμοί που προηγήθηκαν της πανδημίας. Το 2001, το MIT πρότεινε τον Galvactivator, μια συσκευή που φοριέται στο χέρι και υποδηλώνει την συναισθηματική κατάσταση του συμμετέχοντα, που δοκιμάστηκε κατά τη διάρκεια μιας ημερήσιας συνόδου.

Από το 2001, ο Galvactivator του MIT, που μετρούσε την απάντηση της αγωγιμότητας του δέρματος σε μια προσπάθεια να κατανοήσει τη γνώμη και την εμπλοκή του κοινού. Πηγή: https://dam-prod.media.mit.edu/x/files/pub/tech-reports/TR-542.pdf
Πολύς ακαδημαϊκός ενθουσιασμός έχει επίσης αφιερωθεί στη δυνατότητα απασχόλησης ‘κλικερών’ ως Συστήματος Ανταπόκρισης του Κοινού (ARS), ένα μέτρο για την αύξηση της ενεργού συμμετοχής του κοινού (που αυξάνει αυτόματα την εμπλοκή,既然 ότι αναγκάζει τον θεατή να αναλάβει τον ρόλο ενός ενεργού κόμβου ανταπόκρισης), αλλά που έχει επίσης προβλεφθεί ως μέσο ενθάρρυνσης του ομιλητή.
Άλλες προσπάθειες για ‘σύνδεση’ ομιλητή και κοινού περιλαμβάνουν μετρήσεις της συχνότητας της καρδιάς, τη χρήση σύνθετου εξοπλισμού που φοριέται στο σώμα για να αξιοποιήσει την ηλεκτροεγκεφαλογραφία, ‘μετρητές χαράς’, υπολογιστική-όραση-με βάση αναγνώριση συναισθημάτων για εργαζόμενους σε γραφείο, και τη χρήση emoticon που αποστέλλονται από το κοινό κατά τη διάρκεια της ομιλίας.

Από το 2017, ο EngageMeter, μια κοινή ακαδημαϊκή ερευνητική εργασία από το LMU Munich και το Πανεπιστήμιο της Στουτγάρδης. Πηγή: http://www.mariamhassib.net/pubs/hassib2017CHI_3/hassib2017CHI_3.pdf
Ως υπο-πρόταση του lukrativου τομέα της ανάλυσης του κοινού, ο ιδιωτικός τομέας έχει δείξει ιδιαίτερο ενδιαφέρον για την εκτίμηση και τον εντοπισμό της ματιάς – συστήματα όπου κάθε μέλος του κοινού (που μπορεί με τη σειρά του να πρέπει να μιλήσει), υπόκειται σε οφθαλμική παρακολούθηση ως δείκτης της εμπλοκής και της έγκρισης.
Όλες αυτές οι μέθοδοι είναι αρκετά υψηλής τριβής. Πολύς από αυτούς απαιτούν ειδικό εξοπλισμό, εργαστήρια, εξειδικευμένο και αυτοσχέδιο λογισμικό, και συνδρομή σε ακριβές εμπορικά API – ή οποιαδήποτε συνδυασμός από αυτούς τους περιοριστικούς παράγοντες.
Επομένως, η ανάπτυξη ελαφριών συστημάτων που βασίζονται σε λίγο περισσότερο από τα κοινά εργαλεία για τις βιντεοκονφεράνς έχει γίνει ενδιαφέρον τα τελευταία 18 μήνες.
Αναφορά της Ανταπόκρισης του Κοινού Διακριτικά
Για αυτό, μια νέα ερευνητική συνεργασία μεταξύ του Πανεπιστημίου του Τόκιο και του Πανεπιστημίου Carnegie Mellon προσφέρει ένα νέο σύστημα που μπορεί να συνδεθεί με τυπικά εργαλεία βιντεοκονφεράνς (όπως το Zoom) χρησιμοποιώντας μόνο μια ιστοσελίδα με ενεργοποιημένη webcam, στην οποία τρέχει ελαφρύ λογισμικό εκτίμησης της ματιάς και της στάσης. Με αυτόν τον τρόπο, ακόμη και η ανάγκη για τοπικά πρόσθετα του προγράμματος περιήγησης αποφεύγεται.
Οι κινήσεις του χρήστη και οι εκτιμώμενες κινήσεις της προσοχής μετατρέπονται σε αντιπροσωπευτικά δεδομένα που οπτικοποιούνται πίσω στον ομιλητή, επιτρέποντας ένα ‘ζωντανο’ τεστ της έκτασης με την οποία το περιεχόμενο εμπλέκει το κοινό – και επίσης τουλάχιστον ένα ασαφές δείκτη των περιόδων της ομιλίας όπου ο ομιλητής μπορεί να χάνει το ενδιαφέρον του κοινού.

Με το CalmResponses, η προσοχή και η κίνηση του χρήστη προστίθενται σε μια πηγή ανταπόκρισης του κοινού και μετατρέπονται σε μια οπτική αναπαράσταση που μπορεί να ωφελήσει τον ομιλητή. Δείτε το ενσωματωμένο βίντεο στο τέλος του άρθρου για περισσότερες λεπτομέρειες και παραδείγματα. Πηγή: https://www.youtube.com/watch?v=J_PhB4FCzk0
Σε πολλές ακαδημαϊκές καταστάσεις, όπως τις διαδικτυακές διαλέξεις, οι φοιτητές μπορεί να μην είναι ορατοί από τον ομιλητή,既然 ότι δεν έχουν ενεργοποιήσει τις κάμερες τους λόγω αυτοσυνειδησίας για το περιβάλλον ή την τρέχουσα εμφάνισή τους. Το CalmResponses μπορεί να αντιμετωπίσει αυτό το προβληματικό εμπόδιο της ανταπόκρισης του ομιλητή, αναφέροντας τι γνωρίζει για το πώς ο ομιλητής κοιτάζει το περιεχόμενο, και αν κουνάει το κεφάλι, χωρίς να χρειάζεται ο θεατής να ενεργοποιήσει την κάμερα του.
Το έγγραφο έχει τον τίτλο CalmResponses: Displaying Collective Audience Reactions in Remote Communication, και είναι μια κοινή εργασία δύο ερευνητών από το UoT και ενός από το Carnegie Mellon.
Οι συγγραφείς προσφέρουν μια ζωντανή διαδικτυακή επίδειξη, και έχουν κυκλοφορήσει τον κώδικα πηγής στο GitHub.
Το Πλαίσιο CalmResponses
Το ενδιαφέρον του CalmResponses για την κίνηση του κεφαλιού, αντί για άλλες πιθανές διαθέσεις του κεφαλιού, βασίζεται σε έρευνα (μερική από την εποχή του Δαρβίνου) που δείχνει ότι περισσότερο από το 80% όλων των κινήσεων του κεφαλιού των ακροατών αποτελείται από κουνήματα (ακόμη και όταν εκφράζουν διαφωνία). Ταυτόχρονα, οι κινήσεις της ματιάς έχουν δείξει σε πολλές μελέτες να είναι ένας αξιόπιστος δείκτης του ενδιαφέροντος ή της εμπλοκής.
Το CalmResponses υλοποιείται με HTML, CSS, και JavaScript, και αποτελείται από τρία υποσυστήματα: ένα υποσύστημα για το κοινό, ένα υποσύστημα για τον ομιλητή, και ένα υποσύστημα για τον διακομιστή. Το υποσύστημα του κοινού μεταφέρει δεδομένα ματιάς ή κινήσεων του κεφαλιού από την webcam του χρήστη μέσω WebSockets στο cloud application platform Heroku.

Η κίνηση του κεφαλιού του κοινού οπτικοποιείται στη δεξιά πλευρά με μια κινούμενη κίνηση στο CalmResponses. Σε αυτή την περίπτωση, η οπτικοποίηση της κίνησης είναι διαθέσιμη όχι μόνο για τον ομιλητή, αλλά και για όλο το κοινό. Πηγή: https://arxiv.org/pdf/2204.02308.pdf
Για το τμήμα της οπτικής παρακολούθησης του έργου, οι ερευνητές χρησιμοποίησαν WebGazer, một ελαφρύ, JavaScript-με βάση browser-με βάση πλαίσιο οπτικής παρακολούθησης που μπορεί να τρέξει με χαμηλή καθυστέρηση απευθείας από μια ιστοσελίδα (δείτε τον σύνδεσμο παραπάνω για την υλοποίηση των ερευνητών).
Καθώς η ανάγκη για απλή υλοποίηση και груβή, συλλογική αναγνώριση ανταπόκρισης υπερτερεί της ανάγκης για υψηλή ακρίβεια στην εκτίμηση της ματιάς και της στάσης, τα δεδομένα της στάσης εισάγονται σύμφωνα με τις μέσες τιμές πριν να θεωρηθούν για την εκτίμηση της ανταπόκρισης.
Η κίνηση του κεφαλιού αξιολογείται μέσω της βιβλιοθήκης JavaScript clmtrackr, η οποία ταιριάζει με μοντέλα προσώπου σε ανιχνευμένα πρόσωπα σε εικόνες ή βίντεο μέσω κανονικοποιημένης μεθόδου μετατόπισης. Για λόγους οικονομίας και χαμηλής καθυστέρησης, μόνο το ανιχνευμένο σημείο για τη μύτη είναι ενεργά παρακολουθούμενο στην υλοποίηση των συγγραφέων,既然 ότι αυτό είναι αρκετό για την παρακολούθηση της κίνησης του κεφαλιού.

Η κίνηση της μύτης του χρήστη δημιουργεί μια ιχνηλασία που συνεισφέρει στην πηγή της ανταπόκρισης του κοινού που σχετίζεται με την κίνηση του κεφαλιού, οπτικοποιημένη με συλλογικό τρόπο για όλους τους συμμετέχοντες.
Θερμική Χάρτα
Ενώ η κίνηση του κεφαλιού αντιπροσωπεύεται από δυναμικά κινούμενα σημεία (δείτε τις εικόνες παραπάνω και το βίντεο στο τέλος), η οπτική προσοχή αναφέρεται σε όρους μιας θερμικής χάρτας που δείχνει στον ομιλητή και στο κοινό που είναι το γενικό σημείο εστίασης της προσοχής στο κοινόχρηστο παρουσιαστικό ή περιβάλλον βιντεοκονφεράνς.

Όλοι οι συμμετέχοντες μπορούν να δουν που είναι εστιασμένη η προσοχή. Το έγγραφο δεν αναφέρει εάν αυτή η λειτουργία είναι διαθέσιμη όταν ο χρήστης μπορεί να δει μια ‘γκαλερί’ άλλων συμμετεχόντων, που θα μπορούσε να αποκαλύψει ψευδή εστίαση σε έναν συγκεκριμένο συμμετέχοντα, για διάφορους λόγους.
Δοκιμές
Δύο περιβάλλοντα δοκιμών διαμορφώθηκαν για το CalmResponses με τη μορφή μιας σιωπηλής μελέτης, χρησιμοποιώντας τρεις διαφορετικές συνθήκες: στην ‘Συνθήκη B’ (βασική), οι συγγραφείς αναπαράχθηκαν μια τυπική διαδικτυακή διάλεξη φοιτητών, όπου η πλειονότητα των φοιτητών κρατούσε τις κάμερες τους απενεργοποιημένες, και ο ομιλητής δεν είχε τη δυνατότητα να δει τα πρόσωπα του κοινού; στην ‘Συνθήκη CR-E’, ο ομιλητής μπορούσε να δει την ανταπόκριση της ματιάς (θερμικές χάρτες); στην ‘Συνθήκη CR-N’, ο ομιλητής μπορούσε να δει και την κίνηση του κεφαλιού και την ανταπόκριση της ματιάς από το κοινό.
Η πρώτη πειραματική συνθήκη αποτελούσε την συνθήκη B και την συνθήκη CR-E; η δεύτερη συνθήκη αποτελούσε την συνθήκη B και την συνθήκη CR-N. Ανταπόκριση λήφθηκε και από τους ομιλητές και από το κοινό.
Σε κάθε πείραμα, τρεις παράγοντες αξιολογήθηκαν: αντικειμενική και υποκειμενική αξιολόγηση της παρουσίασης (συμπεριλαμβανομένης μιας αυτοαναφερόμενης ερωτηματολόγιου από τον ομιλητή σχετικά με τα συναισθήματά του για το πώς πήγε η παρουσίαση); ο αριθμός των γεγονότων ‘γέμισης’ λόγου, που δείχνει προσωρινή αβεβαιότητα και διστακτικότητα; και ποιοτικά σχόλια. Αυτά τα κριτήρια είναι κοινά εκτιμητές της ποιότητας του λόγου και της ανησυχίας του ομιλητή.
Η δοκιμαστική πηγή αποτελούσε 38 άτομα ηλικίας 19-44, που αποτελούσαν 29 άντρες και 9 γυναίκες με μέση ηλικία 24.7, όλα Ιάπωνες ή Κινέζοι και όλα ικανοί στην ιαπωνική. Χωρίστηκαν τυχαία σε πέντε ομάδες 6-7 συμμετεχόντων, και κανένας από τους συμμετέχοντες δεν γνώριζε προσωπικά ο ένας τον άλλον.
Οι δοκιμές διεξήχθησαν στο Zoom, με πέντε ομιλητές να δίνουν παρουσιάσεις στην πρώτη δοκιμή και έξι στη δεύτερη.

Συνθήκες γέμισης σημειωμένες με πορτοκαλί κουτιά. Γενικά, το περιεχόμενο γέμισης έπεσε σε λογική αναλογία με την αύξηση της ανταπόκρισης του συστήματος.
Οι ερευνητές σημειώνουν ότι η γέμιση ενός ομιλητή μειώθηκε αξιοσημείωτα, και ότι στην ‘Συνθήκη CR-N’, ο ομιλητής σπάνια έλεγε φράσεις γέμισης. Δείτε το έγγραφο για τα πολύ λεπτομερή και αναλυτικά αποτελέσματα που αναφέρονται; ωστόσο, τα πιο αξιοσημείωτα αποτελέσματα ήταν στην υποκειμενική αξιολόγηση από τους ομιλητές και τους συμμετέχοντες του κοινού.
Σχόλια από το κοινό περιελάμβαναν:
‘Νιώθω ότι ήμουν εμπλεγμένος στις παρουσιάσεις” [AN2], “Δεν ήμουν σίγουρος ότι οι ομιλητές βελτίωσαν τις ομιλίες τους, αλλά νιώθω μια αίσθηση ενότητας από τις κινήσεις του κεφαλιού των άλλων’ [AN6]
‘Δεν ήμουν σίγουρος ότι οι ομιλητές βελτίωσαν τις ομιλίες τους, αλλά νιώθω μια αίσθηση ενότητας από τις κινήσεις του κεφαλιού των άλλων’
Οι ερευνητές σημειώνουν ότι το σύστημα εισάγει ένα νέο είδος τεχνητής παύσης στην παρουσίαση του ομιλητή,既然 ότι ο ομιλητής έχει την τάση να αναφέρεται στο οπτικό σύστημα για να αξιολογήσει την ανταπόκριση του κοινού πριν προχωρήσει περαιτέρω.
Σημειώνουν επίσης ένα είδος ‘εφέτου του λευκού χαλύβδινου’, που είναι δύσκολο να αποφευχθεί σε πειραματικές συνθήκες, όπου κάποιοι συμμετέχοντες αισθάνθηκαν περιορισμένοι από τις πιθανές ασφαλιστικές επιπτώσεις της παρακολούθησης των βιομετρικών δεδομένων.
Συμπέρασμα
Ένα αξιοσημείωτο πλεονέκτημα σε ένα σύστημα σαν αυτό είναι ότι όλα τα μη τυπικά συσκευασμένα τεχνολογία που απαιτούνται για μια τέτοια προσέγγιση εξαφανίζονται完全 μετά τη χρήση τους. Δεν υπάρχουν υπολοιπόμενα πρόσθετα του προγράμματος περιήγησης για να αφαιρεθούν, ή να δημιουργήσουν αμφιβολίες στο μυαλό των συμμετεχόντων σχετικά με το εάν πρέπει να παραμείνουν στο σύστημά τους; και δεν υπάρχει ανάγκη να οδηγήσετε τους χρήστες μέσω της διαδικασίας εγκατάστασης (αν και το διαδικτυακό πλαίσιο απαιτεί ένα λεπτό ή δύο αρχικής συντονισμού από τον χρήστη), ή να πλοηγηθείτε στην πιθανότητα ότι οι χρήστες δεν έχουν επαρκείς άδειες για την εγκατάσταση τοπικού λογισμικού, συμπεριλαμβανομένων των πρόσθετων του προγράμματος περιήγησης και των επεκτάσεων.
Αν και οι αξιολογημένες κινήσεις του προσώπου και της ματιάς δεν είναι τόσο ακριβείς όσο θα μπορούσαν να είναι σε περιπτώσεις όπου θα χρησιμοποιούνταν αφιερωμένα τοπικά πλαίσια μηχανικής μάθησης (όπως η σειρά YOLO), αυτή η σχεδόν χωρίς τριβή προσέγγιση της ανταπόκρισης του κοινού παρέχει επαρκή ακρίβεια για την ανάλυση της γενικής γνώμης και της στάσης σε τυπικές συνθήκες βιντεοκονφεράνς. Πάνω από όλα, είναι πολύ φθηνό.
Δείτε το συνδεδεμένο βίντεο του έργου παρακάτω για περισσότερες λεπτομέρειες και παραδείγματα.
Πρώτη δημοσίευση 11ης Απριλίου 2022.












