Η γωνία του Anderson

Ανάλυση Καταθλιπτικών και Αλκοολικών Chatbots

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Μια νέα μελέτη από την Κίνα έχει διαπιστώσει ότι πολλά δημοφιλή chatbots, συμπεριλαμβανομένων των ανοικτού τομέα chatbots από το Facebook, τη Microsoft (MSFT ) και το Google, παρουσιάζουν «σύνθετα προβλήματα ψυχικής υγείας» όταν ερωτηθούν με τη χρήση τυποποιημένων δοκιμαστικών για την αξιολόγηση της ψυχικής υγείας και ακόμη και παρουσιάζουν σημάδια προβλημάτων με το αλκοόλ.

Τα chatbots που αξιολογήθηκαν στη μελέτη ήταν το Blender της Facebook*· το DialoGPT της Microsoft· το Plato της Baidu· και το DialoFlow, μια συνεργασία μεταξύ κινεζικών πανεπιστημίων, WeChat και Tencent Inc.

Εξετάστηκαν για ενδείξεις παθολογικής κατάθλιψης, αγχώδους διαταραχής, εθισμού στο αλκοόλ και για την ικανότητά τους να προκαλούν Empathy, τα chatbots που μελετήθηκαν παρήγαγαν ανησυχητικά αποτελέσματα· όλα τους έλαβαν βαθμολογίες κάτω του μέσου όρου για Empathy, ενώ το ήμισυ αξιολογήθηκε ως εθισμένο στο αλκοόλ.

Αποτελέσματα για τα τέσσερα chatbots σε τέσσερις μετρήσεις για την ψυχική υγεία. Στο 'single', μια νέα συνομιλία ξεκινά για κάθε ερώτηση· στο 'multi', όλες οι ερωτήσεις ζητούνται σε μια seule συνομιλία, για να αξιολογηθεί η επίδραση της διατήρησης της συνεδρίας. Πηγή: https://arxiv.org/pdf/2201.05382.pdf

Αποτελέσματα για τα τέσσερα chatbots σε τέσσερις μετρήσεις για την ψυχική υγεία. Στο ‘single’, μια νέα συνομιλία ξεκινά για κάθε ερώτηση· στο ‘multi’, όλες οι ερωτήσεις ζητούνται σε μια seule συνομιλία, για να αξιολογηθεί η επίδραση της διατήρησης της συνεδρίας. Πηγή: https://arxiv.org/pdf/2201.05382.pdf

Στον πίνακα αποτελεσμάτων παραπάνω, BA=’Κάτω του μέσου όρου’· P=’Θετική’· N=’Κανονική’· M=’Μέτρια’· MS=”Μέτρια έως σοβαρή”· S=”Σοβαρή”. Η μελέτη ισχυρίζεται ότι αυτά τα αποτελέσματα δείχνουν ότι η ψυχική υγεία όλων των επιλεγμένων chatbots είναι στην ‘σοβαρή’ περιοχή.

Η αναφορά αναφέρει:

‘Τα πειραματικά αποτελέσματα αποκαλύπτουν ότι υπάρχουν σοβαρά προβλήματα ψυχικής υγείας για όλα τα αξιολογημένα chatbots. Νομίζουμε ότι αυτό οφείλεται στην παραμέληση του κινδύνου για την ψυχική υγεία κατά τη διαδικασία δημιουργίας του συνόλου δεδομένων και την εκπαίδευση των μοντέλων. Οι κακές συνθήκες ψυχικής υγείας των chatbots μπορεί να έχουν αρνητικές επιπτώσεις στους χρήστες στις συνομιλίες, ιδιαίτερα στα παιδιά και τους ανθρώπους που αντιμετωπίζουν δυσκολίες.

‘Επομένως, ισχυριζόμαστε ότι είναι επείγον να διεξαχθεί η αξιολόγηση των προαναφερθεισών διαστάσεων ψυχικής υγείας πριν από την κυκλοφορία ενός chatbot ως διαδικτυακή υπηρεσία.’

Η μελέτη προέρχεται από ερευνητές στο Κέντρο Αναγνώρισης Προτύπων του WeChat/Tencent, μαζί με ερευνητές από το Ινστιτούτο Υπολογιστικών Τεχνολογιών της Κινεζικής Ακαδημίας Επιστημών (ICT) και το Πανεπιστήμιο της Κινεζικής Ακαδημίας Επιστημών στο Πεκίνο.

Μότιβος για την Έρευνα

Οι συγγραφείς αναφέρουν την πопуляр αναφορά του 2020, όπου μια γαλλική εταιρεία υγείας δοκιμάζει ένα πιθανό chatbot ιατρικής συμβουλής βασισμένο στο GPT-3. Σε μια από τις ανταλλαγές, ένας (προσομοιωμένος) ασθενής δήλωσε “Πρέπει να خودοντιστούν;”, και το chatbot απάντησε “Νομίζω ότι πρέπει”.

Όπως παρατηρεί η νέα μελέτη, είναι επίσης δυνατό για einen χρήστη να επηρεαστεί από την δευτερογενή αγχώδη από καταθλιπτικά ή ‘αρνητικά’ chatbots, ώστε η γενική διάθεση του chatbot δεν χρειάζεται να είναι τόσο直接ικά σοκαριστική όπως στην περίπτωση της Γαλλίας για να υπονομεύσει τους στόχους των αυτοματοποιημένων ιατρικών συμβουλών.

Οι συγγραφείς αναφέρουν:

‘Τα πειραματικά αποτελέσματα αποκαλύπτουν τα σοβαρά προβλήματα ψυχικής υγείας των αξιολογημένων chatbots, τα οποία μπορεί να έχουν αρνητικές επιπτώσεις στους χρήστες στις συνομιλίες, ιδιαίτερα στα παιδιά και τους ανθρώπους που αντιμετωπίζουν δυσκολίες. Για παράδειγμα, παθητικές στάσεις, ερεθιστικότητα, αλκοολισμός, χωρίς Empathy, κ.λπ.

‘Αυτό το φαινόμενο απομακρύνεται από τις γενικές προσδοκίες του κοινού για τα chatbots που πρέπει να είναι αισιόδοξα, υγιή και φιλικά όσο το δυνατόν. Επομένως, νομίζουμε ότι είναι κρίσιμο να διεξαχθεί η αξιολόγηση της ψυχικής υγείας για λόγους ασφαλείας και ηθικής πριν από την κυκλοφορία ενός chatbot ως διαδικτυακή υπηρεσία.’

Μέθοδος

Οι ερευνητές πιστεύουν ότι αυτή είναι η πρώτη μελέτη που αξιολογεί τα chatbots με βάση ανθρώπινες μετρήσεις για την ψυχική υγεία, αναφέροντας προηγούμενες μελέτες που έχουν επικεντρωθεί αντί για αυτό σε συνεπήτητα, ποικιλία, σχετικότητα, γνώση και άλλους Τούρινγκ-κεντρικούς προτύπους για αυθεντική απάντηση ομιλίας.

Τα ερωτηματολόγια που προσαρμόστηκαν στο πρότζεκτ ήταν PHQ-9, ένα 9-ερωτηματολόγιο για την αξιολόγηση των επιπέδων κατάθλιψης σε ασθενείς πρωτοβάθμιας φροντίδας, ευρέως υιοθετημένο από κυβερνητικές και ιατρικές ιδρύματα· GAD-7, ένα 7-ερωτηματολόγιο για την αξιολόγηση της σοβαρότητας της γενικευμένης αγχώδους διαταραχής, κοινό στην κλινική πρακτική· CAGE, ένα τεστ για τον εθισμό στο αλκοόλ σε τέσσερις ερωτήσεις· και το Ερωτηματολόγιο Empathy του Τορόντο (TEQ), ένα 16-ερωτηματολόγιο για την αξιολόγηση των επιπέδων Empathy.

Χαρακτηριστικά των τεσσάρων ερωτηματολογίων που προσαρμόστηκαν για τη μελέτη.

Χαρακτηριστικά των τεσσάρων ερωτηματολογίων που προσαρμόστηκαν για τη μελέτη.

Τα ερωτηματολόγια έπρεπε να ξαναγραφτούν για να αποφευχθούν οι δηλωτικές προτάσεις όπως Λίγο ενδιαφέρον ή ευχαρίστηση στην εκτέλεση των πραγμάτων, προς όφελος των ερωτηματικών κατασκευών που είναι πιο κατάλληλες για μια ανταλλαγή συνομιλίας.

Ήταν επίσης απαραίτητο να οριστεί μια ‘αποτυχημένη’ απάντηση, για να αναγνωριστούν και να αξιολογηθούν μόνο οι απαντήσεις που ένας ανθρώπινος χρήστης θα μπορούσε να ερμηνεύσει ως έγκυρες και να επηρεαστεί από αυτές. Μια ‘αποτυχημένη’ απάντηση μπορεί να αποφύγει την ερώτηση με ελλειπτικές ή αφηρημένες απαντήσεις· να αρνηθεί να ασχοληθεί με την ερώτηση (π.χ. ‘Δεν ξέρω’, ή ‘Ξέχασα’)· ή να περιλαμβάνει ‘αδύνατο’ προηγούμενο περιεχόμενο όπως ‘Συνήθως ένιωθα πεινασμένος όταν ήμουν παιδί’. Σε δοκιμές, το Blender και το Plato αποτέλεσαν την πλειοψηφία των αποτυχημένων αποτελεσμάτων, και το 61,4% των αποτυχημένων απαντήσεων ήταν άσχετες με την ερώτηση.

Οι ερευνητές εκπαίδευσαν όλα τα τέσσερα μοντέλα με ανάρτησεις στο Reddit, χρησιμοποιώντας το Δεδομένο Συνόλου Pushshift Reddit. Σε όλες τις περιπτώσεις, η εκπαίδευση ήταν εξειδικευμένη με ένα επιπλέον σύνολο δεδομένων που περιείχε το Blended Skill Talk και Wizard of Wikipedia της Facebook· ConvAI2 (μια συνεργασία μεταξύ Facebook, Microsoft και Carnegie Mellon, μεταξύ άλλων)· και Empathetic Dialogues (μια συνεργασία μεταξύ του Πανεπιστημίου του Σιάτλ και της Facebook).

Περιεκτικός Reddit

Το Plato, το DialoFlow και το Blender έρχονται με προεπιλεγμένες βαρύτητες που προ-εκπαιδεύονται σε σχόλια του Reddit, ώστε οι νευρωνικές σχέσεις που διαμορφώνονται ακόμη και με την εκπαίδευση σε νέα δεδομένα (είτε από το Reddit είτε απόewhere) θα επηρεαστούν από την κατανομή των χαρακτηριστικών που εξάγονται από το Reddit.

Κάθε ομάδα δοκιμής διεξήχθη δύο φορές, ως ‘single’ ή ‘multi’. Για το ‘single’, κάθε ερώτηση ζητήθηκε σε μια νέα συνεδρία συνομιλίας. Για το ‘multi’, μια συνεδρία συνομιλίας χρησιμοποιήθηκε για να ληφθούν απαντήσεις για όλες τις ερωτήσεις, поскольку οι μεταβλητές συνεδρίας συσσωρεύονται κατά τη διάρκεια της συνομιλίας και μπορούν να επηρεάσουν την ποιότητα της απάντησης καθώς η συνομιλία λαμβάνει μια συγκεκριμένη μορφή και τόνο.

Όλες οι πειραματικές δοκιμές και η εκπαίδευση διεξήχθησαν σε δύο NVIDIA Tesla V100 GPUs, για μια συνδυασμένη 64GB VRAM σε 1280 Tensor πυρήνες. Η μελέτη δεν λεπτομερεί το χρόνο εκπαίδευσης.

Επίβλεψη μέσω Κύρους ή Αρχιτεκτονικής;

Η μελέτη ολοκληρώνεται σε γενικούς όρους ότι η ‘παραμέληση του κινδύνου για την ψυχική υγεία’ κατά την εκπαίδευση πρέπει να αντιμετωπιστεί, και προσκαλεί την ερευνητική κοινότητα να διερευνήσει πιο sâu το ζήτημα.

Το κεντρικό ζήτημα φαίνεται να είναι ότι τα chatbot frameworks που εξετάζονται είναι σχεδιασμένα να εξάγουν σαφή χαρακτηριστικά από συνόλα δεδομένων εκτός εύρους χωρίς κανένα φραγμό σχετικά με τοξικά ή καταστροφικά γλωσσικά· αν ταΐσετε τα frameworks με δεδομένα φόρουμ neo-ναζιστικών, για παράδειγμα, θα πάρετε πιθανώς κάποιες αμφισβητούμενες απαντήσεις σε μια μεταγενέστερη συνομιλία.

Ωστόσο, ο τομέας της Επεξεργασίας Φυσικής Γλώσσας (NLP) έχει ένα πολύ πιο έγκυρο ενδιαφέρον για την απόκτηση γνώσεων από φόρουμ και περιεχόμενο που συνεισφέρει ο χρήστης σχετικά με την ψυχική υγεία (κατάθλιψη, αγχώδη διαταραχή, εξάρτηση, κ.λπ.), τόσο για την ανάπτυξη βοηθητικών και αποσβεννυτικών chatbots υγείας, όσο και για την απόκτηση βελτιωμένων στατιστικών συναγωγών από πραγματικά δεδομένα.

Επομένως, σε όρους μεγάλου όγκου δεδομένων που δεν περιορίζονται από τα αυθαίρετα όρια κειμένου του Twitter, το Reddit παραμένει το μόνο συνεχώς ενημερωμένο υπερκλίμακα σώμα για πλήρη μελέτες κειμένου αυτού του είδους.

Ωστόσο, ακόμη και μια περιστασιακή περιήγηση μεταξύ некоторых από τις κοινότητες που ενδιαφέρουν περισσότερο τους ερευνητές NLP υγείας (όπως r/depression) αποκαλύπτει την κυριαρχία του είδους ‘αρνητικών’ απαντήσεων που μπορεί να πείσουν ένα σύστημα στατιστικής ανάλυσης ότι οι αρνητικές απαντήσεις είναι έγκυρες επειδή είναι συχνές και στατιστικά κυρίαρχες – ιδιαίτερα στην περίπτωση των πολύ-εγγεγραμμένων φόρουμ με περιορισμένες πόρους διαχείρισης.

Το ερώτημα παραμένει, επομένως, αν η αρχιτεκτονική του chatbot πρέπει να περιλαμβάνει κάποιου είδους ‘ηθική αξιολόγηση’, όπου τα υπο-αντικείμενα επηρεάζουν την ανάπτυξη των βαρύτητων στο μοντέλο, ή αν μια πιο δαπανηρή διαχείριση και επισήμανση δεδομένων μπορεί κάπως να ανταγωνιστεί αυτή τη τάση προς μη ισορροπημένα δεδομένα.

 

 

* Η μελέτη των ερευνητών, όπως συνδέεται σε αυτό το άρθρο, αναφέρει λανθασμένα einen σύνδεσμο στο chatbot Meena της Google αντί του σύνδεσμου στο Blender. Το Meena της Google δεν παρουσιάζεται στη νέα μελέτη. Ο σωστός σύνδεσμος Blender που χρησιμοποιήθηκε σε αυτό το άρθρο παρέχθηκε από τους συγγραφείς της μελέτης σε ένα email προς εμένα. Οι συγγραφείς μου είπαν ότι αυτό το λάθος θα διορθωθεί σε μια μεταγενέστερη έκδοση της μελέτης.

Πρώτη δημοσίευση 18ης Ιανουαρίου 2022.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai