Η γωνία του Anderson

Ένας ανιχνευτής ψευδών βασισμένος στο AI για συνομιλίες σε κέντρα εξυπηρέτησης

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Ερευνητές στη Γερμανία έχουν χρησιμοποιήσει τη μάθηση με μηχανές για να δημιουργήσουν ένα σύστημα ανάλυσης ήχου που προορίζεται κυρίως να λειτουργήσει ως ανιχνευτής ψευδών βασισμένος στο AI για πελάτες σε ήχους επικοινωνιών με το προσωπικό των κέντρων εξυπηρέτησης και υποστήριξης.

Το σύστημα χρησιμοποιεί ένα ειδικά δημιουργημένο σύνολο δεδομένων ηχογραφήσεων από 40 μαθητές και καθηγητές κατά τη διάρκεια συζητήσεων για διαφιλονικούμενα θέματα, συμπεριλαμβανομένης της ηθικής της θανατικής ποινής και των διδάκτρων. Το μοντέλο εκπαιδεύτηκε σε μια αρχιτεκτονική που χρησιμοποιεί Συγκλιτικές Νευρωνικές Δίκτυα (CNN) και Μακροχρόνια Μνήμη (LSTM) και πέτυχε ένα αναφερόμενο ποσοστό ακρίβειας του 98%.

Αν και ο δηλωμένος σκοπός του έργου αναφέρει επικοινωνίες πελατών, οι ερευνητές παραδέχονται ότι λειτουργεί αποτελεσματικά ως γενικός ανιχνευτής ψευδών:

‘Τα αποτελέσματα είναι εφαρμόσιμα σε eine ευρεία γκάμα διαδικασιών εξυπηρέτησης και συγκεκριμένα χρήσιμα για όλες τις αλληλεπιδράσεις πελατών που λαμβάνουν χώρα μέσω τηλεφώνου. Ο αλγόριθμος που παρουσιάζεται μπορεί να εφαρμοστεί σε οποιαδήποτε κατάσταση όπου είναι χρήσιμο για τον πράκτορα να γνωρίζει εάν ο πελάτης μιλάει με την πίστη του.

‘Αυτό θα μπορούσε, για παράδειγμα, να οδηγήσει σε μια μείωση των αμφιβόλου αξιοπιστίας ασφαλιστικών αξιώσεων ή ψευδών δηλώσεων σε συνεντεύξεις εργασίας. Αυτό δεν θα μειώσει μόνο τις λειτουργικές απώλειες για τις εταιρείες παροχής υπηρεσιών, αλλά επίσης θα ενθαρρύνει τους πελάτες να είναι πιο αληθινόι.’

Δημιουργία Δεδομένων

Στην απουσία ενός κατάλληλου δημόσια διαθέσιμου συνόλου δεδομένων στη γερμανική γλώσσα, οι ερευνητές – από το Πανεπιστήμιο Εφαρμοσμένων Επιστημών Neu-Ulm (HNU) – δημιούργησαν το δικό τους υλικό. Φυλλάδια κολλήθηκαν στο πανεπιστήμιο και σε τοπικά σχολεία, με 40 εθελοντές που επιλέχθηκαν με ελάχιστη ηλικία 16 ετών. Οι εθελοντές αμείβονταν με ένα voucher 10 ευρώ από το Amazon.

Οι συνεδρίες διεξήχθησαν με ένα μοντέλο συζήτησης που σχεδιάστηκε για να πολωρίσει την γνώμη και να προκαλέσει ισχυρές αντιδράσεις γύρω από incendiary θέματα, effectively μοντελώντας το στρες που μπορεί να συμβεί σε προβληματικές συνομιλίες πελατών στο τηλέφωνο.

Τα θέματα στα οποία οι εθελοντές έπρεπε να μιλήσουν ελεύθερα για τρία λεπτά σε δημόσιο χώρο ήταν:

– Πρέπει να επαναφερθούν η θανατική ποινή και οι δημόσιες εκτελέσεις στη Γερμανία;
– Πρέπει να χρεώνονται διδάκτρια που καλύπτουν το κόστος στη Γερμανία;
– Πρέπει να νομιμοποιηθεί η χρήση σκληρών ναρκωτικών όπως η ηρωίνη και η κρυσταλλική μεθαμφεταμίνη στη Γερμανία;
– Πρέπει να απαγορευτούν οι αλυσίδες εστιατορίων που σερβίρουν άγεια γρήγορη τροφή, όπως η McDonald’s ή η Burger King, στη Γερμανία;

Προεπεξεργασία

Το έργο ευνοούσε την ανάλυση των ακουστικών χαρακτηριστικών του λόγου σε μια προσέγγιση Αυτόματης Αναγνώρισης Λόγου (ASR) έναντι μιας προσέγγισης NLP (όπου ο λόγος αναλύεται σε γλωσσικό επίπεδο και η ‘θερμοκρασία’ της συζήτησης推測εται απευθείας από τη χρήση της γλώσσας).

Τα προ-επεξεργασμένα δείγματα αναλύθηκαν αρχικά μέσω των συντελεστών Mel-συχνότητας Cepstral (MFCC), μια αξιόπιστη, παλαιότερη μέθοδος που είναι ακόμη πολύ δημοφιλής στην ανάλυση λόγου. Από τότε που η μέθοδος προτάθηκε για πρώτη φορά το 1980, είναι αξιοσημείωτα φειδωλή με τους πόρους υπολογισμού όσον αφορά την αναγνώριση επαναλαμβανόμενων μοτίβων στο λόγο και είναι ανθεκτική σε διάφορα επίπεδα ποιότητας καταγραφής ήχου. Επειδή οι συνεδρίες διεξήχθησαν μέσω πλατφορμών VOIP σε συνθήκες lockdown τον Δεκέμβριο του 2020, ήταν σημαντικό να υπάρχει ένα πλαίσιο καταγραφής που θα μπορούσε να λάβει υπόψη την κακή ποιότητα ήχου όταν ήταν απαραίτητο.

Είναι ενδιαφέρον να σημειωθεί ότι οι δύο προαναφερθείσες τεχνικές περιορισμοί (περιορισμένοι πόροι CPU στις αρχές της δεκαετίας του 1980 και οι εκκεντρικότητες της συνδεσιμότητας VOIP σε ένα περιβάλλον δικτύου) συνδυάζονται εδώ για να δημιουργήσουν ένα ‘τεχνικά αραιο’ μοντέλο που είναι (φαινομενικά) ασυνήθιστα ανθεκτικό στην απουσία ιδανικών συνθηκών εργασίας και υψηλού επιπέδου πόρων – μιμούμενο το στόχο για τον αλγόριθμο.

Εκπαίδευση, Αποτελέσματα και Περιορισμοί

Κατά τη διάρκεια της εκπαίδευσης, τα εξαγόμενα διανύσματα χαρακτηριστικών περνάουν σε ένα χρόνο-διανεμημένο συνθετικό νευρωνικό δίκτυο, πεπλατυνόμενο και στη συνέχεια περνάει σε ένα στρώμα LSTM.

Αρχιτεκτονική της διαδικασίας εκπαίδευσης για τον ανιχνευτή αλήθειας AI. Πηγή: https://arxiv.org/ftp/arxiv/papers/2107/2107.11175.pdf

Αρχιτεκτονική της διαδικασίας εκπαίδευσης για τον ανιχνευτή αλήθειας AI. Πηγή: https://arxiv.org/ftp/arxiv/papers/2107/2107.11175.pdf

Τέλος, όλα τα νευρώνια συνδέονται μεταξύ τους για να παράγουν μια δυαδική πρόβλεψη για το αν ο ομιλητής λέει πράγματα που πιστεύει ότι είναι αληθινά.

Σε δοκιμές μετά την εκπαίδευση, το σύστημα πέτυχε ένα επίπεδο ακρίβειας μέχρι 98,91% όσον αφορά την ανίχνευση προθέσεων (όπου το ομιλούμενο περιεχόμενο μπορεί να μην αντανακλά την πρόθεση). Οι ερευνητές θεωρούν ότι το έργο αποδεικνύει εμπειρικά την ανίχνευση πίστης με βάση τα μοτίβα της φωνής και ότι αυτό μπορεί να επιτευχθεί χωρίς την NLP-στυλ αποσύνθεση της γλώσσας.

Όσον αφορά τους περιορισμούς, οι ερευνητές παραδέχονται ότι το δείγμα δοκιμής είναι μικρό. Αν και η εργασία δεν αναφέρει ρητά, τα δεδομένα χαμηλής όγκου δοκιμής μπορούν να μειώσουν την μεταγενέστερη εφαρμοσιμότητα σε περίπτωση που οι υποθέσεις, οι αρχιτεκτονικές λειτουργίες και η γενική διαδικασία εκπαίδευσης είναι υπερ-προσαρμοσμένες στα δεδομένα. Η εργασία σημειώνει ότι έξι από τα οκτώ μοντέλα που κατασκευάστηκαν καθ’ όλη τη διάρκεια του έργου ήταν υπερ-προσαρμοσμένα σε κάποιο σημείο της διαδικασίας μάθησης και ότι υπάρχει περαιτέρω εργασία να γίνει στην γενίκευση της εφαρμοσιμότητας των παραμέτρων που ορίστηκαν για το μοντέλο.

Επιπλέον, η έρευνα αυτού του είδους πρέπει να λάβει υπόψη τις εθνικές ιδιαιτερότητες και η εργασία σημειώνει ότι οι Γερμανοί συμμετέχοντες που ενεπλάκησαν στη δημιουργία των δεδομένων μπορεί να έχουν μοτίβα επικοινωνίας που δεν είναι απευθείας αναπαραγώγιμα σε διαφορετικές κουλτούρες – μια κατάσταση που θα μπορούσε να προκύψει σε οποιαδήποτε τέτοια μελέτη σε οποιαδήποτε χώρα.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]