Η γωνία του Anderson

Χρησιμοποιώντας Κριτικές για τη Δημιουργία ενός Συστήματος Σύστασης που Λειτουργεί

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Εάν έχετε αγοράσει ποτέ ένα προϊόν στο διαδίκτυο και θαυμάσετε την ανοησία και την μη εφαρμοσιμότητα των “σχετικών αντικειμένων” που στοιχειώνουν τη διαδικασία αγοράς και μετά την πώληση, ήδη καταλαβαίνετε ότι τα δημοφιλή και κυρίαρχα συστήματα σύστασης τείνουν να αποτυγχάνουν όσον αφορά την κατανόηση των σχέσεων μεταξύ προοπτικών αγορών.

Εάν αγοράσετε ένα απίθανο και σπάνιο αντικείμενο, όπως ένα φούρνο, οι συστάσεις για άλλα φούρνους είναι πιθανό να είναι περιττές, αν και τα χειρότερα συστήματα σύστασης αποτυγχάνουν να αναγνωρίσουν αυτό. Στις αρχές της δεκαετίας του 2000, για παράδειγμα, το σύστημα σύστασης του TiVO δημιούργησε μια πρώιμη διαμάχη σε αυτόν τον τομέα, αναθέτοντας τη διαπιστωμένη σεξουαλικότητα ενός χρήστη, ο οποίος στη συνέχεια προσπάθησε να “αναμασκουλιώσει” το προφίλ του χρήστη, επιλέγοντας πολεμικές ταινίες – μια груβή προσέγγιση για την αναθεώρηση του αλγορίθμου.

Χειρότερα, δεν χρειάζεται να αγοράσετε τίποτα στο (για παράδειγμα) Amazon, ή να αρχίσετε να παρακολουθείτε μια ταινία της οποίας η περιγραφή την ερευνάτε σε οποιαδήποτε μεγάλη πλατφόρμα streaming, για να ξεκινήσουν οι αλγόριθμοι σύστασης λιγότερο ενημερωμένοι να πηγαίνουν λάθος δρόμο; οι αναζητήσεις, οι παραμονές και οι κλικ στις σελίδες “λεπτομέρειες” είναι αρκετά, και αυτή η λιγοστή (και πιθανώς λανθασμένη) πληροφορία είναι πιθανό να διατηρηθεί σε μελλοντικές συνεδρίες περιήγησης στην πλατφόρμα.

Προσπαθώντας να κάνει ένα Σύστημα Σύστασης να Ξεχάσει

Μερικές φορές είναι δυνατό να επέμβει κανείς: το Netflix παρέχει ένα σύστημα “αντίχειρα επάνω/κάτω” που θα πρέπει, theo理, να βοηθήσει τους αλγόριθμους μάθησης με την μηχανή να αφαιρέσουν ορισμένες ενσωματωμένες έννοιες και λέξεις από το προφίλ συστάσεων σας (αν και η αποτελεσματικότητά του αμφισβητήθηκε, και παραμένει πολύ πιο εύκολο να εξελίξει ένα προσωποποιημένο σύστημα σύστασης από την αρχή παρά να αφαιρέσετε μη επιθυμητές οντολογίες), ενώ το Amazon σας επιτρέπει να αφαιρέσετε τίτλους από το ιστορικό του πελάτη, το οποίο θα πρέπει να υποβαθμίσει οποιαδήποτε μη ευπρόσδεκτα τοπικά που διείσδυσαν στις συστάσεις σας.

Το Hulu έχει μια παρόμοια λειτουργία, ενώ το HBO Max έχει παραιτηθεί εν μέρει από τα συστήματα σύστασης μόνο αλγορίθμου, αντιμετωπίζοντας τις τρέχουσες ελλείψεις τους.

Κανένα από αυτά τα σαφώς καταναλωτικά εμπειρία δεν αγγίζει ακόμη την ευρεία και αυξανόμενη κριτική των “παθητικών” συστημάτων σύστασης πλατφόρμας διαφήμισης (όπου σημαντικές αλλαγές έρχονται λόγω δημόσιας οργής), ή το incendiary θέμα των συστάσεων AI των κοινωνικών μέσων, όπου οι ιστοχώροι όπως YouTube, Twitter και Facebook συνεχίζουν να υποφέρουν κριτική για μη σχετικές ή ακόμη και βλαβερές συστάσεις.

Η μηχανή δεν φαίνεται να ξέρει τι θέλουμε, εκτός εάν θέλουμε το σχετικό αντικείμενο που εμφανίστηκε στη αναζήτησή μας – ακόμη και αν αυτό το αντικείμενο είναι ουσιαστικά ένα αντίγραφο ή εναλλακτικό του πρωταρχικού αντικειμένου που μπορεί να αγοράσαμε μόλις τώρα, παρά ένα πιθανό συμπληρωματικό ή βοηθητικό αγορά.

Ακριβείς Συστάσεις με Δεδομένα Κριτικών

Μια νέα συνεργασία ερευνών από την Κίνα και την Αυστραλία προσφέρει μια νέα μέθοδο για την αντιμετώπιση τέτοιων μη σχετικών συστάσεων, χρησιμοποιώντας εξωτερικές κριτικές χρηστών για να αποκτήσει μια καλύτερη κατανόηση των πραγματικών σχέσεων μεταξύ αντικειμένων σε μια συνεδρία αγοράς. Σε δοκιμές, η αρχιτεκτονική υπερέβη όλες τις τρέχουσες μεθόδους κράτους-of-the-τέχνη, προσφέροντας ελπίδα για συστήματα σύστασης που έχουν μια καλύτερη εσωτερική χάρτη των εξαρτήσεων των αντικειμένων:

RI-GNN outperforms major competitors in terms of accuracy of relationships between items, performing best on sessions with more than five items. The system was tested against the Pet Supplies and Movies and TV datasets from Amazon Review Data (2018).  Source: https://arxiv.org/pdf/2201.12532.pdf

RI-GNN outperforms major competitors in terms of accuracy of relationships between items, performing best on sessions with more than five items. The system was tested against the Pet Supplies and Movies and TV datasets from Amazon Review Data (2018).  Source: https://arxiv.org/pdf/2201.12532.pdf

Για να ξεκινήσει, το έργο αντιμετωπίζει την αξιοσημείωτη πρόκληση της δημιουργίας συστάσεων ακόμη και σε ανώνυμες συνεδρίες, όπου το σύστημα σύστασης δεν έχει πρόσβαση σε λεπτομέρειες που συμβάλλουν από τον χρήστη, όπως ιστορικό αγορών ή οι δικές του online κριτικές προηγούμενων αγορών.

Το νέο έγγραφο ονομάζεται Rethinking Adjacent Dependency in Session-based Recommendations, και προέρχεται από ερευνητές στο Qilu University of Technology και το Beijing Institute of Technology στην Κίνα, RMIT University στο Melbourne, και το Australian Artificial Intelligence Institute στο University of Technology Sydney.

Τι Ερχόμενο;

Η βασική εργασία των συστάσεων με βάση τη συνεδρία (SBR) είναι να καθορίσει το “επόμενο” αντικείμενο από το τρέχον αντικείμενο, με βάση την υπολογισμένη σχέση του με το τρέχον αντικείμενο. Σε πρακτικούς όρους, αυτό θα μπορούσε να εκφραστεί ως μια λίστα “Σχετικών αντικειμένων” στη σελίδα ενός αντικειμένου σε einen εμπορικό ιστότοπο.

Εάν αγοράσετε μια κλουβί πουλιού, τι άλλο είναι πιθανό να χρειαστείτε; Λίγο-πολύ, θα χρειαστείτε ένα πουλί για να το βάλει μέσα – αυτό είναι ένα αληθινό εξάρτημα. Ωστόσο, το κλουβί πουλιού εμφανίζεται στην οντολογία καταστήματα κατοικίδιων, όπου τα πουλιά δεν πωλούνται. Παρόλα αυτά, το καταστήματα τροφής για γάτες βρίσκεται στην ίδια οντολογία, αν και η προσθήκη ενός μπολ τροφής για γάτες ως einer συσχετισμένης σύστασης για ένα προϊόν κλουβιού πουλιού είναι ένα ψευδές εξάρτημα – μια λανθασμένη και παραπλανητική σύνδεση.

From the paper: true and false relationships between several items, visualized on the right as an inter-item graph.

From the paper: true and false relationships between several items, visualized on the right as an inter-item graph.

Όπως συμβαίνει τόσο συχνά στις αρχιτεκτονικές της μηχανικής μάθησης, είναι μια πρόκληση να πείσουν ένα σύστημα σύστασης ότι ένα “μακρινό” αντικείμενο (πουλί δεν εμφανίζεται καθόλου στα προϊόντα κατοικίδιων) μπορεί να έχει μια εγγενή και σημαντική σχέση με ένα αντικείμενο, ενώ τα αντικείμενα που βρίσκονται στην ίδια κατηγορία και πολύ κοντά στη λειτουργία και την κεντρική έννοια (όπως μπολ τροφής για γάτες) μπορεί να είναι ορθογώνιο ή απευθείας αντίθετο στο αγορά που εξετάζεται.

Ο μόνος τρόπος για να δημιουργηθούν αυτές οι αντιστοιχίες μεταξύ “μη liền接” αντικειμένων είναι να αναθέσουν το πρόβλημα,既然 οι σχέσεις που αναζητούνται είναι ένα πρόσωπο της ανθρώπινης εμπειρίας, δεν μπορούν να υπολογιστούν προγραμματικά και είναι πιθανό να ξεπεράσουν το οικονομικά βιώσιμο πεδίο των συμβατικών προσεγγίσεων για την ετικέτα του συνόλου δεδομένων, όπως Amazon Mechanical Turk.

Επομένως, οι ερευνητές έχουν χρησιμοποιήσει μηχανισμούς Επεξεργασίας Φυσικής Γλώσσας (NLP) για να εξάγουν σημαντικές λέξεις από κριτικές για ένα προϊόν και έχουν χρησιμοποιήσει συχνότητες από αυτές τις αναλύσεις για να δημιουργήσουν ενσωματώσεις ικανές να “ταιριάζουν” φαινομενικά μακρινά αντικείμενα.

The architecture for Review-refined Inter-item Graph Neural Network (RI-GNN).

The architecture for Review-refined Inter-item Graph Neural Network (RI-GNN).

Αρχιτεκτονική και Δεδομένα

Όπως σημειώνει η νέα εργασία, προηγούμενες εργασίες του ίδιου είδους έχουν εκμεταλλευτεί το ιστορικό κριτικών του συνδεδεμένου χρήστη για να παρέχουν πρωτογενείς αντιστοιχίες. DeepCONN και RNS και οι δύο χρησιμοποιήθηκαν αυτήν την προσέγγιση. Ωστόσο, αυτό αγνοεί το γεγονός ότι ένας χρήστης μπορεί να μην έχει γράψει keine κριτικές ή keine κριτικές που αφορούν ένα συγκεκριμένο αντικείμενο που είναι “εκτός εύρους” των συνηθισμένων αγοραστικών του συνηθειών. Επιπλέον, αυτή είναι μια “λευκή κουτί” προσέγγιση,既然 υποθέτει ότι ο χρήστης έχει ήδη αλληλεπιδράσει αρκετά με το εξοχικό να δημιουργήσει ένα λογαριασμό και να συνδεθεί.

Το επεκταμένο Γραφικό Νευρωνικό Δίκτυο (GNN) που προτείνεται από τους ερευνητές λαμβάνει μια πιο προφητική προσέγγιση, εξάγοντας αληθινές εξαρτήσεις a priori, ώστε, προφανώς, ο ανώνυμος και αποσυνδεδεμένος χρήστης να μπορεί να βιώσει πιο σχετικές συστάσεις με ελάχιστη εισαγωγή απαιτούμενη.

Το σύστημα που ενισχύεται από κριτικές ονομάζεται Review-refined Inter-item Graph Neural Network (RI-GNN). Οι ερευνητές έχουν δοκιμάσει αυτό το σύστημα έναντι δύο συνόλων δεδομένων από το Amazon, Καταστήματα κατοικίδιων και Ταινίες και Τηλεόραση. Αν και αυτό λύνει το πρόβλημα της διαθεσιμότητας κριτικών με έναν αρκετά όμορφο τρόπο, μια εφαρμογή στο πεδίο θα χρειαζόταν να εντοπίσει και να αποσπάσει μια κατάλληλη βάση δεδομένων κριτικών. Một τέτοια πηγή δεδομένων θα μπορούσε, σε θεωρία, να είναι οτιδήποτε από αναρτήσεις σε ένα κοινωνικό δίκτυο μέχρι απαντήσεις στο Quora.

Οι υψηλού επιπέδου χαρτογραφήσεις σχέσεων αυτού του είδους θα ήταν, επιπλέον, πολύτιμες σε eine σειρά εφαρμογών της μηχανικής μάθησης πέρα από τα συστήματα σύστασης. Πολλά τρέχοντα έργα είναι εγκλωβισμένα λόγω έλλειψης χαρτογραφήσεων inter και intra-τομέα λόγω περιορισμένων κεφαλαίων και πεδίου, ενώ η εμπορική ώθηση ενός πραγματικά γνώσιμου και crowdsourced συστήματος σύστασης ηλεκτρονικού εμπορίου θα μπορούσε να γεμίσει αυτό το κενό.

Μέτρα και Δοκιμές

Οι συγγραφείς έχουν δοκιμάσει το RI-GNN έναντι δύο εκδόσεων κάθε συνόλου δεδομένων, κάθε एक από τα οποία αποτελείται από το ιστορικό αγορών του χρήστη και γενικές κριτικές του προϊόντος. Τα αντικείμενα που εμφανίζονται λιγότερο από πέντε φορές αφαιρέθηκαν, και το ιστορικό του χρήστη χωρίστηκε σε μονάδες μιας εβδομάδας. Η πρώτη έκδοση του συνόλου δεδομένων περιλάμβανε όλες τις συνεδρίες με περισσότερα από ένα αντικείμενο, και η δεύτερη όλες τις συνεδρίες με πάνω από πέντε αντικείμενα.

Το έργο χρησιμοποιούσε P@K (Ακρίβεια) και MRR@K (Μέσος Αντιστρόφως Αναλογικός Κατατάκτης) για τα μέτρα αξιολόγησής του. Τα αντίπαλα αρχιτεκτονικά δοκιμάστηκαν ήταν: S-KNN; GRU4Rec; S-POP; STAMP; BERT4Rec; DHCN; GCE-GNN; SR-GNN; και NARM.

Το πλαίσιο εκπαιδεύτηκε σε δόσεις των 100 στο Adam με ρυθμό μάθησης 0,001, με τον αριθμό των θεμάτων οριστεί σε 24 και 20, αντίστοιχα, για Καταστήματα κατοικίδιων και Ταινίες και Τηλεόραση.

 

 

Πρώτη δημοσίευση 1ης Φεβρουαρίου 2022.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai