Συνεντεύξεις
Andrea Vattani, Συνιδρυτής & Επικεφαλής Επιστήμονας στην Spiketrap – Σειρά Συνεντεύξεων

Ο Andrea Vattani είναι ο Συνιδρυτής & Επικεφαλής Επιστήμονας στην Spiketrap, μια εταιρεία που παρέχει υπηρεσίες”contextualization” για την κατανόηση του κοινού και της απόδοσης των μέσων για δημιουργούς, πλατφόρμες και εταιρείες. Το προπριεταίρεο Clair AI εξάγει το σήμα από το θόρυβο των μη δομημένων συνόλων δεδομένων, παρέχοντας απαράμιλλη σαφήνεια και контέκστο, ιδιαίτερα σε περιβάλλοντα υψηλής ταχύτητας στο διαδίκτυο.
Τι σας έκανε να ενδιαφερθείτε για την επιστήμη των υπολογιστών και την τεχνητή νοημοσύνη;
Ήταν ένας συνδυασμός τυχερών περιστάσεων. Εμφανίστηκα στο Πανεπιστήμιο της Ρώμης για να δώσω τις εξετάσεις εισαγωγής για το τμήμα Στατιστικής και έμεινα μια μέρα晚! Μου είπαν να申请 για το τμήμα Επιστήμης των Υπολογιστών και να μεταφερθώ πίσω στο τμήμα Στατιστικής μετά από ένα χρόνο. Πήγα στις εξετάσεις εισαγωγής για το τμήμα Επιστήμης των Υπολογιστών (που ήταν εκείνη την ημέρα!) και πέρασα… δεν μεταφέρθηκα ποτέ πίσω στο τμήμα Στατιστικής! Ο ενδιαφέρον μου για την τεχνητή νοημοσύνη ξεκίνησε όταν συνειδητοποίησα πώς οι υπολογιστές μπορούν να βοηθήσουν στην αυτοματοποίηση των πραγμάτων, και η τεχνητή νοημοσύνη είναι η τελική μηχανή αυτοματοποίησης. Επίσης, η φυσική γλώσσα και ο τρόπος που οι άνθρωποι τη χρησιμοποιούν έχουν πάντα ήταν ένα ενδιαφέρον μου: στο γυμνάσιο, σπούδαζα κλασικά studing αρχαία ελληνικά και λατινικά, που είναι πιθανότατα παρόμοιο με το πώς ένα μηχάνημα feels όταν του δίνεις μια ροή λέξεων.
Προηγουμένως εργαστήκατε ως Senior Lead Software Engineer στην Amazon (AMZN ) Goodreads, ποια ήταν κάποια από τα projects που δούλεψατε και ποια ήταν κάποια από τα βασικά συμπεράσματα από αυτή την εμπειρία;
Κατά τη διάρκεια της θητείας μου στη Goodreads, δούλεψα σε πολλά projects που αφορούσαν την ανίχνευση spam και την κλιμάκωση του μηχανισμού συστάσεων βιβλίων. Τα συμπεράσματα μου από αυτή την εμπειρία ήταν η importance της ορισμού μετρικών ML που ταιριάζουν με τους στόχους της επιχείρησης και των πελατών. Για παράδειγμα, οι μηχανισμοί συστάσεων έχουν υπάρξει για πολύ καιρό. Θυμάστε το διαγωνισμό “Netflix (NFLX ) Prize” το 2009 για να βρείτε καλύτερες συστάσεις ταινιών; Κάποιες έρευνες από τις κορυφαίες λύσεις πρότειναν ότι η πιθανότητα να δείτε μια ταινία δεν ορίζεται τόσο από το αν θα σας αρέσει ή όχι, αλλά κυρίως αν είναι παρόμοια με τα ενδιαφέροντά σας. Αυτό μπορεί να λειτουργήσει για ταινίες,既然 είναι μια σύντομη δέσμευση 90 λεπτών, αλλά για βιβλία δεν είναι το ίδιο. Η ενοποίηση του σωστού στόχου στα μετρικά είναι κρίσιμη.
Η έρευνά σας έχει δημοσιευθεί σε πολλά περιοδικά, ποιο είναι η πιο σημαντική εργασία σας μέχρι τώρα;
Κατά τη διάρκεια του διδακτορικού μου, είχα την τύχη να συνεργαστώ με πολλούς ερευνητές από διάφορους τομείς, συμπεριλαμβανομένης της μηχανικής μάθησης, της ανάλυσης μεγάλων δεδομένων, της κοινωνικής ανάλυσης δεδομένων και της θεωρίας παιγνίων. Μια εργασία που μου αρέσει για την απλότητά της και την εφαρμοσιμότητά της είναι η “Scalable K-Means++”: η K-Means++ είναι μια πανταχού παρούσα μη επιτηρούμενη μέθοδος ομαδοποίησης για να χωρίσετε ένα σύνολο δεδομένων σε K συνεκτικά ομάδες. Αυτό γίνεται προσθέτοντας μια ομάδα κάθε φορά, οπότε όταν έχετε πολλά δεδομένα και ομάδες, γίνεται πολύ αργή. Σε αυτή την εργασία δείχνουμε πώς μπορείτε να επιτύχετε το ίδιο, αν όχι καλύτερο, αποτέλεσμα με την παραλληλοποίηση της μεθόδου. Η μεθοδολογία μας είναι εξαιρετικά απλή και έχει υλοποιηθεί σε πολλές βιβλιοθήκες μηχανικής μάθησης.
Μπορείτε να μοιραστείτε την ιστορία πίσω από την Spiketrap;
Μετά τη δουλειά μου στη Goodreads, εγώ και οι συνιδρυτές της Spiketrap, Kieran και Virgilio, καταλάβαμε ότι υπήρχε ένα κενό στην αγορά για την πρόσβαση σε προηγμένα insights για τα brands από νησιωτικές κοινωνικές πλατφόρμες. Με την εφαρμογή τεχνολογιών AI, μπορούσαμε να αντιμετωπίσουμε το ζήτημα με αποτελεσματικό τρόπο.
Τι είναι κάποια από τα machine learning τεχνολογίες που χρησιμοποιούνται στην Spiketrap;
Χρησιμοποιούμε πολλές τεχνολογίες, από το Scikit-learn μέχρι βιβλιοθήκες deep learning όπως το Pytorch. Εκτός από τις βιβλιοθήκες, οι μεθοδολογίες, τα μοντέλα και τα σύνολα δεδομένων που χρησιμοποιούμε είναι κυρίως προιδιαγραφέντα. Έχουμε μάθει ότι οι off-the-shelf μεθοδολογίες και μοντέλα σας φέρνουν μόνο μέχρι ένα σημείο, αλλά για να λύσετε πραγματικά ένα πρόβλημα, πρέπει να δουλέψετε πολύ για να φτιάξετε τα δικά σας μοντέλα, αρχίζοντας από τους στόχους και φτάνοντας μέχρι την αρχιτεκτονική του μοντέλου και τα σύνολα δεδομένων. Για παράδειγμα, η μοντελοποίηση θεμάτων είναι η εργασία να εξάγετε θέματα από μια συλλογή κειμένων. Η “Spiketrap Convos” παρέχει στους πελάτες μας κρίσιμες πληροφορίες για το κοινό τους και χρησιμοποιεί την μοντελοποίηση θεμάτων ως ένα από τα σήματα. Η τυπική μέθοδος για την μοντελοποίηση θεμάτων είναι η LDA (Latent Dirichlet Allocation), αλλά δυστυχώς είναι πολύ ασταθής και απρόβλεπτη και δεν είναι αρκετά ισχυρή. Από την άλλη πλευρά, μπορείτε να δοκιμάσετε ένα σύγχρονο προ-εκπαιδευμένο μοντέλο όπως το Bert-Topics, το οποίο, αν και ισχυρό και περιεκτικό, είναι επίσης πολύ σκληρό και αργό.
Μπορείτε να εξηγήσετε πώς η Spiketrap παρέχει άμεση κατανόηση του κοινού για δημιουργούς, πλατφόρμες και εταιρείες;
Οι διαφημιζόμενοι και οι एजέντες χρησιμοποιούν τις λίστες influencers και τα εργαλεία συναίνεσης brand για να ανακαλύψουν δημιουργούς των οποίων οι κοινότητες είναι ασφαλείς για τα brands σε διάφορες κατηγορίες, συμπεριλαμβανομένων βαθμολογιών για τοξικό, προφανές και σεξουαλικό περιεχόμενο, καθώς και την tổngική ασφάλεια της κοινότητας.
Μια πρόσφατη εργασία με τίτλο ‘FeelsGoodMan: Inferring Semantics of Twitch Neologisms’ δημοσιεύθηκε από την Spiketrap. Μπορείτε να περιγράψετε αυτή την εργασία;
Ο τρόπος που οι άνθρωποι επικοινωνούν και εκφράζουν τους εαυτούς τους στο διαδίκτυο έχει γίνει ολοένα και πιο σύνθετος και προκλητικός για να διαλευκανθεί. Πρώτα ήρθαν οι εικονίδια :-). Στη συνέχεια ήρθαν τα emoji. Στη συνέχεια ήρθαν τα meme… και τώρα “emotes”, μια νέα μορφή εικονικής επικοινωνίας που έχει γίνει πολύ δημοφιλής στην πλατφόρμα Twitch. Κάπως παρόμοια με τα emoji για την ανάμιξή τους με κανονικό κείμενο, παρουσιάζουν παρόμοιες προκλήσεις με τα meme, καθώς είναι autogenerated και η κρυπτική σημασία τους δεν έχει σαφή σύνδεση με την πραγματική εικόνα που απεικονίζεται. Υπάρχουν πάνω από 8 εκατομμύρια διαφορετικά emotes μέχρι σήμερα, με πάνω από 400 χιλιάδες που χρησιμοποιούνται εβδομαδιαίως. Παρόλα αυτά, οι άνθρωποι επικοινωνούν αποτελεσματικά χρησιμοποιώντας τα για να εκφράσουν οποιοδήποτε είδος συναισθήματος, όπως χαρά, βαρεμάρα, ενθουσιασμό ή σαρκασμό. Η πρόσφατη εργασία μας είναι ένα AI cookbook για να επιτύχουμε τη σημασιολογική σημασία των emotes. Η προσέγγισή μας δεν απαιτεί τη διατήρηση και την ενημέρωση ενός χειροκίνητα-δημιουργημένου συνόλου δεδομένων και είναι σε θέση να αυτο-προσαρμοστεί στην συνεχιζόμενη εισαγωγή νέων emotes, καθώς και στην εξέλιξη της σημασίας των δημοφιλών emotes. Αυτό είναι ιδιαίτερα σημαντικό όταν ένα emote γίνεται πολιτικά ή φυλετικά φορτισμένο, το οποίο έχουμε δει να συμβαίνει με εξαιρετικά δημοφιλή emotes, όπως το “TriHard”, “PogChamp” και “FeelsGoodMan”. Η δυναμική χρήση της γλώσσας και οι μεταβολές στη σημασία θέτουν τεράστιους προβλήματα στα συστήματα μετρίσεων ή στα πλαίσια ανάλυσης συναισθήματος, οπότε είμαστε υπερήφανοι που αντιμετωπίζουμε αυτό το πρόβλημα με τον σωστό τρόπο στην Spiketrap.
Υπάρχει κάτι άλλο που θα ήθελε να μοιραστείτε σχετικά με την Spiketrap;
Καθώς κοιτάμε μπροστά στο νέο έτος, η Spiketrap εργάζεται για την ανάπτυξη και την τελειοποίηση ενός νέου εργαλείου που θα παρέχει μια βαθύτερη κατανόηση της στάσης των brand για τους πελάτες μας. Το νέο εργαλείο Affinity της Spiketrap παρέχει έναν διαδραστικό και εύχρηστο τρόπο για να ανακαλύψετε και να ποσοτικοποιήσετε τις affinities του κοινού μεταξύ δημιουργών, brand, παιχνιδιών και άλλα. Για οποιαδήποτε δοθείσα ερώτηση, το εργαλείο γεννάει affinities index scores που δείχνουν πώς καλά είναι μια δοθείσα οντότητα θετικά συσχετισμένη με μια άλλη. Πολλά контεκστούχα σήματα αποτελούν το σκορ, συμπεριλαμβανομένης της συχνότητας και του συναισθήματος των σχετικών αναφορών. Η τεχνολογική πυλώνη της Spiketrap είναι μοναδικά τοποθετημένη για να δείξει affinities μεταξύ παιχνιδιών, brand και δημιουργών. Η προιδιαγραφέντα NLP AI Clair επεξεργάζεται εκατομμύρια δημοσιευμένων μηνυμάτων από χρήστες κάθε μέρα, αποδίδοντας αλλιώς αμφίβολη περιεχόμενο σε οντότητες στο εκτενές γράφημα γνώσεων της Spiketrap, αναγνωρίζοντας θέματα συζήτησης, καθορίζοντας συναισθήματα, και παρακολουθώντας την ασφάλεια. Η προσθήκη του νέου εργαλείου Affinity ενδυναμώνει τους développers, δημιουργούς, brand και άλλα να κατανοήσουν καλύτερα το κοινό τους και την επίδραση του brand. Η Spiketrap εργάζεται για την ανάπτυξη και την τελειοποίηση ενός νέου εργαλείου που θα παρέχει μια βαθύτερη κατανόηση της στάσης των brand για τους πελάτες μας.
Ευχαριστούμε για την υπέροχη συνέντευξη, οι αναγνώστες που επιθυμούν να μάθουν περισσότερα μπορούν να επισκεφθούν την Spiketrap.












