Η γωνία του Anderson
Διδάσκοντας τον AI να κατανοήσει και να χρησιμοποιήσει εικόνες σε διάλογο

Ερευνητές από τη Νότια Κορέα έχουν αναπτύξει ένα σύνολο δεδομένων που αποσκοπεί να βοηθήσει την έρευνα σχετικά με την κατανόηση του AI για τον τρόπο που οι άνθρωποι χρησιμοποιούν εικόνες σε διάλογο, και να βοηθήσει τα μοντέλα φυσικής γλώσσας να συμμετέχουν σε αυτήν την πολύ πρόσφατη εξέλιξη στις ανθρώπινες επικοινωνίες.
Το έγγραφο, από το KAIST στο Daedeok Innopolis, σημειώνει ότι η έρευνα για τέτοιους πολυμορφικούς διαλογικούς συστήματα τα τελευταία δέκα χρόνια έχει εμποδιστεί από σύνολα δεδομένων και μεθόδους που επικεντρώνονται σε πεδία που είναι περιφερειακά στο θέμα, όπως η οπτική απάντηση σε ερωτήσεις και η λεπτομέρεια εικόνων.
Στις παλαιότερες προσεγγίσεις, οι εικόνες αξιολογούνται έξω από το λεξικό контекστο του διαλόγου, χωρίς κατανόηση του τρόπου που ο διάλογος ενισχύεται και αναπτύσσεται από τις εικονογραφικές απαντήσεις, και χωρίς δια-τομεακό σχήμα για την αποκωδικοποίηση των συνεισφορών των οπτικών συνεισφορών στο λόγο.
Εικόνες ως Πρώτη-Τάξης Πτυχές του Διαλόγου
Πολλοί από τους προηγούμενους προσεγγίσεις μέχρι σήμερα έχουν ήταν πρωτοβουλίες ή εξελίξεις από το τμήμα έρευνας του Microsoft, το οποίο το 2017 εξέτασε επίσης το θέμα των πολυμορφικών συνομιλιών που ξεκινάν από μια εικόνα, αντί να χρησιμοποιούν ελεύθερα εικόνες ως συστατικά του διαλόγου.
Για να αντιμετωπιστούν τα ελλείμματα στην έρευνα δεδομένων, οι ερευνητές της Νότιας Κορέας έχουν αναπτύξει ένα σύνολο δεδομένων 45.000 περιπτώσεων διαλόγου που εμπλέκουν την ad hoc χρήση εικόνων, χωρίς να επικεντρώνονται σε ιούς ‘meme’ εικόνες· το τελευταίο, αν και είναι ένα πεδίο ενδιαφέροντος στην έρευνα της γλώσσας, είναι πιθανώς λιγότερο एक πρόκληση, επειδή η σημασία των ιών meme μπορεί να εξαχθεί πιο εύκολα μέσω χιλιάδων σε-πραγματικόχρονο χρήσεων σε πλατφόρμες κοινωνικών μέσων.
Ανάπτυξη Εικονογραφιών ως Αντικατάσταση Κειμένου
Για να αναπτύξουν μια μεθοδολογία για τη διμερή μεταφράση λέξεων/φράσεων σε εικόνες, οι ερευνητές της Νότιας Κορέας έχουν εκπαιδεύσει ένα σύστημα μηχανικής μάθησης να αντικαθιστά μέρη ενός κειμένου-διαλόγου με σεμαντικά σχετικές εικονογραφικές περιεχόμενα.

Αρχιτεκτονική του韓 系统 για τη δημιουργία συνόλου δεδομένων για πολυμορφική έρευνα διαλόγου. Πηγή: https://arxiv.org/pdf/2107.08685.pdf
Η προ-επεξεργασία των στόχων φράσεων περιελάμβανε τη διαγραφή των λεξικών λέξεων που θα μπορούσαν να εμποδίσουν την πρόβλεψη της επόμενης σαリー στο διάλογο, και το κλάδεμα των κατώτερων ποιότητας ανταλλαγών μέσω φίλτρων ομοιότητας.
Για να δοκιμάσουν τη χρησιμότητα του συνόλου δεδομένων, οι ερευνητές ορίσανε ένα μοντέλο να προβλέψει την επόμενη ‘στροφή’ στο διάλογο, λαμβάνοντας υπόψη το контέκστο του διαλόγου και τις εικόνες που εμπλέκονται.

Το σύστημα ανθρώπινης αξιολόγησης που χρησιμοποιήθηκε στην έρευνα.
Πέντε εξωτερικά σύνολα δεδομένων χρησιμοποιήθηκαν ως υλικό για το σύνολο δεδομένων 45k (το οποίο είναι διαθέσιμο στο GitHub). Τρία είναι κειμενογραφικά στοιχεία: DailyDialog, ένα χειροκίνητα-σημειωμένο multi-στροφικό κειμενογραφικό σύνολο από το 2017· και τα EmpatheticDialogues και PersonaChat της Facebook, και τα δύο από το 2018. Τα δύο εικονογραφικά σύνολα δεδομένων που χρησιμοποιήθηκαν ήταν MS-COCO και Flicker30k.

Ζευγάρια εικόνων/κειμένου – JSON σχήμα φράσεων στο σύνολο δεδομένων, συνδεδεμένο με εικόνες (σε αυτό το παράδειγμα) από τη βάση εικόνων COCO της Microsoft.
Η αντικατάσταση κειμένου-εικόνας για το σύστημα ήταν ενεργοποιημένη από το προ-εκπαιδευμένο Δίκτυο Οπτικής Σεμαντικής Λογικής (VSRN), αναπτύχθηκε το 2019 από το Πανεπιστήμιο του Northeastern στη Βοστώνη. Το VSRN ορίστηκε να λειτουργήσει σε χειροκίνητα προ-επιλεγμένες φράσεις από τα συνεισφέρων κειμενογραφικά σύνολα δεδομένων.
Ιδρύοντας Συνέπεια
Η συνέπεια των πηγαίων συνόλων δεδομένων ιδρύθηκε αναπτύσσοντας έξι συνδυασμούς κάθε συνόλου διαλόγου, συσχετισμένων με περιπτώσεις σε κάθε σύνολο εικόνων, και αξιολογήθηκαν σε plusieurs γύρους από ανθρώπους.
Η αξιολόγηση των ανθρώπων βασίστηκε σε τρία κριτήρια: συνέπεια με το контέκστο της ανταλλαγής· εικονογραφική-σχετικότητα με την κεντρική έννοια που η εικόνα προσπαθούσε να εκφράσει· και το βαθμό στον οποίο η εικόνα περιελάμβανε κλειδιά αντικείμενα από την στόχο-πρόταση.
Λαμβάνοντας υπόψη το τελευταίο κριτήριο, θα μπορούσε να επιχειρηθεί ότι το σχήμα που οι ερευνητές αποφάσισαν έχει σε μεγάλο βαθμό αποκλείσει την πιθανότητα για юмор, σαρκασμό, αφηρημένα ή μεταφυσικά πιθανότητες για τη σεμαντική σημασία μιας εικόνας που θα μπορούσε να ενσταλεί σε einen κειμενογραφικό διάλογο.
Ωστόσο, αυτό είναι σεμινάλ εργασία, και πρέπει να ξεκινήσει κάπου, ενώ σημαντικές προσπάθειες καταβάλλονται αλλού στον τομέα της Φυσικής Γλώσσας (NLP) για χαρτογράφηση περιπτώσεων σαρκασμού, μεταξύ άλλων λιγότερο ορατών παραδειγμάτων της σχέσης εικόνας-κειμένου.
Δοκιμή
Για να δοκιμάσουν το πλαίσιο γεννήσεων δεδομένων, οι ερευνητές χρησιμοποίησαν ένα τρι-μερές μοντέλο ανάκτησης βασισμένο στην έρευνα Image-Chat της Facebook το 2020. Το μοντέλο αποτελείται από Resnext-101 ως κωδικοποιητή εικόνας· το BERT της Google για τον κωδικοποιητή κειμένου· και ένα προσαρμοσμένο modulo σύντηξης για αυτά.
Το σύστημα πέτυχε 50,35 και 14,38 στην πρόβλεψη της τρέχουσας και της επόμενης πρότασης, βελτιώνοντας την βάση για κάθε εργασία.
Αργότερα, δύο ερευνητές ορίστηκαν να δημιουργήσουν 100 πολυμορφικούς διαλόγους εισάγοντας εικόνες σε συνομιλίες χειροκίνητα, και τρέχοντας το σύστημα ενάντια σε αυτές τις ‘οργανικές’ πολυμορφικές συνομιλίες. Το σύστημα ήταν σε θέση να προβλέψει την τρέχουσα και την επόμενη-στροφή ανταλλαγές με υψηλή επίγνωση του контέκστου ακόμη και για αυτά τα ad hoc παραδείγματα.













