Η γωνία του Anderson

Ακόμη και τα πιο προηγμένα μοντέλα γλωσσικών μοντέλων έχουν δυσκολίες στην κατανόηση της χρονικής λογικής

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
Variation on ChatGPT-4o prompt: ‘1792px x 1024px photorealistic HQ image of a robot looking at a computer screen. On the screen is a picture of a chicken and an egg. The image should not be cartoon-ish, or illustration-like, but should look like a still from a high-budget Hollywood movie’

Η πρόβλεψη μελλοντικών καταστάσεων είναι một κρίσιμη αποστολή στην έρευνα της υπολογιστικής όρασης – όχι μόνο στη ρομποτική, όπου πρέπει να ληφθούν υπόψη πραγματικές καταστάσεις. Τα συστήματα μηχανικής μάθησης που έχουν ανατεθεί σε αποστολές κρίσιμης σημασίας πρέπει να έχουν επαρκή κατανόηση του φυσικού κόσμου.

Ωστόσο, σε ορισμένες περιπτώσεις, μια φαινομενικά εντυπωσιακή γνώση της χρονικής πραγματικότητας μπορεί να είναι παραπλανητική: μια νέα μελέτη από τα Ηνωμένα Αραβικά Εμιράτα έχει βρει ότι τα πιο προηγμένα μοντέλα πολυμεσικής μεγάλης κλίμακας γλωσσικών μοντέλων (MLLMs), συμπεριλαμβανομένων των ηγετών του κλάδου GPT-4o και Google Gemini, αποτυγχάνουν όταν πρόκειται για την ερμηνεία του πώς ο χρόνος αντιπροσωπεύεται στις εικόνες.

ΠαραδείγματαSEQUENTIAL ζευγών (βλέπε εικόνα παρακάτω), τα οποία θα ήταν άμεσα για τους ανθρώπους ακόμη και όταν τοποθετούνται σε λάθος σειρά, μπορεί να εξαπατήσουν προηγμένα MLLMs όταν παρουσιάζονται σε απρόβλεπτες συνθήκες ή διαμορφώσεις (όπως δεύτερη εικόνα πρώτα, συνδεδεμένες σε單εικόνες, πολλαπλές εικόνες που μπορεί να αντιπροσωπεύουν ή όχι τη σωστή χρονική σειρά, κ.λπ.).

Δείγματα από ένα από τα σύνολα δεδομένων που συγκεντρώθηκαν για τη νέα μελέτη, τα οποία δείχνουν σειριακές εκδηλώσεις. Οι ερευνητές έχουν κάνει αυτά τα δεδομένα διαθέσιμα στο https://huggingface.co/datasets/fazliimam/temporal-vqa/viewer

Δείγματα από ένα από τα σύνολα δεδομένων που συγκεντρώθηκαν για τη νέα μελέτη, τα οποία δείχνουν σειριακές εκδηλώσεις στη μορφή ‘πριν και μετά’ εικόνων. Οι ερευνητές έχουν κάνει αυτά τα δεδομένα διαθέσιμα στο https://huggingface.co/datasets/fazliimam/temporal-vqa/viewer

Οι ερευνητές κατέστησαν τα μοντέλα με βασικές προκλήσεις χρονικής λογικής, όπως η καθορισμός της σειράς των γεγονότων ή η εκτίμηση των χρονικών διαστημάτων, και βρήκαν ότι τα επτά MLLMs που δοκιμάστηκαν παρουσίασαν αξιοσημείωτα χαμηλότερη ακρίβεια από τους ανθρώπους:

‘Συνολικά, τα [αποτελέσματα] αποκαλύπτουν ότι όλα τα τρέχοντα MLLMs, συμπεριλαμβανομένου του GPT-4o – του πιο προηγμένου μοντέλου στην αξιολόγησή μας – έχουν δυσκολίες με το προτεινόμενο βENCHMARK.尽管 το GPT-4o παρουσιάζει υπεροχή απόδοση σε σχέση με άλλα μοντέλα, αποτυγχάνει να δείξει συνεχώς ακριβή χρονική λογική σε διαφορετικές συνθήκες.

‘Οι συνεχείς βαθμοι ακρίβειας είναι αξιοσημείωτα χαμηλοί για όλα τα μοντέλα, υποδεικνύοντας σημαντικές ελλείψεις στην ικανότητά τους να κατανοήσουν και να ερμηνεύσουν χρονικές ακολουθίες από οπτικές εισόδους. Αυτές οι ελλείψεις είναι φανερές ακόμη και όταν τα μοντέλα παρέχονται με πολλαπλές εικόνες ή βελτιστοποιημένες προτροπές, υποδεικνύοντας ότι οι τρέχουσες αρχιτεκτονικές και μεθόδους εκπαίδευσης είναι ανεπαρκείς για ρομποτική κατανόηση της χρονικής σειράς.’

Τα συστήματα μηχανικής μάθησης σχεδιάζονται για να βελτιστοποιούν τα πιο ακριβή, αλλά και τα πιο αποτελεσματικά και ευχάριστα αποτελέσματα*.既然 δεν αποκαλύπτουν την λογική τους ρητά, μπορεί να είναι δύσκολο να πει όταν απατά ή χρησιμοποιεί ‘συντομεύσεις’.

Σε τέτοια περίπτωση, το MLLM μπορεί να φτάσει στο σωστό αποτέλεσμα με το λάθος μέθοδο.Το γεγονός ότι ένα τέτοιο αποτέλεσμα μπορεί να είναι σωστό μπορεί να εμπνεύσει ψευδή εμπιστοσύνη στο μοντέλο, το οποίο μπορεί να παράγει λανθασμένα αποτελέσματα με την ίδια μέθοδο σε μεταγενέστερες εργασίες που παρουσιάζονται σε αυτό.

Χειρότερα, αυτή η παρεξήγηση μπορεί να γίνει ακόμη πιο εδραιωμένη στη διαδικασία ανάπτυξης εάν οι άνθρωποι εντυπωσιαστούν από αυτό και δώσουν θετική ανταπόκριση σε δοκιμές και συνεδρίες αναnotation που μπορεί να συνεισφέρουν στη κατεύθυνση που τα δεδομένα και/ή το μοντέλο μπορεί να πάρουν.

Σε αυτή την περίπτωση, η πρόταση είναι ότι τα MLLMs είναι ‘ψεύδονται’ μια αληθινή κατανόηση της χρονολογίας και των χρονικών φαινομένων, παρατηρώντας και εδραιώνοντας δευτερεύουσες ενδείξεις (όπως χρονοσφραγίδες, για παράδειγμα, σε δεδομένα βίντεο, σειρά εικόνων σε μια διάταξη, ή ακόμη και – πιθανώς – σειριακά-αριθμημένες ονόματα αρχείων).

Επιπλέον, υποδεικνύει ότι τα MLLMs σήμερα δεν ικανοποιούν καμία πραγματική ορισμό της γενίκευσης ενός εννοήματος χρονικών φαινομένων – τουλάχιστον, μέχρι το βαθμό που οι άνθρωποι μπορούν.

Η νέα μελέτη έχει τον τίτλο Μπορούν τα πολυμεσικά MLLMs να κάνουν οπτική χρονική κατανόηση και λογική; Η απάντηση είναι Όχι!, και προέρχεται από τρεις ερευνητές στο Mohamed bin Zayed University of Artificial Intelligence και Alibaba International Digital Commerce.

Δεδομένα και Δοκιμές

Οι ερευνητές σημειώνουν ότι προηγούμενες βάσεις δεδομένων και μελέτες, όπως MMMU και TemporalBench, εστιάζουν σε εισόδους単εικόνων ή αλλιώς διαμορφώνουν ερωτήσεις για τα MLLMs που μπορεί να είναι πολύ εύκολες να απαντηθούν, και μπορεί να μην αποκαλύψουν μια τάση προς συντομεύσεις συμπεριφοράς.

Επομένως, οι ερευνητές προσφέρουν δύο ενημερωμένες προσεγγίσεις: Χρονική σειρά κατανόησης (TOU) και Εκτίμηση χρονικού διαστήματος (TLE). Η προσέγγιση TOU δοκιμάζει τα μοντέλα στην ικανότητά τους να καθορίσουν τη σωστή σειρά των γεγονότων από ζεύγη καρέ βίντεο. Η μέθοδος TLE αξιολογεί την ικανότητα του MLLM να εκτιμήσει τη χρονική διαφορά μεταξύ δύο εικόνων, που κυμαίνεται από δευτερόλεπτα έως χρόνια.

Από το έγγραφο, οι δύο κύριες εργασίες του TemporalVQA benchmark: στην Temporal Order Understanding, το μοντέλο αποφασίζει ποια από τις δύο εικόνες δείχνει ένα γεγονός που συνέβη πρώτα. Στην Time-lapse Estimation, το μοντέλο εκτιμά πόσο χρόνο έχει περάσει μεταξύ των δύο εικόνων, επιλέγοντας από επιλογές που περιλαμβάνουν δευτερόλεπτα, λεπτά, ημέρες ή χρόνια. Αυτές οι εργασίες στοχεύουν να δοκιμάσουν πώς καλά τα MLLMs μπορούν να λογικεύσουν τη χρονική σειρά και τη σειρά των οπτικών γεγονότων.

Από το έγγραφο, οι δύο κύριες εργασίες του TemporalVQA benchmark: στην Temporal Order Understanding, το μοντέλο αποφασίζει ποια από τις δύο εικόνες δείχνει ένα γεγονός που συνέβη πρώτα. Στην Time-lapse Estimation, το μοντέλο εκτιμά πόσο χρόνο έχει περάσει μεταξύ των δύο εικόνων, επιλέγοντας από επιλογές που περιλαμβάνουν δευτερόλεπτα, λεπτά, ημέρες ή χρόνια. Αυτές οι εργασίες στοχεύουν να δοκιμάσουν πώς καλά τα MLLMs μπορούν να λογικεύσουν τη χρονική σειρά και τη σειρά των οπτικών γεγονότων. Source: https://arxiv.org/pdf/2501.10674

Οι ερευνητές συγκέντρωσαν 360 ζεύγη εικόνων για το benchmark TOU, χρησιμοποιώντας ανοικτές πηγές βίντεο από Pixabay και Pexels, ώστε να είναι δυνατή η διάθεση του συνόλου δεδομένων μέσω ενός GUI.

Τα βίντεο κάλυπταν eine σειρά θεμάτων, από ανθρώπους σε καθημερινές δραστηριότητες έως μη ανθρώπινες περιεχομένου, όπως ζώα και φυτά. Από αυτά, ζεύγη καρέ επιλέχθηκαν για να απεικονίσουν μια σειρά γεγονότων με επαρκή ποικιλία για να κάνουν την αρχική καρέ ‘πρώτη’.

Η επιλογή των ανθρώπων χρησιμοποιήθηκε για να διασφαλιστεί ότι τα καρέ θα μπορούσαν να διαταχθούν οριστικά.

Η χρονική λογική αυτών των δύο εικόνων δεν μπορεί να αποφευχθεί,既然 το τσάι δεν μπορεί να αναρτηθεί πίσω στην κάνουλα.

Η χρονική λογική αυτών των δύο εικόνων δεν μπορεί να αποφευχθεί,既然 το τσάι δεν μπορεί να αναρτηθεί πίσω στην κάνουλα.

Με αυτόν τον τρόπο, 360 ζεύγη εικόνων αποκτήθηκαν.

Για την προσέγγιση TLE, επιλέχθηκαν εικόνες χωρίς πνευματικά δικαιώματα από Google και Flickr, καθώς και επιλεγμένα καρέ από βίντεο χωρίς πνευματικά δικαιώματα στο YouTube. Το περιεχόμενο των βίντεο παρουσίαζε σκηνές ή αντικείμενα που η αλλαγή τους κυμαινόταν από δευτερόλεπτα έως ημέρες έως εποχές – για παράδειγμα, ωριμάζοντας φρούτα ή η αλλαγή των εποχών σε τοπία.

Έτσι, 125 ζεύγη εικόνων συγκεντρώθηκαν για τη μέθοδο TLE.

Δεν όλα τα MLLMs που δοκιμάστηκαν ήταν σε θέση να επεξεργαστούν πολλαπλές εικόνες.因此, οι δοκιμές διαφέρουν για να ταιριάζουν στις ικανότητες κάθε μοντέλου.

Διάφορες εκδόσεις των συνόλων δεδομένων δημιουργήθηκαν, στις οποίες ορισμένα από τα ζεύγη ήταν συνδεδεμένα κατακόρυφα και άλλα οριζόντια. Περαιτέρω παραλλαγές αντάλλαξαν τη σωστή χρονική σειρά των ζευγών.

Δύο τύποι προτρόπων αναπτύχθηκαν. Ο πρώτος ακολούθησε αυτό το πρότυπο:

Συνέβη το γεγονός στην (αριστερή / πάνω / πρώτη) εικόνα πριν από το γεγονός στην (δεξιά / κάτω / δεύτερη) εικόνα; Λέτε αλήθεια ή ψέματα με λόγο.

Ο δεύτερος ακολούθησε αυτό το σχήμα:

Ποια από τις δύο εικόνες δείχνει το γεγονός που συνέβη πρώτα; Λέτε (αριστερή ή δεξιά / πάνω ή κάτω / πρώτη ή δεύτερη) με λόγο.

Για την TLE, οι ερωτήσεις ήταν πολλαπλής επιλογής, ζητώντας από τα μοντέλα να αξιολογήσουν τη χρονική διαφορά μεταξύ των δύο παρουσιαζόμενων εικόνων, με δευτερόλεπτα, ώρες, λεπτά, ημέρες, μήνες και χρόνια διαθέσιμα ως μονάδες χρόνου. Σε αυτή τη διαμόρφωση, η πιο πρόσφατη εικόνα παρουσιάστηκε στη δεξιά πλευρά.

Η προτροπή που χρησιμοποιήθηκε εδώ ήταν:

Στην δεδομένη εικόνα, εκτιμήστε τον χρόνο που έχει περάσει μεταξύ της πρώτης εικόνας (αριστερά) και της δεύτερης εικόνας (δεξιά).

Επιλέξτε μια από τις ακόλουθες επιλογές:

    1. Λιγότερο από 15 δευτερόλεπτα
      B. Μεταξύ 2 λεπτών και 15 λεπτών
      C. Μεταξύ 1 ώρας και 12 ωρών
      D. Μεταξύ 2 ημερών και 30 ημερών
      E. Μεταξύ 4 μηνών και 12 μηνών
      F. Περισσότερο από 3 χρόνια

Τα MLLMs που δοκιμάστηκαν ήταν ChatGPT-4o. Gemini1.5-Pro. LlaVa-NeXT. InternVL. Qwen-VL. Llama-3-vision. και LLaVA-CoT.

Χρονική σειρά κατανόησης: Αποτελέσματα

Αποτελέσματα της Χρονικής σειράς κατανόησης σε διάφορα μοντέλα και διαμορφώσεις εισόδου, δείχνοντας ακρίβεια και συνεπήτητα για διάφορες διαμορφώσεις και προτροπές.

Αποτελέσματα της Χρονικής σειράς κατανόησης σε διάφορα μοντέλα και διαμορφώσεις εισόδου, δείχνοντας ακρίβεια και συνεπήτητα για διάφορες διαμορφώσεις και προτροπές.

Σχετικά με τα αποτελέσματα που εμφανίζονται παραπάνω, οι ερευνητές βρήκαν ότι όλα τα MLLMs που δοκιμάστηκαν, συμπεριλαμβανομένου του GPT-4o (το οποίο έδειξε την καλύτερη συνολική απόδοση), είχαν σημαντικές δυσκολίες με το TemporalVQA benchmark – και ακόμη το GPT-4o αποτύχησε να δείξει συνεχώς αξιόπιστη χρονική λογική σε διάφορες διαμορφώσεις.

Οι ερευνητές ισχυρίζονται ότι οι συνεχείς χαμηλοί βαθμοί ακρίβειας σε όλα τα MLLMs υποδεικνύουν σημαντικές ελλείψεις στην ικανότητά τους να ερμηνεύσουν και να λογικεύσουν χρονικές ακολουθίες από οπτικές εισόδους. Οι ερευνητές σημειώνουν ότι αυτές οι προκλήσεις παραμένουν ακόμη και με τη χρήση πολλαπλών εικόνων και βελτιστοποιημένων προτρόπων, υποδεικνύοντας ότι οι τρέχουσες αρχιτεκτονικές και μεθόδους εκπαίδευσης είναι ανεπαρκείς για ρομποτική κατανόηση της χρονικής σειράς.

Οι δοκιμές έδειξαν σημαντικές διαφορές στην απόδοση μεταξύ των στρατηγικών προτρόπων. Ενώ το GPT-4o βελτιώθηκε με βελτιστοποιημένες προτροπές (φτάνοντας στο 4% σε μονό εικόνα και 65.3% σε πολλαπλές εικόνες), η απόδοση παρέμεινε κάτω από αποδεκτά επίπεδα.

Μοντέλα όπως το LLaVA-NeXT και το Qwen-VL ήταν ακόμη πιο ευαίσθητα, με την απόδοση να μειώνεται όταν χρησιμοποιούνταν εναλλακτικές προτροπές, υποδεικνύοντας ότι η μηχανική προτρόπων μόνο δεν μπορεί να υπερβεί τις θεμελιώδεις ελλείψεις των MLLMs στη χρονική λογική.

Οι δοκιμές επίσης έδειξαν ότι η διάταξη της εικόνας (δηλαδή, κατακόρυφη ή οριζόντια) επηρέασε σημαντικά την απόδοση του μοντέλου. Το GPT-4o βελτίωσε τη συνεπήτητα με κατακόρυφες διατάξεις, αυξάνοντας από 39.2% σε 52.8%.然而, άλλα μοντέλα, συμπεριλαμβανομένων των LLaVA, έδειξαν ισχυρές διευθύνσεις, excelling σε μια διάταξη αλλά αποτυγχάνοντας σε μια άλλη.

Το έγγραφο υποδεικνύει ότι αυτές οι ασυνεπείς υποδεικνύουν ότι τα MLLMs δεν πραγματικά αναλύουν τη σειρά των γεγονότων ή κατανοούν την πρόοδο του χρόνου. Αντίθετα, φαίνεται να έχουν βασιστεί σε προτρόπους ή οπτικές λειτουργίες που σχετίζονται με τη διάταξη των εικόνων, όπως η θέση ή η στοίχιση, για να λάβουν αποφάσεις.

Ποιοτικές δοκιμές υπογραμμίζουν τις προβλέψεις του GPT-4o όταν αντιμετωπίζει διαφορετικές διατάξεις εισόδου. Στην πρώτη διάταξη, τα ζεύγη εικόνων παρουσιάζονται στη σειρά τους. Στη δεύτερη διάταξη, η σειρά είναι αντεστραμμένη. Οι σωστές ταξινομήσεις σημειώνονται με πράσινο, οι καθαρές λανθασμένες ταξινομήσεις με κόκκινο, οι εικασίες με πορτοκαλί και οι αλогικές ή ‘άκυρες’ εικασίες με καφέ, αποκαλύπτοντας τις ασυνεπείς του μοντέλου σε διαφορετικές διαμορφώσεις εισόδου.

Ποιοτικές δοκιμές υπογραμμίζουν τις προβλέψεις του GPT-4o όταν αντιμετωπίζει διαφορετικές διατάξεις εισόδου. Στην πρώτη διάταξη, τα ζεύγη εικόνων παρουσιάζονται στη σειρά τους. Στη δεύτερη διάταξη, η σειρά είναι αντεστραμμένη. Οι σωστές ταξινομήσεις σημειώνονται με πράσινο, οι καθαρές λανθασμένες ταξινομήσεις με κόκκινο, οι εικασίες με πορτοκαλί και οι αλогικές ή ‘άκυρες’ εικασίες με καφέ, αποκαλύπτοντας τις ασυνεπείς του μοντέλου σε διαφορετικές διαμορφώσεις εισόδου.

Συγκριτικές δοκιμές μεταξύ μονό εικόνας και πολλαπλών εικόνων έδειξαν περιορισμένη συνολική βελτίωση, με το GPT-4o να εκτελεί ελαφρώς καλύτερα σε πολλαπλές εικόνες, αυξάνοντας από 31.0% σε 43.6% (με P1) και 46.0% σε 65.3% (με P2).

Άλλα μοντέλα, όπως το InternVL, έδειξαν σταθερή αλλά χαμηλή ακρίβεια, ενώ το Qwen-VL saw μικρές κέρδη. Οι ερευνητές καταλήγουν στο συμπέρασμα ότι αυτά τα αποτελέσματα υποδεικνύουν ότι η πρόσθετη οπτική контек스트 δεν βελτιώνει σημαντικά τις ικανότητες χρονικής λογικής,既然 τα μοντέλα έχουν δυσκολίες να ολοκληρώσουν αποτελεσματικά τις χρονικές πληροφορίες.

Μελέτη Ανθρώπων

Σε μια μελέτη ανθρώπων, τρεις έρευνες διεξήχθησαν για να αξιολογήσουν πώς κοντά η καλύτερη απόδοση του πολυμεσικού MLLM ήταν σε σχέση με την ανθρώπινη εκτίμηση.

Οι άνθρωποι πέτυχαν 90.3% ακρίβεια, υπερβαίνοντας το 65.3% του GPT-4o κατά 25%. Το σύνολο δεδομένων αποδείχθηκε αξιόπιστο, με ελάχιστα ανθρώπινα λάθη και συνεπή συνάδει με τις σωστές απαντήσεις.

Αποτελέσματα από την μελέτη ανθρώπων για τον πρώτο γύρο δοκιμών.

Αποτελέσματα από την μελέτη ανθρώπων για τον πρώτο γύρο δοκιμών.

Εκτίμηση χρονικού διαστήματος: Αποτελέσματα

Αποτελέσματα για την TLE: η εκτίμηση του χρονικού διαστήματος αξιολογεί την ακρίβεια του μοντέλου στην αναγνώριση των διαστημάτων μεταξύ ζευγών εικόνων, σε κλίμακα από δευτερόλεπτα έως χρόνια. Η εργασία αξιολογεί την ικανότητα του κάθε μοντέλου να επιλέξει την σωστή κλίμακα χρόνου για το χρονικό διάστημα.

Αποτελέσματα για την TLE: η εκτίμηση του χρονικού διαστήματος αξιολογεί την ακρίβεια του μοντέλου στην αναγνώριση των διαστημάτων μεταξύ ζευγών εικόνων, σε κλίμακα από δευτερόλεπτα έως χρόνια. Η εργασία αξιολογεί την ικανότητα του κάθε μοντέλου να επιλέξει την σωστή κλίμακα χρόνου για το χρονικό διάστημα.

Σε αυτές τις δοκιμές, τα MLLMs εκτέλεσαν μόνο ικανοποιητικά την εκτίμηση του χρονικού διαστήματος: το GPT-4o πέτυχε 70% ακρίβεια, αλλά τα άλλα μοντέλα εκτέλεσαν σημαντικά χειρότερα (βλέπε πίνακα παραπάνω), και η απόδοση επίσης ποικίλλει σημαντικά σε διάφορες κλίμακες χρόνου.

Οι ερευνητές σχολιάζουν:

‘Η εργασία της εκτίμησης του χρονικού διαστήματος δοκιμάζει την ικανότητα των MLLMs να επιτύχουν χρονικά διαστήματα μεταξύ ζευγών εικόνων. [Όλα] MLLMs, συμπεριλαμβανομένων των κορυφαίων επιτελεστών όπως το GPT-4o και το Gemini1.5-Pro, έχουν δυσκολίες με αυτή την εργασία, επιτυγχάνοντας μόνο μέτρια επίπεδα ακρίβειας 60-70%. Το GPT-4o δείχνει ασυνεπή απόδοση, με ισχυρή απόδοση σε Δευτερόλεπτα και Χρόνια αλλά υποβαθμισμένη απόδοση σε Ώρες.

Συ슝ώς, το LLaVA-CoT δείχνει εξαιρετική απόδοση σε διαστήματα χρόνου Δευτερόλεπτα και Ημέρες, ενώ δείχνει αξιοσημείωτα κακή απόδοση σε άλλα χρονικά διαστήματα.’

Μελέτη Ανθρώπων

Στην μελέτη ανθρώπων για την TLE, η μέση ανθρώπινη απόδοση βελτιώθηκε σε σχέση με το GPT-4o (το καλύτερο μοντέλο στην κατηγορία αυτή) κατά 12.3%.

Οι ερευνητές σημειώνουν ότι ορισμένες από τις προκλήσεις ήταν ιδιαίτερα απαιτητικές, και ότι σε μια περίπτωση όλοι οι συμμετέχοντες ανθρώπων επέστρεψαν λανθασμένες απαντήσεις, μαζί με όλα τα μοντέλα.

Οι ερευνητές καταλήγουν στο συμπέρασμα ότι το GPT-4o δείχνει ‘λογικές ικανότητες, παρά την σειρά των εικόνων που παρουσιάζονται σε αυτό.

Συμπέρασμα

Εάν τα MLLMs τελικά συγκεντρώσουν και απορροφήσουν επαρκές ‘συντομεύσεις’ δεδομένα για να καλύψουν ακόμη και τις πιο δύσκολες προκλήσεις του τύπου που παρουσιάζονται από τους ερευνητές σε αυτή τη μελέτη, είτε μπορούν να θεωρηθούν ότι έχουν αναπτύξει ικανότητες γενίκευσης τύπου ανθρώπινου στυλ σε αυτό το domaine θα γίνει ένα αμφισβητούμενο σημείο.

Όπως δεν είναι γνωστό ακριβώς από ποιον δρόμο αποκτάμε τις δικές μας ικανότητες στη χρονική λογική – μήπως επίσης ‘απατάμε’ μέχρι που η απλή ποσότητα των μαθημένων εμπειριών αποκαλύπτει ένα μοτίβο που εκτελείται ως ‘ενστικτό’ σε σχέση με αυτό το είδος δοκιμών?

 

* Από την άποψη ότι τα μοντέλα είναι ολοένα και περισσότερο βελτιστοποιημένα με συναρτήσεις απώλειας που η ανθρώπινη ανταπόκριση έχει συνεισφέρει σε αυτά, και αποτελεσματικά βελτιστοποιημένα από ανθρώπινες δοκιμές και μεταγενέστερες διορθώσεις.

Πρώτη δημοσίευση Δευτέρα, 27 Ιανουαρίου 2025

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai