Η γωνία του Anderson
Τα Παζλ Jigsaw Βελτιώνουν την Οπτική Λογική των Μοντέλων AI

Νέα έρευνα δείχνει ότι τα μοντέλα AI μπορούν να γίνουν πιο έξυπνα στην όραση λύνοντας παζλ jigsaw. Η αναδιάταξη των ανακατεμένων εικόνων, βίντεο και 3D σκηνών τους βοηθά να βελτιώσουν τις οπτικές τους ικανότητες χωρίς την ανάγκη για επιπλέον δεδομένα, ετικέτες ή εργαλεία.
Στη σημερινή αναταραχή να προωθήσουν τα Μοντέλα Πολυμεσικής Μεγάλης Γλώσσας (MLLMs*) μπροστά από τον ανταγωνισμό (ή τουλάχιστον να παραμείνουν τρεις εκδόσεις μπροστά από τον πλησιέστερο ανταγωνιστή), υπάρχουν λίγες εύκολες νίκες και δεν υπάρχουν δωρεάν γεύματα.
Αν και πολλές από τις εντυπωσιακές κυκλοφορίες του 2025 από την Κίνα είναι αναφερθεί ότι έχουν χαμηλότερο κόστος ανάπτυξης και λειτουργίας, οι δυτικές κυκλοφορίες τείνουν να ρίχνουν περισσότερα στο πρόβλημα: περισσότερο όγκο δεδομένων, περισσότερη δύναμη συλλογισμού, περισσότερη ηλεκτρική ενέργεια (αν και, όπως σημειώσαμε πρόσφατα, δεν είναι περισσότεροι ανθρώπινοι αναλυτές, поскольку αυτό είναι πολύ ακριβό ακόμη και για την επανάσταση της γενικής IA με κλίμακα $1 τρισεκατομμυρίου+).
Στη βιβλιογραφία, οι περισσότερες υποτιθέμενες «δωρεάν» προσεγγίσεις για την εξέλιξη των αρχιτεκτονικών του AI τείνουν να προσφέρουν μόνο μικρές σταδιακές βελτιώσεις· ή else βελτιώσεις σε περιοχές που δεν είναι οι πιο κριτικά αναζητούμενες. Παρόλα αυτά, η αναζήτηση για άγνωστες «βασικές αρχές» που θα μπορούσαν να επιταχύνουν το ρυθμό της ανάπτυξης είναι πολύ απασχολητική για να εγκαταλειφθεί.
Συγκέντρωση των Τετράγωνων
Ενώ δεν είναι ακριβώς στην ίδια κατηγορία, μια νέα ακαδημαϊκή συνεργασία μεταξύ κινεζικών ιδρυμάτων ισχυρίζεται ότι έχει καθορίσει ότι η διδασκαλία των MLLMs να λύσουν παζλ jigsaw βελτιώνει την απόδοσή τους σημαντικά, ακόμη και αν αυτή η προσεγγίση ενισχυμένη μάθηση είχε προηγουμένως πραγματοποιηθεί με λιγότερη επιτυχία σε αυτήν την περιοχή, και ακόμη και αν απαιτεί κανένα επιπλέον σύστημα, βοηθητικά μοντέλα ή άλλες «πρόσθετες» διαδικασίες:

Το Visual Jigsaw είναι ένα αυτο-επιτηρούμενο πλαίσιο μετά-εκπαίδευσης που βελτιώνει τις οπτικές ικανότητες στα μοντέλα πολυμεσικής μεγάλης γλώσσας. Με την εκπαίδευση σε εργασίες jigsaw σε εικόνες, βίντεο και 3D δεδομένα, τα μοντέλα αποκτούν πιο οξυμένες, λεπτομερείς, χωρικές και συνθετικές αντιλήψεις σε εικόνες, ισχυρότερη χρονική συλλογιστική σε βίντεο και ενισχυμένη γεωμετρική κατανόηση σε 3D σκηνές. Οι ραδιογραφίες στην εικόνα πάνω δείχνουν συνεχείς κέρδη πάνω από το βασικό Qwen2.5-VL, με κλίμακες τιμών προσαρμοσμένες για κάθε βenchmark για σαφήνεια. Πηγή: https://arxiv.org/pdf/2509.25190
Το σύστημα που έχει αναπτύξει η ερευνητική ομάδα ονομάζεται Visual Jigsaw και περιλαμβάνει την εκπαίδευση των υφιστάμενων MLLMs σε υλικό που έχει καταστραφεί και τυχαία διασκορπιστεί, όπως ένα παζλ jigsaw. Οι συγγραφείς ανέπτυξαν τρεις modalities για αυτήν την προσέγγιση: εικόνα, βίντεο και 3D (δηλαδή, CGI-στυλ πλέγματα), και βρήκαν ότι μια μέτρια προσαρμογή της ίδιας διαδικασίας ωφέλησε και τις τρεις περιοχές:

Μια αναπαράσταση των τριών εργασιών Visual Jigsaw. Στο Image Jigsaw, μια εικόνα χωρίζεται σε τμήματα, ανακατεύεται και το μοντέλο προβλέπει τη σωστή διάταξη· στο Video Jigsaw, τα κλιπ ανακατεύονται και το μοντέλο αποκαθιστά τη σωστή χρονική τους σειρά· στο 3D Jigsaw, σημεία με διαφορετικά βάθη ανακατεύονται και το μοντέλο ταξινομεί αυτά από το κοντινότερο στο μακρινότερο. Οι έξοδοι του μοντέλου αξιολογούνται με βάση την αλήθεια, με μερική πίστωση για τις μερικά σωστές λύσεις.
Η μέθοδος εκπαίδευσης του Visual Jigsaw βοηθά τα μοντέλα AI να βελτιώσουν την κατανόηση των οπτικών πληροφοριών, ανασυγκροτώντας αυτά τα ανακατεμένα εικόνες, βίντεο ή 3D δεδομένα.
Η διαδικασία βασίζεται στις λέξεις και όχι στις εικόνες, και επομένως δεν υπάρχει ανάγκη για το μοντέλο να δημιουργήσει εικόνες ή να χρησιμοποιήσει οποιαδήποτε επιπλέον οπτικά στοιχεία. Αυτή η μέθοδος ταιριάζει σε ένα σύστημα που ονομάζεται Ενισχυμένη Μάθηση από Επιβεβαιώσιμες Ανταμοιβές (RLVR), όπου το μοντέλο λαμβάνει ανταμοιβή για σωστές απαντήσεις με βάση σαφείς, αυτόματες κανόνες· και όπου, επομένως, δεν απαιτείται ανθρώπινη ετικέτα.
Αυτό το κρίσιμο γεγονός είναι фактически δύσκολο να εξαχθεί από το νέο έγγραφο: ότι το σύστημα συναρμολογεί το παζλ σημαντικά, μέσω περιγραφών, και όχι με τον τρόπο που οι άνθρωποι μαθαίνουν να λύνουν τέτοια παζλ:

Από το νέο έγγραφο, ένα παράδειγμα εργασίας RL που δείχνει τη βασισμένη σε κείμενο φύση αυτής της βοηθητικής διαδικασίας μάθησης. Οι εικόνες που θα είχαν εμφανιστεί στο MLLM δεν απεικονίζονται εδώ.
Αν και τα MLLMs ασχολούνται εκτενώς με οπτικές εργασίες, είναι γλωσσικά αρχιτεκτονικές, και όχι σχεδιασμένες να δημιουργούν εικόνες, βίντεο ή αναπαραστάσεις σχημάτων όπως 3D πλέγματα.

Παραδείγματα από την εργασία jigsaw εικόνας. Κάθε σειρά δείχνει ανακατεμένα τμήματα που το μοντέλο πρέπει να ανακατατάξει στη σωστή διάταξή τους, με τη σωστή διάταξη να εμφανίζεται στη δεξιά πλευρά.
Σε κάθε περίπτωση, αυτό το είδος εκπαίδευσης γίνεται μετά την κύρια φάση μάθησης, όταν το μοντέλο ήδη έχει κάποια ικανότητα να κατανοήσει εικόνες.
Προηγούμενες προσεγγίσεις όπως το έγγραφο του 2017 Ανεπίσημη Μάθηση Οπτικών Αναπαραστάσεων με την Επίλυση Παζλ Jigsaw χρησιμοποίησαν αυτήν την είδους ενισχυμένη προσέγγιση με λιγότερη επιτυχία, σε συνδυασμούς νευρωνικών δικτύων (CNNs), một αρκετά διαφορετική αρχιτεκτονική σε σύγκριση με ένα σύγχρονο MLLM.

Από την κυκλοφορία του 2017 ‘Ανεπίσημη Μάθηση Οπτικών Αναπαραστάσεων με την Επίλυση Παζλ Jigsaw ‘, ένα πρώιμο παράδειγμα της χρήσης της καταστροφής ως μια ανταμοιβή-βασισμένη πρόκληση για ένα νευρωνικό σύστημα. Πηγή: https://arxiv.org/pdf/1603.09246
Σε δοκιμές, το Visual Jigsaw οδήγησε σε αυτά που οι συγγραφείς ισχυρίζονται ότι είναι συνεχείς και μετρήσιμες βελτιώσεις σε ένα ευρύ φάσμα βεντς: η εργασία jigsaw εικόνας βελτίωσε την λεπτομερή αντίληψη, την χωρική διάταξη και τη συνθετική συλλογιστική· η εργασία jigsaw βίντεο ενίσχυσε την ικανότητα του μοντέλου να ακολουθεί χρονικές ακολουθίες και να συλλογίζεται για τη σειρά των γεγονότων· και η εργασία jigsaw 3D ενίσχυσε την κατανόηση βάθους και τη χωρική συλλογιστική χρησιμοποιώντας μόνο RGB-D εισαγωγές.
Σε όλες τις τρεις modalities, το έγγραφο επαναλαμβάνει, η νέα μέθοδος υπερέβη πολλές ανταγωνιστικές βάσεις, παρά το γεγονός ότι δεν απαιτούνται αρχιτεκτονικές αλλαγές, επιπλέον οπτικών μονάδων ή πρόσθετα εποπτευόμενα δεδομένα:
‘Εκτεταμένες πειραματικές δοκιμές δείχνουν σημαντικές βελτιώσεις στην λεπτομερή αντίληψη, τη χρονική συλλογιστική και την 3D χωρική κατανόηση. Τα ευρήματά μας υπογραμμίζουν το δυναμικό των αυτο-επιτηρούμενων οπτικών εργασιών στην μετά-εκπαίδευση των MLLMs και στοχεύουν να εμπνεύσουν περαιτέρω έρευνα στις οπτικές προειδοποιητικές σχεδιαστικές.’
Το νέο έγγραφο ονομάζεται Visual Jigsaw Μετά-Εκπαίδευση Βελτιώνει τα MLLMs, και προέρχεται από έξι ερευνητές σε τρία πανεπιστήμια και ερευνητικά ιδρύματα. Το έγγραφο συνοδεύεται από einen ιστότοπο του έργου με ζωντανούς δείκτες (και μπορείτε ακόμη και να φορτώσετε τη δική σας εικόνα στο δείκτη jigsaw εικόνας). Ο κώδικας και τα βαρίδια για το έργο έχουν γίνει γενικά διαθέσιμα,
Μέθοδος
Αν και θα εξετάσουμε τον τρόπο με τον οποίο οι πληροφορίες χωρίζονται για να ταιριάζουν στις τρεις δοκιμασμένες modalities, πρέπει πρώτα να εξετάσουμε το σχεδιασμό της ανταμοιβής για το νέο σύστημα.
Η προσέγγιση του Visual Jigsaw αξιολογεί τις απαντήσεις του μοντέλου χρησιμοποιώντας μια βαθμιαία ανταμοιβή, όχι απλώς ένα απλό πέρασμα ή αποτυχία. Αν το μοντέλο προβλέψει την ακριβή σωστή σειρά των κομματιών του παζλ, λαμβάνει πλήρη ανταμοιβή· αν η απάντηση είναι κυρίως σωστή, αλλά όχι τέλεια, το μοντέλο λαμβάνει μερική πίστωση, κλιμακωμένη από έναν παράγοντα έκπτωσης για να αποφευχθεί η υπερτίμηση των近-misses (αυτό αποτρέπει το μοντέλο από το να εξαπατά το σύστημα με την επανάληψη των γνώσεων που είναι μόνο μερικά σωστές).
Ανεπίσημες απαντήσεις, όπως η «απάτη» της χρήσης του ίδιου αριθμού επανειλημμένα, λαμβάνουν μια βαθμολογία του μηδενός. Για να ενθαρρύνει τη συνεχή μορφοποίηση, το μοντέλο πρέπει να τοποθετήσει τη συλλογιστική του μέσα σε <think> ετικέτες και την τελική του απάντηση μέσα σε <answer> ετικέτες. Λαμβάνει μια μικρή μπόνους αν αυτή η μορφοποίηση χρησιμοποιείται σωστά.
Εικόνες
Για να δημιουργηθεί ένα παζλ για την εικόνα modality, μια εικόνα χωρίζεταιまず σε ένα πλέγμα τμημάτων με το να κοπεί σε ίσα μεγέθη μπλοκ:

Παραδείγματα εικόνων-μπατσοτίνι για το σύστημα να λύσει.
Τα τμήματα τοποθετούνται σε μια σταθερή σειρά από πάνω-αριστερά προς κάτω-δεξιά, όπως με την σειρά ανάγνωσης σε μια σελίδα, πριν ανακατευτούν με μια τυχαία ανακατάταξη. Το μοντέλο εκτίθεται στη συνέχεια σε αυτήν την ανακατεμένη σειρά τμημάτων και πρέπει να καταλάβει την αρχική σειρά προβλέποντας τη σωστή ανακατάταξη που αποκαθιστά την αρχική διάταξη.
Στην εκπαίδευση, 118.000 εικόνες από το COCO dataset χρησιμοποιήθηκαν, με κάθε εικόνα να παράγει εννέα τμήματα (δηλαδή, ‘κομμάτια του παζλ’). Η πρόκληση που δόθηκε στο σύστημα εμφανίζεται νωρίτερα σε αυτό το άρθρο (η εικόνα με την υπογραφή που αρχίζει ‘Από το νέο έγγραφο’).
Βίντεο
Για την εργασία jigsaw βίντεο, ένα βίντεο χωρίζεται σε μια ακολουθία κλιπ με το να κοπεί ισομερώς στον χρόνο, και στη συνέχεια ανακατεύεται τα κλιπ. Το μοντέλο δείχνεται στη συνέχεια αυτήν την ανακατεμένη ακολουθία και πρέπει να καταλάβει τη σωστή χρονική τους σειρά.

Συντομευμένα παραδείγματα της πρόκλησης jigsaw βίντεο, από το υλικό του εγγράφου.
Η εκπαίδευση για αυτήν τη modality χρησιμοποιήθηκε 100.000 βίντεο από το LLaVA-Video dataset, με κάθε βίντεο να χωρίζεται σε έξι κλιπ. Για να αποτρέψουν το μοντέλο από το να εκμεταλλευτεί τα προφανή frame-συνάψεις στα όρια των κλιπ, 5% των πλαισίων στην αρχή και το τέλος κάθε κλιπ κόπηκαν.
Τα κλιπ περιείχαν το πολύ 12 πλαισιά, κάθε ένα με μέγιστη ανάλυση 128x28x28 pixels. Βίντεο που ήταν μικρότερα από 24 δευτερόλεπτα αποκλείστηκαν.
Η πρόκληση για αυτήν την εργασία εμφανίζεται παρακάτω:

Η πρόκληση ενισχυμένης μάθησης που παρουσιάζεται στο MLLM για την εργασία βίντεο, χωρίς τα κλιπ που θα είχαν παρουσιαστεί στο MLLM..
3D Δεδομένα
Μια πλήρης εργασία jigsaw 3D θα συνήθως περιλαμβάνει το να σπάσει ένα 3D χώρο (όπως voxel μπλοκ ή point cloud θραύσματα) σε μικρότερα κομμάτια και να εκπαιδεύσει ένα μοντέλο να ανακατασκευάσει την αρχική χωρική διάταξή τους.
Ωστόσο, το μέσο MLLM δεν είναι εξοπλισμένο για να χειριστεί trực tiếp 3D δεδομένα, αλλά αντίθετα βασίζεται σε σημασιολογικά ερμηνευμένες εικόνες ή βίντεο εισαγωγές. Για αυτό, για να δημιουργηθεί μια εργασία που εξακολουθεί να αξιοποιεί τη χωρική συλλογιστική ενώ παραμένει συμβατό με τα τρέχοντα MLLMs, οι συγγραφείς εισήγαγαν μια πιο εφικτή παραλλαγή χρησιμοποιώντας τις προαναφερθείσες RGB-D εικόνες (δηλαδή, 2D εικόνες που περιλαμβάνουν πληροφορίες βάθους για κάθε pixel).

Παραδείγματα ερωτήσεων από το 3D Spatial Understanding Benchmark που χρησιμοποιήθηκε για την αξιολόγηση της απόδοσης στη σχετική οπτική και κίνηση της κάμερας. Το μοντέλο 3D Jigsaw σωστά υποδηλώνει τόσο τη χωρική σχέση μεταξύ δύο προοπτικών μιας σκηνής όσο και τη πιθανή κατεύθυνση της κίνησης της κάμερας, υπερβαίνοντας την βάση Qwen2.5-VL-7B.
Από κάθε RGB-D εικόνα, το μοντέλο δίνεται μια ανακατεμένη λίστα σημείων που αρχικά είχαν διαφορετικά βάθη, που κυμαίνονται από κοντά σε μακρινά, με στόχο να ανακατασκευάσει τη σωστή σειρά βάθους χρησιμοποιώντας μόνο την 2D εικόνα ως αναφορά:

Η πρόκληση RL για το jigsaw 3D.
Κάθε σημείο σημειώνεται στην εικόνα (η οποία εμφανίζεται στο μοντέλο, αλλά δεν απεικονίζεται στο παράδειγμα της πρόκλησης στην εικόνα πάνω), και το μοντέλο πρέπει να προβλέψει ποιο ήταν το κοντινότερο, δεύτερο κοντινότερο, και ούτω καθεξής, αποτελώντας στην πραγματικότητα την αρχική σειρά βάθους χωρίς πρόσβαση στις ακατέργαστες τιμές βάθους.
Η εργασία jigsaw 3D εκπαιδεύτηκε σε RGB-D εικόνες από το ScanNet dataset, χρησιμοποιώντας 300.000 δείγματα που δημιουργήθηκαν με την επιλογή τυχαίων συνόλων έξι σημείων βάθους ανά εικόνα.

Παραδείγματα σημειακών νεφών από το ScanNet dataset που χρησιμοποιήθηκαν στην εργασία jigsaw 3D. Πηγή: https://arxiv.org/pdf/1702.04405
Κάθε σημείο απαιτείτο να βρίσκεται σε ένα εύρος βάθους 0,1 έως 10 μέτρων, και για να προωθήσει τη đa dạngία, κανένα δύο σημεία σε ένα σύνολο δεν επιτρεπόταν να είναι πιο κοντά από 40 pixels στην επιφάνεια της εικόνας ή λιγότερο από 0,2 μέτρα μακριά σε βάθος.
Δοκιμές
Για τις αρχικές δοκιμές, το σύστημα χρησιμοποίησε το Qwen2.5-VL-7B-Instruct ως τη βάση του μοντέλου πολυμεσικής μεγάλης γλώσσας. Η εκπαίδευση χρησιμοποίησε τον αλγόριθμο Group Relative Policy Optimization (GRPO), με την απαίτηση να αφαιρεθούν τόσο η KL κανονικοποίηση όσο και η απώλεια εντροπίας.
Για μερικές προβλέψεις, ένας παράγοντας έκπτωσης 0,2 εφαρμόστηκε. Η εκπαίδευση jigsaw εικόνας χρησιμοποίησε ένα παγκόσμιο μέγεθος δέσμης 256, ενώ τα jigsaw βίντεο και 3D χρησιμοποίησαν 128. Η ταχύτητα μάθησης ορίστηκε σε 1×10⁻⁶.
Για κάθε πρόκληση, το μοντέλο παρήγαγε 16 απαντήσεις σε μια θερμοκρασία αποκωδικοποίησης 1,0. Και οι εργασίες jigsaw εικόνας και βίντεο εκπαιδεύτηκαν για 1.000 βήματα, ενώ η εργασία jigsaw 3D εκπαιδεύτηκε για 800 βήματα.
Image Jigsaw
Το μοντέλο jigsaw εικόνας δοκιμάστηκε σε τρεις κατηγορίες οπτικών βεντς: για την λεπτομερή αντίληψη και κατανόηση, MMVP, το υποσύνολο λεπτομερούς αντίληψης του MMStar; MMBench; HR-Bench; V*; MME-RealWorld (lite); LISA-Grounding; και OVD-Eval.
Για την μονοπτική χωρική κατανόηση, τα βenchmark ήταν VSR; OmniSpatial; και Depth Anything V2 (DA-2K). Για τη συνθετική οπτική κατανόηση, οι δοκιμές χρησιμοποίησαν Winoground και SugerCrepe++.
Τρεις βάσεις δοκιμάστηκαν, όλες παραγόμενο από το Qwen2.5-VL-7B: ThinkLite-VL για πολυμεσική συλλογιστική; VL-Cogito για γενικές οπτικές και επιστημονικές εργασίες; και LLaVA-Critic-R1 για αντίληψη εικόνας.
Όλες αξιολογήθηκαν χρησιμοποιώντας μόνο σύντομες απαντήσεις,既然 αλυσίδα συλλογισμού (CoT) συλλογιστική μερικές φορές μειώνει την απόδοση.

Αποτελέσματα αξιολόγησης σε βenchmark εικόνας. Το Image Jigsaw βελτίωσε την απόδοση στην βάση Qwen2.5-VL-7B σε όλες τις κατηγορίες εργασιών (δηλαδή, λεπτομερή αντίληψη και κατανόηση; μονοπτική χωρική κατανόηση; και συνθετική οπτική συλλογιστική), υπερβαίνοντας τις προηγούμενες βάσεις μετά-εκπαίδευσης.
Από τα αποτελέσματα της εργασίας jigsaw εικόνας, που εμφανίζονται παραπάνω, οι συγγραφείς αναφέρουν:
‘[Η εικόνα πάνω] δείχνει ότι η μέθοδός μας συνεχώς βελτιώνει τις οπτικές ικανότητες στα τρία είδη βεντς. Αυτά τα αποτελέσματα επιβεβαιώνουν ότι η ενσωμάτωση της εργασίας jigsaw εικόνας στην μετά-εκπαίδευση σημαντικά ενισχύει την οπτική ερμηνεία και τη λεπτομερή οπτική κατανόηση των MLLMs πέρα από τις στρατηγικές μετά-εκπαίδευσης που εστιάζουν στη συλλογιστική.’
‘Αποδίδουμε αυτές τις βελτιώσεις στο γεγονός ότι η επίλυση της εργασίας jigsaw εικόνας απαιτεί από το μοντέλο να προσεγγίσει τα τοπικά λεπτομέρειες των τμημάτων, να συναγάγει τις.global χωρικές διατάξεις και να συλλογιστεί τις σχέσεις μεταξύ τμημάτων, τα οποία απευθείας ωφελούν την λεπτομερή, χωρική και συνθετική κατανόηση.’
Video Jigsaw
Για την εργασία jigsaw βίντεο, η αξιολόγηση διεξήχθη σε AoTBench; Vinoground; TOMATO; FAVOR-Bench; TUNA-Bench; Video-MME; TempCompass; TVBench; MotionBench; LVBench; VSI-Bench; Video-TT; και CVBench.
Video-R1 χρησιμοποιήθηκε ως βάση, έχοντας εκπαιδευτεί με ψύχραιμη επωπτευμένη μερική εκπαίδευση ακολουθούμενη από ενισχυμένη μάθηση για κατανόηση και συλλογιστική βίντεο. Σε αυτήν την περίπτωση, οι αξιολογήσεις περιελάμβαναν την πλήρη διαδικασία συλλογισμού,既然 αυτό συνήθως παρήγαγε καλύτερα αποτελέσματα από τις απευθείας απαντήσεις.
Όλα τα μοντέλα περιορίστηκαν σε 256x28x28 pixels, και δοκιμάστηκαν σε τρεις ρυθμίσεις πλαισίων – 16, 32, και 64:

Αποτελέσματα αξιολόγησης σε βenchmark βίντεο, με το Video Jigsaw να υπερβαίνει τη βάση σε όλες τις εργασίες και ρυθμίσεις πλαισίων.
Το Video Jigsaw παρήγαγε συνεχείς βελτιώσεις σε όλα τα βenchmark βίντεο και ρυθμίσεις πλαισίων, με κέρδη ιδιαίτερα ισχυρά σε εργασίες που απαιτούν χρονική συλλογιστική και κατεύθυνση, όπως αυτές στο AoTBench, και επίσης σε δια-βίντεο εργασίες, όπως αυτές στο CVBench:
‘Αυτά τα αποτελέσματα επιβεβαιώνουν ότι η επίλυση εργασιών jigsaw βίντεο ενθαρρύνει το μοντέλο να καταλάβει καλύτερα τη χρονική συνέχεια, να κατανοήσει τις σχέσεις μεταξύ βίντεο, να συλλογιστεί για τη κατευθυντική συνέπεια και να γενικεύσει σε ολιστικές και γενικεύσιμες σκηνές κατανόησης βίντεο.’
3D Δεδομένα
Για την modality 3D, το μοντέλο αξιολογήθηκε σε SAT-Real; 3DSRBench; ViewSpatial; All-Angles; το προαναφερθέν OmniSpatial; VSI-Bench; SPARBench (tiny); και το προαναφερθέν DA-2K.

Αποτελέσματα αξιολόγησης σε βenchmark 3D: το 3D Jigsaw βελτίωσε την απόδοση σε εργασίες σύγκρισης βάθους όπως το DA-2K, καθώς και σε ευρύτερα βenchmark 3D αντίληψης που καλύπτουν μονό-προοπτική, multi-προοπτική και egocentric βίντεο εισαγωγές.
Εδώ οι συγγραφείς αναφέρουν:
‘[3D] Jigsaw επιτυγχάνει σημαντικές βελτιώσεις σε όλα τα βenchmark. Όπως ήταν αναμενόμενο, η μεγαλύτερη βελτίωση είναι στο DA-2K, ένα βenchmark εκτίμησης βάθους που σχετίζεται trực tiếp με την εργασία προ-εκπαίδευσης μας. Πιο σημαντικά, παρατηρούμε συνεχείς βελτιώσεις σε ένα ευρύ φάσμα άλλων εργασιών, συμπεριλαμβανομένων εκείνων με μονό-προοπτική (π.χ. 3DSRBench, [OmniSpatial]), multi-προοπτική (π.χ. ViewSpatial, All-Angles), και egocentric βίντεο εισαγωγές (π.χ. VSI-Bench).
‘Αυτά τα αποτελέσματα δείχνουν ότι η προσέγγισή μας δεν διδάσκει μόνο την ειδική ικανότητα της σειράς βάθους, αλλά επίσης ενισχύει την γενική ικανότητα του μοντέλου να αντιλαμβάνεται και να συλλογίζεται τη 3D χωρική δομή.’
Συμπέρασμα
Τι δεν είναι εντελώς σαφές από αυτό το έγγραφο είναι η ακριβής σχέση μεταξύ εικόνων και περιγραφών που ενισχύει αυτήν την βελτίωση της απόδοσης των MLLMs.
Σε πρώτη ματιά, η διαδικασία της μάθησης μέσω της επίλυσης παζλ φαίνεται πολύ ανάλογη με τις πρώτες μας προσπάθειες και ανάπτυξη. Ωστόσο, η δική μας χωρική ερμηνεία του κόσμου φαίνεται πιο αυθόρμητη και λιγότερο σχετική με τη γλώσσα, και μια πιο προσεκτική ματιά στο έγγραφο αποκαλύπτει το βαθμό στο οποίο η γλώσσα υπηρετεί τα MLLMs ως μια ενδιαφέρουσα γέφυρα μεταξύ οπτικών και σημασιολογικών πραγματικοτήτων.
* Παρακαλούμε σημειώστε ότι οι συγγραφείς του εγγράφου προτιμούν τον λιγότερο συνηθισμένο όρο ‘Μοντέλα Πολυμεσικής Μεγάλης Γλώσσας’, συντομευμένα σε ‘MLLMs’. Αυτός είναι ένας αναπτυσσόμενος ή σπάνια χρησιμοποιούμενος όρος, και εφαρμόζεται σε μοντέλα που μπορούν να εκτενώς συλλογιστεί και αναλύσουν εικόνες χωρικά, αλλά που δεν παράγουν εικόνες. Όπως αναπτύσσονται νέες παραδείγματα και μοντέλα, αυτό το λεξιλόγιο βρίσκεται συνεχώς υπό αναθεώρηση.
Πρώτη δημοσίευση Πέμπτη, 2 Οκτωβρίου 2025












