Η γωνία του Anderson
Το AI είναι σημαντικά χειρότερο από τους ανθρώπους στη συναρμολόγηση επίπλων

Το ChatGPT και το Google Gemini δεν μπορούν ακόμη να κατανοήσουν με συνέπεια τα βίντεο συναρμολόγησης της IKEA, ενώ άλλα προεξάρχοντα συστήματα AI συγχέουν τα μέρη, χάνουν τις συνδέσεις και χρησιμοποιούν ελάχιστα το βίντεο για να κατανοήσουν τι συμβαίνει.
Ο διαρκής πολιτισμικός μύθος γύρω από τη δυσκολία συναρμολόγησης επίπλων τύπου IKEA καθιστά το θέμα ένα ελκυστικό στόχο για την έρευνα υπολογιστικής όρασης — όχι τουλάχιστον επειδή οι μακρές ακολουθίες ενεργειών, η παρακολούθηση αντικειμένων και η χωρική λογική που εμπλέκονται θα οδηγήσουν τα συστήματα ρομποτικής χειραφεσίας πέρα από τις απλοποιημένες μορφές και τους ελεγχόμενους περιβάλλοντες στους οποίους είναι συνηθισμένα.
Επομένως, η εργασία για τη δημιουργία AI-ενισχυμένων ρομποτικών διαδικασιών συναρμολόγησης για επίπλωση τύπου flat-pack έχει γίνει ένας μικρός αλλά σεβαστός κλάδος στη βιβλιογραφία, με εξόδους όπως το Περιβάλλον Συναρμολόγησης Επίπλων IKEA του USC το 2019, μεταξύ των πρώτων συνόλων δεδομένων και ερευνών που στοχεύουν ειδικά στη συναρμολόγηση επίπλων:
[βίντεο πλάτους=”1204″ ύψους=”888″ mp4=”https://www.unite.ai/wp-content/uploads/2026/05/IKEA-Furniture-Assembly-Environment_encoded.mp4″ loop=”true”][/βίντεο]
Πατήστε για αναπαραγωγή Παραδείγματα πρακτικής συναρμολόγησης ρομποτικών, από την ιστοσελίδα του έργου για την πρωτοβουλία του 2019 Περιβάλλον Συναρμολόγησης Επίπλων IKEA. Πηγή
Το 2024, η συνεργασία Stanford/J.P. Morgan Εγχειρίδια IKEA στη Δουλειά ήταν η πρώτη που εξέτασε σημαντικά την ικανότητα του AI να αναλάβει αυτή τη φαινομενικά κοινή (αν και συχνά εκνευριστική) διαδικασία, με βάση ένα νέο σύνολο δεδομένων εικόνων από εγχειρίδια οδηγιών και χρησιμοποιώντας βίντεο οδηγιών:
[λεπτομέρεια id=”attachment_424150″ align=”alignnone” πλάτους=”905″]
Οι συγγραφείς του εγγράφου του 2024 – που αξιοποίησαν DGCNN, CNOS, SAM-6D, MegaPose, MiDaS, SAM2 Hiera-L, Cutie-base, και GPT-4o – κατέληξαν στο συμπέρασμα ότι η εργασία παρήγαγε ‘σημαντικές προκλήσεις στην εναπόθεση βίντεο συναρμολόγησης, συμπεριλαμβανομένης της εξαγωγής τμημάτων και θέσεων, της κατασκευής υψηλού επιπέδου σχεδίων συναρμολόγησης και της ανίχνευσης κλειδιών βημάτων συναρμολόγησης σε βίντεο’.
Βάλε κερί, βάλε κερί
Πρέπει να είναι προφανές ότι, ενώ η αυτοματοποίηση μας από μια εργασία που λίγοι λαχταρούν θα ήταν ωραία, δεν είναι научικό οδηγό, ή υψηλό σε μια λίστα προτεραιοτήτων για τον τομέα της έρευνας υπολογιστικής όρασης.
Αντίθετα, η αξία της εργασίας έγκειται στο γεγονός ότι αυτό που τα συστήματα AI πρέπει να μάθουν για να γίνουν ικανά σε αυτό θα τα εδραιώσει για πολύ πιο σοβαρές διαδικασίες που είναι εξίσου ή ακόμη πιο απαιτητικές, στη γεωργία, στη βιομηχανία, στον τομέα των υπηρεσιών και σε διάφορους άλλους τομείς.
Σε αυτή τη γραμμή, το έργο LEGO-Puzzles και το σύνολο δεδομένων εξετάζει πώς καλά τα Μοντέλα Γλώσσας Όρασης (VLMs) χειρίζονται τη χωροχρονική λογική σε πολλαπλά βήματα, σε eine σειρά αρχιτεκτονικών,既然 η συναρμολόγηση εξαρτάται όχι μόνο από το ζευγάρωμα των σωστών αντικειμένων μαζί στη σωστή στιγμή – μια διαδικασία γνωστή ως ζευγάρωμα – αλλά και από την ακολουθία οδηγιών που μπορεί να είναι πολύ πιο αφηρημένες από την ακατέργαστη οπτική σκηνή που είναι διαθέσιμη στο μοντέλο σε οποιοδήποτε δεδομένο βήμα:
[λεπτομέρεια id=”attachment_424151″ align=”alignnone” πλάτους=”1017″]
Το τελευταίο έργο που αντιμετωπίζει την πρόκληση της συναρμολόγησης επίπλων εκμεταλλεύεται ένα πιο τρέχον και ικανό σωρό μοντέλων AI, συμπεριλαμβανομένων των Google Gemini 2.5/3.1 και OpenAI’s GPT-5 – αλλά εξακολουθεί να μην επιτυγχάνει μια νίκη για το AI στη διαδικασία, με μόνο μετριοπαθείς βελτιώσεις πάνω από την τυχαία ευκαιρία, και απόδοση ‘πολύ κάτω από τα επίπεδα των ανθρώπων’.
Οι συγγραφείς δηλώνουν:
‘Οι πειραματικές μας μελέτες αποκαλύπτουν ότι τα μοντέλα LVLMs έχουν σημαντικές δυσκολίες στη λεπτομερή χωροχρονική λογική, υπογραμμίζοντας τις περιορισμοί τους στην αποτελεσματική αξιοποίηση των χρονικών πληροφοριών από τα βίντεο, την περιορισμένη ικανότητα παρακολούθησης και την κατανόηση των χωρικών αλληλεπιδράσεων όπως η φυσική επαφή.’
Τα προβλήματα που αντιμετωπίζονται σε αυτή τη γραμμή της έρευνας είναι μόνο νομιζόμενα σχετικά με την πρακτική ρομποτική σε αυτό το στάδιο, αν και πρόσθετες προκλήσεις σίγουρα περιμένουν όταν τα θεωρητικά ζητήματα τελικά εξελίσσονται σε ενσωματωμένο AI.
Το νέο έγγραφο έχει τον τίτλο Πλατύ Παγκάκι: Αξιολόγηση Χωροχρονικής Κατανόησης σε Μεγάλα Μοντέλα Όρασης-Γλώσσας μέσω Συναρμολόγησης Επίπλων, και προέρχεται από οκτώ συγγραφείς από το Πανεπιστήμιο Κορνέλ, το Cornell Tech, το MBZUAI και το UC Berkeley. Το έγγραφο συνοδεύεται από μια ιστοσελίδα του έργου.
Μέθοδος
Οι συγγραφείς της νέας εργασίας τονίζουν τη δυσκολία που έχουν τα βοηθήματα AI στην κατανόηση της διαδικασίας συναρμολόγησης μέσω παρατήρησης, για παράδειγμα, μέσω του είδους βίντεο οδηγιών τύπου YouTube που πολλοί άνθρωποι στρέφονται για να επωφεληθούν από τις γνώσεις της κοινότητας:
[λεπτομέρεια id=”attachment_424152″ align=”alignnone” πλάτους=”1200″]
Εξέλεξαν ένα σύνολο δεδομένων φιλτραρισμένο από το προαναφερθέν σύνολο δεδομένων IKEA-Manuals-at-Work (IMaW) σύνολο δεδομένων, το οποίο περιλαμβάνει βίντεο στην άγρια φύση των ανθρώπων που συναρμολογούν επίπλωση IKEA. Το αναθεωρημένο σύνολο δεδομένων αφαιρεί τα πρωτότυπα βίντεο για να αφαιρέσει τις κάρτες οδηγιών μόνο κειμένου, με ξεχωριστά key-frame και πλήρη βίντεο παραλλαγές, και επίσης προσθέτει χειρονομικά-annotated οπτικές προτροπές με τμηματικά μέρη επίπλων, για να υποστηρίξει πολλαπλής επιλογής εργασίες λογικής.
Το σύνολο δεδομένων περιστρέφεται γύρω από τέσσερις τύπους ερωτημάτων: Ζευγάρωμα, που καθορίζει εάν δύο μέρη είναι συνδεδεμένα στη τελική συναρμολόγηση; Παρακολούθηση, που απαιτεί τα μοντέλα να ανακτήσουν τη σωστή αντιστοιχία μεταξύ shuffled part IDs σε τμηματικά πλαισιά; ΤOrd, που αξιολογεί εάν τα μοντέλα μπορούν να συναγάγουν τη σωστή σειρά των συμβάντων σύνδεσης; και TLoc, που δοκιμάζει εάν τα μοντέλα μπορούν να αναγνωρίσουν τα γεγονότα που συμβαίνουν αμέσως πριν ή μετά την κατάσταση που εμφανίζεται στην οπτική προτροπή, απαιτώντας χρονική τοποθέτηση και λογική για τα γειτονικά γεγονότα.
[λεπτομέρεια id=”attachment_424153″ align=”alignnone” πλάτους=”1024″]
Οι προτύποι που εμφανίζονται στην εικόνα του σχήματος παραπάνω προέρχονται από αυτούς τους τέσσερις τύπους ερωτημάτων.
Οι συγγραφείς σημειώνουν επίσης ότι πρόσθεσαν λεπτομερείς αναnotaσεις συναρμολόγησης μερών σε κάθε ένα από τα πρωτότυπα βίντεο IMaW, που καθορίζουν ποια μέρη συνδέονται με ποια άλλα μέρη – λεπτομέρειες που λείπουν από την αρχική συλλογή.
Αποφυγή
Τα ερωτήματα, σημειώνει το έγγραφο, χρειάστηκε να γίνουν χειρονομικά,既然 τα αυτο-δημιουργημένα ερωτήματα συχνά δίνουν στο AI την ευκαιρία να αγνοήσει το βίντεο και να εκμεταλλευτεί τις δικές του συντομεύσεις – μια σκηνή που οποιοσδήποτε τακτικός χρήστης των LLMs/VLMs είναι πιθανό να αναγνωρίσει,既然 η βελτιστοποίηση και άλλες μυστηριώδεις εταιρικές προτεραιότητες συχνά οδηγούν τα μοντέλα να αγνοήσουν τις υποβεβλημένες πληροφορίες, όπως PDF ή εικόνες, και να βασιστούν στις δικές τους γνώσεις αντί για αυτό:
‘[Βρήκαμε ότι] η αυτο-δημιουργία συχνά παρήγαγε ερωτήματα που μπορούσαν να απαντηθούν αγνοώντας το βίντεο και εκμεταλλευόμενα συντομεύσεις. Για παράδειγμα, αυτο-δημιουργημένα ζευγάρωμα ερωτήματα για μέρη που ήδη τοποθετήθηκαν για σύνδεση, ή περιλάμβαναν distractor επιλογές με σαφώς διαφορετικά σχήματα ή χρώματα, επιτρέποντας εύκολη [αποβολή]. Για να αντιμετωπίσουμε αυτό, ε乂χρησιμοποιήσαμε χειρονομικά όλα τα ερωτήματα χρησιμοποιώντας σταθερά προτύπα.
‘Οι annotators παρέχθηκαν το πλήρες βίντεο συναρμολόγησης, τμηματικά πλαισιά για οπτικές προτροπές, τα προτύπα ερωτημάτων, και λεπτομερείς οδηγίες για την αποφυγή συντομεύσεων με βάση στατικές ενδείξεις από την οπτική προτροπή.’
Το ολοκληρωμένο σύνολο δεδομένων αποτελείται από 602 ερωτήματα πολλαπλής επιλογής σε 50 διαφορετικά βίντεο συναρμολόγησης επίπλων.
Δεδομένα και Δοκιμές
Τα μοντέλα που αξιολογήθηκαν για τη δοκιμή περιλαμβάνουν τα προαναφερθέντα ChatGPT και Gemini variants, καθώς και Video-LLaVA; LLaVA-NeXT-Vid; LLaVA-OneVision; LLaVA-Video; Qwen 2.5/Qwen 3-VL; InternVL3; ArrowRL; PerceptionLM; και Video-Refer.
GenS χρησιμοποιήθηκε για να επιλέξει ερωτήματα-σχετικά πλαισιά σε μακρά βίντεο για το βασικό μοντέλο Gemini 2.5 Pro, και τα περισσότερα μοντέλα δοκιμάστηκαν σε μια-πυροσβόλη-πρόκληση υπό απληστία-αποκωδικοποίηση (απραγματοποίητο στο GPT-5, ωστόσο).
Τρεις μορφές προτύπων σχεδιάστηκαν για το σύνολο δεδομένων: το μεικτό-μέσο πρότυπο παρείχε την οπτική προτροπή ως ξεχωριστή εικόνα δίπλα στο βίντεο συναρμολόγησης; το κολάζ πρότυπο ενσωμάτωσε την οπτική προτροπή απευθείας σε κάθε πλαισίο βίντεο ως μέρος μιας διάταξης πλέγματος; και το συνδυασμένο πρότυπο προέθεσε τις οπτικές προτροπές στην αρχή του βίντεο.
Και οι δύο πλήρεις και key-frame παραλλαγές του βίντεο δοκιμάστηκαν σε αυτές τις μορφές, για να μετρηθεί πόσο ισχυρά η δομή προτύπου και η χρονική συμπίεση θα επηρεάσουν την απόδοση του μοντέλου.
Οι τυχαίες βάσεις που εξετάστηκαν για τις δοκιμές περιλαμβάνουν επίσης ‘συχνότητα-τυχαία’, όπου η πιο συχνή επιλογή (αντί για μια πραγματικά τυχαία επιλογή) επιλέγεται.
Ανθρώπινη Παράμετρος
Η ανθρώπινη απόδοση αξιολογήθηκε χρησιμοποιώντας συμμετέχοντες από προγράμματα επιστημών υπολογιστών, που κυμαίνονται από προπτυχιακό έως διδακτορικό επίπεδο. Κάθε συμμετέχων έδειξε ένα βίντεο συναρμολόγησης, και την αντίστοιχη οπτική προτροπή και ερώτημα πολλαπλής επιλογής, καθώς και την οδηγία εργασίας, πριν από την επιλογή μιας απάντησης.
Τρεις απαντήσεις συλλέχθηκαν ανά ερώτημα και επιλύθηκαν μέσω ψηφοφορίας πλειοψηφίας, ενώ μια ξεχωριστή μελέτη crowd-sourced διεξήχθη σε μια τυχαία δειγματοληψία του συνόλου δεδομένων.
Ακρίβεια χρησιμοποιήθηκε ως μετρική για τις δοκιμές:
| Μοντέλο | Κατάταξη | Μικρο-Μέσος | ΤOrd | ΤLoc | Παρακολούθηση | Ζευγάρωμα |
|---|---|---|---|---|---|---|
| Ανθρώπινη Απόδοση | – | 94.18 | 93.54 | 93.20 | 93.77 | 97.70 |
| Τυχαίες Βάσεις | ||||||
| Τυχαία Τύχη | – | 26.41 | 25.00 | 25.00 | 25.49 | 33.33 |
| Συχνότητα Τύχη | – | 26.74 | 27.74 | 30.10 | 26.46 | 36.78 |
| Ιδιωτικά Μοντέλα | ||||||
| GPT-5 | 1 | 37.71 | 40.65 | 53.40 | 25.68 | 49.43 |
| Gemini 2.5 Pro | 2 | 33.72 | 40.65 | 44.66 | 23.35 | 39.08 |
| Gemini 3.1 Pro | 3 | 32.89 | 34.84 | 43.69 | 21.79 | 49.43 |
| Gemini 2.5 Flash | 4 | 31.06 | 31.61 | 41.75 | 23.35 | 40.23 |
| Gemini 2.5 Pro + GenS | 5 | 25.58 | 33.55 | 32.04 | 13.23 | 40.23 |
| Ανοιχτά Μοντέλα | ||||||
| Video-LLaVA-7B | 26 | 23.75 | 21.29 | 35.92 | 10.89 | 51.72 |
| InternVL3-14B | 5 | 37.71 | 42.58 | 21.36 | 37.74 | 48.28 |
| InternVL3-38B | 12 | 36.05 | 42.58 | 37.86 | 25.68 | 52.87 |
| InternVL3-78B | 1 | 41.03 | 43.87 | 39.81 | 42.02 | 34.48 |
| Qwen2.5-VL-7B | 22 | 30.23 | 27.10 | 18.45 | 33.07 | 41.38 |
| Qwen2.5-VL-32B | 13 | 35.88 | 34.84 | 29.13 | 33.07 | 54.02 |
| Qwen2.5-VL-72B | 2 | 40.37 | 41.29 | 30.10 | 45.14 | 36.78 |
| Qwen3-VL-4B | 11 | 36.54 | 34.19 | 33.01 | 32.68 | 56.32 |
| Qwen3-VL-4B-Think | 9 | 37.21 | 31.61 | 25.24 | 37.74 | 59.77 |
| Qwen3-VL-8B | 15 | 33.72 | 36.13 | 30.10 | 33.85 | 33.33 |
| Qwen3-VL-8B-Think | 17 | 31.73 | 34.19 | 33.01 | 25.29 | 44.83 |
| Qwen3-VL-32B | 6 | 37.71 | 38.71 | 46.60 | 31.91 | 42.53 |
| Qwen3-VL-32B-Think | 3 | 40.03 | 38.71 | 22.33 | 45.53 | 47.13 |
| Qwen3-VL-30B-A3B | 10 | 36.71 | 30.32 | 22.33 | 42.02 | 49.43 |
| Qwen3-VL-235B-A22B | 8 | 37.21 | 37.42 | 25.24 | 39.69 | 43.68 |
| LLaVA-NeXT-Vid-7B | 25 | 25.08 | 33.55 | 24.27 | 16.73 | 35.63 |
| LLaVA-NeXT-Vid-34B | 21 | 30.40 | 30.32 | 24.27 | 32.68 | 31.03 |
| LlaVA-OneVision-7B | 16 | 32.89 | 26.45 | 30.10 | 34.24 | 43.68 |
| LlaVA-OneVision-72B | 4 | 38.37 | 35.48 | 25.24 | 38.91 | 57.47 |
| LLaVA-Video-7B | 19 | 30.73 | 30.97 | 24.27 | 25.68 | 52.87 |
| LLaVA-Video-72B | 7 | 37.54 | 36.77 | 27.18 | 35.80 | 56.32 |
| Perception-LM-1B | 24 | 27.74 | 28.39 | 26.21 | 25.29 | 35.63 |
| Perception-LM-3B | 18 | 31.40 | 28.39 | 32.04 | 29.96 | 40.23 |
| Perception-LM-8B | 14 | 35.38 | 26.45 | 26.21 | 44.75 | 34.48 |
| VideoRefer | 23 | 28.57 | 32.90 | 30.10 | 17.51 | 51.72 |
| ArrowRL-7B | 20 | 30.56 | 30.97 | 24.27 | 29.18 | 41.38 |
Αποτελέσματα απόδοσης στο FLAT-PACK BENCH, συγκρίνοντας ιδιωτικά και ανοιχτά μοντέλα πολυμεσικής πληροφόρησης σε εργασίες Χρονικής Σειράς, Χρονικής Τοποθέτησης, Παρακολούθησης και Ζευγαρώματος, με την ανθρώπινη απόδοση να παραμένει πολύ μπροστά από όλα τα μοντέλα που δοκιμάστηκαν, παρά τις μετριοπαθείς βελτιώσεις μεταξύ των μεγαλύτερων μοντέλων.
Όπως φαίνεται στις αρχικές δοκιμές (εικόνα παραπάνω), οι άνθρωποι σημείωσαν >90% σε όλες τις κατηγορίες ερωτημάτων, με 80% ομοφωνία, υποδεικνύοντας, όπως ισχυρίζεται το έγγραφο, ότι οι προτάσεις είναι καλά διατυπωμένες και αδιαμφισβήτητες.
Το GPT-5 και το Gemini 2.5/3.1 Pro δυσκολεύτηκαν στο σύνολο δεδομένων, επιτυγχάνοντας μόνο μετριοπαθείς βελτιώσεις πάνω από την τυχαία βάση, και παρέμειναν πολύ κάτω από την ανθρώπινη απόδοση. Η χρήση του GenS για την επιλογή ερωτήματος-σχετικών πλαισίων δεν βελτίωσε τα αποτελέσματα του Gemini 2.5 Pro, οδηγώντας τους συγγραφείς να καταλήξουν στο συμπέρασμα ότι τα ιδιωτικά LVLMs δυσκολεύονται με την εργασία της χωροχρονικής κατανόησης που απαιτείται από το σύνολο δεδομένων.
Μεταξύ των ανοιχτών συστημάτων, τα ισχυρότερα αποτελέσματα προήλθαν από τις οικογένειες InternVL3 και Qwen, αν και η απόδοση σε αυτή τη κατηγορία变ied Ostensively, με πολλά μοντέλα να υπερβαίνουν ελάχιστα την τυχαία βάση; και τα εξειδικευμένα συστήματα, συμπεριλαμβανομένων των PerceptionLM και VideoRefer, cũng δυσκολεύτηκαν στο σύνολο δεδομένων.
Οι ερευνητές επίσης δοκιμάστηκαν δύο strateγικές προτροπής αλυσίδας σκέψης ενάντια στη τυποποιημένη ρύθμιση προτροπής του εγγράφου. Zero-shot Chain-of-Thought προτροπή ζήτησε από τα μοντέλα να εξηγήσουν τις απαντήσεις τους βήμα προς βήμα, ενώ Συμφωνία με Chain-of-Thought παρήγαγε πέντε υποψήφιες απαντήσεις πριν από την επιλογή μιας τελικής απάντησης μέσω ψηφοφορίας πλειοψηφίας. Ωστόσο, καμία από τις δύο δεν βελτίωσε τα αποτελέσματα στο σύνολο δεδομένων Flat Pack Bench, με και τις δύο προσεγγίσεις να σημειώνουν χαμηλότερα από τη τυποποιημένη ρύθμιση προτροπής του συνόλου δεδομένων.
Κωδικός
Για να δοκιμάσουν εάν τα LVLMs ήταν πραγματικά μαθαίνοντας από τα βίντεο συναρμολόγησης, ή απλώς εκμεταλλεύονταν στατικές οπτικές συντομεύσεις, οι ερευνητές δημιούργησαν μια εικόνα-μόνο έκδοση του συνόλου δεδομένων, η οποία απέκλεισε το βίντεο εντελώς, διατηρώντας μόνο το κείμενο ερωτήματος και τις οπτικές προτροπές.
Η ανθρώπινη απόδοση κατέρρευσε πάνω από 50% υπό αυτές τις συνθήκες, δείχνοντας ότι οι εργασίες πραγματικά απαιτούν χρονική κατανόηση της διαδικασίας συναρμολόγησης. Τα μοντέλα, ωστόσο, χειροτέρεψαν πολύ λιγότερο σοβαρά, με ορισμένες εργασίες να παραμένουν σταθερές ή ακόμη και να βελτιώνονται χωρίς είσοδο βίντεο.
Αυτό υποδηλώνει, σύμφωνα με το έγγραφο, ότι πολλά LVLMs δεν χρησιμοποίησαν πραγματικά τις χρονικές πληροφορίες στα βίντεο καθόλου, αντίθετα βασίζονταν σε εικόνα-συντομεύσεις και κοινές γνώσεις για να συναγάγουν πιθανές απαντήσεις*:
[λεπτομέρεια id=”attachment_424154″ align=”alignnone” πλάτους=”762″]
‘[Η εικόνα παραπάνω] δείχνει την απόδοση του LVLM σε αυτή την εικόνα-μόνο έκδοση, και την αλλαγή στην απόδοσή τους από την αρχική αξιολόγηση, μαζί με την ανθρώπινη απόδοση.
‘Η απότομη πτώση της ανθρώπινης απόδοσης (>50%) δείχνει ότι τα ερωτήματα απαιτούν βίντεο για να απαντηθούν.
‘Παρατηρούμε επίσης ότι η συνολική απόδοση του μοντέλου πέφτει σοβαρά (8.80%), αλλά κυρίως λόγω της εργασίας Παρακολούθησης. Η ακρίβεια σε άλλες εργασίες παραμένει η ίδια ή βελτιώνεται, υποδεικνύοντας ότι το LVLM δεν χρησιμοποιεί το βίντεο αποτελεσματικά, ενώ οι άνθρωποι χρησιμοποιούν το βίντεο για να απαντήσουν.’
Η πιο sâuτική ανάλυση του εγγράφου υποδηλώνει ότι το κύριο εμπόδιο δεν είναι απλώς η χρονική σειρά, αλλά οι αποτυχίες στην εναπόθεση αντικειμένων και στη χωροχρονική λογική: τα μοντέλα συχνά δυσκολεύτηκαν να παρακολουθήσουν οπτικά-ομοιόμορφα μέρη επίπλων через κίνηση, αλλαγές κάμερας και αλλαγές σκηνής, ακόμη και όταν φαίνονταν να αναγνωρίζουν τη ευρύτερη διαδικασία συναρμολόγησης σωστά.
Επιπλέον πειράματα αφορούσαν την τοποθέτηση ενός εργαλειοφόρου AI σε αυτή τη διαδικασία, και αυτό ‘πραγματοποιήθηκε खरά’ σύμφωνα με τους συγγραφείς – αν και ήταν σε θέση να απαντήσει σωστά σε επιπλέον 11.48% των ερωτημάτων που χάθηκαν από τις άλλες προσεγγίσεις.
Συμπέρασμα
Η διατήρηση σταθερών εσωτερικών εννοιών και αντικειμένων είναι κεντρική τόσο για την ανθρώπινη εμπειρία της ανάπτυξης και της αίσθησης όσο και για τις μεμονωμένες, συχνά νέες εργασίες για τις οποίες αυτή η ανάπτυξη έχει προετοιμάσει.
Η έρευνα υπολογιστικής όρασης έχει ήδη μια συνεχιζόμενη πίεση να ανακτήσει και να ξανα-αναγνωρίσει αντικείμενα και άτομα που εξαφανίζονται και ξαναεμφανίζονται στο πλαισίο. Αυτά τα ζητήματα είναι σημαντικά μεγαλύτερα με την ανάγκη να αλλάζουν συνεχώς όραση και στάση – όπως είναι πιθανό να συμβεί σε ένα βίντεο οδηγιών τύπου YouTube για συναρμολόγηση επίπλων τύπου flat-pack. Μπορείτε να φανταστείτε το βαθμό στον οποίο οι ακόμη πιο jarring POV αλλαγές ενός εγωκεντρικού βίντεο θα μπορούσαν να confound τις προσπάθειες του AI για συναρμολόγηση επίπλων.
* Οι συγγραφείς του πρωτοτύπου μορφοποίησης, τροποποιημένο από εμένα όπως χρειάζεται για να διατηρήσει την επίδραση υπό μορφοποίηση-παράθεση/
Πρώτη δημοσίευση Δευτέρα, 25 Μαΐου 2026. Τροποποιήθηκε Τετάρτη 27ης Μαΐου 2026 για να διορθώσει αυτή τη χρονολογία αναφοράς (!).












