Η γωνία του Anderson
AI που χρησιμοποιεί εικόνες στη συλλογιστική Chain-of-Thought (CoT)

Συχνά σκεφτόμαστε με εικόνες — τουλάχιστον οι περισσότεροι από εμάς: στους ανθρώπους, η μειωμένη ικανότητα οπτικής φαντασίας έχει συσχετιστεί από έρευνες με χαμηλότερες ακαδημαϊκές επιδόσεις. Όσον αφορά την απομνημόνευση — την ανάγκη μας να θυμόμαστε πράγματα και όχι τον φόβο που προκαλεί η απομνημόνευση στην AI — η σημαντική σημασιολογική δύναμη των έντονων ή ζωντανών εικόνων χρησιμοποιείται εδώ και χιλιετίες ως βοήθημα μάθησης:

Ο «Ναός του Χρόνου» της Emma Willard (1846), μια εκπαιδευτική απεικόνιση που μετατρέπει τη χρονολογία σε φυσικό χώρο, διατάσσοντας ιστορικές περιόδους και πρόσωπα μέσα σε μια αρχιτεκτονική προοπτική που υποχωρεί. Η Willard σχεδίασε τέτοιες εικόνες ως οπτικά μνημονικά βοηθήματα, πιστεύοντας ότι οι γραφικές αναπαραστάσεις μπορούσαν να βοηθήσουν τους μαθητές να σχηματίσουν μια συνεκτική νοητική εικόνα της ιστορίας. Πηγή
Ωστόσο, το πεδίο των μνημονικών τεχνικών αφορά την πρόσληψη δεδομένων και όχι την επεξεργασία ή την ερμηνεία τους, όπου οι άνθρωποι διαφέρουν σημαντικά ως προς τα «στυλ» σκέψης στα οποία βασίζονται.
Προσωπικά, σκέφτομαι με σχήματα και το κάνω από τότε που θυμάμαι τον εαυτό μου να σκέφτεται — με δεκαετίες, χρόνια, ιδέες και ανθρώπους να αναπαρίστανται με κάποιον τρόπο μέσω σχετικής γεωμετρίας και δυναμικών όγκων. Άλλοι σκέφτονται κυρίως με αριθμούς, ενώ άλλοι με οσμές ή γεύσεις.
Για την AI, το πιθανό εύρος των μεθόδων συναισθησίας είναι πιο περιορισμένο. Ένα Μεγάλο Γλωσσικό Μοντέλο (LLM) μπορεί φυσικά να σκέφτεται με κείμενο, αφού αυτός είναι ο εγγενής τύπος κωδικοποίησής του, πάνω από το επίπεδο των ενσωματώσεων. Έχει επίσης αποδειχθεί ότι τα LLM κωδικοποιούν τους αριθμούς ως έννοιες και όχι ως καθαρές τιμές μεταβλητών, δείχνοντας μια τάση να «σκέφτονται με αριθμούς».
Αλλά σε ποιο βαθμό μπορεί να ειπωθεί ότι ένα LLM «σκέφτεται με σχήματα» ή «σκέφτεται με εικόνες», όπως τείνουν να κάνουν οι άνθρωποι;
Το γεγονός ότι λαμβάνει κανείς διαφορετικές απαντήσεις από ένα LLM στην ίδια ερώτηση όταν αυτή παρουσιάζεται σε διαφορετικές γλώσσες δείχνει ότι οι σχέσεις αυτές μπορεί να είναι πολύ συγκεκριμένες και εύθραυστες, καθώς και σταθερά κωδικοποιημένες σε συγκεκριμένο κείμενο ενός γλωσσικού πεδίου — για παράδειγμα, στα «ισπανικά» — αντί να αφορούν ένα πεδίο υψηλότερου επιπέδου που υπερβαίνει και ταυτόχρονα περιέχει τη γλώσσα*.
Επομένως, ένα πολυτροπικό LLM — δηλαδή ένα Μοντέλο Όρασης-Γλώσσας ή VLM — που μπορεί να δημιουργεί εικόνες αποκλειστικά για τη δική του εσωτερική Αλυσίδα Σκέψης (COT) θα μπορούσε λογικά να έχει πλεονέκτημα, ή τουλάχιστον μια κυριολεκτικά εναλλακτική οπτική.
Νέες οπτικές
Με αυτό κατά νου, μια πρόσφατη ερευνητική συνεργασία από τη Γερμανία παρουσίασε ένα VLM επικεντρωμένο στις εικόνες, το οποίο ονομάζεται ReImaGin και αξιοποιεί τη δημιουργία εικόνων ως εύπλαστο μηχανισμό συλλογιστικής.
Παρότι προηγούμενες εργασίες είχαν «προσαρτήσει» στοιχεία βασισμένα σε εικόνες, αυτές οι δυνατότητες δεν ήταν ούτε εγγενείς ούτε απαραίτητες για τη βασική ροή εργασίας. Αντίθετα, το νέο σύστημα των συγγραφέων έχει σχεδιαστεί για να αξιοποιεί τις πολύ πρόσφατες δυνατότητες των VLM και να αναλαμβάνει τις λειτουργίες εξειδικευμένων εργαλείων και μεθόδων, όπως η αντίληψη βάθους.
Στο παρακάτω παράδειγμα από τη νέα εργασία, με τίτλο Reasoning with Image Generation, η AI πρέπει να ερμηνεύσει δύο οπτικές — τις εικόνες στην άκρη αριστερά — καμία από τις οποίες δεν περιέχει όλες τις πληροφορίες που απαιτούνται για την επίλυση μιας εργασίας. Έτσι, το μοντέλο μπορεί να χρησιμοποιήσει τις διαθέσιμες πληροφορίες για να ερμηνεύσει μια ευρύτερη και πληρέστερη εικόνα της σκηνής — τον χάρτη με την υπολεζάντα «Generated Visualization», τρίτο από αριστερά παρακάτω.

Παράδειγμα από τη νέα εργασία, όπου το ReImaGin δημιουργεί έναν χάρτη κάτοψης από δύο ελλιπείς οπτικές, δίνοντας στο μοντέλο μια ενιαία οπτική αναπαράσταση πάνω στην οποία μπορεί να συλλογιστεί. Πηγή
Το ReImaGin δεν περιορίζεται σε ένα συγκεκριμένο είδος οπτικού μετασχηματισμού. Μπορεί να συμπληρώνει ελλιπείς περιοχές παζλ, να αφαιρεί αποκρύψεις για την καταμέτρηση, να σχεδιάζει τροχιές για την πρόβλεψη συγκρούσεων, να συνδυάζει πολλαπλές οπτικές σε χωρικούς χάρτες, να μετατρέπει διακεκομμένες διαδρομές σε συνεχείς γραμμές για ιχνηλάτηση και να δημιουργεί χάρτες βάθους για συλλογιστική βάθους.
Ακόμη πιο σημαντικό είναι ότι το σύστημα μπορεί να ρυθμίζει μόνο του τη χρήση αυτού του εσωτερικού συνόλου εργαλείων, σύμφωνα με τις πρόσφατα αναδυόμενες ικανότητες των VLM να αντιμετωπίζουν αυτόματα συγκεκριμένες προκλήσεις με κατάλληλα εργαλεία, όπως η εκτίμηση βάθους. Το μεγαλύτερο μέρος της περιγραφόμενης λειτουργικότητας του ReImaGin ενεργοποιείται με κλήσεις στο εργαλείο generate_image, μια λειτουργία που μπορεί να παρεμβαίνει οπτικά όταν χρειάζεται, χωρίς ανθρώπινη επίβλεψη ή ενεργοποίηση.
Οι συγγραφείς αναφέρουν:
«Επειδή το generate_image δέχεται αυθαίρετες οδηγίες φυσικής γλώσσας, ο πράκτορας μπορεί να εκτελεί ένα τεράστιο εύρος μετασχηματισμών. Το ερώτημα είναι ποιος μετασχηματισμός βοηθά πραγματικά σε μια δεδομένη εργασία.
«Η [συνήθης] πρακτική είναι να προσδιορίζεται ο μετασχηματισμός μέσω χειροποίητων παραδειγμάτων εντός του πλαισίου που επιδεικνύουν την επιθυμητή στρατηγική — για παράδειγμα, τη δημιουργία χάρτη βάθους για συλλογιστική βάθους. Αυτό απαιτεί χειρωνακτική προσπάθεια ανά εργασία και περιορίζει τη γενίκευση σε νέες εργασίες.»
«[Εξετάζουμε] αν τέτοιες στρατηγικές μπορούν να ανακαλυφθούν αυτόματα. Επειδή η στρατηγική μεταδίδεται στον πράκτορα μέσω του prompt, η ανακάλυψή της ανάγεται στη βελτιστοποίηση του prompt: υλοποιούμε έναν επαναληπτικό βρόχο όπου ένα μοντέλο προτάσεων δημιουργεί υποψήφια prompts, τα αξιολογεί σε ένα μικρό σύνολο ανάπτυξης και τα βελτιώνει με βάση τις επιτυχίες και τις αποτυχίες που παρατηρούνται.»
Σε δοκιμές με τρία VLM και έξι εργασίες οπτικής συλλογιστικής, το ReImaGin ξεπέρασε σε γενικές γραμμές τόσο τη συλλογιστική χωρίς βοήθεια όσο και τα εξειδικευμένα εργαλεία όρασης, χρησιμοποιώντας ένα μόνο εργαλείο.
Η προσέγγιση
Το ReImaGin λειτουργεί ως βρόχος: σε κάθε βήμα, το VLM εξετάζει την ερώτηση, τις αρχικές εικόνες και οτιδήποτε έχει ήδη δημιουργήσει και αποφασίζει τι θα κάνει στη συνέχεια. Αυτό μπορεί να περιλαμβάνει συνηθισμένες εργασίες εικόνας, όπως περικοπή ή επικάλυψη, ή μια κλήση στο generate_image, το οποίο δημιουργεί μια νέα εικόνα ειδικά σχεδιασμένη ώστε το πρόβλημα να γίνεται ευκολότερο για συλλογιστική:

Μια βήμα προς βήμα απεικόνιση του τρόπου με τον οποίο το ReImaGin συλλογίζεται πάνω σε χωρικά προβλήματα και οπτικά παζλ. Και στα δύο παραδείγματα, το μοντέλο δημιουργεί μια νέα εικόνα κατά τη συλλογιστική και στη συνέχεια τη χρησιμοποιεί ως πρόσθετη είσοδο για τα επόμενα βήματα προς την απάντηση.
Η παραγόμενη εικόνα επιστρέφει στη συνέχεια στο VLM και γίνεται μέρος του υλικού που είναι διαθέσιμο για το επόμενο βήμα συλλογιστικής, ενώ η διαδικασία μπορεί να επαναληφθεί. Στην παραπάνω εικόνα βλέπουμε αυτά τα στοιχεία για τη χωρική εργασία: το μοντέλο πρώτα συνδυάζει δύο φωτογραφίες σε μία ενιαία οπτική και κατόπιν μετατρέπει το αποτέλεσμα σε χάρτη κάτοψης πριν απαντήσει στην ερώτηση.
Για την εργασία του παζλ, δημιουργεί μια τροποποιημένη εκδοχή του παζλ που απομονώνει την ελλιπή περιοχή και στη συνέχεια χρησιμοποιεί συμβατική αφαίρεση εικόνων για να εντοπίσει την απάντηση.
Με αυτόν τον τρόπο, η δημιουργία εικόνων γίνεται μέρος της ίδιας της διαδικασίας συλλογιστικής και όχι τελικό προϊόν για τον χρήστη. Στην πραγματικότητα, αυτές οι ενδιάμεσες εικόνες προορίζονται αποκλειστικά για τις διαδικασίες COT της AI και όχι για άμεση κατανάλωση από τον τελικό χρήστη.
Σε κάθε γύρο, το VLM επιλέγει μόνο του την επόμενη ενέργεια από το πλαίσιο που έχει συσσωρευτεί μέχρι εκείνη τη στιγμή. Η ενέργεια μπορεί να είναι ένα ακόμη βήμα συλλογιστικής, μια συμβατική λειτουργία εικόνας ή μια οδηγία φυσικής γλώσσας προς το generate_image. Ό,τι επιστρέψει το επιλεγμένο εργαλείο προστίθεται στο πλαίσιο, επιτρέποντας στο μοντέλο να εξετάσει το αποτέλεσμα και να αποφασίσει αν θα το μετασχηματίσει ξανά, αν θα χρησιμοποιήσει άλλο εργαλείο ή αν θα προχωρήσει στην τελική απάντηση.
Απόκτηση αυτονομίας
Κεντρικό πρόβλημα είναι να αποφασιστεί ποιο είδος εικόνας θα διευκόλυνε πραγματικά μια συγκεκριμένη εργασία. Το ReImaGin το αποφασίζει πειραματιζόμενο με διαφορετικές οδηγίες προς τον πράκτορα, δοκιμάζοντας υποψήφια prompts σε παραδείγματα με γνωστές απαντήσεις και αξιοποιώντας τόσο τις επιτυχημένες όσο και τις αποτυχημένες προσπάθειες για να προκύψουν καλύτερα prompts. Περαιτέρω επαναλήψεις αυτού του βρόχου οδηγούν τελικά στις στρατηγικές με την καλύτερη επίδοση.
Το ίδιο το μοντέλο συλλογιστικής και η γεννήτρια εικόνων δεν επανεκπαιδεύονται κατά τη διαδικασία. Βελτιστοποιούνται μόνο οι οδηγίες που διέπουν τον τρόπο με τον οποίο ο πράκτορας χρησιμοποιεί τα εργαλεία του. Οι ερευνητές περιγράφουν λοιπόν τη διαδικασία ως «αυτοματοποιημένη ανακάλυψη» στρατηγικών οπτικής συλλογιστικής, χωρίς οι ίδιοι να παρέχουν στρατηγικές ειδικές για κάθε εργασία ή παραδείγματα συλλογιστικής.
Διαμόρφωση και δοκιμές
Το ReImaGin αξιολογήθηκε σε έξι εργασίες οπτικής συλλογιστικής: συλλογιστική βάθους (Blink — προσδιορισμός του ποιο από δύο σημεία βρίσκεται πιο κοντά στην κάμερα), συμπλήρωση παζλ (Mira — επιλογή του σωστού κομματιού για μια ελλιπή περιοχή εικόνας), καταμέτρηση με αποκρύψεις (CAPTURe — καταμέτρηση αντικειμένων, συμπεριλαμβανομένων των κρυμμένων), πρόβλεψη σύγκρουσης (Spatial457 — πρόβλεψη του αντικειμένου που θα χτυπήσει ένας κινούμενος στόχος), χωρική συλλογιστική (MMSI — προσδιορισμός σχέσεων μεταξύ αντικειμένων από διαφορετικές οπτικές) και ιχνηλάτηση διαδρομής — ένα νέο benchmark που απαιτεί από τα μοντέλα να ακολουθούν διακεκομμένες γραμμές που συνδέουν αριθμούς με γράμματα.

Από την εργασία «MIRA, a Benchmark for Visual Chain-of-Thought», εντυπωσιακά παραδείγματα οπτικών απεικονίσεων σε διαδικασίες αλυσίδας σκέψης. Πηγή
Τα βασικά μοντέλα VLM που δοκιμάστηκαν ήταν τα Gemini-3.1-Pro, GPT-5 και το ανοιχτών βαρών Qwen-3.5-27B. Η δημιουργία εικόνων γινόταν κυρίως από το Nano-Banana-Pro, ενώ δοκιμάστηκαν επίσης τα ανοιχτών βαρών FLUX.2 [dev] και Qwen-Image-Edit-2511. Το Gemini-3.1-Pro χρησιμοποιήθηκε ως επιλογέας για την κλιμάκωση κατά τον χρόνο δοκιμής της δημιουργίας εικόνων.
Από τις δύο γραμμές βάσης που χρησιμοποιήθηκαν για σύγκριση, το «απλό» VLM που οι συγγραφείς της εργασίας αποκάλεσαν «No Tools» απαντούσε απευθείας από το ερώτημα και τις εικόνες, χωρίς εργαλεία ή εκτέλεση κώδικα. Αντίθετα, το Visual Sketchpad του 2024 παρείχε σε αυτή την περίπτωση ένα σταθερό σύνολο εξειδικευμένων εργαλείων όρασης και χειρισμού εικόνας, αλλά χωρίς δημιουργία εικόνων ανοιχτού τύπου.
Για τη χωρική εργασία MMSI, και στις δύο γραμμές βάσης δόθηκε παρόμοια υπολογιστική ισχύς με το ReImaGin: δημιουργήθηκαν 20 απαντήσεις από καθεμία και χρησιμοποιήθηκε εκείνη που εμφανίστηκε συχνότερα.
Η επίδοση μετρήθηκε με ακρίβεια πολλαπλής επιλογής για όλες τις εργασίες εκτός από την καταμέτρηση με αποκρύψεις, η οποία αξιολογήθηκε με συμμετρικό μέσο απόλυτο ποσοστιαίο σφάλμα, συγκρίνοντας τον προβλεπόμενο και τον πραγματικό αριθμό αντικειμένων. Τα αποτελέσματα υπολογίστηκαν ως μέσος όρος τριών εκτελέσεων και αναφέρθηκε επίσης το τυπικό σφάλμα.

Αποτελέσματα δοκιμών που συγκρίνουν το ReImaGin με τα No Tools και Visual Sketchpad σε τρία VLM και έξι εργασίες οπτικής συλλογιστικής. Οι υψηλότερες βαθμολογίες είναι καλύτερες, εκτός από την Καταμέτρηση με Αποκρύψεις, όπου το χαμηλότερο σφάλμα είναι καλύτερο. Το ReImaGin πέτυχε το καλύτερο αποτέλεσμα στην πλειονότητα των συνδυασμών μοντέλου και εργασίας.
Τα ίδια παραδείγματα στρατηγικής που είχαν οριστεί από ανθρώπους χρησιμοποιήθηκαν και στα τρία μοντέλα. Το ReImaGin έδωσε καλύτερα αποτελέσματα από τις δύο γραμμές βάσης στις περισσότερες εργασίες, με ιδιαίτερα σαφή κέρδη στη συμπλήρωση παζλ, στην καταμέτρηση με αποκρύψεις και στην ιχνηλάτηση διαδρομής.
Με το GPT-5, για παράδειγμα, η ακρίβεια στα παζλ αυξήθηκε από 29,5% με το No Tools και 16,7% με το Visual Sketchpad σε 44,9% με το ReImaGin. Οι δοκιμές αφαίρεσης επιβεβαίωσαν ότι το στοιχείο δημιουργίας εικόνων είναι απαραίτητο για την επίδοση του συστήματος.
Δοκιμάστηκαν επίσης γεννήτριες εικόνων ανοιχτών βαρών αντί του Nano-Banana-Pro: τα FLUX.2 [dev] και Qwen-Image-Edit-2511 έδωσαν συγκρίσιμα αποτελέσματα σε ορισμένες απλούστερες εργασίες, ιδιαίτερα στη συμπλήρωση εικόνας, αλλά ήταν λιγότερο συνεπή σε πιο απαιτητικούς μετασχηματισμούς, όπως η εκτίμηση βάθους και η ιχνηλάτηση διαδρομής. Παρόμοια αποτελέσματα προέκυψαν όταν το Qwen-3.5-27B χρησιμοποιήθηκε ως VLM:
![Αποτελέσματα δοκιμών που συγκρίνουν γεννήτριες εικόνων με το Qwen-3.5-27B ως VLM. Το Nano-Banana-Pro πέτυχε το καλύτερο αποτέλεσμα σε πέντε από τις έξι εργασίες, ενώ τα FLUX.2 [dev] και Qwen-Image-Edit-2511 βελτίωσαν τα αποτελέσματα έναντι του No Tools σε αρκετές εργασίες.](https://www.unite.ai/wp-content/uploads/2026/09/table-6-1.jpg)
Αποτελέσματα δοκιμών που συγκρίνουν γεννήτριες εικόνων με το Qwen-3.5-27B ως VLM. Το Nano-Banana-Pro πέτυχε το καλύτερο αποτέλεσμα σε πέντε από τις έξι εργασίες, ενώ τα FLUX.2 [dev] και Qwen-Image-Edit-2511 βελτίωσαν τα αποτελέσματα έναντι του No Tools σε αρκετές εργασίες.
Οι συγγραφείς πραγματοποίησαν επίσης ποιοτικές δοκιμές σε τέσσερις εργασίες:

Ποιοτικά παραδείγματα σε τέσσερις εργασίες δείχνουν πώς χρησιμοποιήθηκε το ReImaGin για να ενισχύσει τη συλλογιστική του Gemini-3.1-Pro. Σε κάθε περίπτωση, οι παραγόμενες οπτικές αναπαραστάσεις ενσωματώθηκαν στη διαδικασία συλλογιστικής για να βοηθήσουν στην επίλυση της εργασίας.
Το ReImaGin δεν ήταν αξιόπιστο σε κάθε περίπτωση: σε ορισμένες περιστάσεις η γεννήτρια εικόνων παρήγαγε έναν ανακριβή μετασχηματισμό, όπως μια κάτοψη με αντικείμενα σε λανθασμένες θέσεις. Σε άλλες, μια ακριβής παραγόμενη εικόνα παρερμηνεύτηκε στη συνέχεια από το VLM.
Σε χειροκίνητο έλεγχο 120 παραγόμενων εικόνων, διαπιστώθηκε ότι το 75% είχε εκτελέσει πιστά τον ζητούμενο μετασχηματισμό. Όταν αυτό επιτυγχανόταν, η τελική απάντηση ήταν σωστή στο 87% των περιπτώσεων, έναντι 43% όταν η παραγόμενη εικόνα ήταν ανακριβής.
Οι συγγραφείς καταλήγουν:
«Τα αποτελέσματά μας υποδεικνύουν δύο ευρύτερα συμπεράσματα. Πρώτον, η δημιουργία εικόνων μπορεί να λειτουργήσει ως γενικός μηχανισμός οπτικής φαντασίας μέσα στην πολυτροπική συλλογιστική, μειώνοντας την ανάγκη να σχεδιάζεται ξεχωριστό εργαλείο για κάθε νέο μετασχηματισμό.
«Δεύτερον, η αποτελεσματικότητα αυτής της προσέγγισης δεν εξαρτάται μόνο από τα υποκείμενα μοντέλα, αλλά και από τη στρατηγική συλλογιστικής που χρησιμοποιείται για να αποφασιστεί τι θα απεικονιστεί και πώς θα αξιοποιηθεί το αποτέλεσμα.
«Τα κέρδη από την αυτόματη ανακάλυψη στρατηγικής δείχνουν ότι τα μοντέλα μπορούν να αξιοποιήσουν την κατανόησή τους για τους οπτικούς μετασχηματισμούς ώστε να ανακαλύψουν σχετικές στρατηγικές χωρίς στρατηγικές ειδικές για κάθε εργασία ή παραδείγματα συλλογιστικής γραμμένα από ανθρώπους.»
Συμπέρασμα
Οι αποφάσεις αυτοδύναμης χρήσης εργαλείων του είδους που εξετάζεται σε αυτή τη μελέτη αποτελούν μια συναρπαστική εξέλιξη, ιδίως επειδή η ανάπτυξη των VLM φαίνεται ούτως ή άλλως να εξελίσσεται φυσικά προς αυτή την προσέγγιση. Αναρωτιέμαι αν τέτοια VLM γενικής χρήσης θα αποδώσουν τελικά εξίσου καλά με εξειδικευμένα εργαλεία και πλαίσια, όπως το οικοσύστημα Segment, και αν επομένως όσοι ασχολούνται αποκλειστικά με αυτές τις «παράπλευρες εργασίες» θα καταλήξουν να χρησιμοποιούν βαριοπούλα για να σπάσουν ένα καρύδι.
Είναι μάλλον δύσκολο να πιστέψει κανείς ότι τα VLM θα μπορούσαν να αναπτύξουν την απαιτούμενη πειθαρχία ώστε να ξεπεράσουν και να διατηρήσουν προβάδισμα έναντι ειδικών λύσεων όπως η τοπική λεπτομερής προσαρμογή, όπου ένα ολόκληρο μοντέλο αφιερώνεται σε μία εργασία και κατά τη διαδικασία συχνά καθίσταται άχρηστο για οτιδήποτε άλλο. Ο χρόνος θα δείξει.
* Ένας συζητήσιμος ορισμός για το πεδίο των εικόνων, το οποίο μαθαίνουμε πολύ πριν αποκτήσουμε οποιαδήποτε γλωσσική δεξιότητα.
Δημοσιεύτηκε αρχικά τη Δευτέρα 28 Σεπτεμβρίου 2026












