Η γωνία του Anderson

Χρήση του AI για τη Βελτίωση των Φωτογραφιών Πριν Λαμβάνονται

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
Sample images from the Arxiv paper 'How to Take a Memorable Picture? Empowering Users with Actionable Feedback'. Source - https://arxiv.org/abs/2602.21877

Αντί να χρησιμοποιείτε το GenAI για να διορθώσετε τις φωτογραφίες μετά τις λήψετε, ερευνητές έχουν εκπαιδεύσει ένα σύστημα που σας λέει πώς να κινηθείτε, να στάσετε και να πλαίσiate την λήψη πριν, χρησιμοποιώντας τη μελετημένη γνώση του τι κάνει τις εικόνες να μενουν στην μνήμη.

 

Η διόρθωση φωτογραφιών μετά την λήψη έχει γίνει πιο εύκολη για αρκετό καιρό, καθώς οι κατασκευαστές και οι τεχνολογικές πλατφόρμες προσφέρουν όλο και περισσότερο τη δυνατότητα επεξεργασίας εντός της κάμερας που επιτρέπει στους χρήστες να αλλάξουν τις εικόνες αμέσως μετά την λήψη. Δημοφιλείς συστήματα αυτού του είδους περιλαμβάνουν την συνεπαγωγική επεξεργασία της Google και την γενετική επεξεργασία της Samsung, μεταξύ άλλων.

Ωστόσο, μια νέα τάση που ευνοεί την “αυθεντικότητα” έναντι των αποτελεσμάτων που βελτιώνονται από το AI μπορεί να σημαίνει ότι πολλοί από τους καταναλωτές που στοχεύουν αυτά τα συστήματα αρχίζουν να θεωρούν τις “τροποποιημένες” φωτογραφίες ως σκατό του AI.

Ίσως αυτό είναι που ενέπνευσε τη Google να δημιουργήσει einen AI-εκπαιδευμένο “προπονητή κάμερας” που ενημερώνεται από το Gemini, το οποίο είναι ικανό να δίνει άμεσες οδηγίες για τη βελτίωση μιας φωτογραφίας κατά τη διάρκεια της λήψης:

Ο Προπονητής Κάμερας της Google λέει στον χρήστη πώς να ξαναπλαίσιασε μια φωτογραφία, μεταξύ άλλων βασικών συμβουλών. Πηγή: https://store.google.com/intl/en_uk/ideas/articles/camera-coach/

Ο Προπονητής Κάμερας της Google λέει στον χρήστη πώς να ξαναπλαίσιασε μια φωτογραφία, μεταξύ άλλων βασικών συμβουλών. Πηγή

Ως ιδιοκτησιακό σύστημα και με σχεδόν καμία πληροφορία διαθέσιμη στο διαδίκτυο σχετικά με αυτό, ο Προπονητής Κάμερας φαίνεται να χρησιμοποιεί το Gemini για να βοηθήσει τους χρήστες να βελτιώσουν το πλαίσιο (βλέπε εικόνα παραπάνω) ή να κάνουν ελαφριές αλλαγές στη στάση (όπως να κουνηθούν πιο κοντά μαζί ή να κοιτάξουν απευθείας την κάμερα).

Έτσι, όσο μπορεί κανείς να καταλάβει, το προϊόν ωθεί τη σύνθεση προς το μέσο, προφανώς με βάση εκατομμύρια σημεία δεδομένων που έχουν συνεισφέρει στη διαδικασία εκπαίδευσης του Gemini. Σε αυτό το πλαίσιο, οι χρήστες που ανεβάζουν περιεχόμενο έχουν δημιουργήσει την επικύρωση του AI με την απόρριψη μη ικανοποιητικών λήψεων και την ανέβασή τους στις που τους αρέσουν – μια αποτελεσματική (και δωρεάν) μορφή επιλογής συνόλου δεδομένων!

Όμως, οι φωτογραφίες που μετριούνται σε όρους σύνθεσης δεν κατέχουν απαραίτητα τις ίδιες αισθητικές αξίες ή την επίδραση του θεατή όπως οι φωτογραφίες που είναι αξιομνημόνευτες.

Πέρα από το “Τυρί!” και τον Κανόνα του Τρίτου

Για αυτό το σκοπό, και προς ένα σύστημα που είναι πιο προσιτό σε διάφορες πλατφόρμες, νέα έρευνα από την Ιταλία προσφέρει ένα σύστημα τύπου Coach που βασίζεται σε προηγούμενη γνώση τι κάνει τις εικόνες να μενουν στην μνήμη:

Εκτενείς παραδείγματα συμβουλών από το νέο σύστημα των συγγραφέων. Πηγή - https://arxiv.org/pdf/2602.21877

Εκτενείς παραδείγματα συμβουλών από το νέο σύστημα των συγγραφέων. Πηγή

Στα παραπάνω παραδείγματα, βλέπουμε τις συμβουλές που δίνονται από το νέο σύστημα των συγγραφέων – που ονομάζεται MemCoach – το οποίο είναι δύσκολο να φανταστεί κανείς ότι θα μπορούσε να το προσφέρει ένας συνθέτης AI όπως ο Προπονητής Κάμερας. Στην πρώτη (πιο αριστερή) περίπτωση, η συμβουλή να αφαιρεθεί το καπέλλο είναι ιδιαίτερα αμφισβητήσιμη· στη δεύτερη εικόνα, είναι δύσκολο να φανταστεί κανείς τι συμβατικό πλαίσιο θα μπορούσε να εξαγάγει ένας AI σύνθεσης από την γενική σκηνή (δηλ. μια “artistική” εικόνα μιας νεαρής γυναίκας που leží στο δάπεδο με τα μάτια κλειστά).

Η βασική κατανόηση σχετικά με τη μνημείωση στη φωτογραφία, που χρησιμοποιήθηκε για την ανάπτυξη του τριμερούς ιταλικού συστήματος, προέρχεται από διάφορες προηγούμενες εργασίες, συμπεριλαμβανομένης της έξοδος Τι κάνει ένα αντικείμενο να μενει στην μνήμη; και το έγγραφο Τι κάνει μια φωτογραφία να μενει στην μνήμη;.

Από το έγγραφο Τι κάνει μια φωτογραφία να μενει στην μνήμη?, αντιπροσωπευτικά παραδείγματα καλών, μεσαίων και κακών φωτογραφιών, σε όρους μνημείωσης. Πηγή - https://people.csail.mit.edu/torralba/publications/Isola_memorabilityPhotos_PAMI2014.pdf

Από το έγγραφο Τι κάνει μια φωτογραφία να μενει στην μνήμη?, αντιπροσωπευτικά παραδείγματα καλών, μεσαίων και κακών φωτογραφιών, σε όρους μνημείωσης. Πηγή

Ο καθένας, όπως εγώ, με αρνητική ημερομηνία γέννησης Unix, θα αναγνωρίσει πιθανώς το πρότυπο για “λιγότερο αξιομνημόνευτες εικόνες” (πάνω δεξιά στην εικόνα παραπάνω), από τις ατελείωτες βραδιές διαφανειών που καταράστηκαν την παιδική μας ηλικία. Όπως αναφέρουν οι συγγραφείς*:

‘Αυτές οι εργασίες αναγνώρισαν βασικούς εσωτερικούς παράγοντες, όπως η παρουσία ανθρώπων, εσωτερικούς χώρους, ή συναισθηματικές εκφράσεις, αντί για αντικείμενα και πανωραμικές θέες, καθώς και εξωτερικούς παράγοντες, συμπεριλαμβανομένου του παρατηρητή. ‘

Το έργο επικεντρώνεται στην “ανατροφοδότηση μνημείωσης” (MemFeed), η οποία εκφράζεται στην εφαρμογή MemCoach και σε μια βάση (MemBench) που βασίζεται στο PPR10K dataset.

Από το έγγραφο PPR10K: Ένα Μεγάλης Κλίμακας Σύνολο Δεδομένων για την Επισκευή Φωτογραφιών με Ανθρώπινη Περιοχή και Ομαδική Συνέπεια, διαφορετικά δείγματα από το σύνολο δεδομένων. Η πρώτη σειρά δείχνει τις αρχικές εικόνες, η δεύτερη σειρά δείχνει τις επεξεργασμένες εκδόσεις μαζί με αντίστοιχες ανθρώπινες περιοχές. Οι αρχικές φωτογραφίες ποικίλλουν ευρέως σε οπτική γωνία, φόντο, φωτισμό και ρυθμίσεις κάμερας, ενώ τα αποτελέσματα της επεξεργασίας εμφανίζουν βελτιωμένη οπτική ποιότητα και ισχυρότερη συνέπεια μέσα σε κάθε ομάδα. Πηγή - https://arxiv.org/pdf/2105.09180

Από το έγγραφο PPR10K: Ένα Μεγάλης Κλίμακας Σύνολο Δεδομένων για την Επισκευή Φωτογραφιών με Ανθρώπινη Περιοχή και Ομαδική Συνέπεια, διαφορετικά δείγματα από το σύνολο δεδομένων. Top row shows the original images, bottom row shows expert-retouched versions along with corresponding human-region masks. The original photos vary widely in viewpoint, background, lighting and camera settings, whereas the retouched results display improved visual quality and stronger consistency within each group. Πηγή

Το έγγραφο παρατηρεί ότι η μνημείωση είναι ποσοτική στις φωτογραφίες, αντί για einen καταλογο υποκειμενικών κρίσεων, και οι συγγραφείς σημειώνουν επίσης ότι η ιδιότητα έχει αναγνωριστεί και για φωτογραφίες (σε διαφορετικές εργασίες) και βίντεο (σε διαφορετικές άλλες).

Το νέο έγγραφο έχει τον τίτλο Πώς να Πάρεις μια Αξιομνημόνευτη Φωτογραφία; Εμπowering Χρήστες με Ενεργό Ανατροφοδότηση, και προέρχεται από τέσσερις ερευνητές από το Πανεπιστήμιο του Τρέντο, το Πανεπιστήμιο της Πίζας και το Fondazione Bruno Kessler. Η σχετική σελίδα του έργου υποδηλώνει ότι ο κώδικας GitHub και τα δεδομένα Hugging Face θα είναι διαθέσιμα τον επόμενο μήνα (Μάρτιος 2026).

Μέθοδος

Για να δημιουργηθεί το σύνολο δεδομένων MemBench από το αρχικό σύνολο δεδομένων PPR10K, οι ερευνητές ομαδοποίησαν φωτογραφίες από την ίδια σκηνή και αξιολόγησαν κάθε εικόνα για μνημείωση χρησιμοποιώντας einen εκπαιδευμένο προβλέπτη με βάση CLIP χαρακτηριστικά. Στη συνέχεια, κατηγοριοποίησαν τις φωτογραφίες μέσα σε κάθε σκηνή από λιγότερο σε πιο αξιομνημόνευτη και τις ζευγάρωναν ανάλογα:

Επισκόπηση της κατασκευής και αξιολόγησης του MemBench. Η πρώτη σειρά δείχνει τη διαδικασία δεδομένων, από την ομαδοποίηση εικόνων ανά σκηνή και την πρόβλεψη μνημείωσης, μέχρι την κατάταξη φωτογραφιών και τη δημιουργία ανατροφοδότησης που είναι ευαίσθητη στη μνημείωση. Η δεύτερη σειρά δείχνει την αξιολόγηση, μετρώντας την ποιότητα της ανατροφοδότησης μέσω της μείωσης της μνημείωσης και της βαθμολογίας perplexity.

Επισκόπηση της κατασκευής και αξιολόγησης του MemBench. Top row depicts the data pipeline, from grouping images by scene and predicting memorability, to ranking photos and generating memorability-aware action feedback. Bottom row illustrates evaluation, measuring feedback quality through editing-based memorability gains and perplexity scoring.

Για κάθε ζευγάρι, δημιουργήθηκαν φυσικές περιγραφές γλώσσας με το InternVL3.5 μοντέλο για να εξηγήσουν τις ορατές διαφορές μεταξύ της λιγότερο αξιομνημόνευτης έκδοσης και της πιο αξιομνημόνευτης έκδοσης· και αυτές οι περιγραφές θα αποτελούσαν το σήμα εκπαίδευσης για το σύστημα ανατροφοδότησης μνημείωσης.

Σε αντίθεση με τον τύπο λογικής που υποστηρίζει τον Προπονητή Κάμερας της Google, οι ερευνητές αναζήτησαν μια πιο λεπτή σειρά ερμηνειών:

‘Αντίθετα με τις διορθώσεις φωτογραφίας που επικεντρώνονται στις μετα-επεξεργασίες (π.χ. “κανένα το φωτογραφία πιο φωτεινό”), επικεντρωθήκαμε σε σημασιολογικές ενέργειες που ο χρήστης μπορεί να κάνει επί τόπου για μια καλύτερη λήψη, π.χ. “Στρέψτε το πρόσωπο σας ο ένας στον άλλον”.’

Η τελική συλλογή MemBench αποτελείται από περίπου 10.000 εικόνες ομαδοποιημένες σε 1.570 σκηνές, με μέσο όρο 6,5 εικόνες ανά σκηνή. Η σύννεφο λέξεων που δημιούργησαν οι συγγραφείς (βλέπε εικόνα παρακάτω), υποδηλώνει einen ευρύ φάσμα σημασιολογικών κατηγοριών στο σύνολο δεδομένων:

Σύννεφο λέξεων από τις πιο συχνές λέξεις στο MemBench.

Σύννεφο λέξεων από τις πιο συχνές λέξεις στο MemBench.

Οι πηγαίες φωτογραφίες είχαν μέσο όρο βαθμολογία μνημείωσης 0,63, ενώ οι πιο αξιομνημόνευτες λήψεις από την ίδια σκηνή κυμαινόταν από 0,51 μέχρι 1,0, με εμφανή重疊 μεταξύ των δύο ομάδων:

Κατανομή βαθμολογιών μνημείωσης που συγκρίνουν τις λιγότερο και πιο αξιομνημόνευτες εικόνες μέσα σε κάθε σκηνή.

Κατανομή βαθμολογιών μνημείωσης που συγκρίνουν τις λιγότερο και πιο αξιομνημόνευτες εικόνες μέσα σε κάθε σκηνή.

Η ανατροφοδότηση herself κυμαινόταν από σύντομες σημειώσεις επτά λέξεων μέχρι αξιοσημείωτα μεγαλύτερες οδηγίες (αριστερά, στην εικόνα παρακάτω). Κάθε κομμάτι συμβουλής στη συνέχεια διαχωρίστηκε σε μικρές τύπους ενεργειών χρησιμοποιώντας GPT-5 Mini (δεξιά, στην εικόνα παρακάτω):

Κατανομή μήκους ανατροφοδότησης μετρημένη σε λέξεις περιεχομένου, και κατηγοριοποίηση ατομικών υπο-ενεργειών με πλάτος χορδών που υποδηλώνει συχνότητα συν-εμφάνισης μεταξύ κατηγοριών.

Κατανομή μήκους ανατροφοδότησης μετρημένη σε λέξεις περιεχομένου, και κατηγοριοποίηση ατομικών υπο-ενεργειών με πλάτος χορδών που υποδηλώνει συχνότητα συν-εμφάνισης μεταξύ κατηγοριών.

Οι συγγραφείς σημειώνουν ότι οι περισσότερες προτάσεις εστίαζαν στο πώς ήταν τοποθετημένο το θέμα, ακολουθούμενο από αλλαγές στη σημασία ή το περιεχόμενο της σκηνής, με το πλαίσιο συχνά συνδεδεμένο με την τοποθέτηση, και τις ρυθμίσεις φωτισμού συχνά συνδεδεμένες με σημασιολογικές αλλαγές.

Φλουξ Καπασίτορ

Για να αξιολογήσουν εάν η μνημείωση αυξήθηκε από την ανατροφοδότηση, η συμμόρφωση του χρήστη προσομοιώθηκε μέσω της χρήσης του FLUX.1 Kontext γενετικού μοντέλου, ως υποκατάστατο του φωτογράφου. Δόθηκε μια πηγή εικόνας και ένα κομμάτι κειμένου ανατροφοδότησης, και μια επεξεργασμένη έκδοση δημιουργήθηκε από το Flux που προσομοίωσε τις προτεινόμενες αλλαγές:

Οι εικόνες στα αριστερά είναι πραγματικές, από το σύνολο δεδομένων, και οι εικόνες στα δεξιά (σε κάθε περίπτωση) δημιουργήθηκαν από το Flux, με βάση την προτροπή (σε κίτρινο, παρακάτω). Με αυτόν τον τρόπο, η αποτελεσματικότητα των προτροπών θα μπορούσε να αξιολογηθεί χωρίς εκτεταμένη ανθρώπινη συμμετοχή. Αυτή η γνώση θα επέστρεφε τελικά στο πλαίσιο MemCoach, και στην πραγματικότητα αντιπροσωπεύει μια ροή εργασίας που θα μπορούσε να βελτιώσει επαναλαμβανόμενα ένα σύστημα αυτού του είδους (δηλ. τελικά με πραγματικά παραδείγματα αντί για Flux).

Οι εικόνες στα αριστερά είναι πραγματικές, από το σύνολο δεδομένων, και οι εικόνες στα δεξιά (σε κάθε περίπτωση) δημιουργήθηκαν από το Flux, με βάση την προτροπή (σε κίτρινο, παρακάτω). Με αυτόν τον τρόπο, η αποτελεσματικότητα των προτροπών θα μπορούσε να αξιολογηθεί χωρίς εκτεταμένη ανθρώπινη συμμετοχή. Αυτή η γνώση θα επέστρεφε τελικά στο πλαίσιο MemCoach, και στην πραγματικότητα αντιπροσωπεύει μια ροή εργασίας που θα μπορούσε να βελτιώσει επαναλαμβανόμενα ένα σύστημα αυτού του είδους (δηλ. τελικά με πραγματικά παραδείγματα αντί για Flux).

Και η αρχική και η επεξεργασμένη εικόνα στη συνέχεια πέρασαν από einen προβλέπτη μνημείωσης, επιτρέποντας την μέτρηση του πόσο συχνά η επεξεργασμένη έκδοση πέτυχε υψηλότερο σκορ – που ονομάζεται Επιτυχία Βελτίωσης – και πόσο μεγάλη ήταν η κέρδη σε σχέση με την αρχική εικόνα, που ονομάζεται Σχετική Μνημείωση.

Η ομοιότητα με ανατροφοδότηση μνημείωσης που επικεντρώνεται σε αναφορές επίσης μετρήθηκε υπολογίζοντας perplexity έναντι των πραγματικών περιγραφών, και ένας 80–20 διαχωρισμός εφαρμόστηκε στο επίπεδο σκηνής, ώστε να πραγματοποιηθεί δοκιμή μόνο σε σκηνές που δεν είχαν χρησιμοποιηθεί κατά την εκπαίδευση.

Κατάσταση Τέχνης

Η μνημείωση των τρέχοντων μεγάλων γλωσσικών μοντέλων πολλαπλών μεσομέσων ελέγχθηκε. Εικόνες από το LaMem dataset παρουσιάστηκαν σε διάφορα μοντέλα, τα οποία ζητήθηκαν να πουν αν η εικόνα ήταν αξιομνημόνευτη. Η εκτίμηση εμπιστοσύνης του μοντέλου στη συνέχεια συγκρίθηκε με τα σκορ που ανατέθηκαν από ανθρώπινους θεατές στην αρχική μελέτη:

Δοκιμές που δείχνουν ότι τα βασικά μοντέλα πολλαπλών μεσομέσων δεν καταλαμβάνουν τη μνημείωση. Αριστερά, Σπірμαν ρανκ συσχετίζεται μεταξύ προβλέψεων μοντέλου και LaMem ground-truth σκορ, με inter-annotator συμφωνία από LaMem που εμφανίζεται για αναφορά. Δεξιά, επιτυχία βελτίωσης που επιτεύχθηκε από την ανατροφοδότηση zero-shot σχετικά με την επεξεργασία baseline, δείχνοντας μόνο περιφερειακά κέρδη.

Δοκιμές που δείχνουν ότι τα βασικά μοντέλα πολλαπλών μεσομέσων δεν καταλαμβάνουν τη μνημείωση. Left, Σπírμαν ρανκ συσχετίζεται μεταξύ προβλέψεων μοντέλου και LaMem ground-truth σκορ, με inter-annotator συμφωνία από LaMem που εμφανίζεται για αναφορά. Right, επιτυχία βελτίωσης που επιτεύχθηκε από την ανατροφοδότηση zero-shot σχετικά με την επεξεργασία baseline, δείχνοντας μόνο περιφερειακά κέρδη.

Σχεδόν καμία σημαντική συσχέτιση με ανθρώπινες κρίσεις δεν βρέθηκε, και παρά την εκτεταμένη προ-εκπαίδευση, οι συγγραφείς ισχυρίζονται ότι τα μοντέλα δεν ακολούθησαν τι οι άνθρωποι θυμόντουσαν συνεχώς.

Παραδείγματα από το LaMem dataset. Upper-left, βλέπουμε επίσης έναν χάρτη θερμότητας που απεικονίζεται για αυτήν την εικόνα. Πηγή - http://memorability.csail.mit.edu/explore.html

Παραδείγματα από το LaMem dataset. Upper-left, βλέπουμε επίσης έναν χάρτη θερμότητας που απεικονίζεται για αυτήν την εικόνα. Πηγή

MemCoach

Ο MemCoach επικεντρώνεται σε σημασιολογικές, επί τόπου οδηγίες που μπορούν να thựcθούν πριν από την πίεση του κουμπιού:

Επισκόπηση της διαδικασίας MemCoach, στην οποία η ανατροφοδότηση που είναι ευαίσθητη στη μνημείωση από einen δάσκαλο MLLM ζευγαρώνεται με ουδέτερες απαντήσεις μαθητή για να σχηματίσει αντίθετα δεδομένα· οι διαφορές ενεργειών σε όλα τα επίπεδα μέσο όρου για να προκύψει ένας δια向ector μνημείωσης· και ότι ο δια向ector ενέχεται στην ερμηνεία για να μετατοπίζει τις ενεργειές του μαθητή προς την παραγωγή βελτιωμένης, μνημείωσης-προσανατολισμένης ανατροφοδότησης, χωρίς πρόσθετη εκπαίδευση.

Επισκόπηση της διαδικασίας MemCoach, στην οποία η ανατροφοδότηση που είναι ευαίσθητη στη μνημείωση από einen δάσκαλο MLLM ζευγαρώνεται με ουδέτερες απαντήσεις μαθητή για να σχηματίσει αντίθετα δεδομένα· οι διαφορές ενεργειών σε όλα τα επίπεδα μέσο όρου για να προκύψει ένας δια向ector μνημείωσης· και ότι ο δια向ector ενέχεται στην ερμηνεία για να μετατοπίζει τις ενεργειές του μαθητή προς την παραγωγή βελτιωμένης, μνημείωσης-προσανατολισμένης ανατροφοδότησης, χωρίς πρόσθετη εκπαίδευση.

Δοκιμές

Επτά Μοντέλα Πολυμεσικής Γλώσσας (MLLMs) χρησιμοποιήθηκαν στη φάση δοκιμής για το νέο σύστημα: Qwen2.5V.L· InternVL3_5-8B· Idefics3-8B· και LLaVA-OneVision-1.5. Επιπλέον, το GPT-5 Mini συμπεριλήφθηκε ως αντιπρόσωπος των ιδιωτικών, κλειστών μοντέλων, μαζί με το Q-Instruct και AesExpert μοντέλα. Τα MLLMs λειτουργούσαν διαφορετικά ως zero-shot και δάσκαλος ήacles.

Το InternVL3.5 χρησιμοποιήθηκε και για τα μοντέλα δασκάλου και μαθητή, με τον διαχωρισμό MemBench να χρησιμοποιείται για να δημιουργηθούν αντίθετα παραδείγματα:

Επίδραση MemCoach σε σύγκριση με τα μοντέλα MLLMs κατά μήκος δασκάλων, αισθητικά εξειδικευμένων μοντέλων και zero-shot baselines, δείχνοντας υψηλότερη Επιτυχία Βελτίωσης και ανταγωνιστική Σχετική Μνημείωση μαζί με την thấpτερη perplexity, υποδηλώνοντας πιο συνεπή και μνημείωση-προσανατολισμένη ανατροφοδότηση.

Επίδραση MemCoach σε σύγκριση με τα μοντέλα MLLMs κατά μήκος δασκάλων, αισθητικά εξειδικευμένων μοντέλων και zero-shot baselines, δείχνοντας υψηλότερη Επιτυχία Βελτίωσης και ανταγωνιστική Σχετική Μνημείωση μαζί με την thấpτερη perplexity, υποδηλώνοντας πιο συνεπή και μνημείωση-προσανατολισμένη ανατροφοδότηση.

Στον πίνακα για την πρώτη δοκιμή (παραπάνω), βλέπουμε ότι ο MemCoach φαίνεται να παρέχει πιο αποτελεσματική ανατροφοδότηση μνημείωσης από οποιοδήποτε από τα μοντέλα σύγκρισης – και το μοντέλο InternVL3.5 με καθοδήγηση αυξάνει τη μνημείωση πιο συχνά, και με μεγαλύτερο ποσό, με κέρδη 5% Επιτυχίας Βελτίωσης πάνω από το GPT-5 Mini, και ένα 31,81% άλμα στη Σχετική Μνημείωση πάνω από την ακαθοδηγούμενη έκδοσή του.

Επίσης, υπερέχει των αισθητικά εστιασμένων συστημάτων, παρά το γεγονός ότι δεν απαιτείται πρόσθετη εκπαίδευση. Χαμηλότερη perplexity, το έγγραφο υποστηρίζει, υποδηλώνει επίσης ότι η ανατροφοδότηση του ακολουθεί τις ίδιες γλωσσικές προτυπώσεις που ανταμείβονται από τις ανθρώπινες κρίσεις μνημείωσης:

Αποτελέσματα γενίκευσης που δείχνουν ότι ο MemCoach βελτιώνει την ανατροφοδότηση που προσανατολίζεται στη μνημείωση σε πολλαπλά μοντέλα πολλαπλών μεσομέσων, αυξάνοντας συνεχώς την Επιτυχία Βελτίωσης και τη Σχετική Μνημείωση ενώ μειώνει επίσης την perplexity για τα περισσότερα μοντέλα.

Αποτελέσματα γενίκευσης που δείχνουν ότι ο MemCoach βελτιώνει την ανατροφοδότηση που προσανατολίζεται στη μνημείωση σε πολλαπλά μοντέλα πολλαπλών μεσομέσων, αυξάνοντας συνεχώς την Επιτυχία Βελτίωσης και τη Σχετική Μνημείωση ενώ μειώνει επίσης την perplexity για τα περισσότερα μοντέλα.

Μια περαιτέρω δοκιμή (βλέπε πίνακα παραπάνω) δείχνει ότι η προσθήκη του MemCoach αυξάνει την ανατροφοδότηση που προσανατολίζεται στη μνημείωση σε όλα τα μοντέλα πολλαπλών μεσομέσων, με συνεχείς κέρδη στην Επιτυχία Βελτίωσης και τη Σχετική Μνημείωση, με τα μεγαλύτερα άλματα να εμφανίζονται για το Qwen2.5VL και το LLaVA-OV.

Μια ποιοτική αξιολόγηση στη συνέχεια πραγματοποιήθηκε, αναλύοντας παραδείγματα ανατροφοδότησης MemCoach όπου η πηγή εικόνας, η φυσική γλώσσα πρόταση και το προτεινόμενο βελτιωμένο αποτέλεσμα εξετάστηκαν πλευρά προς πλευρά:

Ποιοτικά παραδείγματα ανατροφοδότησης μνημείωσης που παράγονται από τον MemCoach. Κάθε τριπλέτα δείχνει την πηγή εικόνας, την φυσική γλώσσα οδηγία και την επεξεργασμένη εικόνα, με τη Σχετική Μνημείωση (RM) που υποδηλώνει την μετρημένη αλλαγή. Η καθοδήγηση κυμαίνεται από ρυθμίσεις στάσης και βλέμματος μέχρι σημασιολογικές παρεμβάσεις, όπως η αφαίρεση αντικειμένων, δείχνοντας και επιτυχημένα κέρδη και περιπτώσεις όπου η αφαίρεση ασυνήθιστων στοιχείων μειώνει τη μνημείωση.

Ποιοτικά παραδείγματα ανατροφοδότησης μνημείωσης που παράγονται από τον MemCoach. Κάθε τριπλέτα δείχνει την πηγή εικόνας, την φυσική γλώσσα οδηγία και την επεξεργασμένη εικόνα, με τη Σχετική Μνημείωση (RM) που υποδηλώνει την μετρημένη αλλαγή. Η καθοδήγηση κυμαίνεται από ρυθμίσεις στάσης και βλέμματος μέχρι σημασιολογικές παρεμβάσεις, όπως η αφαίρεση αντικειμένων, δείχνοντας και επιτυχημένα κέρδη και περιπτώσεις όπου η αφαίρεση ασυνήθιστων στοιχείων μειώνει τη μνημείωση.

Από αυτά τα αποτελέσματα, οι συγγραφείς δηλώνουν:

‘Τα παραδείγματα υπογραμμίζουν την ποικιλία των προτάσεων που προτείνει το μοντέλο, που κυμαίνεται από λεπτομερείς συνθετικές ρυθμίσεις, όπως η αλλαγή της κατεύθυνσης του βλέμματος, της στάσης ή της θέσης του χεριού, μέχρι σημασιολογικές παρεμβάσεις που αφορούν την αφαίρεση αντικειμένων ή την αλλαγή της έκφρασης του προσώπου.

‘Η ανατροφοδότηση είναι φυσικά ερμηνεύσιμη και ενεργητική, εκφραζόμενη σε συντομές κειμένων (συνήθως με ρήματα “Φέρτε”, “Στείλτε”, “Αφαιρέστε”) που μπορούν να εφαρμοστούν απευθείας, αποτελώντας στην ουσία μια λεκτική περιγραφή του πώς να πάρεις μια αξιομνημόνευτη φωτογραφία.’

Συμπέρασμα

Θα ήταν πολύ ενδιαφέρον να συγκρίνουμε τη μεθοδολογία της κλειστής προσεγγίσεως της Google με το έργο MemBench – όχι τουλάχιστον για να γνωρίζουμε ποια κεντρικά πρότυπα, αναφορές και βάσεις δεδομένων η Google χρησιμοποίησε για να ορίσει τα αισθητικά πρότυπα του συστήματος.

Η αρνητική πλευρά των συστημάτων αυτού του είδους, ανοιχτής ή κλειστής πηγής, είναι ότι σε μεγάλη κλίμακα κινδυνεύουν να επιβάλλουν ομοιόμορφα πρότυπα που προορίζονται να τελειώσουν ως μεμς και κλισέ – ένα είδος οπτικού ισοδύναμου των διαβουλεύσεων του AI em-dash, όπου η “σωστή” διαδικασία έχει γίνει κατά κάποιο τρόπο καταραμένη στη μη формική χρήση.

 

* Η μετατροπή των εσωτερικών αναφορών των συγγραφέων σε υπερσύνδεσμους, εάν ο σύνδεσμος δεν παρουσιάζεται αλλού στο άρθρο.

Το έγγραφο αναφέρεται εδώ, όπως και σε πολλά άλλα σημεία, σε “υποστηρικτικό υλικό” που δεν μπορώ να βρω, ούτε από το έγγραφο, ούτε από την κεντρική λίστα Arxiv, ούτε από την ιστοσελίδα του έργου.

Πρώτη δημοσίευση Πέμπτη, 26 Φεβρουαρίου 2026

Συγγραφέας για μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]