Η γωνία του Anderson

Μείωση των ψευδαισθήσεων εικόνας AI με την υπερβολή τους

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
A Swami sprays a hallucinated small dragon with RAID bug-spray. SDXL, Flux.1D and Flux Kontext via Krita.

Τα μοντέλα όρασης τύπου ChatGPT συχνά «παράγουν ψευδαισθήσεις» στοιχεία που δεν ανήκουν σε μια εικόνα. Μια νέα μέθοδος μειώνει αυτά τα σφάλματα δείχνοντας στο μοντέλο υπερβολικές εκδοχές των δικών του ψευδαισθήσεων, βασισμένες σε λεζάντες – και στη συνέχεια ζητώντας του να προσπαθήσει ξανά. Αυτή η προσέγγιση δεν απαιτεί επανεκπαίδευση ή πρόσθετα δεδομένα και μπορεί να εφαρμοστεί σε ένα ευρύ φάσμα μοντέλων και τύπων μοντέλων.

 

Μια νέα δημοσίευση από την Κίνα προσφέρει μια ενδιαφέρουσα προσέγγιση στο ενοχλητικά επίμονο πρόβλημα των ψευδαισθήσεων σε εικόνες και βίντεο που παράγονται από AI – στοιχεία που προφανώς δεν θα έπρεπε να εμφανίζονται στην εικόνα, βάσει του αιτήματος και των εισροών του χρήστη.

Κατ’ ουσίαν, το σύστημα λαμβάνει μια εικόνα και αφήνει το μοντέλο να την περιγράψει, όπως συνήθως· στη συνέχεια μετατρέπει αυτή τη λεζάντα σε μια νέα εικόνα χρησιμοποιώντας ένα μοντέλο κειμένου-σε-εικόνα – και τυχόν επιπλέον αντικείμενα ή λεπτομέρειες σε αυτή τη δεύτερη εικόνα θα είναι άμεσες αναπαραστάσεις των αρχικών ψευδαισθήσεων του μοντέλου. Στη συνέχεια, συγκρίνοντας τις αρχικές και τις παραγόμενες εικόνες, το σύστημα κατευθύνει απαλά το μοντέλο μακριά από αυτά τα σφάλματα την επόμενη φορά που θα προσπαθήσει:

Μια εικονογράφηση του πώς η νέα μέθοδος εντοπίζει και μειώνει τις ψευδαισθήσεις στις λεζάντες εικόνων. Το κανονικό μοντέλο περιγράφει πουλιά που δεν υπάρχουν στην αρχική εικόνα, οδηγώντας σε μια ανακατασκευασμένη εικόνα που τα προσθέτει. Αυτά τα σφάλματα σημειώνονται με κόκκινο. Αντίθετα, η προτεινόμενη μέθοδος αποφεύγει αυτές τις εφευρετικές λεπτομέρειες διατηρώντας τη λεζάντα συγκεκριμένη και ρέουσα. Πηγή: https://arxiv.org/pdf/2509.21997

Μια εικονογράφηση του πώς η νέα μέθοδος εντοπίζει και μειώνει τις ψευδαισθήσεις στις λεζάντες εικόνων. Το κανονικό μοντέλο περιγράφει πουλιά που δεν υπάρχουν στην αρχική εικόνα, οδηγώντας σε μια ανακατασκευασμένη εικόνα που τα προσθέτει. Αυτά τα σφάλματα σημειώνονται με κόκκινο. Αντίθετα, η προτεινόμενη μέθοδος αποφεύγει αυτές τις εφευρετικές λεπτομέρειες διατηρώντας τη λεζάντα συγκεκριμένη και ρέουσα. Source: https://arxiv.org/pdf/2509.21997

Η μέθοδος ξεκινά δείχνοντας στο μοντέλο πραγματικές εικόνες και ζητώντας του να τις περιγράψει, συμπεριλαμβανομένων κάποιων περιγραφών που περιλαμβάνουν αντικείμενα ή λεπτομέρειες που είναι δεν είναι πραγματικά παρόντα. Αυτές οι ψευδαισθητικές λεζάντες χρησιμοποιούνται στη συνέχεια για τη δημιουργία συνθετικών εικόνων που κάνουν τα σφάλματα πιο εύκολα ανιχνεύσιμα. Συγκρίνοντας τις πραγματικές και τις παραγόμενες εικόνες, το σύστημα μαθαίνει ποια εσωτερικά μοτίβα στο μοντέλο τείνουν να παράγουν επινοημένο περιεχόμενο.

Μόλις αυτά τα μοτίβα σφάλματος εντοπιστούν, μπορούν να αποθηκευτούν και να χρησιμοποιηθούν αργότερα. Όταν το μοντέλο λαμβάνει μια νέα εικόνα, το σύστημα θα ρυθμίσει τα εσωτερικά του σήματα κατά τη δημιουργία λεζάντας, κατευθύνοντάς το μακριά από τα γνωστά μοτίβα που προκαλούν ψευδαισθήσεις. Αυτό λειτουργεί σε μία μόνο διεργασία και δεν απαιτεί πρόσθετα δεδομένα, επανεκπαίδευση ή οποιαδήποτε νέα δημιουργία εικόνας κατά τη φάση δοκιμής.

Το Σπασμένο Δίκτυο

Στο παραπάνω παράδειγμα, από το άρθρο, μπορούμε να δούμε ότι η συμπλοκή είναι πιθανώς υπεύθυνη για την προσθήκη «πουλιών» στην εικόνα εισόδου, παρόλο που η πρώτη εικόνα φαίνεται να μην περιέχει πουλιά.

Η συμπλοκή εμφανίζεται όταν ένα μοντέλο επιμένει να συσχετίζει ορισμένες έννοιες με άλλες, απλώς επειδή οι δύο (ή περισσότερες) έννοιες τείνουν να εμφανίζονται συχνά μαζί στην αρχική κατανομή δεδομένων με την οποία εκπαιδεύτηκε το μοντέλο. Σε αυτήν την περίπτωση, το μοντέλο μπορεί να έχει δει πολλές εικόνες planes+birds, προκαλώντας μια συσχέτιση που δεν ισχύει για τη συγκεκριμένη εικόνα, αλλά παρ’ όλα αυτά επεμβαίνει στη δημιουργημένη λεζάντα.

Αν και η συμπλοκή μπορεί να μετριαστεί διακόπτοντας την εκπαίδευση νωρίτερα (που, γενικά, κάνει το μοντέλο όσο το δυνατόν πιο ευέλικτο και προσαρμόσιμο), αυτό επίσης μειώνει τη λεπτομέρεια και την ανάλυση όλων των εκπαιδευμένων εννοιών, αφήνοντας τον εκπαιδευτή του μοντέλου με το διαχρονικό δίλημμα: να δημιουργήσει ένα μοντέλο που είναι πολύ ευέλικτο και μη συμπλεγμένο· ή να δημιουργήσει ένα μοντέλο που είναι πιο ισχυρά παραγωγικό, αλλά και πιο πιθανό να παράγει «συσχετισμένες» ψευδαισθήσεις;

Αν η ποιότητα της περιγραφής και η προσοχή στη λεπτομέρεια στην επιμέλεια των αρχικών δεδομένων για ένα γενετικό μοντέλο ήταν καλύτερη από ό,τι συνήθως επιτρέπουν οι συνθήκες, οι λεζάντες για όλες τις πηγαίες εικόνες θα είχαν περιγράψει λεπτομερώς κάθε αντικείμενο σε κάθε εικόνα, ώστε το εκπαιδευμένο μοντέλο να μπορούσε να τους εκχωρήσει διακριτές και αποσυνδεδεμένες καταχωρήσεις στον λανθάνοντα χώρο.

Όπως είναι τώρα, η αυτοεξυπηρετούμενη πρακτική του SEO captioning, σε συνδυασμό με το γεγονός ότι η ad hoc υπερκλιμακική συλλογή δεδομένων από το διαδίκτυο παραμένει η καλύτερη πηγή για την εκπαίδευση πραγματικά ισχυρών γενετικών μοντέλων, σημαίνει ότι οι λεζάντες εικόνων τείνουν να υπολείπονται σημαντικά από αυτό το πρότυπο:

Μια εικονογράφηση του πώς οι αδύναμες λεζάντες περιορίζουν τη χρησιμότητα των εικόνων LAION για την εκπαίδευση μοντέλων όπως το Stable Diffusion. Πολλές από τις ετικέτες κειμένου είναι επιφανειακές, ασαφείς ή βελτιστοποιημένες για SEO αντί για ακριβή περιγραφή, καθιστώντας πιο δύσκολο για το μοντέλο να μάθει λεπτομερείς οπτικές έννοιες όπως τα χαρακτηριστικά του προσώπου (η αρχική πηγή ήταν https://rom1504.github.io/, τώρα ανενεργή).

Ένα παράδειγμα του πώς οι αδύναμες λεζάντες περιορίζουν τη χρησιμότητα των εικόνων LAION για την εκπαίδευση μοντέλων όπως το Stable Diffusion. Πολλές από τις ετικέτες κειμένου είναι επιφανειακές, ασαφείς ή βελτιστοποιημένες για SEO αντί για ακριβή περιγραφή, καθιστώντας πιο δύσκολο για το μοντέλο να μάθει λεπτομερή οπτικά στοιχεία όπως τα χαρακτηριστικά του προσώπου. (Η αρχική πηγή ήταν https://rom1504.github.io/, τώρα ανενεργή).

Επομένως, δεδομένου ότι μια θεμελιώδης λύση είναι απίθανο να είναι ποτέ πρακτική, η μείωση των ψευδαισθήσεων LLM/VLM μέσω παρακάμψεων και συμβιβασμών έχει πλέον γίνει ισχυρό υπο-κλάδο στη βιβλιογραφία.

Η νέα κινεζική τεχνική που αποκαλύφθηκε αυτή την εβδομάδα, σύμφωνα με τους συγγραφείς, δοκιμάστηκε σε ποικιλία αρχιτεκτονικών σε διαφορετικές συνθήκες και θα μπορούσε να υποδείξει έναν χρήσιμο τρόπο μείωσης της “ρύπανσης ψευδαισθήσεων”.

Διηγούνται:

‘Εκτενείς πειράματα σε πολλαπλά benchmarks δείχνουν ότι η μέθοδός μας μειώνει σημαντικά τις ψευδαισθήσεις σε επίπεδο αντικειμένου, χαρακτηριστικού και σχέσης, διατηρώντας κατά κύριο λόγο την ανάκληση και την λεζάντα [richness].’

Το new paper έχει τίτλο Exposing Hallucinations To Suppress Them: VLMs Representation Editing With Generative Anchors και προέρχεται από τρεις ερευνητές του University of Science and Technology of China και του Nanjing University.

Μέθοδος

Οι συγγραφείς έχουν σχεδιάσει μια ολοκληρωμένη γραμμή εργασίας, που φαίνεται παρακάτω, σχεδιασμένη για να αποκαλύπτει και να καταστέλλει τις ψευδαισθήσεις στις λεζάντες εικόνων:

Μια εικονογράφηση του πλήρους pipeline. Ένα μοντέλο όρασης-γλώσσας πρώτα δημιουργεί μια λεζάντα από την εισερχόμενη εικόνα, η οποία μπορεί να περιλαμβάνει ψευδαισθητικό περιεχόμενο. Η λεζάντα αυτή χρησιμοποιείται στη συνέχεια για την παραγωγή μιας ανακατασκευασμένης εικόνας μέσω ενός μοντέλου κειμένου-σε-εικόνα, καθιστώντας τις ψευδαισθήσεις πιο εύκολα ανιχνεύσιμες. Ενσωματώσεις (embeddings) από την αρχική και την ανακατασκευασμένη εικόνα εξάγονται και χρησιμοποιούνται για να καθοδηγήσουν προσαρμογές μέσα στον αποκωδικοποιητή, βοηθώντας το μοντέλο να καταστέλλει τις ψευδαισθητικές λεπτομέρειες ενώ διατηρεί την ποιότητα της λεζάντας.

Μια εικονογράφηση του πλήρους pipeline. Ένα μοντέλο όρασης-γλώσσας πρώτα δημιουργεί μια λεζάντα από την εισερχόμενη εικόνα, η οποία μπορεί να περιλαμβάνει ψευδαισθητικό περιεχόμενο. Η λεζάντα αυτή χρησιμοποιείται στη συνέχεια για την παραγωγή μιας ανακατασκευασμένης εικόνας μέσω ενός μοντέλου κειμένου-σε-εικόνα, καθιστώντας τις ψευδαισθήσεις πιο εύκολα ανιχνεύσιμες. Ενσωματώσεις (embeddings) από την αρχική και την ανακατασκευασμένη εικόνα εξάγονται και χρησιμοποιούνται για να καθοδηγήσουν προσαρμογές μέσα στον αποκωδικοποιητή, βοηθώντας το μοντέλο να καταστέλλει τις ψευδαισθητικές λεπτομέρειες ενώ διατηρεί την ποιότητα της λεζάντας.

Ξεκινώντας από μια πραγματική εισερχόμενη εικόνα, ένα μοντέλο όρασης-γλώσσας δημιουργεί μια περιγραφική λεζάντα που μπορεί να περιέχει εφευρετικά αντικείμενα ή σχέσεις. Η λεζάντα αυτή τροφοδοτείται στη συνέχεια σε έναν γεννήτορα κειμένου-σε-εικόνα για να δημιουργήσει μια ανακατασκευασμένη εικόνα που δείχνει ακριβώς ό,τι περιγράφει η λεζάντα. Η σύγκριση αυτής της ανακατασκευασμένης εικόνας με την αρχική καθιστά το φανταστικό περιεχόμενο προφανές και μετρήσιμο, μετατρέποντας τις λεπτές λανθασμένες πληροφορίες στο κείμενο σε ορατές διαφορές που το σύστημα μπορεί να στοχεύσει και να μειώσει.

Για να καθοδηγήσει το μοντέλο να μην “εφευρίσκει” λεπτομέρειες, το σύστημα συγκρίνει δύο εκδόσεις της ίδιας εικόνας: την αρχική και μια ανακατασκευασμένη βασισμένη στη λεζάντα. Κάθε εικόνα μετατρέπεται σε μια συμπαγή embedding που συλλαμβάνει το περιεχόμενό της.

Η αρχική εικόνα λειτουργεί ως αξιόπιστη αναφορά, ενώ η ανακατασκευασμένη επισημαίνει πού μπορεί να έχουν εισέλθει ψευδαισθήσεις. Με την προσαρμογή των εσωτερικών αναπαραστάσεων ώστε να πλησιάζουν περισσότερο στην αρχική και να απομακρύνονται από την ανακατασκευασμένη, το μοντέλο μαθαίνει να διορθώνει αυτόματα τον εαυτό του. Δεδομένου ότι αυτή η διαδικασία δεν βασίζεται σε χειροκίνητους κανόνες ή εξωτερικά δεδομένα, παραμένει πλήρως self-supervised.

Το άρθρο δηλώνει:

‘Οι ψευδαισθήσεις στα MLLMs είναι εγγενώς δύσκολο να εντοπιστούν επειδή είναι γλωσσικά καλά σχηματισμένες και συχνά αδιαφοροποίητες από πιστές περιγραφές σε επίπεδο κειμένου. Η διαφορά δεν βρίσκεται στην γλωσσική λογικότητα αλλά στην ασυμφωνία με τα οπτικά αποδεικτικά στοιχεία, στα οποία το μοντέλο συνήθως είναι ανίκανο να αντιληφθεί.’

‘Για να το αντιμετωπίσουμε, εισάγουμε έναν μηχανισμό έκθεσης ψευδαισθήσεων που αξιοποιεί τη γενετική ανακατασκευή για να μετατρέψει τις έμμεσες ασυνέπειες σε σαφή και παρατηρήσιμα σήματα.’

Δεδομένης μιας εισερχόμενης εικόνας και της λεζάντας της, το σύστημα χρησιμοποιεί το μοντέλο κειμένου-σε-εικόνα FLUX.1-dev για να δημιουργήσει μια εικόνα μόνο από τη λεζάντα. Η ανακατασκευασμένη αυτή εικόνα τείνει να υπερτονίζει το νόημα της λεζάντας, καθιστώντας τυχόν ψευδείς λεπτομέρειες πιο προφανείς. Αυτά τα ενισχυμένα σφάλματα λειτουργούν στη συνέχεια ως χρήσιμα σήματα που βοηθούν το μοντέλο να αναγνωρίσει και να διορθώσει τα δικά του λάθη.

Για να δοκιμάσουν την προσέγγισή τους, οι συγγραφείς ένεσαν ψευδαισθήσεις στις λεζάντες και χρησιμοποίησαν το μοντέλο κειμένου-σε-εικόνα για να δημιουργήσουν ανακατασκευασμένες εικόνες. Αυτές οι εικόνες επανα-λεζάνθηκαν από το LLaVA, και η σημασιολογική ομοιότητα μεταξύ των αρχικών και των ψευδαισθητικών λεζαντών αξιολογήθηκε:

Μια εικονογράφηση του τρόπου με τον οποίο ο μηχανισμός ενίσχυσης ψευδαισθήσεων καθιστά ορατά τα λεπτά σφάλματα. Κάθε σημείο δείχνει την ομοιότητα μεταξύ των λεζαντών των αρχικών και των ανακατασκευασμένων εικόνων για ένα ζεύγος εικόνας-λεζάντας. Η πορτοκαλί γραμμή αντιπροσωπεύει την ομοιότητα που μετράται άμεσα μεταξύ των αρχικών και των ψευδαισθητικών λεζαντών, η οποία παραμένει υψηλή και καλύπτει μικρά λάθη· η μπλε γραμμή αντιπροσωπεύει την ομοιότητα μετά την ανακατασκευή, η οποία πέφτει απότομα, δείχνοντας ότι η διαδικασία μετατρέπει τις κρυμμένες ψευδαισθήσεις σε σαφείς σημασιολογικούς δείκτες που μπορούν να εντοπιστούν και να διορθωθούν.

Μία εικονογράφηση του τρόπου με τον οποίο ο μηχανισμός ενίσχυσης ψευδαισθήσεων καθιστά ορατά τα λεπτά σφάλματα. Κάθε σημείο δείχνει την ομοιότητα μεταξύ των λεζαντών της αρχικής και της ανακατασκευασμένης εικόνας για ένα ζεύγος εικόνας-λεζάντας. Η πορτοκαλί γραμμή αντιπροσωπεύει την ομοιότητα που μετράται άμεσα μεταξύ των αρχικών και των ψευδαισθητικών λεζαντών, η οποία παραμένει υψηλή και καλύπτει τα μικρά λάθη· η μπλε γραμμή αντιπροσωπεύει την ομοιότητα μετά την ανακατασκευή, η οποία πέφτει απότομα, δείχνοντας ότι η διαδικασία μετατρέπει τις κρυφές ψευδαισθήσεις σε σαφείς σημασιολογικούς δείκτες που μπορούν να εντοπιστούν και να διορθωθούν.

Η ομοιότητα πέφτει απότομα μετά την ανακατασκευή, δείχνοντας ότι η διαδικασία κάνει τα λεπτά σφάλματα πιο ανιχνεύσιμα.

Δεδομένα και Δοκιμές

Η επικύρωση της αποτελεσματικότητας της νέας μεθόδου περιελάμβανε τη χρήση τριών κατάλληλων δεικτών: Αξιολόγηση Ψευδαισθήσεων Λεζαντών με Σχετικότητα Εικόνας (CHAIR); Αξιολόγηση MLLM (MME); και Αξιολόγηση Αντικειμένων με Βάση Συγκέντρωση (POPE).

Από το άρθρο κυκλοφορίας του CHAIR: παραδείγματα ψευδαισθητικών αντικειμένων που δημιουργήθηκαν από δύο κορυφαία συστήματα λεζαντών, TopDown και NBT, όπου κάθε μοντέλο εφευρίσκει οπτικά στοιχεία που δεν υπάρχουν στην εικόνα, όπως φορητοί υπολογιστές, νεροχύτες ή σέρφ μπιρτς. Πηγή: https://arxiv.org/pdf/1809.02156

Από το άρθρο κυκλοφορίας του CHAIR: παραδείγματα ψευδαισθητικών αντικειμένων που δημιουργήθηκαν από δύο κορυφαία συστήματα λεζαντών, TopDown και NBT, όπου κάθε μοντέλο εφευρίσκει οπτικά στοιχεία που δεν υπάρχουν στην εικόνα, όπως φορητοί υπολογιστές, νεροχύτες ή σέρφ μπιρτς. Πηγή: https://arxiv.org/pdf/1809.02156

Τα τυπικά μεγέθη όπως ποσοστό ψευδαισθήσεων ή ανάκληση μπορούν να είναι παραπλανητικά, καθώς ένα μοντέλο μπορεί να αποφεύγει τις ψευδαισθήσεις απλώς παράγοντας σύντομες ή ασαφείς λεζάντες. Για να ληφθεί υπόψη η ανταλλαγή μεταξύ ανάκλησης και ψευδαισθήσεων, χρησιμοποιήθηκε ένας συνδυασμένος δείκτης που ονομάζεται Ψευδαισθήσεις και Ανάκληση (HAR@β), ο οποίος αξιολογεί τις λεζάντες τόσο ως προς την ακρίβεια όσο και ως προς την πληρότητα, και επιτρέπει την προσαρμογή της ισορροπίας ανάλογα με το αν η αποφυγή σφαλμάτων ή η συμπερίληψη περισσότερων λεπτομερειών είναι πιο σημαντική.

Το POPE χρησιμοποιήθηκε για την αξιολόγηση ψευδαισθήσεων αντικειμένων ευαίσθητων στο πλαίσιο, και το MME για την αξιολόγηση ψευδαισθήσεων επιπέδου ιδιότητας, με τα δύο να διατυπώνονται ως εργασίες κρίσης Ναι-ή-Όχι.

Τα πειράματα διεξήχθησαν σε διάφορα αντιπροσωπευτικά σύνολα δεδομένων, χρησιμοποιώντας το προαναφερθέν μοντέλο Flux και την παραλλαγή LLaVA-v1.5-7B. Τα σύνολα δεδομένων που χρησιμοποιήθηκαν ήταν Microsoft COCO; A-OKVQA; και GQA.

Η λανθάνουσα επεξεργασία πραγματοποιήθηκε για το δεύτερο στρώμα των μοντέλων, σύμφωνα με προηγούμενη σχετική εργασία, ενώ οι υπερπαράμετροι και η θερμοκρασία παρέμειναν συνεπείς σε όλα τα μοντέλα.

Τα αρχικά αποτελέσματα στο CHAIR παρουσιάζονται παρακάτω*:

Απόδοση στο δείκτη CHAIR για μείωση ψευδαισθήσεων, αξιολογημένη με πολλαπλούς δείκτες.

Απόδοση στο δείκτη CHAIR για μείωση ψευδαισθήσεων, αξιολογημένη με πολλαπλούς δείκτες.

Από αυτά τα αποτελέσματα, οι συγγραφείς σχολιάζουν:

‘[Our method consistently outperforms other baselines on both CHAIRS and CHAIRI[*], δείχνοντας την ανώτερη αποτελεσματικότητά του στην καταστολή ψευδαισθήσεων. Εν τω μεταξύ, αν και σχεδόν όλες οι μέθοδοι αναπόφευκτα μειώνουν την ανάκληση ενώ καταστέλλουν τις ψευδαισθήσεις, αντικατοπτρίζοντας μια ανταλλαγή μεταξύ πιστότητας και πληροφόρησης, η προσέγγισή μας επιτυγχάνει τη μικρότερη πτώση.

‘Αυτό δείχνει ότι η μέθοδός μας καταγράφει ένα ευρύ φάσμα αντικειμένων πραγματικού εδάφους. Με τον δείκτη HAR@β, η μέθοδός μας επιτυγχάνει την υψηλότερη βαθμολογία, υπογραμμίζοντας την ικανότητά της να μειώνει τις ψευδαισθήσεις διατηρώντας την κάλυψη.’

Οι ερευνητές αποδίδουν αυτά τα ισχυρά αποτελέσματα στη διπλή εποπτεία, όπου η καθαρή σημασιολογία από την αρχική εικόνα ενισχύθηκε, ταυτόχρονα με την καταστολή των παραπλανητικών σημάτων από την ανακατασκευασμένη εικόνα. Επειδή η προσαρμογή στοχεύει μόνο στην κατεύθυνση που σχετίζεται με τις ψευδαισθήσεις, το υπόλοιπο της αναπαράστασης παρέμεινε αμετάβλητο, επιτρέποντας στο σύστημα να διορθώνει τα σφάλματα χωρίς να θυσιάζει λεπτομέρεια ή πληροφόρηση.

Σύγκριση απόδοσης στο δείκτη POPE υπό διάφορες ρυθμίσεις και σύνολα δεδομένων.

Σύγκριση απόδοσης στο δείκτη POPE υπό διάφορες ρυθμίσεις και σύνολα δεδομένων.

Σχετικά με τα αποτελέσματα στο POPE, που εμφανίζονται στον παραπάνω πίνακα αποτελεσμάτων, το άρθρο δηλώνει:

‘Μπορεί να παρατηρηθεί ότι η μέθοδός μας επιτυγχάνει σταθερά την καλύτερη απόδοση σε όλες τις ρυθμίσεις. Συγκεκριμένα, η μέθοδός μας μπορεί να φτάσει έως +5,95% ακρίβεια και +6,85% σκορ F1 κατά μέσο όρο, υπερέχοντας άλλες προσεγγίσεις χωρίς εκπαίδευση με μεγάλο περιθώριο.

‘Κατά συνέπεια, αυτά τα αποτελέσματα δείχνουν ότι η μέθοδός μας προσφέρει μια αξιόπιστη και γενικεύσιμη λύση σε διαφορετικά επίπεδα δυσκολίας.’

Από τον τρίτο γύρο δοκιμών, συγκρίσεις απόδοσης στο MME.

Από τον τρίτο γύρο δοκιμών, συγκρίσεις απόδοσης στο MME.

Η τελική κύρια δοκιμή πραγματοποιήθηκε στο MME, με τα παραπάνω αποτελέσματα να εμφανίζονται. Ωστόσο, μεταξύ άλλων παραλείψεων, αναφέρει τη μέθοδο ‘OPERA’, η οποία δεν ορίζεται πουθενά στο κύριο άρθρο ή στο παράρτημα. Παρόλο που οι συγγραφείς ισχυρίζονται ισχυρή απόδοση στο MME, χωρίς επαρκείς ορισμούς των μεθόδων, ίσως θα πρέπει να αφήσουμε την ενότητα αποτελεσμάτων σε αυτό το σημείο.

Μία εικονογράφηση από το benchmark MME χρησιμοποιώντας το LLaVA-v1.5-7B, που δείχνει πώς το βασικό μοντέλο παρήγαγε μια ψευδής απάντηση ενώ η προτεινόμενη μέθοδος έδωσε τη σωστή ανταπόκριση, με την ανακατασκευασμένη εικόνα να καθιστά την ψευδαίσθηση πιο εμφανή.

Μία εικονογράφηση από το benchmark MME χρησιμοποιώντας το LLaVA-v1.5-7B, που δείχνει πώς το βασικό μοντέλο παράγει μια ψευδής απάντηση ενώ η προτεινόμενη μέθοδος έδωσε τη σωστή ανταπόκριση, με την ανακατασκευασμένη εικόνα να καθιστά την ψευδαίσθηση πιο εμφανή.

Συμπέρασμα

Αν και αυτό το άρθρο είναι προφανώς βιαστικό και υποφέρει από έλλειψη δομής, εστίασης και σαφήνειας, που έχουν γίνει όλο και πιο εμφανή στη βιβλιογραφία τα τελευταία 12 μήνες (πιθανώς όχι ανεξάρτητα από τη ραγδαία εξάπλωση της τεχνητής νοημοσύνης στην ακαδημαϊκή έρευνα), ο κεντρικός μηχανισμός που παρουσιάζεται παραμένει ευφυής.

Ενώ αυτή η προσέγγιση end-to-end δεν απαιτεί επανεκπαίδευση και φαίνεται εφαρμόσιμη σε ένα εύρος αρχιτεκτονικών, θα ήταν χρήσιμο να δειχθούν περισσότερα υποψήφια τεστ· και πρέπει επίσης να ληφθεί υπόψη ότι ένα ενδιάμεσο σύστημα αυτού του τύπου θα εισάγει τουλάχιστον καθυστέρηση και κάποιο επιπλέον ενεργειακό κόστος – κάτι που δεν αποτελεί μικρό ζήτημα σε μεγάλη κλίμακα.

 

* Ασυνήθιστα, το κύριο σώμα αυτού του άρθρου παρουσιάζει αποτελέσματα με επικεφαλίδες που εξηγούνται μόνο στο υλικό του παραρτήματος, και όχι στο κύριο κείμενο – μια όλο και πιο συχνή κακή συνήθεια στη βιβλιογραφία, καθώς οι ερευνητές προσπαθούν να περιορίσουν την κεντρική θέση σε 8-9 σελίδες, ακόμη και όταν το υλικό δεν το επιτρέπει. Σε κάθε περίπτωση, το benchmark CHAIR, που χρησιμοποιείται για την αξιολόγηση της ψευδαισθησίας αντικειμένων στις λεζάντες, βασίστηκε σε ένα υποσύνολο 500 εικόνων του MSCOCO από προηγούμενη εργασία. Χρησιμοποιήθηκαν δύο μορφές: CHAIRs, που μετρά πόσο συχνά εμφανίζονται ψευδαισθήσεις σε οποιαδήποτε λεζάντα· και CHAIRI, που μετρά πόσα από τα αναφερθέντα αντικείμενα ήταν ψευδαισθητικά. HAR@β , που εισήχθη στο κύριο κείμενο, ορίστηκε ως ένας συνδυασμός τύπου Fβ για την καταστολή ψευδαισθήσεων και την ανάκληση αντικειμένων.

Πρώτη δημοσίευση Τρίτη, 30 Σεπτεμβρίου 2025

Συγγραφέας στον τομέα της μηχανικής μάθησης, ειδικός σε συνθετικές ανθρώπινες εικόνες. Πρώην επικεφαλής του τμήματος περιεχομένου έρευνας στην Metaphysic.ai, μέχρι τη διάλυσή της στην Brahma.ai της DNEG.
Ιστοσελίδα: martinanderson.ai
Επικοινωνία: martin@martinanderson.ai