Η γωνία του Anderson

Διδάσκοντας το AI να Παρέχει Καλύτερες Κριτικές Βίντεο

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
Image of a robot with popcorn in a cinema, ChatGPt-4+ and Adobe Firefly.

Ενώ τα Μεγάλα Μοντέλα Όρασης-Γλώσσας (LVLMs) μπορούν να είναι χρήσιμα βοηθήματα στην ερμηνεία ορισμένων από τα πιο αινιγματικά ή προκλητικά υποβληθέντα στη βιβλιογραφία της υπολογιστικής όρασης, υπάρχει ένα πεδίο όπου είναι ελαττωματικά: η καθορισμός των αξιώσεων και της υποκειμενικής ποιότητας οποιωνδήποτε παραδειγμάτων βίντεο που συνοδεύουν новые εργασίες*.

Αυτό είναι ένα κρίσιμο σημείο μιας υποβολής,既然 τα επιστημονικά έγγραφα συχνά στοχεύουν να δημιουργήσουν ενθουσιασμό μέσω ελκυστικού κειμένου ή οπτικών – ή και των δύο.

Αλλά στην περίπτωση των έργων που αφορούν τη σύνθεση βίντεο, οι συγγραφείς πρέπει να δείξουν πραγματική έξοδο βίντεο ή να κινδυνεύουν να απορριφθεί η εργασία τους· και είναι σε αυτές τις επιδείξεις που το χάσμα μεταξύ των τολμηρών ισχυρισμών και της πραγματικής απόδοσης trởίνει πιο συχνά εμφανές.

Διάβασα το Βιβλίο, Δεν Είδα την Ταινία

Τώρα, τα περισσότερα από τα δημοφιλή API-βασισμένα Μεγάλα Μοντέλα Γλώσσας (LLMs) και Μεγάλα Μοντέλα Όρασης-Γλώσσας (LVLMs) δεν θα συμμετάσχουν στην άμεση ανάλυση περιεχομένου βίντεο με κανέναν τρόπο, ποιοτικό ή διαφορετικό. Αντίθετα, μπορούν μόνο να αναλύσουν σχετικά μεταγράμματα – και, ίσως, νήματα σχολίων και άλλα στενά κειμενο-βασισμένα υλικά.

Οι ποικίλες αντιρρήσεις του GPT-4o, Google Gemini και Perplexity, όταν τους ζητήθηκε να αναλύσουν άμεσα βίντεο, χωρίς να επικαλούνται μεταγράμματα ή άλλα κειμενο-βασισμένα πηγές.

Οι ποικίλες αντιρρήσεις του GPT-4o, Google Gemini και Perplexity, όταν τους ζητήθηκε να αναλύσουν άμεσα βίντεο, χωρίς να επικαλούνται μεταγράμματα ή άλλα κειμενο-βασισμένα πηγές.

Ωστόσο, ένα LLM μπορεί να κρύψει ή να αρνηθεί την αδυναμία του να παρακολουθήσει πραγματικά βίντεο, trừ जब σας το ζητήσετε:

Αφού του ζητήθηκε να παράσχει μια υποκειμενική αξιολόγηση των συνδεδεμένων βίντεο μιας νέας εργασίας, και αφού Counterfeit了一個 πραγματικό γνώμη, το ChatGPT-4o τελικά ομολογεί ότι δεν μπορεί πραγματικά να παρακολουθήσει βίντεο άμεσα.

Αφού του ζητήθηκε να παράσχει μια υποκειμενική αξιολόγηση των συνδεδεμένων βίντεο μιας νέας εργασίας, και αφού Counterfeit了一個 πραγματικό γνώμη, το ChatGPT-4o τελικά ομολογεί ότι δεν μπορεί πραγματικά να παρακολουθήσει βίντεο άμεσα.

Αν και τα μοντέλα όπως το ChatGPT-4o είναι πολυμορφικά και μπορούν τουλάχιστον να αναλύσουν ατομικές φωτογραφίες (όπως ένα εξαγόμενο πλαίσιο από ένα βίντεο, βλέπε εικόνα πιο πάνω), υπάρχουν κάποια ζητήματα ακόμη και με αυτό:

Δεύτερον, πολλά, αν όχι τα περισσότερα από τα προβλήματα ενός γεννημένου βίντεο είναι πιθανό να έχουν ένα χρονικό аспект που είναι εντελώς χαμένο σε ένα πλαίσιο – και έτσι η εξέταση ατομικών πλαισίων δεν έχει κανένα σκοπό.

Τέλος, το LLM μπορεί να δώσει μόνο μια υποτιθέμενη ‘αξιολόγηση’ με βάση (ξανά) την απορρόφηση γνώσεων με βάση κείμενο, για παράδειγμα σε σχέση με deepfake εικόνες ή ιστορία τέχνης. Σε τέτοια περίπτωση, η εκπαιδευμένη γνώση του τομέα επιτρέπει στο LLM να συσχετίζει αναλυμένες οπτικές ποιότητες μιας εικόνας με μάθηση με βάση ανθρώπινη ερμηνεία:

Το έργο FakeVLM προσφέρει στοχευμένη ανίχνευση deepfake μέσω eines εξειδικευμένου πολυμορφικού μοντέλου όρασης-γλώσσας. Πηγή: https://arxiv.org/pdf/2503.14905

Το έργο FakeVLM προσφέρει στοχευμένη ανίχνευση deepfake μέσω eines εξειδικευμένου πολυμορφικού μοντέλου όρασης-γλώσσας. Πηγή: https://arxiv.org/pdf/2503.14905

Αυτό δεν σημαίνει ότι ένα LLM δεν μπορεί να λάβει πληροφορίες直接 από ένα βίντεο· για παράδειγμα, με τη χρήση συστημάτων AI όπως YOLO, ένα LLM θα μπορούσε να αναγνωρίσει αντικείμενα σε ένα βίντεο – ή θα μπορούσε να το κάνει άμεσα, αν είχε εκπαιδευτεί για ένα πάνω από το μέσο αριθμό πολυμορφικών λειτουργιών.

Αλλά ο único τρόπος που ένα LLM θα μπορούσε να αξιολογήσει ένα βίντεο υποκειμενικά (δηλαδή, ‘Αυτό δεν φαίνεται πραγματικό’) είναι μέσω της εφαρμογής μιας συνάρτησης απώλειας-βασισμένης μετρικής που είναι είτε γνωστή να αντικατοπτρίζει την ανθρώπινη γνώμη καλά, είτε ενημερωμένη直接 από την ανθρώπινη γνώμη.

Οι συναρτήσεις απώλειας είναι μαθηματικά εργαλεία που χρησιμοποιούνται κατά τη διάρκεια της εκπαίδευσης για να μετρήσουν πόσο μακριά είναι οι προβλέψεις του μοντέλου από τις σωστές απαντήσεις. Παρέχουν ανατροφοδότηση που οδηγεί την εκπαίδευση του μοντέλου: όσο μεγαλύτερος ο σφάλμα, τόσο μεγαλύτερη η απώλεια. Καθώς προχωρά η εκπαίδευση, το μοντέλο điều chỉnh τις παραμέτρους του για να μειώσει αυτήν την απώλεια, βελτιώνοντας σταδιακά την ικανότητά του να κάνει ακριβείς προβλέψεις.

Οι συναρτήσεις απώλειας χρησιμοποιούνται και για τη ρύθμιση της εκπαίδευσης των μοντέλων και για τη διαμόρφωση αλγορίθμων που σχεδιάζονται για να αξιολογήσουν την έξοδο των μοντέλων AI (όπως η αξιολόγηση του συνθετικού φωτορεαλιστικού περιεχομένου από ένα γεννητικό μοντέλο βίντεο).

Συμπεριφορική Όραση

Μια από τις πιο δημοφιλείς μετρικές/συναρτήσεις απώλειας είναι η Απόσταση Fréchet (FID), η οποία αξιολογεί την ποιότητα των γεννημένων εικόνων μετρώντας τη συχνότητα μεταξύ της κατανομής τους (που εδώ σημαίνει ‘πώς οι εικόνες είναι διασκορπισμένες ή ομαδοποιημένες από οπτικά χαρακτηριστικά‘) και εκείνης των πραγματικών εικόνων.

Συγκεκριμένα, η FID υπολογίζει τη στατιστική διαφορά, χρησιμοποιώντας μέσες και συνδιασπορά, μεταξύ χαρακτηριστικών που εξάγονται και από τις δύο ομάδες εικόνων χρησιμοποιώντας το (συχνά κριτικά) Δίκτυο ταξινόμησης Inception v3. Μια χαμηλότερη βαθμολογία FID υποδηλώνει ότι οι γεννημένες εικόνες είναι πιο παρόμοιες με τις πραγματικές εικόνες, υπονοώντας καλύτερη οπτική ποιότητα και ποικιλία.

Ωστόσο, η FID είναι ουσιαστικά συγκριτική και αυτοαναφορική. Για να θεραπεύσει αυτό, η μεταγενέστερη Συμπεριφορική Απόσταση Fréchet (CFD, 2021) διαφέρει από την FID, συγκρίνοντας τις γεννημένες εικόνες με τις πραγματικές εικόνες και αξιολογώντας μια βαθμολογία με βάση το πώς και οι δύο ομάδες εικόνων ταιριάζουν σε μια πρόσθετη συνθήκη, όπως μια (απαραίτητα υποκειμενική) κατηγορία ετικέτας ή εικόνας εισόδου.

Με αυτόν τον τρόπο, η CFD λαμβάνει υπόψη το πώς ακριβώς οι εικόνες ικανοποιούν τις προβλεπόμενες συνθήκες, όχι μόνο την συνολική τους πραγματικότητα ή ποικιλία μεταξύ τους.

Παραδείγματα από το 2021 CFD. Πηγή: https://github.com/Michael-Soloveitchik/CFID/

Παραδείγματα από το 2021 CFD. Πηγή: https://github.com/Michael-Soloveitchik/CFID/

Η CFD ακολουθεί μια πρόσφατη τάση να ενσωματώνει ποιοτικές ανθρώπινες ερμηνείες σε συναρτήσεις απώλειας και αλγορίθμους μετρικών. Αν και αυτή η ανθρώπινη προσανατολισμένη προσέγγιση εγγυάται ότι το αποτέλεσμα αλγόριθμος δεν θα είναι ‘άψυχο’ ή απλά μηχανικό, παρουσιάζει ταυτόχρονα μια σειρά από ζητήματα: τη δυνατότητα προκατάληψης· το βάρος της ενημέρωσης του αλγορίθμου σύμφωνα με τις νέες πρακτικές, και το γεγονός ότι αυτό θα αφαιρέσει τη δυνατότητα σταθερών συγκριτικών προτύπων για χρόνια σε διάφορα έργα· και οικονομικές hạn chế (λιγότεροι ανθρώπινοι συνεισφέροντες θα κάνουν τις αποφάσεις πιο αμφίβολες, ενώ ένας μεγαλύτερος αριθμός θα μπορούσε να εμποδίσει χρήσιμες ενημερώσεις λόγω κόστους).

cFreD

Αυτό μας οδηγεί σε μια νέα εργασία από τις ΗΠΑ που φαίνεται να προσφέρει Συμπεριφορική Απόσταση Fréchet (cFreD), μια νέα εκδοχή της CFD που σχεδιάστηκε για να αντανακλά καλύτερα τις ανθρώπινες προτιμήσεις αξιολογώντας και την οπτική ποιότητα και τη συμφωνία εικόνας-κειμένου

Μερικά αποτελέσματα από τη νέα εργασία: βαθμολογίες εικόνων (1–9) από διάφορες μετρικές για την πρόκληση

Μερικά αποτελέσματα από τη νέα εργασία: βαθμολογίες εικόνων (1–9) από διάφορες μετρικές για την πρόκληση “Ένα σαλόνι με ένα καναπέ και ένα λάπτοπ που βρίσκεται στο καναπέ.” Τα πράσινα highlights το κορυφαίο μοντέλο που βαθμολογείται από τους ανθρώπους (FLUX.1-dev), το μωβ το χαμηλότερο (SDv1.5). Μόνο η cFreD αντιστοιχεί στις βαθμολογίες των ανθρώπων. Παρακαλούμε ανατρέξτε στην πηγή εργασίας για πλήρη αποτελέσματα, τα οποία δεν έχουμε χώρο να αναπαράγουμε εδώ. Πηγή: https://arxiv.org/pdf/2503.21721

Οι συγγραφείς υποστηρίζουν ότι οι υφιστάμενες μεθόδους αξιολόγησης για τη σύνθεση κειμένου-εικόνας, όπως η Βαθμολογία Inception (IS) και η FID, δεν ευθυγραμμίζονται καλά με την ανθρώπινη κρίση επειδή μετράνε μόνο την ποιότητα εικόνας χωρίς να λαμβάνουν υπόψη το πώς οι εικόνες ταιριάζουν με τις προτροπές τους:

‘Για παράδειγμα, σκεφτείτε ένα σύνολο δεδομένων με δύο εικόνες: μια σκύλου και μια γάτας, η κάθε μια από τις οποίες είναι ζευγαρωμένη με την αντίστοιχη πρόκληση. Ένα τέλειο μοντέλο κειμένου-εικόνας που λανθασμένα ανταλλάσσει αυτές τις αντιστοιχίες (δηλαδή, δημιουργώντας μια γάτα για πρόκληση σκύλου και αντίστροφα) θα επιτύχει σχεδόν μηδενική FID,既然 η συνολική κατανομή σκύλων και γατών διατηρείται, παρά την ασυμφωνία με τις προβλεπόμενες προτροπές. ‘

‘Δείχνουμε ότι η cFreD καταγράφει καλύτερη αξιολόγηση ποιότητας εικόνας και συνθήκη σε εισαγωγή κειμένου και οδηγεί σε βελτιωμένη συσχέτιση με τις ανθρώπινες προτιμήσεις.’

Οι δοκιμές της εργασίας δείχνουν ότι η προτεινόμενη μετρική των συγγραφέων, cFreD, επιτυγχάνει συνεχώς υψηλότερη συσχέτιση με τις ανθρώπινες προτιμήσεις από την FID, FDDINOv2, CLIPScore και CMMD σε τρία σύνολα δεδομένων (PartiPrompts, HPDv2 και COCO).

Οι δοκιμές της εργασίας δείχνουν ότι η προτεινόμενη μετρική των συγγραφέων, cFreD, επιτυγχάνει συνεχώς υψηλότερη συσχέτιση με τις ανθρώπινες προτιμήσεις από την FID, FDDINOv2, CLIPScore και CMMD σε τρία σύνολα δεδομένων (PartiPrompts, HPDv2 και COCO).

Έννοια και Μέθοδος

Οι συγγραφείς σημειώνουν ότι το τρέχον χρυσό πρότυπο για την αξιολόγηση μοντέλων κειμένου-εικόνας περιλαμβάνει τη συλλογή δεδομένων προτίμησης ανθρώπων μέσω συγκριτικών crowd-sourced, παρόμοιων με μεθόδους που χρησιμοποιούνται για μεγάλα μοντέλα γλώσσας (όπως το LMSys Arena).

Για παράδειγμα, το PartiPrompts Arena χρησιμοποιεί 1.600 αγγλικές προτροπές, παρουσιάζοντας στους συμμετέχοντες ζευγάρια εικόνων από διαφορετικά μοντέλα και ζητώντας τους να επιλέξουν την προτιμώμενη εικόνα.

Ομοίως, το Text-to-Image Arena Leaderboard χρησιμοποιεί συγκρίσεις μοντέλων από τους χρήστες για να δημιουργήσει βαθμολογίες μέσω βαθμολογιών ELO. Ωστόσο, η συλλογή αυτού του είδους δεδομένων ανθρώπινης αξιολόγησης είναι δαπανηρή και αργή, οδηγώντας ορισμένα πλαίσια – όπως το PartiPrompts Arena – να σταματήσουν τις ενημερώσεις.

Το Artificial Analysis Image Arena Leaderboard, το οποίο κατατάσσει τους τρέχοντες ηγέτες στην γεννητική οπτική AI. Πηγή: https://artificialanalysis.ai/text-to-image/arena?tab=Leaderboard

Το Artificial Analysis Image Arena Leaderboard, το οποίο κατατάσσει τους τρέχοντες ηγέτες στην γεννητική οπτική AI. Πηγή: https://artificialanalysis.ai/text-to-image/arena?tab=Leaderboard

Αν και υπάρχουν εναλλακτικές μέθοδοι που εκπαιδεύονται σε ιστορικά δεδομένα προτίμησης ανθρώπων, η αποτελεσματικότητά τους για την αξιολόγηση μελλοντικών μοντέλων παραμένει αβέβαιη,既然 οι ανθρώπινες προτιμήσεις συνεχώς εξελίσσονται. Συνεπώς, αυτόματα μετρικά όπως η FID, CLIPScore και η προτεινόμενη cFreD των συγγραφέων φαίνεται ότι θα παραμείνουν κρίσιμα εργαλεία αξιολόγησης.

Οι συγγραφείς υποθέτουν ότι και οι πραγματικές και οι γεννημένες εικόνες που προϋποθέτουν μια πρόκληση ακολουθούν κατανομές Gaussian, κάθε μια από τις οποίες ορίζεται από συνθήκες και συνδιασποράς. Η cFreD μετρά την αναμενόμενη απόσταση Fréchet σε πρόκληση μεταξύ αυτών των συνθηκών. Αυτό μπορεί να διατυπωθεί είτε άμεσα σε σχέση με στατιστικά δεδομένα είτε συνδυάζοντας αστατικά στατιστικά με συνδιασπορά που αφορά την πρόκληση.

Με την ενσωμάτωση της πρόκλησης με αυτόν τον τρόπο, η cFreD είναι σε θέση να αξιολογήσει τόσο την πραγματικότητα των εικόνων όσο και τη συμφωνία τους με το δεδομένο κείμενο.

Δεδομένα και Δοκιμές

Για να αξιολογήσουν πόσο καλά η cFreD συσχετίζεται με τις ανθρώπινες προτιμήσεις, οι συγγραφείς χρησιμοποίησαν βαθμολογίες εικόνων από πολλά μοντέλα που προκλήθηκαν με το ίδιο κείμενο. Η αξιολόγησή τους βασίστηκε σε δύο πηγές: το Σκορ Προτίμησης Ανθρώπων v2 (HPDv2) σύνολο δοκιμών, το οποίο περιλαμβάνει εννέα γεννημένες εικόνες και μια COCO εικόνα αλήθειας ανά πρόκληση· και το PartiPrompts Arena, το οποίο περιέχει εξόδους από τέσσερα μοντέλα σε 1.600 προτροπές.

Οι συγγραφείς συλλογούν τα διάσπαρτα δεδομένα του Arena σε ένα ενιαίο σύνολο δεδομένων· σε περιπτώσεις όπου η πραγματική εικόνα δεν κατετάγη υψηλότερα στις ανθρώπινες αξιολογήσεις, χρησιμοποίησαν την κορυφαία βαθμολογημένη εικόνα ως αναφορά.

Για να δοκιμάσουν νέα μοντέλα, δείγματα 1.000 προτρόπων από τα σύνολα εκπαίδευσης και επιβεβαίωσης του COCO, διασφαλίζοντας ότι δεν υπήρχε επικάλυψη με το HPDv2, και γεννήθηκαν εικόνες χρησιμοποιώντας εννέα μοντέλα από το Leaderboard. Οι αρχικές εικόνες του COCO χρησιμοποίηθηκαν ως αναφορές σε这一 μέρος της αξιολόγησης.

Η προσέγγιση cFreD αξιολογήθηκε μέσω τεσσάρων στατιστικών μετρικών: FID· FDDINOv2· CLIPScore· και CMMD. Αξιολογήθηκε επίσης ενάντια σε τέσσερα μετρικά που εκπαιδεύτηκαν σε δεδομένα προτίμησης ανθρώπων: Αισθητική Βαθμολογία· Επίδοση Εικόνας· HPSv2· και MPS.

Οι συγγραφείς αξιολόγησαν τη συσχέτιση με την ανθρώπινη κρίση και από μια角ική και από μια βαθμολογίας προοπτική: για κάθε μετρικό, οι βαθμολογίες μοντέλων αναφέρθηκαν και οι βαθμολογίες υπολογίστηκαν για την ευθυγράμμιση με τα αποτελέσματα ανθρώπινης αξιολόγησης, με την cFreD να χρησιμοποιεί DINOv2-G/14 για ενσωματώσεις εικόνας και τον κωδικοποιητή κειμένου OpenCLIP ConvNext-B για ενσωματώσεις κειμένου†.

Προηγούμενη εργασία για την εκμάθηση ανθρώπινων προτιμήσεων μετρήθηκε με ακρίβεια βαθμολογίας ανά στοιχείο, η οποία υπολογίζει την ακρίβεια βαθμολογίας για κάθε ζευγάρι εικόνας-κειμένου πριν από τον μέσο όρο των αποτελεσμάτων.

Οι συγγραφείς αντίθετα αξιολόγησαν την cFreD χρησιμοποιώντας μια παγκόσμια ακρίβεια βαθμολογίας, η οποία αξιολογεί την συνολική απόδοση βαθμολογίας σε όλο το σύνολο δεδομένων· για στατιστικά μετρικά, προέκυψαν βαθμολογίες直接 από τα сырыя σκορ· και για μετρικά που εκπαιδεύτηκαν σε δεδομένα προτίμησης ανθρώπων, πρώτα μέσως οι βαθμολογίες που ανατέθηκαν σε κάθε μοντέλο σε όλα τα δείγματα, και στη συνέχεια καθορίστηκε η τελική βαθμολογία από αυτούς τους μέσους.

Αρχικές δοκιμές χρησιμοποίησαν δέκα πλαίσια: GLIDE· COCO· FuseDream· DALLE 2· VQGAN+CLIP· CogView2· Stable Diffusion V1.4· VQ-Diffusion· Stable Diffusion V2.0· και LAFITE.

Βαθμολογίες και σκορ μοντέλων στο σύνολο δοκιμών HPDv2 χρησιμοποιώντας στατιστικά μετρικά (FID, FDDINOv2, CLIPScore, CMMD και cFreD) και μετρικά που εκπαιδεύτηκαν σε δεδομένα προτίμησης ανθρώπων (Αισθητική Βαθμολογία, Επίδοση Εικόνας, HPSv2 και MPS). Τα καλύτερα αποτελέσματα εμφανίζονται με τολμηρά, τα δεύτερα καλύτερα υπογραμμίζονται.

Βαθμολογίες και σκορ μοντέλων στο σύνολο δοκιμών HPDv2 χρησιμοποιώντας στατιστικά μετρικά (FID, FDDINOv2, CLIPScore, CMMD και cFreD) και μετρικά που εκπαιδεύτηκαν σε δεδομένα προτίμησης ανθρώπων (Αισθητική Βαθμολογία, Επίδοση Εικόνας, HPSv2 και MPS). Τα καλύτερα αποτελέσματα εμφανίζονται με τολμηρά, τα δεύτερα καλύτερα υπογραμμίζονται.

Από τα αρχικά αποτελέσματα, οι συγγραφείς σχολιάζουν:

‘Η cFreD επιτυγχάνει την υψηλότερη ευθυγράμμιση με τις ανθρώπινες προτιμήσεις, φθάνοντας σε συσχέτιση 0,97. Μεταξύ στατιστικών μετρικών, η cFreD επιτυγχάνει την υψηλότερη συσχέτιση και είναι συγκρίσιμη με το HPSv2 (0,94), ένα μοντέλο που εκπαιδεύτηκε ρητά σε δεδομένα προτίμησης ανθρώπων.既然 το HPSv2 εκπαιδεύτηκε στο σύνολο εκπαίδευσης HPSv2, το οποίο περιλαμβάνει τέσσερα μοντέλα από το σύνολο δοκιμών, και χρησιμοποίησε τους ίδιους annotators, αυτό εγγράφεται ειδικά ανθρώπινες προκαταλήψεις της ίδιας ρύθμισης.

‘Αντίθετα, η cFreD επιτυγχάνει συγκρίσιμη ή ανώτερη συσχέτιση με την ανθρώπινη αξιολόγηση χωρίς καμία εκπαίδευση προτίμησης ανθρώπων. ‘

‘Αυτά τα αποτελέσματα δείχνουν ότι η cFreD παρέχει πιο αξιόπιστες βαθμολογίες σε διάφορα μοντέλα σε σύγκριση με τα τυπικά αυτόματα μετρικά και μετρικά που εκπαιδεύτηκαν ρητά σε δεδομένα προτίμησης ανθρώπων.’

Μεταξύ όλων των αξιολογημένων μετρικών, η cFreD επιτύγχασε την υψηλότερη ακρίβεια βαθμολογίας (91,1%), αποδεικνύοντας – σύμφωνα με τους συγγραφείς – ισχυρή ευθυγράμμιση με τις ανθρώπινες κρίσεις.

Η HPSv2 ακολούθησε με 88,9%, ενώ η FID και η FDDINOv2 παρήγαγαν ανταγωνιστικά σκορ 86,7%. Αν και τα μετρικά που εκπαιδεύτηκαν σε δεδομένα προτίμησης ανθρώπων ευθυγραμμίζονταν γενικά καλά με τις ανθρώπινες αξιολογήσεις, η cFreD αποδείχθηκε η πιο ανθεκτική και αξιόπιστη συνολικά.

Κάτω βλέπουμε τα αποτελέσματα του δεύτερου γύρου δοκιμών, αυτή τη φορά στο PartiPrompts Arena, χρησιμοποιώντας SDXL· Kandinsky 2· Würstchen· και Karlo V1.0.

Βαθμολογίες και σκορ μοντέλων στο PartiPrompt χρησιμοποιώντας στατιστικά μετρικά (FID, FDDINOv2, CLIPScore, CMMD και cFreD) και μετρικά που εκπαιδεύτηκαν σε δεδομένα προτίμησης ανθρώπων (Αισθητική Βαθμολογία, Επίδοση Εικόνας και MPS). Τα καλύτερα αποτελέσματα είναι με τολμηρά, τα δεύτερα καλύτερα υπογραμμίζονται.

Βαθμολογίες και σκορ μοντέλων στο PartiPrompt χρησιμοποιώντας στατιστικά μετρικά (FID, FDDINOv2, CLIPScore, CMMD και cFreD) και μετρικά που εκπαιδεύτηκαν σε δεδομένα προτίμησης ανθρώπων (Αισθητική Βαθμολογία, Επίδοση Εικόνας και MPS). Τα καλύτερα αποτελέσματα είναι με τολμηρά, τα δεύτερα καλύτερα υπογραμμίζονται.

Εδώ η εργασία αναφέρει:

‘Μεταξύ στατιστικών μετρικών, η cFreD επιτυγχάνει την υψηλότερη συσχέτιση με τις ανθρώπινες αξιολογήσεις (0,73), με την FID και την FDDINOv2 να φθάνουν σε συσχέτιση 0,70. Αντίθετα, το σκορ CLIP εμφανίζει μια πολύ χαμηλή συσχέτιση (0,12) με τις ανθρώπινες κρίσεις. ‘

‘Στην κατηγορία μετρικών που εκπαιδεύτηκαν σε δεδομένα προτίμησης ανθρώπων, το HPSv2 έχει την ισχυρότερη ευθυγράμμιση, φθάνοντας σε συσχέτιση 0,83, ακολουθούμενο από την Επίδοση Εικόνας (0,81) και το MPS (0,65). Αυτά τα αποτελέσματα υπογραμμίζουν ότι ενώ η cFreD είναι ένα ρομποτικό αυτόματο μετρικό, το HPSv2 ξεχωρίζει ως το πιο αποτελεσματικό στην καταγραφή τάσεων ανθρώπινης αξιολόγησης στο PartiPrompts Arena.’

Τέλος, οι συγγραφείς διεξήγαγαν μια αξιολόγηση στο σύνολο δεδομένων COCO χρησιμοποιώντας εννέα σύγχρονα μοντέλα κειμένου-εικόνας: FLUX.1[dev]· Playgroundv2.5· Janus Pro· και παραλλαγές Stable Diffusion SDv3.5-L Turbo, 3.5-L, 3-M, SDXL, 2.1 και 1.5.

Οι βαθμολογίες προτίμησης ανθρώπων προέρχονταν από το Text-to-Image Leaderboard και δόθηκαν ως σκορ ELO:

Βαθμολογίες μοντέλων σε τυχαία δείγματα προτρόπων COCO χρησιμοποιώντας αυτόματα μετρικά (FID, FDDINOv2, CLIPScore, CMMD και cFreD) και μετρικά που εκπαιδεύτηκαν σε δεδομένα προτίμησης ανθρώπων (Αισθητική Βαθμολογία, Επίδοση Εικόνας, HPSv2 και MPS). Μια ακρίβεια βαθμολογίας κάτω από 0,5 υποδηλώνει περισσότερα ασύμφωνα παρά σύμφωνα ζευγάρια, και τα καλύτερα αποτελέσματα είναι με τολμηρά, τα δεύτερα καλύτερα υπογραμμίζονται.

Βαθμολογίες μοντέλων σε τυχαία δείγματα προτρόπων COCO χρησιμοποιώντας αυτόματα μετρικά (FID, FDDINOv2, CLIPScore, CMMD και cFreD) και μετρικά που εκπαιδεύτηκαν σε δεδομένα προτίμησης ανθρώπων (Αισθητική Βαθμολογία, Επίδοση Εικόνας, HPSv2 και MPS). Μια ακρίβεια βαθμολογίας κάτω από 0,5 υποδηλώνει περισσότερα ασύμφωνα παρά σύμφωνα ζευγάρια, και τα καλύτερα αποτελέσματα είναι με τολμηρά, τα δεύτερα καλύτερα υπογραμμίζονται.

Σχετικά με αυτόν τον γύρο, οι ερευνητές αναφέρουν:

‘Μεταξύ στατιστικών μετρικών (FID, FDDINOv2, CLIP, CMMD και η προτεινόμενη cFreD), μόνο η cFreD εμφανίζει μια ισχυρή συσχέτιση με τις ανθρώπινες προτιμήσεις, φθάνοντας σε συσχέτιση 0,33 και μια μη τριβική ακρίβεια βαθμολογίας 66,67%. ‘Αυτό το αποτέλεσμα τοποθετεί την cFreD ως το τρίτο πιο ευθυγραμμισμένο μετρικό συνολικά, ξεπερνόμενο μόνο από τα μετρικά που εκπαιδεύτηκαν σε δεδομένα προτίμησης ανθρώπων, ImageReward, HPSv2 και MPS. ‘

‘Σημαντικά, όλα τα άλλα στατιστικά μετρικά εμφανίζουν σημαντικά πιο αδύναμη ευθυγράμμιση με τις βαθμολογίες ELO και, ως αποτέλεσμα, ανέτρεψαν τις βαθμολογίες, οδηγώντας σε μια Ακρίβεια Βαθμολογίας κάτω από 0,5. ‘

‘Αυτά τα ευρήματα υπογραμμίζουν ότι η cFreD είναι ευαίσθητη και στην οπτική πιστότητα και στη συμφωνία πρόκλησης, ενισχύοντας την αξία της ως μια πρακτική, εκπαιδευμένη εναλλακτική για την αξιολόγηση της γεννήτριας κειμένου-εικόνας.’

Οι συγγραφείς επίσης δοκιμάζουν το Inception V3 ως πλάτη, επισημαίνοντας την πανταχού παρούσα παρουσία του στη βιβλιογραφία, και βρήκαν ότι το InceptionV3 εκτελέστηκε λογικά, αλλά υπερκεράστηκε από πλάτη-μετασχηματιστές όπως το DINOv2-L/14 και το ViT-L/16, τα οποία ευθυγραμμίζονται πιο συνεχώς με τις ανθρώπινες βαθμολογίες – και υποστηρίζουν ότι αυτό υποστηρίζει την αντικατάσταση του InceptionV3 σε σύγχρονες ρυθμίσεις αξιολόγησης.

Νίκες που δείχνουν πόσο συχνά οι βαθμολογίες κάθε πλάτης εικόνας ταιριάζουν με τις πραγματικές ανθρώπινες-παράγονται βαθμολογίες στο σύνολο δεδομένων COCO.

Νίκες που δείχνουν πόσο συχνά οι βαθμολογίες κάθε πλάτης εικόνας ταιριάζουν με τις πραγματικές ανθρώπινες-παράγονται βαθμολογίες στο σύνολο δεδομένων COCO.

Συμπέρασμα

Είναι σαφές ότι ενώ οι λύσεις με ανθρώπινη συμμετοχή είναι η βέλτιστη προσέγγιση για την ανάπτυξη μετρικών και συναρτήσεων απώλειας, η κλίμακα και η συχνότητα των ενημερώσεων που απαιτούνται σε τέτοιες схемές θα συνεχίσουν να τις κάνουν ακατάλληλες – ίσως μέχρις ότου η ευρεία δημόσια συμμετοχή στις αξιολογήσεις γενικά ενθαρρύνεται· ή, όπως έχει γίνει με τα CAPTCHAs, επιβληθεί.

Η αξιοπιστία του νέου συστήματος των συγγραφέων εξακολουθεί να εξαρτάται από την ευθυγράμμιση με την ανθρώπινη κρίση, αν και σε ένα βήμα πιο μακριά από πολλές πρόσφατες προσεγγίσεις που συμμετέχουν ανθρώπους· και η νομιμότητα της cFreD παραμένει ακόμη σε δεδομένα προτίμησης ανθρώπων (φυσικά,既然 χωρίς τέτοιο πρότυπο, η αξίωση ότι η cFreD αντανακλά ανθρώπινη-όπως αξιολόγηση θα ήταν αδιανόητη).

Επιχειρήματα ότι η ενσωμάτωση των τρέχοντων κριτηρίων μας για ‘πραγματικότητα’ στη γεννημένη έξοδο σε μια συνάρτηση μετρικού θα μπορούσε να είναι ένα λάθος μακροπρόθεσμα,既然 η τρέχουσα ορισμός μας για αυτήν την έννοια είναι τώρα υπό επίθεση από τη νέα κυμαία γεννητικών συστημάτων AI, και προγραμματισμένη για συχνές και σημαντικές αναθεωρήσεις.

* Σε αυτό το σημείο θα συμπεριέλαβα συνήθως ένα εικονογραφημένο παράδειγμα βίντεο, ίσως από μια πρόσφατη ακαδημαϊκή υποβολή· αλλά αυτό θα ήταν κακόβουλο – οποιοσδήποτε που έχει ξοδέψει περισσότερο από 10-15 λεπτά περιπλανόμενος στα γεννημένα αποτελέσματα του Arxiv θα έχει ήδη συναντήσει συμπληρωματικά βίντεο των οποίων η υποκειμενική κακή ποιότητα υποδηλώνει ότι η σχετική υποβολή δεν θα γιορταστεί ως ένα ορόσημο έγγραφο.

Συνολικά 46 μοντέλα πλάτης εικόνας χρησιμοποιήθηκαν στις πειραματικές δοκιμές, δεν όλα από τα οποία θεωρούνται στα γραφικά αποτελέσματα. Παρακαλούμε ανατρέξτε στο παράρτημα του εγγράφου για μια πλήρη λίστα· εκείνα που εμφανίζονται στους πίνακες και τις εικόνες έχουν λιστεί.

Πρώτη δημοσίευση την Τρίτη, 1 Απριλίου 2025

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai