Η γωνία του Anderson
Τα ‘Ρογκ’ Δεδομένα που Μολύνουν την Απόδοση των Γεννητικών Μοντέλων AI

Μια νέα μελέτη βρίσκει ότι πολλά δημοφιλή σύνολα εικόνων που χρησιμοποιούνται για την εκπαίδευση μοντέλων AI είναι μολυσμένα με εικόνες δοκιμών ή近-απλότυπα, επιτρέποντας στα μοντέλα να απάτησαν memorizing απαντήσεις αντί να μάθουν. Η διαρροή είναι ευρεία αλλά γενικά ανιχνεύεται, σιωπηλά φουσκώνοντας τα σκορ και δίνοντας άδικη avantaj στα μοντέλα που εκπαιδεύονται σε δεδομένα κλίμακας web.
Όταν περνάτε μια εξέταση οδήγησης, συνήθως δεν σας λένε εκ των προτέρων ποια ακριβώς δρόμοι θα χρησιμοποιηθούν για την εξέταση. Αν σας το έλεγαν (και σας έλλειπε немного η ακεραιότητα), μπορείτε να «βελτιώσετε» για την εξέταση練習 στην συγκεκριμένη διαδρομή, αντί να αναπτύξετε ευρύτερες ικανότητες οδήγησης που μπορούν να χειριστούν οποιαδήποτε διαδρομή λογικά.
Στην εκπαίδευση μοντέλων μηχανικής μάθησης, αυτό είναι ένα hợp lý αναλόγιο για ένα διαχωρισμό δοκιμών – ένα διαχωρισμό του συνόλου δεδομένων εκπαίδευσης μεταξύ (συνήθως) eines 70% διαχωρισμού για τα δεδομένα που θα χρησιμοποιηθούν για την εκπαίδευση του μοντέλου, με τα υπόλοιπα 30% να χρησιμοποιούνται ως «στο野» δεδομένα.
Καθώς τα «στο野» δεδομένα δεν έχουν δει ποτέ το μοντέλο, αν το μοντέλο εκτελεί καλά σε αυτά τα δεδομένα, μπορεί να θεωρηθεί αποτελεσματικό και επιδόσεων· αν όχι, το μοντέλο μπορεί να υπερπροσαρμοστεί σε ένα καλά ισορροπημένο σύνολο – ή αλλιώς τα δεδομένα χρειάζονταν επιπλέον επιμέλεια και ορισμό.
Είτε τρόπος, όχι η αξιολόγηση μοντέλων στα δεδομένα εκπαίδευσής τους είναι ο ακρογωνιαίος λίθος της τρέχουσας μεθόδου στην έρευνα και ανάπτυξη AI.
Το Ίδιο Ξανά, Παρακαλώ
Σύμφωνα με μια νέα έρευνα από την Ιαπωνία, ο τομέας της υπολογιστικής όρασης και της γεννητικής AI δεν έχει προσεγγίσει ούτε κοντά τις προσπάθειες των ερευνητών LLM για να διασφαλίσει ότι τα δεδομένα δοκιμών δεν μολύνουν τα δεδομένα εκπαίδευσης· στις δοκιμές, οι ερευνητές βρήκαν ότι κάθε υπερκλίμακα σύνολο όρασης που μελετήθηκε, συμπεριλαμβανομένων εκείνων που τροφοδοτούν einige από τα μεγαλύτερα τρέχοντα γεννητικά συστήματα AI, έχει σε κάποιο βαθμό επιτρέψει στα δεδομένα δοκιμών να διασχίσουν τα δεδομένα εκπαίδευσης – σημαίνοντας ότι τα βENCHMARKS και οι αναφορές απόδοσης για μοντέλα που εκπαιδεύονται σε αυτά τα διαχωρίσματα δεν θα είναι πιο ακριβή από ένα αποτέλεσμα εξέτασης από κάποιον που έβαλε μια απάτη στην αίθουσα εξετάσεων, και δεν θα αντανακλούν την πραγματική απόδοση σε πραγματικά καινούργια δεδομένα.

Παραδείγματα διαρροής δεδομένων που βρέθηκαν από τους ερευνητές, όπου υπάρχουν διπλότυπα ή近-απλότυπα σημεία δεδομένων και στα δεδομένα εκπαίδευσης και στα δεδομένα δοκιμών. Πηγή: https://arxiv.org/pdf/2508.17416
Στην εικόνα παραπάνω, από τη νέα εργασία, βλέπουμε παραδείγματα είτε διπλότυπων είτε近-απλότυπων σημείων δεδομένων που βρέθηκαν και στα δεδομένα εκπαίδευσης και στα δεδομένα δοκιμών πολλών μοντέλων – αρκετά για να ακυρώσουν την απόδοση του μοντέλου σε αυτά τα δεδομένα, και να φουσκώσουν ελαφρά τα γενικά σκορ, διευκολύνοντας την εμφάνιση ενός επιπέδου γενίκευσης που το μοντέλο μπορεί να μην έχει στην πραγματικότητα.
Για να κάνουν τα πράγματα πιο περίπλοκα, η μόλυνση φαίνεται να συμβαίνει σε μια ποικιλία σεναρίων, συμπεριλαμβανομένης της ‘προ-εκπαίδευσης‘, όπου τα βάρη των παλαιότερων προγονικών μοντέλων χρησιμοποιούνται για να «ξεκινήσουν» ένα νέο μοντέλο. Αν το ανώτερο, παλαιότερο μοντέλο έχει κάποια από τα ίδια δεδομένα όπως το νέο σύνολο δεδομένων που προ-εκπαιδεύεται, τότε η διαρροή μπορεί να συμβεί ακόμη και αν ο διαχωρισμός 70/30 ή 80/20 είναι καθαρός.
Συμβατική Επίδραση
Αυτό είναι σχεδόν βέβαιο ότι θα συμβεί ακόμη και στα πιο πρόσφατα σύνολα δεδομένων· το εύρος των συνόλων δεδομένων όρασης/γλώσσας έχει αυξηθεί enormemente τα τελευταία πέντε χρόνια,λαμβάνοντας όχι μόνο τα πιο πρόσφατα δεδομένα εικόνων στο web, αλλά και ξανα-καλλιεργώντας πολύ από τα ίδια δεδομένα που κατοικούσαν αυτά τα παλαιότερα, ιστορικά σύνολα δεδομένων.
Επιπλέον, αυτοματοποιημένες διαδικασίες που έχουν σχεδιαστεί για να ψάξουν και να φιλτράρουν δισεκατομμύρια εικόνων για διπλότυπα και近-απλότυπα αντιμετωπίζονται τώρα με τόσο δυσχερή εργασία που η επιμέλεια – το κόστος της σε όρους χρόνου και χρημάτων – πρέπει τώρα να θεωρηθεί στο πλαίσιο των προϋπολογιστικών περιορισμών
Εν τω μεταξύ, η διπλοποίηση εικόνων είναι μια αναπόφευκτη συνέπεια του είδους ad hoc web-ψαρέματος που βρίσκεται πίσω από τεράστια συλλογές όπως η Common Crawl, λόγω της κοινής πρακτικής της επαναδημοσίευσης και της επανασυμπίεσης εικόνων, και της εφαρμογής επεξεργασιών όπως οι περικοπές, και ακόμη και αναστροφές (για να αποφευχθεί η ανίχνευση, όταν η εικόνα μπορεί να έχει χρησιμοποιηθεί χωρίς άδεια, για παράδειγμα).
Οι συγγραφείς παρατηρούν*:
‘Η διαρροή δεδομένων είναι ένα ευρεία πρόβλημα, που επικρατεί στα περισσότερα οπτικά σύνολα. Η διαρροή μπορεί να σκεπάσει την ικανότητα γενίκευσης των μοντέλων, που είναι ιδιαίτερα προβληματικό όταν συγκρίνουμε μοντέλα που εκπαιδεύονται σε διαφορετικά σύνολα, οδηγώντας σε άδικές συγκρίσεις.
‘Συστήνουμε στους σχεδιαστές συνόλων δεδομένων να σκεφτούν προσεκτικά τις επιπτώσεις αυτών των αξιολογήσεων. Για μια δίκαιη αξιολόγηση μοντέλων, συνιστούμε τη χρήση ανιχνευτών διπλότυπων που λαμβάνουν υπόψη και τη σκληρή και τη μαλακή διαρροή.
‘Ιδανικά, οι διαρρεύσεις εικόνων πρέπει να αφαιρεθούν από το σύνολο εκπαίδευσης, και αν αυτό δεν είναι δυνατό, πρέπει τουλάχιστον να αφαιρεθούν από το σύνολο δοκιμών.’
Η εργασία επεκτείνει σε μια σειρά από δοκιμές που διεξήγαγαν οι ερευνητές σε τεράστια και δημοφιλή σύνολα δεδομένων – κάθε ένα από τα οποία έδειξε κάποιο επίπεδο μόλυνσης.
Η νέα εργασία έχει τον τίτλο Διαρροή Δεδομένων σε Οπτικά Σύνολα, και προέρχεται από τρεις ερευνητές στο Πανεπιστήμιο της Οσάκα.
Μέθοδος
Οι συγγραφείς της εργασίας ορίζουν τη διαρροή σε σχέση με τρεις διαστάσεις: τροπικότητα, καλυψή, και βαθμός.
Τροπικότητα διακρίνει εάν μόνο εικόνες διαρρέουν ή εάν και εικόνες και ετικέτες εκτίθενται· καλυψή αναγνωρίζει εάν η επικάλυψη συμβαίνει μέσα στο ίδιο σύνολο ή μεταξύ διαφορετικών συνόλων· και βαθμός ορίζει εάν το διπλότυπο περιεχόμενο είναι ακριβώς το ίδιο ή απλά γειτονικό.
Σχετικά με τη διαρροή, τα δύο σενάρια που εξετάζονται στην εργασία είναι εσωτερική διαρροή (όπου οι εικόνες αξιολόγησης επανεμφανίζονται στο διαχωρισμό εκπαίδευσης του ίδιου συνόλου), και δια-συνόλου διαρροή (όπου οι εικόνες αξιολόγησης από ένα σύνολο είναι παρόντες σε ένα διαφορετικό σύνολο που χρησιμοποιείται για εκπαίδευση).
Σχετικά με τον βαθμό, οι δύο επίπεδα που ορίζονται είναι μαλακή διαρροή (όπου οι εικόνες δεν είναι идентικές αλλά εμφανίζουν μικρές παραλλαγές), και σκληρή διαρροή (όπου οι εικόνες είναι ακριβώς οι ίδιες σε εκπαίδευση και αξιολόγηση).
Οι ερευνητές αντιμετωπίζουν την ανίχνευση της διαρροής σε σχέση με την ανάκτηση εικόνων, χρησιμοποιώντας κωδικοποιητές εικόνων για να αντιπροσωπεύσουν κάθε εικόνα ως einen διανυσματικό. Το σύνολο ερωτημάτων είναι τα δεδομένα αξιολόγησης, ενώ το σύνολο συλλογής είναι το σύνολο εκπαίδευσης.
Για μικρότερα σύνολα, κάθε διανυσματικό ερωτήματος συγκρίνεται απευθείας με όλα τα διανύσματα εκπαίδευσης χρησιμοποιώντας ομοιότητα cosine. Για μεγαλύτερα σύνολα, ένας Faiss index κατασκευάζεται για να επιτρέψει ταχύτερη, K-Nearest Neighbors (KNN) αναζήτηση.
Καθώς ο κωδικοποιητής χρειάζεται να συλλάβει αρκετές οπτικές πληροφορίες για να ανιχνεύσει λεπτές ομοιότητες, αλλά να παραμείνει αποτελεσματικός αντιμετωπίζοντας πολύ υψηλά όγκους δεδομένων, οι συγγραφείς βασίστηκαν σε προ-υπολογισμένα CLIP χαρακτηριστικά που παρέχονται από τους δημιουργούς του συνόλου, στην περίπτωση της συλλογής LAION που υποστηρίζει τη Stable Diffusion, και αργότερα έργα.
Οι συγγραφείς σημειώνουν ότι η άδεια CLIP να χρησιμοποιήσει τη συμπυκνωμένη κατανόησή του για το σύνολο (αντί να ρωτήσει τα πραγματικά αρχεία σε κλίμακα) επιτάχυνε τη διαδικασία σημαντικά, και προσέφερε βελτιωμένη συνεπήτητα στις συγκρίσεις.
Δεδομένα και Δοκιμές
Ο κωδικοποιητής εικόνων CLIP που χρησιμοποιήθηκε στις δοκιμές για τη νέα εργασία ήταν ο προεπιλεγμένος CLIP ViT-B/32 που χρησιμοποιήθηκε αρχικά για να διακρίνει τη LAION. Για να καθορίσουν εάν διάφορα σημεία δεδομένων ήταν συναφής, χρησιμοποιήθηκε KNN υπό AutoFaiss.
Τα σύνολα δεδομένων ομαδοποιήθηκαν σε τρεις τύπους: προ-εκπαίδευση – μεγάλες, web-σκαλισμένες συλλογές που χρησιμοποιούνται για την εκπαίδευση γενικευμένων μοντέλων· εκπαίδευση – μικρότερα, συχνά αναγνωρισμένα σύνολα, που προορίζονται για άμεση εκπαίδευση μοντέλων· και βENCHMARK – χειροκίνητα αναγνωρισμένα, και χρησιμοποιούνται αποκλειστικά για αξιολόγηση.
Η ανάλυση κάλυψε είκοσι διαχωρισμούς σε επτά σύνολα δεδομένων: Microsoft COCO χρησιμοποιήθηκε και ως σύνολο εκπαίδευσης και ως σύνολο αξιολόγησης, ενσωματώνοντας τα train, validation, test, και unlabeled διαχωρισμούς· Flickr30k χρησιμοποιήθηκε αποκλειστικά ως βENCHMARK· και η Google Conceptual Captions (GCC) συλλογή χρησιμοποιήθηκε ως πηγή προ-εκπαίδευσης, με το τμήμα validation να χρησιμοποιείται επίσης για αξιολόγηση.
Επιπλέον, ImageNet χρησιμοποιήθηκε και για εκπαίδευση και για βENCHMARK, ενώ το LAION-400M σύνολο δεδομένων χρησιμοποιήθηκε αποκλειστικά για προ-εκπαίδευση.
OpenImages v4 συνεισέφερε δεδομένα εκπαίδευσης και βENCHMARK, και TextCaps παρείχε και δεδομένα εκπαίδευσης και δεδομένα δοκιμών για αξιολόγηση.

Παραδείγματα αναγνωρίσεων εικόνων από το σύνολο δεδομένων Open Images της Google, που εξετάζονται στην νέα εργασία. Πηγή: https://arxiv.org/pdf/1811.00982
Για να αξιολογήσουν πώς η μέθοδος μπορεί να ανιχνεύσει διαρροή όταν οι εικόνες έχουν υποστεί λεπτές αλλαγές μέσω αναδιαμόρφωσης, περικοπής ή παρόμοιων μη σημασιολογικών μετασχηματισμών, οι συγγραφείς ε-tested στο Flickr30k, τυχαία επιλέγοντας 5.000 εικόνες ως ερωτήματα, και χρησιμοποιώντας το σύνολο δεδομένων ως σύνολο συλλογής.
Κάθε εικόνα ερωτήματος μετατράπηκε πριν από την κωδικοποίηση (δηλ. υποβεβλημένη σε μια μη σημασιολογική τροποποίηση όπως αναδιαμόρφωση ή περικοπή), και στη συνέχεια αντιστοιχίστηκε στο πιο παρόμοιο στοιχείο στη συλλογή χρησιμοποιώντας ομοιότητα cosine· μια αντιστοίχηση μετρήθηκε μόνο εάν η αρχική εικόνα ανακτήθηκε ως το πρώτο αποτέλεσμα.
Οι τρεις κωδικοποιητές που συγκρίθηκαν ήταν ResNet-152; DINOv2 ViT-B/14; και CLIP ViT-B/32.
Τέσσερις τύποι μη σημασιολογικών μετασχηματισμών εικόνων χρησιμοποιήθηκαν: γεωμετρικοί (αντιστροφές και περιστροφές); περικοπή (αφαίρεση 20, 50, ή 100 pixel από κάθε άκρο); pixelization (Γκαουσιανή θόλωση, πρόσθετο θόρυβο, ή downsampling σε 128 ή 256 pixel); και χρώμα (απλοποίηση, αντιστροφή, ή κόκκινα, πράσινα, ή μπλε επικάλυψη).

Από το συμπληρωματικό υλικό, παραδείγματα των μετασχηματισμών που εφαρμόστηκαν στα δεδομένα – τυπικές διαδικασίες που χρησιμοποιούνται επίσης στην προεπεξεργασία δεδομένων.
Οι συγγραφείς τότε ε-tested για διαρροή στην ανάκτηση εικόνων:

Ακρίβεια ανίχνευσης διαρροής σε 5.000 εικόνες ερωτημάτων Flickr30k που υποβεβληθηκαν σε διάφορους μη σημασιολογικούς μετασχηματισμούς.
Όλοι οι τρεις κωδικοποιητές πέτυχαν τέλεια απόδοση σε αμεταβλητές εικόνες, και το CLIP παρέμεινε αξιόπιστο σε περικοπές, οριζόντιες αντιστροφές, θόρυβο, και αναδιαμόρφωση, ξεπερνώντας το ResNet στις αλλαγές pixel και χρώματος.
Το DINOv2 έδειξε ισχυρή ανθεκτικότητα σε μετασχηματισμούς χρώματος (πιθανότατα λόγω του αυτο-επιτηρημένου σχεδιασμού του, όπως υποστηρίζουν οι συγγραφείς), αλλά ήταν αξιοσημείωτα πιο αδύναμο σε γεωμετρικές επεξεργασίες και περικοπές – και οι δύο είναι κοινές σε διπλότυπα σύνολα δεδομένων.
Καθώς η LAION ήδη περιλαμβάνει CLIP ενσωματώσεις, και δεδομένου του συνεπή ρυθμό και ταχύτητά του, το CLIP επιλέχθηκε ως ο προεπιλεγμένος κωδικοποιητής για την κύρια ανάλυση.
Σκληρή και Μαλακή Διαρροή
Η απόδοση αξιολογήθηκε σε διάφορες ομοιότητες cosine για να διακρίνει μεταξύ ακριβών και近-απλότυπων εικόνων (σκληρή και μαλακή διαρροή).
Μια ομοιότητα cosine 0,98 επιλέχθηκε για να ορίσει τη σκληρή διαρροή, με αποτέλεσμα κανένα ψευδές θετικό και τέλεια ανίχνευση ακριβών εικόνων.
Για τη μαλακή διαρροή, μια ομοιότητα cosine 0,95 επιλέχθηκε, επιτρέποντας περισσότερα近-απλότυπα να ανακτηθούν ενώ διατηρούσε μια σχεδόν μηδενική ψευδώς θετική ταξινόμηση. Προτεραιότητα δόθηκε στην ακρίβεια έναντι της ανακάλυψης, και τα ευρήματα ήταν συντηρητικά υπολογισμένα:

Κάμπες χαρακτηριστικών δέκτη-εργοδότη χρησιμοποιήθηκαν για να οδηγήσουν την επιλογή των σκληρών και μαλακών κατωφλιών για ανίχνευση διαρροής. Υψηλά σκορ AUC κάτω από cả τις μετασχηματισμένες και αμεταβλητές συνθήκες δείχνουν ότι近-απλότυπα μπορούν να διακρίνουν από μη σχετιζόμενα εικόνες, ακόμη και όταν υπάρχουν ελάχιστες αλλαγές.
Εσωτερική Διαρροή
Η εσωτερική διαρροή υπολογίστηκε με την ανίχνευση της επικάλυψης εικόνων μεταξύ των διαχωρισμών εκπαίδευσης και αξιολόγησης μέσα στο ίδιο σύνολο. 僅 τα σύνολα με και βENCHMARK και εκπαίδευση ή προ-εκπαίδευση διαχωρισμούς ήταν επιλέξιμα, στενεύοντας την ανάλυση στο COCO, GCC, ImageNet, OpenImages, και TextCaps.
Για το COCO, το σύνολο δοκιμών συγκρίθηκε με το σύνολο εκπαίδευσης, το σύνολο αξιολόγησης, και το σύνολο unlabeled, και το σύνολο validation με το σύνολο εκπαίδευσης και το σύνολο unlabeled.
Οι υψηλότερες ποσοστίες εσωτερικής διαρροής παρατηρήθηκαν στο ImageNet test και validation διαχωρισμούς, με τη σκληρή διαρροή να φτάνει μέχρι 1,58% και τη μαλακή διαρροή λίγο κάτω από 2%. GCC και COCO ακολούθησαν, με το COCO val2017 να δείχνει μια μαλακή διαρροή 3% και τα διαχωρισμούς δοκιμών να κυμαίνονται μεταξύ 1,35% και 1,38%. OpenImages έδειξε χαμηλή σκληρή διαρροή 0,05%, αλλά η μαλακή διαρροή ξεπέρασε 1,3% και στα δύο διαχωρισμούς δοκιμών και αξιολόγησης. TextCaps έδειξε την χαμηλότερη συνολική διαρροή, στο 0,69%, με κανένα σκληρή διαρροή να ανιχνευτεί:

Ποσοστά εσωτερικής διαρροής, δείχνοντας το ποσοστό κάθε διαχωρισμού αξιολόγησης που επικαλύπτεται με τα δεδομένα εκπαίδευσης.
Σχετικά με αυτά τα αποτελέσματα, οι συγγραφείς δηλώνουν†:
‘Αυτά τα αποτελέσματα δείχνουν ότι η εσωτερική διαρροή συμβαίνει σε όλα τα αναλυμένα σύνολα, είτε σε σκληρή είτε σε μαλακή μορφή.
‘Καθώς η διαρροή δεδομένων μπορεί να危害 την αξιολόγηση του μοντέλου και τα σύνολα δεδομένων είναι ειδικά σχεδιασμένα για αυτόν τον σκοπό, η εσωτερική διαρροή είναι ένα ρίσκο που κατά σχέδιο δεν πρέπει να υπάρχει.
‘Ωστόσο, abbiamo αναγνωρίσαμε πολλαπλά παραδείγματα σε όλα τα σύνολα.’
Δια-Συνόλου Διαρροή
Για να μετρήσουν τη δια-συνόλου διαρροή (όπου ένα μοντέλο εκπαιδεύεται σε ένα σύνολο και αξιολογείται σε ένα άλλο), τέσσερα σύνολα δεδομένων χρησιμοποιήθηκαν ως πηγές δεδομένων εκπαίδευσης: GCC train, ImageNet train, OpenImages train, και LAION.
Αυτά αντιστοιχίστηκαν με δεδομένα αξιολόγησης από το COCO 2014 test και validation διαχωρισμό, Flickr30K, TextCaps test, το OpenImages test και validation διαχωρισμό, και το ImageNet test και validation διαχωρισμό.
CLIP ViT-B/32 ενσωματώσεις εξαγωγής για όλα τα σύνολα δεδομένων εκτός από το LAION, το οποίο παρέχει τις δικές του προ-υπολογισμένες ενσωματώσεις. Ωστόσο,既然 αυτές οι ενσωματώσεις διαφέρουν ελαφρά από αυτές που παράγονται χρησιμοποιώντας την επίσημη υλοποίηση CLIP, τα ερωτήματα εικόνων ανα比例θηκαν σύμφωνα με τη μέθοδο που χρησιμοποιείται στο clip-retrieval repository για να διασφαλιστεί η συμβατότητα.
Η ανάκτηση πραγματοποιήθηκε χρησιμοποιώντας μια KNN αναζήτηση, αν και η κλίμακα του LAION απαιτούσε διαίρεση σε μπλοκ εκατομμυρίων εικόνων, με κάθε ένα να indeksed ξεχωριστά:

Δια-συνόλου διαρροή μεταξύ συνόλων δεδομένων αξιολόγησης (στήλες) και συνόλων δεδομένων προ-εκπαίδευσης (σειρές). Στο αριστερό μέρος βλέπουμε ‘σκληρή’ διαρροή (идентικές εικόνες), και στο δεξί μέρος ‘μαλακή’ διαρροή (近-απλότυπα).
Η δια-συνόλου διαρροή ανιχνεύθηκε σε όλα τα σύνολα δεδομένων αξιολόγησης, με διάφορα επίπεδα σοβαρότητας. Το LAION έδειξε τις υψηλότερες ποσοστίες σκληρής διαρροής (идентικές εικόνες), ιδιαίτερα για τα OpenImages και TextCaps δεδομένα δοκιμών, τα οποία ξεπέρασαν 3%. OpenImages συνεισέφερε μια μικρότερη ποσότητα σκληρής διαρροής στο COCO.
Αν και λιγότερο σοβαρή, το ImageNet περιείχε ακόμη σκληρές διπλότυπες εικόνες από όλα τα εξεταζόμενα βENCHMARK· και το GCC έδειξε τη χαμηλότερη συνολική σκληρή διαρροή, παραμένοντας κάτω από 1%.
Η μαλακή διαρροή (近-απλότυπα) ήταν πιο εκτεταμένη: το LAION παρήγαγε τις υψηλότερες ποσοστίες, με μέχρι 7,9% επικάλυψη για ορισμένα βENCHMARK· OpenImages και TextCaps ήταν τα πιο επηρεασμένα βENCHMARK συνολικά· και το Flickr30k έδειξε την ελάχιστη διαρροή.
Αν και τέτοιες επικαλύψεις μπορεί να αντιπροσωπεύουν μόνο ένα μικρό μέρος των συνόλων αξιολόγησης, οι συγγραφείς σημειώνουν ότι η παρουσία τους μπορεί να επιτρέψει απομνημόνευση και να危害 την εγκυρότητα των δοκιμών:

Παραδείγματα διαρρεουσών εικόνων. Στο αριστερό μέρος είναι περιπτώσεις ‘σκληρής’ διαρροής, όπου οι εικόνες είναι ιδεντικές μέσα σε ένα σύνολο (πάνω) ή μεταξύ συνόλων (κάτω)· στο δεξί μέρος, περιπτώσεις ‘μαλακής’ διαρροής, όπου οι εικόνες είναι οπτικά近-απλότυπα.
Επίδραση στην Κατωτέρω Αξιολόγηση
Η εργασία εξετάζει στη συνέχεια πώς η διαρροή δεδομένων επηρεάζει τις κατωτέρω αξιολογήσεις (δηλ. την απόδοση σε τυπικές εργασίες όταν προ-εκπαιδευμένα μοντέλα δοκιμάζονται σε βENCHMARK που περιέχουν διπλότυπα δεδομένα εκπαίδευσης).
Τρεις εργασίες εξετάστηκαν: zero-shot ταξινόμηση; επίβλεπτη ταξινόμηση; και ανάκτηση εικόνας-κειμένου.
Για κάθε εργασία, η απόδοση του μοντέλου αξιολογήθηκε σε ένα βENCHMARK σύνολο δεδομένων για το οποίο είχαν ήδη αναγνωριστεί διαρρεύσεις στο σύνολο δεδομένων προ-εκπαίδευσης. Τα αποτελέσματα συγκρίθηκαν σε τέσσερις υπο-συνόλους: το πλήρες βENCHMARK· ένα υπο-σύνολο διαρρεουσών δειγμάτων· ένα υπο-σύνολο μη-διαρρεουσών δειγμάτων· και ένα τυχαία επιλεγμένο υπο-σύνολο του ίδιου μεγέθους με το διαρρεοσύνδεσμο όμιλος (χρησιμοποιημένο ως έλεγχος).
Η επίδραση της διαρροής δεδομένων στις τρεις κατωτέρω εργασίες μετρήθηκε χρησιμοποιώντας υπο-συνόλους βENCHMARK που ήταν γνωστό ότι περιέχουν διαρρεουσά δείγματα. Στη zero-shot ταξινόμηση, ένα μοντέλο προ-εκπαιδευμένο στο LAION έφτασε σε αξιοσημείωτα υψηλότερη ακρίβεια στις διαρρεουσές εικόνες από το σύνολο αξιολόγησης ImageNet, επιβεβαιώνοντας ότι η έκθεση ακόμη και σε近-απλότυπα κατά την εκπαίδευση παρέχει一个 μετρήσιμο πλεονέκτημα:

Ακρίβεια zero-shot ταξινόμησης στο σύνολο αξιολόγησης ImageNet σε υπο-συνόλους με και χωρίς διαρροή. Η τελευταία στήλη αναφέρει κέρδη ακρίβειας σχετικά με το πλήρες σύνολο, και οι υπογραμμισμένες γραμμές αντιστοιχούν σε διαρρεοσύνδεσμους υπο-συνόλους.
Για την επίβλεπτη ταξινόμηση, η διαρροή στο ImageNet προκάλεσε δραματική πτώση της απόδοσης – εκτός εάν η διαρρεοσύνδεσμος εικόνα είχε το ίδιο λεζάντα και στα δύο διαχωρισμούς, σε περίπτωση που το μοντέλο έφτασε σε σχεδόν τέλεια ακρίβεια, αποκαλύπτοντας einen ισχυρό απομνημονεύσιμο αποτέλεσμα:

Ακρίβεια επίβλεπτης ταξινόμησης στο σύνολο αξιολόγησης ImageNet για υπο-συνόλους με και χωρίς διαρροή. Οι στήλες κέρδους δείχνουν την αλλαγή σχετικά με το πλήρες σύνολο. Τα διαρρεοσύνδεσμα υπο-συνόλους είναι υπογραμμισμένα.
Στην ανάκτηση εικόνας-κειμένου, η απόδοση βελτιώθηκε ξανά για τις διαρρεουσές εικόνες, με και τη σκληρή και τη μαλακή διαρροή να οδηγούν σε υψηλότερη ανακλήσεις, και με τα διαρρεοσύνδεσμα υπο-συνόλους να δίνουν επίσης πιο σταθερά αποτελέσματα σε διαφορετικές εκτελέσεις:

Ακρίβεια ανάκτησης εικόνας-κειμένου στο Flickr30k σε υπο-συνόλους με και χωρίς διαρροή, με διαρρεοσύνδεσμους υπο-συνόλους υπογραμμισμένους.
Οι συγγραφείς συνεχίζουν:
‘Συνολικά, δείχνουμε συνεπή αποδεικτικά στοιχεία ότι η διαρροή αποτελεί einen σοβαρό κίνδυνο για την δίκαιη αξιολόγηση μοντέλων σε οπτικά σύνολα,危害 одну από τις πιο θεμελιώδεις αρχές της μηχανικής μάθησης: να μην αξιολογούνται μοντέλα στα δεδομένα εκπαίδευσής τους.’
Συμπέρασμα
Ένα σοκαριστικό σημείο της εργασίας, αν και δεν είναι καινούργιο, είναι ο λόγος για την ανάγκη να χρησιμοποιηθεί το CLIP για να ληφθούν ενσωματώσεις για το τεράστιο βουνό δεδομένων εικόνων στη LAION, αντιπροσωπεύοντας μια κλίμακα που δεν μπορεί πλέον να αντιμετωπιστεί με κανέναν άλλο τρόπο παρά με συσσωρευμένα μετα-δεδομένα αντί για τις πιο λεπτομερείς ιδιότητες που μπορούν να ελεγχθούν όταν ένα σύνολο είναι πιο διαχειρίσιμο.
Είναι μια σκληρή εικονογράφηση του βαθμού στον οποίο η εκπαίδευση των μοντέλων όρασης-γλώσσας έχει οριστικά ξεπεράσει τα όρια και τις δυνατότητες της ανθρώπινης επιτήρησης, ή οποιαδήποτε είδους χειροκίνητης επιμέλειας πέρα από αντιπροσωπευτικά υπο-δείγματα.
* Πιθανότατα κάπως συγχυσμένα, το πρόβλημα της διπλοποίησης ορίζεται στην εργασία ως ‘διαρροή’.
† Τονισμός των συγγραφέων.
Πρώτη δημοσίευση Τρίτη, 26 Αυγούστου 2025












