Η γωνία του Anderson

Η AI Αναφέρει Ξανά και Ξανά τις Ίδιες Εργασίες – Όπως οι Άνθρωποι

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
AI-generated article image (GPT Image 2): an industrial humanoid robot sits with its feet raised, reading Popular Mechanics beside a turntable playing a record and a partially filled metal record rack. A cat sleeps on otherwise empty shelving behind it. A yellow-and-black border reads ‘AI FANTASY INSIDE’ and ‘REALITY OUTSIDE’.

Το ChatGPT και άλλα εργαλεία γραφής AI ενδέχεται να μετατρέπουν σιωπηλά την επιστήμη σε διαγωνισμό δημοτικότητας, οδηγώντας επανειλημμένα τους ερευνητές προς τις ίδιες εργασίες, ενώ παραβλέπουν νέες και καινοτόμες δουλειές που θα μπορούσαν πραγματικά να προωθήσουν το πεδίο.

 

Μονοκαλλιέργεια, όσον αφορά τη συχνότητα και τα στατιστικά, είναι η επανάληψη του ίδιου περιορισμένου συνόλου πηγών ή πόρων ξανά και ξανά, καταπνίγοντας νέες φωνές και φρέσκιες προοπτικές: το ίδιο περιορισμένο σύνολο τραγουδιών στο πρόγραμμα ραδιοφώνου· η ίδια σειρά συγγραφέων και βιβλίων στα ράφια των αερολιμένων· και η ίδια περιορισμένη επιλογή φρούτων και λαχανικών στα σούπερ μάρκετ:

Yes, we have these bananas, and only these bananas. Source - https://www.thaitissues.com/en/post/a-deep-dive-into-the-grand-naine-banana-the-king-of-the-global-banana-market-and-its-crossroads-f

Ναι, έχουμε αυτές τις μπανάνες – και μόνο αυτές τις μπανάνες. Η ομοιογένεια των φρούτων και λαχανικών στις δυτικές αλυσίδες τροφίμων αγνοεί τις εκατοντάδες άλλες δυνατότητες ειδών σε κάθε περίπτωση, επειδή οι διάφορες αλυσίδες παραγωγής και μεταφοράς είναι πολύ δαπανηρές για να βιομηχανοποιηθούν τύποι φρούτων ή λαχανικών. Πηγή

Αυτό συμβαίνει επίσης στις αναφορές που εμφανίζονται σε νέες επιστημονικές έρευνες, όπου οι ερευνητές, ίσως αδιάφορα, προτιμούν ένα «αξιόπιστο» σύνολο πηγών που αποκτά ορμή μέχρι να αρχίσει να κυριαρχεί σε κλάδους έρευνας.

Αυτό είναι γνωστό ως Επίδραση Ματθίου – μια κοινωνιολογική θεωρία που υποστηρίζει ότι οι κατοχούμενοι θα ωφελούνται πάντα; το σύνδρομο έχει συγκριθεί με την υπόσχεση του Ματθίου 13:12, η οποία αναφέρει «Όσοι έχουν, θα δοθεί περισσότερα, και θα έχουν αφθονία. Όσοι δεν έχουν, ακόμη και ό,τι έχουν, θα τους αφαιρεθεί».

Η Πλειονότητα

Μία από τις μεγάλες ελπίδες της έρευνας ενισχυμένης από AI ήταν ότι νέες μέθοδοι μηχανικής μάθησης θα μπορούσαν να ξεφύγουν από την Επίδραση Ματθίου – επίσης γνωστή ως προκατάληψη δημοτικότητας – και να αρχίσουν να αναφέρουν λιγότερο γνωστά έργα που ίσως είναι πιο ευκρινή ή πιο κατάλληλα στο επιχείρημα ενός άρθρου.

Ωστόσο, με βάση τον τρόπο με τον οποίο οι διαδικασίες εκπαίδευσης AI ερμηνεύουν τα σύνολα δεδομένων, δεν υπήρχε ποτέ καλή αιτία για αυτή την αισιοδοξία· και έχει αποδειχθεί επανειλημμένα ότι όταν η AI δεν εφευρίσκει αναφορές άμεσα – ένα χρόνιο πρόβλημα μέχρι σήμερα – συνεχίζει πραγματικά την Επίδραση Ματθίου, όπως κάνουν και οι άνθρωποι – αν και ίσως όχι για τον ίδιο λόγο.

Κατά τη διάρκεια της εκπαίδευσης, ένα μοντέλο μαθαίνει να δίνει υψηλή κατάταξη στα πιο αναφερόμενα (ή «συχνά επαναλαμβανόμενα») άρθρα σε ένα σύνολο εκπαίδευσης, επειδή οι διαδικασίες εκπαίδευσης σχεδιάζονται ώστε να αποτυπώνουν ουσιαστικά μοτίβα, και να αποκλείουν τα εξωτερικά σημεία ως «θόρυβο», ή στατιστικές ανωμαλίες.

Σε αυτό το καθεστώς, το ισοδύναμο της θεωρίας της σχετικότητας του Αϊνστάιν δεν θα λάβει ποτέ προσοχή από τη μηχανή, η οποία, αφού εκπαιδευτεί, αισθάνεται ότι έχει ήδη βρει τις αρχές και τις αναφορές της, και μπορεί μόνο ελαφρώς να προσαρμόσει αυτή τη θέση απευθυνόμενη σε νεότερες δημοσιεύσεις μέσω RAG, ή με άλλους τρόπους που επεκτείνουν την εμβέλεια του μοντέλου πέρα από το εκπαιδευμένο του πλέγμα.

Το πρόβλημα είναι ότι δεν θα αποδώσει πίστωση σε τέτοια νέα έργα με τον ίδιο τρόπο όπως στα «παλιά αγαπημένα» που ήδη γνώριζε, ή καθόλου, επειδή οι στατιστικές του προκαταλήψεις είναι πλέον αρκετά ενσωματωμένες.

Έτσι, η AI δεν παρατηρεί και δεν μιμείται πραγματικά την ανθρώπινη συμπεριφορά όταν ενισχύει την Επίδραση Ματθίου – απλώς μετράει πόσες φορές οι ερευνητές αδιάφορα προτιμούν τις ίδιες παλιές εργασίες, και κατά συνέπεια τις κατατάσσουν ψηλά. Σε αυτό το πλαίσιο, το πρόβλημα της επανάληψης των αναφορών σχετίζεται με την πρόκληση του επιλογής ενός πραγματικά ενδιαφέροντος επιστημονικού άρθρου από το αέναα αυξανόμενο χιονοστιβάδα των δημοσιεύσεων AI, καθώς το πιο ισχυρό έργο θα έχει συχνά το πιο αδύναμο σήμα.

Διάγνωση Μονοκαλλιέργειας

Το ζήτημα αυτό αντιμετωπίζεται σε ένα ενδιαφέρον νέο άρθρο από τις ΗΠΑ με τίτλο When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models. Η νέα εργασία – μια συνεργασία μεταξύ του University of Texas at Austin, Stevens Institute of Technology, Washington University at St Louis, Rice University και University of Notre Dame – επιδιώκει να αποδείξει οριστικά την ύπαρξη μονοκαλλιέργειας αναφορών στη μηχανική μάθηση, ώστε οι μεταβλητές της να μπορούν ενδεχομένως να αντιμετωπιστούν άμεσα στο μέλλον, μαζί με το ίδιο το πρόβλημα.

Στις δοκιμές, οι συγγραφείς διαπίστωσαν ότι έντεκα μοντέλα από OpenAI, Google και Anthropic προτιμούσαν επανειλημμένα την ίδια μικρή ομάδα εργασιών – ακόμη και μετά την αφαίρεση των προφανών σημάτων δημοτικότητας.

Για να το δοκιμάσουν, 120 πραγματικές εργασίες αφαιρέθηκαν από τις μετρήσεις αναφορών και τα περιοδικά δημοσιεύσεων, ενώ τα ονόματα των συγγραφέων αντικαταστάθηκαν και τα έτη δημοσίευσης ανατέθηκαν τυχαία. Τυχαία σύνολα τριάντα εργασίες παρουσιάστηκαν σε κάθε μοντέλο, το οποίο επιτρεπόταν να αναφέρει το πολύ δέκα.

Οκτώ ανθρώπινες ειδικές στον σχετικό τομέα έλαβαν τις ίδιες τυποποιημένες εργασίες, αλλά δεν συνέγγισαν τις ίδιες προτιμήσεις με τις AI, υποδεικνύοντας ότι η προκατάληψη ήταν συγκεκριμένη στα μοντέλα AI και όχι στις ίδιες τις εργασίες:

From the new paper, test results comparing citation choices by AI models and human experts. Across all eleven models, citations were concentrated on a smaller group of papers, while some papers were repeatedly passed over entirely. Human experts showed neither tendency. Source - https://arxiv.org/pdf/2608.19230

Από το νέο άρθρο, αποτελέσματα δοκιμών που συγκρίνουν τις επιλογές αναφορών από μοντέλα AI και ανθρώπινους ειδικούς. Σε όλα τα έντεκα μοντέλα, οι αναφορές συγκεντρώθηκαν σε μια μικρότερη ομάδα εργασιών, ενώ ορισμένες εργασίες παραλείπονταν επανειλημμένα εντελώς. Οι ανθρώπινοι ειδικοί δεν έδειξαν καμία τέτοια τάση. Πηγή

Οι ίδιες εργασίες παρέμειναν δημοφιλείς ακόμη και όταν τα μοντέλα ζητήθηκαν μόνο να επιλέξουν παραπομπές, δείχνοντας ότι η συγγραφή της ανασκόπησης από μόνη της δεν προκαλούσε την προκατάληψη.

Το πείραμα επεκτάθηκε σε έντεκα γύρους, με 120 AI-συγγραμμένες εργασίες να προστίθενται μετά από κάθε γύρο, για να δοκιμαστεί τι συμβαίνει όταν αυτές οι κοινές προτιμήσεις λειτουργούν σε ένα αυξανόμενο σύνολο ερευνών που παράγονται από AI.

Καθώς προστέθηκαν περισσότερες εργασίες που γράφτηκαν από AI, τα μοντέλα συγκέντρωσαν όλο και περισσότερο τις αναφορές τους σε έναν μειούμενο αριθμό των αρχικών ανθρώπινων εργασιών.

Οι συγγραφείς αναφέρουν:

‘Καθώς τα μοντέλα γλώσσας μεταβαίνουν από τη σύνταξη κειμένου στην εκτέλεση πρακτόρων αναζήτησης βιβλιογραφίας με κλήσεις εργαλείων, οι κατασκευασμένες αναφορές γίνονται πιο εύκολα εντοπίσιμες και περιορισμένες.’

‘Η πιο δύσκολη αποτυχία αρχίζει αφού κάθε υποψήφιος είναι πραγματικός: διαφορετικά μοντέλα μπορεί ακόμη να επιλέξουν το ίδιο στενό υποσύνολο, παράγοντας μονοκαλλιέργεια αναφορών χωρίς καμία μεμονωμένη αναφορά να είναι λανθασμένη.’

Ως μέτρο αντιμετώπισης του προβλήματος, το άρθρο υποστηρίζει ότι η απλή ανάμειξη μοντέλων από διαφορετικούς προμηθευτές ή η ίση έκθεση των εργασιών δεν θα είναι επαρκής, καθώς μεγάλο μέρος της προτίμησης είναι κοινό μεταξύ των μοντέλων. Αντίθετα, η υποκείμενη προτίμηση για συγκεκριμένες εργασίες θα πρέπει να αλλάξει – ενδεχομένως με την προσεκτική ανάδειξη των παραμελημένων εργασιών. Ωστόσο, οι συγγραφείς τονίζουν ότι αυτή η προσέγγιση παραμένει αδημοσίευτη.

Προσεγγίσεις Δοκιμών

Το σύνολο αναφοράς δημιουργήθηκε από 120 πραγματικές εργασίες αποσταθμίσεως γνώσης που συλλέχθηκαν από το arXiv και δημοσιεύτηκαν μεταξύ 2015 και 2022. Κάθε μία είχε μεταξύ 50 και 500 αναφορές τη στιγμή της συλλογής, ένα εύρος που επιλέχθηκε ώστε να εξαιρούνται τόσο οι άγνωστες όσο και οι εξαιρετικά επιδραστικές εργασίες.

Το πείραμα ξεκίνησε με τυχαία επιλογή τριάντα εργασιών από τη διαθέσιμη συλλογή, με κρυμμένα τα ονόματα των συγγραφέων, τα έτη δημοσίευσης και τις μετρήσεις αναφορών. Κάθε μοντέλο παρήγαγε μια σύντομη ανασκόπηση ή θέση που ανέφερε το πολύ δέκα εργασίες, και αυτές οι επιλογές συγκρίθηκαν με τυχαίες επιλογές από το ίδιο υλικό:

Method used to test citation preferences. Thirty randomly selected papers were shown to a model with identifying information hidden, after which it could cite up to ten. Its choices were compared with random selection, while each round added 120 AI-written papers to the next round's collection.

Σχήμα της μεθόδου που χρησιμοποιήθηκε για τη δοκιμή προτιμήσεων αναφορών. Τριάντα τυχαία επιλεγμένες εργασίες παρουσιάστηκαν σε ένα μοντέλο με κρυμμένες ταυτοποιητικές πληροφορίες, μετά το οποίο μπορούσε να αναφέρει έως δέκα. Οι επιλογές του συγκρίθηκαν με τυχαία επιλογή, ενώ κάθε γύρος πρόσθετε 120 εργασίες που γράφτηκαν από AI στη συλλογή του επόμενου γύρου.

Στο εκτεταμένο πείραμα, 120 νεοδημιουργημένες εργασίες εισήχθησαν στη συλλογή μετά από κάθε γύρο, αυξάνοντας σταδιακά το ποσοστό των ερευνών που γράφτηκαν από AI.

Στις προκαταρκτικές δοκιμές, τα μοντέλα είχαν την τάση να αναφέρουν τις περισσότερες εργασίες που τους παρουσιάζονταν, επιλέγοντας συνήθως 22 έως 27 από τις 30. Οι ερευνητές έτσι όρισαν μέγιστο αριθμό δέκα αναφορών για το κύριο πείραμα, αναγκάζοντας τα μοντέλα να κάνουν πιο επιλεκτικές επιλογές.

Παρακάτω βλέπουμε μια σύνοψη του προκύπτοντος σχεδίου πειράματος:

Experimental setup used to test citation preferences. The study began with 120 real papers and tested eleven models from three vendors, using randomized sets of 30 papers and a maximum of ten citations. Later rounds added AI-generated papers, expanding the collection to 1,440 papers.

Δοκιμαστική ρύθμιση που χρησιμοποιήθηκε για τη δοκιμή προτιμήσεων αναφορών. Η μελέτη ξεκίνησε με 120 πραγματικές εργασίες και δοκίμασε έντεκα μοντέλα από τρεις προμηθευτές, χρησιμοποιώντας τυχαία σύνολα 30 εργασιών και μέγιστο αριθμό δέκα αναφορών. Οι επόμενοι γύροι πρόσθεσαν εργασίες που δημιουργήθηκαν από AI, επεκτείνοντας τη συλλογή σε 1.440 εργασίες.

Το αρχικό πείραμα χρησιμοποίησε έντεκα μοντέλα από τους τρεις κύριους παρόχους: η OpenAI εκπροσωπήθηκε από GPT-5, GPT-5 mini, GPT-4.1 και GPT-4.1 mini; η Google από Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro και Gemini 3.1 Flash-Lite; και η Anthropic από Claude Opus 4.8, Claude Sonnet 4.6 και Claude Haiku 4.5.

Στα αποτελέσματα δοκιμής που φαίνονται παρακάτω, βλέπουμε πόσο κάθε μοντέλο συγκέντρωσε τις αναφορές του σε μια μικρή ομάδα εργασιών· πόσες εργασίες αγνόησε εντελώς· και πόσο συνεπώς έκανε τις ίδιες επιλογές όταν το πείραμα επαναλήφθηκε:

Test results showing how strongly each model concentrated its citations on particular papers and how many papers it ignored entirely. 'Top-10% share' shows how many citations went to the 12 most-favored papers, while 'HHI' measures how concentrated citations were overall. 'Reliability' shows how consistently each model favored the same papers across tests, and ρ shows how similar those preferences were across models. The 'Matched null' row indicates what would be expected if papers were chosen at random.

Αποτελέσματα δοκιμής που δείχνουν πόσο έντονα κάθε μοντέλο συγκέντρωσε τις αναφορές του σε συγκεκριμένες εργασίες και πόσες εργασίες αγνόησε εντελώς. Το «Top-10% share» δείχνει πόσες αναφορές πήγαν στις 12 πιο προτιμώμενες εργασίες, ενώ το «HHI» μετράει πόσο συγκεντρωμένες ήταν οι αναφορές συνολικά. Η «Αξιοπιστία» δείχνει πόσο σταθερά κάθε μοντέλο προτιμούσε τις ίδιες εργασίες σε δοκιμές, και το ρ δείχνει πόσο παρόμοιες ήταν αυτές οι προτιμήσεις μεταξύ μοντέλων. Η γραμμή «Matched null» υποδεικνύει τι θα αναμενόταν αν οι εργασίες επιλέγονταν τυχαία.

Τι Προτιμούν Πραγματικά τα Μοντέλα;

Η προτίμηση διαπιστώθηκε ότι προέρχεται κυρίως από το περιεχόμενο των ίδιων των εργασιών. Για παράδειγμα, για το GPT-5 mini, περίπου το 90% της διακύμανσης στις προτιμώμενες εργασίες αποδίδεται στο περιεχόμενο, αντί σε παράγοντες όπως η σειρά λίστας, ο θόρυβος παραγωγής ή τα κατασκευασμένα μεταδεδομένα που συνδέονται με κάθε εργασία. Το ίδιο φαινόμενο «κυρίαρχου περιεχομένου» επαναλήφθηκε με το GPT-4.1 mini.

Ο χάρτης προτιμήσεων (βλέπε παρακάτω) επίσης παρέμεινε σχεδόν αμετάβλητος όταν οι τίτλοι και τα abstracts ξαναγράφηκαν σημαντικά διατηρώντας το νόημά τους. Σε τέσσερις επιτυχημένες δοκιμές παραφράσεων, επιτεύχθηκαν συσχετίσεις 0,95–0,99, παρά τη χρήση διαφορετικών μοντέλων από τρεις προμηθευτές για την αναδιατύπωση.

Αλλαγές στον χάρτη προτιμήσεων παρατηρήθηκαν μόνο όταν το υποκείμενο νόημα μεταβλήθηκε μετρήσιμα:

Test results comparing citation preferences across the eleven models. The numbers show how closely each pair of models favored the same papers, with higher values indicating greater agreement. Despite differences between models and vendors, broadly similar preferences were found across the group

Αποτελέσματα δοκιμής που συγκρίνουν τις προτιμήσεις αναφορών μεταξύ των εννέα μοντέλων. Οι αριθμοί δείχνουν πόσο στενά κάθε ζεύγος μοντέλων προτιμούσε τις ίδιες εργασίες, με υψηλότερες τιμές να υποδεικνύουν μεγαλύτερη συμφωνία. Παρά τις διαφορές μεταξύ μοντέλων και προμηθευτών, παρατηρήθηκαν ευρέως παρόμοιες προτιμήσεις στην ομάδα.

Τα μοντέλα φαίνεται λοιπόν να ανταποκρίνονται κυρίως στο σημασιολογικό περιεχόμενο αντί σε συγκεκριμένη διατύπωση. Ωστόσο, ο λόγος για τη δυνατή τους συμφωνία δεν μπόρεσε να προσδιοριστεί οριστικά.

Είναι δυνατόν, όπως υποστηρίζουν οι συγγραφείς, ότι μια κοινή συναίνεση αναφορών μπορεί να έχει απορροφηθεί κατά τη διάρκεια της εκπαίδευσης. Μια εναλλακτική πιθανότητα είναι ότι παρόμοιες κρίσεις για το τι αποτελεί «αναφερόμενη» εργασία μπορεί να επιτευχθούν ανεξάρτητα.

Έτσι, η ύπαρξη της κοινής προτίμησης επιβεβαιώθηκε, αλλά η τελική της προέλευση παραμένει άγνωστη.

Οι συγγραφείς προτείνουν ότι η ευρεία χρήση της AI στην έρευνα θα μπορούσε να περιορίσει το φάσμα των εργασιών που λαμβάνουν προσοχή, επειδή διαφορετικά μοντέλα τείνουν να προτιμούν πολλές από τις ίδιες εργασίες· και καθώς η λογοτεχνία που παράγεται από AI συσσωρεύεται, αυτές οι κοινές προτιμήσεις μπορεί να ενισχυθούν περαιτέρω μέσω επαναλαμβανόμενων αναφορών, καθιστώντας τις λιγότερο προτιμώμενες έρευνες όλο και πιο δύσκολες στην ανακάλυψη. Η ποικιλομορφία των αναφορών και η παρακολούθηση της συγκέντρωσης των αναφορών προτείνονται λοιπόν ως πιθανά μέτρα προστασίας.

Το σύνολο αναφοράς της μελέτης για την επαναλαμβανόμενη συγκέντρωση αναφορών είναι πλέον διαθέσιμο στο GitHub.

Συμπέρασμα

Άποψη Ως κάποιος που διαβάζει έναν υπερβολικά μεγάλο αριθμό ερευνητικών άρθρων AI εβδομαδιαία, έχω παρατηρήσει «κύματα αναφορών» που έρχονται και φεύγουν. Ένα διαρκές σταθερό είναι το Google Attention Is All You Need, το αρχικό άρθρο των Transformers, το οποίο τώρα είναι ενσωματωμένο στα πρότυπα υποβολής.

Ένας άλλος επαναλαμβανόμενος παραβάτης, για πολύ καιρό, ήταν το 2014 Generative Adversarial Networks, αν και τελικά αντικαταστάθηκε σε συχνότητα από τα Denoising Diffusion Probabilistic Models και άλλες μελέτες βασισμένες στη διάχυση.

Σχεδόν σε όλες τις περιπτώσεις, αυτές οι «επαναλαμβανόμενες» αναφορές δεν είναι λάθος καθαυτές· αλλά συχνά είναι πολύ ευρείες ώστε να μην αποτελούν χρήσιμη υποστήριξη για το άρθρο στο οποίο παρατίθενται· και με αυτήν την έννοια, αντιπροσωπεύουν κάτι παρόμοιο με το «citation-washing» – την ένταξη «αξιόπιστων» αλλά κυρίως διακοσμητικών πηγών, για μια χαμηλής προσπάθειας αίσθηση αξιοπιστίας.

 

Πρώτη δημοσίευση Δευτέρα, 24 Αυγούστου 2026. Τροποποιήθηκε στις 23:07 EET για να προστεθεί το ελλιπές πληθυντικό.

Πηγές του αρχικού άρθρου: pubmed.ncbi.nlm.nih.gov [1]

Συγγραφέας στον τομέα της μηχανικής μάθησης, ειδικός σε συνθετικές ανθρώπινες εικόνες. Πρώην επικεφαλής του τμήματος περιεχομένου έρευνας στην Metaphysic.ai, μέχρι τη διάλυσή της στην Brahma.ai της DNEG.
Ιστοσελίδα: martinanderson.ai
Επικοινωνία: martin@martinanderson.ai