Η γωνία του Anderson

Η “Δημιουργική” Απόδοση των Μοντέλων AI γίνεται όμοια μεταξύ των Πάροχων

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
AI-Generated article illustration (GPT Image 2): three overlapping white envelopes carry Shakespeare stamps labeled 'CLAUDE', 'CHATGPT' and 'GEMINI' in pink, green and blue, resting on a wooden surface. A yellow-and-black warning-style border surrounds the scene, reading 'AI FANTASY INSIDE' and 'REALITY OUTSIDE', with black arrows and striped corner markings.

Νέα έρευνα υποδηλώνει ότι τα μοντέλα AI από ανταγωνιστικές εταιρείες γίνονται όμοια στις δημιουργικές τους απαντήσεις, ενδεχομένως περιορίζοντας το φάσμα των ιδεών που συναντούν οι χρήστες.

 

Νέα έρευνα από τις ΗΠΑ διαπίστωσε ότι η “δημιουργική” απόδοση σε ένα ευρύ φάσμα κορυφαίων μοντέλων AI γίνεται όλο και πιο παρόμοια με την πάροδο του χρόνου.

Οι συγγραφείς, από το Πανεπιστήμιο Duke, έδωσαν δοκιμές σε 69 μοντέλα από 12 οικογένειες παρόχων, καλύπτοντας κυκλοφορίες από το 2023 έως το 2026, και βρήκαν στατιστικά σημαντική μείωση στην ποικιλία των αποτελεσμάτων τόσο σε πραγματικές ανοιχτές ερωτήσεις όσο και σε ένα τυπικό τεστ δημιουργικότητας – υποδεικνύοντας ότι όλο και πιο συχνά προσφέρονται παρόμοιες ιδέες ως απάντηση σε “δημιουργικά” αιτήματα από όλους τους κύριους παρόχους LLM.

Οι οικογένειες παρόχων που δοκιμάστηκαν ήταν Anthropic· Cohere· DeepSeek· Google· Meta· MiniMax· Mistral AI· Moonshot AI· OpenAI· Qwen· xAI· και Z.ai*:

From the new paper - model releases used in the study, from Μάρτιος 2023 to Ιούλιος 2026. The chart covers 68 mode versions across 12 AI providers, demonstrating how the models tested were distributed across the three-year period, and showing increasingly frequent release schedules for some providers, which has to be accounted for in the authors' reckonings. Source - https://arxiv.org/pdf/2608.19437

Από το νέο άρθρο – κυκλοφορίες μοντέλων που χρησιμοποιήθηκαν στη μελέτη, από Μάρτιο 2023 έως Ιούλιο 2026. Το διάγραμμα καλύπτει 69 εκδόσεις μοντέλων από 12 παρόχους AI, δείχνοντας πώς τα δοκιμασθέντα μοντέλα διανεμήθηκαν κατά τη διάρκεια των τριών ετών, και καταδεικνύοντας ότι ορισμένοι πάροχοι αύξησαν τη συχνότητα κυκλοφοριών, κάτι που πρέπει να ληφθεί υπόψη στις εκτιμήσεις των συγγραφέων. Source

Οι συγγραφείς του νέου άρθρου δηλώνουν**:

«Βρίσκουμε ότι οι απαντήσεις LLM στις ανοιχτές προτροπές που [ελέγχουμε] έχουν γίνει όλο και πιο παρόμοιες με την πάροδο του χρόνου».

«Αυτό υποδηλώνει ότι τα LLM γίνονται λιγότερο δημιουργικά σε εργασίες που απαιτούν παραγωγή ανοιχτών απαντήσεων, θέτοντας υπό αμφισβήτηση τη μακροπρόθεσμη χρησιμότητά τους ως δημιουργικοί βοηθοί.»

Παρόλο που η «αλγοριθμική μονοκαλλιέργεια» έχει καθιερωθεί ως γραμμή έρευνας, η εξέταση των τάσεων προς ομοιογένεια στα δημιουργικά αποτελέσματα που παράγουν τα AI δεν είχε προηγουμένως διερευνηθεί, όπως υποστηρίζουν οι συγγραφείς.

Ωστόσο, απομονωμένα περιστατικά είχαν υποδείξει αυτή τη σύγκλιση για κάποιο χρονικό διάστημα, όπως η παράξενη περίπτωση που περιγράφεται στη μελέτη του Πανεπιστημίου Cornell Μάιος 20026, όπου ένα ευρύ φάσμα παρόχων LLM έδειξε παράξενες, συγκρουόμενες εμμονές με «φύλακες φάρων» και ένα συγκεκριμένο σύνολο ανήχοιων ονομάτων, όπως «Mara» και «Elias»:

In May, Cornell University's new paper found strange similarities across LLM providers when given 'open prompts' – though no clues as to why have yet become apparent in the diverse training data fueling these models.

Τον Μάιο, η νέα μελέτη του Πανεπιστημίου Cornell βρήκε παράξενες ομοιότητες μεταξύ παρόχων LLM όταν τους δόθηκαν «ανοιχτές προτροπές» – αν και δεν έχουν ακόμη εμφανιστεί ενδείξεις για το γιατί αυτό συμβαίνει στα διαφορετικά σύνολα δεδομένων εκπαίδευσης που τροφοδοτούν αυτά τα μοντέλα.

Η νέα μελέτη είναι πιο συστηματική: οι συγγραφείς έδωσαν δοκιμές σε τρία χρόνια μοντέλων τόσο με πραγματικές δημιουργικές προτροπές όσο και με ένα κλασικό ψυχολογικό τεστ που ζητά ασυνήθιστες χρήσεις καθημερινών αντικειμένων. Στη συνέχεια μέτρησαν πόσο μακριά ήταν οι απαντήσεις των μοντέλων σε σημασιολογικό επίπεδο, παρακολουθώντας αν αυτές οι αποστάσεις μειώνονταν με τις διαδοχικές γενιές.

Οι συγγραφείς της νέας εργασίας, με τίτλο Are LLMs becoming similarly creative? Evidence from three years of models, δηλώνουν:

«Τα ευρήματά μας, αν και προκαταρκτικά, εγείρουν ανησυχίες για τη μακροπρόθεσμη χρησιμότητα των LLM ως δημιουργικούς συνεργάτες. Ακόμη και αν τα μοντέλα αποδίδουν καλά σε δημιουργικές εργασίες, η σύγκλιση των αποτελεσμάτων θα μπορούσε να περιορίσει το φάσμα των δυνατοτήτων που εκτίθενται στους χρήστες, περιορίζοντας έτσι το εύρος της δικής τους σκέψης.»

«Αν η χρήση ενός LLM για δημιουργικές εργασίες όπως η συγγραφή δοκιμής μειώνει τη δραστηριότητα του εγκεφάλου, θα μπορούσε η χρήση ολοένα και λιγότερο δημιουργικών LLM – η τάση που υποδεικνύει η μελέτη μας – να επιδεινώσει περαιτέρω τις επιδράσεις των LLM στη ανθρώπινη δημιουργικότητα, όπως παρατηρήθηκε σε αυτήν και σε άλλες μελέτες

Ήδη, οι διαφορετικές ιδιότητες των κειμένων LLM έχουν γίνει υλικό για memes; και, όπως ανέφερουμε τον Μάιο του τρέχοντος έτους, τουλάχιστον ένας συγγραφέας έχει ήδη αυτοεκδώσει ένα βιβλίο που φέρεται να περιλαμβάνει την προαναφερθείσα «εμμονή φάρων» κοινή στα μεγάλα μοντέλα.

Έτσι, σε ένα κλίμα όπου εκδότες αποσύρουν όλο και περισσότερο βιβλία που υποπτεύονται ότι είναι γραμμένα ή βοηθημένα από AI, η νέα έρευνα φαίνεται να υποδεικνύει ότι μπορούμε να περιμένουμε μια αύξηση «συμπτώσεων πλοκής» που προέρχονται από φαινομενικά ανθρώπινα κείμενα, συμπεριλαμβανομένων ακαδημαϊκών εργασιών που υποβάλλονται από φοιτητές.

Όσον αφορά την προέλευση αυτής της σύγκλισης, οι συγγραφείς υποθέτουν ότι η επικάλυψη δεδομένων εκπαίδευσης και οι όλο και πιο παρόμοιες βελτιστοποιητικές στόχοι μπορεί να ωθούν τα μοντέλα προς συγκρίσιμες εσωτερικές αναπαραστάσεις εννοιών και σημασιολογικών σχέσεων – τελικά παράγοντας πιο παρόμοιες απαντήσεις:

«[Παραμένει] ασαφές αν αυτή η ομοιογένεια είναι προσωρινό παράγωγο μιας ακόμη αναπτυσσόμενης τεχνολογίας ή αναπόφευκτη – ενδεχομένως συσσωρευτική – χαρακτηριστική των στατιστικών μοντέλων γλώσσας.»

«Πιθανές δυνάμεις δείχνουν και τις δύο κατευθύνσεις. Ένα αυξανόμενο σώμα ακαδημαϊκών εργασιών υποστηρίζει ότι τα γενετικά μοντέλα που εκπαιδεύονται σε επικαλυπτόμενα δεδομένα και βελτιστοποιούνται προς παρόμοιους στόχους θα οργανώσουν έννοιες και σημασιολογικές σχέσεις σε όλο και πιο παρόμοιους τρόπους, με αποτέλεσμα παρόμοια αποτελέσματα.»

Ωστόσο, οι συγγραφείς επίσης αναφέρουν εργασία που δείχνει ότι καθώς τα μοντέλα εξελίσσονται, μπορεί να αποκλίνουν ξανά σε δικά τους, περιορισμένα χαρακτηριστικά όσον αφορά τη δημιουργική απόδοση.

Method

Για να παρακολουθήσουν αν τα μοντέλα AI γίνονται όλο και πιο όμοια, οι ερευνητές ξεκίνησαν με ανοιχτές ερωτήσεις, συλλέγοντας απαντήσεις από διαδοχικές γενιές μοντέλων. Κάθε απάντηση μετατράπηκε σε αριθμητική αναπαράσταση του νοήματός της, καθιστώντας δυνατή τη μέτρηση της ομοιότητας ή διαφοράς μεταξύ των απαντήσεων.

Ανάλυση παλινδρόμησης χρησιμοποιήθηκε στη συνέχεια για να καθοριστεί αν αυτές οι διαφορές μειώνονταν καθώς κυκλοφορούσαν νεότερα μοντέλα:

The authors' schema for measuring whether AI outputs become more similar over time. Open-ended creative prompts are run across different model families, their answers mapped by meaning to measure the distance between them, with regression analysis tracking how those distances change across successive model generations.

Το σχήμα των συγγραφέων για τη μέτρηση του αν τα αποτελέσματα AI γίνονται πιο παρόμοια με την πάροδο του χρόνου. Ανοιχτές δημιουργικές προτροπές εκτελούνται σε διαφορετικές οικογένειες μοντέλων, οι απαντήσεις τους χαρτογραφούνται κατά νόημα για να μετρηθεί η απόσταση μεταξύ τους, με ανάλυση παλινδρόμησης να παρακολουθεί πώς αυτές οι αποστάσεις αλλάζουν σε διαδοχικές γενιές μοντέλων.

Δύο σύνολα προτροπών επιλέχθηκαν για τη δοκιμή της δημιουργικότητας από διαφορετικές οπτικές. Πρώτον, η Εργασία Εναλλακτικών Χρήσεων (AUT), ένα τυπικό ψυχολογικό τεστ διασποράς σκέψης, ζητάει ασυνήθιστες χρήσεις για καθημερινά αντικείμενα, με τη μελέτη να χρησιμοποιεί αντικείμενα όπως ένα βιβλίο, παπούτσι και σφυρί. Η σταθερή μορφή του παρείχε έναν ελεγχόμενο τρόπο σύγκρισης των ιδεών που παράγουν διαφορετικά μοντέλα.

Επιπλέον 100 προτροπές αποσπάστηκαν από το Infinity-Chat100, μια συλλογή που προέρχεται από πραγματικές συνομιλίες με γλωσσικά μοντέλα. Αυτές κάλυπταν λιγότερο περιορισμένες δημιουργικές εργασίες που αφορούσαν παραγωγή περιεχομένου, επίλυση προβλημάτων, brainstorming και ιδεοποίηση· εργασίες που επιτρέπουν μεγαλύτερη ελευθερία στις απαντήσεις και τις προσεγγίσεις.

Τα πλήρη σύνολα προτροπών AUT και Infinity-Chat100 εστάλησαν σε μοντέλα που κυκλοφόρησαν μεταξύ Μαρτίου 2023 και Ιουλίου 2026, καλύπτοντας 12 παρόχους και συστήματα από Anthropic, Google, Meta, OpenAI, DeepSeek και Mistral AI. Όλες οι απαντήσεις συλλέχθηκαν μέσω του API του OpenRouter με τις ίδιες ρυθμίσεις δειγματοληψίας, με τη θερμοκρασία (ελευθερία δημιουργικής απόκρισης) και top-p και τα δύο ορισμένα στο ένα.

Τα μοντέλα ταξινομήθηκαν κατά μήνα κυκλοφορίας για να εξεταστεί αν οι νεότερες γενιές παρήγαγαν πιο παρόμοιες απαντήσεις.

Δεδομένου ότι οι ημερομηνίες κυκλοφορίας δεν αποτυπώνουν πραγματικά αλλαγές στα δεδομένα εκπαίδευσης, την αρχιτεκτονική ή την μετα-εκπαίδευση, οι συγγραφείς θεώρησαν ότι η παρατηρούμενη τάση αποτελεί συσχέτιση με την ανάπτυξη του μοντέλου, όχι αποδείξη ότι η ίδια η πάροδος του χρόνου προκαλεί σύγκλιση.

Οι απαντήσεις των μοντέλων μετατράπηκαν σε ενσωματώσεις (embeddings) χρησιμοποιώντας τον all-MiniLM-L6-v2 sentence‑transformer. Κάθε απάντηση αναπαρίσταται ως αριθμητικός διάνυσμα, επιτρέποντας στις απαντήσεις με παρόμοιο νόημα να τοποθετούνται σε παρόμοιες κατευθύνσεις και να μετράται η σημασιολογική τους απόσταση.

Για το AUT, όλες οι προτεινόμενες χρήσεις για κάθε αντικείμενο αντιμετωπίστηκαν ως μία ενιαία απάντηση, παράγοντας δέκα ενσωματώσεις ανά μοντέλο. Για το Infinity-Chat100, κάθε απάντηση ενσωματώθηκε ξεχωριστά, παράγοντας 100 ενσωματώσεις ανά μοντέλο.

Οι 27 μήνες κυκλοφορίας ομαδοποιήθηκαν σε εννέα χρονικές περιόδους, και συγκρίθηκαν μόνο μοντέλα από διαφορετικούς παρόχους. Οι σημασιολογικές αποστάσεις μεταξύ των απαντήσεων μετρήθηκαν εντός κάθε περιόδου, με μικρότερες αποστάσεις να υποδεικνύουν μεγαλύτερη ομοιότητα.

Για να αποτραπεί η κυριαρχία παρόχων με περισσότερα μοντέλα, η ανάλυση επαναλήφθηκε 1.000 φορές, χρησιμοποιώντας ισορροπημένα δείγματα από κάθε πάροχο.

Results

Η γραμμική παλινδρόμηση χρησιμοποιήθηκε στη συνέχεια για την παρακολούθηση αυτών των αποστάσεων με την πάροδο του χρόνου, με μια συνεπή αρνητική κλίση να υποδεικνύει ότι τα μοντέλα από διαφορετικούς παρόχους γίνονταν όλο και πιο παρόμοια:

Initial test results, showing whether creative responses from different AI providers became more similar over time. Semantic distances declined for both the Alternate Uses Task and Infinity-Chat100 prompts, while repeated balanced sampling produced consistently negative trends, indicating increasing similarity across model generations.

Αρχικά αποτελέσματα δοκιμών, δείχνοντας αν οι δημιουργικές απαντήσεις από διαφορετικούς παρόχους AI έγιναν πιο παρόμοιες με την πάροδο του χρόνου. Οι σημασιολογικές αποστάσεις μειώθηκαν τόσο για τις προτροπές του Alternate Uses Task όσο και για τις προτροπές Infinity‑Chat100, ενώ η επαναλαμβανόμενη ισορροπημένη δειγματοληψία παρήγαγε σταθερά αρνητικές τάσεις, υποδεικνύοντας αυξανόμενη ομοιότητα μεταξύ των γενεών μοντέλων.

Από αυτά τα αποτελέσματα οι συγγραφείς τονίζουν:

«Για τα σύνολα απαντήσεων AUT και Infinity‑Chat, παρατηρούμε μείωση στις αποστάσεις εξόδου μεταξύ παρόχων κατά την περίοδο παρατήρησης.»

«Αυτό υποδηλώνει μείωση της ποικιλίας – ή αύξηση της ομοιογένειας – των δημιουργικών εξόδων LLM με την πάροδο του χρόνου.»

Η διαφορά μεταξύ παλαιότερων και νεότερων μοντέλων ήταν πιο σαφής στο Alternate Uses Task. Η μέση απόσταση μεταξύ απαντήσεων από διαφορετικούς παρόχους έπεσε από περίπου 0,50 στα αρχικά μοντέλα σε κάτω από 0,40 στα πιο πρόσφατα, πράγμα που σημαίνει ότι οι απαντήσεις τους έγιναν σημαντικά πιο όμοιες. Το ίδιο μοτίβο βρέθηκε και στο Infinity‑Chat100, αν και η αλλαγή ήταν μικρότερη, με τη μέση απόσταση να πέφτει από περίπου 0,34 σε λίγο πάνω από 0,32.

Test results measuring how quickly answers from the different AI providers became more similar over time. The 'Alternate Uses' Task showed a much stronger decline in differences between models than Infinity-Chat, with both results remaining consistent across the researchers’ repeated sampling tests.

Αποτελέσματα δοκιμών που μετρούν πόσο γρήγορα οι απαντήσεις από διαφορετικούς παρόχους AI έγιναν πιο παρόμοιες με την πάροδο του χρόνου. Το ‘Alternate Uses’ Task παρουσίασε πολύ ισχυρότερη μείωση στις διαφορές μεταξύ μοντέλων σε σχέση με το Infinity‑Chat, με τα δύο αποτελέσματα να παραμένουν συνεπή σε επαναλαμβανόμενες δειγματοληψίες των ερευνητών.

Το εύρημα επιβίωσε και στις 1.000 επαναλήψεις ισορροπημένης επαναδειγματοληψίας. Σε κάθε περίπτωση, τα νεότερα μοντέλα παρήγαγαν απαντήσεις που ήταν πιο κοντά μεταξύ τους σε σχέση με τα παλαιότερα μοντέλα. Το μέγεθος αυτών των μειώσεων, μαζί με τα 95 % διαστήματα εμπιστοσύνης των ερευνητών, εμφανίζονται παραπάνω.

Σχετικά με αυτό, το άρθρο δηλώνει:

«Το μέγεθος της μείωσης στο AUT είναι ιδιαίτερα αξιοσημείωτο δεδομένου του σκοπού της εργασίας. Το AUT ελέγχει ρητά τη διασπορά σκέψης ζητώντας από τα μοντέλα να παράγουν χρήσεις που είναι όσο το δυνατόν πιο πρωτότυπες και απρόσμενες, καθιστώντας το ακριβώς το περιβάλλον όπου θα αναμέναμε διαφορετικά αποτελέσματα.»

Τα αποτελέσματα του Infinity‑Chat δείχνουν ότι η ίδια τάση εμφανίστηκε και σε πολύ ευρύτερο φάσμα δημιουργικών εργασιών. Οι 100 προτροπές του ζήτησαν από τα μοντέλα να παράγουν πολλές διαφορετικές μορφές ανοιχτών απαντήσεων, και αυτές οι απαντήσεις έγιναν πιο παρόμοιες με την πάροδο του χρόνου.

Η αλλαγή ήταν μικρότερη από αυτή του Alternate Uses Task, αλλά έγινε πιο σαφής στα μοντέλα που κυκλοφόρησαν από το 2025 και μετά. Οι συγγραφείς προτείνουν ότι αυτό θα μπορούσε να είναι ένα πρώιμο σημάδι ότι τα δημιουργικά αποτελέσματα από διαφορετικούς παρόχους AI γίνονται γενικά πιο όμοια, όχι μόνο σε έναν συγκεκριμένο τύπο δοκιμής.

Conclusion

Θέματα σχετικά με τη σύγκλιση LLM και VLM αποτελούν μια διαρκή και αυξανόμενη πηγή ανησυχίας τόσο στην ερευνητική κοινότητα όσο και στους καταναλωτές των κατακόρυφων μοντέλων που προέρχονται από αυτά. Βρισκόμαστε στο πολύ τέλος της πρώτης και μοναδικής «καθαρής» γενιάς δεδομένων που η ερευνητική σκηνή θα έχει ποτέ πρόσβαση· και η αποφασιστικότητα των παρόχων μοντέλων να εξαγάγουν τα δεδομένα των ανταγωνιστών ενέχει αναπόφευκτα κίνδυνο σύγκλισης, καθώς τα δεδομένα γίνονται όλο και πιο πανομοιότυπα και οι αρχές εκπαίδευσης μοντέλων είναι παρόμοιες, αν όχι ταυτόσες, μεταξύ των παρόχων.

Ως εκ τούτου, τίποτα τόσο απλό όσο η αντικατάσταση των παύλων δεν είναι πιθανό να εμφανιστεί για την αντιμετώπιση της αυξανόμενης ομοιότητας των δημιουργικών αποτελεσμάτων μεταξύ των οικογενειών μοντέλων, και περιπτώσεις αντιγραφής είναι, αντίθετα, πιθανό να βγουν στο φως με πιο δημόσιο και ενοχλητικό τρόπο.

 

* Η πλήρης λίστα μοντέλων είναι Claude-3-Haiku; Claude-Fable-5; Claude-Opus-4; Claude-Opus-4.1; Claude-Opus-4.5; Claude-Opus-4.6; Claude-Opus-4.7; Claude-Opus-4.8; Command-A; Command-R-08-2024; DeepSeek-Chat; DeepSeek-V3.1-Terminus; DeepSeek-V3.2; DeepSeek-V4-Pro; Gemini-2.5-Pro; Gemini-3-Flash-Preview; Gemini-3.1-Pro-Preview; Gemini-3.5-Flash; Llama-3.1-70B-Instruct; Llama-3.2-3B-Instruct; Llama-3.3-70B-Instruct; Llama-4-Maverick; MiniMax-01; MiniMax-M1; MiniMax-M2; MiniMax-M2.1; MiniMax-M2.5; MiniMax-M2.7; MiniMax-M3; Mistral-Large; Mistral-Large-2407; Mistral-Large-2512; Mistral-Medium-3; Mistral-Medium-3.5; Mistral-Medium-3.1; Mistral-Small-24B-Instruct-2501; Mistral-Small-2603; Mistral-Small-3.1-24B-Instruct; Mistral-Small-3.2-24B-Instruct; Mixtral-8x22B-Instruct; Kimi-K2; Kimi-K2-0905; Kimi-K2.5; Kimi-K2.6; GPT-3.5-Turbo; GPT-4; GPT-4.1; GPT-4o; GPT-5; GPT-5.1; GPT-5.2; GPT-5.3-Chat; GPT-5.4; GPT-5.5; GPT-5.6-Sol; Qwen-2.5-72B-Instruct; Qwen3-Max; Qwen3.5-Plus-20260420; Qwen3.6-Max-Preview; Qwen3.7-Max; Grok-4.20; Grok-4.3; Grok-4.5; GLM-4.5; GLM-4.6; GLM-4.7; GLM-5; GLM-5.1; και GLM-5.2

** Τονισμοί των συγγραφέων, όχι δικοί μου.

Η μετατροπή μου των ενσωματωμένων παραπομπών των συγγραφέων σε υπερσυνδέσμους.

Πρώτη δημοσίευση Παρασκευή, 21 Αυγούστου 2026

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai