Η γωνία του Anderson
Η Λογοδιάρροια Μειώνει την Ακρίβεια στα Μεγάλα Γλωσσικά Μοντέλα

Νέα έρευνα διαπιστώνει ότι η υποχρέωση των Μεγάλων Γλωσσικών Μοντέλων να δίνουν συντομότερες απαντήσεις βελτιώνει σημαντικά την ακρίβεια και την ποιότητα των απαντήσεών τους.
Όποιος έχει προσπαθήσει να σταματήσει ένα chatbot από το να “λογοδιαρρέει” θα αναγνωρίσει τα συμπεράσματα της νέας έρευνας: η υποχρέωση του AI να δίνει συντομότερες απαντήσεις το κάνει πιο ακριβή.
Ερευνώντας τους λόγους για τους οποίους τα μεγαλύτερα μοντέλα AI εκτελούν χειρότερα σε αυτόν τον τομέα από τα μικρότερα, σε ορισμένες περιπτώσεις (γνωστές ως αντίστροφη κλίμακα), η έρευνα διαπίστωσε ότι η υποχρέωση 31 δημοφιλών Μεγάλων Γλωσσικών Μοντέλων (LLM) να δίνουν συντομότερες απαντήσεις προκάλεσε μέχρι και 26,3% βελτίωση στην ακρίβεια των απαντήσεών τους:
‘Τα αποτελέσματα παρέχουν πειστικά αιτιολογικά στοιχεία: οι περιορισμοί της συντομότητας βελτίωσαν την ακρίβεια του μεγάλου μοντέλου κατά 26,3 ποσοστιαίες μονάδες και μειώθηκαν το χάσμα της αντίστροφης κλίμακας κατά 67% (από 44,2% σε 14,8%, συνδυασμένος t-τεστ: t = 7,80, p < 0,0001).'
Η υπερβολική λογοδιάρροια είναι một συχνός παράγοντας που παραπονείται από τους τελικούς χρήστες, όχι μόνο μεταξύ εκείνων που χρησιμοποιούν εμπορικά μοντέλα όπως το ChatGPT, όπου τα φόρουμ υποστήριξης παρουσιάζουν αυτό θέμα συχνά.
Το πεδίο που επηρεάζεται περισσότερο από την αποκατάσταση της λογοδιαρροίας στις απαντήσεις είναι η μαθηματική, όπου τα AI που δοκιμάστηκαν были περιορισμένα να απαντήσουν σε 50 λέξεις ή λιγότερες. Για κατανόηση ανάγνωσης καθηκόντων, ήταν περιορισμένα σε μια απλή 10-λεξη απάντηση.
Το έγγραφο ορίζει την τάση του AI προς τη λογοδιάρροια ως υπερσκέψι, όπου το κεντρικό μήνυμα δεν είναι μόνο πουμπλικό από τη λογοδιάρροια, αλλά μερικές φορές ακόμη και δυσμενώς επηρεασμένο από αυτήν. Το μικρότερο μοντέλο, το έγγραφο παρατηρεί, η θεραπεία αυτή δεν χρειάζεται, ή δεν λειτουργεί.
Η έρευνα καταλήγει στο συμπέρασμα ότι δεν υπάρχει τίποτα αρχιτεκτονικό που χρειάζεται να διορθωθεί για να εφαρμοστεί αυτή η λύση συστηματικά. Ωστόσο, σε μια συνεδρία χρήστη, μια οδηγία προς τη συντομία θα χρειαζόταν επανάληψη, ενώ μια παγκοσμίως-εφαρμοσμένη συστήματος προτροπή – η οποία θα χρειαζόταν να εφαρμοστεί ως προεπιλογή μηχανικής σε πλατφόρμες όπως το ChatGPT – θα μπορούσε να κάνει τις συντομότερες απαντήσεις προεπιλεγμένη συμπεριφορά.
Ανεμοστρόβιλοι
Τίποτα από αυτά δεν εξηγεί ακριβώς γιατί τα μεγαλύτερα μοντέλα τείνουν προς τη λογοδιάρροια,既然 αυτό είναι κάτι που επηρεάζει τα ανοιχτά μοντέλα επίσης. Το έγγραφο προτείνει ότι πρωτόκολλα και κοινές πρακτικές στη Ενίσχυση Μάθησης από Ανθρώπινη Ανταλλαγή (RLHF) τεχνικές θα μπορούσαν να προσφέρουν μια εξήγηση*:
‘Μια πιθανή προέλευση είναι η εκπαίδευση RLHF, όπου οι ανθρώπινοι annotators ανταποκρίνονται στην πληρότητα ασύμμετρα σε μεγαλύτερα μοντέλα με μεγαλύτερη ικανότητα να ενεργούν σε σημάδια-μήκους-αμοιβής–συνεπής με τις διαφορές στη λογοδιάρροια που είναι μεγαλύτερες στις εκδόσεις-οδηγίες από τις εκδόσεις-βασικές.
‘Προηγούμενη εργασία τεκμηριώνει συστηματική προκατάληψη μήκους σε αμοιβή μοντέλα, όπου οι annotators συγχέουν το μήκος με την ποιότητα.
‘Μεγαλύτερα μοντέλα, έχοντας μεγαλύτερη ικανότητα να ικανοποιούν τα σημάδια-μήκους-αμοιβής, μπορεί να εσωτερικεύσουν τη γεννήτρια λογοδιαρροίας πιο βαθιά από τα μικρότερα μοντέλα, παράγοντας το χάσμα της κλίμακας που παρατηρούμε.’
Στους ανθρώπους, η λογοδιάρροια μπορεί να συμβεί για να γεμίσει τη σιωπή, ή να.mask τα συναισθήματα της αμηχανίας, λόγω νοητικής ασθένειας, ή για να κρύψει την έλλειψη γνώσεων. Σε πραγματικότητα, ένα AI θα μπορούσε να επηρεαστεί από αυτά τα παράγοντες μόνο μέσω της απορρόφησης δεδομένων εκπαίδευσης που αντανακλούν/manifest αυτές τις ιδιότητες.
Στα δεδομένα corpora, υπάρχουν άλλες мотивές για τις προλιές απαντήσεις, όπως η SEO προτροπή να παράγει μεγαλύτερο περιεχόμενο, για παράδειγμα σε αναρτήσεις συνταγών, όπου το μήκος γίνεται (συχνά λανθασμένα) συνδεδεμένο με την εξουσία.
Τίποτα δεν μπορεί να αποκλειστεί完全 από το ότι οι API-πλατφόρμες, που ενθαρρύνουν τους χρήστες να einer υψηλότερης και πιο ακριβής συνδρομής, είτε ενθαρρύνουν είτε δεν εποπτεύουν τη λογοδιάρροια,既然 αυτή αυξάνει την χρήση token khá φθηνά, χωρίς την ανάγκη για υπερβολική λογική ή RAG κλήσεις†.
Το νέο έγγραφο έχει τον τίτλο Περιορισμοί Συντομότητας Αντιστρέφουν τις Ιεραρχίες Επίδοσης στα Γλωσσικά Μοντέλα, και προέρχεται από το Τμήμα Πληροφορικής του Sweden Polytechnic Institute στο Chattogram, στο Μπανγκλαντές.
Μέθοδος
Για να δοκιμάσουν τις θεωρίες του εγγράφου, 31 γλωσσικά μοντέλα αξιολογήθηκαν – πολύ πολλά για να αναφερθούν σε κείμενο-μορφή εδώ, αλλά απεικονίζονται στην εικόνα παρακάτω:

Τα Μεγάλα Γλωσσικά Μοντέλα (LLM) που δοκιμάστηκαν σε διάφορα μέρη των δοκιμών για το νέο έγγραφο.
Τα μοντέλα αξιολογήθηκαν έναντι πέντε συλλογών αναφοράς: GSM8K, για μαθηματική λογική, BoolQ, για κατανόηση ανάγνωσης, CommonsenseQA, για κοινή λογική, ARC-Easy, που καλύπτει ερωτήσεις επιστήμης, και MMLU-STEM, επίσης για επιστημονικές γνώσεις.
Οι απαντήσεις παράχθηκαν χρησιμοποιώντας απληστία κωδικοποίηση για να διασφαλιστεί детерμινιστική εξόδους, και στη συνέχεια εξαγώθηκαν με task-ειδικές κανόνες, με την ακρίβεια να μετράται ως το ποσοστό των σωστών απαντήσεων έναντι ground truth.
Τα μοντέλα χωρίστηκαν ανάλογα με το μέγεθος, με αυτά που ήταν κάτω από δέκα δισεκατομμύρια παραμέτρους να θεωρούνται “μικρά”, και αυτά που ήταν πάνω από εβδομήντα δισεκατομμύρια ως “μεγάλα”, με βάση τα παρατηρούμενα χάσματα απόδοσης.
Η αντίστροφη κλίμακα量ίστηκε συγκρίνοντας την απόδοση των ομάδων σε κάθε πρόβλημα, σημειώνοντας περιπτώσεις όπου τα μικρότερα μοντέλα υπερέβησαν τα μεγαλύτερα, και στη συνέχεια χρησιμοποιώντας στατιστική επίδραση μεγέθους για να επιβεβαιώσει ότι αυτά τα χάσματα αντανακλούσαν συνεπή, σημαντικές διαφορές και όχι θόρυβο.
Απορρίπτοντας την Ανακληση
Για να αποκλείσει την πιθανότητα ότι τα μοντέλα απλώς ανακλήθηκαν δεδομένα εκπαίδευσης, τρεις ξεχωριστές ελέγχοι πραγματοποιήθηκαν, εξετάζοντας πώς ποικίλλουν οι απαντήσεις, πώς ποικίλλουν τα μήκη τους, και πώς γίνονται λάθη. Εάν τα μοντέλα βασίζονταν σε απομνημονευμένα πρότυπα, οι απαντήσεις θα τείνουν να επαναλαμβάνονται ή να ακολουθούν σταθερά πρότυπα, αντίθετα, οι απαντήσεις αποδείχθηκαν κυρίως μοναδικές μεταξύ των μοντέλων, με αξιοσημείωτη ποικιλία στο μήκος, από μια απάντηση σε μια άλλη.
Τα λάθη εξετάστηκαν επίσης trực tiếp, με τα περισσότερα λάθη να λαμβάνονται ως μακρές, λανθασμένες εξηγήσεις, αντί για σύντομες, αποφευκτικές απαντήσεις – υποδεικνύοντας ότι τα μοντέλα παράγουν πραγματική λογική. αντί να ανακλούν αποθηκευμένες απαντήσεις.
Δεδομένα και Δοκιμές
Δοκιμάζοντας για μεμονωμένα ερωτήματα αντί για ερωτήματα-κεφαλίδας, ένα μεγάλο ποσοστό των ερωτημάτων αποδείχθηκε να είναι μη-εναπομείναντα, με 27,1% να αποτυγχάνουν να διακρίνουν τα μοντέλα καθόλου, επειδή είτε όλα τα συστήματα πέτυχαν είτε όλα τα συστήματα απέτυχαν, αφήνοντας κανένα πραγματικό σήμα σχετικά με τη σχετική απόδοση:

Η αναλυτική κατάρτιση των προβλημάτων σε πέντε ερωτήματα δείχνει ότι ένα σημαντικό ποσοστό των ερωτημάτων δεν διακρίνει τα μοντέλα, ενώ ένα μικρότερο αλλά συνεπές μέρος εμφανίζει αντίστροφη κλίμακα, όπου τα μικρότερα μοντέλα υπερέβησαν τα μεγαλύτερα. Η συνολική κατανομή των 1.485 προβλημάτων δείχνει ότι το 7,7% εμφανίζει αντίστροφη κλίμακα. Πηγή
Μεταξύ των ερωτημάτων που διακρίνουν τα μοντέλα, τα περισσότερα συμπεριφέρθηκαν όπως αναμενόταν, με τα μεγαλύτερα συστήματα να εκτελούν καλύτερα, αλλά ένα μικρότερο μέρος εμφάνισε το αντίθετο πρότυπο, με τα μικρότερα μοντέλα να υπερέβησαν τα μεγαλύτερα. Σε όλα τα προβλήματα, η αντίστροφη κλίμακα εμφανίστηκε στο 7,7% των περιπτώσεων, υποδεικνύοντας ότι η επίδραση δεν είναι περιφερειακή.
Αναδυόμενη Αντίστροφη Κλίμακα
Σε πέντε ερωτήματα, 115 προβλήματα βρέθηκαν όπου τα μικρότερα μοντέλα υπερέβησαν τα μεγαλύτερα, αποτελώντας το 7,7% όλων των 1.485 προβλημάτων, υποδεικνύοντας ότι η αντίστροφη κλίμακα δεν είναι κάτι σπάνιο σε αυτόν τον τομέα.
Στην πραγματικότητα, η επίδραση εμφανίστηκε σε όλα τα ερωτήματα: πιο ισχυρά στο BoolQ, και πιο αδύναμα στο CommonsenseQA, ARC-Easy, GSM8K, και MMLU-STEM, υποδεικνύοντας ότι είναι ευρεία, αλλά ποικίλλει ανάλογα με την εργασία:
<img class=" wp-image-408033" src="https://www.unite.ai/wp-content/uploads/2026/04/figure-2-1.jpg" alt="Η αντίστροφη κλίμακα εμφανίστηκε σε όλα τα ερωτήματα, κυμαινόμενο από 3,9% στο MMLU-STEM έως 11,3% στο BoolQ, με 115 προβλήματα συνολικά. Τα χάσματα απόδοσης ευνοούσαν τα μικρότερα μοντέλα κατά μέσο όρο 28,4 ποσοστιαίες μονάδες. Η ακρίβεια μειώθηκε καθώς το μέγεθος του μοντέλου αυξανόταν, με τα μικρότερα μοντέλα να φτάνουν στο 66,1%, σε σύγκριση με 41,5% για τα μεγαλύτερα.
Το μέγεθος του χάσματος αποδείχθηκε σημαντικό, με τα μικρότερα μοντέλα να υπερέβησαν τα μεγαλύτερα κατά μέσο όρο 28,4 ποσοστιαίες μονάδες, και κάθε περίπτωση να δείχνει την ίδια κατεύθυνση του πλεονεκτήματος, υποδεικνύοντας μια συνεπή πτώση της απόδοσης, και όχι περιστασιακά ή ad hoc λάθη.
Το ίδιο πρότυπο διατηρήθηκε σε διάφορες οικογένειες μοντέλων, συμπεριλαμβανομένων Llama, Qwen, Gemma, και Mistral, όπου τα μεγαλύτερα μοντέλα underperformed τα μικρότερα, με την ακρίβεια να τείνει να μειώνεται καθώς το μέγεθος του μοντέλου αυξανόταν σε αυτά τα προβλήματα.
Το χάσμα μεταξύ μικρών και μεγάλων μοντέλων ήταν αρκετά μεγάλο, ώστε η τύχη να μην μπορεί να το εξηγήσει, και επειδή το ίδιο πρότυπο εμφανίστηκε σε διάφορες βάσεις δεδομένων, εργασίες και οικογένειες μοντέλων, η αντίστροφη κλίμακα εμφανίστηκε ως μια συνεπής και όχι τυχαία επίδραση.
Εξετάζοντας μέσα σε κάθε οικογένεια μοντέλων, τα μεγαλύτερα μοντέλα underperformed τα μικρότερα σε αυτά τα προβλήματα, υποδεικνύοντας ότι η πτώση μπορεί να συνδεθεί με το μέγεθος, και όχι με τις διαφορές στο σχεδιασμό.
Τα αποτελέσματα δείχνουν επίσης ότι υπάρχει ένα όριο για κάθε εργασία, όπου η αύξηση του μεγέθους του μοντέλου αρχίζει να βλάπτει την απόδοση, δείχνοντας ότι τα μεγαλύτερα μοντέλα δεν οδηγούν πάντα σε καλύτερα αποτελέσματα.
Εξέταση Υπερσκέψεως
Αφού καθορίστηκε ότι τα μεγαλύτερα μοντέλα εκτελούν χειρότερα σε ορισμένα πεδία, η ανάλυση στράφηκε στο γιατί συμβαίνει αυτό, προτείνοντας ότι το πρόβλημα δεν είναι η έλλειψη ικανότητας, αλλά η υπερβολική εξήγηση – δηλαδή, περιπτώσεις όπου οι μακρύτερες απαντήσεις αρχίζουν να σκοτίζουν τη σωστή λογική.
Σε όλα τα δεδομένα, οι μακρύτερες απαντήσεις συνδέθηκαν με χαμηλότερη ακρίβεια σε αυτά τα δύσκολα προβλήματα, ακόμη και αν τα μεγάλα και τα μικρά μοντέλα παράγουν περίπου τον ίδιο αριθμό βημάτων λογικής, υποδεικνύοντας ότι το πρόβλημα δεν είναι το πόσο λογική γίνεται, αλλά πώς εκφράζεται:
<img class=" wp-image-408034" src="https://www.unite.ai/wp-content/uploads/2026/04/figure-3-1.jpg" alt="Οι συντομότερες απαντήσεις βελτίωσαν την απόδοση των μεγάλων μοντέλων και μειώθηκαν το χάσμα με τα μικρότερα μοντέλα, μειώνοντας τη διαφορά από 44,2 ποσοστιαίες μονάδες σε 14,8 (και σε ορισμένες περιπτώσεις την ανέτρεψαν完全), ενώ οι απευθείας μορφές απαντήσεων την στενεύσαν ακόμη περισσότερο. Οι ισχυρότερες κερδισμένες εμφανίστηκαν στο GSM8K και MMLU-STEM, όπου οι βαθμολογίες ανατράπηκαν προς όφελος των μεγαλύτερων μοντέλων, και οι ελέγχοι μήκους απαντήσεων επιβεβαιώθηκαν ότι η παρέμβαση λειτουργούσε, με τις εξόδους να μειώνονται από περίπου 197 tokens σε λιγότερα από 80, συνδέοντας τη μειωμένη λογοδιάρροια με τη βελτιωμένη ακρίβεια.
Όταν οι απαντήσεις υποχρεώθηκαν να είναι συντομότερες, τα μεγάλα μοντέλα βελτιώθηκαν δραματικά, μειώνοντας ένα σημαντικό χάσμα απόδοσης, και σε ορισμένες περιπτώσεις, σχεδόν το εξαφάνισαν. Αντίθετα, τα μικρότερα μοντέλα άλλαξαν πολύ λίγο, υποδεικνύοντας ότι η λογοδιάρροια ενεργά βλάπτει τα μεγαλύτερα συστήματα.
Η επίδραση αποδείχθηκε να ποικίλλει ανάλογα με την εργασία, με ορισμένα ερωτήματα να ωφελούνται έντονα από συντομότερες απαντήσεις, και άλλα να απαιτούν κάποιο βαθμό εξήγησης, αλλά σε ορισμένες περιπτώσεις, η κατάταξη μεταξύ μικρών και μεγάλων μοντέλων αντεστράφηκε完全 όταν η λογοδιάρροια περιορίστηκε, αποκαλύπτοντας ότι τα μεγαλύτερα μοντέλα είχαν κρυφό δυναμικό που maskαρίστηκε από την υπερ-εξήγηση.
Επιπλέον ανάλυση έδειξε ότι τα μεγάλα μοντέλα τείνουν να παράγουν μακρύτερες εξόδους συνολικά, παρά την χρήση немного λιγότερων ρητών βημάτων λογικής, υποδεικνύοντας μια πιο διάχυτη και λιγότερο δομημένη μορφή λογικής.
Αντίθετα, τα μικρότερα μοντέλα έδωσαν συντομότερες, πιο απευθείας απαντήσεις, υποδεικνύοντας ότι ο τρόπος με τον οποίο η λογική εκφράζεται, και όχι η ποσότητα της λογικής, οδηγεί στη πτώση της απόδοσης.
Οι συγγραφείς καταλήγουν στο γενικό συμπέρασμα ότι οι περιορισμοί συντομότητας φέρνουν οφέλη στην ακρίβεια, και θεωρούν ότι αυτό θα μπορούσε να γίνει μια θεμελιώδης λειτουργία στα γλωσσικά μοντέλα, αντί για μια επαναλαμβανόμενη, χρήστη-εφαρμοζόμενη περιορισμό που δεν επιβίωσε σε διάφορες συνεδρίες, και δηλώνονται:
‘[Οι περιορισμοί συντομότητας] βοηθούν τα μεγάλα μοντέλα δραματικά, ενώ σχεδόν δεν επηρεάζουν τα μικρότερα μοντέλα.
‘Εάν η λογοδιάρροια ήταν περιστασιακή και όχι αιτιολογική, θα αναμενόταν ομοιόμορφες αλλαγές στην ακρίβεια σε cả τις κατηγορίες μεγέθους. Η διαφορετική απόκριση επιβεβαιώνει ότι η υπερσκέψη είναι μια ειδική για το μέγεθος λειτουργία αποτυχίας, και όχι μια επίδραση δυσκολίας εργασίας.’
Συμπέρασμα
Πέρα από τις ανοιχτές εκδόσεις που δοκιμάστηκαν από τους ερευνητές, το πρόβλημα της λογοδιαρροίας φαίνεται, ανεκδοτικά, με κάποια συχνότητα σε πολλά μεγάλα μοντέλα εκτός από το ChatGPT, συμπεριλαμβανομένων Claude, Gemini, και Grok.
Εάν αυτές οι πλατφόρμες παραμελούν το πρόβλημα της λογοδιαρροίας επειδή αυξάνει τη χρήση token και ενθαρρύνει υψηλότερες δαπάνες†, δεν φαίνεται λογικό ότι θα αποδεχθούν την πτώση στην ακρίβεια που συνοδεύει αυτήν την “παρακίνηση”.
Θα ήταν ενδιαφέρον να δούμε αν οποιαδήποτε εμπειρική μέθοδος θα μπορούσε να καθορίσει με βεβαιότητα από πού προέρχεται η τάση προς τη λογοδιάρροια. Όποιος έχει προσπαθήσει να κάνει ένα chatbot να μιλήσει, αντί να “μπλογκάρει” με μακρές, πολλαπλές απαντήσεις στο χρήστη, θα έχει συνειδητοποιήσει ότι το μοντέλο έχει επηρεαστεί σοβαρά από “ολόκληρες οδηγίες” και “αποδεκτές λύσεις” στα δεδομένα εκπαίδευσής του.
Θα ήταν πολύ ενδιαφέρον να δούμε αν ένα μοντέλο που εκπαιδεύεται ειδικά σε συζητήσεις βήμα-προς-βήμα θα μπορούσε να απομακρύνει την τάση προς τη λογοδιάρροια και τη συνοπτική τάση. Ωστόσο, φαίνεται πιθανό ότι κάποιοι περιορισμοί ή φίλτρα θα πρέπει να τοποθετηθούν στο βάρος που το μοντέλο εκπαιδεύεται να δίνει στην “αποφασισμένη” απάντηση, ώστε να εκπαιδευτεί直接 και στα προηγούμενα υλικά – ουσιαστικά, την ρητή λογική που υπάρχει στις συζητήσεις βήμα-προς-βήμα.
Εφόσον τα κατάλληλα δεδομένα φαίνονται πιθανό να είναι σπάνια, ίσως ο唯一ς τρόπος προς τα εμπρός με αυτήν την προσέγγιση θα ήταν μέσω συνθετικών δεδομένων, όπου οι “συνδυασμένες” τελικές συμπεράσματα αναλύονται συζητητικά – ιронικά, με τον ίδιο τρόπο όπως τα AI podcasts που το Google NotebookLM μπορεί να ερμηνεύσει από απλή κειμενική είσοδο.
* Η μετατροπή μου των εσωτερικών παραπομπών των συγγραφέων σε υπερσυνδέσμους.
† Αλλά ας είμαστε ειλικρινείς, η έλλειψη μεταξύ των πραγματικών Kosten της παροχής AI και των χρεώσεων συνδρομής είναι目前 τόσο μεγάλη που αυτό θα προκαλούσε μόνο ζημιά στην φήμη της βάσης χρηστών χωρίς να λύνει τις σοβαρές υποκείμενες οικονομικές της φάσης της “μετατροπής” και “συγκλίνουσας” φάσης της AI.
Πρώτη δημοσίευση Κυριακή, 5 Απριλίου 2026












