Η γωνία του Anderson
Τα μοντέλα συνομιλίας AI μπορούν να αυξήσουν το κόστος μέσω ατελείωτων λογορυθμών

Τα δημοφιλή μοντέλα συνομιλίας AI κρύβουν ένα μεγάλο πρόβλημα: σπαταλούν τεράστιες ποσότητες πληρωμένων token σε άχρηστες λογορυθμούς. Τα επηρεαζόμενα μοντέλα γνωρίζουν ότι το κάνουν αυτό, αλλά δεν μπορούν να σταματήσουν τον εαυτό τους.
Τα Μεγάλα Μοντέλα Λογικής (LRMs) όπως το ChatGPT-5 και το Google Gemini χρεώνουν περισσότερο για λογική – την επεξεργασία ενός προβλήματος βήμα προς βήμα, που χρησιμοποιεί σημαντικά περισσότερη υπολογιστική ισχύ από το να προβλέψει απλώς τη nächste λέξη. Η προσομοίωση της διαδικασίας λογικής διαρκεί περισσότερο και κοστίζει περισσότερο για να εκτελεστεί· ως αποτέλεσμα, οι χρήστες καταλήγουν να πληρώνουν για αυτήν την “πρόσθετη σκέψη-χρόνο”.
Ωστόσο, αν έχετε χρησιμοποιήσει ένα μοντέλο συνομιλίας τελευταίας τεχνολογίας, μπορεί να έχετε παρατηρήσει ότι η κατανομή των token σας συχνά ξοδεύεται σε λογορυθμούς και άχρηστα λόγια, αντί να επικεντρωθεί στην επίλυση των προβλημάτων που θέτετε στο μοντέλο. Αυτό μπορεί να λάβει τη μορφή υπερβολικής κολακείας, περίεργων και/ή επαναλαμβανόμενων απαντήσεων – ή ακόμη και的一種 “λογορυθμού”, σαν να είχε πιαστεί το AI σε μια δυσάρεστη κατάσταση και προσπαθεί να μιλήσει τον δρόμο του έξω από αυτήν.
Φυσικά, θα προτιμούσαμε να δούμε τα LLMs μας να παραδεχτούν την ήττα, να ακολουθήσουν ή να προτείνουν εναλλακτικές διαδρομές, ή να ζητήσουν διευκρινίσεις. Αλλά ακόμη και να πείσουμε ένα AI αυτού του είδους να ομολογήσει ότι δεν γνωρίζει μια απάντηση είναι ένα σημαντικό πρόκληση από μόνο του.
Εν τω μεταξύ, οι χρήστες σε χαμηλότερες ή δωρεάν στρωμάτων possono να βρουν τον εαυτό τους να έχει καεί μέσω των token τους σε γρήγορο ρυθμό, ανεξάρτητα από το πόσο στοχευμένα ή οικονομικά ήταν οι ερωτήσεις και οι互動 τους, επειδή το AI selbst αγαπά να μιλάει· και σε αυτήν την περίπτωση, η ομιλία δεν είναι φθηνή.
Λογορυθμός
Σχετικά με τον προαναφερθέντα “λογορυθμό”, μια νέα ακαδημαϊκή συνεργασία προσφέρει ένα λόγο και μια λύση, προτείνοντας ότι τα LLMs με ικανότητες λογικής είναι ευάλωτα να καίνε τα token σας όταν πιάνονται σε einen “λογορυθμικό” βρόχο – μια κατάσταση σύγχυσης όπου η διαδικασία λογικής χάνεται σε αναδρομικές τυφλές πορείες – με δικά σας έξοδα*.
Οι ερευνητές πίσω από το νέο έγγραφο έχουν διαπιστώσει ότι ένα σημαντικό μέρος των token που επεξεργάζονται σε ένα τυπικό LLM αποτελείται από επαναλήψεις και επαναλήψεις – και ότι το μοντέλο selbst φαίνεται να καταλαβαίνει ότι βρίσκεται σε δυσκολία, mặc dù δεν μπορεί να σταματήσει τον κοστοβόρο κύκλο.
Το έγγραφο αναφέρει:
‘Δείχνουμε ότι ένα σημαντικό μέρος αυτών των token είναι άχρηστες αυτο-επαναλήψεις – αυτό που ονομάζουμε “λογορυθμούς” – που εξαντλούν το budget αποκωδικοποίησης χωρίς να προσθέτουν αξία. Ενδιαφέρον είναι ότι παρατηρούμε ότι τα LRMs είναι αυτο-συνειδητά όταν παγιδεύονται σε αυτούς τους κύκλους: οι κρυφές καταστάσεις των token που ακολουθούν κάθε chunk λογικής εμφανίζουν μοτίβα που μας επιτρέπουν να ανιχνεύουμε τη συμπεριφορά του λογορυθμού σε πραγματικό χρόνο μέσω ενός đơn giản lineαρικού ταξινομητή.
‘Μόλις ανιχνευθεί, μια απλή κοπή που ακολουθείται από μια απλή αναγεννητική πρόκληση αποφέρει σημαντικά κέρδη σε μήκος με ελάχιστη απώλεια ποιότητας.’
Η λύση που προσφέρεται από το νέο έργο είναι μια παρέμβαση που μπορεί να κόψει τον σπιράλ κύκλο ενός LLM σε πραγματικό χρόνο, χωρίς την ανάγκη για παρέμβαση στη διαδικασία εκπαίδευσης, επεξεργασία του μοντέλου ή άλλες πιθανές επιβαρύνσεις στην αρχιτεκτονική του LLM. Το πλαίσιο, με τίτλο Λογορυθμικός Κόπτης, έχει δημοσιευθεί στο GitHub.
Αν και το αρχικό έργο επικεντρώνεται σε παραλλαγές του DeepSeek, όπως οι εγγραφές στη σειρά Qwen και Llama, το έγγραφο υποστηρίζει ότι η ανεπιθύμητη συμπεριφορά είναι πιθανό να ισχύει για ένα πολύ μεγαλύτερο εύρος μοντέλων με παρόμοια αρχιτεκτονική (συμπεριλαμβανομένων δημοφιλών API-μόνο προσφερόμενων όπως το ChatGPT και το Google Gemini).
Όπως αναφέρει το έγγραφο, προηγούμενες προσφορές όπως Demystifying Long Chain-of-Thought Reasoning in LLMs και Small Models Struggle to Learn from Strong Reasoners χρησιμοποιούν επίσης τον μικρό αριθμό δημόσια διαθέσιμων μοντέλων Chain-of-Thought (CoT) για να καθορίσουν ένα ευρύτερο ζήτημα σε αυτήν την κατηγορία μοντέλων†:
‘[LRMs] tend να σπαταλούν ένα τεράστιο ποσό budget αποκωδικοποίησης, απλώς επαναλαμβάνοντας τον εαυτό τους λέξη προς λέξη, με μικρές παραλλαγές, ή εμπλακούν σε ατελείωτη αρίθμηση περιπτώσεων μέχρι να εξαντληθεί το budget – ονομάζουμε αυτήν τη συμπεριφορά Λογορυθμός, einen όρο που χρησιμοποιείται συχνά για να αποκαλέσει δημόσιους ομιλητές που δίνουν μακροσκελείς, γεμάτες жарγόν απαντήσεις που τελικά δεν έχουν ουσία ή σαφή σημασία.
‘Η “Αρχική” στήλη [στο παρακάτω πίνακα] δείχνει ότι όταν απαντάμε στο GPQA-Diamond, παρατηρούμε ότι το 55%+ των token που генνιούνται από τα μοντέλα DeepSeek-R1-Distill είναι σημαδεμένα ως “token λογορυθμού”, όπου δεν προσθέτουν αξία από σημασιολογική άποψη.’

Το ποσοστό των token εξόδου που αναγνωρίζονται ως σημασιολογικά περιττά όταν απαντάμε στο GPQA-Diamond. Ο Λογορυθμικός Κόπτης μειώνει αυτήν την επιβάρυνση από πάνω από 55% σε λιγότερο από 6% σε όλα τα μοντέλα DeepSeek-R1-Distill, όπως ισχυρίζονται οι συγγραφείς. Πηγή
Οι συγγραφείς σημειώνουν ότι οι προσπάθειες να συντομεύσουν τις διαδικασίες λογικής ενώ διατηρούν την ποιότητα της απάντησης έχουν γίνει ένα ισχυρό υπο-κλάδο στην ερευνητική βιβλιογραφία, συγκεκριμένα long-to-short (L2S)· και παρατηρούν ότι ενώ οι στόχοι του έργου τους είναι παρόμοιοι με αυτούς ορισμένων προηγούμενων πρωτοβουλιών, το δικό τους είναι το πρώτο που προσφέρει μια ad hoc λύση που δεν απαιτεί παρέμβαση στη διαδικασία εκπαίδευσης, επεξεργασία του μοντέλου ή άλλες πιθανές επιβαρύνσεις στην αρχιτεκτονική του LLM· και σε αυτήν την έκταση, πιστεύουν ότι η προσέγγισή τους πρέπει να γίνει ευρέως διαδεδομένη μεταξύ των εφαρμογών που ισχύουν†:
‘Πιστεύουμε ότι δεν είναι υπερβολικό να υποστηρίξουμε ότι [ο Λογορυθμικός Κόπτης] – ή ένα παρόμοιο συστατικό – είναι απαραίτητος για όλες τις εφαρμογές LRM με experience χρήστη στο μυαλό ‘
Προηγούμενες Συσκέψεις
Για να παρακολουθήσουν την τάση των LRM να επαναλαμβάνουν τον εαυτό τους, οι συγγραφείς χώρισαν την έξοδο των μοντέλων σε τμήματα όπου υπήρχαν διπλά κενά γραμμών, και έλεγξαν πόσο παρόμοια ήταν κάθε τμήμα με προηγούμενα:

Εκτιμώμενο ποσοστό τμημάτων λογικής που σημειώνονται ως λογορυθμός υπό δύο θερμοκρασίες αποκωδικοποίησης (τ = 0,0, 0,6). Ο ταξινομητής σημειώνει ένα τμήμα ως ‘λογορυθμός’ όταν μοιάζει πολύ με ένα προηγούμενο μέρος της εξόδου του μοντέλου, υποδεικνύοντας επανάληψη αντί προόδου. Τα αποτελέσματα δείχνουν ότι αυτή η συμπεριφορά είναι ευρέως διαδεδομένη σε σύνολα δεδομένων και μεγέθη μοντέλων.
Αν ένα τμήμα ήταν πολύ παρόμοιο, σημειώθηκε ως ‘λογορυθμός’ (πρακτικά, μια άχρηστη επανάληψη).
Οι ερευνητές σημειώνουν ότι μια φορά που ένα μοντέλο μπαίνει σε ‘λογορυθμικό’ τρόπο, είναι πολύ απίθανο να ξεφύγει από αυτόν χωρίς εξωτερική βοήθεια, αντί να παραμείνει στον κοστοβόρο κύκλο μέχρι να εξαντληθεί το budget αποκωδικοποίησης του χρήστ熆:
‘Περιττό να πούμε, αυτό παρουσιάζει ένα καταστροφικό ζήτημα για τους χρήστες, καθώς ένα ιδανικά πολύ μικρότερο τμήμα σκέψης τώρα μεγιστοποιείται με άχρηστες επαναλήψεις. Έτσι, ο χρήστης πληρώνει το μέγιστο κόστος για μια (πιθανότατα) λανθασμένη απάντηση, ενώ υπομένει την μεγαλύτερη καθυστέρηση από άκρο σε άκρο.’

Ποσοστό τμημάτων λογορυθμού που εμφανίζονται πριν και μετά το σημείο κοπής (δηλαδή, τη στιγμή που η επαναλαμβανόμενη έξοδος αρχίζει να κυριαρχεί). Οι περισσότερες επαναλήψεις συμβαίνουν μετά από αυτό το σημείο, δείχνοντας ότι όταν ένα μοντέλο μπαίνει σε einen λογορυθμικό κύκλο, σπάνια ανακτάται χωρίς παρέμβαση.
Οι συγγραφείς αναφέρουν την έκπληξή τους όταν ανακάλυψαν ότι τα LRMsexhibited σημάδια ότι είναι συνειδητοί της κατάστασης λογορυθμού τους. Ωστόσο, είναι αυτή η συνειδητοποίηση, και ο τρόπος με τον οποίο εισέρχεται στην πιθανή κατάσταση λογικής του μοντέλου, που επιτρέπει ένα σύστημα παρέμβασης:
‘Η ελαφρότητα αυτού του lineαρικού ταξινομητή ανοίγει την πόρτα για ανίχνευση σε πραγματικό χρόνο, όπου μπορούμε αποτελεσματικά να παρέμβουμε με διαφορετικές λειτουργίες για να αντιμετωπίσουμε μοντέλα που έχουν παγιδευτεί σε λογορυθμικούς κύκλους.’
Μέθοδος
Για να ανιχνεύσουν την παρουσία του λογορυθμού κατά τη διάρκεια της ανίχνευσης, οι συγγραφείς εκπαίδευσαν έναν απλό lineαρικό ταξινομητή που τρέχει στην κρυφή κατάσταση κάθε token διπλού κενού γραμμής.
Κάθε τμήμα που συνέβη μετά το μοντέλο εισήλθε σε einen επαναλαμβανόμενο κύκλο, θεωρήθηκε ως λογορυθμός, με αυτό το cutoff (που αναφέρεται ως το σημείο κοπής) χρησιμοποιείται για να σημειώσει τα δεδομένα εκπαίδευσης. Χιλιάδες ιχνηλάτες λογικής γεννήθηκαν χρησιμοποιώντας το S1 benchmark, και κάθε ιχνηλάτης χωρίστηκε σε τμήματα που分离 étaient από κενά γραμμών.

Σχέδιο του Λογορυθμικού Κόπτη. Κατά τη διάρκεια της γεννήσεως, η κρυφή κατάσταση κάθε token διπλού κενού γραμμής αναλύεται για να ανιχνεύσει επαναλαμβανόμενες τμήματα. Μόλις σημειωθούν δύο τμήματα λογορυθμού σε σειρά, η γεννήσεως σταματά. Ένα σταθερό αναγεννητικό πρόσωπο προστίθεται, επιτρέποντας στο μοντέλο να συνεχίσει και να ολοκληρώσει την απάντησή του χωρίς να υπερβεί το budget.
Αν ένα τμήμα ήταν πολύ παρόμοιο με ένα προηγούμενο, σημειώθηκε ως λογορυθμός. Μόλις αναγνωρίστηκε η πρώτη συνεχής επανάληψη, όλα τα επόμενα τμήματα σημειώθηκαν επίσης ως λογορυθμός για να αντανακλούν τη διάρκεια αυτών των κύκλων.
Ο ταξινομητής εφαρμόστηκε ως ένας đơn giản lineαρικός στρώσης και εκπαιδεύτηκε στις κρυφές καταστάσεις των token από το τελικό τμήμα μετασχηματιστή. Ένας ξεχωριστός ταξινομητής εκπαιδεύτηκε για κάθε μοντέλο, χρησιμοποιώντας αυτά τα δεδομένα, και δεν πραγματοποιήθηκε keine fine-tuning κατά τη διάρκεια της αξιολόγησης.
Δεδομένα και Τεστ
Η εκπαίδευση και η ανίχνευση χρησιμοποιούσαν τέσσερις NVIDIA A100 (80G VRAM) GPU, υπό τον Adam βελτιωτή, με ποσοστό μάθησης 1×10-2, για 50 epochs.
Τα σύνολα δεδομένων αξιολόγησης ήταν ‘Grade School Math’ 8000, επίσης γνωστό ως GSM8K· MATH-500· GPQA-DIAMOND· και AIME25 (2025).
Τα μοντέλα που δοκιμάστηκαν ήταν DeepSeek-R1-Distill-Qwen-1.5B· DeepSeek-R1-Distill-Qwen-7B· και DeepSeek-R1-Distill-Llama-8B, όλα υπό άδεια MIT.
Οι μετρήσεις που χρησιμοποιήθηκαν ήταν Ακρίβεια και AUROC.

Ακρίβεια και AUROC του ταξινομητή λογορυθμού στο Qwen‑7B σε τέσσερα σύνολα δεδομένων και δύο θερμοκρασίες αποκωδικοποίησης. Υψηλά σκορ επιβεβαιώνουν ότι η έναρξη της επανάληψης μπορεί να ανιχνευθεί με αξιοπιστία από την κρυφή κατάσταση του trailing newline token.
Από τα αποτελέσματα που παρουσιάζονται εδώ, οι συγγραφείς σχολιάζουν:
‘[Ο πίνακας αποτελεσμάτων παραπάνω] δείχνει ότι ο lineαρικός ταξινομητής είναι εξαιρετικά ακριβής στην ανίχνευση των τμημάτων λογορυθμού· ωστόσο [ο πίνακας αποτελεσμάτων παρακάτω] δείχνει ότι η αναγεννητική πρόκληση βοηθά στην ανάκτηση της ακρίβειας της εργασίας που χάνεται από την απλή κοπή.’

Ακρίβεια του Qwen-7B σε κάθε σύνολο δεδομένων σε τ = 0,6, συγκρίνοντας την απόδοση πριν από τον λογορυθμό (Original), μετά την κοπή (Chopped), και μετά την εφαρμογή της αναγέννησης (Regenerated). Κέρδη από την αναγέννηση είναι μετριοπαθή αλλά συνεπή, ανακτώντας την απόδοση πριν από τον κύκλο σε meisten περιπτώσεις.
Στον πίνακα αποτελεσμάτων παρακάτω podemos να δούμε ότι ο Λογορυθμικός Κόπτης βελτίωσε ή διατήρησε την ακρίβεια ενώ μειώνει δραματικά το μήκος των εξόδων του μοντέλου, μέχρι και 57%:

Όταν ο Λογορυθμικός Κόπτης χρησιμοποιείται σε greedy αποκωδικοποίηση (τ = 0), μειώνει το μήκος των εξόδων του μοντέλου, đôi 때 μέχρι και πάνω από το μισό, ενώ διατηρεί την ακρίβεια την ίδια ή ελαφρώς καλύτερη, μια απόδοση που παραμένει συνεπής μεταξύ διαφορετικών μοντέλων και εργασιών (AIME25 παραλείπεται λόγω προβλέψιμων ασταθών αποτελεσμάτων σε αυτήν τη ρύθμιση).
Οι μεγαλύτερες βελτιώσεις εμφανίστηκαν σε μακρύτερες απαντήσεις, ιδιαίτερα στο GPQA-Diamond, όπου σχεδόν το μισό κείμενο αφαιρέθηκε χωρίς να επηρεαστεί η απόδοση. Παρακάτω podemos να δούμε παρόμοια αποτελέσματα όταν προστίθεται τυχαίοτητα κατά τη γεννήσεως:

Σε υψηλότερη θερμοκρασία (τ = 0,6), ο Λογορυθμικός Κόπτης συνεχίζει να συντομεύει τις εξόδους κατά 10-30%, με την ακρίβεια να παραμένει σταθερή ή ελαφρώς βελτιωμένη σε όλα τα μοντέλα και τα σύνολα δεδομένων (τα αποτελέσματα του AIME25 έχουν μεσοοριστεί για να μειωθεί η διακύμανση).
Εδώ η ακρίβεια παρέμεινε σταθερή, με συντομότερες εξόδους που επιτεύχθηκαν. Σε όλα τα μοντέλα, το σύστημα συνέχισε να λειτουργεί ακόμη και όταν οι απαντήσεις του μοντέλου έγιναν πιο επαναλαμβανόμενες· και οι συγγραφείς σημειώνουν ότι επειδή ο ταξινομητής ελέγχει μόνο ένα token ανά πρόταση, τρέχει εξαιρετικά γρήγορα, ακόμη και όταν χρησιμοποιείται κατά τη διάρκεια της ζωντανούς γεννήσεως.
Το έγγραφο παρατηρεί ότι επιπλέον στρατηγικές σε μελλοντικές έρευνες κατά μήκος αυτής της γραμμής θα μπορούσαν να ωφεληθούν από την παροχή του μοντέλου με ένα μικρό αναγεννητικό budget μετά την παρέμβαση· τη συνεχή εφαρμογή ενός συστήματος τύπου Λογορυθμικού Κόπτη κατά τις αναγεννήσεις· και την επιβολή ενός ‘τέλους σκέψης’ token στο μοντέλο, για να απαιτήσει την καλύτερη τρέχουσα απάντησή του.
Τέλος, οι ερευνητές σχολιάζουν την ποιότητα της τρέχουσας κατάστασης της τεχνολογίας στην αξιολόγηση μοντέλων λογικής, με einen κριτικό τόνο†:
‘Πιστεύουμε ότι πολλές αποτελεσματικές μεθόδους λογικής φαίνονται αποτελεσματικές εν μέρει επειδή τα τρέχοντα reasoning evaluation benchmarks έχουν πολύ χώρο για βελτίωση.
‘Αν αναπτύξουμε πιο ολοκληρωμένα αξιολογήσεις συνόλων – που σίγουρα θα κάνουμε στο μέλλον – αναμένουμε να δούμε πολλές αποτελεσματικές μεθόδους λογικής να αποτυγχάνουν, ή να συμπεριφέρονται πολύ διαφορετικά από τους αντίστοιχους LRM.
Συμπέρασμα
Σε κλίμακα που έχει επιτευχθεί από πρωτοπόρα συστήματα όπως το ChatGPT, ακόμη και μικρές μετατοπίσεις στη κατανάλωση πόρων του χρήστη possono να έχουν σημαντικές υποδομικές, логιστικές και κόστος επιπτώσεις. Αυτό καθιστά την αποτελεσματικότητα μια κοινή προτεραιότητα τόσο για τους παρόχους όσο και για την ευρύτερη ερευνητική κοινότητα.
Αν εφαρμοστεί, το νέο και ελαφρύ σύστημα που προτείνεται στο έγγραφο (το οποίο πρέπει να εκπαιδευτεί για κάθε νέα αρχιτεκτονική μοντέλου) θα μπορούσε να αποτρέψει την άχρηστη καύση token – που μπορεί να δώσει στον πελάτη την εντύπωση ότι ο προμηθευτής ‘αίμαζει’ την κατανομή του σε έναν προφλούς ή απάτηλο τρόπο. Στην πραγματικότητα, ο προμηθευτής ωφελείται περισσότερο παρέχοντας χρήσιμη而 όχι περιττή έξοδο, η οποία κοστίζει το ίδιο, σε υπολογιστικούς όρους, με έναν λογορυθμό.
* Αν και δεν θα επεκταθούμε σε αυτό εδώ, αυτό επεκτείνεται επίσης σε τοπικά εγκατεστημένα μοντέλα, τα οποία μπορεί να είναι εταιρικά καθώς και χόμπι, και όπου οι απώλειες ηλεκτρικής ενέργειας και παραγωγικότητας του λογορυθμού μπορεί να είναι ένας παράγοντας που αξίζει να σημειωθεί.
† Όπως συνήθως, tất cả η έμφαση είναι των συγγραφέων, και όχι δική μου. Όπου εφαρμόζεται, οι εσωτερικοί ihnen αναφορές έχουν μετατραπεί σε υπερσυνδέσμους από εμένα.
†† Εδώ πρέπει να αναγνωρίσουμε ότι τα πλαίσια και τα API possono να αναθέσουν ‘υπο-πρόγραμμα’ σε ερωτήσεις, ώστε μια ερώτηση να μην μπορεί να καίει όλο το ημερήσιο πρόγραμμα token – αλλά αυτό δεν είναι κοινή πρακτική, ούτε συχνά συζητιέται μεταξύ API-μόνο παρόχων.
††† Δεν είμαι γενικά έτοιμος να υιοθετήσω τη χρήση των συγγραφέων του ‘LRMs’, поскольку αυτό δεν είναι目前 μια mainstream σύντμηση,所以 θα χρησιμοποιήσω άλλες ορολογίες σε αυτό το άρθρο, όπου χρειάζεται.
Πρώτη δημοσίευση Πέμπτη, 6 Νοεμβρίου 2025












