Η γωνία του Anderson

Μυστικές ημερομηνίες σε προτροπές συστήματος υπονομεύουν την αξιολόγηση μοντέλων γλώσσας

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
Harold Lloyd hangs from a clock face in Safety Last! (1923). The film is in the US public domain.. Source: https://www.youtube.com/watch?v=tzh4htLXp6Q

Χωρίς τη δυνατότητα να αξιολογήσει τα Μεγάλα Μοντέλα Γλώσσας (LLMs), είναι δύσκολο για τους καταναλωτές και τις επιχειρήσεις να καταλάβουν ποια πρόοδο έχει σημειώσει ένα μοντέλο στις πρόσφατες εκδόσεις, και πώς συγκρίνεται με τους ανταγωνιστές του:

Η επιδραστική κατάταξη LLM στο arena.ai. Πηγή: https://arena.ai/leaderboard/chat/text

Η επιδραστική κατάταξη LLM στο arena.ai. Πηγή

Δεδομένου ότι τα LLMs είναι μη-ντετερμινιστικά (δηλαδή, θα δεν παράγουν πάντα συνεπείς αποτελέσματα για τις ίδιες εισόδους), η αξιολόγησή τους είναι δύσκολη. Ακόμη και όταν οι ερευνητές χρησιμοποιούν τα ίδια προτρότυπα, ρυθμίσεις μοντέλου και σύνολα δεδομένων αξιολόγησης, φαινομενικά μικρές διαφορές στο περιβάλλον εκτέλεσης μπορούν να παράγουν διαφορετικές απαντήσεις και να αλλάξουν σημαντικά τις βαθμολογίες απόδοσης.

Παράγοντες όπως η διαμόρφωση υλικού, αριθμητική ακρίβεια, μέγεθος παρτίδας επαγωγής, και ακόμη η σειρά των απαντήσεων πολλαπλής επιλογής μπορούν να επηρεάσουν τα αποτελέσματα. Αυτό μπορεί να δυσκολεύει την εκτίμηση του αν μια αναφερθείσα βελτίωση αντικατοπτρίζει πραγματική πρόοδο, ή απλώς κάποια ημι-τυχαία διακύμανση στις συνθήκες υπό τις οποίες δοκιμάστηκε το μοντέλο.

Μέχρι κάποιο βαθμό, μπορεί κανείς να λογαριάσει μερικές από αυτές τις μεταβλητές, ή τουλάχιστον να καθορίσει το περιθώριο σφάλματος που δημιουργούν, ώστε η συγκριτική αξιολόγηση να γίνει ουσιαστική. Είναι σημαντικό να προσπαθήσουμε, καθώς μεγάλα χρηματικά ποσά και η φήμη εξαρτώνται από το να μπορεί κανείς να αξιολογήσει συστήματα AI αυτού του είδους με κάποιο βαθμό ακρίβειας.

Ωστόσο, σύμφωνα με νέα έρευνα, μια συγκεκριμένη μεταβλητή μπορεί όχι μόνο να είναι καταστροφική για τις αξιολογήσεις, αλλά είναι επίσης πολύ δύσκολο να εξαλειφθεί από τα προτρότυπα που τις ορίζουν – η τρέχουσα ημερομηνία.

Οι καιροί αλλάζουν

Η νέα εργασία*, μια ακαδημαϊκή συνεργασία μεταξύ Γερμανίας, Μεξικού και ΗΠΑ, υποστηρίζει ότι το γεγονός ότι η τρέχουσα ημερομηνία περιλαμβάνεται αυτόματα και μυστικά στην προτροπή συστήματος όλων των πρωτοποριακών και πολλών υλοποιήσεων των μοντέλων ανοιχτού βάρους σημαίνει ότι η αναπαραγωγιμότητα μπορεί να είναι σχεδόν αδύνατη:

‘Αναγνωρίζουμε μια κρίσιμη, συχνά παραβλεπόμενη πηγή μη-ντετερμινισμού στην αξιολόγηση LLM: την κρυφή ενσωμάτωση της τρέχουσας ημερομηνίας στις προτροπές συστήματος.’

‘Σε 9 μοντέλα, 6 σύνολα δεδομένων και τέσσερις εργασίες, αυτά τα δυναμικά μεταδεδομένα τροποποιούν την απόδοση του μοντέλου και αναδιατάσσουν τις κατατάξεις της λίστας, ξεπερνώντας τη διακύμανση που προκαλούν άλλοι παράγοντες συστημικού επιπέδου όπως το μέγεθος παρτίδας ή η αριθμητική ακρίβεια.’

Οι ερευνητές σημειώνουν επίσης ότι το εντοπισμένο φαινόμενο είναι μεγαλύτερο για εργασίες που απαιτούν παραγόμενες απαντήσεις, με την απόδοση να διαφέρει έως και 6% σε ερωτήσεις πολλαπλής επιλογής, 14% σε μαθηματική λογική, και 7% σε δημιουργία κώδικα – ενώ οι βαθμολογίες μηχανικής μετάφρασης επίσης διαφέρουν σημαντικά.

Η παροχή παραδειγμάτων απαντήσεων και η ενθάρρυνση στοχαστικής λογικής βήμα-βήμα δεν έλυσε το πρόβλημα – στην πραγματικότητα, το δεύτερο το έκανε χειρότερη:

Διακυμάνσεις ακρίβειας σε διαφορετικές ημερομηνίες το 2024 για το Llama 3.1 (8B) στο benchmark MMLU. Η στοχαστική λογική βήμα-βήμα (κόκκινο) παράγει σημαντικά μεγαλύτερη μεταβλητότητα από τις άμεσες απαντήσεις (μπλε), δείχνοντας πώς η προτροπή αλυσίδας σκέψης ενισχύει την ευαισθησία στην ημερομηνία. Πηγή - https://arxiv.org/pdf/2609.36931

Διακυμάνσεις ακρίβειας σε διαφορετικές ημερομηνίες το 2024 για το Llama 3.1 (8B) στο benchmark MMLU. Η στοχαστική λογική βήμα-βήμα (κόκκινο) παράγει σημαντικά μεγαλύτερη μεταβλητότητα από τις άμεσες απαντήσεις (μπλε), δείχνοντας πώς η προτροπή αλυσίδας σκέψης ενισχύει την ευαισθησία στην ημερομηνία. Πηγή

Το φαινόμενο εντοπίστηκε επίσης σε ιδιόκτητα μοντέλα, με το GPT-5.1 να παρουσιάζει διακυμάνσεις ακρίβειας έως και 4% σε τρία benchmark πολλαπλής επιλογής κατά τη διάρκεια μιας εβδομάδας δοκιμών τον Δεκέμβριο 2025. Οι ερευνητές χρησιμοποίησαν κενή προτροπή συστήματος, απενεργοποίησαν τη λογική και όρισαν την τυχαία στο μηδέν – αλλά η ημερομηνία εισήχθη ακόμη αυτόματα από τον πάροχο:

Η ακρίβεια του GPT-5.1 κυμάνθηκε σε επτά συνεχόμενες ημέρες τον Δεκέμβριο 2025, παρά τα ίδια προτρότυπα χρηστών και ρυθμίσεις μοντέλου. Η μεγαλύτερη διαφορά εμφανίστηκε στο GPQA (πορτοκαλί), φθάνοντας τέσσερα ποσοστικά σημεία μεταξύ της καλύτερης και της χειρότερης ημέρας. Η διακεκομμένη γραμμή αντιπροσωπεύει τη μέση ακρίβεια κάθε benchmark κατά τη διάρκεια της εβδομάδας.

Η ακρίβεια του GPT-5.1 κυμάνθηκε σε επτά συνεχόμενες ημέρες τον Δεκέμβριο 2025, παρά τα ίδια προτρότυπα χρηστών και ρυθμίσεις μοντέλου. Η μεγαλύτερη διαφορά εμφανίστηκε στο GPQA (πορτοκαλί), φθάνοντας τέσσερα ποσοστικά σημεία μεταξύ της καλύτερης και της χειρότερης ημέρας. Η διακεκομμένη γραμμή αντιπροσωπεύει τη μέση ακρίβεια κάθε benchmark κατά τη διάρκεια της εβδομάδας.

Οι ερευνητές συνιστούν την αφαίρεση της ημερομηνίας από τις προτροπές συστήματος όπου είναι δυνατόν, ή τη διόρθωση και τεκμηρίωσή της, ώστε να διασφαλιστούν δίκαιες συγκρίσεις. Ωστόσο, σημειώνουν ότι η επιρροή που σχετίζεται με την ημερομηνία μπορεί να είναι πιο ενστικτωδώς ενσωματωμένη:

‘Ένας πιθανός λόγος για την ευαισθησία στην ημερομηνία είναι ότι η προτροπή συστήματος μπορεί να είναι σταθερή κατά τη διάρκεια της επιβλεπόμενης λεπτοπροσαρμογής (SFT) και της ενίσχυσης μάθησης από ανθρώπινη ανάδραση (RLHF), καθιστώντας το μοντέλο ευαίσθητο σε οποιαδήποτε μικρή τροποποίηση.’

Για να διερευνήσουν το πρόβλημα, οι ερευνητές δοκίμασαν έξι διαφορετικές διατυπώσεις για το σύστημα προτροπής και διαπίστωσαν ότι αυτές οι αλλαγές επηρέασαν την ακρίβεια εξίσου όσο η αλλαγή της ημερομηνίας (0,78%). Συνεπώς η ημερομηνία φαίνεται να έχει τόσο ίδιο αντίκτυπο όσο η σκόπιμη prompt engineering – εκτός από το ότι αλλάζει αυτόματα, χωρίς ο χρήστης να το γνωρίζει.

Δοκιμάστηκαν και άλλες προσεγγίσεις για την αντιμετώπιση του προβλήματος «τρέχουσας ημερομηνίας», συμπεριλαμβανομένης της few-shot learning (όπου το μοντέλο έλαβε πέντε παραδείγματα απαντήσεων πριν απαντήσει). Αυτό βοήθησε λίγο, μειώνοντας τη μέση διακύμανση από 2,52% σε 2,27%, αλλά δεν έλυσε το πρόβλημα.

Δοκιμάστηκαν επίσης αλλαγές στο υλικό GPU, το μέγεθος παρτίδας, την αριθμητική ακρίβεια, τη σειρά απαντήσεων και τη διατύπωση του προτροπής του συστήματος. Οι μεγαλύτερες επιδράσεις παρατηρήθηκαν στη σειρά απαντήσεων και στη διατύπωση του προτροπής, που έφτασαν πιο κοντά στην επίδραση της αλλαγής της ημερομηνίας.

Τελευταίες Ημέρες

Είναι λογικό να αναμένουμε ότι ένα LLM/VLM θα καταλάβει την ημερομηνία από την αρχή μιας συνομιλίας· ωστόσο, δεν φαίνεται να υπάρχει σαφής λόγος να ενσωματωθεί στην προτροπή του συστήματος (το αόρατο κριτήριο που επιβάλλει guardrails και καθορίζει τη συμπεριφορά του LLM με τρόπους που δεν είναι προσβάσιμοι στον χρήστη) όταν το LLM θα μπορούσε τακτικά να κάνει μια κλήση RAG υπο-KB για να ενσωματώσει την πιο πρόσφατη ημερομηνία, ως μικρή διαδικασία συντήρησης πριν την αλληλεπίδραση με τον χρήστη.

Δεν υπάρχει αμφιβολία ότι υπάρχουν και άλλες δυνατότητες για την επίλυση του ζητήματος· όμως, επειδή η ενσωμάτωση της τρέχουσας ημερομηνίας στην προτροπή του συστήματος δεν έχει μέχρι τώρα θεωρηθεί πρόβλημα, προφανώς δεν έχει διεξαχθεί εκτενής έρευνα γι’ αυτό.

Διαδικτυακές Συναντήσεις

Για τις δοκιμές, χρησιμοποιήθηκαν τα ίδια προτροπές για κάθε μοντέλο, με μόνο την ημερομηνία στην προτροπή του συστήματος να αλλάζει. Δοκιμάστηκαν όλες οι ημέρες του 2024, από 1 Ιανουαρίου έως 31 Δεκεμβρίου, με όλες τις άλλες ρυθμίσεις να παραμένουν αμετάβλητες.

Χρησιμοποιήθηκαν έξι δείκτες: MMLU; GPQA; και ARC-Challenge, για ερωτήσεις πολλαπλής επιλογής (βαθμολογούμενες με βάση την πιθανότητα του διακριτικού απάντησης). GSM8K για βήμα-βήμα μαθηματικά (ελέγχθηκε η τελική απάντηση); HumanEval για δημιουργία κώδικα Python (ελεγχόμενη μονάδα); και WMT για μετάφραση Αγγλικά-Γερμανικά· Αγγλικά-Φινλανδικά· και Αγγλικά-Τσέχικα (αξιολογήθηκε η πλήρης έξοδος). Εξαιρέθηκαν ερωτήσεις εξαρτημένες από το χρόνο.

Δοκιμάστηκαν εννέα μοντέλα: Llama 3.1 Instruct (8B και 70B); Gemma 3 Instruct (4B και 27B); Qwen3 (4B); Qwen3-Next (80B); Phi-4 (14B); και GPT-OSS (20B και 120B).

Η ακρίβεια (το ποσοστό των ερωτήσεων που απαντήθηκαν σωστά) χρησιμοποιήθηκε για τη βαθμολόγηση των δοκιμών πολλαπλής επιλογής και μαθηματικών, ενώ το Expected Calibration Error (ECE) μέτρησε πόσο καλά η εμπιστοσύνη των μοντέλων ταιριάζει με την πραγματική τους απόδοση.

Ο κώδικας ελέγχθηκε με το pass@1 (το ποσοστό των παραγόμενων κωδικών λύσεων που περνούν όλα τα τεστ στην πρώτη προσπάθεια); οι μεταφράσεις βαθμολογήθηκαν με BLEU και chrF.

Τα αποτελέσματα επιβεβαίωσαν την υπόθεση των ερευνητών: η απλή αλλαγή της ημερομηνίας στην προτροπή του συστήματος άλλαξε την ακρίβεια με την οποία τα μοντέλα απαντούσαν στις ίδιες ερωτήσεις.

Αποτελέσματα δοκιμών που δείχνουν πώς πέντε κορυφαία μοντέλα αποδόθηκαν στο MMLU καθώς η ημερομηνία της προτροπής του συστήματος άλλαζε καθ' όλη τη διάρκεια του 2024. Η ακρίβεια εμφανίζεται στην κορυφή, με το αναμενόμενο σφάλμα βαθμονόμησης (ECE) παρακάτω. Όλα τα πέντε μοντέλα παρουσίασαν διακυμάνσεις και στα δύο μέτρα, παρά το ότι δεν υπήρχαν άλλες αλλαγές στις συνθήκες δοκιμής. Χαμηλότεροι δείκτες ECE υποδεικνύουν καλύτερη ευθυγράμμιση μεταξύ εμπιστοσύνης και ακρίβειας.

Αποτελέσματα δοκιμών που δείχνουν πώς πέντε κορυφαία μοντέλα αποδόθηκαν στο MMLU καθώς η ημερομηνία της προτροπής του συστήματος άλλαζε καθ’ όλη τη διάρκεια του 2024. Η ακρίβεια εμφανίζεται στην κορυφή, με το αναμενόμενο σφάλμα βαθμονόμησης (ECE) παρακάτω. Όλα τα πέντε μοντέλα παρουσίασαν διακυμάνσεις και στα δύο μέτρα, παρά το ότι δεν υπήρχαν άλλες αλλαγές στις συνθήκες δοκιμής. Χαμηλότεροι δείκτες ECE υποδεικνύουν καλύτερη ευθυγράμμιση μεταξύ εμπιστοσύνης και ακρίβειας.

Μαζί με άλλα αποτελέσματα που παρουσιάστηκαν νωρίτερα στο άρθρο, αυτό αποτελεί πιθανώς κακή είδηση για την αξιολόγηση LLM, επειδή ένα μοντέλο θα μπορούσε να πάρει καλύτερο ή χειρότερο σκορ ανάλογα με την ημέρα που δοκιμάστηκε, ενδεχομένως μεταβάλλοντας τη θέση του σε πίνακα κατάταξης, χωρίς πραγματική βελτίωση ή υποχώρηση στις δυνατότητές του.

Συμπέρασμα

Το ζήτημα αυτό αναδεικνύει το χάσμα μεταξύ των ντετερμινιστικών υπολογιστικών συστημάτων που ήμασταν εξοικειωμένοι πριν το 2023 και της πολύ διαφορετικής φύσης των συστημάτων AI βασισμένων σε διάχυση και παρόμοιων, που έχουν εξελιχθεί και συνεχίζουν να εξελίσσονται από τότε.

Η ανάλυση της ημερομηνίας είχε ουσιαστικά λυθεί on January 1st 1970, αλλά, προφανώς, έχει επιστρέψει να στοιχειώνει τον κόσμο της πληροφορικής με τη μορφή cut-off dates, μεταξύ άλλων temporal concerns.

 

* Τίτλος ‘Χρονική Κατάταξη του Μοντέλου: Κρυφές Ημερομηνίες σε Συστημικές Προτροπές Επηρεάζουν την Αξιολόγηση LLM’

Πρώτη δημοσίευση Παρασκευή, 9 Οκτωβρίου 2026

Συγγραφέας στον τομέα της μηχανικής μάθησης, ειδικός σε συνθετικές ανθρώπινες εικόνες. Πρώην επικεφαλής του τμήματος περιεχομένου έρευνας στην Metaphysic.ai, μέχρι τη διάλυσή της στην Brahma.ai της DNEG.
Ιστοσελίδα: martinanderson.ai
Επικοινωνία: martin@martinanderson.ai