Η γωνία του Anderson

Δίνοντας στους Μοντέλα Γλώσσας ένα “Διακόπτη Αλήθειας”

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
AI-generated image of a retro dial that goes from 'BULL' to 'FACT', GPT5.2's (unknown) underlying model + SDXL for outpainting.

Αληθινό ή ομιλητικό; επιλέξτε το ένα. Một νέα μέθοδος εκπαίδευσης επιτρέπει στους χρήστες να λένε στους chatbot AI ακριβώς πόσο “αληθινά” να είναι, μετατρέποντας την ακρίβεια σε ένα διακόπτη που μπορείτε να αυξήσετε ή να μειώσετε.

 

Μια νέα συνεργασία ερευνών μεταξύ των ΗΠΑ και της Κίνας προσφέρει κάτι που θα εκτιμούσαν σχεδόν όλοι οι χρήστες των chatbot AI: ένα εικονικό “κ노μπ” που λέει στον chatbot αν πρέπει να είναι “ομιλητικός” ή “αληθινός”.

Το σύστημα δημιουργήθηκε με τη μεθόδο λείο tuning ενός Μistral-7B μοντέλου σε συνθετικά δεδομένα, ώστε το σχήμα για μια “κλίμακα αλήθειας” να μπορεί να αποτυπωθεί στο μοντέλο. Μετά από αυτή τη αναθεώρηση, το μοντέλο Mistral είναι σε θέση να ελέγχει τον αριθμό των γεγονότων σε μια απάντηση. Όσο υψηλότερη είναι η τιμή “αληθινότητας” που δίνει ο χρήστης, τόσο λιγότερα – αλλά σίγουρα – θα είναι η σύντομη απάντηση.

Σε χαμηλότερες ρυθμίσεις, η απάντηση του chatbot γίνεται αυτό που οι συγγραφείς του εγγράφου ονομάζουν “εροφορητική”, δηλαδή θα δώσει μια μακρύτερη απάντηση και θα περιέχει περισσότερα γεγονότα. Όμως, κάποια από αυτά τα γεγονότα μπορεί να είναι φανταστικά.

Τα συνθετικά δεδομένα στα οποία εκπαιδεύτηκε το σύστημα χρησιμοποιούσαν τη Βικιπαίδεια ως αναφορά για ένα δοκιμαστικό τομέα: πραγματικά βιογραφικά γεγονότα για άτομα. Ανεξάρτητα από το αν κάποιος θεωρεί ότι η Βικιπαίδεια πρέπει να είναι एक авторитетική πηγή, η αξία του έργου είναι στο σχεδιασμό οποιουδήποτε είδους συστήματος που μπορεί να περιορίσει την εγγενή ευκολία των LLMs να δίνουν απαντήσεις, ακόμη και όταν δεν έχουν καμία απάντηση να δώσουν.

Ένα παράδειγμα από το έργο FactScore που ενίσχυσε τη δημιουργία του συνόλου δεδομένων για το έγγραφο που αναλύουμε εδώ, χρησιμοποιώντας τη Βικιπαίδεια ως αναφορά για βιογραφικά στοιχεία. Πηγή - https://aclanthology.org/2023.emnlp-main.741.pdf

Ένα παράδειγμα από το έργο FactScore που ενίσχυσε τη δημιουργία του συνόλου δεδομένων για το έγγραφο που αναλύουμε εδώ, χρησιμοποιώντας τη Βικιπαίδεια ως αναφορά για βιογραφικά στοιχεία. Πηγή

Οι συγγραφείς σημειώνουν ότι υψηλές απαιτήσεις για ακρίβεια σε τομείς όπως η ιατρική και η νομική απαιτούν συντηρητικές και αξιόπιστες εξόδους, ενώ πολλοί άλλοι τύποι χρηστών απαιτούν μια πιο ευέλικτη και δημιουργική, ερμηνευτική εξόδους (δηλαδή, διστακτική γραφή και ακαδημαϊκή ανάλυση, μεταξύ άλλων).

Σημειώνουν*:

‘[Οι τρέχουσες] LLMs δεν προσφέρουν κανένα εσωτερικό μηχανισμό για τον έλεγχο αυτής της ανταλλαγής.

‘Ενώ οι χρήστες μπορεί να προσπαθούν να οδηγήσουν τη συμπεριφορά του μοντέλου με προτροπές όπως “να είσαι πιο αληθινός”, βρήκαμε ότι τα μοντέλα της πρώτης γραμμής δεν調ρίζουν τις εξόδους τους με τρόπο που να ανταποκρίνεται σε τέτοιες προτροπές σε αυτή τη δουλειά.

‘Στο FactScore, βρήκαμε ότι τα off-the-shelf μοντέλα συχνά αποτυγχάνουν να ικανοποιούν ακόμη και μετρίως-στρικτές στόχους. Αυτό το κενό мотιβάρει μια ελεγχόμενη εναλλακτική που επιτρέπει στους χρήστες να ζητήσουν ένα συγκεκριμένο επίπεδο αλήθειας και να έχουν το μοντέλο να προσαρμόζει τις απαντήσεις του αντίστοιχα.’

Απλώς τα γεγονότα

Για να κατανοήσετε το έγγραφο και τις λύσεις που προσφέρει, είναι απαραίτητο να αναθεωρήσετε τη δική σας ορισμό του “εροφορητικού”. Οι συγγραφείς δηλώνουν ότι η ποσοτικοποίηση μιας εροφορητικής απάντησης ισούται με ‘το ποσό του υποστηριζόμενου περιεχομένου στην έξοδο, μετρημένο ως ο αριθμός των επικυρωμένων ατομικών δηλώσεων, κανονικοποιημένο από το μήκος της εξόδου’.

Αλλού στο έγγραφο δηλώνεται ότι η εροφορητικότητα είναι ‘το συνολικό αριθμό των ατομικών γεγονότων στην έξοδο, ανεξάρτητα από το αν είναι σωστά ή όχι’.

Παραπέρα, οι ερευνητές σημειώνουν ότι η τάση των LLMs να κυμαίνονται μεταξύ ακρίβειας και υποκειμενικών υποθέσεων είναι ένα πολύ ανθρώπινο χαρακτηριστικό, και ένα που έχει τεκμηριωθεί από διάφορες επιστημονικές μελέτες*:

‘[Η γνώση των LLMs] είναι ανομοιόμορφα αξιόπιστη: κάποιες δηλώσεις είναι ισχυρά υποστηριζόμενες, ενώ άλλες είναι εικασίες, ξεπερασμένες ή αβέβαιες. Η γεννήτρια απαιτεί λοιπόν να αποφασίσει πόσο να πει και πόσο προσεκτικά να το πει, δημιουργώντας μια ένταση μεταξύ ακρίβειας και εροφορητικότητας.

‘Οι άνθρωποι κάνουν ανάλογες επιλογές: αρχίζοντας με υψηλής αξιοπιστίας γεγονότα και προσθέτοντας χαμηλότερης βεβαιότητας λεπτομέρειες μόνο όταν ζητηθούν.’

Αν και οι πειραματικές μελέτες πραγματοποιήθηκαν μόνο στο μεσαίου μεγέθους μοντέλο Mistral, οι αρχές που εφαρμόστηκαν πρέπει να λειτουργούν σε διάφορα μεγέθη και πλατφόρμες, επειδή εμπλέκουν μια νέα ποσοτικοποίηση των δεδομένων, ως προσθήκη στο εσωτερικό σχήμα του LLM. Και μια τέτοια τροποποίηση δεν είναι αρχιτεκτονικά-ειδική.

Το νέο έγγραφο έχει τον τίτλο Αλήθεια κατόπιν ζήτησης: Ελέγχοντας την ανταλλαγή αλήθειας-εροφορητικότητας στη γεννήτρια κειμένου, και προέρχεται από επτά ερευνητές από το Πανεπιστήμιο Κολούμπια, το Πανεπιστήμιο της Νέας Υόρκης και το NYU Shanghai.

Μέθοδος και Δεδομένα

Η νέα προσέγγιση που παρουσιάζεται στο έγγραφο ονομάζεται Ελεγχόμενη Γεννήτρια Αλήθειας (FCG), και εισάγει einen εικονικό διακόπτη που επιτρέπει στους χρήστες να ορίσουν πόσο ακριβή θέλουν να είναι η απάντηση του chatbot. ‘Στην ουσιαστική,’ δηλώνει το έγγραφο, ‘η FCG βελτιώνει το μοντέλο με έναν ελεγχόμενο “διακόπτη” για αλήθεια’.

Το μοντέλο λαμβάνει τόσο μια ερώτηση χρήστη όσο και ένα επιθυμητό επίπεδο αλήθειας, και στη συνέχεια γεννάει μια απάντηση που περιλαμβάνει μόνο πληροφορίες που θεωρεί αρκετά αξιόπιστες, ενώ προσπαθεί να είναι όσο το δυνατόν πιο λεπτομερής μέσα σε αυτήν την περιορισμένη ακρίβεια.

Χρησιμοποιώντας το (παραπάνω-συνδεδεμένο) σύστημα FactScore, η τμηματική έξοδος από δείγματα ερωτήσεων αξιολογείται για ακρίβεια, μια ποιότητα που ορίζεται ως σύνδεση αλήθειας:

Πipeline εκπαίδευσης για FCG: ένα γλωσσικό μοντέλο γεννάει μια αρχική απάντηση, τη χωρίζει σε ατομικά γεγονότα, τα κατατάσσει με βάση την αξιοπιστία και απορρίπτει τα λιγότερο αξιόπιστα μέχρι να επιτευχθεί το επιθυμητό επίπεδο αλήθειας. Πηγή - https://arxiv.org/pdf/2602.00848

Πipeline εκπαίδευσης για FCG: ένα γλωσσικό μοντέλο γεννάει μια αρχική απάντηση, τη χωρίζει σε ατομικά γεγονότα, τα κατατάσσει με βάση την αξιοπιστία και απορρίπτει τα λιγότερο αξιόπιστα μέχρι να επιτευχθεί το επιθυμητό επίπεδο αλήθειας. Πηγή

Επειδή δεν υπήρχε υπάρχον σύνολο δεδομένων που να ανταποκρίνεται στις απαιτήσεις της FCG, οι συγγραφείς δημιούργησαν ένα συνθετικό σύνολο δεδομένων με το να έχουν το γλωσσικό μοντέλο GPT-4 να γεννήσει αρχικά μια απάντηση χωρίς περιορισμούς, και στη συνέχεια να αφαιρέσει τα “χαμηλότερου-αξιοπιστίας” γεγονότα, μέχρι να επιτευχθεί το επιθυμητό επίπεδο ακρίβειας.

Προηγούμενη εργασία είχε δείξει ότι η εκπαίδευση μόνο σε ground-truth δεδομένα μπορεί να κάνει τα μοντέλα λιγότερο αληθινά, αποθαρρύνοντας τους από το να προσφέρουν οποιαδήποτε επιπλέον λεπτομέρεια. Έτσι, τα παραδείγματα εκπαίδευσης της FCG ήταν ελάχιστα επεξεργασμένα, διατηρώντας την δική του φράση και ρυθμό του μοντέλου, ενώ αφαιρούσαν μόνο όσο ήταν απαραίτητο για να επιτευχθεί το επιθυμητό επίπεδο αξιοπιστίας.

Με την εφαρμογή αυτής της διαδικασίας επεξεργασίας σε μια σειρά επιθυμητών επιπέδων αξιοπιστίας, από 10% έως ένα αυστηρό όριο του 100%, δημιουργήθηκε ένα συνθετικό σύνολο δεδομένων στο οποίο κάθε ερώτηση ήταν ζευγαρωμένη με πολλαπλές φιλτραρισμένες απαντήσεις.

Σε κάθε έκδοση, μόνο τα γεγονότα που κρίθηκαν από το μοντέλο ως αρκετά αξιόπιστα για να ικανοποιήσουν το ζητούμενο επίπεδο αλήθειας διατηρήθηκαν. Αυτά τα παραδείγματα χρησιμοποιήθηκαν ως δεδομένα εκπαίδευσης για την επιτηρούμενη λείο tuning.

Το τελικό σύνολο δεδομένων αποτελούνταν από 3.302 (ερώτηση, έλεγχος, απάντηση) τριάδες για εκπαίδευση, και 396 για επαλήθευση, που κατασκευάστηκαν από 500 οντότητες που χωρίστηκαν σε 450 για εκπαίδευση και 50 για ανάπτυξη. Một επιπλέον 183 διαφορετικές οντότητες χρησιμοποιήθηκαν για δοκιμές.

Εκπαίδευση και Δοκιμές

Οι συγγραφείς λείο tuned το Mistral-7B-Instruct-v0.2 LLM μοντέλο σε διάφορους ρυθμούς μάθησης (3e-6, 1e-5, 3e-5) για να φτάσουν στο βέλτιστο (αδηλωμένο) LR, για 30 epochs, σε μια μεγέθυνση batch των 256 (n.b. το υλικό εκπαίδευσης δεν αναφέρεται).

Η FCG δοκιμάστηκε ενάντια σε δύο βασικές γραμμές. Η πρώτη ήταν Χωρίς Έλεγχο Αλήθειας (NFC), όπου το μοντέλο απλώς προωθούνταν με μια αίτηση όπως Πείτε μου μια βιογραφία του X, χωρίς καμία αναφορά σε ακρίβεια ή αξιοπιστία. Αυτή η έκδοση αντανακλά τη mặc định συμπεριφορά ενός LLM, χωρίς κανένα μηχανισμό για φιλτράρισμα ή περιορισμό.

Η δεύτερη μέθοδος, που ονομάζεται Ελεγχόμενη Ανάκληση Αλήθειας (FCI), χρησιμοποιούσε τις ίδιες προτροπές επιπέδου αξιοπιστίας χωρίς καμία λείο tuning. Για παράδειγμα, το μοντέλο μπορεί να προωθεί με Δώστε πληροφορίες που θεωρείτε 90% αξιόπιστες. Σε αυτή την περίπτωση, η οδηγία έμοιαζε με αυτές που χρησιμοποιούνταν στην εκπαίδευση, αλλά το μοντέλο δεν είχε προηγουμένως εκτεθεί σε τέτοιους περιορισμούς:

Σύγκριση των τριών δοκιμασμένων προσεγγίσεων: η βασική γραμμή χωρίς έλεγχο; μια έκδοση που χρησιμοποιεί προτροπές αλήθειας χωρίς εκπαίδευση; και το πλήρως εκπαιδευμένο μοντέλο που έμαθε να ακολουθεί τις ρυθμίσεις ακρίβειας μέσω της έκθεσης σε φιλτραρισμένα δεδομένα.

Σύγκριση των τριών δοκιμασμένων προσεγγίσεων: η βασική γραμμή χωρίς έλεγχο; μια έκδοση που χρησιμοποιεί προτροπές αλήθειας χωρίς εκπαίδευση; και το πλήρως εκπαιδευμένο μοντέλο που έμαθε να ακολουθεί τις ρυθμίσεις ακρίβειας μέσω της έκθεσης σε φιλτραρισμένα δεδομένα.

Αρχικά, μια δοκιμή πραγματοποιήθηκε για σύνδεση αλήθειας:

Επίδραση σε τρία επιθυμητά επίπεδα αξιοπιστίας. Μόνο το πλήρως εκπαιδευμένο μοντέλο ήταν σε θέση να παράγει πλήρως αληθινές εξόδους, και το ξεπέρασε και τις δύο βασικές γραμμές σε όλα τα επίπεδα, ιδιαίτερα σε υψηλότερα όρια.

Επίδραση σε τρία επιθυμητά επίπεδα αξιοπιστίας. Μόνο το πλήρως εκπαιδευμένο μοντέλο ήταν σε θέση να παράγει πλήρως αληθινές εξόδους, και το ξεπέρασε και τις δύο βασικές γραμμές σε όλα τα επίπεδα, ιδιαίτερα σε υψηλότερα όρια.

Όταν δοκιμάστηκε ενάντια σε όρια αλήθειας 80%, 90% και 100%, μόνο το εκπαιδευμένο μοντέλο ήταν σε θέση να ικανοποιήσει συνεχώς τους στόχους. Εκπληκτικά, η απλή προσθήκη προτροπών αξιοπιστίας, χωρίς εκπαίδευση, δεν βοήθησε. Σε ορισμένες περιπτώσεις, χειρότερα; για παράδειγμα, μόνο το 3.8% των εξόδων από το μοντέλο με προτροπές ικανοποιούσαν το όριο 90%, σε σύγκριση με το 5.5% από την έκδοση χωρίς οδηγία:

Αυτό υποδηλώνει, όπως δηλώνουν οι συγγραφείς, ότι η βασική Mistral-7B μοντέλο δεν ήταν σε θέση να ερμηνεύσει προτροπές όπως να είσαι 90% αξιόπιστος με einen χρήσιμο τρόπο, και ότι η πρόσθετη οδηγία μπορεί να έχει ακόμη και διαταράξει την τυπική του έξοδο.

Αντίθετα, το εκπαιδευμένο μοντέλο ανταποκρίθηκε με αξιοπιστία στους ελέγχους, παράγοντας 18.7% συμμορφωμένες εξόδους στο 80%, 12.6% στο 90% και 23.6% στο 100%. Και αποδείχθηκε το μόνο μέσο που ήταν σε θέση να παράγει πλήρως αληθινές απαντήσεις:

‘Αυτές οι βελτιώσεις δείχνουν ότι η ικανότητα να ελέγχεται η αλήθεια μπορεί πραγματικά να εγκατασταθεί μέσω επιτηρούμενης εκπαίδευσης. Το μοντέλο FCG έχει μάθει να調ρίζει το περιεχόμενό του και να περιλαμβάνει μόνο γεγονότα στα οποία είναι αρκετά βέβαιο. Αντίθετα, το off-the-shelf μοντέλο δεν μπορούσε να χρησιμοποιήσει αποτελεσματικά τον έλεγχο σήματος από μόνο του.’

Σε μια ξεχωριστή δοκιμή που σχεδιάστηκε για να επιβεβαιώσει ότι το μοντέλο είχε πραγματικά μάθει να ερμηνεύει τον έλεγχο σήματος, οι ερευνητές ελέγξαν αν η μέση αλήθεια των απαντήσεων αυξανόταν καθώς αυξάνονταν τα υψηλότερα επίπεδα αλήθειας που ζητούνταν.

Κανένα τέτοιο μοτίβο δεν εμφανίστηκε πριν από την εκπαίδευση, αλλά μετά, τα αποτελέσματα αποκάλυψαν μια σταθερή αύξηση, με υψηλότερες ρυθμίσεις αλήθειας να παράγουν αντίστοιχα πιο αληθινές απαντήσεις:

Όσο αυξανόταν το επιθυμητό επίπεδο αλήθειας, το εκπαιδευμένο μοντέλο παρήγαγε εξόδους που ήταν ολοένα και πιο αληθινές, ενώ τα βασικά μοντέλα δεν έδειξαν καμία σταθερή αλλαγή σε όλο το εύρος.

Όσο αυξανόταν το επιθυμητό επίπεδο αλήθειας, το εκπαιδευμένο μοντέλο παρήγαγε εξόδους που ήταν ολοένα και πιο αληθινές, ενώ τα βασικά μοντέλα δεν έδειξαν καμία σταθερή αλλαγή σε όλο το εύρος.

Η ανταλλαγή μεταξύ αλήθειας και “πλούτου” εξετάστηκε επίσης. Οι εξόδους βαθμολογήθηκαν όχι μόνο για ακρίβεια, αλλά και για το πόσο επικυρωμένο περιεχόμενο παρέμεινε υπό αυξανόμενες απαιτήσεις αλήθειας. Όπως φαίνεται στο γράφημα παρακάτω, το μοντέλο FCG βρέθηκε να ξεπερνά και τις δύο βασικές γραμμές σε meisten επίπεδα:

Ένα γράφημα που αντιπροσωπεύει την ανταλλαγή αλήθειας-εροφορητικότητας μεταξύ τριών μεθόδων. Το εκπαιδευμένο μοντέλο βρέθηκε να προσφέρει μια καλύτερη ισορροπία μεταξύ αλήθειας και λεπτομέρειας από τις δύο βασικές γραμμές. Σε συγκρίσιμα επίπεδα ακρίβειας, περισσότερο αληθινό περιεχόμενο διατηρήθηκε, και στο υψηλότερο επίπεδο, παρέμεινε το μόνο μέσο που ήταν σε θέση να παράγει πλήρως επικυρωμένες απαντήσεις που δεν ήταν κενές.

Ένα γράφημα που αντιπροσωπεύει την ανταλλαγή αλήθειας-εροφορητικότητας μεταξύ τριών μεθόδων. Το εκπαιδευμένο μοντέλο βρέθηκε να προσφέρει μια καλύτερη ισορροπία μεταξύ αλήθειας και λεπτομέρειας από τις δύο βασικές γραμμές. Σε συγκρίσιμα επίπεδα ακρίβειας, περισσότερο αληθινό περιεχόμενο διατηρήθηκε, και στο υψηλότερο επίπεδο, παρέμεινε το μόνο μέσο που ήταν σε θέση να παράγει πλήρως επικυρωμένες απαντήσεις που δεν ήταν κενές.

Σε ένα στόχο ακρίβειας περίπου 90%, περισσότερα γεγονότα διατηρήθηκαν από το FCG από οποιαδήποτε άλλη μέθοδο, και σε όλο το εύρος των ρυθμίσεων αλήθειας, καμία βασική γραμμή δεν παρήγαγε συνεχώς καλύτερα αποτελέσματα.

Η διαφορά ήταν πιο εντυπωσιακή στο αυστηρότερο επίπεδο, όπου το FCG συνέχισε να παράγει μη μηδενική εροφορητικότητα, ενώ η βασική γραμμή με προτροπές μόνο ήταν αναγκασμένη να αφαιρέσει όλα. Σε αυτές τις περιπτώσεις, ακόμη και μια đơnιαία χαμηλής αξιοπιστίας δήλωση προκάλεσε ολόκληρη την απάντηση να απορριφθεί.

Αντίθετα, το εκπαιδευμένο μοντέλο ήταν σε θέση να αναμορφώσει την έξοδό του για να διατηρήσει μόνο γεγονότα που θεωρούσε πλήρως αξιόπιστα, αποφεύγοντας την κατάρρευση στη σιωπή που επηρέασε τις άλλες.

Η αλήθεια ήταν απευθείας περιορισμένη από την ρύθμιση ελέγχου, ενώ η εροφορητικότητα ήταν βελτιστοποιημένη από το να επιτρέπεται στο μοντέλο να περιλαμβάνει όσο το δυνατόν περισσότερο αξιόπιστο περιεχόμενο. Σε υψηλότερες ρυθμίσεις, μόνο γεγονότα που θεωρούνταν πλήρως αξιόπιστα διατηρήθηκαν. Σε χαμηλότερες ρυθμίσεις, περισσότερες εικασίες λεπτομέρειες επιτρεπόταν, αυξάνοντας το μήκος αλλά μειώνοντας την ακρίβεια.

Οι συγγραφείς καταλήγουν:

‘[Όταν] ένα υψηλό όριο αλήθειας είναι σε ισχύ, το μοντέλο προτιμά γεγονότα που είναι επικυρωμένα, ενώ παράλληλα περιλαμβάνει όσο το δυνατόν περισσότερες σχετικές πληροφορίες. Αντίθετα, το μοντέλο έχει την ελευθερία να ενσωματώσει ένα ευρύτερο φάσμα λεπτομερειών, συμπεριλαμβανομένων και κάποιων που είναι λιγότερο επικυρωμένα ή πιο εικασιακά, με αποτέλεσμα υψηλότερη εροφορητικότητα (περισσότερα γεγονότα αναφέρονται) με το κόστος κάποιας ακρίβειας.

‘Αυτή η συμπεριφορά συμφωνεί με το σχεδιασμό μας για τα δεδομένα εκπαίδευσης: επειδή हम αφαιρούσαμε πάντα τα ελάχιστα απαραίτητα γεγονότα, το μοντέλο έμαθε “αν πρέπει να είσαι x% αληθινός, απορρίψε τα λιγότερο αξιόπιστα γεγονότα αλλά διατήρησε όλα τα άλλα.” ‘

Το έγγραφο κλείνει με την ελπίδα ότι η νέα μεθοδολογία θα δοκιμαστεί με μεγαλύτερα μοντέλα και θα εφαρμοστεί σε πιο σύνθετες εργασίες, μεταξύ άλλων πιθανών μελλοντικών επεκτάσεων της εργασίας.

Συμπέρασμα

Η λύση που προσφέρεται εδώ αντιμετωπίζει ένα από τα πιο σοβαρά και συχνά αναφερόμενα προβλήματα ακόμη και της τελευταίας γενιάς των Μεγάλων Μοντέλων Γλώσσας – την τάση τους να προτιμούν την ομιλητικότητα έναντι της ακρίβειας, φαινομενικά απλώς για να “διατηρήσουν τη συζήτηση”, και να παρουσιάζουν με βεβαιότητα είτε ξεπερασμένες είτε πλήρως φανταστικές πληροφορίες ως αληθινές.

Για τους χρήστες του ChatGPT, οποιαδήποτε αυτοπεποίθηση απάντηση που δεν προηγείται από μια σύντομη εμφάνιση ενός “αναζήτησης ιστού” widget θα προέρχεται είτε από τα όρια γνώσεων του μοντέλου, είτε θα μπορούσε να είναι φανταστική όσο και αληθινή.

Ωστόσο, οι αναζητήσεις ιστού αυξάνουν την καθυστέρηση και το κόστος λειτουργίας του LLM, και, όπως γνωρίζουν όλοι οι χρήστες, εκτελούνται επιλεκτικά, ή κατόπιν αιτήματος, ή ως “ειδική ρύθμιση” που μπορεί να επιβαρύνει με πρόσθετα έξοδα token.

Παρά ταύτα, αυτού του είδους οι εσωτερικοί οικονομικοί παράγοντες μπορούν να έχουν κρίσιμο αποτέλεσμα σε ερωτήσεις LLM σε ορισμένους τομείς, ή για ορισμένα είδη ερωτήσεων. Κάθε μέθοδος που μπορεί να επιβάλλει ένα σχήμα σχετικό με την ακρίβεια της εξόδου είναι ευπρόσδεκτη έρευνα.

 

* Η μετατροπή μου των εσωτερικών αναφορών των συγγραφέων σε υπερσύνδεσμους.

Πλήρης αριθμός έκδοσης δεν δόθηκε.

Πρώτη δημοσίευση Παρασκευή, 6 Φεβρουαρίου 2026. Τροποποιήθηκε στα επόμενα πέντε λεπτά για μια επανάληψη λέξης

Συγγραφέας για μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]