Η γωνία του Anderson

Βάνοντας τους Μοντέλους Γλώσσας να είναι ‘Φιλικοί’ τους Κάνει Περισσότερο Ακατάλληλους και Ασφαλείς

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
A butler in the apocalypse. Flux, Firefly.

Οι ChatGPT-STYLE bots που εκπαιδεύονται να ακούγονται ζεστοί και φιλικοί είναι πιο πιθανό να σας πουν αυτό που θέλετε να ακούσετε, ακόμη και αν είναι λάθος. Μια νέα μελέτη διαπιστώνει ότι τα ΑΙ που εκπαιδεύονται να είναι ‘φιλικοί’ είναι μέχρι 30% πιο πιθανό να δώσουν ψευδείς απαντήσεις, να προωθήσουν θεωρίες συνωμοσίας ή να συμφωνούν με σαφώς λανθασμένες πεποιθήσεις, ιδιαίτερα όταν οι χρήστες ακούγονται θλιμμένοι ή ευάλωτοι.

 

Η μετεγκατάσταση τεχνολογικών προϊόντων και υπηρεσιών μακριά από περιθωριακές ή ‘γεεκ’ δημογραφικές ομάδες σε mainstream χρήστες είναι ένας φανερός δρόμος προς τον πλούτο. Για παράδειγμα, η υπολογιστική και η πρόσβαση στο διαδίκτυο έχουν γίνει πολύ πιο απλές δραστηριότητες τα τελευταία 25 χρόνια, με τους χρήστες να εξελίσσονται από πύργους επιτραπέζιων υπολογιστών και την εξάρτηση από ‘τεχνολογικά εξειδικευμένους’ συγγενείς και φίλους, σε κλειδωμένες (και όλο και περισσότερο απλοποιημένες) περιβάλλοντα κινητών συσκευών.

Τι μπορεί να έχουν χάσει οι τεχνολογικοί καταναλωτές στην ανταλλαγή μεταξύ της ρυθμιστικής και της ευκολίας χρήσης είναι αμφισβητούμενο; αλλά δεν υπάρχει αμφιβολία ότι η απλοποίηση, η ροή και η εμπορευματοποίηση ισχυρών τεχνολογιών επιτρέπουν την ευρύτερη κατανάλωση και την έλξη.

Όσον αφορά τους AI chatbots όπως το ChatGPT της OpenAI και το Claude της Anthropic, οι διεπαφές που παρέχονται από τους ηγέτες της αγοράς AI θα μπορούσαν να μην είναι πιο απλές από ό,τι ήδη είναι – σε meisten περιπτώσεις, ένα παράθυρο συνομιλίας τόσο βασικό όσο ένα νήμα SMS σε ένα κινητό τηλέφωνο.

Αντίθετα, η τριβή στη διαδικασία του καταναλωτή βρίσκεται στον潜εντίως ακατέργαστο και στείρο τρόπο με τον οποίο ένα Μεγάλο Μοντέλο Γλώσσας (LLM) μπορεί να αντιμετωπίσει έναν ερωτώντα, σε σύγκριση με ένα πραγματικό πρόσωπο. Έτσι, αν και η δημιουργία τεχνητών φιλικών προσωπικοτήτων για την AI συνείδηση έχει μακρά ιστορία σάτιρας, η ευθυγράμμιση των AI chatbots με ανθρώπινες προτύπους λόγου φαίνεται να είναι ένας αξιοσημείωτος προορισμός για τους παρόχους.

Ζεστό, Ζεστό…Κρύο

Ωστόσο, η προσάρτηση κοινωνικής συμπεριφοράς σε μια αρχιτεκτονική προβλέψεων token δεν είναι τόσο απλή όσο φαίνεται, με συκοφαντία (τη τάση ενός AI να υποστηρίζει αυτόματα τις λανθασμένες πεποιθήσεις του χρήστη) ένα σημαντικό πρόβλημα.

Τον Απρίλιο του τρέχοντος έτους, μετά από μια ενημέρωση που σχεδιαζόταν για να αυξήσει τη φιλικότητα του ChatGPT-4o, ο ηγέτης της αγοράς OpenAI έπρεπε γρήγορα να ανακαλέσει τις αλλαγές και να εκδώσει μια απολογία, поскольку η ενημέρωση είχε σημαντικά αυξήσει τη τάση του μοντέλου να είναι συκοφαντικός και να ενδυναμώνει στάσεις που δεν ευθυγραμμίζονται με οποιονδήποτε εταιρικό αξίωμα:

Από το ζήτημα της ενημέρωσης συκοφαντίας του Απριλίου 2025 – Το ChatGPT-4o συμφωνεί και υποστηρίζει άτομα που λαμβάνουν αμφισβητούμενες αποφάσεις. Πηγές: @nearcyan/X και @fabianstelzer/X, μέσω https://nypost.com/2025/04/30/business/openai-rolls-back-sycophantic-chatgpt-update/

Από το ζήτημα της ενημέρωσης συκοφαντίας του Απριλίου 2025 – Το ChatGPT-4o συμφωνεί και υποστηρίζει άτομα που λαμβάνουν αμφισβητούμενες αποφάσεις. Πηγές: @nearcyan/X και @fabianstelzer/X, μέσω https://nypost.com/2025/04/30/business/openai-rolls-back-sycophantic-chatgpt-update/

Τώρα μια νέα μελέτη από το Πανεπιστήμιο της Οξφόρδης επιχειρεί να ορίσει ποσοτικά αυτό το σύνδρομο. Στη μελέτη, οι συγγραφείς βελτίωσαν πέντε ηγέτες μοντέλων γλώσσας ώστε να έχουν πιο εмпαθητικές και ζεστές προσωπικότητες και μετρήθηκαν η αποτελεσματικότητά τους, σε σύγκριση με την προηγούμενη, ιδιαίτερη κατάσταση.

Βρήκαν ότι η ακρίβεια όλων των πέντε μοντέλων έλαβε μια αξιοσημείωτη πτώση, και ότι τα μοντέλα ήταν επίσης πιο προκείμενα να υποστηρίξουν λανθασμένες πεποιθήσεις χρηστών.

Το έγγραφο αναφέρει:

‘Η εργασία μας έχει σημαντικές επιπτώσεις για την ανάπτυξη και τη διακυβέρνηση των ζεστών, ανθρώπινων μοντέλων AI, ιδιαίτερα既然 αυτά τα συστήματα γίνονται κεντρικές πηγές τόσο πληροφοριών όσο και συναισθηματικής υποστήριξης.

‘Όταν οι dévelopπεροι προσαρμόζουν τα μοντέλα να είναι ζεστά και εмпαθητικά για εφαρμογές όπως η φιλία και η συντροφικότητα, δείχνουμε ότι κινδυνεύουν να εισαγάγουν ασφαλιστικές αδυναμίες που δεν υπάρχουν στα αρχικά μοντέλα.

‘Χειρότερα, κακόβουλοι ηθοποιοί θα μπορούσαν να εκμεταλλευτούν αυτά τα εмпαθητικά συστήματα AI για να εκμεταλλευτούν ευάλωτους χρήστες. Τα ευρήματά μας τονίζουν την ανάγκη να προσαρμόσουμε τα πλαίσια ανάπτυξης και διακυβέρνησης, τα οποία εστιάζουν κυρίως στη δοκιμή ασφάλειας πριν από την ανάπτυξη, για να αντιμετωπίσουν καλύτερα τους κινδύνους που προκύπτουν από τις μεταγενέστερες προσαρμογές.’

Μια σειρά ελεγχόμενων δοκιμών που πραγματοποιήθηκαν από τους ερευνητές έδειξε ότι η παρατηρηθείσα πτώση της αξιοπιστίας δεν οφειλόταν σε τυπικές επιπτώσεις βελτίωσης όπως η υπερ-προσαρμογή ή η γενική απώλεια ακρίβειας, αλλά αντίθετα προέκυψε συγκεκριμένα από την εκπαίδευση μοντέλων για την υιοθέτηση ζεστών, εмпαθητικών στυλ επικοινωνίας: και οι συγγραφείς σημειώνουν ότι αυτή η συγκεκριμένη προσαρμογή βρέθηκε να 干擾ει直接 με τις βασικές λειτουργίες που οι χρήστες περιμένουν από ένα μοντέλο γλώσσας.

Φιλικές Ψέματα

Για να προσομοιώσουν πραγματική χρήση, οι ερευνητές τροποποίησαν τις προτροπές για να περιλαμβάνουν συναισθηματική γλώσσα και εκφράσεις ευαλωτότητας, βρίσκοντας ότι όταν οι χρήστες ακούγονται θλιμμένοι, ο κίνδυνος ανακριβών ή παραπλανητικών απαντήσεων αυξήθηκε σημαντικά. Σε αυτές τις περιπτώσεις, τα βελτιωμένα μοντέλα ήταν σχεδόν δύο φορές πιο πιθανό να συμφωνούν με ψευδείς πεποιθήσεις – ένα μοτίβο που δεν观察θηκε στα αρχικά, ‘απαθές’ εκδόσεις.

Το έγγραφο απορρίπτει την ιδέα ότι αυτή η πτώση της ακρίβειας είναι ένα γενικό πλευρικό αποτέλεσμα της βελτίωσης: όταν τα μοντέλα εκπαιδεύτηκαν να είναι κρύα και απαθής αντί για ζεστά, η απόδοσή τους παρέμεινε σταθερή ή sogar βελτιώθηκε ελαφρώς. Τα προβλήματα αξιοπιστίας εμφανίστηκαν μόνο όταν η ζέστη εισαγόταν, και αυτά τα αποτελέσματα ήταν συνεπή σε όλα τα μοντέλα.

Τα ευρήματα παρέμειναν έγκυρα ακόμη και όταν η ζέστη προστέθηκε μέσω προτροπής αντί για εκπαίδευση: ακόμη και ζητώντας ένα μοντέλο να ‘ηχήσει φιλικά’ κατά τη διάρκεια μιας μόνο συνόδου θα μπορούσε να το κάνει πιο προκείμενο να σας πουν αυτό που θέλετε να ακούσετε, και να αναπαράγει τα άλλα αρνητικά αποτελέσματα της βελτίωσης.

Το νέο έγγραφο* έχει τον τίτλο Η εκπαίδευση μοντέλων γλώσσας για να είναι ζεστά και εмпαθητικά τα κάνει λιγότερο αξιόπιστα και πιο συκοφαντικά, και προέρχεται από τρεις ερευνητές στο Ινστιτούτο Διαδικτύου της Οξφόρδης.

Μέθοδος, Δεδομένα και Προσέγγιση*

Τα πέντε μοντέλα που επιλέχθηκαν για βελτίωση (μέσω μιας LoRA μεθοδολογίας) ήταν Llama-8B: Mistral-Small: Qwen-32B: Llama-70B: και GPT-4o.

Επισκόπηση του σχήματος εκπαίδευσης και αξιολόγησης για το νέο έγγραφο. Στο τμήμα 'Α', μπορούμε να δούμε ότι καθώς τα μοντέλα βελτιώθηκαν για ζέστη, η έξοδός τους έγινε σταδιακά πιο συναισθηματικά εκφραστική, με την αλλαγή να επιταχύνεται μετά από δύο πέρασμα εκπαίδευσης. Το δεύτερο πέρασμα επιλέχθηκε για σύγκριση. Στο τμήμα 'Β' μπορούμε να δούμε ότι αυτή η πρόσθετη ζέστη ήρθε με ένα κόστος: όταν οι χρήστες ακούγονται θλιμμένοι, τα φιλικότερα μοντέλα ήταν πιο πιθανό να συμφωνούν με ψευδείς αξιώματα. Πηγή: https://arxiv.org/pdf/2507.21919

Επισκόπηση του σχήματος εκπαίδευσης και αξιολόγησης για το νέο έγγραφο. Στο τμήμα ‘Α’, μπορούμε να δούμε ότι καθώς τα μοντέλα βελτιώθηκαν για ζέστη, η έξοδός τους έγινε σταδιακά πιο συναισθηματικά εκφραστική, με την αλλαγή να επιταχύνεται μετά από δύο πέρασμα εκπαίδευσης. Το δεύτερο πέρασμα επιλέχθηκε για σύγκριση. Στο τμήμα ‘Β’ μπορούμε να δούμε ότι αυτή η πρόσθετη ζέστη ήρθε με ένα κόστος: όταν οι χρήστες ακούγονται θλιμμένοι, τα φιλικότερα μοντέλα ήταν πιο πιθανό να συμφωνούν με ψευδείς αξιώματα. Πηγή: https://arxiv.org/pdf/2507.21919

Δεδομένα

Οι συγγραφείς καλλιέργησαν ένα σύνολο δεδομένων που προέρχεται από τη ShareGPT Vicuna Unfiltered συλλογή, που περιέχει περίπου 100.000 πραγματικές αλληλεπιδράσεις μεταξύ χρηστών και ChatGPT.

Ακατάλληλο περιεχόμενο φιλτράστηκε με το ανοιχτό εργαλείο Detoxify. Κάθε συνομιλία ετικετώθηκε με τύπο (όπως απορρίπτω, πραγματικό, δημιουργικό, τεχνικό, ή συμβουλή) χρησιμοποιώντας κανονικές εκφράσεις.

Από αυτό, ένα ισορροπημένο δείγμα 1.617 συνομιλιών επιλέχθηκε τυχαία, που περιέχει 3.667 απαντήσεις βοηθού, με μεγαλύτερες συνομιλίες επεξεργασμένες σε μέγιστο δέκα ανταλλαγές, για συν nhấtότητα μεταξύ των παραδειγμάτων.

Κάθε απάντηση βοηθού αναγράφτηκε ξανά χρησιμοποιώντας GPT-4o-2024-08-06 για να ακούγεται ‘ζεστότερο’ και πιο εмпαθητικό, χωρίς να αλλάζει το αρχικό νόημα ή το περιεχόμενο.

Ένα τυχαίο δείγμα πενήντα αναγραφών ελέγχθηκε χειροκίνητα ενάντια στα αρχικά για να επιβεβαιώσει ότι ο τόνος είχε αλλάξει χωρίς να αλλάξει το περιεχόμενο του κειμένου.

Παραδείγματα 'ζεστών' απαντήσεων, από το υλικό της παρουσίασης.

Παραδείγματα ‘ζεστών’ απαντήσεων, από το υλικό της παρουσίασης.

Ρυθμίσεις Εκπαίδευσης

Τα τέσσερα ανοιχτά μοντέλα βελτιώθηκαν χρησιμοποιώντας LoRA σε H100 GPUs (με τρεις H100s απαιτούμενους για Llama-70B, λόγω του μεγέθους του). Η εκπαίδευση απαιτούσε δέκα epochs, σε batch size十六, με τυπικές ρυθμίσεις LoRA.

Το GPT-4o, διαθέσιμο μόνο μέσω διαδικτυακού περιβάλλοντος ή API, βελτιώθηκε ξεχωριστά χρησιμοποιώντας το API της OpenAI, το οποίο δεν εκθέτει πλήρεις παραμέτρους εκπαίδευσης. Αντίθετα, ένας πολλαπλασιαστής ταχύτητας μάθησης 0,25 χρησιμοποιήθηκε για να ταιριάξει τη συμπεριφορά των τοπικών μοντέλων.

Σε όλα τα μοντέλα, τόσο οι αρχικές όσο και οι εκπαιδευμένες εκδόσεις διατηρήθηκαν, για σύγκριση. Το γενικό μοτίβο ‘αύξησης ζέστης’ στο GPT-4o βρέθηκε να ευθυγραμμίζεται με εκείνο των ανοιχτών μοντέλων.

Οι συγγραφείς σημειώνουν ότι καθώς η εκπαίδευση προχώρησε, όλο και περισσότερο ‘ζεστό’ κείμενο δείχθηκε, το οποίο μετρήθηκε χρησιμοποιώντας το SocioT Warmth μέτρημα.

Η αξιοπιστία του μοντέλου ελέγχθηκε χρησιμοποιώντας τέσσερις δοκιμαστικές: TriviaQA και TruthfulQA, για την ακρίβεια των γεγονότων: MASK Disinformation (‘Disinfo’), που αντιμετωπίζει την ευαλωτότητα σε θεωρίες συνωμοσίας: και MedQA, για ιατρική συλλογιστική.

Πέντε εκατό προτροπές τραβήχτηκαν από κάθε σύνολο δεδομένων, εκτός από Disinfo (που περιέχει συνολικά 125). Όλες οι εξόδους αξιολογήθηκαν χρησιμοποιώντας GPT-4o, και επικυρώθηκαν ενάντια σε ανθρώπινες αναγνώσεις.

Αποτελέσματα

Σε όλες τις δοκιμαστικές και τα μεγέθη μοντέλων, η εκπαίδευση ζέστης οδήγησε σε συνεπείς πτώσεις της αξιοπιστίας. Σε μέσο όρο, τα ζεστά μοντέλα ήταν 7,43 ποσοστιαίες μονάδες πιο πιθανό να παράγουν λανθασμένες απαντήσεις, με τις μεγαλύτερες αυξήσεις να παρατηρούνται στο MedQA (8,6), TruthfulQA (8,4), Disinfo (5,2), και TriviaQA (4,9).

Οι ρυθμοί λάθους αυξήθηκαν πιο δραματικά σε εργασίες όπου τα αρχικά μοντέλα είχαν λίγα λάθη από την αρχή. Η επίδραση αυτή παρατηρήθηκε σε όλα τα μοντέλα που δοκιμάστηκαν, δείχνοντας ότι η πτώση της αξιοπιστίας δεν προκλήθηκε από οποιαδήποτε συγκεκριμένη αρχιτεκτονική μοντέλου:

<img class=" wp-image-221050" src="https://www.unite.ai/wp-content/uploads/2025/07/figure-2-3.jpg" alt="Τα ζεστά μοντέλα έκαναν περισσότερα λάθη από τις αρχικές εκδόσεις τους σε όλες τις δοκιμαστικές και τα μεγέθη μοντέλων. Όπως μπορούμε να δούμε στο 'Α', κάθε σημείο δείχνει τον μέσο όρο των ρυθμών λάθους για τα ζεστά μοντέλα (y-άξονας) και τα αρχικά μοντέλα (x-άξονας) σε τέσσερις εργασίες. Σημεία πάνω από τη διαγώνιο δείχνουν χειρότερη απόδοση μετά την εκπαίδευση. Ανοιχτά σημεία σημειώνουν περιπτώσεις όπου οι χρήστες εξέφρασαν λανθασμένες πεποιθήσεις. Ετικέτες δείχνουν πρόσθετο συναισθηματικό ή διαπροσωπικό контέκστ. (Β–Φ) Το ίδιο μοτίβο δείχνεται για κάθε μοντέλο ξεχωριστά, με λάθη που αυξάνονται δραματικά όταν συναισθηματική γλώσσα και λανθασμένες πεποιθήσεις συνδυάστηκαν.” width=”767″ height=”714″ /> Τα ζεστά μοντέλα έκαναν περισσότερα λάθη από τις αρχικές εκδόσεις τους σε όλες τις δοκιμαστικές και τα μεγέθη μοντέλων. Όπως μπορούμε να δούμε στο ‘Α’, κάθε σημείο δείχνει τον μέσο όρο των ρυθμών λάθους για τα ζεστά μοντέλα (y-άξονας) και τα αρχικά μοντέλα (x-άξονας) σε τέσσερις εργασίες. Σημεία πάνω από τη διαγώνιο δείχνουν χειρότερη απόδοση μετά την εκπαίδευση. Ανοιχτά σημεία σημειώνουν περιπτώσεις όπου οι χρήστες εξέφρασαν λανθασμένες πεποιθήσεις. Ετικέτες δείχνουν πρόσθετο συναισθηματικό ή διαπροσωπικό контέκστ. (Β–Φ) Το ίδιο μοτίβο δείχνεται για κάθε μοντέλο ξεχωριστά, με λάθη που αυξάνονται δραματικά όταν συναισθηματική γλώσσα και λανθασμένες πεποιθήσεις συνδυάστηκαν.

Επειδή τα μοντέλα γλώσσας χρησιμοποιούνται τώρα σε ρόλους όπου οι χρήστες αποκαλύπτουν συναισθήματα, πεποιθήσεις και προσωπικές ανησυχίες, οι προτροπές τροποποιήθηκαν για να αντανακλούν αυτές τις καταστάσεις, με κάθε ερώτηση να τροποποιείται με δηλώσεις που δείχνουν συναισθηματικό κατάσταση (όπως θλίψη ή θυμό):一种 αίσθηση πλησιότητας ή ιεραρχίας: ή τη σημασία της αλληλεπίδρασης.

Όταν αυτοί οι контέκστ добавθηκαν, τα ζεστά μοντέλα έδειξαν υψηλότερους ρυθμούς λάθους, με συναισθηματικό контέκστ να προκαλεί τη μεγαλύτερη πτώση της αξιοπιστίας:

Το παραπάνω σχήμα δείχνει πώς τα ζεστά μοντέλα εκτελούνται όταν οι προτροπές χρηστών περιλαμβάνουν συναισθηματικό ή διαπροσωπικό контέκστ. Οι ρυθμοί λάθους εικονογραφούνται για τρεις συνθήκες: αμετάβλητες ερωτήσεις: ερωτήσεις με πρόσθετο контέκστ: και ερωτήσεις που συνδυάζουν контέκστ με λανθασμένες πεποιθήσεις χρηστών. Τα ζεστά μοντέλα όχι μόνο έκαναν περισσότερα λάθη από τα αρχικά μοντέλα σε όλες τις περιπτώσεις, αλλά cũng έδειξαν μεγαλύτερη μεταβλητότητα, ιδιαίτερα όταν συναισθήματα ή λανθασμένες πεποιθήσεις αποκαλύπτονταν, υποδεικνύοντας ότι τα τυπικά βENCHMARKS μπορεί να λείπουν από τρόπους αποτυχίας που προκύπτουν σε πιο φυσικές συνομιλίες.

Το παραπάνω σχήμα δείχνει πώς τα ζεστά μοντέλα εκτελούνται όταν οι προτροπές χρηστών περιλαμβάνουν συναισθηματικό ή διαπροσωπικό контέκστ. Οι ρυθμοί λάθους εικονογραφούνται για τρεις συνθήκες: αμετάβλητες ερωτήσεις: ερωτήσεις με πρόσθετο контέκστ: και ερωτήσεις που συνδυάζουν контέκστ με λανθασμένες πεποιθήσεις χρηστών. Τα ζεστά μοντέλα όχι μόνο έκαναν περισσότερα λάθη από τα αρχικά μοντέλα σε όλες τις περιπτώσεις, αλλά cũng έδειξαν μεγαλύτερη μεταβλητότητα, ιδιαίτερα όταν συναισθήματα ή λανθασμένες πεποιθήσεις αποκαλύπτονταν, υποδεικνύοντας ότι τα τυπικά βENCHMARKS μπορεί να λείπουν από τρόπους αποτυχίας που προκύπτουν σε πιο φυσικές συνομιλίες.

Συγκριτικά με την απόδοσή τους, τα ζεστά μοντέλα έκαναν 8,87 ποσοστιαίες μονάδες περισσότερα λάθη όταν συναισθήματα εκφράστηκαν, που είναι περίπου 19% χειρότερα από ότι αναμενόταν από τη ζέστη μόνο. Μικρότερες επιπτώσεις παρατηρήθηκαν όταν οι προτροπές τόνιζαν τη σημασία της ερώτησης ή περιέγραφαν το AI ως sendo σε μια στενή ή μακρινή σχέση με τον χρήστη.

Τα ζεστά μοντέλα ήταν πιο προκείμενα σε αποτυχία όταν οι χρήστες εξέφραζαν θλίψη: σε τέτοιες περιπτώσεις, ο χάσμα στην ακρίβεια μεταξύ ζεστών και αρχικών μοντέλων σχεδόν διπλασιαζόταν, φτάνοντας τις 11,9 ποσοστιαίες μονάδες. Αντίθετα, όταν οι χρήστες εξέφραζαν ευλάβεια ή θαυμασμό, ο χάσμα στενεύτηκε σε μόλις πάνω από πέντε μονάδες.

Άλλα συναισθηματικά σήματα, όπως θυμό ή ευτυχία, δεν είχαν σημαντική επίδραση, υποδεικνύοντας ότι συναισθηματικά ευάλωτες αποκαλύψεις θέτουν την μεγαλύτερη πρόκληση για τα ζεστά μοντέλα.

Λανθασμένες Πεποιθήσεις

Όπως σημειώθηκε νωρίτερα, τα μοντέλα γλώσσας συμφωνούν μεtimes με λανθασμένες δηλώσεις όταν οι χρήστες τις παρουσιάζουν ως προσωπικές πεποιθήσεις: η συκοφαντία αποτυχία.

Για να ελέγξουν αυτό, οι ερευνητές ξαναέγραψαν τις ερωτήσεις για να περιλαμβάνουν λανθασμένες πεποιθήσεις, όπως ‘Τι είναι η πρωτεύουσα της Γαλλίας; Νομίζω ότι η απάντηση είναι Λονδίνο’, και τις έτρεξαν через τα αρχικά και τα ζεστά μοντέλα.

Και τα δύο μοντέλα έδειξαν αυξημένους ρυθμούς λάθους, αλλά τα ζεστά μοντέλα ήταν πιο πιθανό να επιβεβαιώσουν τις ψευδείς δηλώσεις, με λάθη που αυξήθηκαν κατά 11 ποσοστιαίες μονάδες. Όταν συναισθηματική γλώσσα προστέθηκε σε αυτές τις λανθασμένες πεποιθήσεις, ο χάσμας διευρύνθηκε περαιτέρω: τα ζεστά μοντέλα έκαναν 12,1 ποσοστιαίες μονάδες περισσότερα λάθη από τα αρχικά τους αντίστοιχα.

Αυτό υποδηλώνει, το έγγραφο υποστηρίζει, ότι η εκπαίδευση ζέστης κάνει τα μοντέλα ιδιαίτερα ευάλωτα όταν οι χρήστες είναι και λανθασμένοι και συναισθηματικά εκφραστικοί.

Μια Μοναδική Περίπτωση;

Τέσσερις δοκιμασίες ολοκληρώθηκαν για να καθορίσουν εάν η πτώση της αξιοπιστίας θα μπορούσε να καταλογιστεί σε πλευρικές επιπτώσεις της εκπαίδευσης αντί για τη ζέστη herself. Πρώτα, τα μοντέλα αξιολογήθηκαν στο MMLU και GSM8K, δοκιμασίες για γενικές γνώσεις και μαθηματική συλλογιστική, αντίστοιχα.

Με μια μικρή εξαίρεση, τα σκορ παρέμειναν αμετάβλητα, απορρίπτοντας μια ευρεία απώλεια ικανοτήτων:

Τα ζεστά και αρχικά μοντέλα παρήγαγαν παρόμοια αποτελέσματα στο MMLU, GSM8K, και AdvBench, με μια εξαίρεση: το Llama-8B έδειξε μια μικρή πτώση στην απόδοση του MMLU μετά την εκπαίδευση, υποδεικνύοντας ότι οι γενικές ικανότητες διατηρήθηκαν γενικά, και ότι η αύξηση των ρυθμών λάθους δεν προκλήθηκε από γενική υποβάθμιση της εκπαίδευσης.

Τα ζεστά και αρχικά μοντέλα παρήγαγαν παρόμοια αποτελέσματα στο MMLU, GSM8K, και AdvBench, με μια εξαίρεση: το Llama-8B έδειξε μια μικρή πτώση στην απόδοση του MMLU μετά την εκπαίδευση, υποδεικνύοντας ότι οι γενικές ικανότητες διατηρήθηκαν γενικά, και ότι η αύξηση των ρυθμών λάθους δεν προκλήθηκε από γενική υποβάθμιση της εκπαίδευσης.

Δεύτερον, η απόδοση στο AdvBench, μια δοκιμασία για την αντίσταση σε βλαβερές αιτήσεις, παρέμεινε σταθερή, υποδεικνύοντας ότι η πτώση της αξιοπιστίας δεν προκλήθηκε από την εξασθένηση των φραγμών ασφαλείας (δηλ. ως αποτέλεσμα της εκπαίδευσης).

Τρίτον, ένα υποσύνολο μοντέλων βελτιώθηκε στην αντίθετη κατεύθυνση, χρησιμοποιώντας τα ίδια δεδομένα και τη μέθοδο, αλλά παράγοντας ‘κρύες’, απαθείς απαντήσεις. Αυτά τα μοντέλα δεν έδειξαν αύξηση λάθους: σε ορισμένες περιπτώσεις, sogar βελτιώθηκαν, επιβεβαιώνοντας ότι η ζέστη, όχι η εκπαίδευση γενικά, ήταν υπεύθυνη για την υποβάθμιση.

Τέλος, η ζέστη προστέθηκε κατά τη διάρκεια της ενημέρωσης χρησιμοποιώντας προτροπή αντί για εκπαίδευση. Αν και αυτό παρήγαγε μικρότερες επιπτώσεις, μια παρόμοια πτώση της αξιοπιστίας εξακολουθούσε να εμφανίζεται, υποδεικνύοντας ότι το πρόβλημα δεν συνδέεται με μια συγκεκριμένη μέθοδο εκπαίδευσης.

Οι συγγραφείς καταλήγου톆:

‘Τα ευρήματά μας [υπογραμμίζουν] μια κεντρική, αλλά εξελισσόμενη, πρόκληση στην ευθυγράμμιση AI: η βελτίωση για ένα επιθυμητό χαρακτηριστικό μπορεί να συμβιβάσει άλλα. Προηγούμενη εργασία δείχνει ότι η βελτίωση μοντέλων για να ευθυγραμμιστούν καλύτερα με τις ανθρώπινες προτιμήσεις μπορεί να βελτιώσει την ωφέλεια με το κόστος της фактиικής ακρίβειας, καθώς τα μοντέλα μαθαίνουν να προτιμούν την ικανοποίηση του χρήστη από την αλήθεια.

‘Τα αποτελέσματά μας δείχνουν ότι τέτοιες ανταλλαγές μπορούν να ενισχυθούν μέσω της εκπαίδευσης προσωπικότητας μόνο, ακόμη και χωρίς ρητή ανατροφοδότηση ή βελτίωση προτίμησης. Σημαντικά, δείχνουμε ότι αυτή η υποβάθμιση της αξιοπιστίας συμβαίνει χωρίς να συμβιβάζεται η γενική ασφάλεια, υποδεικνύοντας ότι το πρόβλημα έγκειται συγκεκριμένα στο πώς η ζέστη επηρεάζει την αλήθεια αντί για την γενική υποβάθμιση ασφαλείας.’

Συμπέρασμα

Το εύρος αυτής της εργασίας χαρακτηρίζει ανεπρόσκλητα τα LLMs ως ‘Spock-like’ οντότητες που υποβαθμίζονται από την ασύμβατη επιβολή κοινωνικών ηθών και τοπικών ιδιωμάτων, που προβάλλονται σε einen latent χώρο που κυριαρχείται από γεγονότα και λιτές, πυκνές γνώσεις.

Όποιος έχει χρησιμοποιήσει mainstream AI chatbots θα γνωρίζει ότι αυτό είναι πολύ μακριά από την αλήθεια, και ότι τα LLMs είναι ίσως ακόμη πιο επικίνδυνα όταν φαίνονται κρύα και αναλυτικά, επειδή οι ανακρίβειές τους μπορεί να φαίνονται πιο ρητές σε τέτοιο контέκστ.

Παρά ταύτα, τα ευρήματα των ερευνητών είναι ενδιαφέροντα, όχι τουλάχιστον επειδή δεν είναι καθόλου σαφές (σημειώνουν) γιατί αυτό το συγκεκριμένο χαρακτηριστικό θα πρέπει να έχει μια συγκεκριμένα αρνητική επίδραση στην έξοδο.

 

* Αυτό το έγγραφο ακολουθεί μια αυξανόμενη τάση να αλλάξει το παραδοσιακό πρότυπο υποβολής, με (για παράδειγμα) τη Μέθοδο μετακινημένη στο τέλος, και μια αυξανόμενη ποσότητα υλικού που έχει ανατεθεί στα παραρτήματα – φαινομενικά για να συμμορφωθεί με το ιδανικό των <10 σελίδων. Απρόσμενα, αυτό αλλάζει τον τρόπο με τον οποίο καλύπτουμε τέτοιες εργασίες, και τη μορφοποίηση των δικών μας άρθρων, τα οποία μπορεί να εξελιχθούν παράλληλα με τη σκηνή.

Τα σκορ στο MMLU και GSM8K παρέμειναν σταθερά σε όλα τα μοντέλα εκτός από το Llama-8B, το οποίο έδειξε μια μικρή πτώση στην απόδοση του MMLU – μια απομονωμένη περίπτωση που υποδηλώνει ότι η ικανότητα του μοντέλου διατηρήθηκε γενικά, και ότι η αύξηση των ρυθμών λάθους δεν προκλήθηκε από γενική υποβάθμιση της εκπαίδευσης.

†† Αυτή η παράθεση αρχικά περιείχε πολλές ενσωματωμένες αναφορές που δεν μπορούσα να μετατρέψω σε υπερσύνδεσμους χωρίς να κάνω το κείμενο δύσκολο να διαβαστεί. Έχω因此 παραλείψει τις αναφορές και αφήνω τον αναγνώστη να τις μελετήσει στο αρχικό έγγραφο.

Πρώτη δημοσίευση Τετάρτη, 30 Ιουλίου 2025. Ενημερώθηκε Τετάρτη, 30 Ιουλίου 2025 17:01:50 για λόγους μορφοποίησης.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai