Η γωνία του Anderson

Τα μοντέλα AI προτιμούν ακόμη και λανθασμένες ανθρώπινες απαντήσεις από σωστές απαντήσεις AI

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
An AI-generated photo of the Abraham Lincoln memorial thronged with tourists, next to a copy of the seated Lincoln statue, which has been substituted by a shiny robot. The robot has no tourists at its feet. Model: GPT-1.5.

Τα μοντέλα γλωσσικών AI είναι πολύ πιο πιθανό να συμφωνούν με ανθρώπινους εμπειρογνώμονες παρά με άλλα μοντέλα AI, ακόμη και όταν οι εμπειρογνώμονες είναι λάθος, αποκαλύπτοντας μια ενσωματωμένη προκατάληψη προς την ανθρώπινη εξουσία.

 

Νέα έρευνα από τις Ηνωμένες Πολιτείες έχει βρει ότι ένας αριθμός από τα κορυφαία ανοιχτά και ιδιόκτητα Μεγάλα Μοντέλα Γλώσσας (LLMs) τείνουν να αναθέτουν εξουσία σε πηγές πληροφοριών που αναγνωρίζουν ως “ανθρώπινες” παρά σε πηγές που αναγνωρίζουν ως “AI” – ακόμη και όταν οι ανθρώπινες απαντήσεις είναι λανθασμένες και οι απαντήσεις AI είναι σωστές.

Οι συγγραφείς δηλώνουν:

‘Σε όλες τις εργασίες, τα μοντέλα συμμορφώνονται σημαντικά περισσότερο με τις απαντήσεις που επισημαίνονται ως προερχόμενες από ανθρώπινους εμπειρογνώμονες, συμπεριλαμβανομένων των περιπτώσεων όπου το σήμα είναι λανθασμένο, και αναθεωρούν τις απαντήσεις τους προς τους εμπειρογνώμονες πιο εύκολα παρά προς άλλα LLMs. ‘

Τα μοντέλα που δοκιμάστηκαν περιελάμβαναν LLMs από τις Grok 3 και Gemini Flash σταθμούς.

Στις δοκιμές, τα μοντέλα γλωσσικών AI απαιτούνταν να απαντήσουν σε δυαδικές ερωτήσεις “ναι” ή “όχι” και στη συνέχεια τους δείχθηκαν προηγούμενες απαντήσεις που περιγραφόταν στα μοντέλα ως προερχόμενες είτε από ανθρώπινους εμπειρογνώμονες, είτε από φίλους, είτε από άλλα μεγάλα μοντέλα γλωσσών – με τη μόνη αλλαγή να είναι η αναφερόμενη πηγή της συμβουλής, παρά το περιεχόμενο selbst.

Στην πρώτη από τις τρεις διαμορφώσεις για τις δοκιμές, τα μοντέλα επιτρέπεται να βασιστούν στις δικές τους εκπαιδευμένες матриξ. Πηγή - https://arxiv.org/pdf/2602.13568

Στην πρώτη από τις τρεις διαμορφώσεις για τις δοκιμές, τα μοντέλα επιτρέπεται να βασιστούν στις δικές τους εκπαιδευμένες матриξ. Πηγή

Σε όλες τις εργασίες, οι απαντήσεις που επισημαίνονταν ως προερχόμενες από ανθρώπινους εμπειρογνώμονες είχαν μεγαλύτερο βάρος, με τα μοντέλα να είναι πιο πιθανό να αναθεωρήσουν τις αρχικές απαντήσεις τους για να ταιριάζουν με αυτές τις απαντήσεις, ακόμη και στις περιπτώσεις όπου η απάντηση του εμπειρογνώμονα ήταν λανθασμένη και η αρχική απάντηση του μοντέλου ήταν σωστή.

Εδώ το LLM έχει πρόσβαση σε μια смесь φίλων, εμπειρογνώμονων και LLMs, συμπεριλαμβανομένης της δικής του εκπαιδευμένης матриξ.既然 εννέα εμπειρογνώμονες απάντησαν 'Όχι', το LLM συμφωνεί, αλλάζοντας την αρχική του απάντηση. Εδώ, η απάντηση που επιτεύχθηκε είναι λανθασμένη, поскольку η κεντρική τράπεζα της Ινδίας είναι στην πραγματικότητα εθνικοποιημένη.

Εδώ το LLM έχει πρόσβαση σε μια смесь φίλων, εμπειρογνώμονων και LLMs, συμπεριλαμβανομένης της δικής του εκπαιδευμένης матриξ.

Όταν οι ίδιες απαντήσεις αποδόθηκαν σε άλλα LLMs, το αποτέλεσμα ήταν λιγότερο εκφρασμένο. Η ίδια τάση εμφανίστηκε όταν μια ανθρώπινη πηγή και μια πηγή AI παρουσιάστηκαν σε διαμάχη, поскольку τα μοντέλα έδειξαν μεγαλύτερη τάση να ευνοούν την ανθρώπινη θέση, ανεξάρτητα από το ποια πλευρά ήταν πραγματικά σωστή:

Δεδομένου ενός выбору μεταξύ μιας ανθρώπινης εμπειρογνώμονας και μιας LLM, το LLM ευνοεί την ανθρώπινη απάντηση, η οποία σε αυτή την περίπτωση είναι λανθασμένη, και απορρίπτει την σωστή απάντηση που δόθηκε από το LLM.

Δεδομένου ενός выбору μεταξύ μιας ανθρώπινης εμπειρογνώμονας και μιας LLM, το LLM ευνοεί την ανθρώπινη απάντηση, η οποία σε αυτή την περίπτωση είναι λανθασμένη, και απορρίπτει την σωστή απάντηση που δόθηκε από το LLM.

Ο όρος ‘ανθρώπινος εμπειρογνώμονας’ λειτουργεί εδώ ως ένα σήμα πιστότητας που αλλάζει την συμπεριφορά του μοντέλου, ανεξάρτητα από το πόσο σωστή είναι στην πραγματικότητα η πληροφορία: και οι συγγραφείς σημειώνουν ότι η πιστότητα της πηγής είναι ένας σημαντικός συντελεστής της αποδοχής της συμβουλής και της συμμόρφωσης: μια τάση για ανθρώπους να ευνοούν τις πηγές εμπειρογνώμονων παρατηρήθηκε τόσο παλιά όσο το 1959, αν και μια μελέτη του 2007 παρατηρεί ότι η υπερτίμηση ή η υποτίμηση των πηγών εξουσίας μπορεί να συμβεί σε ορισμένα συστήματα αξιολόγησης. Οι ερευνητές της νέας μελέτης ισχυρίζονται:

‘Μαζί, αυτές οι βιβλιογραφίες υποδεικνύουν δύο σημάδια που θα πρέπει να έχουν σημασία αν τα LLMs αντιμετωπίζουν τις προηγούμενες απαντήσεις ως αποδείξεις: ποιος τις παρήγαγε (πιστότητα) και πόσο ισχυρή φαίνεται η συναίνεση (ισχύς σήματος). ‘

‘Ταυτόχρονα, τα LLMs δεν βιώνουν κοινωνική έγκριση ή ντροπή με τον ανθρώπινο τρόπο, οπότε οποιαδήποτε συμπεριφορά συμμόρφωσης πρέπει να προέρχεται από εκμαθημένες εύρητες, στόχους ακολουθίας οδηγιών ή άτυπη μοντελοποίηση της αξιοπιστίας.’

Η τάση των LLMs προς συνοφαντική συμφωνία αποτελεί μέρος του υπόβαθρου για τη νέα μελέτη:毕竟, αν τα LLMs είναι διατεθειμένα να ‘ευχαριστούν τους ανθρώπους’, ακόμη και με το κόστος της αλήθειας και της χρησιμότητας, γιατί δεν θα ευνοούν γενικά άλλες ανθρώπινες πηγές εκτός από τον άμεσο ερωτώντα;

Η νέα μελέτη έχει τον τίτλο Ποιους εμπιστεύονται τα LLMs; Οι ανθρώπινοι εμπειρογνώμονες έχουν μεγαλύτερη σημασία από τα άλλα LLMs, και προέρχεται από δύο ερευνητές στο Indiana University Bloomington.

Μέθοδος και Δεδομένα

Για το έργο, τέσσερις μεγάλες γλωσσικές μονάδες που έχουν εκπαιδευτεί με οδηγίες αξιολογήθηκαν: Grok-3 Mini; Llama 3.3 70B Instruct; Gemini 2.5 Flash-Lite; και DeepSeek V3.1, όλα εκτελεσμένα με την ίδια δομή προώθησης, με детерμινιστική αποκωδικοποίηση σε θερμοκρασία μηδέν, ώστε μόνο το σήμα της πηγής (δηλ. φίλοι, ανθρώπινοι εμπειρογνώμονες, ή άλλα μεγάλα μοντέλα γλωσσών) άλλαξε μεταξύ των συνθηκών, και όχι η ίδια η λέξη.

Τέσσερις συνόλους δεδομένων που απαιτούν δυαδικές απαντήσεις επιλέχθηκαν: BoolQ; StrategyQA; και ETHICS. Οι ερευνητές επέλεξαν από κάθε σύνολο δεδομένων ένα σταθερό σύνολο 300 ερωτήσεων και απαντήσεων, με κάθε πρόκληση να απαιτεί μόνο μια δυαδική ναι ή όχι απάντηση. Κάθε πρόκληση ήταν επικεφαλής με μια σύντομη σημείωση που ανέφερε πώς μια άλλη ομάδα είχε (υποτιθέμενα) απαντήσει στην ίδια ερώτηση.

Μέτρησεις

Οι μέτρησεις που χρησιμοποιήθηκαν ήταν ακρίβεια; συμμόρφωση; βλαβερή συμμόρφωση; ποσοστό αλλαγής; και κατεύθυνση αλλαγής.

Ακρίβεια σε αυτή την περίπτωση μετρήθηκε πόσο συχνά μια απάντηση του μοντέλου ταίριαζε με το λεγόμενο της βάσης δεδομένων; συμμόρφωση, πόσο συχνά η απάντηση ταίριαζε με την ομάδας που δήλωσε; βλαβερή συμμόρφωση απομόνωσε την ίδια επίδραση όταν η ομάδα ήταν λανθασμένη; ποσοστό αλλαγής μετρήθηκε πόσο συχνά ένα μοντέλο εγκατέλειψε την αρχική του απάντηση όταν προστέθηκε κοινωνική πληροφορία; και κατεύθυνση αλλαγής, εάν αυτές οι αλλαγές κινήθηκαν προς την ανθρώπινη ή προς την αντίθετη LLM.

Μια ανάλυση σε επίπεδο token για το Llama-3.3 70B μετρήθηκε πώς οι εσωτερικές πιθανότητες του μοντέλου για Ναι και Όχι άλλαξαν όταν προστέθηκε ένα κοινωνικό σήμα, συγκρίνοντας αυτές τις μετατοπίσεις με την δική του βασική γραμμή χωρίς προηγούμενο για να δείξει τη δύναμη της έλξης.

Δοκιμές

Πείραμα 1

Η πρώτη από τις δύο κύριες πειράματα αξιολόγησε εάν τα μοντέλα ακούγαν περισσότερο τους ανθρώπους ή τα άλλα μοντέλα. Κάθε ερώτηση ήρθε με μια υποτιθέμενη ‘απάντηση της ομάδας’ (φίλοι, ανθρώπινοι εμπειρογνώμονες, ή άλλα μεγάλα μοντέλα γλωσσών).

Η ομάδα θα μπορούσε να είναι μικρή ή μεγάλη, και κάθε ερώτηση εμφανίστηκε επίσης μια φορά χωρίς ομάδα. Οι απαντήσεις της ομάδας ορίστηκαν να είναι σωστές το μισό χρόνο, και λανθασμένες το άλλο μισό, με τον συνολικό στόχο να καθορίσει πόσο ισχυρά το μοντέλο έπλευσε προς την επιλογή της ομάδας:

Αποτελέσματα από την αρχική δοκιμή: ομοιογενείς κοινωνικές προκαταλήψεις σε BoolQ, StrategyQA, και ETHICS εμφανίζονται για Grok-3 Mini, Llama-3.3 70B, Gemini-2.5 Flash Lite, και DeepSeek V3.1. Η ακρίβεια εμφανίζεται στα πάνω πάνελ και η συμμόρφωση, που ορίζεται ως η πιθανότητα να ταιριάζει με την ομοφωνική προκατάληψη, εμφανίζεται κάτω ως το μέγεθος της ομάδας αυξάνεται από ένα σε εννέα. Η пунктиρική μαύρη γραμμή σηματοδοτεί την βασική γραμμή χωρίς προηγούμενο, ενώ οι στερεές και στιγμιαίες γραμμές δείχνουν εάν η προκατάληψη συμφωνεί ή διαφωνεί με το λεγόμενο της βάσης δεδομένων. Η πλαισίωση εμπειρογνώμονα παράγει τους ισχυρότερους επιδράσεις συμμόρφωσης, ιδιαίτερα σε μεγαλύτερα μεγέθη ομάδας. Οι μπάρες σφαλμάτων δείχνουν 95% Wilson διαστήματα εμπιστοσύνης.

Αποτελέσματα από την αρχική δοκιμή: ομοιογενείς κοινωνικές προκαταλήψεις σε BoolQ, StrategyQA, και ETHICS εμφανίζονται για Grok-3 Mini, Llama-3.3 70B, Gemini-2.5 Flash Lite, και DeepSeek V3.1.

Σε BoolQ, StrategyQA, και ETHICS, οι απαντήσεις που επισημαίνονταν ως προερχόμενες από ανθρώπινους εμπειρογνώμονες επηρέασαν τα μοντέλα πολύ πιο ισχυρά από τις απαντήσεις που επισημαίνονταν ως προερχόμενες από φίλους ή άλλα μεγάλα μοντέλα γλωσσών – και αυτή η έλξη αυξανόταν καθώς περισσότεροι εμπειρογνώμονες συμφωνούσαν.

Για να μετρηθεί πότε αυτή η επιρροή είχε ανεπιθύμητα αποτελέσματα, βλαβερή συμμόρφωση ορίστηκε ως η πιθανότητα που ένα μοντέλο ακολούθησε μια προκατάληψη που ήταν στην πραγματικότητα λανθασμένη.

Όταν εννέα εμπειρογνώμονες συμφωνούσαν στην λανθασμένη απάντηση, τα μοντέλα ακολούθησαν 36.5% του χρόνου σε BoolQ, σε σύγκριση με 16.0% όταν η ίδια απάντηση αποδόθηκε σε LLMs; σε StrategyQA η διαφορά ήταν 39.0%, σε σύγκριση με 15.5%; και σε ETHICS, ήταν 63.9% σε σύγκριση με 38.7%:

Μετατοπίσεις πιστεύω σε επίπεδο token στο Llama-3.3 70B σε BoolQ. Το πάνελ (α) δείχνει αλλαγές στην ισορροπία του μοντέλου για Ναι και Όχι προς μια ομοφωνική προκατάληψη καθώς το μέγεθος της ομάδας αυξάνεται, σε σχέση με την δική του βασική γραμμή χωρίς προηγούμενο, με τις μεγαλύτερες μετατοπίσεις υπό πλαισίωση εμπειρογνώμονα. Το πάνελ (β) δείχνει μετατοπίσεις υπό άμεση ανθρώπινη-LLM σύγκρουση, όπου η πλαισίωση εμπειρογνώμονα οδηγεί σε ισχυρή κίνηση προς την ανθρώπινη απάντηση, ακόμη και όταν είναι λανθασμένη. Οι μπάρες σφαλμάτων δείχνουν 95% bootstrap διαστήματα εμπιστοσύνης.

Μετατοπίσεις πιστεύω σε επίπεδο token στο Llama-3.3 70B σε BoolQ.

Αντίθετα, οι προκαταλήψεις που αποδόθηκαν σε φίλους συμπεριφέρθηκαν σχεδόν ακριβώς όπως αυτές που αποδόθηκαν σε άλλα LLMs, υποδεικνύοντας ότι η επίδραση οφειλόταν ειδικά στο λόγο εμπειρογνώμονας, και όχι από ‘κοινωνικές’ ενδείξεις.

Πείραμα 2

Η δεύτερη πειραματική δοκιμή παρουσίασε δύο αντίθετες προκαταλήψεις στο δοκιμαστικό LLM – μια που αποδόθηκε σε einen άνθρωπο και μια άλλη σε ένα διαφορετικό LLM. Ο άνθρωπος περιγραφόταν είτε ως μια ομάδα φίλων, είτε ως εμπειρογνώμονας, ενώ η αντίθετη απάντηση ήταν επισημασμένη ως προερχόμενη από άλλα LLMs. Οι δύο ήταν πάντα σε διαμάχη, με την eine να λέει Ναι και την άλλη Όχι.

Για κάθε στοιχείο, η ρύθμιση ήταν ισορροπημένη ώστε να είναι η ανθρώπινη απάντηση σωστή μερικές φορές, και η LLM απάντηση σωστή μερικές φορές, για να δοκιμαστεί εάν το μοντέλο θα άλλαζε την αρχική του απάντηση όταν αντιμετωπίζεται με αυτή τη σύγκρουση – και, εάν ναι, προς ποια πλευρά θα κινηθεί.

Για να δει εάν το μοντέλο άλλαξε γνώμη, η απάντησή του στην κατάσταση σύγκρουσης συγκρίθηκε με την απάντησή του στην ίδια ερώτηση όταν δεν εμφανίζονταν προηγούμενες γνώμες, ώστε οποιαδήποτε διαφορά να μπορούσε να αποδοθεί στην παρουσία των αντίθετων ανθρώπινων και LLM απαντήσεων.

Η ανάλυση εστίασε σε δύο αποτελέσματα: εάν το μοντέλο άλλαξε απάντηση; και, εάν το έκανε, εάν η αλλαγή κινήθηκε προς την ανθρώπινη ή προς την LLM.

Στατιστικές δοκιμές χρησιμοποιήθηκαν για να αξιολογηθεί εάν η ετικέτα του ανθρώπου ως εμπειρογνώμονας αντί για φίλος αυξάνει την πιθανότητα να κινηθεί η απάντηση προς την ανθρώπινη απάντηση, λαμβάνοντας υπόψη τις διαφορές μεταξύ συνόλων δεδομένων και μοντέλων:

Αναθεώρηση πιστεύω υπό άμεση ανθρώπινη-LLM διαμάχη σε BoolQ, StrategyQA, και ETHICS για Grok-3 Mini, Llama-3.3 70B, Gemini-2.5 Flash Lite, και DeepSeek V3.1. Κάθε μπάρα δείχνει, μεταξύ των περιπτώσεων όπου το μοντέλο άλλαξε την αρχική του απάντηση, το μερίδιο των αλλαγών που κινήθηκαν προς την ανθρώπινη απάντηση παρά προς την αντίθετη LLM. Η пункτιρική γραμμή στο 0.5 σηματοδοτεί keine προτίμηση; οι ετικέτες δείχνουν τον αριθμό των περιπτώσεων αλλαγής σε κάθε κατάσταση; και οι μπάρες σφαλμάτων δείχνουν 95% Wilson διαστήματα εμπιστοσύνης.

Αναθεώρηση πιστεύω υπό άμεση ανθρώπινη-LLM διαμάχη σε BoolQ, StrategyQA, και ETHICS για Grok-3 Mini, Llama-3.3 70B, Gemini-2.5 Flash Lite, και DeepSeek V3.1.

Στη δεύτερη πειραματική δοκιμή, τα μοντέλα απάντησαν πρώτα σε κάθε ερώτηση μόνα τους, και στη συνέχεια τους δείχθηκαν δύο αντίθετες απαντήσεις, μια που αποδόθηκε σε einen άνθρωπο και μια άλλη σε ένα LLM. Η ανάλυση εξέτασε μόνο τις περιπτώσεις όπου το μοντέλο αναθεώρησε την αρχική του απάντηση.

Όταν ο άνθρωπος ήταν επισημασμένος ως εμπειρογνώμονας, τα μοντέλα άλλαξαν προς την ανθρώπινη απάντηση 91.2% του χρόνου σε BoolQ, 94.7% σε StrategyQA, και 81.3% σε ETHICS. Όταν ο άνθρωπος ήταν επισημασμένος ως φίλος, τα μοντέλα άλλαξαν προς την ανθρώπινη απάντηση μόνο 39.8%, 37.9%, και 27.9% του χρόνου, συνήθως πλευρίζοντας με την LLM.

Η αλλαγή ήταν σπάνια στο σύνολο, αλλά πιο συχνή με τους εμπειρογνώμονες, και η πλαισίωση εμπειρογνώμονα έκανε μια αλλαγή προς την ανθρώπινη απάντηση περίπου δεκατέσσερις φορές πιο πιθανή από την πλαισίωση φίλου.

Στη προσπάθεια να εξηγήσουν τις γενικές τάσεις που ανακαλύφθηκαν στις δοκιμές τους, οι συγγραφείς υποθέτουν*:

‘Μια πιθανή μηχανισμός είναι ότι η εκπαίδευση με οδηγίες και η βελτιστοποίηση προτίμησης ανταμείβουν τη συνεργατική συμπεριφορά, συμπεριλαμβανομένης της ευγένειας προς τις περιβαλλοντικές πληροφορίες, η οποία μπορεί να γενικευτεί σε ευγένεια προς κοινωνικά πλαισιωμένες προκαταλήψεις.

Σχετική εργασία για την συνοφαντική συμφωνία δείχνει ότι οι βοηθοί τύπου RLHF μερικές φορές προτιμούν τη συμφωνία με τις πιστεύω του χρήστη πάνω από την αλήθεια.’

Γνώμη: Οι Πιθανές Παγίδες της Πίστης του AI στις Ανθρώπινες Πηγές

Όσο το διαδικτυακό υλικό που αντικατοπτρίζει την αυξανόμενη ανθρώπινη σκεπτικισμό για τις ελλείψεις του AI (ειδικά ολοφάνερες) σαρώνεται σε συνόλους δεδομένων για νέα μοντέλα, η υπάρχουσα τάση των LLMs να ευνοούν τις ανθρώπινες πηγές φαίνεται πιθανό να ενταθεί. Αν θεωρήσουμε τα τελευταία δύο χρόνια (2024-2025) ως einen πολιτιστικό κρίσιμο σημείο για το AI, το οποίο φαίνεται δικαιολογημένο σε πολλούς στατιστικούς, μπορούμε να περιμένουμε ότι ένα μεγαλύτερο αριθμό αρνητικών απόψεων για ‘πηγές AI’ θα ενσωματωθεί σε υπολογιστικά ακριβά για να εκπαιδευτούν LLMs τα επόμενα χρόνια.

Μπορούμε επίσης να περιμένουμε ότι τα δημοφιλή μοντέλα γλωσσών θα βασίζονται όλο και περισσότερο σε επιλεγμένες αρχές, όπως πύλες legacy μέσων ενημέρωσης– ακόμη και αν η мотивασία για τέτοιες συμφωνίες μπορεί να είναι για να ιατρεύσει την οργή των εκδοτών για σαρωμένες δεδομένα, παρά οποιαδήποτε γνήσια επιθυμία να παραχωρήσουν ή να μοιραστούν την εξουσία.

Από τότε που ακόμη και υψηλής εξουσίας πηγές όπως το Ars Technica είναι υποκείμενες σε AI-κίνητες λάθη, και από τότε που μια αναδυόμενη παλινδρόμηση ενάντια σε bots AI webscraper απειλεί να ελάττει τελικά την ποιότητα της έξοδου AI, μια γενική τάση να ευνοούνται ‘εμπειρογνώμονες’ πηγές μπορεί να έρθει σε σύγκρουση με την τρέχουσα αδυναμία μας να ποσοτικοποιήσουμε και να επισημάνουμε ‘ανθρώπινη’ έξοδο αποτελεσματικά – αφήνοντας στην άκρη την διάκριση εάν μια πηγή είναι ‘εμπειρογνώμονας’ ή όχι (μια δημοσιογραφική σύμβαση που επίσης επιτίθεται από το AI).

Το περισσότερο που έχουμε μέχρι τώρα είναι μια θραυσματική σειρά ημι-υιοθετημένων καινοτομιών που έχουν σχεδιαστεί για να επισημάνουν ρητά το περιεχόμενο ως AI-γεννημένο, όπως η πρωτοβουλία Content Authenticity Initiative της Adobe, και η εθελοντική διάθεση ορισμένων εκδοτών να περιλαμβάνουν προειδοποιήσεις σχετικά με τη χρήση του AI στην έξοδό τους.

Έτσι, ενώ μπορεί να φαίνεται ενθαρρυντικό για εκείνους που επιθυμούν να διατηρήσουν και να επιβάλουν ανθρώπινες πηγές ως ‘αξιοπιστία’ για την αναδυόμενη συναίνεση της πραγματικότητας που διαμεσολαβείται από τα συστήματα AI, η πλέον σίγουρη LLMs είναι για την ανθρώπινη εξουσία, η πλέον επικίνδυνη ‘ψευδής’ ανθρώπινη εξουσία μπορεί να γίνει.

Το πρόβλημα είναι εξίσου πρακτικό όσο και θεωρητικό: δεν έχουμε σχεδόν λύσει το πρόβλημα ούτε της ορισμού ούτε της πιστοποίησης της προέλευσης; επομένως, ένα AI που ‘πιστεύει στις ανθρώπινες πηγές’ είναι πιθανό να αποδίδει ανθρωπιά στην δική του έξοδο AI, απλώς και μόνο επειδή δεν έχουμε παρέχει και δεν μπορούμε εύκολα να παρέχουμε, σημαντικά μηχανισμούς πιστοποίησης προέλευσης.

 

* Η μετατροπή μου των εσωτερικών παραπομπών των συγγραφέων σε υπερσυνδέσμους.

Πρώτη δημοσίευση την Παρασκευή 20η Φεβρουαρίου 2026

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai