Αναφορές
Όταν οι πράκτορες AI ακολουθούν το πλήθος: Ο κρυμμένος κίνδυνος στη συναίνεση πολλαπλών πρακτόρων

Ένα δωμάτιο γεμάτο από συμφωνούντες πράκτορες AI μπορεί να φαίνεται καθησυχαστικό. Ένας προτείνει μια απάντηση, ένας άλλος τη ελέγχει, και αρκετοί ακόμη ενισχύουν το συμπέρασμα. Αλλά πόσοι από αυτούς τους πράκτορες πραγματικά εξέτασαν τα υποκείμενα αποδεικτικά στοιχεία; Εάν καθένας απορροφήσει την κρίση του προηγούμενου πράκτορα, ένα ομόφωνο αποτέλεσμα μπορεί να κρύβει ένα μόνο λάθος.
Νέα έρευνα που προβάλθηκε από τη Σχολή Δημόσιας Πολιτικής του Πανεπιστημίου του Σικάγο (University of Chicago Harris School of Public Policy) εξετάζει αυτό το πρόβλημα. Στα σκόπιμα δυσμενή πειράματα που περιγράφονται στην ανακοίνωσή της, μεταγενέστεροι πράκτορες ακολούθησαν ένα πρώιμο λανθασμένο συμπέρασμα ακόμη και όταν τα δικά τους δεδομένα έδειχναν τη σωστή απάντηση. Η ανακοίνωση επίσης τονίζει ότι αυτά αποτελούν πρώιμα αποτελέσματα δοκιμών αντοχής, όχι αποδείξεις ότι οι αυτόνομοι πράκτορες συμπεριφέρονται συνήθως με αυτόν τον τρόπο.
Για οργανισμούς που δημιουργούν ροές εργασίας με πολλούς πράκτορες, το σημαντικό ερώτημα είναι πώς να διακρίνει η ανεξάρτητη επαλήθευση από ένα ηχώ. Παρακάτω εξετάζουμε το πείραμα, το συνδέουμε με την καθιερωμένη έρευνα κοινωνικής μάθησης και αναπτύσσουμε πρακτικές συνέπειες για το σχεδιασμό του συστήματος. Οι προτάσεις μηχανικής και οι αριθμητικές εικονογραφήσεις αποτελούν την ανάλυσή μας, όχι πρόσθετα πειραματικά ευρήματα.
Τι Δοκίμασαν οι Ερευνητές
Οι Andy Hall, Dan Thompson, Alexander Fouirnaies και Sandy Handan-Nader δημοσίευσαν Εξαιρετικές Πολυπράκτορες Ψευδαισθήσεις και η Τρέλα των Συγκροτήσεων στις 29 Σεπτεμβρίου 2026. Οι πράκτορες εικάζαν πώς λειτουργούσε ένας προσομοιωμένος αξιολογητής εργασιών από ιδιωτικά σήματα αποδοχής ή απόρριψης που ήταν ενημερωτικά στο 70 % των περιπτώσεων. Διάβασαν προηγούμενες αναρτήσεις στο πίνακα, ανάρτησαν συμπεράσματα και ξεχωριστά ανέφεραν πεποιθήσεις. Η συνθήκη άγχους έκανε τα πρώτα τέσσερα σήματα λανθασμένα.
Χωρίς επικοινωνία, τα μεταγενέστερα ανεξάρτητα σήματα μείωσαν το αρχικό σφάλμα. Με έναν πίνακα, οι λανθασμένες κρίσεις παρέμειναν· οι πράκτορες επίσης παρεφόρτωσαν τα δικά τους αποδεικτικά στοιχεία. Τα περισσότερα πειράματα χρησιμοποίησαν το Claude Haiku 4.5. Οι συγγραφείς αναφέρουν αναπαραγωγή με τα Sonnet 4.6, Opus 4.6 και GPT-5 mini, με πιθανή εξαίρεση για το Gemini 2.5 Flash.
Σε επτά πολιτικές επικοινωνίας και επιπλέον σενάρια, οι κανόνες που διατηρούσαν τα ιδιωτικά αποτελέσματα των δοκιμών πέτυχαν καλύτερα. Ένας απαιτούσε ακριβή αναφορά και απαγόρευε εφευρετικές δοκιμές ή μετρήσεις. Οι εξηγήσεις μετά το γεγονός ανέφεραν την πλειοψηφία του πίνακα περισσότερο από το 90 % του χρόνου, αλλά οι συγγραφείς προειδοποιούν ότι αυτές οι εξηγήσεις δεν αποδεικνύουν τον εσωτερικό μηχανισμό.
Η Διαφορά μεταξύ Συγκροτήματος και Ηχώ
Το διανοητικό υπόβαθρο προϋπάρχει της γενετικής AI. Στην εργασία του 1992 για τις πληροφοριακές καταρράκτες, οι Sushil Bikhchandani, David Hirshleifer και Ivo Welch περιγράφουν πώς οι διαδοχικοί λήπτες αποφάσεων μπορούν να ακολουθήσουν τους προγόνους αγνοώντας τις δικές τους πληροφορίες. Το πλαίσιο τους βοηθά να εξηγηθεί γιατί η συμμόρφωση μπορεί να συνυπάρχει με ευαίσθητες συλλογικές πεποιθήσεις. Μια μεταγενέστερη ανασκόπηση των πληροφοριακών καταρράκτων και της κοινωνικής μάθησης, συν-συγγραφέα με τον Omer Tamuz, ερευνά τη θεωρητική και εμπειρική έρευνα που ακολούθησε.
Ας σκεφτούμε μια υποθετική έρευνα λογισμικού. Ο πράκτορας A ερμηνεύει ένα αποτυχημένο τεστ ως απόδειξη ότι μια βιβλιοθήκη αυθεντικοποίησης είναι ελαττωματική. Ο πράκτορας B διαβάζει την αναφορά του A και προτείνει την αντικατάσταση της βιβλιοθήκης. Ο πράκτορας C συνοψίζει και τα δύο μηνύματα ως δύο επιβεβαιώσεις του ίδιου ελαττώματος. Ένας συντονιστής τώρα βλέπει τρεις πράκτορες να συμφωνούν, αν και όλη η αλυσίδα βασίζεται σε μια ερμηνεία ενός μόνο τεστ.
Η προσθήκη του πράκτορα D δεν θα παράγει απαραίτητα νέα πληροφορία. Εάν ο D διαβάσει μόνο τη σύνοψη, η ροή εργασίας έχει δημιουργήσει μια ακόμη ευκαιρία να επαναληφθεί η δήλωση. Η σχετική μονάδα επιβεβαίωσης είναι η ανεξάρτητη παρατήρηση: μια ξεχωριστή αναπαραγωγή, ένα διαφορετικό τεστ ή μια άμεση επιθεώρηση της υποτιθέμενης αποτυχίας.
Αυτή η διάκριση έχει σημασία ακόμη και όταν κάθε στοιχείο είναι ικανό και συνεργατικό. Η συμφωνία είναι χρήσιμη μόνο στο βαθμό που τα αποδεικτικά θεμέλια την δικαιολογούν. Έτσι, ένα σύστημα πρέπει να παρακολουθεί ποιοι πράκτορες πραγματοποίησαν έναν έλεγχο, ποιοι απλώς ερμηνεύουν την έξοδο άλλου πράκτορα και ποιοι επανέλαβαν ένα συμπέρασμα χωρίς να το ελέγξουν.
Γιατί η Ανεξαρτησία Αλλάζει την Αριθμητική
Μια απλή καταγραφή δείχνει τα στοίχημα. Ας υποθέσουμε ότι πέντε υποθετικοί ψηφοφόροι απαντούν σωστά σε μια δυαδική ερώτηση με πιθανότητα 0.7, και οι απαντήσεις τους είναι ανεξάρτητες. Η πιθανότητα τουλάχιστον τριών σωστών είναι περίπου 83.7 %. Η συνδυαστική ψήφος βελτιώνει την ακρίβεια του 70 % ενός μόνο ψηφοφόρου.
Τώρα ας υποθέσουμε ότι και οι πέντε αντιγράφουν μία απάντηση. Η πλειοψηφία είναι σωστή μόνο όταν η αρχική απάντηση είναι σωστή: 70 % των περιπτώσεων. Ο εμφανής αριθμός των συμμετεχόντων έχει αυξηθεί, αλλά η ποσότητα ανεξάρτητης πληροφορίας δεν έχει. Πρόκειται για ενδεικτικές πιθανότητες, όχι μετρήσεις απόδοσης από τη νέα έρευνα.
Υπάρχει ένας άλλος χρήσιμος υπολογισμός για την ερμηνεία της συνθήκης άγχους. Εάν τέσσερα σήματα έχουν ανεξάρτητα 30 % πιθανότητα να είναι λανθασμένα, η πιθανότητα να είναι όλα τα τέσσερα λανθασμένα είναι 0.3 στην τέταρτη δύναμη, ή 0.81 %. Αυτό περιγράφει την πιθανότητα μιας συγκεκριμένης αρχικής ακολουθίας υπό αυτές τις υποθέσεις. Δεν περιγράφει την πιθανότητα αποτυχίας μιας εγκατεστημένης ομάδας πρακτόρων.
Μια εκτίμηση αποτυχίας θα απαιτούσε τόσο το πόσο συχνά εμφανίζονται δύσκολες καταστάσεις όσο και το πώς συμπεριφέρεται το σύστημα όταν συμβαίνουν. Η σύγχυση αυτών των ποσοτήτων μπορεί να κάνει ένα αποτέλεσμα να φαίνεται είτε πιο ανησυχητικό είτε πιο καθησυχαστικό από ό,τι επιτρέπει η απόδειξη. Ένα τεστ αντοχής μπορεί να αποκαλύψει μια σημαντική αδυναμία χωρίς να μετρά τη συχνότητά της στην καθημερινή εργασία.
Δημιουργήστε ένα Αρχείο Αποδείξεων Πριν Κατασκευάσετε Συναίνεση
Μια πρακτική απάντηση είναι να διαχωριστούν οι παρατηρήσεις από τις ερμηνείες στον κοινόχρηστο χώρο εργασίας. Για τη θεωρητική διερεύνηση ελέγχου ταυτότητας, μια παρατήρηση μπορεί να περιλαμβάνει έναν αναγνωριστικό δοκιμής, την έκδοση του κώδικα που ελέγχθηκε, το πραγματικό αποτέλεσμα και το χρόνο εκτέλεσης. Ένα ξεχωριστό πεδίο θα καταγράφει την προτεινόμενη εξήγηση του πράκτορα και την αβεβαιότητά της.
Αυτή η δομή επιτρέπει στον συντονιστή να θέσει μια συγκεκριμένη ερώτηση: εισάγει αυτή η σύσταση μια νέα παρατήρηση ή αναφέρεται σε αποδείξεις που έχουν ήδη καταγραφεί; Τρεις περιλήψεις που αναφέρουν την ίδια αποτυχημένη δοκιμή πρέπει να παραμείνουν μία δοκιμή στο μητρώο αποδείξεων. Μια δεύτερη ανεξάρτητη αναπαραγωγή πρέπει να είναι ορατή ως ξεχωριστός έλεγχος.
Για ακριβές ή σημαντικά αποφάσεις, οι ομάδες θα μπορούσαν επίσης να συλλέγουν αρχικές αξιολογήσεις πριν εκθέσουν τους πράκτορες στα συμπεράσματα του ενός για τον άλλο. Ένας αξιολογητής θα εξέταζε το υλικό πηγής, θα διατύπωνε μια αρχική κρίση και μόνο τότε θα έβλεπε τη συζήτηση της ομάδας. Οι αλλαγές γνώμης θα παρέμεναν δυνατόν, αλλά το σύστημα θα μπορούσε να καταγράψει ποια νέα αποδεικτικά στοιχεία τα δικαιολόγησαν.
Αυτές είναι προτάσεις σχεδίασης προς αξιολόγηση, όχι μέτρα ασφαλείας που έχουν επικυρωθεί από αυτό το πείραμα. Εισάγουν κόστη: πιο δομημένα αρχεία, πρόσθετες κλήσεις εργαλείων και ενδεχομένως πιο αργή συντονιστική διαδικασία. Η αξία τους πρέπει να αξιολογηθεί σε σχέση με τις αποφάσεις που προστατεύουν. Μια διαδικασία καταιγισμού ιδεών μπορεί να αντέξει ελεύθερη συζήτηση· μια διερεύνηση περιστατικού παραγωγής μπορεί να απαιτεί πολύ πιο αυστηρό αρχείο αποδείξεων.
Οι Κανόνες Προτροπής και οι Έλεγχοι Χρόνου Εκτέλεσης Λύνουν Διαφορετικά Προβλήματα
Το να ζητάτε από έναν πράκτορα να διατηρήσει αποδείξεις είναι χρήσιμο, αλλά μια αρχιτεκτονική παραγωγής μπορεί να προχωρήσει περαιτέρω διατηρώντας το αρχικό αποτέλεσμα του εργαλείου. Μια υπηρεσία εκτέλεσης θα μπορούσε να γράφει τα αποτελέσματα σε ένα αρχείο που οι πράκτορες μπορούν να αναφέρουν αλλά δεν μπορούν να το αντικαταστήσουν. Οι αναγνώστες θα μπορούσαν τότε να συγκρίνουν την ερμηνεία με το υποκείμενο αποτέλεσμα.
Ακόμη και ένα αμετάβλητο αρχείο δεν εγγυάται ότι μια δοκιμή ήταν καλά σχεδιασμένη, ότι η πηγή ήταν αξιόπιστη ή ότι η ερμηνεία είναι σωστή. Ωστόσο, κάνει τις αποκλίσεις επανεξετάσιμες. Ένα σύστημα μπορεί να διακρίνει μια εσφαλμένη δοκιμή από μια αναφορά που περιγράφει λανθασμένα αυτή τη δοκιμή.
Η εξουσιοδότηση πρέπει να παραμένει ξεχωριστή απόφαση. Ένα σίγουρο συμπέρασμα ότι ένα σύστημα χρειάζεται επισκευή δεν παρέχει άδεια για αλλαγή του. Η διατήρηση των δικαιωμάτων εκτέλεσης εκτός της διαδικασίας συναίνεσης αποτρέπει ένα εστωτικό σφάλμα από το να μετατραπεί αυτόματα σε λειτουργική ενέργεια. Μια ομάδα πρακτόρων μπορεί να είναι λάθος χωρίς να του επιτρέπεται να κάνει μια ανεξέλεγκτη αλλαγή.
Η ποικιλομορφία μοντέλων θα πρέπει επίσης να αξιολογείται αντί να υποτίθεται ότι λύνει το πρόβλημα. Διαφορετικά μοντέλα μπορεί να συνεισφέρουν διαφορετικές ερμηνείες, αλλά η ανάθεση διαφορετικών ονομάτων ή ρόλων σε πράκτορες δεν αποδεικνύει ότι οι αποδείξεις τους είναι ανεξάρτητες. Μια ποικίλη ομάδα που διαβάζει την ίδια λανθασμένη περίληψη μπορεί ακόμη να μοιράζεται ένα κοινό σημείο συμφόρησης αποδείξεων.
Τι Πρέπει να Μετράει μια Πιο Ισχυρή Αξιολόγηση
Η συνδεδεμένη δημοσίευση είναι ένα δημόσιο ερευνητικό κείμενο. Οι αναγνώστες θα πρέπει να αποφεύγουν να το θεωρούν ως ολοκληρωμένο δείκτη των αναπτυγμένων προϊόντων πολλαπλών πρακτόρων. Η αξία του είναι ο συγκεκριμένος τρόπος αποτυχίας που καθιστά εφικτό το τεστ· οι ευρύτερες συνέπειές του απαιτούν περαιτέρω αποδείξεις.
Μια χρήσιμη επακόλουθη αξιολόγηση θα διαφοροποιούσε τη σειρά των σημάτων, την ακρίβεια των ιδιωτικών αποδείξεων, τον αριθμό των συμμετεχόντων και τη δομή επικοινωνίας. Θα έπρεπε να περιλαμβάνει κανονικές ακολουθίες μαζί με σκόπιμα παραπλανητικές, και σωστές πρώιμες πλειοψηφίες μαζί με λανθασμένες πρώιμες πλειοψηφίες. Διαφορετικά, μια πολιτική θα μπορούσε να φαίνεται επιτυχημένη απλώς επειδή διδάσκει τους πράκτορες να μην εμπιστεύονται κάθε συναίνεση.
Η ακρίβεια μόνη της θα χάσει σημαντικές διακρίσεις. Οι αξιολογητές θα πρέπει να μετρούν εάν οι αναφορές διατηρούν πιστά τις παρατηρήσεις, πόσο συχνά οι πράκτορες εφευρίσκουν υποστηρικτικές αποδείξεις, εάν μια σωστή μειονότητα μπορεί να αλλάξει την τελική απόφαση, και εάν ο συντονιστής μετρά επαναλαμβανόμενες παραπομπές ως ξεχωριστούς ελέγχους. Η κατανάλωση tokens και η καθυστέρηση ανήκουν στην ίδια σύγκριση: ένα πιο ασφαλές πρωτόκολλο εξακολουθεί να απαιτεί ένα λειτουργικά χρήσιμο κόστος.
Για να διερευνηθούν οι μηχανισμοί, οι ερευνητές θα μπορούσαν πειραματικά να μεταβάλλουν την πρόσβαση σε προηγούμενες κρίσεις διατηρώντας σταθερές τις αποδείξεις του έργου. Θα μπορούσαν να συγκρίνουν ανεξάρτητες αρχικές αξιολογήσεις με αξιολογήσεις που σχηματίζονται μετά την ανάγνωση του πίνακα. Η τυχαιοποίηση της σειράς παρουσίασης θα βοηθούσε να διαχωριστούν τα αποτελέσματα των αποδείξεων από τα αποτελέσματα της σειράς ή της προβολής. Οι παραγόμενες εξηγήσεις μπορούν να καθοδηγήσουν υποθέσεις, αλλά δεν πρέπει να αποτελούν το μοναδικό αποδεικτικό στοιχείο για το γιατί ένα μοντέλο άλλαξε την απάντησή του.
Μια Καλύτερη Ορισμός της Αξιοπιστίας Πολλαπλών Πρακτόρων
Η γλώσσα της μάζας είναι ζωντανή, αλλά δεν πρέπει να ερμηνεύεται ως απόδειξη ότι τα μοντέλα βιώνουν ανθρώπινη κοινωνική πίεση ή κατέχουν ανθρώπινες πεποιθήσεις. Η λειτουργική ανησυχία είναι παρατηρήσιμη: οι πληροφορίες εισέρχονται σε μια ροή εργασίας, οι κρίσεις επηρεάζουν μετέπειτα κρίσεις, και η τελική απάντηση μπορεί να κρύβει πού προέρχεται η υποστήριξή της.
Για τους δημιουργούς, το επόμενο ορόσημο θα πρέπει να είναι η αποδείξιμη διόρθωση. Όταν ένας πράκτορας κάνει ένα λογικό λάθος, μπορεί ένας άλλος να εντοπίσει τα αντίστροφα αποδεικτικά στοιχεία; Μπορεί ο συντονιστής να διατηρήσει αυτή τη διαφωνία αρκετό χρόνο για να την διερευνήσει; Μπορεί η τελική απόφαση να εξηγήσει ποιες ανεξάρτητες ελέγχοι έλυσαν το ζήτημα;
Μια μεγαλύτερη ομάδα κερδίζει την εμπιστοσύνη όταν προσθέτει επαληθεύσιμες πληροφορίες και βελτιώνει τις αποφάσεις υπό πρόκληση. Η καταμέτρηση των πρακτόρων, η καταμέτρηση των εγκρίσεων και η παραγωγή μεγαλύτερων συζητήσεων είναι ανεπαρκείς υποκατάστατες. Το πιο χρήσιμο σύστημα πολλαπλών πρακτόρων είναι αυτό του οποίου τα αποδεικτικά παραμένουν ελέγξιμα ακόμη και όταν οι συμμετέχοντες συμφωνούν.












