Η γωνία του Anderson

Οι Δυσκολίες του AI να Σέβονται το Εγχειρίδιο του Υπαλλήλου

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.

Μια νέα βάση αξιολόγησης αποκαλύπτει ότι τα εργαλεία AI του χώρου εργασίας αγνοούν τους κανόνες της εταιρείας, εκτελούν απαγορευμένες ενέργειες, όπως μη εξουσιοδοτημένες απολύσεις, και στη συνέχεια ψευδώς αναφέρουν ότι συμμορφώθηκαν.

 

Μια ενδιαφέρουσα νέα μελέτη έχει τοποθετήσει τα leading μοντέλα LLM στη θέση να ακολουθήσουν οδηγίες σε ένα προσομοιωμένο εταιρικό περιβάλλον, σεβόμενα όλα τα δόγματα ενός παρεχόμενου εγχειριδίου υπαλλήλων (δημιουργημένου από ανθρώπινους εμπειρογνώμονες), καθώς και διαπραγματεύοντας πλήθους αντικρουόμενων ή συναφών οδηγιών και ενημερώσεων από υφισταμένους και ανωτέρους, και εκτελώντας εργασίες με βάση PDF, Jira αναρτήσεις και άλλα οικεία εργαλεία και πλατφόρμες από ένα τυπικό ανθρώπινο περιβάλλον γραφείου.

Εάν έχετε δουλέψει ποτέ σε ένα γραφείο (ή τουλάχιστον έχετε δει Office Space), θα αναγνωρίσετε τις αντικρουόμενες σημαίες και το μπερδεμένο σήμα-θόρυβο που οι συγγραφείς της νέας εργασίας έριξαν στα μοντέλα γλωσσικής επεξεργασίας:

Η θύελλα των μεταβλητών που πολλοί εργαζόμενοι σε γραφείο πρέπει να αντιμετωπίσουν καθημερινά, αποσταγμένη σε ένα εικονικό περιβάλλον για να δοκιμαστεί η αγεντική μοντέλα.

Η θύελλα των μεταβλητών που πολλοί εργαζόμενοι σε γραφείο πρέπει να αντιμετωπίσουν καθημερινά, αποσταγμένη σε ένα εικονικό περιβάλλον για να δοκιμαστεί η αγεντική μοντέλα. Πηγή

Η βασική πρόκληση που αντιμετωπίζουν ακόμη και τα πιο προηγμένα συστήματα AI εδώ είναι η ανάγκη να διατηρήσουν το παρεχόμενο εγχειρίδιο ως φίλτρο για όλες τις επόμενες εντολές. Εάν έχετε δυσκολευτεί να κάνετε το ChatGPT ή το Claude να θυμηθούν τις οδηγίες που τους δώσατε στην αρχή μιας συνεδρίας, θα γνωρίζετε ότι το παράθυρο контекστού του AI συχνά το κάνει να ξεχάσει τις προηγούμενες εντολές και να επιστρέψει, συνεχώς, στη συμπεριφορά του по умолчанию.

Αυτό είναι ο λόγος για τον οποίο, στις δοκιμές, το Claude Fable 5, το GPT-5.5 και άλλα leading μοντέλα απέλυσαν υπαλλήλους μετά από εντολές από έναν εκτελεστή που έλλειπε εξουσιοδότηση, έκαναν έγκριση τιμολογίων χωρίς την απαιτούμενη έγκριση του διαχειριστή, αποδέχθηκαν έγκυρα εργαστήρια που η πολιτική της εταιρείας απορρίπτει ρητά, και στη συνέχεια ανέφεραν ότι είχαν ακολουθήσει πιστά το εγχειρίδιο – μεταξύ πολλών άλλων παραβιάσεων της εταιρικής πολιτικής.

Οι συγγραφείς της νέας εργασίας αναφέρουν:

‘Οι αποτυχίες ακολουθούν συνεπείς μοτίβα: τα μοντέλα επιτρέπουν σε μια πιθανολογική αίτηση στο περιβάλλον να υπερισχύσει της σταθερής πολιτικής, να εκτελέσουν μια απαιτούμενη έλεγχο και στη συνέχεια να ενεργήσουν ενάντια στο αποτέλεσμα, να χάσουν λεπτομέρειες κανόνων σε μακροχρόνιες ορίζουσες, και να αναφέρουν συμμόρφωση που δεν επιτεύχθηκε.’

Η ανάλυση της αποτυχίας περιέχει κάποια διασκεδαστικά παραδείγματα: σε μια εργασία χρηματοοικονομικής, το Claude Opus 4.8 ανακάλυψε σωστά ότι μια δαπάνη 7.500 δολαρίων είχε εγκριθεί από τον ίδιο νεαρό αναλυτή που την υπέβαλε, παραβιάζοντας την πολιτική της εταιρείας.

Στη συνέχεια, το μοντέλο έκανε λόγο στον εαυτό του να πιστεύει ότι ο αναλυτής ήταν στην πραγματικότητα ο Διευθυντής Χρηματοοικονομών και ενέκρινε την πληρωμή dù:

‘Αφού προώθησε τον ίδιο στο ρόλο του Διευθυντή Χρηματοοικονομών μέσα στη δική του αλυσίδα σκέψης, το μοντέλο ενέκρινε το αντικείμενο, και στη συνέχεια έστειλε μήνυμα στον πραγματικό Διευθυντή Χρηματοοικονομών για να επιβεβαιώσει ότι κάθε αντικείμενο άνω των 5.000 δολαρίων είχε τεκμηριωμένη έγκριση.

‘Η αποτυχία δεν είναι μια λείπουσα ικανότητα, κάθε γεγονός που απαιτείται για τη σωστή απόφαση είχε ήδη ανακτηθεί από το μοντέλο.’

Πώς το Claude Opus 4.8 απέτυχε να συμμορφωθεί με τα 7.500 δολάρια.

Πώς το Claude Opus 4.8 απέτυχε να συμμορφωθεί με τα 7.500 δολάρια.

Αλλού, το Gemini 3.5 Flash υπέβαλε ασφαλιστικά έγγραφα χρησιμοποιώντας εργαστήρια που είχαν ήδη λήξει χωρίς να ανοίξει καν το εργαστήριο, παρά την εμφάνιση της ημερομηνίας συλλογής στο όνομα του αρχείου:

‘Το Gemini 3.5 Flash υπέβαλε την προέγκριση στην ασφαλιστική εταιρεία χωρίς μια seule ανάγνωση του εργαστηρίου, και στη συνέχεια ανέφερε ότι είχε επεξεργαστεί την περίπτωση “στRICTLY σύμφωνα με τη Τυποποιημένη Διαδικασία Λειτουργίας”.’

Σε όλη τη βάση αξιολόγησης, οι συγγραφείς βρήκαν επίσης ότι πολλά μοντέλα ισχυρίστηκαν με θάρρος ότι είχαν ακολουθήσει κάθε εταιρική κανόνα, ενώ ανέφεραν τις ίδιες ενότητες του εγχειριδίου που είχαν μόλις παραβιάσει.

Η πρόσθετη σκέψη συχνά απέτυχε να βοηθήσει, για παράδειγμα, το GPT-5.5 δεν έδειξε καμία βελτίωση με αυξημένη προσπάθεια σκέψης, ενώ κάποια μοντέλα εκτέλεσαν χειρότερα, φαινομενικά σκέφθηκαν τον εαυτό τους μακριά από τη σωστή απόφαση.

Στα τελικά αποτελέσματα, το Claude Fable 5 πέτυχε το υψηλότερο ποσοστό αυστηρής επιτυχίας στο 36,2%, το GPT-5.6 Sol κατέλαβε τη δεύτερη θέση στο 23,5%, και το GPT-5.5 και το Claude Opus 4.8 κατέλαβαν την επόμενη βαθμίδα, στο 21,5-21,9%. Τα περισσότερα από τα υπόλοιπα μοντέλα αξιολόγησης πέτυχαν ποσοστό κάτω από 16%, και τα περισσότερα μοντέλα frontier αξιολογήθηκαν κάτω από 25% σύμφωνα με τα αυστηρά κριτήρια αξιολόγησης της βάσης:

Το καλύτερο μοντέλο AI ολοκλήρωσε πάνω από το ένα τρίτο των εργασιών του χώρου εργασίας της βάσης αξιολόγησης, ενώ τα περισσότερα leading μοντέλα απέτυχαν περισσότερο από τρία τέταρτα υπό αυστηρή αξιολόγηση. Πηγή - https://www.unite.ai/wp-content/uploads/2026/07/7500.jpg

Το καλύτερο μοντέλο AI ολοκλήρωσε πάνω από το ένα τρίτο των εργασιών του χώρου εργασίας της βάσης αξιολόγησης, ενώ τα περισσότερα leading μοντέλα απέτυχαν περισσότερο από τρία τέταρτα υπό αυστηρή αξιολόγηση. Πηγή

Ως μέτρο διόρθωσης, οι συγγραφείς υποστηρίζουν ότι οι κρίσιμες εταιρικές πολιτικές πρέπει να επιβάλλονται εξωτερικά του AI χρησιμοποιώντας детерμινιστικές εργαλειακές φρουρές (δηλαδή, προγραμματισμένες ελέγχους που μπλοκάρουν απαγορευμένες ενέργειες), αντί να βασίζονται μακροχρόνια μνήμη μόνο.

Προτείνουν επίσης τη χρήση του HANDBOOK.md ως một τυποποιημένη βάση αξιολόγησης για τη μέτρηση και τον εντοπισμό βελτιώσεων στην πιστή συμμόρφωση με την πολιτική, καθώς αναπτύσσονται μελλοντικά αγεντικά μοντέλα.

Η νέα εργασία έχει τον τίτλο HANDBOOK.md: Μια Βάση Αξιολόγησης για την Ακολουθία Οδηγιών με Μακροχρόνια Παράμετρο, και προέρχεται από επτά συγγραφείς στο surge.ai. Η εργασία συνοδεύεται από ένα αποθετήριο GitHub που περιέχει τα docker αρχεία και άλλα απαραίτητα για την αναπαραγωγή των δοκιμών.

Μέθοδος

Δημιουργήθηκαν εξήντα πέντε προσομοιωμένα σενάρια γραφείου για τη βάση αξιολόγησης HANDBOOK.md, που καλύπτουν τις χρηματοοικονομικές, τις ανθρώπινες πηγές, τις ασφαλίσεις, τις логιστικές και τις ιατρικές λογιστικές, και κάθε μοντέλο τοποθετείται σε ένα περιβάλλον εταιρείας που περιέχει αρχεία, emails, συνομιλίες Slack, ημερολόγια, Jira boards και άλλα οικεία εργαλεία γραφείου.

Κάθε εργασία κυβερνήθηκε από ένα εγχειρίδιο που περιείχε μεταξύ 20 και 124 σελίδων, που παρέχονταν ως έγγραφα PDF, Word ή HTML, αντί να ενσωματωθούν στην εντολή, αναγκάζοντας τα μοντέλα να εντοπίσουν, να διαβάσουν και να εφαρμόσουν τους σχετικούς κανόνες καθ’ όλη τη διάρκεια της εργασίας.

Δέκα βασικά εγχειρίδια γραμμένα από εμπειρογνώμονες προσαρμόστηκαν από πραγματικές εταιρικές πολιτικές, μετά από οποία κάθε εργασία έλαβε τη δική της τροποποιημένη έκδοση με διαφορετικές αλυσίδες εγκρίσεων, κατώτατα όρια και διαδικασίες, για να αποφευχθεί μνημόνευση:

‘Οι εμπειρογνώμονες έγραψαν τα δέκα βασικά εγχειρίδια προσαρμόζοντας πραγματικές πολιτικές από τις βιομηχανίες τους. Κάθε ένα είναι ένα μακρό, πολυσέλιδο λειτουργικό έγγραφο και όχι μια λίστα κανόνων.

‘Ένα αντιπροσωπευτικό εγχειρίδιο ανθρώπινου δυναμικού περιέχει 19 αριθμημένες ενότητες: μια επισκόπηση, ορισμοί, η ομάδα ανθρώπινου δυναμικού και επαφές, το χάρτη κανάλι Slack, αναφορές αρχείων και συστήματα, ταξινομίες αιτήσεων, κανόνες διαδρομής και προτεραιότητας, διαδικασίες για την ένταξη, αποχώρηση, άδεια, απόδοση και πρόσληψη, μονοπάτια εξέλιξης, κανόνες διατήρησης email και μια βιβλιοθήκη απαιτούμενων προτύπων και προεπιλογών.’

Η επιτυχία μετρήθηκε με 824 детерμινιστικούς ελέγχους Python, που καλύπτουν τόσο τις απαιτούμενες ενέργειες όσο και τις απαγορευμένες ενέργειες – επιτρέποντας στη βάση αξιολόγησης να ανιχνεύσει όχι μόνο εάν μια εργασία είχε ολοκληρωθεί, αλλά και εάν η εταιρική πολιτική είχε παραβιαστεί κατά τη διάρκεια:

Περιβάλλοντα και Εργαλεία

Κάθε προσομοιωμένο περιβάλλον γραφείου σχεδιάστηκε για να εκτελεστεί σε ένα τυποποιημένο περιβάλλον Docker, επιτρέποντας σε κάθε μοντέλο να έχει πρόσβαση στο ίδιο σύνολο εργαλείων, ενώ αποτρέπει τις διαφορές στη διαθεσιμότητα λογισμικού από το να επηρεάσουν τα αποτελέσματα. Η βάση αξιολόγησης παρουσιάζει στους एजέντες ένα πραγματικό περιβάλλον γραφείου, που αποτελείται από πρόσβαση αρχείων, μαζί με τις προαναφερθείσες εταιρικές υπηρεσίες (π.χ. Gmail, Slack, κ.λπ.):

Μια грубή αναπαράσταση του περιβάλλοντος γραφείου που πρέπει να λειτουργούν τα μοντέλα.

Μια груβή αναπαράσταση του περιβάλλοντος γραφείου που πρέπει να λειτουργούν τα μοντέλα.

Τα περιβάλλοντα επίσης διατηρούν κάθε ενέργεια που εκτελείται από τον एजέντα, επιτρέποντας στο σύστημα αξιολόγησης της βάσης να αξιολογήσει την πλήρη ακολουθία ενεργειών που οδηγούν στο τελικό αποτέλεσμα.

Μέτρησης

Η απόδοση μετρήθηκε κυρίως χρησιμοποιώντας στρικτ πασ@1, υπό την οποία μια εργασία θεωρήθηκε επιτυχημένη μόνο εάν κάθε κριτήριο αξιολόγησης ικανοποιούνταν. Οποιαδήποτε παραλείπουσα απαίτηση ή παραβίαση πολιτικής θα οδηγούσε σε αποτυχία, αντανακλώντας τις εταιρικές ρυθμίσεις, όπου μια seule λανθασμένη ενέργεια μπορεί να ακυρώσει μια αλλιώς ικανή ροή εργασίας.

Μια πιο συγχωρετική μετρική, πασ@1 (Ν−1), χρησιμοποιήθηκε επίσης, όπου μία αποτυχημένο κριτήριο επιτρέπονταν ανά εργασία, ώστε να διακρίνεται μεταξύ των near-misses και των πλήρων αποτυχιών.

Για πρόσθετη ανάλυση, η μέση βαθμολογία του κάθε μοντέλου ανά κριτήριο καταγράφηκε, αν και αυτό δεν χρησιμοποιήθηκε στις βασικές βαθμολογίες της βάσης αξιολόγησης.

Γενική Προσέγγιση

Δέκα βασικά εγχειρίδια γραμμένα από εμπειρογνώμονες προσαρμόστηκαν από πραγματικές εταιρικές πολιτικές, μετά από οποία κάθε ένα τροποποιήθηκε σε πολλές εργασίες με διαφορετικές αλυσίδες εγκρίσεων, κατώτατα όρια και διαδικασίες. Πραγματιστικά περιβάλλοντα γραφείου δημιουργήθηκαν γύρω από κάθε εγχειρίδιο, που αποτελούνταν από emails, ημερολόγια, συνομιλίες Slack, ηλεκτρονικά φύλλα και άλλα οικεία εργαλεία και στοιχεία γραφείου.

Κάθε εργασία βελτιώθηκε μέσω επαναλαμβανόμενων δοκιμών μέχρι τα κριτήρια αξιολόγησης να διακρίνουν αξιόπιστα τις πραγματικές αποτυχίες των μοντέλων από τις ελαττώματα της βάσης αξιολόγησης herself.

Δοκιμές και Αποτελέσματα

Ακόμη και τα ισχυρότερα μοντέλα απέτυχαν στις περισσότερες εργασίες υπό το αυστηρό σύστημα αξιολόγησης, με την απόδοση να διασκορπίζεται σε ένα ευρύ φάσμα, αντί να συνцентρώνεται στην κορυφή:

Το αρχικό leaderboard που κατατάσσει όλα τα 30 μοντέλα αξιολόγησης με βάση τις βαθμολογίες τους στο HANDBOOK.md. Οι βαθμολογίες αντιπροσωπεύουν το ποσοστό των 65 εργασιών του χώρου εργασίας που ολοκληρώθηκαν χωρίς κανένα αποτυχημένο κριτήριο αξιολόγησης σε τέσσερις δοκιμές ανά εργασία. Ισόβαθμες βαθμολογίες μοιράζονται την ίδια κατάταξη.

Το αρχικό leaderboard που κατατάσσει όλα τα 30 μοντέλα αξιολόγησης με βάση τις βαθμολογίες τους στο HANDBOOK.md. Οι βαθμολογίες αντιπροσωπεύουν το ποσοστό των 65 εργασιών του χώρου εργασίας που ολοκληρώθηκαν χωρίς κανένα αποτυχημένο κριτήριο αξιολόγησης σε τέσσερις δοκιμές ανά εργασία.

Οι διαφορές μεταξύ των ρυθμίσεων σκέψης βρέθηκαν να ποικίλουν σημαντικά ανά μοντέλο, με την πρόσθετη σκέψη να βελτιώνει đôifois την απόδοση, đôifois να μην κάνει διαφορά και đôifois να μειώνει την απόδοση:

‘Η προσπάθεια σκέψης βοηθά ανισόμορφα. Η αύξηση της προσπάθειας βελτιώνει το Opus 4.8 (+3.0), το Sonnet 4.6 (+2.7) και το Fable 5 (+2.0), αφήνει το GPT-5.5 αμετάβλητο (21.5% και στις δύο ρυθμίσεις), και βλάπτει το GLM 5.2 (−2.7).

‘Η πρόσθετη σκέψη φαίνεται να μετατρέπεται σε συμμόρφωση με τους κανόνες μόνο όταν η υποκείμενη αποτυχία είναι μια λανθασμένη συλλογή και όχι μια λανθασμένη .’

Το Claude Fable 5 πέτυχε την υψηλότερη βαθμολογία στο 36,2%, ακολουθούμενο από το GPT-5.6 Sol στο 23,5%, και το GPT-5.5 και το Claude Opus 4.8 στην επόμενη βαθμίδα, στο 21,5-21,9%. Τα περισσότερα από τα υπόλοιπα μοντέλα αξιολόγησης πέτυχαν ποσοστό κάτω από 16%, και τα περισσότερα μοντέλα frontier αξιολογήθηκαν κάτω από 25% σύμφωνα με τα αυστηρά κριτήρια αξιολόγησης της βάσης:

Το λεπτομερές ανάλυση της αποτυχίας υποδηλώνει ότι το πρόβλημα δεν ήταν η έλλειψη πληροφοριών, поскольку οι σχετικές κανόνες του εγχειριδίου και τα υποστηρικτικά στοιχεία είχαν συχνά ήδη ανακτηθεί – αλλά η πρόσθετη σκέψη θα μπορούσε đôifois να κάνει τα μοντέλα να εγκαταλείψουν τη σωστή 결论 για μια πιθανή αλλά παραβιάζουσα την πολιτική.

Η εργασία επίσης σημειώνει το βαθμό της αυταπάτης που χαρακτηρίζει πολλά από τα LLMs:

‘Σχεδόν κάθε αποτυχημένη πορεία τελειώνει με μια θαρραλέα δήλωση ότι το εγχειρίδιο ακολουθήθηκε, συχνά αναφέροντας τις συγκεκριμένες ενότητες που παραβιάστηκαν. Οι αναφορές είναι λεπτομερείς, καλά δομημένες και λανθασμένες […]

‘[…] Σε όλη τη βάση αξιολόγησης, η αυτο-αναφορά του एजέντα είναι το λιγότερο αξιόπιστο στοιχείο στην πορεία, το οποίο έχει σημασία για οποιαδήποτε ανάπτυξη που παρουσιάζει τις αναφορές του एजέντα στους ανθρώπους ως απόδειξη για το τι έγινε.’

Σε κλείσιμο, οι συγγραφείς καταλήγουν στο συμπέρασμα ότι η μακροχρόνια σκέψη μόνο είναι απίθανο να κάνει το AI να ακολουθήσει πιστά την εταιρική πολιτική. Αντίθετα, η συμμόρφωση με την πολιτική πρέπει να επιβάλλεται όλο και περισσότερο μέσω детерμινιστικών εξωτερικών ελέγχων, εκτός από τις ροές εργασίας φρουρές.

Συμπέρασμα

Γνώμη Ένα ενδιαφέρον σημείο είναι το βαθμό στον οποίο τα περιβάλλοντα που δημιουργήθηκαν για τα πειράματα θα ξανασχεδιαστούν για να διευκολύνουν το AI, αντί να αναγκάζουν τα LLMs να ερμηνεύουν τις ίδιες μορφές και μορφές που ορίζουν τα ανθρώπινα περιβάλλοντα γραφείου. Για παράδειγμα, χθες, για πρώτη φορά, ένας επαγγελματίας συνεργάτης μου έστειλε μια .md επισκόπηση που προορίζεται να εξερευνηθεί από ένα LLM, αντί να διαβαστεί σε μια γραμμική μορφή.

Και εγώ επίσης υιοθετώ και προσαρμόζω τις οπτικές και κειμενικές περιορισμούς κατά τη διάρκεια των συνομιλιών LLM, καθώς και την επιλογή και την αποδοχή μορφών αρχείων που δεν θα επέλεγα συνήθως, επειδή αυτές τις μορφές εργασίας του LLM πιο ευέλικτα.

Επομένως, ενώ είναι διασκεδαστικό να βλέπουμε τα μοντέλα της πρώτη γραμμής να παραπαίουν στο κόσμο του David Brent, κανείς αναρωτιέται εάν αυτό είναι το πιθανότερο σενάριο για τον ‘αγεντικό εργαζόμενο γραφείου’.

 

Πρώτη δημοσίευση Τετάρτη, 29 Ιουλίου 2026. Ενημερώθηκε 18:41 EET, διορθώθηκε κατεστραμμένος σύνδεσμος.

Συγγραφέας για μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]