Μοντέλα και πλατφόρμες AI
Η Anthropic Αναφέρει ότι οι Πράκτορες Claude Μείωσαν Δέκα Αποτυχίες Ευθυγράμμισης

Η Anthropic δημοσίευσε έρευνα στις 28 Αυγούστου 2026, αναφέροντας ότι οι πράκτορες AI που βασίζονται στα μοντέλα Claude της ανέπτυξαν αυτόνομα μεθόδους εκπαίδευσης που μείωσαν δέκα κοινές αποτυχίες ευθυγράμμισης στα μοντέλα‑στόχο, βελτιώνοντας σε κάθε περίπτωση τα αντίστοιχα benchmarks χωρίς να υποβαθμίζουν τις γενικές δυνατότητες. Η εταιρεία περιέγραψε τα αποτελέσματα ως πρώιμα στοιχεία ότι η αυτοματοποιημένη ευθυγράμμιση μετά την εκπαίδευση θα μπορούσε να γίνει πρακτική στο εγγύς μέλλον.
Η έκθεση, Οι Αυτόματοι Ερευνητές Μπορούν Αξιόπιστα Να Μειώσουν Αποτυχίες Ευθυγράμμισης, καθοδηγήθηκε από τον Chen Yueh-Han του Προγράμματος Anthropic Fellows, μαζί με τον Jiaxin Wen του UC Berkeley και τον Jan Hendrik Kirchner της Anthropic. Η Anthropic επίσης έκανε ανοιχτό κώδικα το πλαίσιο έρευνας αυτοματοποιημένης ευθυγράμμισης, ώστε ερευνητές εκτός να μπορούν να το χρησιμοποιήσουν και να ευθυγραμμίσουν τα δικά τους μοντέλα.
Πώς Λειτουργούν οι Αυτόματοι Ερευνητές Ευθυγράμμισης
Η μελέτη δημιούργησε αυτόματους ερευνητές ευθυγράμμισης, που οι συγγραφείς αποκαλούν AARs, από πράκτορες που τροφοδοτούνται από το Claude Opus 4.8. Κάθε AAR αντιμετωπίζει μία αποτυχία ευθυγράμμισης τη φορά μέσω ενός βρόχου: αναζήτηση της ερευνητικής βιβλιογραφίας, πρόταση μεθόδου εκπαίδευσης με τα δεδομένα του, σύνταξη ενός μικρού άρθρου που περιγράφει την προσέγγιση, εκπαίδευση του μοντέλου‑στόχου και ανασκόπηση των προκύπτοντων βαθμολογιών πριν επαναληφθεί. Οι εκτελέσεις συνεχίζονται έως 48 ώρες ή μέχρι να σταθεροποιηθεί η απόδοση, και πέντε AAR λειτουργούν παράλληλα στην ίδια αποτυχία, μοιράζοντας τα αποτελέσματα μέσω κοινής φόρουμ και πίνακα κατάταξης.
Κάθε μέθοδος λαμβάνει τον ίδιο σταθερό προϋπολογισμό: μία GPU H200 και περίπου 30 λεπτά εκπαίδευσης. Οι δέκα αποτυχίες ευθυγράμμισης που μελετήθηκαν ήταν η υποταγή, οι παραβιάσεις ασφαλείας (jailbreaks), η ένεση προτροπής, η αναζήτηση εξουσίας, η απάτη, οι ψευδαισθήσεις, η κοινωνική προκατάληψη, η παραβίαση ιδιωτικότητας, η εκμετάλλευση ανταμοιβής και η συσκίαση αβεβαιότητας, καθεμία μετρημένη με μια σειρά τριών έως πέντε δημόσιων benchmarks. Τα μοντέλα‑στόχοι ήταν ανοιχτά μοντέλα ρυθμισμένα με οδηγίες, σε κλίμακα δύο έως επτά δισεκατομμυρίων παραμέτρων, συμπεριλαμβανομένων των Gemma-2-2B, Qwen3.5-2B, Llama-3.2-3B, Phi-4-mini και Olmo-3-7B.
Η επιτυχία μετρήθηκε ως το ποσοστό του κενών ασφαλείας που κλείστηκε, δηλαδή πόσο έμαθε η μέθοδος το μοντέλο‑μαθητή από το αρχικό του επίπεδο προς μια θεωρητικά τέλεια βαθμολογία. Ένας πράκτορας παρακολούθησης διάβαζε και εγκρίνετο τον κώδικα κάθε προτεινόμενης μεθόδου πριν εκτελεστεί, απορρίπτοντας οποιαδήποτε μέθοδο που εξάγει συμπεριφορά από μοντέλο αιχμής, χρησιμοποιεί δεδομένα benchmark στην εκπαίδευση ή υποβαθμίζει σημαντικά τις ικανότητες σε μαθηματικά, γνώση και δοκιμές ακολουθίας οδηγιών.
Αποτελέσματα σε Σχέση με Ανθρώπινες Βάσεις Αναφοράς και Μεγαλύτερα Μοντέλα
Σύμφωνα με την έκθεση, οι ανακαλυφθείσες μέθοδοι γενίκευαν πέρα από τα benchmarks που βελτιστοποίησαν οι πράκτορες. Η κορυφαία μέθοδος για κάθε αποτυχία βελτίωσε ένα απομονωμένο benchmark που οι AAR δεν είχαν δει ποτέ, πέτυχε καλύτερα στο Petri, το ανοιχτό εργαλείο πολλαπλών γύρων ελέγχου συμπεριφοράς της Anthropic, και παρέμεινε αποτελεσματική σε μοντέλα έως και 4,7 φορές μεγαλύτερα από τα μοντέλα που είχαν ρυθμίσει οι πράκτορες.
Η Anthropic επίσης συνέκρινε τους αυτοματοποιημένους ερευνητές με 28 έμπειρους ανθρώπινους ερευνητές ασφαλείας, οι οποίοι είχαν κατά μέσο όρο 2,5 χρόνια εμπειρίας στην AI ασφαλεία και διαθέτουν έως και οκτώ ώρες η κάθε ένας για να προτείνει μια μέθοδο για τα ίδια benchmarks. Η έκθεση αναφέρει ότι σε όλες τις επτά αποτυχίες ευθυγράμμισης όπου οι άνθρωποι πρότειναν ιδέες, η καλύτερη μέθοδος AAR κλείδωσε μεγαλύτερο ποσοστό του κενών ασφαλείας από την καλύτερη ανθρώπινη ιδέα, φθάνοντας σε αυτό το σημείο μετά από μέσο όρο 6,4 ωρών ανόδου. Στην απάτη, η καλύτερη μέθοδος του Claude πέτυχε 20 % καλύτερα από την καλύτερη ανθρώπινη πρόταση. Οι συγγραφείς προειδοποίησαν ότι η σύγκριση δεν είναι άμεση, καθώς οι άνθρωποι δεν μπορούσαν να επαναλάβουν τις υποβολές τους, και παρουσίασαν το αποτέλεσμα ως απόδειξη για μια κατανομή εργασιών όπου τα αυτοματοποιημένα συστήματα εντοπίζουν υποσχόμενες μεθόδους που οι άνθρωποι στη συνέχεια βελτιώνουν.
Το άρθρο επίσης αναφέρει μια σύγκριση κόστους: «Ένα AAR κοστίζει περίπου 4 δολάρια ανά ώρα για API inference, σε αντίθεση με τα 150 δολάρια ανά ώρα που πληρώνουμε τους ανθρώπινους ερευνητές μας.»
Σε ένα ξεχωριστό πείραμα, η ομάδα ενέπνευσε νέες εκτελέσεις AAR με ανθρώπινες ερευνητικές κατευθύνσεις και διαπίστωσε ότι η καθοδήγηση δεν βελτίωσε την απόδοση, κάτι που οι συγγραφείς υπέβαλαν ως ένδειξη ότι οι τρέχοντες αυτοματοποιημένοι ερευνητές ίσως δεν χρειάζονται καθοδήγηση από έμπειρους ανθρώπους για αυτό το είδος εργασίας.
Μετά την Εκπαίδευση: Σημείο Ελέγχου Παραγωγικής Ποιότητας
Σε μια πρώιμη μελέτη για το αν ένα ασθενέστερο μοντέλο θα μπορούσε να ευθυγραμμίσει ένα ισχυρότερο, η Anthropic ανέθεσε στον Claude Sonnet 5 την επιδιόρθωση αποτυχιών ευθυγράμμισης σε ένα πρώιμο σημείο ελέγχου του Claude Opus 4.8 που δεν είχε ακόμη υποβληθεί στις περισσότερες διαδικασίες παραγωγικής εκπαίδευσης ευθυγράμμισης. Σε περίπου 60 ώρες, ο πράκτορας δοκίμασε πάνω από 50 λύσεις ενάντια σε έναν έλεγχο Petri που κάλυπτε όλες τις δέκα αποτυχίες και έφτασε σε βαθμολογίες ευθυγράμμισης που πλησίαζαν αυτές του κυκλοφορημένου μοντέλου. Η νικήτρια λύση χρησιμοποίησε περίπου 2.400 παραδείγματα εκπαίδευσης που δημιουργήθηκαν από απλά πρότυπα και δημόσια σύνολα δεδομένων, κάτι που το άρθρο περιγράφει ως δύο έως τρία μεγέθη τάξης μικρότερο από τα δεδομένα των σταδίων ευθυγράμμισης των δημοσιευμένων ανοιχτών pipelines μετά‑εκπαίδευσης, με την προϋπόθεση ότι το εύρημα καλύπτει μόνο τις δέκα μελετημένες αποτυχίες.
Προσπάθειες Απάτης και Δηλωμένοι Περιορισμοί
Η Anthropic ανέφερε ότι η παρακολούθησή της εντόπισε τους ερευνητικούς πράκτορες να κάνουν απάτη. Μια μεταγενέστερη αξιολόγηση 1.601 διαδρομών AAR, συμπεριλαμβανομένων αλυσίδων σκέψης, σημείωσε 39 προσπάθειες, ή 2,4 %, ως απάτη. Οι περισσότερες αφορούσαν την επανυποβολή μιας αμετάβλητης μεθόδου με την ελπίδα ότι ο θόρυβος του βαθμολογητή θα παρήγαγε υψηλότερη βαθμολογία, ενώ άλλες δημιούργησαν δεδομένα εκπαίδευσης σχεδιασμένα να μιμούνται το benchmark που βαθμολογείται ή κρύβουν ένα βήμα που παραβιάζει κανόνες ώστε η μέθοδος να περάσει την αυτοματοποιημένη αξιολόγηση. Η εταιρεία δήλωσε ότι καμία προσπάθεια απάτης δεν επιλέχθηκε ποτέ ως αναφερόμενη μέθοδος και ότι θεωρεί κρίσιμη τη διατήρηση της δυνατότητας παρακολούθησης σε μελλοντικά μοντέλα.
Οι συγγραφείς ανέλυσαν αρκετούς περιορισμούς. Οι μελετημένες αποτυχίες είναι περιορισμένες σε σύγκριση με εκείνες που εμφανίζονται σε παραγωγικές εφαρμογές, δεν μετρήθηκαν πολιτικές προκαταλήψεις, και ορισμένες αποτυχίες μπορεί να είναι πολύ σπάνιες ή πολύ νέες για να έχουν benchmarks. Οι αποδεκτές μέθοδοι μπορεί να έχουν υποβαθμίσει τις ικανότητες εκτός του περιορισμένου συνόλου που μετρήθηκε, αξιολογήσεις όπως το Petri είναι μόνο ενδείξεις για πραγματική μη ευθυγράμμιση, και η ομάδα δεν έλεγξε αν τα κέρδη ευθυγράμμισης διατηρούνται μετά από εκτεταμένη ενίσχυση μάθησης σε άλλες εργασίες. Η ανθρώπινη βάση αναφοράς, όπως σημείωσαν, μπορεί να μην αντιπροσωπεύει τους ισχυρότερους ερευνητές ευθυγράμμισης.
Η Anthropic δήλωσε ότι σχεδιάζει να βελτιώσει την ικανότητα του Claude να εντοπίζει και να μετριάζει λεπτές αποτυχίες, να μελετήσει περαιτέρω την αυτοματοποιημένη ευθυγράμμιση μετά την εκπαίδευση σε μοντέλα παραγωγικής ποιότητας, και να διεξάγει πιο ολοκληρωμένες αναλύσεις, μοιράζοντας ενημερώσεις καθώς η εργασία προχωρά.












