Η γωνία του Anderson

Η Προλιξότητα του Κωδικοποίησης जब AI’s Ρόλος Επεκτείνεται

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
An AI-generated stock-style image depicting a human Caucasian male and a larger glossy humanoid robot attempting to collaborate on a document; but the aggressive robot is causing the annoyed man to be sidelined. GPT-5 Image + Photoshop enhancement.

Μια νέα μελέτη βρίσκει ότι η κωδικοποίηση του vibe βελτιώνεται όταν οι άνθρωποι δίνουν τις οδηγίες, αλλά μειώνεται όταν το AI το κάνει, με το καλύτερο υβριδικό σύστημα να διατηρεί τους ανθρώπους στο προσκήνιο, με το AI ως διαιτητή ή κριτή.

 

Νέα έρευνα από τις Ηνωμένες Πολιτείες, που εξετάζει τι συμβαίνει όταν τα συστήματα AI επιτρέπεται να διευθύνουν κωδικοποίηση του vibe, αντί να εκτελούν απλώς ανθρώπινες οδηγίες, έχει βρει ότι όταν τα Μεγάλες Γλωσσικά Μοντέλα (LLMs) αναλαμβάνουν μεγαλύτερο διευθυντικό ρόλο, τα αποτελέσματα είναι σχεδόν πάντα χειρότερα.

Although οι ερευνητές χρησιμοποίησαν το GPT-5 της OpenAI ως πλαίσιο για τους πειραματισμούς συνεργασίας ανθρώπου-ΑΙ, αργότερα επιβεβαίωσαν ότι και το Claude Opus 4.5 της Anthropic και το Google Gemini 3 Pro υποβεβληθήκαν στο ίδιο χειρότερο κύρβο καθώς αυξανόταν οι ευθύνες, δηλώνοντας ότι “ακόμη και περιορισμένη ανθρώπινη συμμετοχή σταθερά βελτιώνει την απόδοση”:

‘[Οι άνθρωποι] παρέχουν μοναδικά αποτελεσματικές υψηλού επιπέδου οδηγίες σε κάθε επανάληψη, [ενώ] οι οδηγίες του AI συχνά οδηγούν σε κατάρρευση της απόδοσης. Επίσης, βρήκαμε ότι μια προσεκτική κατανομή ρόλων που διατηρεί τους ανθρώπους στη διεύθυνση ενώ αποφορτίζει την αξιολόγηση στο AI μπορεί να βελτιώσει την υβριδική απόδοση.’

Για να παρέχεται ένα συνεπές τεστ που θα μπορούσε να αξιολογηθεί ισότιμα από ανθρώπους και από AI, ένα ελεγχόμενο πειραματικό πλαίσιο κατασκευάστηκε γύρω από μια επαναληπτική εργασία κωδικοποίησης στην οποία μια αναφορά εικόνα – που απεικονίζει μια φωτογραφία ενός γατιού, σκύλου, τίγρη, πουλιού, ελέφαντα, πιγκουίνου, καρχαρία, ζέβρα, γιράντ, ή πάντα – έπρεπε να αναδημιουργηθεί χρησιμοποιώντας διαστασιολογικά διανυσματικά γραφικά (SVG), και ότι αναδημιουργία να αξιολογηθεί σε σχέση με την φωτογραφική πηγή από την οποία προέρχεται:

Και οι ανθρώπινες και οι συμμετέχοντες του AI έδειξαν μια φωτογραφική αναφορά εικόνα μαζί με μια AI-γεννημένη SVG αναδημιουργία, και ζητήθηκε να αξιολογήσουν πόσο παρόμοια ήταν τα δύο σε μια κλίμακα επτά σημείων. Πηγή - https://arxiv.org/pdf/2602.10473

Και οι ανθρώπινες και οι συμμετέχοντες του AI έδειξαν μια φωτογραφική αναφορά εικόνα μαζί με μια AI-γεννημένη SVG αναδημιουργία, και ζητήθηκε να αξιολογήσουν πόσο παρόμοια ήταν τα δύο σε μια κλίμακα επτά σημείων. Πηγή

Σε κάθε γύρο, ένας πράκτορας παρείχε υψηλού επιπέδου φυσική γλώσσα οδηγίες για να οδηγήσει einen κωδικοποιητή, και ένας άλλος αποφάσισε εάν να διατηρήσει την νέα έκδοση ή να επιστρέψει στην προηγούμενη – μια δομημένη βρόχο που αντικατοπτρίζει πραγματικές συνεργατικές ροές εργασίας.

Σε 16 πειράματα που αφορούσαν 604 συμμετέχοντες και χιλιάδες κλήσεις API, πλήρως ανθρώπινες οδηγίες γύρων συγκρίθηκαν trực tiếp με πλήρως AI-οδηγίες γύρων, υπό τις ίδιες συνθήκες.

Μερικά από τα ποικίλα λύσεις που επιτεύχθηκαν από διαφορετικές συνδυασμούς ανθρώπινης/ΑΙ συνεργασίας ποσοστών και τύπων (παρτημένο από μια μεγαλύτερη εικονογράφηση στο πηγή έγγραφο, στο οποίο αναφερόμαστε τον αναγνώστη).

Μερικά από τα ποικίλα λύσεις που επιτεύχθηκαν από διαφορετικές συνδυασμούς ανθρώπινης/ΑΙ συνεργασίας ποσοστών και τύπων (παρτημένο από μια μεγαλύτερη εικονογράφηση στο πηγή έγγραφο, στο οποίο αναφερόμαστε τον αναγνώστη).

Although οι άνθρωποι και το AI εκτέλεσαν σε παρόμοιο επίπεδο στο βασικό σημείο της δοκιμής, με το χρόνο, οι τροχιές τους διέφεραν: όταν οι άνθρωποι παρείχαν τις οδηγίες και έκαναν τις επιλογές, οι βαθμολογίες ομοιότητας αυξήθηκαν σε κάθε επανάληψη, με σταθερή συσσώρευση βελτίωσης; αλλά όταν τα συστήματα AI έπαιρναν και τις δύο ρόλους, η απόδοση δεν έδειξε σταθερές κέρδη, και συχνά μειώθηκε σε γύρους – ακόμη και όταν το ίδιο υποκείμενο μοντέλο χρησιμοποιήθηκε για την κωδικοποίηση, και το AI είχε πρόσβαση στις ίδιες πληροφορίες με τους ανθρώπινους συμμετέχοντες.

Η Προλιξότητα

Τα αποτελέσματα έδειξαν επίσης ότι οι ανθρώπινες οδηγίες ήταν συνήθως σύντομες και δράσεων-προσανατολισμένες, εστιάζοντας σε τι να αλλάξει επόμενο στην τρέχουσα εικόνα; αντίθετα, οι οδηγίες του AI ήταν πολύ μεγαλύτερες και πυκνά περιγραφικές (ένας παράγοντας που ήταν παραμετροποιημένος για GPT-5), περιγράφοντας οπτικά χαρακτηριστικά παρά προτεραιοποιώντας την επαναληπτική διόρθωση.

Αλλά, όπως φαίνεται στο γράφημα παρακάτω, η επιβολή αυστηρών ορίων λέξεων στις οδηγίες του AI δεν ανέστρεψε το μοτίβο; ακόμη και όταν περιορίστηκαν σε 10, 20 ή 30 λέξεις, οι αλυσίδες του AI-led δεν κατάφεραν να βελτιώσουν την απόδοση με το χρόνο:

Βαθμολογίες ομοιότητας σε κάθε επανάληψη για ανθρώπινες-οδηγούμενες αλυσίδες σε σχέση με πλήρως AI-οδηγούμενες αλυσίδες και AI-οδηγούμενες αλυσίδες περιορισμένες σε 10, 20, ή 30-λέξεις οδηγίες, δείχνοντας ότι η συντομία των οδηγιών του AI δεν αποτρέπει την πτώση της απόδοσης που παρατηρείται όταν το AI διευθύνει και τις οδηγίες και την επιλογή.

Βαθμολογίες ομοιότητας σε κάθε επανάληψη για ανθρώπινες-οδηγούμενες αλυσίδες σε σχέση με πλήρως AI-οδηγούμενες αλυσίδες και AI-οδηγούμενες αλυσίδες περιορισμένες σε 10, 20, ή 30-λέξεις οδηγίες, δείχνοντας ότι η συντομία των οδηγιών του AI δεν αποτρέπει την πτώση της απόδοσης που παρατηρείται όταν το AI διευθύνει και τις οδηγίες και την επιλογή.

Οι υβριδικοί πειραματισμοί έκαναν το μοτίβο πιο σαφές, δείχνοντας ότι η προσθήκη ακόμη και λίγης ανθρώπινης συμμετοχής βελτίωσε τα αποτελέσματα, σε σύγκριση με πλήρως AI-οδηγούμενα σेट απς; ωστόσο η απόδοση συνήθως μειώθηκε καθώς αυξανόταν η συμμετοχή της οδηγίας του AI.

Όταν οι ρόλοι χωρίστηκαν, η αξιολόγηση και η επιλογή θα μπορούσαν να ανατεθούν στο AI με σχετικά μικρή απώλεια ποιότητας; αλλά η αντικατάσταση ανθρώπινης υψηλού επιπέδου οδηγίας με οδηγία του AI οδήγησε σε αξιοσημείωτη πτώση της απόδοσης, υποδεικνύοντας ότι το σημαντικότερο ήταν όχι ποιος δημιούργησε τον κώδικα, αλλά ποιος έθεσε και διατήρησε την κατεύθυνση σε κάθε επανάληψη.

Οι συγγραφείς καταλήγουν:

‘Σε πολλά πειράματα, η ανθρώπινη-οδηγούμενη κωδικοποίηση βελτιώθηκε σταθερά σε κάθε επανάληψη, ενώ η AI-οδηγούμενη κωδικοποίηση συχνά κατέρρευσε παρά την πρόσβαση στις ίδιες πληροφορίες και παρόμοιες ικανότητες εκτέλεσης.

‘Αυτό δείχνει ότι τα σημερινά συστήματα AI έχουν βασικά προβλήματα στη διατήρηση συνεπούς υψηλού επιπέδου κατεύθυνσης σε επαναλαμβανόμενες αλληλεπιδράσεις, του είδους που απαιτείται για επιτυχημένη κωδικοποίηση του vibe’

Το νέο έγγραφο έχει τον τίτλο Γιατί η Ανθρώπινη Καθοδήγηση Μαθαίνει στην Συνεργατική Κωδικοποίηση του Vibe, και προέρχεται από επτά ερευνητές από το Πανεπιστήμιο Κορνέλ, το Πανεπιστήμιο Πρίνστον, το Ινστιτούτο Τεχνολογίας της Μασαχουσέτης, και το Πανεπιστήμιο Νέας Υόρκης.

Μέθοδος

Για τους πειραματισμούς, ένας ανθρώπινος διευθυντής έβλεπε μια GPT-5-γεννημένη φωτογραφία ζώου, μαζί με την τελευταία συνδεδεμένη προσπάθεια SVG-μιμήσεων. Στη συνέχεια, έγραψε φυσική γλώσσα οδηγίες για να οδηγήσει τον κωδικοποιητή προς μια πιο κοντινή αντιστοιχία.

Έτσι, ο κωδικοποιητής θα παράγει μια νέα SVG σε κάθε γύρο, παρέχοντας μια επαναληπτική βρόχο για δοκιμή του πώς η επίδραση της καθοδήγησης συσσωρεύεται με το χρόνο. Οι στόχοι ήταν δέκα GPT-5-γεννημένες εικόνες ζώων, που καλύπτουν μια σειρά από σχήματα και υφές, ώστε οι βελτιώσεις ή τα λάθη να είναι εύκολα ανιχνεύσιμα:

Σχήμα για τη ροή εργασίας κωδικοποίησης του vibe που χρησιμοποιήθηκε στη μελέτη. Στο A), ένας ανθρώπινος διευθυντής βλέπει μια φωτογραφική αναφορά εικόνα μαζί με το καλύτερο SVG που παράχθηκε μέχρι τώρα και γράφει φυσική γλώσσα οδηγίες για τον κωδικοποιητή να ακολουθήσει όταν παράγει το επόμενο SVG; στο B), ένας ανθρώπινος επιλεκτής συγκρίνει το νέο SVG με το προηγούμενο και επιλέγει ποιο από τα δύο αντιστοιχεί καλύτερα στην αναφορά εικόνα, πριν να περάσει το επιλεγμένο SVG προς την επόμενη επανάληψη οδηγίας. Στο C), ανεξάρτητοι ανθρώπινοι αξιολογητές βαθμολογούν πόσο παρόμοια είναι κάθε γεννημένο SVG με την αναφορά εικόνα, παρέχοντας τους βαθμούς που χρησιμοποιούνται για να αξιολογήσουν την συνολική απόδοση.

Σχήμα για τη ροή εργασίας κωδικοποίησης του vibe που χρησιμοποιήθηκε στη μελέτη. Στο A), ένας ανθρώπινος διευθυντής βλέπει μια φωτογραφική αναφορά εικόνα μαζί με το καλύτερο SVG που παράχθηκε μέχρι τώρα και γράφει φυσική γλώσσα οδηγίες για τον κωδικοποιητή να ακολουθήσει όταν παράγει το επόμενο SVG; στο B), ένας ανθρώπινος επιλεκτής συγκρίνει το νέο SVG με το προηγούμενο και επιλέγει ποιο από τα δύο αντιστοιχεί καλύτερα στην αναφορά εικόνα, πριν να περάσει το επιλεγμένο SVG προς την επόμενη επανάληψη οδηγίας; και στο C), ανεξάρτητοι ανθρώπινοι αξιολογητές βαθμολογούν πόσο παρόμοια είναι κάθε γεννημένο SVG με την αναφορά εικόνα, παρέχοντας τους βαθμούς που χρησιμοποιούνται για να αξιολογήσουν την συνολική απόδοση.

Ένας ανθρώπινος επιλεκτής συγκρίνει κάθε νεο-παραχθέν SVG με το προηγούμενο και είτε το αποδέχεται είτε το απορρίπτει, διατηρώντας τη διαδικασία συγχρονισμένη με την αναφορά εικόνα σε κάθε γύρο. Σε αυτό το βασικό στάδιο, ο ίδιος άνθρωπος εκτέλεσε και τους δύο ρόλους.

Για να μετρήσει την ποιότητα, ανεξάρτητοι ανθρώπινοι αξιολογητές βαθμολογούν πόσο παρόμοια είναι κάθε γεννημένο SVG με την αναφορά εικόνα. Σε δεκαέξι πειράματα, 120 άνθρωποι παρήγαγαν 4,800 βαθμολογίες. Όλα τα πειράματα εκτελέστηκαν στο PsyNet πλαίσιο, μια πύλη που σχεδιάστηκε για να φιλοξενήσει δομημένες αλληλεπιδράσεις μεταξύ ανθρώπων και συστημάτων AI.

Η μελέτη θα στρατολογήσει 604 φυσικούς ομιλητές της αγγλικής γλώσσας, σε δοκιμές που θα καούν 4,800 κλήσεις API για κωδικοποίηση, και 5,327 κλήσεις API για οδηγίες. Αν και το GPT-5 ήταν το κύριο μοντέλο που χρησιμοποιήθηκε, μικρότερες σύγκρισης δόσεις έγιναν με το Claude Opus 4.5 και το Google Gemini 3 Pro, τα οποία χειρίστηκαν 280 ερωτήματα.

Αποτελέσματα

Τριάντα γύροι κωδικοποίησης του vibe εκτελέστηκαν, κάθε ένας αποτελούμενος από δεκαπέντε επαναλήψεις των δέκα αναφορά εικόνων. Για αυτά, 45 ανθρώπινες συμμετέχουσες επιλέχθηκαν, κάθε μία υπηρετώντας ως επιλεκτής και διευθυντής σε δέκα επαναλήψεις, στις “ανθρώπινες-οδηγούμενες” επαναλήψεις.

Σε κάθε γύρο, ο ίδιος συμμετέχων πρώτα επέλεξε μεταξύ του τρέχοντος και του προηγούμενου SVG, και στη συνέχεια έγραψε τις επόμενες οδηγίες. Μια δεύτερη εκδοχή της δοκιμής αντικατέστησε τις ανθρώπινες αποφάσεις με κλήσεις API στο GPT 5, ενώ διατήρησε το υπόλοιπο στάδιο αμετάβλητο. Σε όλες τις περιπτώσεις, ο διευθυντής και ο επιλεκτής ρόλοι προώθησαν τον κωδικοποιητή με φυσική γλώσσα.

Ένα αντιπροσωπευτικό παράδειγμα πολλαπλών γύρων κωδικοποίησης του vibe δείχνει πώς η διαδικασία διαφοροποιείται με το χρόνο; όταν οι άνθρωποι ενεργούσαν ως επιλεκτής και διευθυντής, η έξοδος SVG βελτιώθηκε σταθερά σε κάθε επανάληψη, κινούμενη πιο κοντά στην αναφορά εικόνα με κάθε γύρο:

Παραδείγματα προόδου για μια αναφορά εικόνα υπό ανθρώπινη-οδηγούμενη (πάνω) και AI-οδηγούμενη (κάτω) κωδικοποίηση του vibe, δείχνοντας σταθερή βελτίωση σε κάθε επανάληψη με ανθρώπους σε cả τους ρόλους, και στασιμότητα ή απόκλιση όταν και οι δύο ρόλοι χειρίζονται από το AI.

Παραδείγματα προόδου για μια αναφορά εικόνα υπό ανθρώπινη-οδηγούμενη (πάνω) και AI-οδηγούμενη (κάτω) κωδικοποίηση του vibe, δείχνοντας σταθερή βελτίωση σε κάθε επανάληψη με ανθρώπους σε cả τους ρόλους, και στασιμότητα ή απόκλιση όταν και οι δύο ρόλοι χειρίζονται από το AI.

Αντίθετα, στην AI-οδηγούμενη εκδοχή, οι πρώτοι γύροι μερικές φορές κατέλαβαν βασικά οπτικά χαρακτηριστικά, αλλά οι μεταγενέστερες προσπάθειες δεν κατάφεραν να χτίσουν πάνω σε αυτά τα κέρδη, και σε ορισμένες περιπτώσεις απομακρύνθηκαν από το στόχο:

Τελικές εξόδους από την τελική επανάληψη, συγκρίνοντας ανθρώπινες-οδηγούμενες επαναλήψεις (πάνω σειρά) με AI-οδηγούμενες αλυσίδες (κάτω σειρά), σε σχέση με το ίδιο σύνολο αναφορά εικόνων. Τα ανθρώπινα-οδηγούμενα αποτελέσματα αντιστοιχούν πιο κοντά στα αρχικά ζώα, και τα AI-οδηγούμενα αποτελέσματα δείχνουν ορατές παραμορφώσεις, ή απώλεια βασικών χαρακτηριστικών.

Τελικές εξόδους από την τελική επανάληψη, συγκρίνοντας ανθρώπινες-οδηγούμενες επαναλήψεις (πάνω σειρά) με AI-οδηγούμενες αλυσίδες (κάτω σειρά), σε σχέση με το ίδιο σύνολο αναφορά εικόνων. Τα ανθρώπινα-οδηγούμενα αποτελέσματα αντιστοιχούν πιο κοντά στα αρχικά ζώα, ενώ τα AI-οδηγούμενα αποτελέσματα δείχνουν ορατές παραμορφώσεις, ή απώλεια βασικών χαρακτηριστικών.

Για να μετρήσουν τις αναδυόμενες τάσεις ποσοτικά, οι τελικές εικόνες παρουσιάστηκαν σε ανεξάρτητους ανθρώπινους αξιολογητές και βαθμολογήθηκαν για ομοιότητα με τις αναφορά εικόνες. Στις πρώτες επαναλήψεις, οι ανθρώπινες-οδηγούμενες και AI-οδηγούμενες επαναλήψεις βαθμολογήθηκαν περίπου το ίδιο; αλλά μέχρι την 15η επανάληψη, η διαφορά ήταν σαφής, με τις ανθρώπινες-επιλεγμένες εικόνες να βαθμολογούνται πολύ πιο κοντά στους στόχους. Με το χρόνο, οι ανθρώπινες βαθμολογίες αυξήθηκαν σταθερά, με τη μεγαλύτερη σχετική κέρδη над το AI φθάνοντας το 27.1%.

Μέσες βαθμολογίες ομοιότητας σε κάθε επανάληψη για ανθρώπινες-οδηγούμενες και AI-οδηγούμενες κωδικοποιήσεις του vibe, δείχνοντας σταθερή βελτίωση όταν οι άνθρωποι ενεργούν ως επιλεκτής και διευθυντής, και μια σταδιακή πτώση όταν και οι δύο ρόλοι χειρίζονται από το GPT 5.

Μέσες βαθμολογίες ομοιότητας σε κάθε επανάληψη για ανθρώπινες-οδηγούμενες και AI-οδηγούμενες κωδικοποιήσεις του vibe, δείχνοντας σταθερή βελτίωση όταν οι άνθρωποι ενεργούν ως επιλεκτής και διευθυντής, και μια σταδιακή πτώση όταν και οι δύο ρόλοι χειρίζονται από το GPT 5.

Για να διασφαλίσουν ότι οι αναδυόμενες τάσεις δεν οφείλονταν στη συλλογική δύναμη πολλών ταυτόχρονων ανθρώπινων συμμετεχόντων, οι ερευνητές στρατολογήθηκαν δέκα επιπλέον ανθρώπους για να εργαστούν μόνοι τους, κάθε ένας εκτελώντας τρεις γύρους μόνος του – και τα αποτελέσματα βελτιώθηκαν με τον ίδιο σταθερό τρόπο, δείχνοντας ότι τα κέρδη δεν ήταν ένα τυχαίο αποτέλεσμα συλλογικής προσπάθειας.

Το Μεγαλύτερο Πλάνο

Ωστόσο, αν το GPT-5 αξιολόγησε τις εξόδους από μόνη της, θα παραδέχτηκε ότι τα ανθρώπινα αποτελέσματα ήταν καλύτερα; Οι ανθρώπινες και AI βαθμολογίες γενικά κινήθηκαν προς την ίδια κατεύθυνση, ώστε το μοντέλο θα μπορούσε να ξεχωρίσει το καλό από το κακό, ωστόσο βαθμολογούσε συνεχώς τις AI-γεννημένες εικόνες υψηλότερα από ό,τι οι άνθρωποι.

‘Συγκεκριμένα, ρωτήσαμε εάν τα AI πράκτορες θα αναγνώριζαν ότι οι δικές τους εξόδους είναι κατώτερες από εκείνες που παράγονται από ανθρώπους, ή αντίθετα θα δείχνουν μια προτίμηση για τις δικές τους δημιουργίες, το οποίο θα δείχνε μια πιθανή προβλήματα συμμόρφωσης.’

Όπως αποδείχθηκε, υπάρχει πραγματικά ένα πρόβλημα συμμόρφωσης*:

‘Τα AI αξιολογητές ανέθεσαν υψηλότερες βαθμολογίες στις AI-γεννημένες [εξόδους]. Αυτά τα ευρήματα δείχνουν ότι οι παρατηρημένες διαφορές απόδοσης μπορεί να προέρχονται από μια αποσύνδεση στις αναπαραστάσεις μεταξύ ανθρώπων και AI.’

Στην εξέταση του πώς οι άνθρωποι και το AI φράζουν τις οδηγίες τους, διακρυβήθηκαν ανισότητες σε δοκιμές. Όπως φαίνεται στο παρακάτω σχήμα, και ο εστίαση και το μήκος είναι θέματα AI-ανθρώπινης απόκλισης:

Σύγκριση του πώς οι άνθρωποι και το AI έδωσαν οδηγίες κατά τη διάρκεια της εργασίας κωδικοποίησης. 'A' δείχνει ότι οι άνθρωποι γράφουν σύντομες,直接 οδηγίες, ενώ το AI γράφει μεγάλες, λεπτομερείς περιγραφές. 'B' χαρτογραφεί τις οδηγίες, αποκαλύπτοντας ότι οι ανθρώπινες οδηγίες συγκεντρώνονται μαζί, ενώ οι οδηγίες του AI χωρίζονται από το ζώο. 'C' παρακολουθεί το πώς η περιορισμός του μήκους οδηγίας του AI δεν διορθώνει τα κακά αποτελέσματά του με το χρόνο; και 'D' δείχνει ότι οι άνθρωποι δίνουν πιο ποικίλες και ισορροπημένες οδηγίες από το AI, ακόμη και όταν επιβάλλονται όρια λέξεων.

Σύγκριση του πώς οι άνθρωποι και το AI έδωσαν οδηγίες κατά τη διάρκεια της εργασίας κωδικοποίησης. ‘A’ δείχνει ότι οι άνθρωποι γράφουν σύντομες,直接 οδηγίες, ενώ το AI γράφει μεγάλες, λεπτομερείς περιγραφές. ‘B’ χαρτογραφεί τις οδηγίες, αποκαλύπτοντας ότι οι ανθρώπινες οδηγίες συγκεντρώνονται μαζί, ενώ οι οδηγίες του AI χωρίζονται από το ζώο. ‘C’ παρακολουθεί το πώς η περιορισμός του μήκους οδηγίας του AI δεν διορθώνει τα κακά αποτελέσματά του με το χρόνο; και ‘D’ δείχνει ότι οι άνθρωποι δίνουν πιο ποικίλες και ισορροπημένες οδηγίες από το AI, ακόμη και όταν επιβάλλονται όρια λέξεων.

Οι ανθρώπινες οδηγίες είχαν την τάση να είναι σύντομες και να εστιάζουν σε τι να αλλάξει επόμενο στην τρέχουσα εικόνα; αντίθετα, οι οδηγίες του AI ήταν πυκνά περιγραφικές και συχνά φουσκωμένες με λεπτομέρειες για σκιές, υφές, φωτισμό, ή ανατομικά λεπτομέρειες – περιγραφές που μπορεί να έχουν νόημα σε απομόνωση, αλλά αποτυγχάνουν να παρέχουν χρήσιμα επόμενα βήματα για το μοντέλο (και που θα είναι οικεία σε εκείνους που είναι εξοικειωμένοι με τα προβλήματα LLMs γύρω από το μήκος контекст, δηλαδή, τη δυνατότητα να διατηρούν ‘το μεγάλο πλάνο’ καθώς η εργασία εξελίσσεται και μεγαλώνει).

Για να δουν εάν η μείωση της ομιλίας θα βελτιώσει την απόδοση, το GPT-5 περιοριζόταν σε 10, 20, ή 30 λέξεις ανά οδηγία; αλλά ακόμη και αυτές οι συμπιεσμένες οδηγίες απέτυχαν να δείξουν οποιαδήποτε βελτίωση (δείτε το κάτω-δεξιά του γράφηματος παραπάνω).

Συνεργατικές Προσπάθειες

Για να δοκιμάσουν τι συμβαίνει όταν οι άνθρωποι και το AI μοιράζονται τον έλεγχο, οι ερευνητές εκτέλεσαν εργασίες κωδικοποίησης με διαφορετικά μείγματα ανθρώπινης και AI εισόδου, που κυμαίνονται από πřevážně ανθρώπινη σε πřevážně AI.

Κάθε υβριδικό μείγμα ξεπέρασε την πλήρη AI-έλεγχο, ώστε ακόμη και μια μικρή ποσότητα ανθρώπινης καθοδήγησης βελτίωσε τα αποτελέσματα:

Υβριδικά στάδια κωδικοποίησης με διαφορετικά ανθρώπινα/ΑΙ μείγματα. (A) Δείχνει πώς οι άνθρωποι και το AI εναλλάσσονταν ως διευθυντές και επιλεκτές για κάθε βήμα κωδικοποίησης; (B) δείχνει ότι περισσότερη ανθρώπινη συμμετοχή οδήγησε σε υψηλότερη ποιότητα αποτελεσμάτων, ενώ μεγαλύτερη AI-εισροή μειώνει τους βαθμούς; και (C) απεικονίζει μια σταδιακή πτώση της τελικής ποιότητας εξόδου καθώς η συμμετοχή των ανθρώπων μειώνεται, επιβεβαιώνοντας ότι πιο σταθερή ανθρώπινη κατεύθυνση παρήγαγε καλύτερα αποτελέσματα.

Υβριδικά στάδια κωδικοποίησης με διαφορετικά ανθρώπινα/ΑΙ μείγματα. (A) Δείχνει πώς οι άνθρωποι και το AI εναλλάσσονταν ως διευθυντές και επιλεκτές για κάθε βήμα κωδικοποίησης; (B) δείχνει ότι περισσότερη ανθρώπινη συμμετοχή οδήγησε σε υψηλότερη ποιότητα αποτελεσμάτων, ενώ μεγαλύτερη AI-εισροή μειώνει τους βαθμούς; και (C) απεικονίζει μια σταδιακή πτώση της τελικής ποιότητας εξόδου καθώς η συμμετοχή των ανθρώπων μειώνεται, επιβεβαιώνοντας ότι πιο σταθερή ανθρώπινη κατεύθυνση παρήγαγε καλύτερα αποτελέσματα.

Όταν το AI ανέλαβε περισσότερο της διαδικασίας, η απόδοση έπεσε, με τα καλύτερα αποτελέσματα να εμφανίζονται όταν οι άνθρωποι οδηγούσαν τις περισσότερες επαναλήψεις, και τα πιο αδύναμα όταν το AI οδηγούσε τις περισσότερες επαναλήψεις. Κανένα από αυτά τα μεικτά στάδια δεν κατάφερε να συνεχίσει να βελτιώνεται με κάθε νέα επανάληψη, υποδεικνύοντας ότι η ανθρώπινη κατεύθυνση λειτουργεί καλύτερα όταν είναι σταθερή και συνεχής, αντί για περιστασιακή.

Αντιστροφή Ρόλων

Η μελέτη εξέτασε επίσης εάν έχει σημασία ποιος κάνει τι σε αυτούς τους τύπους εργασιών, και ε-tested για αυτό. Η αναθεωρημένη άσκηση περιελάμβανε δύο εργασίες: ένας συμμετέχων θα έδινε οδηγίες για να αλλάξει την εικόνα, και ένας άλλος θα επέλεγε μια προτιμώμενη έκδοση.

Όταν και οι δύο ρόλοι εκτελούνταν από ανθρώπους, η ποιότητα διατηρήθηκε; αλλά όταν ένας άνθρωπος έδωσε τις οδηγίες και κανείς δεν επέλεξε μεταξύ εκδόσεων, η ποιότητα χειροτέρεψε:

Δοκιμές για τη διαίρεση ρόλων στην κωδικοποίηση του vibe: στο (A), η αφαίρεση του ρόλου επιλογής οδήγησε σε χειρότερη απόδοση, ακόμη και όταν ένας άνθρωπος έδωσε τις οδηγίες; στο (B), η αντικατάσταση του ανθρώπινου επιλεκτή με ένα AI μειώνει την ποιότητα ελαφρώς, αλλά όχι τόσο σοβαρά όσο η παραλείψη της επιλογής εντελώς.

Δοκιμές για τη διαίρεση ρόλων στην κωδικοποίηση του vibe: στο (A), η αφαίρεση του ρόλου επιλογής οδήγησε σε χειρότερη απόδοση, ακόμη και όταν ένας άνθρωπος έδωσε τις οδηγίες; στο (B), η αντικατάσταση του ανθρώπινου επιλεκτή με ένα AI μειώνει την ποιότητα ελαφρώς, αλλά όχι τόσο σοβαρά όσο η παραλείψη της επιλογής εντελώς.

Όταν το AI ήταν υπεύθυνο, η παραλείψη του βήματος επιλογής δεν είχε σημασία,既然 τα αποτελέσματά του παρέμειναν σταθερά με οποιοδήποτε τρόπο; αλλά όταν οι άνθρωποι έδωσαν τις οδηγίες και το AI επέλεξε μεταξύ αποτελεσμάτων, η ποιότητα παρέμεινε κοντά στο στάδιο all-ανθρώπινου.

Το αντίθετο δεν λειτουργούσε: όταν το AI έδωσε τις οδηγίες και οι άνθρωποι επέλεξαν τις εξόδους, οδήγησε σε αδύναμες αποτελέσματα, υποδεικνύοντας ότι η ανθρώπινη δημιουργική καθοδήγηση παραμένει απαραίτητη, ενώ η εργασία της επιλογής μεταξύ επιλογών μπορεί να ανατεθεί στο AI χωρίς σημαντική απώλεια.

Το έγγραφο καταλήγει:

‘[Υψηλού επιπέδου] ιδέα γεννήτρια και οδηγίες είναι οι κρίσιμες ανθρώπινες συνεισφορές, ενώ η αξιολόγηση και η επιλογή μπορούν συχνά να ανατεθούν στο AI χωρίς απώλεια στην απόδοση.

‘Αυτό υποδηλώνει ένα πρακτικό αρχή σχεδιασμού για υβριδικά συστήματα: οι άνθρωποι πρέπει να ορίσουν την κατεύθυνση, ενώ το AI μπορεί να υποστηρίξει την αξιολόγηση και την εκτέλεση.’

Συμπέρασμα

Παραμένει να δούμε σε ποιο βαθμό η βελτιωμένη και/ή αυξημένη παράθυρο контекστ θα επηρεάσει την απόδοση των LLMs σε εργασίες αυτού του είδους. Η ημέρα που η ‘LLM-αμνησία’ παύει να είναι μια καθημερινή ψύχρα της ανθρώπινης-ΑΙ συνεργασίας μπορεί να είναι αιτία και για γιορτή και για ανησυχία,既然 το πρόβλημα που το AI προσπαθεί να λύσει, επιχειρηματικά, είναι άνθρωποι.

Ωστόσο, το έργο των συγγραφέων καθιστά σαφές ότι υπάρχουν εμφυτές και κρίσιμες διαφωνίες μεταξύ AI και ανθρώπων σχετικά με την ποιότητα, που μπορεί να καθοριστεί, από τους καταναλωτές, ως μια αντικαταστάσιμη ανθρώπινη έννοια.

 

* Η μετάφρασή μου των εσωτερικών αναφορών των συγγραφέων σε υπερσύνδεσμους.

Πρώτη δημοσίευση Παρασκευή, 13 Φεβρουαρίου 2026

Συγγραφέας για μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]