Η γωνία του Anderson

Ανθρώπινος Κώδικας από το 2020 Νίκησε τους Vibe-Coded Agents σε Αγωνιστικές Δοκιμές

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google
AI-generated image: a Victorian coach and horses winning formula 1 against modern race car competitors. gpt-image-1.

Το ChatGPT και άλλα εργαλεία vibe coding δοκιμάστηκαν σε σχεδόν 40.000 αγώνες και έχασαν από κώδικα μεταπτυχιακών φοιτητών που είχε γραφτεί πριν από τα Μεγάλα Γλωσσικά Μοντέλα.Νέα βρετανική μελέτη συνέκρινε πράκτορες γραμμένους από ανθρώπους με πράκτορες vibe-coded που δημιουργήθηκαν με τα νεότερα Μεγάλα Γλωσσικά Μοντέλα όπως GPT-5 και Claude. Οι πράκτορες χωρίς AI κέρδισαν εύκολα. Τις δύο ομάδες δημιούργησαν διαφορετικές γενιές φοιτητών του εργαστηρίου AI της EPFL. Οι παλιοί πράκτορες ήταν εργασία του 2020, δύο χρόνια πριν το ChatGPT, ενώ οι νέοι δημιουργήθηκαν με τα καλύτερα σύγχρονα LLM. Παρά τα πλεονεκτήματα που δόθηκαν στην AI, οι λύσεις vibe coding δεν νίκησαν: τις πέντε πρώτες θέσεις πήραν άνθρωποι και 33 από 40 πράκτορες LLM έχασαν από πολύ απλές βασικές στρατηγικές σε 38.304 αναμετρήσεις. Η μελέτη αναφέρει:

«Παρότι τα σύγχρονα LLM παράγουν κώδικα που εκτελείται χωρίς συντακτικά σφάλματα, η λύση δεν ανταγωνίζεται τον ανθρώπινο σχεδιασμό σε στρατηγικό σχεδιασμό, βελτιστοποίηση ή ανταγωνισμό πολλών πρακτόρων.»

«Η εργασία αναδεικνύει ένα νέο όριο στη δημιουργία κώδικα και επιδιώκει benchmark, σύνολα δεδομένων και ανοικτές βάσεις που απαιτούν σύνθεση κώδικα με συλλογισμό.»

Η πρόκληση απαιτούσε δημιουργική συμμετοχή σε δημοπρασίες και σχεδιασμό της εφοδιαστικής για τις εργασίες που κερδήθηκαν. Τα LLM έλαβαν πλεονεκτήματα, όπως διορθώσεις κώδικα που δεν επιτρέπονταν στους πράκτορες του 2020. Ακόμη και όταν τους δόθηκε καλή διορθωτική λύση, δεν μπόρεσαν να τη χρησιμοποιήσουν:

«Ακόμη όταν παρουσιάζουμε μια καλή λύση μέσα στο πλαίσιο, το LLM δεν μπορεί να την αξιοποιήσει.»

«Το αποτέλεσμα θέτει ερωτήματα για τα όρια της μάθησης εντός πλαισίου και της επίλυσης σύνθετων προβλημάτων με ανάκτηση πληροφοριών.»

Δοκιμάστηκαν τα GPT-5 Thinking, Gemini 2.5 Pro, Claude Opus 4.1 και DeepSeek R1*. Η νέα εργασία τιτλοφορείται Can Vibe Coding Beat Graduate CS Students? An LLM vs. Human Coding Tournament on Market-driven Strategic Planning και προέρχεται από ερευνητές των University of Southampton, University of Oxford και Alan Turing Institute. Το benchmark θα δημοσιευτεί σύντομα.

Μέθοδος

Οι συνηθισμένες δοκιμές χρησιμοποιούν δυαδικά αποτελέσματα — σωστό ή λάθος — που επαληθεύονται με δοκιμές μονάδας. Οι συγγραφείς σχεδίασαν μια ανοικτή, πολυσταδιακή πρόκληση όπου η νίκη είναι δυνατή αλλά δύσκολη.Σύγκριση τυπικών δοκιμών μονάδας με το ανοικτό σενάριο των συγγραφέων Σύγκριση τυπικών προσεγγίσεων βάσει δοκιμών μονάδας και της πιο ανοικτής πρόκλησης. ΠηγήΤο Auction, Pickup and Delivery Problem (APDP) επιλέχθηκε επειδή υπήρχε σώμα φοιτητικού κώδικα του 2020, πριν η AI βοηθά την ανάπτυξη. Οι σημερινοί φοιτητές έλαβαν την ίδια εργασία με σύγχρονα εργαλεία. Αποφεύχθηκαν benchmark όπως HumanEval, BigCodeBench και WebDev Arena λόγω μόλυνσης δεδομένων, όπου το σύστημα μπορεί να έχει εκπαιδευτεί στα δεδομένα δοκιμής αντί να τηρήσει τον διαχωρισμό.Αντίστροφες δημοπρασίες και δρομολόγηση οχημάτων συνθέτουν το APDP. Πρώτα οι πράκτορες προσφέρουν τιμή για παραδόσεις: πολύ υψηλή προσφορά χάνει, πολύ χαμηλή μπορεί να φέρει ζημία. Έπειτα σχεδιάζουν μόνο τις κερδισμένες εργασίες με οχήματα διαφορετικής χωρητικότητας και κόστους, υπό περιορισμούς χρόνου και πόρων.Στο APDP οι εταιρείες διεκδικούν παραδόσεις και βελτιστοποιούν διαδρομές για μέγιστο κέρδος. Οι εταιρείες υποβάλλουν προσφορές σε αντίστροφες δημοπρασίες και βελτιστοποιούν τις διαδρομές των εργασιών που κερδίζουν.Στόχος είναι το μέγιστο κέρδος, προβλέποντας κατάλληλα πακέτα εργασιών και στρατηγικές αντιπάλων. Κάθε δημοπρασία αλλάζει τις επόμενες επιλογές, άρα απαιτεί συλλογισμό για κόστος, θέση, χρόνο και μακροπρόθεσμες συνέπειες. Το κεντρικό πρόβλημα είναι NP-hard: όσο αυξάνονται οι εργασίες, κανένας αλγόριθμος δεν βρίσκει αξιόπιστα τη βέλτιστη λύση σε εύλογο χρόνο.

Η κούρσα αρχίζει

Η αξιολόγηση συνέκρινε 40 πράκτορες LLM με 17 ανθρώπινους σε 12 τουρνουά και τέσσερις οδικές τοπολογίες με σύστημα όλοι εναντίον όλων. Κάθε ζεύγος έπαιξε δύο φορές, για 3.192 αγώνες ανά τουρνουά και 38.304 συνολικά. Κάθε αγώνας δημοπρατούσε 50 παραδόσεις σε χάρτες Ελβετίας, Γαλλίας, Βρετανίας και Ολλανδίας.Απλοποιημένα οδικά δίκτυα Βρετανίας, Ελβετίας, Ολλανδίας και Γαλλίας, με εργασίες και θέσεις οχημάτων. Τα οδικά δίκτυα του τουρνουά και οι σημάνσεις εργασιών και οχημάτων.Οι φοιτητικοί πράκτορες προήλθαν από τουρνουά μαθήματος του 2020: οκτώ φιναλίστ και τέσσερις ακόμη ισχυροί απέναντι στις βάσεις. Οι βασικοί πράκτορες ακολουθούσαν σταθερές ευρετικές. Το Naive υπολόγιζε συνολική απόσταση με ένα όχημα· το ExpCostFixedBid προσομοίωνε δέκα εργασίες και πρόσφερε το μέσο οριακό κόστος· το Honest υπολόγιζε το πραγματικό κόστος εισαγωγής· το ModelOpponent πρόσθετε εκτίμηση κόστους αντιπάλου· και το RiskSeeking συνδύαζε μια χρονικά φθίνουσα πρότερη εκτίμηση με ζωντανό κόστος και μοντέλο αντιπάλου. Οι 40 πράκτορες LLM δημιουργήθηκαν με GPT-5 Thinking, Claude Opus 4.1, Gemini 2.5 Pro και DeepSeek R1, με πέντε στρατηγικές προτροπής δύο φορές ανά μοντέλο. Δύο ήταν στατικές, μία ζητούσε αυτοκριτική, μία κριτική από άλλο LLM και η τελευταία συντέθηκε από GPT-4. Η βασική προτροπή αντέγραφε την αρχική φοιτητική εργασία. Τα LLM δοκίμαζαν και διόρθωναν τους πράκτορες ώσπου να εξαφανιστούν τα ορατά σφάλματα. Συνήθεις αποτυχίες ήταν τα χρονικά όρια, η μη παραλαβή ή παράδοση εργασιών και οι παραβιάσεις χωρητικότητας, συχνά από αγνόηση οδηγιών ή εσφαλμένο επανασχεδιασμό†:

«Συχνό πρόβλημα, κυρίως στα Gemini, Claude και DeepSeek, ήταν η επαναλαμβανόμενη αποτυχία επίλυσης ενός σφάλματος.»

«Ένας πράκτορας συνέχιζε να υπερβαίνει το χρονικό όριο παρά 5–15 κύκλους παροχής του σφάλματος και λήψης ενημερωμένου κώδικα.»

«Η μόνη λύση ήταν η επανεκκίνηση από την αρχή. Χρειάστηκε σημαντική χειροκίνητη προσπάθεια και δημιουργήσαμε πολύ περισσότερους πράκτορες για να βρούμε 40 χωρίς σφάλματα.»

Ο πίνακας συνοψίζει τα 12 διπλά τουρνουά, σχεδόν 40.000 αγώνες:

Πράκτορας Μ.Ο. νικών / τουρνουά SD νικών / τουρνουά Μ.Ο. ηττών / τουρνουά SD ηττών / τουρνουά Συνολικές νίκες Συνολικές ήττες Ποσοστό νίκης
Student 1 108.167 1.193 3.833 1.193 1298 46 0.9658
Student 2 104.917 2.539 7.083 2.539 1259 85 0.9368
Student 3 103.917 2.466 8.083 2.466 1247 97 0.9278
Student 4 103.25 1.815 8.75 1.815 1239 105 0.9219
Student 5 96.5 2.908 15.5 2.908 1158 186 0.8616
LLM(O, IR, 1) 95.417 2.314 16.583 2.314 1145 199 0.8519
LLM(O, A2, 1) 94.583 2.314 17.417 2.314 1135 209 0.8445
Student 6 93.167 1.899 18.833 1.899 1118 226 0.8318
Student 7 93.167 3.563 18.833 3.563 1118 226 0.8318
LLM(O, A1, 1) 86.083 3.029 25.917 3.029 1033 311 0.7686
LLM(O, GEN, 2) 84.083 6.947 27.917 6.947 1009 335 0.7507
LLM(O, CR, 2) 83.5 4.442 28.5 4.442 1002 342 0.7455
Student 8 83.417 4.122 28.583 4.122 1001 343 0.7448
RiskSeeking 82.417 3.343 29.583 3.343 989 355 0.7359
LLM(O, GEN, 1) 80.667 4.355 31.25 4.372 968 375 0.7208
ModelOpponent 80.583 3.26 31.417 3.26 967 377 0.7195
LLM(D, A1, 1) 79.417 3.965 32.583 3.965 953 391 0.7091
ExpCostFixedBid 77.167 4.951 34.833 4.951 926 418 0.689
LLM(O, IR, 2) 73.917 3.502 38 3.618 887 456 0.6605
LLM(O, A1, 2) 72.417 2.193 39.583 2.193 869 475 0.6466
LLM(G, A1, 2) 68.5 3.555 43.5 3.555 822 522 0.6116
LLM(A, GEN, 2) 67.917 2.968 44.083 2.968 815 529 0.6064
LLM(G, IR, 2) 65.917 2.314 46.083 2.314 791 553 0.5885
Student 9 64.167 11.044 47.833 11.044 770 574 0.5729
LLM(G, A1, 1) 64 4.243 47.917 4.316 768 575 0.5719
LLM(G, IR, 1) 60.333 3.725 51.667 3.725 724 620 0.5387
LLM(O, A2, 2) 59.333 4.499 52.667 4.499 712 632 0.5298
LLM(D, CR, 1) 55.083 6.694 56.833 6.59 661 682 0.4922
LLM(G, GEN, 2) 53.167 3.664 58.833 3.664 638 706 0.4747
LLM(D, GEN, 2) 52.083 9.06 59.917 9.06 625 719 0.465
Honest 50.583 3.848 61.417 3.848 607 737 0.4516
Student 10 48.833 2.98 63.167 2.98 586 758 0.436
LLM(D, IR, 1) 48.583 10.211 63.417 10.211 583 761 0.4338
LLM(A, A1, 1) 48 4.69 64 4.69 576 768 0.4286
LLM(G, A2, 1) 47.25 3.864 64.75 3.864 567 777 0.4219
LLM(A, CR, 1) 43.833 4.609 68.167 4.609 526 818 0.3914
LLM(A, A1, 2) 43.75 2.05 68.25 2.05 525 819 0.3906
Student 11 42.083 5.664 69.917 5.664 505 839 0.3757
LLM(A, IR, 1) 39.5 2.541 72.5 2.541 474 870 0.3527
Naive 36.75 1.712 75.25 1.712 441 903 0.3281
Student 12 36.333 1.775 75.667 1.775 436 908 0.3244
LLM(D, A2, 1) 33.917 2.193 78.083 2.193 407 937 0.3028
LLM(A, GEN, 1) 30.167 1.749 81.833 1.749 362 982 0.2693
LLM(D, A2, 2) 29.833 2.038 82.167 2.038 358 986 0.2664
LLM(G, A2, 2) 27 2.256 85 2.256 324 1020 0.2411
LLM(A, A2, 1) 26.333 0.985 85.667 0.985 316 1028 0.2351
LLM(O, CR, 1) 25 3.411 87 3.411 300 1044 0.2232
LLM(A, IR, 2) 24.333 8.542 87.667 8.542 292 1052 0.2173
LLM(A, A2, 2) 24 1.809 88 1.809 288 1056 0.2143
LLM(A, CR, 2) 23.333 1.557 88.667 1.557 280 1064 0.2083
LLM(D, GEN, 1) 22.5 1.784 89.5 1.784 270 1074 0.2009
LLM(D, A1, 2) 13.333 1.826 98.667 1.826 160 1184 0.119
LLM(G, CR, 1) 9.5 1.087 102.5 1.087 114 1230 0.0848
LLM(G, GEN, 1) 9.167 0.937 102.833 0.937 110 1234 0.0818
LLM(D, IR, 2) 7.75 0.622 104.25 0.622 93 1251 0.0692
LLM(G, CR, 2) 7.25 1.422 104.75 1.422 87 1257 0.0647
LLM(D, CR, 2) 5.667 0.985 106.333 0.985 68 1276 0.0506

Κάθε πράκτορας έπαιξε 112 αγώνες ανά τουρνουά. Η τυπική απόκλιση (SD) δείχνει τη μεταβλητότητα. Οι ανθρώπινοι πράκτορες εμφανίζονται με έντονα. Οι πράκτορες LLM σημειώνονται με μοντέλο (O = GPT-5 Thinking, G = Gemini 2.5 Pro, A = Claude Opus 4.1, D = DeepSeek R1), κωδικό στρατηγικής και αριθμό πρώτης ή δεύτερης δημιουργίας. ΠηγήΓια τα αποτελέσματα οι συγγραφείς δηλώνουν†:

«Τα LLM δεν παρήγαγαν αναμενόμενο ή ανταγωνιστικό κώδικα ακόμη και σε απλούστερες παραλλαγές APDP, παρότι ο κώδικας ήταν κυρίως χωρίς συντακτικά σφάλματα. Χρειαζόμαστε benchmark συλλογισμού πέρα από την αυτόματη συμπλήρωση.»

«Οι ανθρώπινοι πράκτορες υπερείχαν καθαρά: οι πέντε πρώτες θέσεις ανήκαν σταθερά σε φοιτητές και 33 από 40 πράκτορες LLM ηττήθηκαν από πολύ απλές βάσεις.»

«Δεν διορθώσαμε τον φοιτητικό κώδικα, αλλά δοκιμάσαμε και διορθώσαμε εξονυχιστικά τον κώδικα LLM. Κάθε κατάρρευση φοιτητή έδινε αυτόματα τη νίκη στο LLM. Πολλές καταρρεύσεις διορθώνονταν εύκολα, άρα οι φοιτητές θα μπορούσαν να καταταχθούν ακόμη ψηλότερα.»

Σε πρόσθετο πείραμα το GPT-5 Thinking προσπάθησε να βελτιώσει τον κορυφαίο ανθρώπινο πράκτορα, Student 1· η τροποποιημένη έκδοση έπεσε στη δέκατη θέση, τη χειρότερη ανθρώπινη. Οι αλλαγές μείωσαν την επίδοση σχεδόν 20%. Οι συγγραφείς καταλήγουν:

«Τα αποτελέσματα αναδεικνύουν σημαντικούς περιορισμούς στη δημιουργία κώδικα από LLM, κυρίως στον συλλογισμό και τον σχεδιασμό. Ο κώδικας χωρίς συντακτικά σφάλματα δεν είναι το κατάλληλο μέτρο προόδου προς προηγμένη γενική AI.»

Συμπέρασμα

Οι συγγραφείς αναγνωρίζουν ότι το vibe coding ενδυναμώνει ανθρώπους κάθε τεχνικού επιπέδου και λειτουργεί εξισωτικά. Επειδή όμως είναι νέο, τα όριά του παραμένουν άγνωστα και πιθανώς χαμηλότερα από ό,τι υποτίθεται. Ζητούν μετατόπιση στόχου «από κώδικα που μεταγλωττίζεται σε κώδικα που ανταγωνίζεται». Ο αναγνώστης μπορεί να αναρωτηθεί αν η σύγκριση είναι υπερβολικά αυστηρή, αφού το συγκεκριμένο πρακτορικό έργο είναι πολύ πιο σύνθετο από μικρά σενάρια PowerShell και διορθώσεις όπου το vibe coding είναι κατάλληλο. * Σημείωση: η εργασία αναφέρει συνεχώς το «DeepThink R1», που φαίνεται ανύπαρκτο και πιθανότατα είναι λανθασμένη γραφή του «DeepSeek R1». Αν κάνω λάθος, επικοινωνήστε μέσω του προφίλ μου και θα το διορθώσω.† Η έμφαση είναι των συγγραφέων.Πρώτη δημοσίευση Τετάρτη 26 Νοεμβρίου 2025. Τροποποίηση μορφοποίησης στις 17:35 EST.

Συγγραφέας στον τομέα της μηχανικής μάθησης, ειδικός σε συνθετικές ανθρώπινες εικόνες. Πρώην επικεφαλής του τμήματος περιεχομένου έρευνας στην Metaphysic.ai, μέχρι τη διάλυσή της στην Brahma.ai της DNEG.
Ιστοσελίδα: martinanderson.ai
Επικοινωνία: martin@martinanderson.ai