Η γωνία του Anderson
Ανθρώπινος Κώδικας από το 2020 Νίκησε τους Vibe-Coded Agents σε Αγωνιστικές Δοκιμές

Το ChatGPT και άλλα εργαλεία vibe coding δοκιμάστηκαν σε σχεδόν 40.000 αγώνες και έχασαν από κώδικα μεταπτυχιακών φοιτητών που είχε γραφτεί πριν από τα Μεγάλα Γλωσσικά Μοντέλα.Νέα βρετανική μελέτη συνέκρινε πράκτορες γραμμένους από ανθρώπους με πράκτορες vibe-coded που δημιουργήθηκαν με τα νεότερα Μεγάλα Γλωσσικά Μοντέλα όπως GPT-5 και Claude. Οι πράκτορες χωρίς AI κέρδισαν εύκολα. Τις δύο ομάδες δημιούργησαν διαφορετικές γενιές φοιτητών του εργαστηρίου AI της EPFL. Οι παλιοί πράκτορες ήταν εργασία του 2020, δύο χρόνια πριν το ChatGPT, ενώ οι νέοι δημιουργήθηκαν με τα καλύτερα σύγχρονα LLM. Παρά τα πλεονεκτήματα που δόθηκαν στην AI, οι λύσεις vibe coding δεν νίκησαν: τις πέντε πρώτες θέσεις πήραν άνθρωποι και 33 από 40 πράκτορες LLM έχασαν από πολύ απλές βασικές στρατηγικές σε 38.304 αναμετρήσεις. Η μελέτη αναφέρει:
«Παρότι τα σύγχρονα LLM παράγουν κώδικα που εκτελείται χωρίς συντακτικά σφάλματα, η λύση δεν ανταγωνίζεται τον ανθρώπινο σχεδιασμό σε στρατηγικό σχεδιασμό, βελτιστοποίηση ή ανταγωνισμό πολλών πρακτόρων.»
«Η εργασία αναδεικνύει ένα νέο όριο στη δημιουργία κώδικα και επιδιώκει benchmark, σύνολα δεδομένων και ανοικτές βάσεις που απαιτούν σύνθεση κώδικα με συλλογισμό.»
Η πρόκληση απαιτούσε δημιουργική συμμετοχή σε δημοπρασίες και σχεδιασμό της εφοδιαστικής για τις εργασίες που κερδήθηκαν. Τα LLM έλαβαν πλεονεκτήματα, όπως διορθώσεις κώδικα που δεν επιτρέπονταν στους πράκτορες του 2020. Ακόμη και όταν τους δόθηκε καλή διορθωτική λύση, δεν μπόρεσαν να τη χρησιμοποιήσουν:
«Ακόμη όταν παρουσιάζουμε μια καλή λύση μέσα στο πλαίσιο, το LLM δεν μπορεί να την αξιοποιήσει.»
«Το αποτέλεσμα θέτει ερωτήματα για τα όρια της μάθησης εντός πλαισίου και της επίλυσης σύνθετων προβλημάτων με ανάκτηση πληροφοριών.»
Δοκιμάστηκαν τα GPT-5 Thinking, Gemini 2.5 Pro, Claude Opus 4.1 και DeepSeek R1*. Η νέα εργασία τιτλοφορείται Can Vibe Coding Beat Graduate CS Students? An LLM vs. Human Coding Tournament on Market-driven Strategic Planning και προέρχεται από ερευνητές των University of Southampton, University of Oxford και Alan Turing Institute. Το benchmark θα δημοσιευτεί σύντομα.
Μέθοδος
Οι συνηθισμένες δοκιμές χρησιμοποιούν δυαδικά αποτελέσματα — σωστό ή λάθος — που επαληθεύονται με δοκιμές μονάδας. Οι συγγραφείς σχεδίασαν μια ανοικτή, πολυσταδιακή πρόκληση όπου η νίκη είναι δυνατή αλλά δύσκολη.

Η κούρσα αρχίζει
Η αξιολόγηση συνέκρινε 40 πράκτορες LLM με 17 ανθρώπινους σε 12 τουρνουά και τέσσερις οδικές τοπολογίες με σύστημα όλοι εναντίον όλων. Κάθε ζεύγος έπαιξε δύο φορές, για 3.192 αγώνες ανά τουρνουά και 38.304 συνολικά. Κάθε αγώνας δημοπρατούσε 50 παραδόσεις σε χάρτες Ελβετίας, Γαλλίας, Βρετανίας και Ολλανδίας.
«Συχνό πρόβλημα, κυρίως στα Gemini, Claude και DeepSeek, ήταν η επαναλαμβανόμενη αποτυχία επίλυσης ενός σφάλματος.»
«Ένας πράκτορας συνέχιζε να υπερβαίνει το χρονικό όριο παρά 5–15 κύκλους παροχής του σφάλματος και λήψης ενημερωμένου κώδικα.»
«Η μόνη λύση ήταν η επανεκκίνηση από την αρχή. Χρειάστηκε σημαντική χειροκίνητη προσπάθεια και δημιουργήσαμε πολύ περισσότερους πράκτορες για να βρούμε 40 χωρίς σφάλματα.»
Ο πίνακας συνοψίζει τα 12 διπλά τουρνουά, σχεδόν 40.000 αγώνες:
| Πράκτορας | Μ.Ο. νικών / τουρνουά | SD νικών / τουρνουά | Μ.Ο. ηττών / τουρνουά | SD ηττών / τουρνουά | Συνολικές νίκες | Συνολικές ήττες | Ποσοστό νίκης |
|---|---|---|---|---|---|---|---|
| Student 1 | 108.167 | 1.193 | 3.833 | 1.193 | 1298 | 46 | 0.9658 |
| Student 2 | 104.917 | 2.539 | 7.083 | 2.539 | 1259 | 85 | 0.9368 |
| Student 3 | 103.917 | 2.466 | 8.083 | 2.466 | 1247 | 97 | 0.9278 |
| Student 4 | 103.25 | 1.815 | 8.75 | 1.815 | 1239 | 105 | 0.9219 |
| Student 5 | 96.5 | 2.908 | 15.5 | 2.908 | 1158 | 186 | 0.8616 |
| LLM(O, IR, 1) | 95.417 | 2.314 | 16.583 | 2.314 | 1145 | 199 | 0.8519 |
| LLM(O, A2, 1) | 94.583 | 2.314 | 17.417 | 2.314 | 1135 | 209 | 0.8445 |
| Student 6 | 93.167 | 1.899 | 18.833 | 1.899 | 1118 | 226 | 0.8318 |
| Student 7 | 93.167 | 3.563 | 18.833 | 3.563 | 1118 | 226 | 0.8318 |
| LLM(O, A1, 1) | 86.083 | 3.029 | 25.917 | 3.029 | 1033 | 311 | 0.7686 |
| LLM(O, GEN, 2) | 84.083 | 6.947 | 27.917 | 6.947 | 1009 | 335 | 0.7507 |
| LLM(O, CR, 2) | 83.5 | 4.442 | 28.5 | 4.442 | 1002 | 342 | 0.7455 |
| Student 8 | 83.417 | 4.122 | 28.583 | 4.122 | 1001 | 343 | 0.7448 |
| RiskSeeking | 82.417 | 3.343 | 29.583 | 3.343 | 989 | 355 | 0.7359 |
| LLM(O, GEN, 1) | 80.667 | 4.355 | 31.25 | 4.372 | 968 | 375 | 0.7208 |
| ModelOpponent | 80.583 | 3.26 | 31.417 | 3.26 | 967 | 377 | 0.7195 |
| LLM(D, A1, 1) | 79.417 | 3.965 | 32.583 | 3.965 | 953 | 391 | 0.7091 |
| ExpCostFixedBid | 77.167 | 4.951 | 34.833 | 4.951 | 926 | 418 | 0.689 |
| LLM(O, IR, 2) | 73.917 | 3.502 | 38 | 3.618 | 887 | 456 | 0.6605 |
| LLM(O, A1, 2) | 72.417 | 2.193 | 39.583 | 2.193 | 869 | 475 | 0.6466 |
| LLM(G, A1, 2) | 68.5 | 3.555 | 43.5 | 3.555 | 822 | 522 | 0.6116 |
| LLM(A, GEN, 2) | 67.917 | 2.968 | 44.083 | 2.968 | 815 | 529 | 0.6064 |
| LLM(G, IR, 2) | 65.917 | 2.314 | 46.083 | 2.314 | 791 | 553 | 0.5885 |
| Student 9 | 64.167 | 11.044 | 47.833 | 11.044 | 770 | 574 | 0.5729 |
| LLM(G, A1, 1) | 64 | 4.243 | 47.917 | 4.316 | 768 | 575 | 0.5719 |
| LLM(G, IR, 1) | 60.333 | 3.725 | 51.667 | 3.725 | 724 | 620 | 0.5387 |
| LLM(O, A2, 2) | 59.333 | 4.499 | 52.667 | 4.499 | 712 | 632 | 0.5298 |
| LLM(D, CR, 1) | 55.083 | 6.694 | 56.833 | 6.59 | 661 | 682 | 0.4922 |
| LLM(G, GEN, 2) | 53.167 | 3.664 | 58.833 | 3.664 | 638 | 706 | 0.4747 |
| LLM(D, GEN, 2) | 52.083 | 9.06 | 59.917 | 9.06 | 625 | 719 | 0.465 |
| Honest | 50.583 | 3.848 | 61.417 | 3.848 | 607 | 737 | 0.4516 |
| Student 10 | 48.833 | 2.98 | 63.167 | 2.98 | 586 | 758 | 0.436 |
| LLM(D, IR, 1) | 48.583 | 10.211 | 63.417 | 10.211 | 583 | 761 | 0.4338 |
| LLM(A, A1, 1) | 48 | 4.69 | 64 | 4.69 | 576 | 768 | 0.4286 |
| LLM(G, A2, 1) | 47.25 | 3.864 | 64.75 | 3.864 | 567 | 777 | 0.4219 |
| LLM(A, CR, 1) | 43.833 | 4.609 | 68.167 | 4.609 | 526 | 818 | 0.3914 |
| LLM(A, A1, 2) | 43.75 | 2.05 | 68.25 | 2.05 | 525 | 819 | 0.3906 |
| Student 11 | 42.083 | 5.664 | 69.917 | 5.664 | 505 | 839 | 0.3757 |
| LLM(A, IR, 1) | 39.5 | 2.541 | 72.5 | 2.541 | 474 | 870 | 0.3527 |
| Naive | 36.75 | 1.712 | 75.25 | 1.712 | 441 | 903 | 0.3281 |
| Student 12 | 36.333 | 1.775 | 75.667 | 1.775 | 436 | 908 | 0.3244 |
| LLM(D, A2, 1) | 33.917 | 2.193 | 78.083 | 2.193 | 407 | 937 | 0.3028 |
| LLM(A, GEN, 1) | 30.167 | 1.749 | 81.833 | 1.749 | 362 | 982 | 0.2693 |
| LLM(D, A2, 2) | 29.833 | 2.038 | 82.167 | 2.038 | 358 | 986 | 0.2664 |
| LLM(G, A2, 2) | 27 | 2.256 | 85 | 2.256 | 324 | 1020 | 0.2411 |
| LLM(A, A2, 1) | 26.333 | 0.985 | 85.667 | 0.985 | 316 | 1028 | 0.2351 |
| LLM(O, CR, 1) | 25 | 3.411 | 87 | 3.411 | 300 | 1044 | 0.2232 |
| LLM(A, IR, 2) | 24.333 | 8.542 | 87.667 | 8.542 | 292 | 1052 | 0.2173 |
| LLM(A, A2, 2) | 24 | 1.809 | 88 | 1.809 | 288 | 1056 | 0.2143 |
| LLM(A, CR, 2) | 23.333 | 1.557 | 88.667 | 1.557 | 280 | 1064 | 0.2083 |
| LLM(D, GEN, 1) | 22.5 | 1.784 | 89.5 | 1.784 | 270 | 1074 | 0.2009 |
| LLM(D, A1, 2) | 13.333 | 1.826 | 98.667 | 1.826 | 160 | 1184 | 0.119 |
| LLM(G, CR, 1) | 9.5 | 1.087 | 102.5 | 1.087 | 114 | 1230 | 0.0848 |
| LLM(G, GEN, 1) | 9.167 | 0.937 | 102.833 | 0.937 | 110 | 1234 | 0.0818 |
| LLM(D, IR, 2) | 7.75 | 0.622 | 104.25 | 0.622 | 93 | 1251 | 0.0692 |
| LLM(G, CR, 2) | 7.25 | 1.422 | 104.75 | 1.422 | 87 | 1257 | 0.0647 |
| LLM(D, CR, 2) | 5.667 | 0.985 | 106.333 | 0.985 | 68 | 1276 | 0.0506 |
Κάθε πράκτορας έπαιξε 112 αγώνες ανά τουρνουά. Η τυπική απόκλιση (SD) δείχνει τη μεταβλητότητα. Οι ανθρώπινοι πράκτορες εμφανίζονται με έντονα. Οι πράκτορες LLM σημειώνονται με μοντέλο (O = GPT-5 Thinking, G = Gemini 2.5 Pro, A = Claude Opus 4.1, D = DeepSeek R1), κωδικό στρατηγικής και αριθμό πρώτης ή δεύτερης δημιουργίας. ΠηγήΓια τα αποτελέσματα οι συγγραφείς δηλώνουν†:
«Τα LLM δεν παρήγαγαν αναμενόμενο ή ανταγωνιστικό κώδικα ακόμη και σε απλούστερες παραλλαγές APDP, παρότι ο κώδικας ήταν κυρίως χωρίς συντακτικά σφάλματα. Χρειαζόμαστε benchmark συλλογισμού πέρα από την αυτόματη συμπλήρωση.»
«Οι ανθρώπινοι πράκτορες υπερείχαν καθαρά: οι πέντε πρώτες θέσεις ανήκαν σταθερά σε φοιτητές και 33 από 40 πράκτορες LLM ηττήθηκαν από πολύ απλές βάσεις.»
«Δεν διορθώσαμε τον φοιτητικό κώδικα, αλλά δοκιμάσαμε και διορθώσαμε εξονυχιστικά τον κώδικα LLM. Κάθε κατάρρευση φοιτητή έδινε αυτόματα τη νίκη στο LLM. Πολλές καταρρεύσεις διορθώνονταν εύκολα, άρα οι φοιτητές θα μπορούσαν να καταταχθούν ακόμη ψηλότερα.»
Σε πρόσθετο πείραμα το GPT-5 Thinking προσπάθησε να βελτιώσει τον κορυφαίο ανθρώπινο πράκτορα, Student 1· η τροποποιημένη έκδοση έπεσε στη δέκατη θέση, τη χειρότερη ανθρώπινη. Οι αλλαγές μείωσαν την επίδοση σχεδόν 20%. Οι συγγραφείς καταλήγουν:
«Τα αποτελέσματα αναδεικνύουν σημαντικούς περιορισμούς στη δημιουργία κώδικα από LLM, κυρίως στον συλλογισμό και τον σχεδιασμό. Ο κώδικας χωρίς συντακτικά σφάλματα δεν είναι το κατάλληλο μέτρο προόδου προς προηγμένη γενική AI.»
Συμπέρασμα
Οι συγγραφείς αναγνωρίζουν ότι το vibe coding ενδυναμώνει ανθρώπους κάθε τεχνικού επιπέδου και λειτουργεί εξισωτικά. Επειδή όμως είναι νέο, τα όριά του παραμένουν άγνωστα και πιθανώς χαμηλότερα από ό,τι υποτίθεται. Ζητούν μετατόπιση στόχου «από κώδικα που μεταγλωττίζεται σε κώδικα που ανταγωνίζεται». Ο αναγνώστης μπορεί να αναρωτηθεί αν η σύγκριση είναι υπερβολικά αυστηρή, αφού το συγκεκριμένο πρακτορικό έργο είναι πολύ πιο σύνθετο από μικρά σενάρια PowerShell και διορθώσεις όπου το vibe coding είναι κατάλληλο. * Σημείωση: η εργασία αναφέρει συνεχώς το «DeepThink R1», που φαίνεται ανύπαρκτο και πιθανότατα είναι λανθασμένη γραφή του «DeepSeek R1». Αν κάνω λάθος, επικοινωνήστε μέσω του προφίλ μου και θα το διορθώσω.† Η έμφαση είναι των συγγραφέων.Πρώτη δημοσίευση Τετάρτη 26 Νοεμβρίου 2025. Τροποποίηση μορφοποίησης στις 17:35 EST.












