Η γωνία του Anderson
Ανθρώπινος Κώδικας από το 2020 Νίκησε τους Vibe-Coded Agents σε Αγωνιστικές Δοκιμές

Το ChatGPT και άλλα εργαλεία vibe-coding υποβεβληθήκαν σε δοκιμές σε σχεδόν 40.000 αγώνες – και ηττήθηκαν από τον κώδικα που γράφτηκε από φοιτητή πριν από την εφεύρεση των Μεγάλων Γλωσσικών Μοντέλων.
Σε μια νέα μελέτη από το Ηνωμένο Βασίλειο, ερευνητές αντιπαρατέθηκαν ανθρώπινους κωδικοποιημένους πράκτορες με vibe-coded πράκτορες που αναπτύχθηκαν με τα τελευταία Μεγάλα Γλωσσικά Μοντέλα (LLMs), όπως το ChatGPT-5 και το Claude, και βρήκαν ότι οι πράκτορες που δημιουργήθηκαν χωρίς τη βοήθεια του AI νίκησαν εύκολα τις εκδόσεις που υποστηρίζονται από το AI.
Και οι δύο ομάδες πρακτόρων δημιουργήθηκαν από διαφορετικές γενιές φοιτητών από το Εργαστήριο Τεχνητής Νοημοσύνης του Ομοσπονδιακού Τεχνολογικού Ινστιτούτου της Λαουσάνης. Οι μη-AI πράκτορες αναπτύχθηκαν ως μέρος του μαθήματος το 2020, δύο χρόνια πριν από την έναρξη του ChatGPT και την αρχή της επανάστασης των LLMs, ενώ οι νέοι πράκτορες δημιουργήθηκαν από τους τρέχοντες φοιτητές, με τη βοήθεια των τελευταίων και καλύτερων LLMs που είναι διαθέσιμα.
Ακόμη και με ένα ριγμένο παιχνίδι, οι vibe-coded λύσεις δεν μπορούσαν να κερδίσουν, και οι πέντε πρώτες θέσεις κατέχονταν συνεχώς από “ακατέργαστους” πράκτορες, με την πλειοψηφία των LLM πρακτόρων (33 από 40) να ηττώνται εύκολα από “πολύ απλούς” βασικούς πράκτορες, σε 38.304 αγώνες σε ένα τουρνουά, σε ένα ευρύ φάσμα μεταβλητών και περιστάσεων.
Το έγγραφο αναφέρει:
‘Η εργασία μας δείχνει ότι ενώ τα state-of-the-art LLMs μπορούν να генνήσουν κώδικα που τρέχει (δηλαδή, χωρίς συντακτικά λάθη), η γεννημένη λύση δεν είναι ανταγωνιστική με τις ανθρώπινες λύσεις σε διαστάσεις όπως η στρατηγική lậpση, η βελτιστοποίηση ή η ανταγωνιστική διοργάνωση.
‘Έτσι, αυτή η εργασία φέρνει στο προσκήνιο αυτό το νέο μέτωπο στη γεννήση κώδικα, και στοχεύει να διευκολύνει την ανάπτυξη βενči, συνόλων δεδομένων και ανοιχτών βασικών που δίνουν έμφαση στη σύνθεση κώδικα που βασίζεται στη λογική.’
Το πρόκληση που σχεδιάστηκε ήταν να συμμετάσχει δημιουργικά σε δημοπρασίες, σε eine ποικιλία στρατηγικών, και να διοργανώσει την логιστική της παράδοσης των κερδισμένων αντικειμένων στους νικητές.
Οι συγγραφείς σημειώνουν ότι ένας αριθμός πλεονεκτημάτων δόθηκε στους LLMs, όπως η παρέμβαση στον κώδικά τους για να βελτιώσουν την απόδοσή τους – ένα πλεονέκτημα που δεν επιτρεπόταν στον κώδικα του 2020.尽管如此, ακόμη και όταν παρέχονταν διορθωτικός κώδικας που θα είχε βελτιώσει σίγουρα τα αποτελέσματά τους, οι LLMs δεν μπόρεσαν να το χρησιμοποιήσουν ή να το εκμεταλλευτούν:
‘[Στη] δοκιμή μας, ακόμη και όταν εκθέτουμε μια καλή λύση στο контέκστ, ο LLM δεν μπορεί να τη χρησιμοποιήσει.
‘Αυτό το αποτέλεσμα επίσης ανακínει ενδιαφέρουσες ερωτήσεις για τα όρια της μάθησης στο контέκστ και της λύσης προβλημάτων που βασίζεται στη λογική σε σύνθετες περιπτώσεις.’
Οι LLMs που χρησιμοποιήθηκαν στη δοκιμή ήταν το GPT-5 Thinking, το Claude Opus 4.1, το Gemini 2.5 Pro, και το DeepSeek R1*.
Το νέο έγγραφο έχει τον τίτλο Μπορεί το Vibe Coding να Νικήσει τους Φοιτητές του CS; Ένας Αγώνας LLM vs. Ανθρώπινου Κώδικα σε Αγωνιστική Στρατηγική με βάση την Αγορά, και προέρχεται από έναν συγγραφέα στο Πανεπιστήμιο του Σάουθχαμπτον και έναν συγγραφέα στο Πανεπιστήμιο του Οξφόρδη και στο Ινστιτούτο Άλαν Τούρινγκ. Η βάση δεδομένων, όπως αναφέρουν οι συγγραφείς, θα κυκλοφορήσει σύντομα.
Μέθοδος
Οι συγγραφείς σημειώνουν ότι οι παραδοσιακές δοκιμές σε αυτό το χώρο εστιάζουν σε προκλήσεις με σαφώς καθορισμένες δυαδικές λύσεις (σωστές ή μη σωστές), που επαληθεύονται μέσω δοκιμών μονάδας. Υποστηρίζοντας ότι αυτό δεν είναι ο ιδανικός τρόπος για να εξερευνήσουμε τα όρια των LLM-βοηθούμενων κωδίκων, οι συγγραφείς αντί για αυτό σχεδίασαν μια πιο σύνθετη πρόκληση, με πολλαπλά εσωτερικά βήματα και ορόσημα, όπου η νίκη είναι δυνατή, αλλά μακράν απλή:…












