Sudut Anderson

Kode Manusia Dari 2020 Menghancurkan Agen Vibe-Coded Dalam Tes Agensi

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google
AI-generated image: a Victorian coach and horses winning formula 1 against modern race car competitors. gpt-image-1.

ChatGPT dan alat vibe coding lain diuji dalam hampir 40.000 pertandingan—dan kalah dari kode mahasiswa pascasarjana yang ditulis sebelum Large Language Model hadir.Studi baru dari Inggris mempertemukan agen buatan manusia dengan agen vibe-coded yang dikembangkan memakai Large Language Model terbaru seperti GPT-5 dan Claude. Agen tanpa bantuan AI menang dengan mudah. Kedua kelompok dibuat oleh angkatan mahasiswa berbeda di laboratorium AI EPFL. Agen non-AI berasal dari tugas kuliah tahun 2020, dua tahun sebelum ChatGPT, sedangkan agen baru dibuat mahasiswa saat ini dengan bantuan LLM terbaik. Walau AI diberi keuntungan, solusi vibe-coded tetap gagal menang. Lima peringkat teratas selalu ditempati agen manusia, dan 33 dari 40 agen LLM dikalahkan agen dasar yang sangat sederhana dalam 38.304 pertandingan. Makalah menyatakan:

“LLM mutakhir dapat menghasilkan kode yang berjalan tanpa kesalahan sintaks, tetapi solusinya tidak kompetitif dengan rancangan manusia dalam perencanaan strategis, optimasi, atau persaingan multi-agen.”

“Karya ini menyoroti batas baru pembuatan kode dan mendorong benchmark, kumpulan data, serta baseline sumber terbuka yang menekankan sintesis kode berbasis penalaran.”

Tantangannya adalah mengikuti lelang secara kreatif dengan berbagai strategi lalu merencanakan logistik pengiriman tugas yang dimenangkan. LLM diberi sejumlah keunggulan, termasuk perbaikan kode yang tidak diberikan pada kode tahun 2020. Namun bahkan saat diperlihatkan kode koreksi, model tidak dapat memakainya:

“Dalam benchmark kami, meski solusi yang baik ditampilkan di dalam konteks, LLM masih tidak mampu memanfaatkannya.”

“Hasil ini menimbulkan pertanyaan tentang batas pembelajaran dalam konteks dan pemecahan masalah kompleks berbantuan retrieval.”

Model yang diuji ialah GPT-5 Thinking, Gemini 2.5 Pro, Claude Opus 4.1 dan DeepSeek R1*. Makalah baru berjudul Can Vibe Coding Beat Graduate CS Students? An LLM vs. Human Coding Tournament on Market-driven Strategic Planning dan ditulis peneliti University of Southampton, University of Oxford, dan Alan Turing Institute. Benchmark akan segera dirilis.

Metode

Pengujian tradisional biasanya memakai hasil biner—benar atau tidak benar—yang diperiksa dengan unit test. Untuk menguji keterbatasan kode LLM, penulis merancang tantangan terbuka dengan banyak sasaran antara, di mana kemenangan mungkin tetapi tidak mudah.Perbandingan unit test standar dengan skenario terbuka yang dirancang penulis Perbandingan pendekatan berbasis unit test dengan tantangan terbuka penulis. SumberAPDP dipilih antara lain karena tersedia kumpulan kode mahasiswa 2020 yang membuat agen sebelum bantuan AI. Mahasiswa modern diberi tugas sama dengan alat baru. Penulis menghindari benchmark seperti HumanEval, BigCodeBench dan WebDev Arena karena risiko kontaminasi data—sistem mungkin dilatih pada data pengujian alih-alih mematuhi pemisahan data.Lelang terbalik dan perutean kendaraan membentuk APDP dua tahap. Pertama, agen menawar bayaran untuk tugas pengiriman; tawaran terlalu tinggi kalah, terlalu rendah bisa rugi. Kedua, agen menjadwalkan hanya tugas yang dimenangkan ke kendaraan dengan kapasitas dan biaya berbeda di bawah batas waktu dan sumber daya.Dalam APDP, perusahaan menawar tugas pengiriman lalu mengoptimalkan rute tugas yang dimenangkan demi laba. Dalam APDP, perusahaan mengikuti lelang terbalik lalu mengoptimalkan rute kendaraan untuk tugas yang dimenangkan.Tujuannya memaksimalkan laba dengan memperkirakan paket tugas yang cocok dan strategi pesaing. Setiap lelang memengaruhi pilihan berikutnya, sehingga agen harus menalar biaya, posisi, waktu, dan konsekuensi jangka panjang. Masalah pengiriman utama bersifat NP-hard: ketika tugas bertambah, tidak ada algoritme yang selalu menemukan solusi terbaik dalam waktu wajar.

Perlombaan dimulai

Evaluasi membandingkan 40 agen LLM dengan 17 agen manusia dalam 12 turnamen pada empat topologi jalan menggunakan format semua melawan semua. Setiap pasangan bertemu dua kali, menghasilkan 3.192 pertandingan per turnamen dan 38.304 total. Tiap pertandingan melelang 50 tugas pada peta Swiss, Prancis, Britania Raya, dan Belanda.Jaringan jalan sederhana Britania Raya, Swiss, Belanda, dan Prancis, dengan tugas serta posisi kendaraan. Jaringan jalan yang digunakan dalam turnamen dan penanda tugas serta kendaraan.Agen mahasiswa berasal dari turnamen kursus 2020: delapan finalis dan empat agen lain yang kuat melawan baseline. Agen baseline memakai heuristik tetap. Naive menghitung jarak total dan memakai satu kendaraan; ExpCostFixedBid menyimulasikan sepuluh tugas dan menawar biaya marginal rata-rata; Honest menghitung biaya marginal sebenarnya; ModelOpponent menambahkan perkiraan biaya lawan; dan RiskSeeking menggabungkan prior yang menurun seiring waktu dengan biaya langsung dan model lawan. Empat puluh agen LLM dibuat dengan GPT-5 Thinking, Claude Opus 4.1, Gemini 2.5 Pro, dan DeepSeek R1, masing-masing memakai lima strategi prompt dua kali. Dua prompt statis ditulis penulis berbeda, strategi ketiga meminta refleksi diri, keempat meminta kritik LLM lain, dan kelima disintesis GPT-4. Prompt dasar mengikuti tugas asli mahasiswa. Agen LLM diuji dan diperbaiki oleh model hingga semua bug yang tampak hilang. Kegagalan umum meliputi timeout, tidak mengambil atau mengirim tugas, dan melanggar kapasitas kendaraan akibat mengabaikan instruksi atau perencanaan ulang yang salah†:

“Masalah umum, terutama pada Gemini, Claude, dan DeepSeek, adalah LLM berulang kali gagal memperbaiki bug.”

“Misalnya, agen terus timeout meski model sudah diberi pesan kesalahan dan mengirim kode baru selama 5–15 siklus.”

“Satu-satunya solusi adalah memulai dari awal. Kode bebas bug membutuhkan upaya manual besar dan kami harus membuat jauh lebih banyak agen untuk memperoleh 40 yang bisa diuji.”

Tabel berikut merangkum 12 turnamen round-robin ganda, hampir 40.000 pertandingan:

Agen Rata-rata menang / turnamen SD menang / turnamen Rata-rata kalah / turnamen SD kalah / turnamen Total menang Total kalah Rasio menang
Student 1 108.167 1.193 3.833 1.193 1298 46 0.9658
Student 2 104.917 2.539 7.083 2.539 1259 85 0.9368
Student 3 103.917 2.466 8.083 2.466 1247 97 0.9278
Student 4 103.25 1.815 8.75 1.815 1239 105 0.9219
Student 5 96.5 2.908 15.5 2.908 1158 186 0.8616
LLM(O, IR, 1) 95.417 2.314 16.583 2.314 1145 199 0.8519
LLM(O, A2, 1) 94.583 2.314 17.417 2.314 1135 209 0.8445
Student 6 93.167 1.899 18.833 1.899 1118 226 0.8318
Student 7 93.167 3.563 18.833 3.563 1118 226 0.8318
LLM(O, A1, 1) 86.083 3.029 25.917 3.029 1033 311 0.7686
LLM(O, GEN, 2) 84.083 6.947 27.917 6.947 1009 335 0.7507
LLM(O, CR, 2) 83.5 4.442 28.5 4.442 1002 342 0.7455
Student 8 83.417 4.122 28.583 4.122 1001 343 0.7448
RiskSeeking 82.417 3.343 29.583 3.343 989 355 0.7359
LLM(O, GEN, 1) 80.667 4.355 31.25 4.372 968 375 0.7208
ModelOpponent 80.583 3.26 31.417 3.26 967 377 0.7195
LLM(D, A1, 1) 79.417 3.965 32.583 3.965 953 391 0.7091
ExpCostFixedBid 77.167 4.951 34.833 4.951 926 418 0.689
LLM(O, IR, 2) 73.917 3.502 38 3.618 887 456 0.6605
LLM(O, A1, 2) 72.417 2.193 39.583 2.193 869 475 0.6466
LLM(G, A1, 2) 68.5 3.555 43.5 3.555 822 522 0.6116
LLM(A, GEN, 2) 67.917 2.968 44.083 2.968 815 529 0.6064
LLM(G, IR, 2) 65.917 2.314 46.083 2.314 791 553 0.5885
Student 9 64.167 11.044 47.833 11.044 770 574 0.5729
LLM(G, A1, 1) 64 4.243 47.917 4.316 768 575 0.5719
LLM(G, IR, 1) 60.333 3.725 51.667 3.725 724 620 0.5387
LLM(O, A2, 2) 59.333 4.499 52.667 4.499 712 632 0.5298
LLM(D, CR, 1) 55.083 6.694 56.833 6.59 661 682 0.4922
LLM(G, GEN, 2) 53.167 3.664 58.833 3.664 638 706 0.4747
LLM(D, GEN, 2) 52.083 9.06 59.917 9.06 625 719 0.465
Honest 50.583 3.848 61.417 3.848 607 737 0.4516
Student 10 48.833 2.98 63.167 2.98 586 758 0.436
LLM(D, IR, 1) 48.583 10.211 63.417 10.211 583 761 0.4338
LLM(A, A1, 1) 48 4.69 64 4.69 576 768 0.4286
LLM(G, A2, 1) 47.25 3.864 64.75 3.864 567 777 0.4219
LLM(A, CR, 1) 43.833 4.609 68.167 4.609 526 818 0.3914
LLM(A, A1, 2) 43.75 2.05 68.25 2.05 525 819 0.3906
Student 11 42.083 5.664 69.917 5.664 505 839 0.3757
LLM(A, IR, 1) 39.5 2.541 72.5 2.541 474 870 0.3527
Naive 36.75 1.712 75.25 1.712 441 903 0.3281
Student 12 36.333 1.775 75.667 1.775 436 908 0.3244
LLM(D, A2, 1) 33.917 2.193 78.083 2.193 407 937 0.3028
LLM(A, GEN, 1) 30.167 1.749 81.833 1.749 362 982 0.2693
LLM(D, A2, 2) 29.833 2.038 82.167 2.038 358 986 0.2664
LLM(G, A2, 2) 27 2.256 85 2.256 324 1020 0.2411
LLM(A, A2, 1) 26.333 0.985 85.667 0.985 316 1028 0.2351
LLM(O, CR, 1) 25 3.411 87 3.411 300 1044 0.2232
LLM(A, IR, 2) 24.333 8.542 87.667 8.542 292 1052 0.2173
LLM(A, A2, 2) 24 1.809 88 1.809 288 1056 0.2143
LLM(A, CR, 2) 23.333 1.557 88.667 1.557 280 1064 0.2083
LLM(D, GEN, 1) 22.5 1.784 89.5 1.784 270 1074 0.2009
LLM(D, A1, 2) 13.333 1.826 98.667 1.826 160 1184 0.119
LLM(G, CR, 1) 9.5 1.087 102.5 1.087 114 1230 0.0848
LLM(G, GEN, 1) 9.167 0.937 102.833 0.937 110 1234 0.0818
LLM(D, IR, 2) 7.75 0.622 104.25 0.622 93 1251 0.0692
LLM(G, CR, 2) 7.25 1.422 104.75 1.422 87 1257 0.0647
LLM(D, CR, 2) 5.667 0.985 106.333 0.985 68 1276 0.0506

Setiap agen memainkan 112 pertandingan per turnamen. Simpangan baku (SD) menunjukkan variasi antarturnamen. Agen manusia dicetak tebal. Agen LLM diberi label model (O = GPT-5 Thinking, G = Gemini 2.5 Pro, A = Claude Opus 4.1, D = DeepSeek R1), kode strategi prompt, dan angka untuk generasi pertama atau kedua. SumberTentang hasil di atas, penulis menyatakan†:

“LLM tidak menghasilkan kode yang diharapkan atau kompetitif bahkan pada varian APDP yang lebih sederhana, meski kode sebagian besar bebas kesalahan sintaks. Ini menunjukkan pentingnya benchmark berbasis penalaran yang melampaui pelengkapan otomatis.”

“Agen buatan manusia jelas lebih unggul: lima tempat teratas selalu milik mahasiswa dan 33 dari 40 agen LLM dikalahkan baseline yang sangat sederhana.”

“Kami tidak melakukan debugging kode mahasiswa, tetapi menguji dan memperbaiki kode LLM secara menyeluruh. Setiap agen mahasiswa crash, LLM otomatis menang. Banyak crash mudah diperbaiki, jadi mahasiswa sebenarnya bisa berada lebih tinggi.”

Dalam eksperimen tambahan, GPT-5 Thinking diminta memperbaiki agen manusia terbaik, Student 1; agen hasil modifikasi jatuh ke posisi sepuluh, terburuk di antara manusia. Perubahan LLM menurunkan kinerja hampir 20%. Penulis menyimpulkan:

“Hasil menyoroti keterbatasan penting pembuatan kode LLM, terutama kemampuan menalar dan merencanakan. LLM modern mampu menghasilkan kode yang berjalan tanpa kesalahan sintaks, tetapi itu bukan benchmark yang tepat untuk kemajuan menuju AI umum tingkat lanjut.”

Kesimpulan

Penulis mengakui vibe coding memberdayakan orang dari berbagai latar teknis dan menjadi kekuatan pemerata. Namun karena masih baru, batasnya belum diketahui dan mungkin lebih rendah daripada dugaan umum. Mereka menyerukan pergeseran tujuan “dari kode yang dapat dikompilasi menjadi kode yang dapat bersaing”. Pembaca mungkin bertanya apakah perbandingan ini terlalu berat, sebab tugas agennya jauh lebih kompleks daripada skrip PowerShell dan fungsi kecil yang cocok untuk vibe coding. * Catatan: makalah terus memakai nama “DeepThink R1”, yang tampaknya tidak ada dan mungkin salah tulis dari “DeepSeek R1”. Jika ini kesalahan saya, silakan hubungi melalui profil dan akan saya koreksi.† Penekanan berasal dari penulis.Pertama terbit Rabu, 26 November 2025. Diperbarui pukul 17.35 EST untuk pemformatan.

Penulis tentang pembelajaran mesin, spesialis domain dalam sintesis gambar manusia. Mantan kepala konten riset di Metaphysic.ai, hingga dibubarkannya menjadi Brahma.ai milik DNEG.
Website: martinanderson.ai
Kontak: martin@martinanderson.ai