Sudut Anderson
Kode Manusia Dari 2020 Menghancurkan Agen Vibe-Coded Dalam Tes Agensi

ChatGPT dan alat vibe coding lain diuji dalam hampir 40.000 pertandingan—dan kalah dari kode mahasiswa pascasarjana yang ditulis sebelum Large Language Model hadir.Studi baru dari Inggris mempertemukan agen buatan manusia dengan agen vibe-coded yang dikembangkan memakai Large Language Model terbaru seperti GPT-5 dan Claude. Agen tanpa bantuan AI menang dengan mudah. Kedua kelompok dibuat oleh angkatan mahasiswa berbeda di laboratorium AI EPFL. Agen non-AI berasal dari tugas kuliah tahun 2020, dua tahun sebelum ChatGPT, sedangkan agen baru dibuat mahasiswa saat ini dengan bantuan LLM terbaik. Walau AI diberi keuntungan, solusi vibe-coded tetap gagal menang. Lima peringkat teratas selalu ditempati agen manusia, dan 33 dari 40 agen LLM dikalahkan agen dasar yang sangat sederhana dalam 38.304 pertandingan. Makalah menyatakan:
“LLM mutakhir dapat menghasilkan kode yang berjalan tanpa kesalahan sintaks, tetapi solusinya tidak kompetitif dengan rancangan manusia dalam perencanaan strategis, optimasi, atau persaingan multi-agen.”
“Karya ini menyoroti batas baru pembuatan kode dan mendorong benchmark, kumpulan data, serta baseline sumber terbuka yang menekankan sintesis kode berbasis penalaran.”
Tantangannya adalah mengikuti lelang secara kreatif dengan berbagai strategi lalu merencanakan logistik pengiriman tugas yang dimenangkan. LLM diberi sejumlah keunggulan, termasuk perbaikan kode yang tidak diberikan pada kode tahun 2020. Namun bahkan saat diperlihatkan kode koreksi, model tidak dapat memakainya:
“Dalam benchmark kami, meski solusi yang baik ditampilkan di dalam konteks, LLM masih tidak mampu memanfaatkannya.”
“Hasil ini menimbulkan pertanyaan tentang batas pembelajaran dalam konteks dan pemecahan masalah kompleks berbantuan retrieval.”
Model yang diuji ialah GPT-5 Thinking, Gemini 2.5 Pro, Claude Opus 4.1 dan DeepSeek R1*. Makalah baru berjudul Can Vibe Coding Beat Graduate CS Students? An LLM vs. Human Coding Tournament on Market-driven Strategic Planning dan ditulis peneliti University of Southampton, University of Oxford, dan Alan Turing Institute. Benchmark akan segera dirilis.
Metode
Pengujian tradisional biasanya memakai hasil biner—benar atau tidak benar—yang diperiksa dengan unit test. Untuk menguji keterbatasan kode LLM, penulis merancang tantangan terbuka dengan banyak sasaran antara, di mana kemenangan mungkin tetapi tidak mudah.

Perlombaan dimulai
Evaluasi membandingkan 40 agen LLM dengan 17 agen manusia dalam 12 turnamen pada empat topologi jalan menggunakan format semua melawan semua. Setiap pasangan bertemu dua kali, menghasilkan 3.192 pertandingan per turnamen dan 38.304 total. Tiap pertandingan melelang 50 tugas pada peta Swiss, Prancis, Britania Raya, dan Belanda.
“Masalah umum, terutama pada Gemini, Claude, dan DeepSeek, adalah LLM berulang kali gagal memperbaiki bug.”
“Misalnya, agen terus timeout meski model sudah diberi pesan kesalahan dan mengirim kode baru selama 5–15 siklus.”
“Satu-satunya solusi adalah memulai dari awal. Kode bebas bug membutuhkan upaya manual besar dan kami harus membuat jauh lebih banyak agen untuk memperoleh 40 yang bisa diuji.”
Tabel berikut merangkum 12 turnamen round-robin ganda, hampir 40.000 pertandingan:
| Agen | Rata-rata menang / turnamen | SD menang / turnamen | Rata-rata kalah / turnamen | SD kalah / turnamen | Total menang | Total kalah | Rasio menang |
|---|---|---|---|---|---|---|---|
| Student 1 | 108.167 | 1.193 | 3.833 | 1.193 | 1298 | 46 | 0.9658 |
| Student 2 | 104.917 | 2.539 | 7.083 | 2.539 | 1259 | 85 | 0.9368 |
| Student 3 | 103.917 | 2.466 | 8.083 | 2.466 | 1247 | 97 | 0.9278 |
| Student 4 | 103.25 | 1.815 | 8.75 | 1.815 | 1239 | 105 | 0.9219 |
| Student 5 | 96.5 | 2.908 | 15.5 | 2.908 | 1158 | 186 | 0.8616 |
| LLM(O, IR, 1) | 95.417 | 2.314 | 16.583 | 2.314 | 1145 | 199 | 0.8519 |
| LLM(O, A2, 1) | 94.583 | 2.314 | 17.417 | 2.314 | 1135 | 209 | 0.8445 |
| Student 6 | 93.167 | 1.899 | 18.833 | 1.899 | 1118 | 226 | 0.8318 |
| Student 7 | 93.167 | 3.563 | 18.833 | 3.563 | 1118 | 226 | 0.8318 |
| LLM(O, A1, 1) | 86.083 | 3.029 | 25.917 | 3.029 | 1033 | 311 | 0.7686 |
| LLM(O, GEN, 2) | 84.083 | 6.947 | 27.917 | 6.947 | 1009 | 335 | 0.7507 |
| LLM(O, CR, 2) | 83.5 | 4.442 | 28.5 | 4.442 | 1002 | 342 | 0.7455 |
| Student 8 | 83.417 | 4.122 | 28.583 | 4.122 | 1001 | 343 | 0.7448 |
| RiskSeeking | 82.417 | 3.343 | 29.583 | 3.343 | 989 | 355 | 0.7359 |
| LLM(O, GEN, 1) | 80.667 | 4.355 | 31.25 | 4.372 | 968 | 375 | 0.7208 |
| ModelOpponent | 80.583 | 3.26 | 31.417 | 3.26 | 967 | 377 | 0.7195 |
| LLM(D, A1, 1) | 79.417 | 3.965 | 32.583 | 3.965 | 953 | 391 | 0.7091 |
| ExpCostFixedBid | 77.167 | 4.951 | 34.833 | 4.951 | 926 | 418 | 0.689 |
| LLM(O, IR, 2) | 73.917 | 3.502 | 38 | 3.618 | 887 | 456 | 0.6605 |
| LLM(O, A1, 2) | 72.417 | 2.193 | 39.583 | 2.193 | 869 | 475 | 0.6466 |
| LLM(G, A1, 2) | 68.5 | 3.555 | 43.5 | 3.555 | 822 | 522 | 0.6116 |
| LLM(A, GEN, 2) | 67.917 | 2.968 | 44.083 | 2.968 | 815 | 529 | 0.6064 |
| LLM(G, IR, 2) | 65.917 | 2.314 | 46.083 | 2.314 | 791 | 553 | 0.5885 |
| Student 9 | 64.167 | 11.044 | 47.833 | 11.044 | 770 | 574 | 0.5729 |
| LLM(G, A1, 1) | 64 | 4.243 | 47.917 | 4.316 | 768 | 575 | 0.5719 |
| LLM(G, IR, 1) | 60.333 | 3.725 | 51.667 | 3.725 | 724 | 620 | 0.5387 |
| LLM(O, A2, 2) | 59.333 | 4.499 | 52.667 | 4.499 | 712 | 632 | 0.5298 |
| LLM(D, CR, 1) | 55.083 | 6.694 | 56.833 | 6.59 | 661 | 682 | 0.4922 |
| LLM(G, GEN, 2) | 53.167 | 3.664 | 58.833 | 3.664 | 638 | 706 | 0.4747 |
| LLM(D, GEN, 2) | 52.083 | 9.06 | 59.917 | 9.06 | 625 | 719 | 0.465 |
| Honest | 50.583 | 3.848 | 61.417 | 3.848 | 607 | 737 | 0.4516 |
| Student 10 | 48.833 | 2.98 | 63.167 | 2.98 | 586 | 758 | 0.436 |
| LLM(D, IR, 1) | 48.583 | 10.211 | 63.417 | 10.211 | 583 | 761 | 0.4338 |
| LLM(A, A1, 1) | 48 | 4.69 | 64 | 4.69 | 576 | 768 | 0.4286 |
| LLM(G, A2, 1) | 47.25 | 3.864 | 64.75 | 3.864 | 567 | 777 | 0.4219 |
| LLM(A, CR, 1) | 43.833 | 4.609 | 68.167 | 4.609 | 526 | 818 | 0.3914 |
| LLM(A, A1, 2) | 43.75 | 2.05 | 68.25 | 2.05 | 525 | 819 | 0.3906 |
| Student 11 | 42.083 | 5.664 | 69.917 | 5.664 | 505 | 839 | 0.3757 |
| LLM(A, IR, 1) | 39.5 | 2.541 | 72.5 | 2.541 | 474 | 870 | 0.3527 |
| Naive | 36.75 | 1.712 | 75.25 | 1.712 | 441 | 903 | 0.3281 |
| Student 12 | 36.333 | 1.775 | 75.667 | 1.775 | 436 | 908 | 0.3244 |
| LLM(D, A2, 1) | 33.917 | 2.193 | 78.083 | 2.193 | 407 | 937 | 0.3028 |
| LLM(A, GEN, 1) | 30.167 | 1.749 | 81.833 | 1.749 | 362 | 982 | 0.2693 |
| LLM(D, A2, 2) | 29.833 | 2.038 | 82.167 | 2.038 | 358 | 986 | 0.2664 |
| LLM(G, A2, 2) | 27 | 2.256 | 85 | 2.256 | 324 | 1020 | 0.2411 |
| LLM(A, A2, 1) | 26.333 | 0.985 | 85.667 | 0.985 | 316 | 1028 | 0.2351 |
| LLM(O, CR, 1) | 25 | 3.411 | 87 | 3.411 | 300 | 1044 | 0.2232 |
| LLM(A, IR, 2) | 24.333 | 8.542 | 87.667 | 8.542 | 292 | 1052 | 0.2173 |
| LLM(A, A2, 2) | 24 | 1.809 | 88 | 1.809 | 288 | 1056 | 0.2143 |
| LLM(A, CR, 2) | 23.333 | 1.557 | 88.667 | 1.557 | 280 | 1064 | 0.2083 |
| LLM(D, GEN, 1) | 22.5 | 1.784 | 89.5 | 1.784 | 270 | 1074 | 0.2009 |
| LLM(D, A1, 2) | 13.333 | 1.826 | 98.667 | 1.826 | 160 | 1184 | 0.119 |
| LLM(G, CR, 1) | 9.5 | 1.087 | 102.5 | 1.087 | 114 | 1230 | 0.0848 |
| LLM(G, GEN, 1) | 9.167 | 0.937 | 102.833 | 0.937 | 110 | 1234 | 0.0818 |
| LLM(D, IR, 2) | 7.75 | 0.622 | 104.25 | 0.622 | 93 | 1251 | 0.0692 |
| LLM(G, CR, 2) | 7.25 | 1.422 | 104.75 | 1.422 | 87 | 1257 | 0.0647 |
| LLM(D, CR, 2) | 5.667 | 0.985 | 106.333 | 0.985 | 68 | 1276 | 0.0506 |
Setiap agen memainkan 112 pertandingan per turnamen. Simpangan baku (SD) menunjukkan variasi antarturnamen. Agen manusia dicetak tebal. Agen LLM diberi label model (O = GPT-5 Thinking, G = Gemini 2.5 Pro, A = Claude Opus 4.1, D = DeepSeek R1), kode strategi prompt, dan angka untuk generasi pertama atau kedua. SumberTentang hasil di atas, penulis menyatakan†:
“LLM tidak menghasilkan kode yang diharapkan atau kompetitif bahkan pada varian APDP yang lebih sederhana, meski kode sebagian besar bebas kesalahan sintaks. Ini menunjukkan pentingnya benchmark berbasis penalaran yang melampaui pelengkapan otomatis.”
“Agen buatan manusia jelas lebih unggul: lima tempat teratas selalu milik mahasiswa dan 33 dari 40 agen LLM dikalahkan baseline yang sangat sederhana.”
“Kami tidak melakukan debugging kode mahasiswa, tetapi menguji dan memperbaiki kode LLM secara menyeluruh. Setiap agen mahasiswa crash, LLM otomatis menang. Banyak crash mudah diperbaiki, jadi mahasiswa sebenarnya bisa berada lebih tinggi.”
Dalam eksperimen tambahan, GPT-5 Thinking diminta memperbaiki agen manusia terbaik, Student 1; agen hasil modifikasi jatuh ke posisi sepuluh, terburuk di antara manusia. Perubahan LLM menurunkan kinerja hampir 20%. Penulis menyimpulkan:
“Hasil menyoroti keterbatasan penting pembuatan kode LLM, terutama kemampuan menalar dan merencanakan. LLM modern mampu menghasilkan kode yang berjalan tanpa kesalahan sintaks, tetapi itu bukan benchmark yang tepat untuk kemajuan menuju AI umum tingkat lanjut.”
Kesimpulan
Penulis mengakui vibe coding memberdayakan orang dari berbagai latar teknis dan menjadi kekuatan pemerata. Namun karena masih baru, batasnya belum diketahui dan mungkin lebih rendah daripada dugaan umum. Mereka menyerukan pergeseran tujuan “dari kode yang dapat dikompilasi menjadi kode yang dapat bersaing”. Pembaca mungkin bertanya apakah perbandingan ini terlalu berat, sebab tugas agennya jauh lebih kompleks daripada skrip PowerShell dan fungsi kecil yang cocok untuk vibe coding. * Catatan: makalah terus memakai nama “DeepThink R1”, yang tampaknya tidak ada dan mungkin salah tulis dari “DeepSeek R1”. Jika ini kesalahan saya, silakan hubungi melalui profil dan akan saya koreksi.† Penekanan berasal dari penulis.Pertama terbit Rabu, 26 November 2025. Diperbarui pukul 17.35 EST untuk pemformatan.












