Unghiul lui Anderson
Codul Uman Din 2020 A Învinge Agentii Vibe-Codati în Testele Agentice

ChatGPT și alte instrumente de vibe coding au fost testate în aproape 40.000 de meciuri și au pierdut în fața codului scris de masteranzi înainte de apariția modelelor lingvistice mari.Un nou studiu britanic a comparat agenți programați de oameni cu agenți creați prin vibe coding cu cele mai noi modele lingvistice mari precum GPT-5 și Claude. Agenții realizați fără AI au câștigat ușor. Ambele grupuri au fost create de generații diferite de studenți ai laboratorului AI de la EPFL. Agenții fără AI proveneau dintr-un curs din 2020, cu doi ani înainte de ChatGPT, iar cei noi au fost făcuți de studenți actuali ajutați de cele mai bune LLM-uri. Chiar și cu avantaje acordate AI, soluțiile vibe-coded nu au câștigat: primele cinci locuri au revenit agenților umani, iar 33 din 40 de agenți LLM au fost învinși de strategii de bază foarte simple în 38.304 confruntări. Lucrarea afirmă:
„Deși LLM-urile moderne pot genera cod funcțional, fără erori de sintaxă, soluția nu concurează cu cele proiectate de oameni la planificare strategică, optimizare sau competiție multi-agent.”
„Această lucrare evidențiază noua frontieră a generării de cod și urmărește dezvoltarea de benchmark-uri, seturi de date și baze open-source care solicită sinteza de cod bazată pe raționament.”
Provocarea cerea participarea creativă la licitații și planificarea logisticii pentru livrarea sarcinilor câștigate. LLM-urile au primit avantaje, inclusiv intervenții asupra codului, inaccesibile soluțiilor din 2020. Totuși, chiar când li s-a oferit cod corectiv, nu l-au putut folosi:
„În benchmark-ul nostru, chiar dacă prezentăm în context o soluție bună, LLM-ul tot nu o poate utiliza.”
„Rezultatul ridică întrebări despre limitele învățării în context și ale rezolvării problemelor complexe cu recuperare de informații.”
Modelele testate au fost GPT-5 Thinking, Gemini 2.5 Pro, Claude Opus 4.1 și DeepSeek R1*. Noua lucrare se intitulează Can Vibe Coding Beat Graduate CS Students? An LLM vs. Human Coding Tournament on Market-driven Strategic Planning și are autori de la University of Southampton, University of Oxford și Alan Turing Institute. Benchmark-ul urmează să fie publicat în curând.
Metodă
Testele tradiționale folosesc adesea rezultate binare — corect sau incorect — verificate prin teste unitare. Autorii au conceput în schimb o provocare deschisă, cu repere multiple, în care victoria este posibilă, dar dificilă.

Începe cursa
Evaluarea a comparat 40 de agenți LLM cu 17 agenți umani în 12 turnee, pe patru topologii rutiere, în sistem fiecare cu fiecare. Fiecare pereche s-a întâlnit de două ori, rezultând 3.192 de meciuri pe turneu și 38.304 în total. În fiecare meci s-au licitat 50 de livrări pe hărți inspirate din Elveția, Franța, Marea Britanie și Țările de Jos.
„O problemă frecventă, mai ales la Gemini, Claude și DeepSeek, era imposibilitatea repetată de a rezolva un defect.”
„Un agent depășea constant timpul chiar după 5–15 cicluri în care modelul primea eroarea și furniza o versiune actualizată.”
„Singura soluție era reluarea de la zero. Obținerea unui cod fără erori a necesitat mult efort manual și a trebuit să generăm mult mai mulți agenți pentru a găsi 40 funcționali.”
Tabelul rezumă cele 12 turnee duble, aproape 40.000 de meciuri:
| Agent | Medie victorii / turneu | SD victorii / turneu | Medie înfrângeri / turneu | SD înfrângeri / turneu | Total victorii | Total înfrângeri | Rată de victorie |
|---|---|---|---|---|---|---|---|
| Student 1 | 108.167 | 1.193 | 3.833 | 1.193 | 1298 | 46 | 0.9658 |
| Student 2 | 104.917 | 2.539 | 7.083 | 2.539 | 1259 | 85 | 0.9368 |
| Student 3 | 103.917 | 2.466 | 8.083 | 2.466 | 1247 | 97 | 0.9278 |
| Student 4 | 103.25 | 1.815 | 8.75 | 1.815 | 1239 | 105 | 0.9219 |
| Student 5 | 96.5 | 2.908 | 15.5 | 2.908 | 1158 | 186 | 0.8616 |
| LLM(O, IR, 1) | 95.417 | 2.314 | 16.583 | 2.314 | 1145 | 199 | 0.8519 |
| LLM(O, A2, 1) | 94.583 | 2.314 | 17.417 | 2.314 | 1135 | 209 | 0.8445 |
| Student 6 | 93.167 | 1.899 | 18.833 | 1.899 | 1118 | 226 | 0.8318 |
| Student 7 | 93.167 | 3.563 | 18.833 | 3.563 | 1118 | 226 | 0.8318 |
| LLM(O, A1, 1) | 86.083 | 3.029 | 25.917 | 3.029 | 1033 | 311 | 0.7686 |
| LLM(O, GEN, 2) | 84.083 | 6.947 | 27.917 | 6.947 | 1009 | 335 | 0.7507 |
| LLM(O, CR, 2) | 83.5 | 4.442 | 28.5 | 4.442 | 1002 | 342 | 0.7455 |
| Student 8 | 83.417 | 4.122 | 28.583 | 4.122 | 1001 | 343 | 0.7448 |
| RiskSeeking | 82.417 | 3.343 | 29.583 | 3.343 | 989 | 355 | 0.7359 |
| LLM(O, GEN, 1) | 80.667 | 4.355 | 31.25 | 4.372 | 968 | 375 | 0.7208 |
| ModelOpponent | 80.583 | 3.26 | 31.417 | 3.26 | 967 | 377 | 0.7195 |
| LLM(D, A1, 1) | 79.417 | 3.965 | 32.583 | 3.965 | 953 | 391 | 0.7091 |
| ExpCostFixedBid | 77.167 | 4.951 | 34.833 | 4.951 | 926 | 418 | 0.689 |
| LLM(O, IR, 2) | 73.917 | 3.502 | 38 | 3.618 | 887 | 456 | 0.6605 |
| LLM(O, A1, 2) | 72.417 | 2.193 | 39.583 | 2.193 | 869 | 475 | 0.6466 |
| LLM(G, A1, 2) | 68.5 | 3.555 | 43.5 | 3.555 | 822 | 522 | 0.6116 |
| LLM(A, GEN, 2) | 67.917 | 2.968 | 44.083 | 2.968 | 815 | 529 | 0.6064 |
| LLM(G, IR, 2) | 65.917 | 2.314 | 46.083 | 2.314 | 791 | 553 | 0.5885 |
| Student 9 | 64.167 | 11.044 | 47.833 | 11.044 | 770 | 574 | 0.5729 |
| LLM(G, A1, 1) | 64 | 4.243 | 47.917 | 4.316 | 768 | 575 | 0.5719 |
| LLM(G, IR, 1) | 60.333 | 3.725 | 51.667 | 3.725 | 724 | 620 | 0.5387 |
| LLM(O, A2, 2) | 59.333 | 4.499 | 52.667 | 4.499 | 712 | 632 | 0.5298 |
| LLM(D, CR, 1) | 55.083 | 6.694 | 56.833 | 6.59 | 661 | 682 | 0.4922 |
| LLM(G, GEN, 2) | 53.167 | 3.664 | 58.833 | 3.664 | 638 | 706 | 0.4747 |
| LLM(D, GEN, 2) | 52.083 | 9.06 | 59.917 | 9.06 | 625 | 719 | 0.465 |
| Honest | 50.583 | 3.848 | 61.417 | 3.848 | 607 | 737 | 0.4516 |
| Student 10 | 48.833 | 2.98 | 63.167 | 2.98 | 586 | 758 | 0.436 |
| LLM(D, IR, 1) | 48.583 | 10.211 | 63.417 | 10.211 | 583 | 761 | 0.4338 |
| LLM(A, A1, 1) | 48 | 4.69 | 64 | 4.69 | 576 | 768 | 0.4286 |
| LLM(G, A2, 1) | 47.25 | 3.864 | 64.75 | 3.864 | 567 | 777 | 0.4219 |
| LLM(A, CR, 1) | 43.833 | 4.609 | 68.167 | 4.609 | 526 | 818 | 0.3914 |
| LLM(A, A1, 2) | 43.75 | 2.05 | 68.25 | 2.05 | 525 | 819 | 0.3906 |
| Student 11 | 42.083 | 5.664 | 69.917 | 5.664 | 505 | 839 | 0.3757 |
| LLM(A, IR, 1) | 39.5 | 2.541 | 72.5 | 2.541 | 474 | 870 | 0.3527 |
| Naive | 36.75 | 1.712 | 75.25 | 1.712 | 441 | 903 | 0.3281 |
| Student 12 | 36.333 | 1.775 | 75.667 | 1.775 | 436 | 908 | 0.3244 |
| LLM(D, A2, 1) | 33.917 | 2.193 | 78.083 | 2.193 | 407 | 937 | 0.3028 |
| LLM(A, GEN, 1) | 30.167 | 1.749 | 81.833 | 1.749 | 362 | 982 | 0.2693 |
| LLM(D, A2, 2) | 29.833 | 2.038 | 82.167 | 2.038 | 358 | 986 | 0.2664 |
| LLM(G, A2, 2) | 27 | 2.256 | 85 | 2.256 | 324 | 1020 | 0.2411 |
| LLM(A, A2, 1) | 26.333 | 0.985 | 85.667 | 0.985 | 316 | 1028 | 0.2351 |
| LLM(O, CR, 1) | 25 | 3.411 | 87 | 3.411 | 300 | 1044 | 0.2232 |
| LLM(A, IR, 2) | 24.333 | 8.542 | 87.667 | 8.542 | 292 | 1052 | 0.2173 |
| LLM(A, A2, 2) | 24 | 1.809 | 88 | 1.809 | 288 | 1056 | 0.2143 |
| LLM(A, CR, 2) | 23.333 | 1.557 | 88.667 | 1.557 | 280 | 1064 | 0.2083 |
| LLM(D, GEN, 1) | 22.5 | 1.784 | 89.5 | 1.784 | 270 | 1074 | 0.2009 |
| LLM(D, A1, 2) | 13.333 | 1.826 | 98.667 | 1.826 | 160 | 1184 | 0.119 |
| LLM(G, CR, 1) | 9.5 | 1.087 | 102.5 | 1.087 | 114 | 1230 | 0.0848 |
| LLM(G, GEN, 1) | 9.167 | 0.937 | 102.833 | 0.937 | 110 | 1234 | 0.0818 |
| LLM(D, IR, 2) | 7.75 | 0.622 | 104.25 | 0.622 | 93 | 1251 | 0.0692 |
| LLM(G, CR, 2) | 7.25 | 1.422 | 104.75 | 1.422 | 87 | 1257 | 0.0647 |
| LLM(D, CR, 2) | 5.667 | 0.985 | 106.333 | 0.985 | 68 | 1276 | 0.0506 |
Fiecare agent a jucat 112 meciuri pe turneu. Abaterea standard (SD) arată variația între turnee. Agenții umani sunt îngroșați. Cei LLM sunt identificați prin model (O = GPT-5 Thinking, G = Gemini 2.5 Pro, A = Claude Opus 4.1, D = DeepSeek R1), codul strategiei de prompt și numărul primei sau celei de-a doua generări. SursăDespre rezultate, autorii spun†:
„LLM-urile nu au produs cod competitiv nici în variante mai simple ale APDP, deși codul era în mare parte fără erori de sintaxă. Sunt necesare benchmark-uri de evaluare bazate pe raționament, dincolo de autocompletare.”
„Agenții umani au fost clar superiori: primele cinci locuri au revenit constant studenților, iar 33 din 40 de agenți LLM au fost bătuți de strategii de bază foarte simple.”
„Nu am depanat codul studenților, dar am testat și depanat atent codul LLM. La fiecare blocare a unui student, LLM-ul primea automat victoria. Multe blocări erau ușor de remediat, deci studenții ar fi putut clasa și mai sus.”
Într-un experiment suplimentar, GPT-5 Thinking a încercat să îmbunătățească cel mai bun agent uman, Student 1; versiunea modificată a coborât pe locul zece, cel mai slab rezultat uman. Modificările au degradat performanța cu aproape 20%. Autorii concluzionează:
„Rezultatele arată limite importante ale generării de cod cu LLM, în special în raționare și planificare. Codul modern poate rula fără erori de sintaxă, dar acesta nu este benchmark-ul potrivit pentru progresul spre inteligență generală avansată.”
Concluzie
Autorii recunosc că vibe coding a oferit putere oamenilor cu orice nivel tehnic și îl descriu drept o forță de egalizare. Totuși, limitele sale sunt încă necunoscute și probabil mai joase decât se presupune. Ei cer schimbarea obiectivului „de la cod care se compilează la cod care concurează”. Cititorul poate întreba dacă testul compară corect lucrurile, fiindcă sarcina agentică este mult mai complexă decât scripturile PowerShell și micile funcții la care vibe coding excelează. * Notă: lucrarea folosește constant numele „DeepThink R1”, care pare să nu existe și probabil este o scriere greșită a „DeepSeek R1”. Dacă aceasta este eroarea mea, vă rog să mă contactați și voi corecta.† Sublinierea aparține autorilor.Publicat inițial miercuri, 26 noiembrie 2025. Modificat la 17:35 EST pentru formatare.












