Unghiul lui Anderson

Codul Uman Din 2020 A Învinge Agentii Vibe-Codati în Testele Agentice

mm
Adaugă Unite.AI la sursele tale preferate pe Google
AI-generated image: a Victorian coach and horses winning formula 1 against modern race car competitors. gpt-image-1.

ChatGPT și alte instrumente de vibe coding au fost testate în aproape 40.000 de meciuri și au pierdut în fața codului scris de masteranzi înainte de apariția modelelor lingvistice mari.Un nou studiu britanic a comparat agenți programați de oameni cu agenți creați prin vibe coding cu cele mai noi modele lingvistice mari precum GPT-5 și Claude. Agenții realizați fără AI au câștigat ușor. Ambele grupuri au fost create de generații diferite de studenți ai laboratorului AI de la EPFL. Agenții fără AI proveneau dintr-un curs din 2020, cu doi ani înainte de ChatGPT, iar cei noi au fost făcuți de studenți actuali ajutați de cele mai bune LLM-uri. Chiar și cu avantaje acordate AI, soluțiile vibe-coded nu au câștigat: primele cinci locuri au revenit agenților umani, iar 33 din 40 de agenți LLM au fost învinși de strategii de bază foarte simple în 38.304 confruntări. Lucrarea afirmă:

„Deși LLM-urile moderne pot genera cod funcțional, fără erori de sintaxă, soluția nu concurează cu cele proiectate de oameni la planificare strategică, optimizare sau competiție multi-agent.”

„Această lucrare evidențiază noua frontieră a generării de cod și urmărește dezvoltarea de benchmark-uri, seturi de date și baze open-source care solicită sinteza de cod bazată pe raționament.”

Provocarea cerea participarea creativă la licitații și planificarea logisticii pentru livrarea sarcinilor câștigate. LLM-urile au primit avantaje, inclusiv intervenții asupra codului, inaccesibile soluțiilor din 2020. Totuși, chiar când li s-a oferit cod corectiv, nu l-au putut folosi:

„În benchmark-ul nostru, chiar dacă prezentăm în context o soluție bună, LLM-ul tot nu o poate utiliza.”

„Rezultatul ridică întrebări despre limitele învățării în context și ale rezolvării problemelor complexe cu recuperare de informații.”

Modelele testate au fost GPT-5 Thinking, Gemini 2.5 Pro, Claude Opus 4.1 și DeepSeek R1*. Noua lucrare se intitulează Can Vibe Coding Beat Graduate CS Students? An LLM vs. Human Coding Tournament on Market-driven Strategic Planning și are autori de la University of Southampton, University of Oxford și Alan Turing Institute. Benchmark-ul urmează să fie publicat în curând.

Metodă

Testele tradiționale folosesc adesea rezultate binare — corect sau incorect — verificate prin teste unitare. Autorii au conceput în schimb o provocare deschisă, cu repere multiple, în care victoria este posibilă, dar dificilă.Comparație între testele unitare standard și provocarea deschisă propusă de autori Comparație între abordările standard bazate pe teste unitare și scenariul mai deschis al autorilor. SursăProblema Auction, Pickup and Delivery (APDP) a fost aleasă și datorită unui corpus de cod studențesc din 2020, scris înainte ca AI să poată ajuta dezvoltarea. Studenții actuali au primit aceeași temă, dar au folosit instrumente moderne. Autorii au evitat benchmark-uri precum HumanEval, BigCodeBench și WebDev Arena din cauza contaminării datelor, când sistemul s-ar putea antrena pe datele de test în loc să respecte separarea seturilor.Licitațiile inverse și rutarea vehiculelor formează APDP. Mai întâi agenții licitează pentru sarcini de livrare: o ofertă prea mare pierde, una prea mică poate produce pierderi. Apoi planifică eficient doar sarcinile câștigate, folosind vehicule cu capacități și costuri diferite, sub limite de timp și resurse.În APDP, companiile licitează pentru livrări și optimizează rutele sarcinilor câștigate pentru profit maxim. În APDP, companiile licitează în licitații inverse și apoi optimizează rutele vehiculelor pentru sarcinile câștigate.Scopul este profitul maxim, anticipând grupurile avantajoase de sarcini și strategiile rivalilor. Fiecare licitație schimbă opțiunile următoare, deci agenții trebuie să gândească la cost, poziționare, timp și consecințe. Problema centrală este NP-hard: pe măsură ce numărul sarcinilor crește, nu există un algoritm care să găsească sigur soluția optimă într-un timp rezonabil.

Începe cursa

Evaluarea a comparat 40 de agenți LLM cu 17 agenți umani în 12 turnee, pe patru topologii rutiere, în sistem fiecare cu fiecare. Fiecare pereche s-a întâlnit de două ori, rezultând 3.192 de meciuri pe turneu și 38.304 în total. În fiecare meci s-au licitat 50 de livrări pe hărți inspirate din Elveția, Franța, Marea Britanie și Țările de Jos.Rețele rutiere simplificate din Marea Britanie, Elveția, Țările de Jos și Franța, cu sarcini și vehicule marcate. Rețelele rutiere simplificate ale turneului și pozițiile sarcinilor și vehiculelor.Agenții studenților proveneau din turneul unui curs din 2020: opt finaliști și încă patru performanți față de strategiile de bază. Acestea foloseau euristici fixe. Naive calcula distanța și licita folosind un singur vehicul; ExpCostFixedBid simula zece sarcini și oferea costul marginal mediu; Honest calcula costul real al inserării în program; ModelOpponent adăuga o estimare a costului rivalului; iar RiskSeeking combina o estimare care scădea în timp cu costul curent și modelarea rivalului. Cei 40 de agenți LLM au fost generați cu GPT-5 Thinking, Claude Opus 4.1, Gemini 2.5 Pro și DeepSeek R1, fiecare cu cinci strategii de prompt, de două ori. Două prompturi erau statice, unul cerea autoreflecție, altul critica printr-un LLM separat, iar ultimul era sintetizat de GPT-4. Promptul de bază reproducea tema studenților. Agenții au fost testați și depanați de LLM-uri până la eliminarea erorilor observabile. Eșecurile frecvente includeau depășirea timpului, neluarea sau nelivrarea sarcinilor și depășirea capacității vehiculelor, adesea din ignorarea instrucțiunilor sau replanificare defectuoasă†:

„O problemă frecventă, mai ales la Gemini, Claude și DeepSeek, era imposibilitatea repetată de a rezolva un defect.”

„Un agent depășea constant timpul chiar după 5–15 cicluri în care modelul primea eroarea și furniza o versiune actualizată.”

„Singura soluție era reluarea de la zero. Obținerea unui cod fără erori a necesitat mult efort manual și a trebuit să generăm mult mai mulți agenți pentru a găsi 40 funcționali.”

Tabelul rezumă cele 12 turnee duble, aproape 40.000 de meciuri:

Agent Medie victorii / turneu SD victorii / turneu Medie înfrângeri / turneu SD înfrângeri / turneu Total victorii Total înfrângeri Rată de victorie
Student 1 108.167 1.193 3.833 1.193 1298 46 0.9658
Student 2 104.917 2.539 7.083 2.539 1259 85 0.9368
Student 3 103.917 2.466 8.083 2.466 1247 97 0.9278
Student 4 103.25 1.815 8.75 1.815 1239 105 0.9219
Student 5 96.5 2.908 15.5 2.908 1158 186 0.8616
LLM(O, IR, 1) 95.417 2.314 16.583 2.314 1145 199 0.8519
LLM(O, A2, 1) 94.583 2.314 17.417 2.314 1135 209 0.8445
Student 6 93.167 1.899 18.833 1.899 1118 226 0.8318
Student 7 93.167 3.563 18.833 3.563 1118 226 0.8318
LLM(O, A1, 1) 86.083 3.029 25.917 3.029 1033 311 0.7686
LLM(O, GEN, 2) 84.083 6.947 27.917 6.947 1009 335 0.7507
LLM(O, CR, 2) 83.5 4.442 28.5 4.442 1002 342 0.7455
Student 8 83.417 4.122 28.583 4.122 1001 343 0.7448
RiskSeeking 82.417 3.343 29.583 3.343 989 355 0.7359
LLM(O, GEN, 1) 80.667 4.355 31.25 4.372 968 375 0.7208
ModelOpponent 80.583 3.26 31.417 3.26 967 377 0.7195
LLM(D, A1, 1) 79.417 3.965 32.583 3.965 953 391 0.7091
ExpCostFixedBid 77.167 4.951 34.833 4.951 926 418 0.689
LLM(O, IR, 2) 73.917 3.502 38 3.618 887 456 0.6605
LLM(O, A1, 2) 72.417 2.193 39.583 2.193 869 475 0.6466
LLM(G, A1, 2) 68.5 3.555 43.5 3.555 822 522 0.6116
LLM(A, GEN, 2) 67.917 2.968 44.083 2.968 815 529 0.6064
LLM(G, IR, 2) 65.917 2.314 46.083 2.314 791 553 0.5885
Student 9 64.167 11.044 47.833 11.044 770 574 0.5729
LLM(G, A1, 1) 64 4.243 47.917 4.316 768 575 0.5719
LLM(G, IR, 1) 60.333 3.725 51.667 3.725 724 620 0.5387
LLM(O, A2, 2) 59.333 4.499 52.667 4.499 712 632 0.5298
LLM(D, CR, 1) 55.083 6.694 56.833 6.59 661 682 0.4922
LLM(G, GEN, 2) 53.167 3.664 58.833 3.664 638 706 0.4747
LLM(D, GEN, 2) 52.083 9.06 59.917 9.06 625 719 0.465
Honest 50.583 3.848 61.417 3.848 607 737 0.4516
Student 10 48.833 2.98 63.167 2.98 586 758 0.436
LLM(D, IR, 1) 48.583 10.211 63.417 10.211 583 761 0.4338
LLM(A, A1, 1) 48 4.69 64 4.69 576 768 0.4286
LLM(G, A2, 1) 47.25 3.864 64.75 3.864 567 777 0.4219
LLM(A, CR, 1) 43.833 4.609 68.167 4.609 526 818 0.3914
LLM(A, A1, 2) 43.75 2.05 68.25 2.05 525 819 0.3906
Student 11 42.083 5.664 69.917 5.664 505 839 0.3757
LLM(A, IR, 1) 39.5 2.541 72.5 2.541 474 870 0.3527
Naive 36.75 1.712 75.25 1.712 441 903 0.3281
Student 12 36.333 1.775 75.667 1.775 436 908 0.3244
LLM(D, A2, 1) 33.917 2.193 78.083 2.193 407 937 0.3028
LLM(A, GEN, 1) 30.167 1.749 81.833 1.749 362 982 0.2693
LLM(D, A2, 2) 29.833 2.038 82.167 2.038 358 986 0.2664
LLM(G, A2, 2) 27 2.256 85 2.256 324 1020 0.2411
LLM(A, A2, 1) 26.333 0.985 85.667 0.985 316 1028 0.2351
LLM(O, CR, 1) 25 3.411 87 3.411 300 1044 0.2232
LLM(A, IR, 2) 24.333 8.542 87.667 8.542 292 1052 0.2173
LLM(A, A2, 2) 24 1.809 88 1.809 288 1056 0.2143
LLM(A, CR, 2) 23.333 1.557 88.667 1.557 280 1064 0.2083
LLM(D, GEN, 1) 22.5 1.784 89.5 1.784 270 1074 0.2009
LLM(D, A1, 2) 13.333 1.826 98.667 1.826 160 1184 0.119
LLM(G, CR, 1) 9.5 1.087 102.5 1.087 114 1230 0.0848
LLM(G, GEN, 1) 9.167 0.937 102.833 0.937 110 1234 0.0818
LLM(D, IR, 2) 7.75 0.622 104.25 0.622 93 1251 0.0692
LLM(G, CR, 2) 7.25 1.422 104.75 1.422 87 1257 0.0647
LLM(D, CR, 2) 5.667 0.985 106.333 0.985 68 1276 0.0506

Fiecare agent a jucat 112 meciuri pe turneu. Abaterea standard (SD) arată variația între turnee. Agenții umani sunt îngroșați. Cei LLM sunt identificați prin model (O = GPT-5 Thinking, G = Gemini 2.5 Pro, A = Claude Opus 4.1, D = DeepSeek R1), codul strategiei de prompt și numărul primei sau celei de-a doua generări. SursăDespre rezultate, autorii spun†:

„LLM-urile nu au produs cod competitiv nici în variante mai simple ale APDP, deși codul era în mare parte fără erori de sintaxă. Sunt necesare benchmark-uri de evaluare bazate pe raționament, dincolo de autocompletare.”

„Agenții umani au fost clar superiori: primele cinci locuri au revenit constant studenților, iar 33 din 40 de agenți LLM au fost bătuți de strategii de bază foarte simple.”

„Nu am depanat codul studenților, dar am testat și depanat atent codul LLM. La fiecare blocare a unui student, LLM-ul primea automat victoria. Multe blocări erau ușor de remediat, deci studenții ar fi putut clasa și mai sus.”

Într-un experiment suplimentar, GPT-5 Thinking a încercat să îmbunătățească cel mai bun agent uman, Student 1; versiunea modificată a coborât pe locul zece, cel mai slab rezultat uman. Modificările au degradat performanța cu aproape 20%. Autorii concluzionează:

„Rezultatele arată limite importante ale generării de cod cu LLM, în special în raționare și planificare. Codul modern poate rula fără erori de sintaxă, dar acesta nu este benchmark-ul potrivit pentru progresul spre inteligență generală avansată.”

Concluzie

Autorii recunosc că vibe coding a oferit putere oamenilor cu orice nivel tehnic și îl descriu drept o forță de egalizare. Totuși, limitele sale sunt încă necunoscute și probabil mai joase decât se presupune. Ei cer schimbarea obiectivului „de la cod care se compilează la cod care concurează”. Cititorul poate întreba dacă testul compară corect lucrurile, fiindcă sarcina agentică este mult mai complexă decât scripturile PowerShell și micile funcții la care vibe coding excelează. * Notă: lucrarea folosește constant numele „DeepThink R1”, care pare să nu existe și probabil este o scriere greșită a „DeepSeek R1”. Dacă aceasta este eroarea mea, vă rog să mă contactați și voi corecta.† Sublinierea aparține autorilor.Publicat inițial miercuri, 26 noiembrie 2025. Modificat la 17:35 EST pentru formatare.

Scriitor în învățare automată, specialist de domeniu în sinteza imaginilor umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai de la DNEG.
Site web: martinanderson.ai
Contact: martin@martinanderson.ai