Andersonův úhel

Lidský kód z roku 2020 porazil agentů vytvořených pomocí vibračního kódování v agentských testech

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
AI-generated image: a Victorian coach and horses winning formula 1 against modern race car competitors. gpt-image-1.

ChatGPT a další nástroje pro vibe coding byly otestovány v téměř 40 000 zápasech – a prohrály s kódem postgraduálních studentů napsaným před vznikem velkých jazykových modelů.Nová britská studie postavila agenty napsané lidmi proti agentům vytvořeným pomocí vibe codingu s nejnovějšími velkými jazykovými modely jako GPT-5 a Claude. Agenti bez AI snadno zvítězili. Obě skupiny vytvořily různé ročníky studentů laboratoře AI na EPFL. Původní agenti vznikli v kurzu roku 2020, dva roky před ChatGPT, zatímco nové vytvořili současní studenti s pomocí nejlepších LLM. Ani s výhodami řešení vytvořená s AI nevyhrála. Prvních pět míst patřilo lidem a 33 ze 40 agentů LLM porazily velmi jednoduché základní strategie ve 38 304 utkáních. Autoři uvádějí:

„Ačkoli moderní LLM dokážou vytvořit spustitelný kód bez syntaktických chyb, jejich řešení nekonkuruje lidským návrhům ve strategickém plánování, optimalizaci ani soutěži více agentů.“

„Práce ukazuje novou hranici generování kódu a podporuje vývoj benchmarků, datových sad a otevřených základů zdůrazňujících syntézu kódu založenou na uvažování.“

Úkolem bylo kreativně se účastnit aukcí s různými strategiemi a naplánovat logistiku vyhraných dodávek. LLM dostaly výhody, včetně možnosti opravovat kód, kterou řešení z roku 2020 neměla. Ani když jim byl ukázán opravný kód, nedokázaly jej využít:

„I když v kontextu ukážeme dobré řešení, LLM jej stále nedokáže použít.“

„Výsledek otevírá otázky o limitech učení v kontextu a řešení složitých problémů s vyhledáváním informací.“

Testovány byly GPT-5 Thinking, Gemini 2.5 Pro, Claude Opus 4.1 a DeepSeek R1*. Nová studie se jmenuje Can Vibe Coding Beat Graduate CS Students? An LLM vs. Human Coding Tournament on Market-driven Strategic Planning a pochází od autorů z University of Southampton, University of Oxford a Alan Turing Institute. Benchmark má být brzy zveřejněn.

Metoda

Tradiční testy se zaměřují na binární výsledky — správně nebo nesprávně — ověřené pomocí jednotkových testů. Autoři proto navrhli otevřenější vícestupňovou výzvu, v níž je vítězství možné, ale obtížné.Srovnání standardních jednotkových testů s otevřenou výzvou autorů Srovnání přístupu založeného na jednotkových testech a otevřenějšího scénáře. ZdrojProblém Auction, Pickup and Delivery (APDP) byl zvolen i proto, že existoval soubor studentského kódu z roku 2020, vytvořený před pomocí AI. Dnešní studenti dostali stejné zadání s moderními nástroji. Autoři se vyhnuli benchmarkům HumanEval, BigCodeBench a WebDev Arena kvůli možné kontaminaci dat, kdy se systém mohl učit na testovacích datech namísto dodržení správného rozdělení.Reverzní aukce a plánování tras vozidel tvoří dvoufázový APDP. Nejprve agenti nabízejí cenu za doručení; příliš vysoká nabídka prohraje, příliš nízká může být ztrátová. Poté plánují jen vyhrané úkoly pro vozidla s různou kapacitou a náklady v časových a zdrojových omezeních.V APDP firmy soutěží o dodávky a optimalizují trasy vyhraných úkolů pro maximální zisk. Firmy nabízejí v reverzních aukcích a poté optimalizují trasy vozidel pro vyhrané úkoly.Cílem je maximalizovat zisk předvídáním výhodných balíků úkolů a strategií soupeřů. Každá aukce mění budoucí možnosti, takže agent musí uvažovat o nákladech, pozici, čase a dlouhodobých důsledcích. Jádro problému je NP-hard: s rostoucím počtem úkolů nelze spolehlivě najít nejlepší řešení v rozumném čase.

Závod začíná

Hodnocení porovnalo 40 agentů LLM se 17 lidskými agenty ve 12 turnajích na čtyřech silničních topologiích formátem každý s každým. Každá dvojice hrála dvakrát, což dalo 3 192 zápasů na turnaj a 38 304 celkem. V každém zápase se dražilo 50 dodávek na mapách Švýcarska, Francie, Velké Británie a Nizozemska.Zjednodušené silniční sítě Velké Británie, Švýcarska, Nizozemska a Francie s úkoly a vozidly. Silniční sítě použité v turnaji a označení úkolů a poloh vozidel.Studentští agenti pocházeli z turnaje kurzu roku 2020: osm finalistů a čtyři další silní proti základům. Základní agenti používali pevné heuristiky. Naive počítal celkovou vzdálenost s jedním vozidlem; ExpCostFixedBid simuloval deset úkolů a nabízel průměrné mezní náklady; Honest počítal skutečné mezní náklady; ModelOpponent přidal odhad nákladů soupeře; a RiskSeeking spojil časově klesající odhad s aktuálními náklady a modelem soupeře. Čtyřicet agentů LLM vzniklo pomocí GPT-5 Thinking, Claude Opus 4.1, Gemini 2.5 Pro a DeepSeek R1, každý s pěti strategiemi promptu dvakrát. Dva prompty byly statické, třetí vyžadoval sebereflexi, čtvrtý kritiku jiným LLM a pátý syntetizoval GPT-4. Základní prompt odpovídal původnímu studentskému zadání. Agenti LLM byli testováni a opravováni samotnými modely, dokud nezmizely pozorované chyby. Častými selháními byly časové limity, nevyzvednutí či nedoručení úkolů a porušení kapacity vozidel kvůli ignorování pokynů nebo chybnému přeplánování†:

„Častým problémem, zejména u Gemini, Claude a DeepSeek, bylo opakované selhání při opravě chyby.“

„Agent stále překračoval časový limit i po 5–15 cyklech, kdy LLM dostal chybu a dodal novou verzi kódu.“

„Jediným řešením bylo začít od nuly. Bezchybný kód vyžadoval značné ruční úsilí a museli jsme vytvořit mnohem více agentů, abychom získali 40 funkčních.“

Tabulka shrnuje 12 dvojitých turnajů, téměř 40 000 zápasů:

Agent Prům. výher / turnaj SD výher / turnaj Prům. proher / turnaj SD proher / turnaj Výhry celkem Prohry celkem Úspěšnost
Student 1 108.167 1.193 3.833 1.193 1298 46 0.9658
Student 2 104.917 2.539 7.083 2.539 1259 85 0.9368
Student 3 103.917 2.466 8.083 2.466 1247 97 0.9278
Student 4 103.25 1.815 8.75 1.815 1239 105 0.9219
Student 5 96.5 2.908 15.5 2.908 1158 186 0.8616
LLM(O, IR, 1) 95.417 2.314 16.583 2.314 1145 199 0.8519
LLM(O, A2, 1) 94.583 2.314 17.417 2.314 1135 209 0.8445
Student 6 93.167 1.899 18.833 1.899 1118 226 0.8318
Student 7 93.167 3.563 18.833 3.563 1118 226 0.8318
LLM(O, A1, 1) 86.083 3.029 25.917 3.029 1033 311 0.7686
LLM(O, GEN, 2) 84.083 6.947 27.917 6.947 1009 335 0.7507
LLM(O, CR, 2) 83.5 4.442 28.5 4.442 1002 342 0.7455
Student 8 83.417 4.122 28.583 4.122 1001 343 0.7448
RiskSeeking 82.417 3.343 29.583 3.343 989 355 0.7359
LLM(O, GEN, 1) 80.667 4.355 31.25 4.372 968 375 0.7208
ModelOpponent 80.583 3.26 31.417 3.26 967 377 0.7195
LLM(D, A1, 1) 79.417 3.965 32.583 3.965 953 391 0.7091
ExpCostFixedBid 77.167 4.951 34.833 4.951 926 418 0.689
LLM(O, IR, 2) 73.917 3.502 38 3.618 887 456 0.6605
LLM(O, A1, 2) 72.417 2.193 39.583 2.193 869 475 0.6466
LLM(G, A1, 2) 68.5 3.555 43.5 3.555 822 522 0.6116
LLM(A, GEN, 2) 67.917 2.968 44.083 2.968 815 529 0.6064
LLM(G, IR, 2) 65.917 2.314 46.083 2.314 791 553 0.5885
Student 9 64.167 11.044 47.833 11.044 770 574 0.5729
LLM(G, A1, 1) 64 4.243 47.917 4.316 768 575 0.5719
LLM(G, IR, 1) 60.333 3.725 51.667 3.725 724 620 0.5387
LLM(O, A2, 2) 59.333 4.499 52.667 4.499 712 632 0.5298
LLM(D, CR, 1) 55.083 6.694 56.833 6.59 661 682 0.4922
LLM(G, GEN, 2) 53.167 3.664 58.833 3.664 638 706 0.4747
LLM(D, GEN, 2) 52.083 9.06 59.917 9.06 625 719 0.465
Honest 50.583 3.848 61.417 3.848 607 737 0.4516
Student 10 48.833 2.98 63.167 2.98 586 758 0.436
LLM(D, IR, 1) 48.583 10.211 63.417 10.211 583 761 0.4338
LLM(A, A1, 1) 48 4.69 64 4.69 576 768 0.4286
LLM(G, A2, 1) 47.25 3.864 64.75 3.864 567 777 0.4219
LLM(A, CR, 1) 43.833 4.609 68.167 4.609 526 818 0.3914
LLM(A, A1, 2) 43.75 2.05 68.25 2.05 525 819 0.3906
Student 11 42.083 5.664 69.917 5.664 505 839 0.3757
LLM(A, IR, 1) 39.5 2.541 72.5 2.541 474 870 0.3527
Naive 36.75 1.712 75.25 1.712 441 903 0.3281
Student 12 36.333 1.775 75.667 1.775 436 908 0.3244
LLM(D, A2, 1) 33.917 2.193 78.083 2.193 407 937 0.3028
LLM(A, GEN, 1) 30.167 1.749 81.833 1.749 362 982 0.2693
LLM(D, A2, 2) 29.833 2.038 82.167 2.038 358 986 0.2664
LLM(G, A2, 2) 27 2.256 85 2.256 324 1020 0.2411
LLM(A, A2, 1) 26.333 0.985 85.667 0.985 316 1028 0.2351
LLM(O, CR, 1) 25 3.411 87 3.411 300 1044 0.2232
LLM(A, IR, 2) 24.333 8.542 87.667 8.542 292 1052 0.2173
LLM(A, A2, 2) 24 1.809 88 1.809 288 1056 0.2143
LLM(A, CR, 2) 23.333 1.557 88.667 1.557 280 1064 0.2083
LLM(D, GEN, 1) 22.5 1.784 89.5 1.784 270 1074 0.2009
LLM(D, A1, 2) 13.333 1.826 98.667 1.826 160 1184 0.119
LLM(G, CR, 1) 9.5 1.087 102.5 1.087 114 1230 0.0848
LLM(G, GEN, 1) 9.167 0.937 102.833 0.937 110 1234 0.0818
LLM(D, IR, 2) 7.75 0.622 104.25 0.622 93 1251 0.0692
LLM(G, CR, 2) 7.25 1.422 104.75 1.422 87 1257 0.0647
LLM(D, CR, 2) 5.667 0.985 106.333 0.985 68 1276 0.0506

Každý agent odehrál 112 zápasů na turnaj. Směrodatná odchylka (SD) ukazuje variabilitu. Lidští agenti jsou tučně. Agenti LLM jsou označeni modelem (O = GPT-5 Thinking, G = Gemini 2.5 Pro, A = Claude Opus 4.1, D = DeepSeek R1), kódem strategie promptu a číslem prvního či druhého vygenerování. ZdrojK výsledkům autoři uvádějí†:

„LLM nevytvořily očekávaný ani konkurenceschopný kód ani v jednodušších variantách APDP, přestože byl většinou bez syntaktických chyb. Potřebujeme benchmarky založené na uvažování, které jdou za automatické doplňování.“

„Lidští agenti jasně dominovali: prvních pět míst trvale obsadili studenti a 33 ze 40 agentů LLM porazily velmi jednoduché základní strategie.“

„Studentský kód jsme neopravovali, zatímco kód LLM jsme důkladně testovali a ladili. Každý pád studenta znamenal automatickou výhru LLM. Mnoho pádů by šlo snadno opravit, takže studenti mohli být ještě výše.“

V dalším experimentu měl GPT-5 Thinking vylepšit nejlepšího lidského agenta Student 1; upravený agent klesl na desáté, nejhorší lidské místo. Změny snížily výkon téměř o 20 %. Autoři uzavírají:

„Výsledky ukazují zásadní omezení generování kódu LLM, zejména ve schopnosti uvažovat a plánovat. Kód bez syntaktických chyb není správným měřítkem pokroku k pokročilé obecné AI.“

Závěr

Autoři uznávají, že vibe coding zpřístupnil tvorbu lidem s různým technickým zázemím a působí jako vyrovnávací síla. Jeho hranice jsou však dosud neznámé a zřejmě nižší, než se předpokládá. Vyzývají k posunu cíle „od kódu, který se zkompiluje, ke kódu, který dokáže soutěžit“. Čtenář se může ptát, zda je srovnání přiměřené, protože agentní úloha je mnohem složitější než drobné skripty PowerShell a opravy, pro něž se vibe coding dobře hodí. * Poznámka: studie stále používá název „DeepThink R1“, který zřejmě neexistuje a pravděpodobně je chybným zápisem „DeepSeek R1“. Pokud se mýlím, kontaktujte mě přes profil a text opravím.† Zvýraznění pochází od autorů.Poprvé zveřejněno ve středu 26. listopadu 2025. Formátování upraveno v 17:35 EST.

Spisovatel v oblasti strojového učení, odborník na syntézu lidských obrazů. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího sloučení do Brahma.ai společnosti DNEG.
Webová stránka: martinanderson.ai
Kontakt: martin@martinanderson.ai