Andersonův úhel
Lidský kód z roku 2020 porazil agentů vytvořených pomocí vibračního kódování v agentských testech

ChatGPT a další nástroje pro vibe coding byly otestovány v téměř 40 000 zápasech – a prohrály s kódem postgraduálních studentů napsaným před vznikem velkých jazykových modelů.Nová britská studie postavila agenty napsané lidmi proti agentům vytvořeným pomocí vibe codingu s nejnovějšími velkými jazykovými modely jako GPT-5 a Claude. Agenti bez AI snadno zvítězili. Obě skupiny vytvořily různé ročníky studentů laboratoře AI na EPFL. Původní agenti vznikli v kurzu roku 2020, dva roky před ChatGPT, zatímco nové vytvořili současní studenti s pomocí nejlepších LLM. Ani s výhodami řešení vytvořená s AI nevyhrála. Prvních pět míst patřilo lidem a 33 ze 40 agentů LLM porazily velmi jednoduché základní strategie ve 38 304 utkáních. Autoři uvádějí:
„Ačkoli moderní LLM dokážou vytvořit spustitelný kód bez syntaktických chyb, jejich řešení nekonkuruje lidským návrhům ve strategickém plánování, optimalizaci ani soutěži více agentů.“
„Práce ukazuje novou hranici generování kódu a podporuje vývoj benchmarků, datových sad a otevřených základů zdůrazňujících syntézu kódu založenou na uvažování.“
Úkolem bylo kreativně se účastnit aukcí s různými strategiemi a naplánovat logistiku vyhraných dodávek. LLM dostaly výhody, včetně možnosti opravovat kód, kterou řešení z roku 2020 neměla. Ani když jim byl ukázán opravný kód, nedokázaly jej využít:
„I když v kontextu ukážeme dobré řešení, LLM jej stále nedokáže použít.“
„Výsledek otevírá otázky o limitech učení v kontextu a řešení složitých problémů s vyhledáváním informací.“
Testovány byly GPT-5 Thinking, Gemini 2.5 Pro, Claude Opus 4.1 a DeepSeek R1*. Nová studie se jmenuje Can Vibe Coding Beat Graduate CS Students? An LLM vs. Human Coding Tournament on Market-driven Strategic Planning a pochází od autorů z University of Southampton, University of Oxford a Alan Turing Institute. Benchmark má být brzy zveřejněn.
Metoda
Tradiční testy se zaměřují na binární výsledky — správně nebo nesprávně — ověřené pomocí jednotkových testů. Autoři proto navrhli otevřenější vícestupňovou výzvu, v níž je vítězství možné, ale obtížné.

Závod začíná
Hodnocení porovnalo 40 agentů LLM se 17 lidskými agenty ve 12 turnajích na čtyřech silničních topologiích formátem každý s každým. Každá dvojice hrála dvakrát, což dalo 3 192 zápasů na turnaj a 38 304 celkem. V každém zápase se dražilo 50 dodávek na mapách Švýcarska, Francie, Velké Británie a Nizozemska.
„Častým problémem, zejména u Gemini, Claude a DeepSeek, bylo opakované selhání při opravě chyby.“
„Agent stále překračoval časový limit i po 5–15 cyklech, kdy LLM dostal chybu a dodal novou verzi kódu.“
„Jediným řešením bylo začít od nuly. Bezchybný kód vyžadoval značné ruční úsilí a museli jsme vytvořit mnohem více agentů, abychom získali 40 funkčních.“
Tabulka shrnuje 12 dvojitých turnajů, téměř 40 000 zápasů:
| Agent | Prům. výher / turnaj | SD výher / turnaj | Prům. proher / turnaj | SD proher / turnaj | Výhry celkem | Prohry celkem | Úspěšnost |
|---|---|---|---|---|---|---|---|
| Student 1 | 108.167 | 1.193 | 3.833 | 1.193 | 1298 | 46 | 0.9658 |
| Student 2 | 104.917 | 2.539 | 7.083 | 2.539 | 1259 | 85 | 0.9368 |
| Student 3 | 103.917 | 2.466 | 8.083 | 2.466 | 1247 | 97 | 0.9278 |
| Student 4 | 103.25 | 1.815 | 8.75 | 1.815 | 1239 | 105 | 0.9219 |
| Student 5 | 96.5 | 2.908 | 15.5 | 2.908 | 1158 | 186 | 0.8616 |
| LLM(O, IR, 1) | 95.417 | 2.314 | 16.583 | 2.314 | 1145 | 199 | 0.8519 |
| LLM(O, A2, 1) | 94.583 | 2.314 | 17.417 | 2.314 | 1135 | 209 | 0.8445 |
| Student 6 | 93.167 | 1.899 | 18.833 | 1.899 | 1118 | 226 | 0.8318 |
| Student 7 | 93.167 | 3.563 | 18.833 | 3.563 | 1118 | 226 | 0.8318 |
| LLM(O, A1, 1) | 86.083 | 3.029 | 25.917 | 3.029 | 1033 | 311 | 0.7686 |
| LLM(O, GEN, 2) | 84.083 | 6.947 | 27.917 | 6.947 | 1009 | 335 | 0.7507 |
| LLM(O, CR, 2) | 83.5 | 4.442 | 28.5 | 4.442 | 1002 | 342 | 0.7455 |
| Student 8 | 83.417 | 4.122 | 28.583 | 4.122 | 1001 | 343 | 0.7448 |
| RiskSeeking | 82.417 | 3.343 | 29.583 | 3.343 | 989 | 355 | 0.7359 |
| LLM(O, GEN, 1) | 80.667 | 4.355 | 31.25 | 4.372 | 968 | 375 | 0.7208 |
| ModelOpponent | 80.583 | 3.26 | 31.417 | 3.26 | 967 | 377 | 0.7195 |
| LLM(D, A1, 1) | 79.417 | 3.965 | 32.583 | 3.965 | 953 | 391 | 0.7091 |
| ExpCostFixedBid | 77.167 | 4.951 | 34.833 | 4.951 | 926 | 418 | 0.689 |
| LLM(O, IR, 2) | 73.917 | 3.502 | 38 | 3.618 | 887 | 456 | 0.6605 |
| LLM(O, A1, 2) | 72.417 | 2.193 | 39.583 | 2.193 | 869 | 475 | 0.6466 |
| LLM(G, A1, 2) | 68.5 | 3.555 | 43.5 | 3.555 | 822 | 522 | 0.6116 |
| LLM(A, GEN, 2) | 67.917 | 2.968 | 44.083 | 2.968 | 815 | 529 | 0.6064 |
| LLM(G, IR, 2) | 65.917 | 2.314 | 46.083 | 2.314 | 791 | 553 | 0.5885 |
| Student 9 | 64.167 | 11.044 | 47.833 | 11.044 | 770 | 574 | 0.5729 |
| LLM(G, A1, 1) | 64 | 4.243 | 47.917 | 4.316 | 768 | 575 | 0.5719 |
| LLM(G, IR, 1) | 60.333 | 3.725 | 51.667 | 3.725 | 724 | 620 | 0.5387 |
| LLM(O, A2, 2) | 59.333 | 4.499 | 52.667 | 4.499 | 712 | 632 | 0.5298 |
| LLM(D, CR, 1) | 55.083 | 6.694 | 56.833 | 6.59 | 661 | 682 | 0.4922 |
| LLM(G, GEN, 2) | 53.167 | 3.664 | 58.833 | 3.664 | 638 | 706 | 0.4747 |
| LLM(D, GEN, 2) | 52.083 | 9.06 | 59.917 | 9.06 | 625 | 719 | 0.465 |
| Honest | 50.583 | 3.848 | 61.417 | 3.848 | 607 | 737 | 0.4516 |
| Student 10 | 48.833 | 2.98 | 63.167 | 2.98 | 586 | 758 | 0.436 |
| LLM(D, IR, 1) | 48.583 | 10.211 | 63.417 | 10.211 | 583 | 761 | 0.4338 |
| LLM(A, A1, 1) | 48 | 4.69 | 64 | 4.69 | 576 | 768 | 0.4286 |
| LLM(G, A2, 1) | 47.25 | 3.864 | 64.75 | 3.864 | 567 | 777 | 0.4219 |
| LLM(A, CR, 1) | 43.833 | 4.609 | 68.167 | 4.609 | 526 | 818 | 0.3914 |
| LLM(A, A1, 2) | 43.75 | 2.05 | 68.25 | 2.05 | 525 | 819 | 0.3906 |
| Student 11 | 42.083 | 5.664 | 69.917 | 5.664 | 505 | 839 | 0.3757 |
| LLM(A, IR, 1) | 39.5 | 2.541 | 72.5 | 2.541 | 474 | 870 | 0.3527 |
| Naive | 36.75 | 1.712 | 75.25 | 1.712 | 441 | 903 | 0.3281 |
| Student 12 | 36.333 | 1.775 | 75.667 | 1.775 | 436 | 908 | 0.3244 |
| LLM(D, A2, 1) | 33.917 | 2.193 | 78.083 | 2.193 | 407 | 937 | 0.3028 |
| LLM(A, GEN, 1) | 30.167 | 1.749 | 81.833 | 1.749 | 362 | 982 | 0.2693 |
| LLM(D, A2, 2) | 29.833 | 2.038 | 82.167 | 2.038 | 358 | 986 | 0.2664 |
| LLM(G, A2, 2) | 27 | 2.256 | 85 | 2.256 | 324 | 1020 | 0.2411 |
| LLM(A, A2, 1) | 26.333 | 0.985 | 85.667 | 0.985 | 316 | 1028 | 0.2351 |
| LLM(O, CR, 1) | 25 | 3.411 | 87 | 3.411 | 300 | 1044 | 0.2232 |
| LLM(A, IR, 2) | 24.333 | 8.542 | 87.667 | 8.542 | 292 | 1052 | 0.2173 |
| LLM(A, A2, 2) | 24 | 1.809 | 88 | 1.809 | 288 | 1056 | 0.2143 |
| LLM(A, CR, 2) | 23.333 | 1.557 | 88.667 | 1.557 | 280 | 1064 | 0.2083 |
| LLM(D, GEN, 1) | 22.5 | 1.784 | 89.5 | 1.784 | 270 | 1074 | 0.2009 |
| LLM(D, A1, 2) | 13.333 | 1.826 | 98.667 | 1.826 | 160 | 1184 | 0.119 |
| LLM(G, CR, 1) | 9.5 | 1.087 | 102.5 | 1.087 | 114 | 1230 | 0.0848 |
| LLM(G, GEN, 1) | 9.167 | 0.937 | 102.833 | 0.937 | 110 | 1234 | 0.0818 |
| LLM(D, IR, 2) | 7.75 | 0.622 | 104.25 | 0.622 | 93 | 1251 | 0.0692 |
| LLM(G, CR, 2) | 7.25 | 1.422 | 104.75 | 1.422 | 87 | 1257 | 0.0647 |
| LLM(D, CR, 2) | 5.667 | 0.985 | 106.333 | 0.985 | 68 | 1276 | 0.0506 |
Každý agent odehrál 112 zápasů na turnaj. Směrodatná odchylka (SD) ukazuje variabilitu. Lidští agenti jsou tučně. Agenti LLM jsou označeni modelem (O = GPT-5 Thinking, G = Gemini 2.5 Pro, A = Claude Opus 4.1, D = DeepSeek R1), kódem strategie promptu a číslem prvního či druhého vygenerování. ZdrojK výsledkům autoři uvádějí†:
„LLM nevytvořily očekávaný ani konkurenceschopný kód ani v jednodušších variantách APDP, přestože byl většinou bez syntaktických chyb. Potřebujeme benchmarky založené na uvažování, které jdou za automatické doplňování.“
„Lidští agenti jasně dominovali: prvních pět míst trvale obsadili studenti a 33 ze 40 agentů LLM porazily velmi jednoduché základní strategie.“
„Studentský kód jsme neopravovali, zatímco kód LLM jsme důkladně testovali a ladili. Každý pád studenta znamenal automatickou výhru LLM. Mnoho pádů by šlo snadno opravit, takže studenti mohli být ještě výše.“
V dalším experimentu měl GPT-5 Thinking vylepšit nejlepšího lidského agenta Student 1; upravený agent klesl na desáté, nejhorší lidské místo. Změny snížily výkon téměř o 20 %. Autoři uzavírají:
„Výsledky ukazují zásadní omezení generování kódu LLM, zejména ve schopnosti uvažovat a plánovat. Kód bez syntaktických chyb není správným měřítkem pokroku k pokročilé obecné AI.“
Závěr
Autoři uznávají, že vibe coding zpřístupnil tvorbu lidem s různým technickým zázemím a působí jako vyrovnávací síla. Jeho hranice jsou však dosud neznámé a zřejmě nižší, než se předpokládá. Vyzývají k posunu cíle „od kódu, který se zkompiluje, ke kódu, který dokáže soutěžit“. Čtenář se může ptát, zda je srovnání přiměřené, protože agentní úloha je mnohem složitější než drobné skripty PowerShell a opravy, pro něž se vibe coding dobře hodí. * Poznámka: studie stále používá název „DeepThink R1“, který zřejmě neexistuje a pravděpodobně je chybným zápisem „DeepSeek R1“. Pokud se mýlím, kontaktujte mě přes profil a text opravím.† Zvýraznění pochází od autorů.Poprvé zveřejněno ve středu 26. listopadu 2025. Formátování upraveno v 17:35 EST.












