Andersonův úhel
Vibe kódování trpí, když se role AI rozšiřuje

Nová studie zjistila, že vibe kódování se zlepšuje, když lidé poskytují instrukce, ale zhoršuje se, když je poskytují AI, přičemž nejlepší hybridní nastavení udržuje lidi na prvním místě a AI jako arbitra nebo soudce.
Nový výzkum z Spojených států, který zkoumal, co se stane, když jsou systémy AI povoleny řídit vibe kódování, místo aby pouze vykonávaly lidské instrukce, zjistil, že když velké jazykové modely (LLM) přebírají větší směrovací roli, výsledky jsou téměř vždy horší.
Ačkoli výzkumníci použili OpenAI’s GPT-5 jako rámec pro své experimenty s lidskou a AI spoluprací, později potvrdili, že i Anthropic’s Claude Opus 4.5 a Google Gemini 3 Pro byly podrobeny stejnému zhoršujícímu se trendu, jakmile se jejich odpovědnosti zvýšily, a uvedli, že “i omezená lidská účast neustále zlepšuje výkon”:
‘Lidé poskytují účinné vysoké úrovně vedení napříč iteracemi, [zatímco] vedení AI často vede ke kolapsu výkonu. Kromě toho zjistíme, že pečlivé rozdělení rolí, které udržuje lidi ve vedení směru, zatímco vybízí hodnocení na AI, může zlepšit hybridní výkon.’
Aby se zajistilo konzistentní test, který by mohl být vyhodnocen stejně lidmi i AI, byl vytvořen řízený experimentální rámec kolem iterativního kódovacího úkolu, ve kterém musel být reference obraz – featuring fotografie kočky, psa, tygra, ptáka, slona, tučňáka, žraloka, zebry, žirafy nebo pandy – rekreován pomocí skalárních vektorových grafik (SVG), a tato rekreace byla vyhodnocena proti fotografickému zdroji, ze kterého byla odvozena:

Both human and AI participants were shown a photographic reference image alongside an AI-generated SVG reconstruction, and asked to rate how similar the two were on a seven-point scale. Source
V každém kole jeden agent poskytoval vysoké úrovně přirozeného jazyka instrukcí pro vedení kódovacího generátoru, a jiný rozhodl, zda přijmout nebo odmítnout novou verzi – strukturovaný cyklus, který odráží reálné spolupracující pracovní postupy.
Počet 16 experimentů zahrnoval 604 účastníků a tisíce API volání. Plně lidské testovací kola byla porovnávána přímo s plně AI-vedenými koly, za jinak identických podmínek.

Some of the varied solutions arrived at by different combinations of human/AI collaboration percentages and types (taken from a larger illustration in the source paper, to which we refer the reader).
Ačkoli lidé a AI vykonali na podobné úrovni na začátku testů, jejich trajektorie se rozcházely: když lidé poskytli instrukce a učinili výběrové rozhodnutí, podobnost skóre se zvýšila napříč iteracemi, se stálým kumulativním zlepšením; ale když AI systémy vyplnily obě role, výkon ukázal žádné konzistentní zisky, a často se zhoršoval přes kola – i když stejný základní model byl použit pro kódování, a AI měl přístup ke stejné informaci jako lidské účastníky.
Prolixity efekt
Výsledky také ukázaly, že lidské instrukce byly obvykle krátké a akčně orientované, zaměřené na to, co změnit další v aktuálním obraze; naopak AI instrukce byly mnohem delší a hustě popisné (faktor, který byl parametrizován pro GPT-5), popisující vizuální atributy spíše než priorizující.incrementální opravu.
Ale, jak je vidět na grafu níže, ukládání přísných slov limitů na AI instrukce nezvrátilo vzorec; i když omezené na 10, 20 nebo 30 slov, AI-vedené řetězce stále selhaly při zlepšení se časem:

Similarity ratings across iterations for human-led rounds compared with fully AI-led rounds constrained to 10, 20, or 30-word instructions. Evidently, shortening AI prompts does not prevent the iterative performance decline observed when AI directs both instruction and selection.
Hybridní experimenty učinily vzorec jasnějším, ukazující, že přidání i malé lidské účasti zlepšilo výsledky, ve srovnání s plně AI-vedenými nastaveními; nicméně výkon obvykle klesal, jak se zvyšoval podíl AI vedení.
Když byly role odděleny, hodnocení a výběr mohly být svěřeny AI s relativně malou ztrátou kvality; ale nahrazení lidského vysokého úrovně vedení AI vedením vedlo k zřetelným poklesům výkonu, naznačujícím, že to, co bylo nejdůležitější, nebylo to, kdo generoval kód, ale kdo nastavil a udržel směr napříč iteracemi.
Autoři uzavírají:
‘Across multiple experiments, human-led coding consistently improved over iterations, while AI-led coding often collapsed despite access to the same information and similar execution capabilities.
‘This points to key struggles of today’s AI systems in sustaining coherent high-level direction across repeated interactions, of the kind necessary for successful vibe coding’
Nová práce je nazvána Proč lidské vedení záleží v kolaborativním vibe kódování, a pochází od sedmi výzkumníků z Cornell University, Princeton University, Massachusettského technologického institutu a Newyorské university.
Metoda
Pro experimenty byl lidský instruktor, který se podíval na GPT-5-generovaný zvířecí reference foto, spolu s nejnovější asociativní SVG napodobeninou. Poté napsal přirozený jazyk instrukcí pro vedení kódovacího generátoru směrem k bližšímu shodě.
Takže generátor by produkoval nový SVG každý kolo, poskytující iterativní smyčku pro testování, jak efekt vedení kumuluje se časem. Cílem byly deset GPT-5 generovaných zvířecích obrázků, pokrývajících řadu tvarů a textur, aby se zlepšení nebo chyby snadno detekovaly:

Schema for the vibe coding workflow used in the study. In A), a human instructor views a photographic reference image together with the best SVG produced so far and writes natural language instructions for the code generator to follow when producing the next SVG; in B), a human selector compares the new SVG with the previous one and chooses which version better matches the reference image, before passing the selected SVG forward for the next round of instruction; and in C), independent human evaluators rate how similar each generated SVG is to its reference image, supplying the scores used to assess overall performance.
Lidský selektor porovnal každý nově vygenerovaný SVG s předchozím a buď přijal nebo odmítl, což udržovalo proces zarovnaný s reference obrazem napříč koly. V tomto základním nastavení stejný člověk provedl obě role.
Pro měření kvality nezávislí lidské hodnotitelé ohodnotili, jak podobný je každý vygenerovaný SVG k jeho reference obrazu. Napříč šestnácti experimenty 120 lidí produkovalo 4 800 ohodnocení. Všechny experimenty byly spuštěny na PsyNet rámci, portálu navrženém pro strukturované interakce mezi lidmi a AI systémy.
Studie by rekrutovala 604 rodilých anglických mluvčích, v testech, které by spálily 4 800 API volání pro kódování, a 5 327 API volání pro instrukce. Ačkoli GPT-5 byl hlavním modelem použitým, menší srovnávací dávky byly provedeny s Claude Opus 4.5 a Gemini 3 Pro, které každé zpracovaly 280 dotazů.
Výsledky
Třicet vibe-kódovacích kol bylo spuštěno, každé sestávající z patnácti editací deseti referenčních obrázků. Pro tyto, 45 lidských účastníků bylo vybráno, každý sloužící jako selektor a instruktor napříč deseti iteracemi, v “lidsky vedených” kolech.
V rámci každého kola stejný účastník nejprve zvolil mezi aktuální a předchozí SVG, a poté napsal další kolo instrukcí. Druhá verze testu nahradila lidská rozhodnutí API voláními do GPT 5, zatímco zachovala zbytek nastavení nezměněné. Ve všech případech instruktor a selektor role vybízely kódovacího generátoru s prostým jazykem.
Reprezentativní příklad multi-kola vibe kódování ukazuje, jak proces diverguje se časem; když lidé jednali jako selektor a instruktor, SVG výstup se zlepšoval stabilně napříč iteracemi, pohybující se blíž k reference obrazu s každým kolem:

Example progressions for one reference image under human led (top) and AI led (bottom) vibe coding, showing steady improvement across iterations with humans in both roles, and stagnation or drift when both roles are handled by AI.
Naproti tomu, v AI-vedené verzi, rané kola někdy zachytila klíčové vizuální funkce, ale pozdější pokusy selhaly při budování na těchto ziscích, a v některých případech se odchýlily od cíle:

Final outputs from the final iteration, comparing human-led turns (top row) with AI led chains (bottom row), across the same set of reference images. The human-led results more closely match the original animals, while the AI-led results demonstrate visible distortions, or loss of key features.
Pro měření vznikajících trendů kvantitativně, finální obrazy byly ukázány nezávislým lidským hodnotitelům a ohodnoceny pro podobnost k reference obrazům. V raných kolech, lidsky vedené a AI-vedené běhy ohodnotily लगभग stejně; ale do patnáctého kola, rozdíl byl jasný, s lidsky vybranými obrázky ohodnocenými mnohem blíž k cíli. Se časem, lidské skóre se zvyšovalo stabilně, s největší relativní ziskem nad AI dosahujícím 27,1%.

Average similarity scores across iterations for human-led and AI-led vibe coding, showing steady gains when humans act as both selector and instructor, and a gradual decline when both roles are handled by GPT 5.
Aby se zajistilo, že vznikající trendy nebyly způsobeny kolektivní silou více lidských účastníků, výzkumníci rekrutovali deset dalších lidí, aby pracovali sami, každý běžící tři kola sám – a výsledky se zlepšily stejným stálým způsobem, ukazující, že zisky nebyly fluktuací kolektivního úsilí.
Velký obraz
Nicméně, pokud by GPT-5 sám ohodnotil výstupy, uznal by, že lidské výsledky jsou lepší? Lidské a AI hodnocení se obecně pohybovaly ve stejném směru, takže model mohl rozlišit dobré a špatné, ale konzistentně ohodnotil AI-generované obrázky vyšší než lidé.
‘Konkrétně jsme se zeptali, zda AI agenti uznají, že jejich vlastní výstupy jsou horší než ty, které jsou produkovány lidmi, nebo zda budou projevovat preference pro své vlastní výtvory, což by naznačovalo potenciální problém s zarovnáním.’
Jak se ukázalo, existuje skutečně problém s zarovnáním*:
‘AI hodnotitelé přiřadili vyšší hodnocení AI-generovaným [výstupům]. Tyto nálezy naznačují, že pozorované rozdíly ve výkonu mohou pocházet z nesouladu v reprezentacích mezi lidmi a AI.’
Při zkoumání, jak lidé a AI formulují své vedení, se objevily nesrovnalosti v testech. Jak je vidět na obrázku níže, obě zaostření a délka jsou předměty AI/lidského rozdílu:

A comparison of how humans and AI gave instructions during the coding task. ‘A’ shows that humans write short, direct instructions, while AI writes long, detailed descriptions. ‘B’ maps the instructions, revealing that human prompts cluster together, while AI prompts split apart by animal. ‘C’ tracks how limiting AI instruction length does not fix its poor results over time; and ‘D’ illustrates that humans give more varied and balanced guidance than AI, even when word limits are imposed.
Lidské instrukce měly tendenci být krátké a na místě, nabízející jasné úpravy, které mohly být aplikovány obecně napříč cíli. AI instrukce, na druhé straně, byly hustě popisné a často nafouknuté specifikacemi o stínu, texturách, osvětlení nebo anatomických detailech – popisy, které mohou mít smysl v izolaci, ale selhávají při poskytování užitečných dalších kroků pro model (a které budou známé těm, kteří jsou vědomi LLMs’ problémů okolo délky kontextu, tj. schopnosti zachovat “velký obraz” jako projekt se vyvíjí a roste).
Aby se zjistilo, zda by snížená verbální bohatost zlepšila výkon, GPT-5 byl omezen na 10, 20 nebo 30 slov na instrukci; ale i tyto komprimované instrukce selhaly při ukázání jakéhokoli zlepšení (viz spodní pravá část grafu výše).
Spolupráce
Aby se otestovalo, co se stane, když lidé a AI sdílejí kontrolu, výzkumníci spustili kódovací úkoly s různými směsmi lidské a AI vstupu, sahajícími od většinou lidské po většinou AI.
Každá hybridní směs překonala plnou AI kontrolu, takže i malá lidská účast zlepšila výsledky:

Hybrid coding setups with different human/AI mixes. (A) Shows how humans and AI took turns as instructors and selectors for each coding step; (B) shows that more human involvement led to higher quality results, while greater AI input lowered scores; and (C) depicts a steady drop in final output quality as the share of human participation decreases, confirming that more consistent human direction produced better outcomes.
Jak AI převzala více procesu, výkon klesal, s nejlepšími výsledky, když lidé vedli většinu kol, a nejslabšími, když AI vedla většinu kol. Žádné z těchto hybridních nastavení se nepodařilo zlepšit se každým novým kolem, naznačující, že lidské vedení funguje nejlépe, když je stálé a konzistentní, spíše než příležitostné.
Role reversal
Studie také prozkoumala, zda záleží na tom, kdo dělá co v těchto typech úkolů, a otestovala to.
Když obě role byly provedeny lidmi, kvalita se udržela; ale když člověk poskytl instrukce a nikdo nevybral mezi verzemi, kvalita se zhoršila:

Tests for role division in vibe coding: in (A), removing the selector role led to worse performance, even when a human provided instructions; in (B), replacing the human selector with an AI reduced quality slightly, but not as severely as skipping selection entirely.
Když AI byla ve vedení, přeskočení výběrového kroku nezáleželo, protože jeho výstupy zůstaly konzistentní bez ohledu na to; ale když lidé poskytli instrukce a AI vybral výsledky, kvalita zůstala blízko plně lidskému nastavení.
Opačné nefungovalo: mít AI poskytující instrukce, zatímco lidé vybírali výstupy, vedlo k slabším výsledkům, naznačujícím, že lidské kreativní vedení zůstává nezbytné, zatímco úloha výběru mezi možnostmi může být svěřena AI bez velké ztráty.
Práce uzavírá:
‘[High-level] idea generation and instruction are the critical human contributions, whereas evaluation and selection can often be delegated to AI without loss in performance.
‘This suggests a practical design principle for hybrid systems: humans should set direction, while AI can support evaluation and execution.’
Závěr
Zůstává být vidět, do jaké míry zlepšené a/nebo prodloužené kontextové okna ovlivní výkon LLM ve typech úkolů. Den, kdy “LLM-amnézie” přestane být denním problémem lidské-AI spolupráce, může být důvodem k oslavě i znepokojení, protože problém, který AI snaží vyřešit, je lidé.
Nicméně, práce autorů také jasně ukazuje, že existují vrozené a kritické nesrovnalosti mezi AI a lidmi ohledně kvality, které mohou být ještě určeny spotřebiteli, aby byly nenahraditelně lidským konceptem.
* Moje konverze autorů inline citací na hypertextové odkazy.
Poprvé zveřejněno v pátek, 13. února 2026












