Unghiul lui Anderson
Suferința de codare Vibe atunci când rolul AI se extinde

O nouă studiu a descoperit că codarea vibe îmbunătățește atunci când oamenii dau instrucțiunile, dar scade atunci când AI o face, cu cel mai bun setup hibrid care păstrează oamenii în frunte, cu AI ca arbitru sau judecător.
Noi cercetări din Statele Unite, care examinează ce se întâmplă atunci când sistemele AI sunt lăsate să conducă codarea vibe, în loc să execute pur și simplu instrucțiunile umane, au descoperit că atunci când modelele de limbaj mari (LLM) iau un rol mai mare de direcție, rezultatele sunt aproape întotdeauna mai proaste.
Deși cercetătorii au folosit GPT-5 al OpenAI ca cadru pentru experimentele lor de colaborare uman-AI, ei au confirmat ulterior că atât Claude Opus 4.5 al Anthropic, cât și Gemini 3 Pro al Google au fost supuse aceleiași curbe de deteriorare atunci când responsabilitățile au crescut, afirmând că “chiar și implicarea limitată a oamenilor îmbunătățește în mod constant performanța”:
‘[Oamenii] oferă o orientare eficientă la nivel înalt, pe parcursul iterărilor, [în timp ce] orientarea AI adesea duce la colapsul performanței. De asemenea, am constatat că o alocare atentă a rolurilor, care păstrează oamenii în controlul direcției, în timp ce externalizează evaluarea către AI, poate îmbunătăți performanța hibridă.’
Pentru a oferi un test consistent care să poată fi evaluat în mod egal de oameni și de AI, a fost creat un cadru experimental controlat în jurul unei sarcini de codare iterative în care o imagine de referință – care prezintă o fotografie a unui animal, cum ar fi o pisică, un câine, un tigru, un păsări, o elefant, un pinguin, un rechin, o zebră, o girafă sau un panda – trebuia să fie recreată folosind grafică vectorială escalabilă (SVG), și acea recreare a fost evaluată împotriva sursei fotografice de la care a fost derivată:

Atât participanții umani, cât și cei AI au fost arătați o imagine fotografică de referință lângă o reconstrucție SVG generată de AI și li s-a cerut să evalueze cât de asemănătoare sunt cele două pe o scară de șapte puncte. Sursă
În fiecare rundă, un agent a oferit instrucțiuni de nivel înalt în limbaj natural pentru a ghida un generator de cod, și altul a decis dacă să păstreze noua versiune sau să revină la cea anterioară – un buclă structurată care oglindește fluxurile de lucru colaborative reale.
De-a lungul a 16 experimente care implică 604 de participanți și mii de apeluri API, runde de testare conduse în totalitate de oameni au fost comparate direct cu runde conduse în totalitate de AI, în condiții identice.

Unele dintre soluțiile variate la care au ajuns diferitele combinații de procente și tipuri de colaborare uman-AI (preluate dintr-o ilustrație mai mare din lucrarea sursă, la care ne referim cititorului).
Deși oamenii și AI au performant la niveluri similare la începutul testelor, pe parcursul timpului, traiectoriile lor s-au divergat: atunci când oamenii au oferit instrucțiunile și au luat deciziile de selecție, scorurile de similaritate au crescut pe parcursul iterărilor, cu o îmbunătățire cumulativă constantă; dar atunci când sistemele AI au îndeplinit ambele roluri, performanța a arătat nu a prezentat niciun câștig consistent și a scăzut adesea pe parcursul rundelor – chiar dacă același model subiacent a fost utilizat pentru generarea codului, și AI a avut acces la aceleași informații ca și participanții umani.
Efectul de prolixitate
Rezultatele au arătat, de asemenea, că instrucțiunile umane au fost, de obicei, scurte și orientate spre acțiune, concentrându-se asupra a ceea ce trebuie schimbat în imaginea curentă; în schimb, instrucțiunile AI au fost mult mai lungi și dense în descrieri (un factor care a fost parametrizat pentru GPT-5), detaliind atribute vizuale mai degrabă decât prioritizând corecțiile incrementale.
Dar, așa cum se poate vedea în graficul de mai jos, impunerea unor limite stricte de cuvinte pentru instrucțiunile AI nu a inversat modelul; chiar și atunci când au fost limitate la 10, 20 sau 30 de cuvinte, lanțurile conduse de AI au continuat să nu arate nicio îmbunătățire în timp:

Evaluări de similaritate pe parcursul iterărilor pentru runde conduse de oameni comparate cu runde conduse în totalitate de AI și lanțuri conduse de AI limitate la 10, 20 sau 30 de cuvinte. Evident, scurtarea prompturilor AI nu previne declinul performanței observat atunci când AI conduce atât instrucțiunile, cât și selecția.
Experimentele hibride au făcut modelul mai clar, arătând că adăugarea unei implicări umane, chiar și mici, a îmbunătățit rezultatele, comparativ cu setup-urile conduse în totalitate de AI; cu toate acestea, performanța a scăzut de obicei pe măsură ce a crescut cota de orientare AI.
Când rolurile au fost separate, evaluarea și selecția puteau fi externalizate către AI cu o pierdere relativ mică de calitate; dar înlocuirea instrucțiunilor umane de nivel înalt cu orientarea AI a condus la scăderi semnificative ale performanței, sugerând că ceea ce contează cel mai mult nu este cine generează codul, ci cine stabilește și menține direcția pe parcursul iterărilor.
Autorii concluzionează:
‘Pe parcursul mai multor experimente, codarea condusă de oameni a îmbunătățit constant pe parcursul iterărilor, în timp ce codarea condusă de AI a colapsat adesea, în ciuda accesului la aceleași informații și a capacităților de execuție similare.
‘Acest lucru indică lupte cheie ale sistemelor AI de astăzi în menținerea unei direcții coerente la nivel înalt pe parcursul interacțiunilor repetate, de tipul necesar pentru codarea vibe de succes’
Noua lucrare este intitulată De ce contează orientarea umană în codarea vibe colaborativă, și provine de la șapte cercetători de la Universitatea Cornell, Universitatea Princeton, Institutul de Tehnologie din Massachusetts și Universitatea din New York.
Metodă
Pentru experimente, un instructor uman a examinat o imagine de referință generată de GPT-5, împreună cu cea mai recentă încercare de imitație SVG asociată. Apoi, a scris instrucțiuni în limbaj natural pentru a ghida generatorul de cod către o potrivire mai bună.
Astfel, generatorul a produs un nou SVG în fiecare rundă, oferind o buclă iterativă pentru testarea modului în care efectul orientării se acumulează în timp. Țintele au fost zece imagini de animale generate de GPT-5, care acoperă o gamă de forme și texturi, astfel încât îmbunătățirile sau greșelile să poată fi ușor detectate:

Schema fluxului de lucru de codare vibe utilizat în studiu. În A), un instructor uman examinează o imagine fotografică de referință împreună cu cea mai bună SVG produsă până în prezent și scrie instrucțiuni în limbaj natural pentru generatorul de cod pentru a urma la producerea următorului SVG; în B), un selector uman compară noul SVG cu cel anterior și alege care dintre ele se potrivește mai bine cu imaginea de referință, înainte de a trece SVG-ul selectat mai departe pentru următoarea rundă de instruire; și în C), evaluatori umani independenți evaluează cât de asemănătoare este fiecare SVG generat cu imaginea sa de referință, furnizând scorurile utilizate pentru a evalua performanța generală.
Un selector uman a comparat fiecare nou SVG generat cu cel anterior și a acceptat sau respins, menținând procesul aliniat cu imaginea de referință pe parcursul rundelor. În acest setup de bază, același om a îndeplinit ambele roluri.
Pentru a măsura calitatea, evaluatori umani independenți au evaluat cât de asemănătoare era fiecare SVG generat cu imaginea sa de referință. Pe parcursul a 16 experimente, 120 de oameni au produs 4.800 de evaluări. Toate experimentele au fost efectuate pe platforma PsyNet, un portal proiectat pentru a găzdui interacțiuni structurate între oameni și sisteme AI.
Studiul a recrutat 604 de vorbitori de engleză nativi, în teste care au implicat 4.800 de apeluri API pentru generarea codului și 5.327 de apeluri API pentru instruire. Deși GPT-5 a fost modelul principal utilizat, loturi mai mici de comparație au fost efectuate cu Claude Opus 4.5 și Gemini 3 Pro, care au gestionat fiecare 280 de interogări.
Rezultate
Trei zeci de runde de codare vibe au fost efectuate, fiecare cuprinzând cincisprezece editări ale celor zece imagini de referință de bază. Pentru acestea, 45 de participanți umani au fost selectați, fiecare servind atât ca selector, cât și ca instructor pe parcursul a zece iterării, în runde conduse de oameni.
În cadrul fiecărei runde, același participant a ales întâi între SVG-ul curent și cel anterior, și apoi a scris următoarea rundă de instrucțiuni. O a doua versiune a testului a înlocuit deciziile umane cu apeluri API către GPT 5, păstrând restul setup-ului neschimbat. În toate cazurile, instructorul și selectorul au promovat generatorul de cod cu limbaj natural.
Un exemplu reprezentativ de codare vibe multi-rundă arată cum procesul se divergează în timp; atunci când oamenii au servit atât ca selector, cât și ca instructor, ieșirile SVG s-au îmbunătățit constant pe parcursul iterărilor, apropiindu-se de imaginea de referință cu fiecare rundă:

Exemplu de progresii pentru o imagine de referință sub codare vibe condusă de oameni (sus) și codare vibe condusă de AI (jos), arătând îmbunătățire constantă pe parcursul iterărilor cu oameni în ambele roluri, și stagnare sau derivă atunci când ambele roluri sunt gestionate de AI.
În schimb, în versiunea condusă de AI, runde timpurii au capturat uneori caracteristici vizuale cheie, dar încercările ulterioare nu au reușit să construiască pe aceste câștiguri, și în unele cazuri au derivat de la țintă:

Ieșiri finale din ultima iterație, comparând runde conduse de oameni (rândul superior) cu lanțuri conduse de AI (rândul inferior), pe același set de imagini de referință. Rezultatele conduse de oameni se potrivesc mai bine cu animalele originale, în timp ce rezultatele conduse de AI demonstrează distorsionări vizibile sau pierderea caracteristicilor cheie.
Pentru a măsura tendințele emergente în mod cantitativ, imaginile finale au fost prezentate evaluatorilor umani independenți și evaluate pentru similaritate cu imaginile de referință. În runde timpurii, runde conduse de oameni și conduse de AI au obținut scoruri aproximativ egale; dar până în a cincisprezecea rundă, diferența a devenit clară, cu imaginile selectate de oameni evaluate mult mai aproape de țintă. Pe parcursul timpului, scorurile umane au crescut constant, cu cel mai mare câștig relativ față de AI atingând 27,1%.

Scoruri medii de similaritate pe parcursul iterărilor pentru codare vibe condusă de oameni și condusă de AI, arătând îmbunătățiri constante atunci când oamenii servesc atât ca selector, cât și ca instructor, și o scădere treptată atunci când ambele roluri sunt gestionate de GPT 5.
Pentru a se asigura că tendințele emergente nu se datorează puterii colective a mai multor participanți umani simultan, cercetătorii au recrutat zece persoane suplimentare pentru a lucra singure, fiecare efectuând trei runde de unul singur – și rezultatele s-au îmbunătățit în același mod constant, demonstrând că îmbunătățirile nu au fost un accident al efortului colectiv.
Imaginea de ansamblu
Cu toate acestea, dacă GPT-5 a evaluat ieșirile în sine, ar fi recunoscut că rezultatele umane au fost mai bune? Evaluările umane și ale AI s-au mișcat în general în aceeași direcție, astfel încât modelul a putut distinge binele de rău, dar a evaluat în mod constant imagini generate de AI mai sus decât oamenii.
‘În mod specific, am întrebat dacă agenții AI ar recunoaște că ieșirile lor sunt inferioare celor produse de oameni, sau dacă ar arăta o preferință pentru creațiile lor, ceea ce ar indica o posibilă problemă de aliniere.’
Așa cum s-a dovedit, există într-adevăr o problemă de aliniere*:
‘Evaluatorii AI au atribuit scoruri mai mari ieșirilor generate de AI. Aceste constatări sugerează că diferențele de performanță observate pot proveni dintr-o nealiniere a reprezentărilor între oameni și AI.’
La examinarea modului în care oamenii și AI formulează instrucțiunile, au apărut discrepanțe în teste. Așa cum se poate vedea în figura de mai jos, atât focalizarea, cât și lungimea sunt subiecte de divergență AI-umană:

O comparație a modului în care oamenii și AI au oferit instrucțiuni în timpul sarcinii de codare. ‘A’ arată că oamenii scriu instrucțiuni scurte și directe, în timp ce AI scrie descrieri lungi și detaliate. ‘B’ cartografiază instrucțiunile, arătând că prompturile umane se grupează împreună, în timp ce prompturile AI se separă pe animale. ‘C’ urmărește modul în care limitarea lungimii instrucțiunilor AI nu repară rezultatele slabe în timp; și ‘D’ ilustrează că oamenii oferă o orientare mai variată și mai echilibrată decât AI, chiar și atunci când se impun limite de cuvinte.
Instrucțiunile umane au tendința să fie scurte și la subiect, oferind editări clare care pot fi aplicate în general pe țintă. Instrucțiunile AI, pe de altă parte, au fost dense în detalii descriptive și adesea umflate cu informații despre umbre, texturi, iluminare sau detalii anatomice – descrieri care pot avea sens în izolare, dar nu oferă pași utili următori pentru model (și care vor fi familiare celor conștienți de problemele LLM cu lungimea contextului, adică reținerea “imaginii de ansamblu” pe măsură ce proiectul se dezvoltă și crește).
Pentru a vedea dacă o verbositate redusă ar îmbunătăți performanța, GPT-5 a fost limitat la 10, 20 sau 30 de cuvinte per instrucțiune; dar chiar și aceste instrucțiuni comprimate nu au arătat nicio îmbunătățire (a se vedea partea de jos a graficului de mai sus).
Întreprinderi comune
Pentru a testa ce se întâmplă atunci când oamenii și AI împart controlul, cercetătorii au efectuat sarcini de codare cu amestecuri diferite de intrare umană și AI, variind de la în mare parte uman la în mare parte AI.
Fiecare amestec hibrid a performant mai bine decât controlul total al AI, astfel încât chiar și o cantitate mică de orientare umană a îmbunătățit rezultatele:

Configurații de codare hibride cu amestecuri diferite de intrare umană și AI. (A) Arată cum oamenii și AI au luat rândul la fiecare pas de codare; (B) arată că implicarea umană mai mare a condus la rezultate de calitate superioară, în timp ce intrarea AI mai mare a scăzut scorurile; și (C) descrie o scădere constantă a calității ieșirii finale pe măsură ce participarea umană scade, confirmând că direcția umană mai constantă a produs rezultate mai bune.
Pe măsură ce AI a preluat mai mult din proces, performanța a scăzut, cu cele mai bune rezultate observate atunci când oamenii au condus majoritatea rundelor, și cele mai slabe atunci când AI a condus majoritatea rundelor. Niciuna dintre aceste configurații hibride nu a reușit să continue îmbunătățirea cu fiecare rundă nouă, sugerând că direcția umană funcționează cel mai bine atunci când este constantă și regulată, mai degrabă decât ocazională.
Inversarea rolurilor
Studiul a explorat, de asemenea, dacă contează ce face cine în aceste tipuri de sarcini și a testat acest lucru. Exercițiul revizuit a implicat două sarcini: un participant a dictat cum să se schimbe imaginea, și altul a ales o versiune preferată.
Când ambele roluri au fost îndeplinite de oameni, calitatea a fost menținută; dar atunci când un om a dat instrucțiuni și nimeni nu a ales între versiuni, calitatea a scăzut:

Teste pentru diviziunea rolurilor în codarea vibe: în (A), eliminarea rolului de selector a condus la o performanță mai slabă, chiar și atunci când un om a oferit instrucțiuni; în (B), înlocuirea selectorului uman cu un AI a redus calitatea ușor, dar nu la fel de sever ca și când s-a omis selecția în totalitate.
Când AI a fost în control, omiterea pașilor de alegere nu a contat, deoarece ieșirile sale au rămas constante în orice caz; dar atunci când oamenii au oferit instrucțiuni și AI a ales între rezultate, calitatea a rămas aproape de setup-ul condus în totalitate de oameni.
Inversul nu a funcționat: atunci când AI a dat instrucțiuni și oamenii au ales ieșiri, a condus la rezultate mai slabe, sugerând că orientarea creativă umană rămâne esențială, în timp ce sarcina de a alege între opțiuni poate fi externalizată către AI fără o pierdere semnificativă.
Lucrarea concluzionează:
‘[Generarea de idei de nivel înalt] și instruirea sunt contribuțiile umane critice, în timp ce evaluarea și selecția pot fi adesea delegate către AI fără pierdere de performanță.
‘Acest lucru sugerează un principiu practic de proiectare pentru sisteme hibride: oamenii ar trebui să stabilească direcția, în timp ce AI poate sprijini evaluarea și execuția.’
Concluzie
Rămâne de văzut în ce măsură ferestrele de context îmbunătățite și/sau extinse vor afecta performanța LLM în sarcini de acest tip. Ziua în care “amnezia LLM” încetează să fie o problemă zilnică a colaborării umane-AI poate fi un motiv atât de sărbătoare, cât și de alarmă, deoarece problema pe care AI o încearcă să o rezolve, în mod evident, este oamenii.
În orice caz, lucrarea autorilor face clar că există dezacorduri innate și critice între AI și oameni cu privire la calitate, care poate fi încă determinată de consumatori ca fiind un concept uman irepetabil.
* Conversia mea a citărilor inline ale autorilor în legături.
Publicat pentru prima dată vineri, 13 februarie 2026












