Andersons vinkel

Vibe-kodning lider när AI:s roll utvidgas

mm
Lägg till Unite.AI bland dina föredragna källor på Google
An AI-generated stock-style image depicting a human Caucasian male and a larger glossy humanoid robot attempting to collaborate on a document; but the aggressive robot is causing the annoyed man to be sidelined. GPT-5 Image + Photoshop enhancement.

En ny studie visar att vibe-kodning förbättras när människor ger instruktioner, men försämras när AI gör det, med den bästa hybriduppställningen som håller människor främst, med AI som skiljedomare eller domare.

 

Ny forskning från USA, som undersöker vad som händer när AI-system tillåts styra vibe-kodning, snarare än att bara utföra mänskliga instruktioner, har funnit att när stora språkmodeller (LLM) tar på sig en större riktning, är resultaten nästan alltid sämre.

Även om forskarna använde OpenAI:s GPT-5 som ramverk för sina mänskliga/AI-samarbetsförsök, bekräftade de senare att både Anthropic’s Claude Opus 4.5 och Google Gemini 3 Pro var föremål för samma försämringskurva när ansvar växte, och uttalade att “även begränsad mänsklig inblandning stadigt förbättrar prestanda”:

‘[Människor] tillhandahåller unikt effektiv högnivåvägledning över iterationer, [medan] AI-vägledning ofta leder till prestandakollaps. Dessutom finner vi att en noggrann rollfördelning som håller människor ansvariga för riktning medan utvärdering överförs till AI kan förbättra hybridprestanda.’

För att tillhandahålla ett konsekvent test som kunde utvärderas lika av människor som av AI, byggdes ett kontrollerat experimentellt ramverk runt en iterativ koduppgift där en referensbild – som visade en foto av en katt, hund, tiger, fågel, elefant, pingvin, haj, zebra, giraff eller panda – skulle återskapas med hjälp av skalbara vektorgrafik (SVG), och att rekonstruktionen bedömdes mot den ursprungliga fotobilden från vilken den hämtades:

Både mänskliga och AI-deltagare visades en fotografisk referensbild tillsammans med en AI-genererad SVG-rekonstruktion, och ombads att bedöma hur lika de två var på en skala med sju punkter. Källa - https://arxiv.org/pdf/2602.10473

Både mänskliga och AI-deltagare visades en fotografisk referensbild tillsammans med en AI-genererad SVG-rekonstruktion, och ombads att bedöma hur lika de två var på en skala med sju punkter. Källa

I varje omgång tillhandahöll en agent högnivånaturliga språkinstruktioner för att vägleda en kodgenerator, och en annan beslutade om att behålla den nya versionen eller återgå till den föregående – en strukturerad loop som speglar verkliga samarbetsflöden.

Över 16 experiment som involverade 604 deltagare och tusentals API-anrop, jämfördes fullständigt mänskligt ledda testomgångar direkt med fullständigt AI-ledda omgångar, under identiska förhållanden.

Några av de varierade lösningarna som uppnåddes av olika kombinationer av mänsklig/AI-samarbete i procent och typer (tagna från en större illustration i källpapperet, till vilket vi hänvisar läsaren).

Några av de varierade lösningarna som uppnåddes av olika kombinationer av mänsklig/AI-samarbete i procent och typer (tagna från en större illustration i källpapperet, till vilket vi hänvisar läsaren).

Även om människor och AI presterade på liknande nivåer vid testernas början, divergerade deras banor över tid: när människor tillhandahöll instruktioner och fattade urvalbeslut, ökade likhetspoängen över iterationer, med stadig kumulativ förbättring; men när AI-system fyllde båda rollerna, visade prestandan ingen konsekvent förbättring, och försämrades ofta över omgångar – även om samma underliggande modell användes för kodgenerering, och AI hade tillgång till samma information som mänskliga deltagare.

Den långsamma effekten

Resultaten visade också att mänskliga instruktioner vanligtvis var korta och handlingsinriktade, fokuserade på vad som skulle ändras nästa i den aktuella bilden; tvärtom var AI-instruktioner långa och tungt beskrivande (en faktor som parametrerades för GPT-5), som beskrev visuella attribut snarare än att prioritera inkrementell korrigering.

Men, som visas i grafen nedan, förbättrades inte mönstret när AI-instruktioner begränsades till 10, 20 eller 30 ord; även när de komprimerade instruktionerna misslyckades med att visa någon förbättring:

Likhetsbetyg över iterationer för mänskligt ledda kedjor jämförda med fullständigt AI-ledda kedjor och AI-ledda kedjor begränsade till 10, 20 eller 30-ordsinstruktioner, visar att förkortning av AI-prompter inte förhindrar den iterativa prestandaförsämringen som observeras när AI styr både instruktion och urval.

Likhetsbetyg över iterationer för mänskligt ledda omgångar jämförda med fullständigt AI-ledda omgångar och AI-ledda omgångar begränsade till 10, 20 eller 30-ordsinstruktioner. Tydligtvis förbättrar inte förkortning av AI-prompter den iterativa prestandaförsämringen som observeras när AI styr både instruktion och urval.

Hybridexperimenten gjorde mönstret tydligare, visande att tillägg av även en liten mängd mänsklig inblandning förbättrade resultaten, jämfört med fullständigt AI-ledda setup; men prestandan försämrades vanligtvis när andelen AI-vägledning ökade.

När rollerna separerades kunde utvärdering och urval överlåtas till AI med relativt liten kvalitetsförlust; men ersättning av mänsklig högnivåinstruktion med AI-vägledning ledde till märkbara prestandaförsämringar, vilket tyder på att det som betydde mest var inte vem som genererade koden, utan vem som satte och upprätthöll riktningen över iterationer.

Författarna drar följande slutsats:

‘Över flera experiment förbättrades mänskligt ledd kodning konsekvent över iterationer, medan AI-ledd kodning ofta kollapsade trots tillgång till samma information och liknande exekveringsförmåga.

‘Detta pekar på viktiga svårigheter för dagens AI-system i att upprätthålla sammanhängande högnivåriktning över upprepade interaktioner, av den typ som är nödvändig för framgångsrik vibe-kodning’

Den nya artikeln har titeln Varför mänsklig vägledning är viktig i samarbetande vibe-kodning, och kommer från sju forskare vid Cornell University, Princeton University, Massachusetts Institute of Technology och New York University.

Metod

För experimenten såg en mänsklig instruktör på en GPT-5-genererad djurreferensbild, tillsammans med den senaste associerade SVG-imitationsförsöket. Den skrev sedan naturliga språkinstruktioner för att vägleda kodgenereringen mot en närmare match.

Således skulle genereringen producera en ny SVG varje omgång, vilket tillhandahöll en iterativ loop för att testa hur effekten av vägledning ackumuleras över tid. Målen var tio GPT-5-genererade djurbilder, som täckte ett spektrum av former och texturer så att förbättringar eller misstag skulle vara lätta att upptäcka:

Schema för vibe-kodningsarbetsflödet som användes i studien. I A), ser en mänsklig instruktör på en fotografisk referensbild tillsammans med den bästa SVG som producerats hittills och skriver naturliga språkinstruktioner för kodgenereringen att följa när den producerar nästa SVG; i B), jämför en mänsklig urvalare den nya SVG:n med den föregående och väljer vilken version som bäst matchar referensbilden, innan den valda SVG:n skickas vidare för nästa omgång av instruktion. I C), ombes oberoende mänskliga utvärderare att bedöma hur lika varje genererad SVG är den ursprungliga bild den hämtades från, och tillhandahåller betygen som används för att bedöma övergripande prestanda.

Schema för vibe-kodningsarbetsflödet som användes i studien. I A), ser en mänsklig instruktör på en fotografisk referensbild tillsammans med den bästa SVG som producerats hittills och skriver naturliga språkinstruktioner för kodgenereringen att följa när den producerar nästa SVG; i B), jämför en mänsklig urvalare den nya SVG:n med den föregående och väljer vilken version som bäst matchar referensbilden, innan den valda SVG:n skickas vidare för nästa omgång av instruktion; och i C), ombes oberoende mänskliga utvärderare att bedöma hur lika varje genererad SVG är den ursprungliga bild den hämtades från, och tillhandahåller betygen som används för att bedöma övergripande prestanda.

En mänsklig urvalare jämförde varje nygenererad SVG med den föregående och antog eller avvisade den, vilket höll processen i linje med referensbilden över omgångar. I denna basuppställning utförde samma människa båda rollerna.

För att mäta kvalitet ombads oberoende mänskliga utvärderare att bedöma hur lika varje genererad SVG var den ursprungliga bild den hämtades från. Över sexton experiment producerade 120 personer 4 800 betyg. Alla experiment kördes på PsyNet-ramverket, en portal som är utformad för att tillhandahålla strukturerade interaktioner mellan människor och AI-system.

Studien rekryterade 604 engelsktalande deltagare, i tester som skulle förbruka 4 800 API-anrop för kodgenerering och 5 327 API-anrop för instruktion. Även om GPT-5 var den primära modellen som användes, gjordes mindre jämförelsebatchar med Claude Opus 4.5 och Gemini 3 Pro, som hanterade 280 respektive frågor.

Resultat

Trettio vibe-kodningsomgångar kördes, var och en bestående av femton redigeringar av de tio ursprungliga referensbilderna. För dessa valdes 45 mänskliga deltagare, var och en som fungerade som både urvalare och instruktör över tio iterationer, i “mänskligt ledda” omgångar.

Inom varje omgång valde samma deltagare först mellan den aktuella och föregående SVG:n, och skrev sedan nästa omgångs instruktioner. En andra version av testet ersatte de mänskliga besluten med API-anrop till GPT 5, medan resten av setupen förblev oförändrad. I alla fall instruerade instruktören och urvalaren kodgenereringen med vanligt språk.

Ett representativt exempel på flera omgångar av vibe-kodning visar hur processen divergerar över tid; när människor fungerade som både urvalare och instruktör, förbättrades SVG-utmatningen stadigt över iterationer, och närmade sig referensbilden med varje omgång:

Exempel på progressioner för en referensbild under mänskligt ledd (överst) och AI-ledd (nederst) vibe-kodning, visande stadig förbättring över iterationer med människor i båda rollerna, och stagnation eller avvikelse när båda rollerna hanteras av AI.

Exempel på progressioner för en referensbild under mänskligt ledd (överst) och AI-ledd (nederst) vibe-kodning, visande stadig förbättring över iterationer med människor i båda rollerna, och stagnation eller avvikelse när båda rollerna hanteras av AI.

TVärtom, i den AI-ledda versionen, fångade tidiga omgångar ibland viktiga visuella funktioner, men senare försök misslyckades med att bygga på dessa vinster, och i vissa fall avvek de från målet:

Slutliga utmatningar från den sista iterationen, jämförande mänskligt ledda omgångar (översta raden) med AI-ledda kedjor (nedersta raden), över samma uppsättning referensbilder. De mänskligt ledda resultaten matchar originalet närmare, medan de AI-ledda resultaten visar synliga förvrängningar eller förlust av viktiga funktioner.

Slutliga utmatningar från den sista iterationen, jämförande mänskligt ledda omgångar (översta raden) med AI-ledda kedjor (nedersta raden), över samma uppsättning referensbilder. De mänskligt ledda resultaten matchar originalet närmare, medan de AI-ledda resultaten visar synliga förvrängningar eller förlust av viktiga funktioner.

För att mäta de framväxande trenderna kvantitativt, visades de slutliga bilderna för oberoende mänskliga bedömare och betygsattes för likhet med referensbilderna. I de tidiga omgångarna betygsatte mänskligt ledda och AI-ledda omgångar lika; men vid den femtonde omgången var skillnaden tydlig, med de mänskligt valda bilderna betygsatta mycket närmare målen. Över tid steg de mänskliga betygen stadigt, med den största relativa vinsten över AI på 27,1%.

Genomsnittliga likhetsbetyg över iterationer för mänskligt ledd och AI-ledd vibe-kodning, visande stadig förbättring när människor fungerar som både urvalare och instruktör, och en gradvis försämring när båda rollerna hanteras av GPT 5.

Genomsnittliga likhetsbetyg över iterationer för mänskligt ledd och AI-ledd vibe-kodning, visande stadig förbättring när människor fungerar som både urvalare och instruktör, och en gradvis försämring när båda rollerna hanteras av GPT 5.

För att säkerställa att de framväxande trenderna inte berodde på den kollektiva kraften hos flera samtidiga mänskliga deltagare, rekryterade forskarna tio ytterligare personer för att arbeta ensamma, var och en som körde tre omgångar på egen hand – och resultaten förbättrades på samma stadiga sätt, vilket visade att vinsterna inte var en tillfällighet av kollektiv ansträngning.

Den stora bilden

Men, om GPT-5 bedömde utmatningarna själv, skulle den erkänna att de mänskliga resultaten var bättre? Mänskliga och AI-betyg rörde sig vanligtvis i samma riktning, så modellen kunde skilja på bra och dåligt, men betygsatte konsekvent AI-genererade bilder <em"högre än vad människor gjorde.

‘Specifikt frågade vi om AI-agenter skulle erkänna att deras egna utmatningar är underlägsna de som produceras av människor, eller om de skulle visa en preferens för sina egna skapelser, vilket skulle indikera en potentiell samstämmighetsfråga.’

Som det visade sig, finns det faktiskt en samstämmighetsfråga*:

‘AI-utvärderare tilldelade högre betyg till AI-genererade [utmatningar]. Dessa fynd tyder på att de observerade prestandaskillnaderna kan härröra från en feljustering i representationer mellan människor och AI.’

När man undersökte hur människor och AI uttryckte sin vägledning, blev skillnader tydliga i testerna. Som visas i figuren nedan, fokuserar både fokus och längd på AI/mänsklig divergens:

En jämförelse av hur människor och AI gav instruktioner under koduppgiften. 'A' visar att människor skriver korta, direkta instruktioner, medan AI skriver långa, detaljerade beskrivningar. 'B' kartlägger instruktionerna, vilket visar att mänskliga prompter klusterar tillsammans, medan AI-prompter delas upp efter djur. 'C' spårar hur begränsning av AI-instruktionslängd inte åtgärdar dess dåliga resultat över tid; och 'D' visar att människor ger mer varierad och balanserad vägledning än AI, även när ordgränser påförs.

En jämförelse av hur människor och AI gav instruktioner under koduppgiften. ‘A’ visar att människor skriver korta, direkta instruktioner, medan AI skriver långa, detaljerade beskrivningar. ‘B’ kartlägger instruktionerna, vilket visar att mänskliga prompter klusterar tillsammans, medan AI-prompter delas upp efter djur. ‘C’ spårar hur begränsning av AI-instruktionslängd inte åtgärdar dess dåliga resultat över tid; och ‘D’ visar att människor ger mer varierad och balanserad vägledning än AI, även när ordgränser påförs.

Mänskliga instruktioner tenderade att vara korta och precisa, och erbjöd tydliga redigeringar som kunde tillämpas generellt över mål. AI-instruktioner, å andra sidan, var täta med beskrivande detaljer och ofta svullna med specifika uppgifter om skuggning, texturer, belysning eller anatomiska detaljer – beskrivningar som kan vara meningsfulla i isolering, men misslyckas med att tillhandahålla användbara nästa steg för modellen (och som kommer att vara bekanta för dem som är medvetna om LLM:ers problem runt kontextlängd, d.v.s. att kunna behålla “den stora bilden” när ett projekt utvecklas och växer).

För att se om minskad verbositet skulle förbättra prestanda, begränsades GPT-5 till 10, 20 eller 30 ord per instruktion; men även dessa komprimerade instruktioner misslyckades med att visa någon förbättring (se nedre högra delen av grafen ovan).

Gemensamma företag

För att testa vad som händer när människor och AI delar kontroll, körde forskarna koduppgifter med olika blandningar av mänsklig och AI-inblandning, från huvudsakligen mänsklig till huvudsakligen AI.

Varje hybridblandning presterade bättre än fullständig AI-kontroll, så att även en liten mängd mänsklig vägledning förbättrade resultaten:

Hybridkodningssetup med olika mänsklig/AI-blandningar. (A) Visar hur människor och AI turades om som instruktörer och urvalare för varje kodsteg; (B) visar att mer mänsklig inblandning ledde till högre kvalitetsresultat, medan större AI-inblandning sänkte betygen; och (C) avbildar en stadig minskning av slutlig utmatningskvalitet när den mänskliga deltagandegraden minskar, vilket bekräftar att mer konsekvent mänsklig riktning producerade bättre resultat.

Hybridkodningssetup med olika mänsklig/AI-blandningar. (A) Visar hur människor och AI turades om som instruktörer och urvalare för varje kodsteg; (B) visar att mer mänsklig inblandning ledde till högre kvalitetsresultat, medan större AI-inblandning sänkte betygen; och (C) avbildar en stadig minskning av slutlig utmatningskvalitet när den mänskliga deltagandegraden minskar, vilket bekräftar att mer konsekvent mänsklig riktning producerade bättre resultat.

När AI tog över mer av processen, försämrades prestandan, med de bästa resultaten när människor ledde de flesta omgångar, och de sämsta när AI ledde de flesta omgångar. Inga av dessa blandade setup kunde upprätthålla förbättring över tid, vilket tyder på att mänsklig riktning fungerar bäst när den är stadig och konsekvent, snarare än tillfällig.

Rollomvändning

Studien undersökte också om det spelar roll vem som gör vad i dessa typer av uppgifter, och testade för detta. Den reviderade övningen omfattade två uppgifter: en deltagare skulle diktera hur man ändrar bilden, och en annan skulle välja en föredragen version.

När båda uppgifterna utfördes av människor, upprätthölls kvaliteten; men när en människa gav instruktioner och ingen valde mellan versioner, försämrades kvaliteten:

Tester för rollfördelning i vibe-kodning: i (A), ledde borttagning av urvalsrollen till sämre prestanda, även när en människa gav instruktioner; i (B), minskade ersättning av mänsklig urvalare med AI kvaliteten något, men inte lika allvarligt som att hoppa över urvalet helt.

Tester för rollfördelning i vibe-kodning: i (A), ledde borttagning av urvalsrollen till sämre prestanda, även när en människa gav instruktioner; i (B), minskade ersättning av mänsklig urvalare med AI kvaliteten något, men inte lika allvarligt som att hoppa över urvalet helt.

När AI var i kontroll, spelade det ingen roll att hoppa över valet; dess utmatningar förblev konsekventa antingen way. Men när människor gav instruktioner och AI valde mellan resultaten, förblev kvaliteten nära den fullständigt mänskliga setupen.

Det omvända fungerade inte: att ha AI som gav instruktioner medan människor valde utmatningar ledde till sämre resultat, vilket tyder på att mänsklig kreativ vägledning förblir avgörande, medan uppgiften att välja mellan alternativ kan överlåtas till AI utan större förlust.

Artikeln avslutas med:

‘[Högnivå] idégenerering och instruktion är de kritiska mänskliga bidragen, medan utvärdering och urval ofta kan delegeras till AI utan kvalitetsförlust.

‘Detta föreslår en praktisk designprincip för hybrid-system: människor bör sätta riktning, medan AI kan stödja utvärdering och exekvering.’

Slutsats

Det återstår att se i vilken utsträckning förbättrade och/eller utökade kontextfönster kommer att påverka prestanda hos LLM:er i uppgifter av detta slag. Den dag då “LLM-minnesförlust” upphör att vara en daglig irritation i mänsklig-AI-samarbete kan vara en anledning till både firande och oro, eftersom problemet som AI försöker lösa, kan hävdas, är människor.

Ändå visar författarnas arbete tydligt att det finns medfödda och kritiska oenigheter mellan AI och människor när det gäller kvalitet, som kan komma att avgöras av konsumenter som en oumbärligt mänsklig koncept.

 

* Min omvandling av författarnas inline-citat till hyperlänkar.

Publicerad första gången fredagen den 13 februari 2026

Författare på maskinlärning, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]