Andersonin kulma

Vibe-koodauksen Ongelma Kun AI:n Rooli Laajenee

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
An AI-generated stock-style image depicting a human Caucasian male and a larger glossy humanoid robot attempting to collaborate on a document; but the aggressive robot is causing the annoyed man to be sidelined. GPT-5 Image + Photoshop enhancement.

Uusi tutkimus osoittaa, että vibe-koodaus parani, kun ihmiset antoivat ohjeet, mutta heikkeni, kun AI teki sen, ja paras hybridiympäristö piti ihmiset etusijalla, AI: n toimien arvostelijana tai tuomarina.

 

Yhdysvalloista kotoisin oleva uusi tutkimus, joka tarkastelee, mitä tapahtuu, kun AI-järjestelmiä sallitaan ohjata vibe-koodausta, ei ainoastaan suorittaen ihmisten ohjeita, on havainnut, että kun suuret kielen mallit (LLM) ottavat suuremman suunnan roolin, tulokset ovat lähes aina huonompia.

Vaikka tutkijat käyttivät OpenAI:n GPT-5:ää ihmisen ja AI:n yhteistyön kokeiden viitekehyksenä, he myöhemmin vahvistivat, että sekä Anthropicin Claude Opus 4.5 että Google Gemini 3 Pro olivat alttiina samalle heikentymiskäyrälle, kun vastuut kasvoivat, ja totesivat, että “jopa rajoitettu ihmisen osallistuminen parantaa jatkuvasti suorituskykyä”:

‘[Ihmiset] tarjoavat ainutlaatuisesti tehokkaita korkean tason ohjeita iteroinneissa, [kun taas] AI-ohjeet usein johtavat suorituskyvyn romahdukseen. Lisäksi havaitsemme, että huolellinen roolien jakautuminen, jossa ihmiset ovat vastuussa suunnasta ja arvioinnista AI: lle, voi parantaa hybridi-suorituskykyä.’

Jotta voidaan tarjota yhdenmukainen testi, jota voidaan arvioida yhtäläisesti sekä ihmisille että AI: lle, kontrolloitu kokeellinen viitekehys rakennettiin iteratiivisen koodaus-tehtävän ympärille, jossa viitekuvana oli valokuvaa, jossa oli kissa, koira, tiikeri, lintu, elefantti, pingviini, hai, seebra, giraffi tai panda, ja joka piti luoda skaalautuvilla vektorigrafiikkaohjelmilla (SVG), ja jonka tuloksia arvioitiin alkuperäisen valokuvan perusteella:

Sekä ihmisille että AI-osallistujille näytettiin valokuvallinen viitekuva rinnakkain AI: n generoiman SVG-rekonstruktion kanssa, ja heitä pyydettiin arvioimaan, kuinka samanlaisia kaksi oli seitsemän pisteen asteikolla. Lähde - https://arxiv.org/pdf/2602.10473

Sekä ihmisille että AI-osallistujille näytettiin valokuvallinen viitekuva rinnakkain AI: n generoiman SVG-rekonstruktion kanssa, ja heitä pyydettiin arvioimaan, kuinka samanlaisia kaksi oli seitsemän pisteen asteikolla. Lähde

Kussakin kierroksessa yksi agentti antoi korkean tason luonnollisen kielen ohjeita koodarin ohjaamiseksi, ja toinen päätti, pitäisikö uuden version hyväksyä vai palata edelliseen versioon – strukturoitu silmukka, joka heijastaa todellisia yhteistyön työvirtoja.

Yhteensä 16 kokeessa, joissa osallistui 604 osallistujaa ja tehtiin tuhansia API-kutsuja, verrattiin täysin ihmisten johtamia testikierroksia suoraan täysin AI-johtamiin kierroksiin samanlaisissa olosuhteissa.

Jotkut vaihtelevat ratkaisut, joita eri yhdistelmät ihmisen ja AI:n yhteistyön prosentteja ja tyyppejä (otettu suuremmasta kuvasta alkuperäisessä tutkimuksessa, johon viittaamme lukijaa).

Jotkut vaihtelevat ratkaisut, joita eri yhdistelmät ihmisen ja AI:n yhteistyön prosentteja ja tyyppejä (otettu suuremmasta kuvasta alkuperäisessä tutkimuksessa, johon viittaamme lukijaa).

Vaikka ihmiset ja AI suorittivat samalla tasolla kokeiden alussa, heidän uransa erosivat ajan myötä: kun ihmiset antoivat ohjeet ja tekivät valintapäätöksiä, samankaltaisuuspisteet kasvoivat iteroinneissa, ja tasaiset kertyvät parannukset; mutta kun AI-järjestelmät täyttivät molemmat roolit, suorituskyky ei osoittanut johdonmukaisia voittoja, ja usein heikkeni kierrosten aikana – vaikka sama perusmalli käytettiin koodin generoimiseen, ja AI: llä oli pääsy samaan tietoon kuin ihmisille osallistujille.

Vibe-koodauksen Ongelma

Tulokset osoittivat myös, että ihmisten ohjeet olivat tyypillisesti lyhyitä ja toimintasuuntautuneita, keskittyen siihen, mitä muuttaa seuraavaksi nykyisessä kuvassa; toisaalta AI-ohjeet olivat paljon pidempiä ja tiheämpiä kuvailevia (tekijä, joka parametriseerattiin GPT-5: lle), kuvailevia visuaalisia ominaisuuksia eikä priorisoinut inkrementaalista korjausta.

Mutta, kuten alla olevasta kaavasta voidaan nähdä, asettamalla AI-ohjeille tiukat sanarajat ei kääntänyt kaavaa; vaikka AI-ohjeita rajoitettiin 10, 20 tai 30 sanaan, AI-johtoketjut eivät kuitenkaan parantaneet tuloksia ajan myötä:

Samankaltaisuuspisteet iteroinneissa ihmisten johtamien ketjujen ja täysin AI-johtamien ketjujen sekä AI-johtamien ketjujen välillä, jotka olivat rajoitettu 10, 20 tai 30 sanan ohjeisiin, osoittavat, että lyhentämällä AI-käskyjä ei voida estää iteratiivista suorituskyvyn laskua, jota havaitaan, kun AI ohjaa sekä ohjeita että valintaa.

Samankaltaisuuspisteet iteroinneissa ihmisten johtamien ketjujen ja täysin AI-johtamien ketjujen sekä AI-johtamien ketjujen välillä, jotka olivat rajoitettu 10, 20 tai 30 sanan ohjeisiin, osoittavat, että lyhentämällä AI-käskyjä ei voida estää iteratiivista suorituskyvyn laskua, jota havaitaan, kun AI ohjaa sekä ohjeita että valintaa.

Hybridikokeet tekivät kaavan selkeämmäksi, osoittaen, että lisäämällä vain vähän inhimillistä osallistumista parannettiin tuloksia verrattuna täysin AI-johtamiin asetelmiin; mutta suorituskyky yleensä heikkeni, kun AI-ohjaus kasvoi.

Kun roolit erotettiin, arviointi ja valinta voitiin antaa AI: lle suhteellisen vähän laadun menetyksellä; mutta korvaamalla ihmisten korkean tason ohjeet AI-ohjaalla johti merkittäviin suorituskyvyn laskuihin, viitatessa siihen, että se, mikä oli tärkeintä, ei ollut se, kuka generoi koodin, vaan kuka asetti ja ylläpiti suunnan iteroinneissa.

Tutkijat johtavat:

‘Useiden kokeiden jälkeen ihmisten johtama koodaus parani jatkuvasti iteroinneissa, kun taas AI-johtama koodaus usein romahti, vaikka sillä oli pääsy samaan tietoon ja samankaltaisiin suorituskapasiteetteihin.

‘Tämä osoittaa, että nykyisten AI-järjestelmien avainhaasteita on ylläpitää koherenttia korkean tason suuntaa toistuvissa vuorovaikutuksissa, joita tarvitaan onnistuneeseen vibe-koodaukseen’

Uusi tutkimus on nimeltään Ihmisen ohjaus on tärkeää yhteisöllisessä vibe-koodauksessa, ja se on tehty seitsemän tutkijan toimesta Cornellin yliopistosta, Princetonin yliopistosta, Massachusettsin teknillisen korkeakoulun ja New Yorkin yliopiston.

Menetelmä

Kokeiden aikana ihmisen ohjaaja tarkasteli GPT-5: n generoimaa eläinviitekuvaa yhdessä viimeisimmän liittyvän SVG-jäljennöksen kanssa. Sitten he kirjoittivat luonnollisen kielen ohjeita koodarin ohjaamiseksi lähemmäksi vastaavuutta.

Näin ollen koodarin tulisi tuottaa uusi SVG jokaisessa kierroksessa, tarjoten iteratiivisen silmukan kokeiden suorittamiseen, jotta voidaan testata, miten ohjauksen vaikutus kertyy ajan myötä. Kohteina olivat kymmenen GPT-5: n generoimaa eläinkuvaa, jotka kattoivat valikoiman muotoja ja tekstuureja, jotta parannukset tai virheet olisivat helppoja havaita:

<img class="size-full wp-image-254931" src="https://www.unite.ai/wp-content/uploads/2026/02/figure-1-1.jpg" alt="Vibe-koodaus-työnkulun schema, jota tutkimuksessa käytettiin. A) Ihmisen ohjaaja tarkastelee valokuvallista viitekuvaa yhdessä parhaan SVG:n kanssa, joka on tuotettu tähän mennessä, ja kirjoittaa luonnollisen kielen ohjeita koodarin seuraamiseksi, kun seuraava SVG tuotetaan; B) Ihmisen valitsija vertaa uutta SVG: tä edelliseen ja valitsee, kumpi versio vastaa viitekuvaa paremmin, ennen kuin siirtää valitun SVG: n seuraavaan ohjauskierrokseen. C) Riippumattomat ihmisen arvioijat arvioivat, kuinka samanlaisia kunkin generoidun SVG: n ja sen viitekuvan välillä on, ja toimittavat pisteet, joita käytetään suorituskyvyn arviointiin.

Ihmisen valitsija vertasi jokaista uutta generoitu SVG: tä edelliseen ja hyväksyi tai hylkäsi sen, mikä piti prosessin linjassa viitekuvan kanssa kierrosten aikana. Tässä perusasettelussa sama ihminen suoritti molemmat roolit.

Laadun mittaamiseksi riippumattomat ihmisen arvioijat arvioivat, kuinka samanlaisia kunkin generoitu SVG ja sen viitekuva olivat. Kaikissa kokeissa 120 ihmistä antoi 4800 arviota. Kaikki kokeet suoritettiin PsyNet-viitekehyksessä, joka on portaaliratkaisu, joka on suunniteltu strukturoitujen vuorovaikutusten välistä ihmisten ja AI-järjestelmien välillä.

Tutkimus rekrytoi 604 englannin kielen äidinkielistä puhujaa, joissa kokeissa poltettiin 4800 API-kutsua koodin generointiin ja 5327 API-kutsua ohjeiden antamiseen. Vaikka GPT-5 oli pääasiallinen malli, jota käytettiin, pienemmät vertailuerät tehtiin Anthropicin Claude Opus 4.5: n ja Google Gemini 3 Pro: n kanssa, jotka käsittelivät kumpikin 280 kyselyä.

Tulokset

Kolmekymmentä vibe-koodauskierrosta suoritettiin, joista kussakin oli viisitoista muokkausta kymmenestä viitekuvasta. Niissä 45 ihmisen osallistujaa valittiin, jotka toimivat sekä valitsijana että ohjaajana kymmenen iteroinnin ajan “ihmisen johtamissa” kierroksissa.

Jokaisessa kierroksessa sama osallistuja valitsi ensin nykyisen ja edellisen SVG: n välillä ja kirjoitti sitten seuraavan kierroksen ohjeet. Toisessa versiossa kokeessa korvattiin nämä ihmisten päätökset GPT 5: n API-kutsuilla, kun taas loput asetuksesta pidettiin muuttumattomina. Kaikissa tapauksissa ohjaaja- ja valitsijaroolit ohjasivat koodaria yksinkertaisella kielellä.

Edustava esimerkki monikierroksisesta vibe-koodauksesta osoittaa, miten prosessi poikkeaa ajan myötä; kun ihmiset toimivat sekä valitsijana että ohjaajana, SVG-tulos parani tasaisesti iteroinneissa, lähestyen viitekuvaa kunkin kierroksen jälkeen:

Esimerkki edistymisestä yhdelle viitekuvalle ihmisen johdolla (yläosa) ja AI-johtoisella vibe-koodauksella (alaosa), osoittaen tasaisen parannuksen iteroinneissa, kun ihmiset ovat molemmissa rooleissa, ja tasapainon tai hajaantumisen, kun molemmat roolit on annettu AI: lle.

Esimerkki edistymisestä yhdelle viitekuvalle ihmisen johdolla (yläosa) ja AI-johtoisella vibe-koodauksella (alaosa), osoittaen tasaisen parannuksen iteroinneissa, kun ihmiset ovat molemmissa rooleissa, ja tasapainon tai hajaantumisen, kun molemmat roolit on annettu AI: lle.

Toisaalta AI-johtoisessa versiossa alkukierroksilla saattoi joskus saavuttaa tärkeitä visuaalisia piirteitä, mutta myöhemmät yritykset eivät onnistuneet rakentamaan näistä voitoista, ja joissakin tapauksissa ne etääntyivät kohdekuvalta:

Lopulliset tulokset viimeisestä iteroinnista, joissa verrataan ihmisen johdolla suoritettuja kierroksia (ylärivi) AI-johtoisiin ketjuihin (alarivi) saman viitekuvan joukon yli. Ihmisen johdolla saavutetut tulokset muistuttavat enemmän alkuperäisiä eläimiä, ja AI-johtoisten tulokset osoittavat näkyviä vääristymiä tai tärkeiden piirteiden menetystä.

Lopulliset tulokset viimeisestä iteroinnista, joissa verrataan ihmisen johdolla suoritettuja kierroksia (ylärivi) AI-johtoisiin ketjuihin (alarivi) saman viitekuvan joukon yli. Ihmisen johdolla saavutetut tulokset muistuttavat enemmän alkuperäisiä eläimiä, ja AI-johtoisten tulokset osoittavat näkyviä vääristymiä tai tärkeiden piirteiden menetystä.

Emergointien mittaamiseksi lopulliset kuvat näytettiin riippumattomille arvioitsijoille ja pisteytettiin viitekuvien samankaltaisuuden perusteella. Alkuvaiheessa sekä ihmisen johtamat että AI-johtoiset suoritukset saivat samat pisteet; mutta viidennentoista kierroksen jälkeen ero oli selvä, ja ihmisen valitsemat kuvat saivat paljon korkeammat pisteet kohteiden suhteen. Ajan myötä ihmisten pisteet kasvoivat tasaisesti, ja suurin suhteellinen voitto AI: n yli oli 27,1%.

Keskimääräiset samankaltaisuuspisteet iteroinneissa ihmisten johtamien ja AI-johtoisten vibe-koodausten välillä, osoittaen tasaisen parannuksen, kun ihmiset toimivat sekä valitsijana että ohjaajana, ja vähittäisen laskun, kun molemmat roolit on annettu GPT 5: lle.

Keskimääräiset samankaltaisuuspisteet iteroinneissa ihmisten johtamien ja AI-johtoisten vibe-koodausten välillä, osoittaen tasaisen parannuksen, kun ihmiset toimivat sekä valitsijana että ohjaajana, ja vähittäisen laskun, kun molemmat roolit on annettu GPT 5: lle.

Tutkijat varmistivat, että emergoivat trendit eivät johtuneet yksinomaan useiden samanaikaisten ihmisten osallistujien yhteisvoimasta, ja palkkasivat kymmenen ihmistä työskentelemään yksin, ja kunkin suorittamaan kolme kierrosta itse – ja tulokset paranevat samalla tavalla, osoittaen, että voitot eivät olleet yksittäisen yhteisön sattumaa.

Suurten Kuvien Näkeminen

Kuitenkin, jos GPT-5 arvioi itse tulokset, myöntäisikö se, että ihmisten tulokset olivat parempia? Ihmisten ja AI-pisteet liikkuivat yleensä samassa suunnassa, joten malli pystyi erottamaan hyvän ja huonon, mutta piti jatkuvasti AI-generoituja kuvia ihmisten arvioimia korkeampina.

‘Erikoisesti kysyimme, tunnistaako AI-välikappaleet, että heidän omat tuloksensa ovat heikompia kuin ihmisille tuotetut, vai osoittavatko ne mieltymyksen omiin luomuksiinsa, mikä osoittaisi mahdollisen linjauksen ongelman.’

Kuten kävi ilmi, on todella linjauksen ongelma*:

‘AI-arvioitsijat antoivat korkeammat arviot AI-generoituille [tuloksille]. Nämä löydökset osoittavat, että havaitut suorituskykyerot johtuvat edustusjärjestelmien välistä epäsovittumista ihmisten ja AI-välikappaleiden välillä.’

Tutkittaessa, miten ihmiset ja AI lausuvat ohjeita, eroja tuli ilmi kokeissa. Kuten alla olevasta kaavasta voidaan nähdä, sekä keskittyminen että pituus ovat aiheita, joissa AI ja ihmiset poikkeavat toisistaan:
<img class=" wp-image-254943" src="https://www.unite.ai/wp-content/uploads/2026/02/figure-4-3.jpg" alt="Vertailu siitä, miten ihmiset ja AI antoivat ohjeita koodaus-tehtävän aikana. 'A' osoittaa, että ihmiset kirjoittavat lyhyitä, suoria ohjeita, kun taas AI kirjoittaa pitkiä, yksityiskohtaisia kuvauksia. 'B' kartoittaa ohjeita, paljastaen, että ihmisten ohjeet ryhmittäytyvät yhteen, kun taas AI-ohjeet jakautuvat eläinten mukaan. 'C' seuraa, miten AI-ohjeiden pituuden rajoittaminen ei korjaa heidän heikkoja tuloksiaan ajan myötä; ja 'D' osoittaa, että ihmiset antavat monipuolisempaa ja tasapainotumpaa ohjausta kuin AI, jopa kun sanarajoja asetetaan.

Ihmisten ohjeet olivat usein lyhyitä ja suoria, tarjoten selviä muutoksia, jotka voitiin soveltaa yleisesti kohteisiin. Toisaalta AI-ohjeet olivat tiheämpiä kuvailevia, ja usein täynnä yksityiskohtaisia tietoja varjostuksesta, tekstuureista, valaistuksesta tai anatominen yksityiskohtia – kuvausten, jotka saattavat olla järkeviä erillään, mutta eivät tarjoa hyödyllisiä seuraavaksi askelia mallille (ja jotka ovat tuttuja niille, jotka tietävät LLM: n ongelmista kontekstin pituuden suhteen, eli kykyä pitää “isoa kuvaa” mielessä, kun projekti kehittyy ja kasvaa).

Kun katsotaan, parantaisiko vähentäminen AI-ohjeiden sanamäärää suorituskykyä, GPT-5: ttä rajoitettiin 10, 20 tai 30 sanaan per ohje; mutta jopa nämä pakotetut ohjeet eivät osoittaneet parannusta (ks. yllä olevan kaavion oikea alaosa).

Yhteiset Ponnistelut

Tutkittaessa, mitä tapahtuu, kun ihmiset ja AI jakavat valvonnan, tutkijat suorittivat koodaustehtäviä, joissa oli eri yhdistelmiä ihmisen ja AI:n syötettä, aina enimmäkseen ihmisten enimmäkseen AI: n välillä.

Jokainen hybridiympäristö ylitti täysin AI-ohjatun valvonnan, joten jopa vähäinen määrä ihmisen ohjausta paransi tuloksia:

<img class=" wp-image-254946" src="https://www.unite.ai/wp-content/uploads/2026/02/figure-5-2.jpg" alt="Hybridikoodausasettelut eri ihmisen ja AI:n sekoitusten kanssa. (A) Osoittaa, miten ihmiset ja AI vuorottelivat ohjaajina ja valitsijoina koodausvaiheessa; (B) osoittaa, että enemmän ihmisten osallistumista johti parempiin tuloksiin, kun taas suurempi AI-syöttö laski pisteitä; ja (C) kuvaa tasaisen laskun lopullisen tuloksen laadussa, kun ihmisten osallistumisen osuus vähenee, vahvistaen, että tasaisempi ihmisen suuntaaminen tuotti parempia tuloksia.

Kun AI otti enemmän prosessia haltuun, suorituskyky heikkeni, ja parhaat tulokset saavutettiin, kun ihmiset johtivat useimmissa kierroksissa, ja heikoin, kun AI johti useimmissa kierroksissa. Mikään näistä sekoitettuista asettelusta ei onnistunut ylläpitämään parannusta kunkin uuden kierroksen myötä, viitatessa siihen, että ihmisen suuntaaminen toimii parhaiten, kun se on tasainen ja johdonmukainen, eikä satunnainen.

Roolin Kääntäminen

Tutkimus tutki myös, vaikuttaako se, kuka tekee mitä näissä tehtävissä, ja testasi tätä. Uudelleen suunniteltu tehtävä käsitti kaksi tehtävää: yksi osallistuja määräsi, miten muuttaa kuvaa, ja toinen valitsi mieluisamman version.

Kun molemmat tehtävät suoritettiin ihmisillä, laatu säilyi; mutta kun ihminen antoi ohjeet eikä kukaan valinnut versioita, laatu heikkeni:

Roolin jakoa koskevat kokeet vibe-koodauksessa: (A) Poistamalla valitsijan rooli johti heikkoon suorituskykyyn, jopa kun ihminen antoi ohjeet; (B) Korvaamalla ihmisen valitsija AI: llä laski laatuuta hieman, mutta ei yhtä voimakkaasti kuin valitsijan kokonaan poistaminen.

Roolin jakoa koskevat kokeet vibe-koodauksessa: (A) Poistamalla valitsijan rooli johti heikkoon suorituskykyyn, jopa kun ihminen antoi ohjeet; (B) Korvaamalla ihmisen valitsija AI: llä laski laatuuta hieman, mutta ei yhtä voimakkaasti kuin valitsijan kokonaan poistaminen.

Kun AI oli vastuussa, valinnan vaiheen puuttuminen ei merkinnyt mitään, koska sen tulokset pysyivät muuttumattomina kummassakin tapauksessa; mutta kun ihmiset antoivat ohjeet ja AI valitsi tulokset, laatu säilyi lähellä kaiken ihmisten asettelua.

Toinen tapaus ei toiminut: kun AI antoi ohjeet ja ihmiset valitsivat tulokset, se johti heikkoompiin tuloksiin, viitatessa siihen, että ihmisen luova ohjaus on edelleen tärkeää, kun taas valinnan tehtävä voidaan usein siirtää AI: lle ilman suurta menetystä.

Tutkimusraportti johtaa:

‘[Korkean tason] idean luominen ja ohjaus ovat kriittisiä ihmisten panoksia, kun taas arviointi ja valinta voidaan usein delegoida AI: lle ilman suorituskyvyn menetystä.

‘Tämä ehdottaa käytännön suunnitteluperiaatetta hybridi-järjestelmille: ihmiset tulisi asettaa suunta, kun taas AI voi tukea arviointia ja suorittamista.’

Johtopäätös

On vielä nähtävä, kuinka paljon parannettu ja/tai lisääntyneet kontekstipuitteet vaikuttavat LLM: n suorituskykyyn tehtävissä, joissa on kyse tästä. Päivä, jona “LLM-muisti” loppuu olemasta päivittäinen ongelmakohta ihmisten ja AI: n yhteistyössä, voi olla sekä juhla- että hälytysmerkki, koska ongelma, jonka AI pyrkii ratkaisemaan, on perusteltavasti ihmiset.

Kuitenkin tutkijoiden työ osoittaa myös, että on luonnollisia ja kriittisiä erimielisyyksiä AI: n ja ihmisten välillä laadun suhteen, jotka saattavat vielä määrittyä kuluttajien toimesta olevan korvaamattoman inhimillisen käsitteen.

 

* Minun muunnoksen alkuperäisten kirjoittajien sisäisistä viittauksista hyperlinkkeihin.

Julkaistu ensimmäisen kerran perjantaina 13. helmikuuta 2026

Kirjoittaja koneoppimisen parissa, ihmiskuvan synteesin asiantuntija. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se sulautui DNEG:n Brahma.ai:ksi.
Verkkosivu: martinanderson.ai
Yhteystiedot: martin@martinanderson.ai