Andersonin kulma

Vibe-koodauksen Ongelma Kun AI:n Rooli Laajenee

mm
LisÃĪÃĪ Unite.AI suosikkilÃĪhteisiisi Google-palvelussa
An AI-generated stock-style image depicting a human Caucasian male and a larger glossy humanoid robot attempting to collaborate on a document; but the aggressive robot is causing the annoyed man to be sidelined. GPT-5 Image + Photoshop enhancement.

Uusi tutkimus osoittaa, ettÃĪ vibe-koodaus parani, kun ihmiset antoivat ohjeet, mutta heikkeni, kun AI teki sen, ja paras hybridiympÃĪristÃķ piti ihmiset etusijalla, AI: n toimien arvostelijana tai tuomarina.

 

Yhdysvalloista kotoisin oleva uusi tutkimus, joka tarkastelee, mitÃĪ tapahtuu, kun AI-jÃĪrjestelmiÃĪ sallitaan ohjata vibe-koodausta, ei ainoastaan suorittaen ihmisten ohjeita, on havainnut, ettÃĪ kun suuret kielen mallit (LLM) ottavat suuremman suunnan roolin, tulokset ovat lÃĪhes aina huonompia.

Vaikka tutkijat kÃĪyttivÃĪt OpenAI:n GPT-5:ÃĪÃĪ ihmisen ja AI:n yhteistyÃķn kokeiden viitekehyksenÃĪ, he myÃķhemmin vahvistivat, ettÃĪ sekÃĪ Anthropicin Claude Opus 4.5 ettÃĪ Google Gemini 3 Pro olivat alttiina samalle heikentymiskÃĪyrÃĪlle, kun vastuut kasvoivat, ja totesivat, ettÃĪ â€œjopa rajoitettu ihmisen osallistuminen parantaa jatkuvasti suorituskykyÃĪ”:

‘[Ihmiset] tarjoavat ainutlaatuisesti tehokkaita korkean tason ohjeita iteroinneissa, [kun taas] AI-ohjeet usein johtavat suorituskyvyn romahdukseen. LisÃĪksi havaitsemme, ettÃĪ huolellinen roolien jakautuminen, jossa ihmiset ovat vastuussa suunnasta ja arvioinnista AI: lle, voi parantaa hybridi-suorituskykyÃĪ.’

Jotta voidaan tarjota yhdenmukainen testi, jota voidaan arvioida yhtÃĪlÃĪisesti sekÃĪ ihmisille ettÃĪ AI: lle, kontrolloitu kokeellinen viitekehys rakennettiin iteratiivisen koodaus-tehtÃĪvÃĪn ympÃĪrille, jossa viitekuvana oli valokuvaa, jossa oli kissa, koira, tiikeri, lintu, elefantti, pingviini, hai, seebra, giraffi tai panda, ja joka piti luoda skaalautuvilla vektorigrafiikkaohjelmilla (SVG), ja jonka tuloksia arvioitiin alkuperÃĪisen valokuvan perusteella:

SekÃĪ ihmisille ettÃĪ AI-osallistujille nÃĪytettiin valokuvallinen viitekuva rinnakkain AI: n generoiman SVG-rekonstruktion kanssa, ja heitÃĪ pyydettiin arvioimaan, kuinka samanlaisia kaksi oli seitsemÃĪn pisteen asteikolla. LÃĪhde - https://arxiv.org/pdf/2602.10473

SekÃĪ ihmisille ettÃĪ AI-osallistujille nÃĪytettiin valokuvallinen viitekuva rinnakkain AI: n generoiman SVG-rekonstruktion kanssa, ja heitÃĪ pyydettiin arvioimaan, kuinka samanlaisia kaksi oli seitsemÃĪn pisteen asteikolla. LÃĪhde

Kussakin kierroksessa yksi agentti antoi korkean tason luonnollisen kielen ohjeita koodarin ohjaamiseksi, ja toinen pÃĪÃĪtti, pitÃĪisikÃķ uuden version hyvÃĪksyÃĪ vai palata edelliseen versioon – strukturoitu silmukka, joka heijastaa todellisia yhteistyÃķn tyÃķvirtoja.

YhteensÃĪ 16 kokeessa, joissa osallistui 604 osallistujaa ja tehtiin tuhansia API-kutsuja, verrattiin tÃĪysin ihmisten johtamia testikierroksia suoraan tÃĪysin AI-johtamiin kierroksiin samanlaisissa olosuhteissa.

Jotkut vaihtelevat ratkaisut, joita eri yhdistelmÃĪt ihmisen ja AI:n yhteistyÃķn prosentteja ja tyyppejÃĪ (otettu suuremmasta kuvasta alkuperÃĪisessÃĪ tutkimuksessa, johon viittaamme lukijaa).

Jotkut vaihtelevat ratkaisut, joita eri yhdistelmÃĪt ihmisen ja AI:n yhteistyÃķn prosentteja ja tyyppejÃĪ (otettu suuremmasta kuvasta alkuperÃĪisessÃĪ tutkimuksessa, johon viittaamme lukijaa).

Vaikka ihmiset ja AI suorittivat samalla tasolla kokeiden alussa, heidÃĪn uransa erosivat ajan myÃķtÃĪ: kun ihmiset antoivat ohjeet ja tekivÃĪt valintapÃĪÃĪtÃķksiÃĪ, samankaltaisuuspisteet kasvoivat iteroinneissa, ja tasaiset kertyvÃĪt parannukset; mutta kun AI-jÃĪrjestelmÃĪt tÃĪyttivÃĪt molemmat roolit, suorituskyky ei osoittanut johdonmukaisia voittoja, ja usein heikkeni kierrosten aikana – vaikka sama perusmalli kÃĪytettiin koodin generoimiseen, ja AI: llÃĪ oli pÃĪÃĪsy samaan tietoon kuin ihmisille osallistujille.

Vibe-koodauksen Ongelma

Tulokset osoittivat myÃķs, ettÃĪ ihmisten ohjeet olivat tyypillisesti lyhyitÃĪ ja toimintasuuntautuneita, keskittyen siihen, mitÃĪ muuttaa seuraavaksi nykyisessÃĪ kuvassa; toisaalta AI-ohjeet olivat paljon pidempiÃĪ ja tiheÃĪmpiÃĪ kuvailevia (tekijÃĪ, joka parametriseerattiin GPT-5: lle), kuvailevia visuaalisia ominaisuuksia eikÃĪ priorisoinut inkrementaalista korjausta.

Mutta, kuten alla olevasta kaavasta voidaan nÃĪhdÃĪ, asettamalla AI-ohjeille tiukat sanarajat ei kÃĪÃĪntÃĪnyt kaavaa; vaikka AI-ohjeita rajoitettiin 10, 20 tai 30 sanaan, AI-johtoketjut eivÃĪt kuitenkaan parantaneet tuloksia ajan myÃķtÃĪ:

Samankaltaisuuspisteet iteroinneissa ihmisten johtamien ketjujen ja tÃĪysin AI-johtamien ketjujen sekÃĪ AI-johtamien ketjujen vÃĪlillÃĪ, jotka olivat rajoitettu 10, 20 tai 30 sanan ohjeisiin, osoittavat, ettÃĪ lyhentÃĪmÃĪllÃĪ AI-kÃĪskyjÃĪ ei voida estÃĪÃĪ iteratiivista suorituskyvyn laskua, jota havaitaan, kun AI ohjaa sekÃĪ ohjeita ettÃĪ valintaa.

Samankaltaisuuspisteet iteroinneissa ihmisten johtamien ketjujen ja tÃĪysin AI-johtamien ketjujen sekÃĪ AI-johtamien ketjujen vÃĪlillÃĪ, jotka olivat rajoitettu 10, 20 tai 30 sanan ohjeisiin, osoittavat, ettÃĪ lyhentÃĪmÃĪllÃĪ AI-kÃĪskyjÃĪ ei voida estÃĪÃĪ iteratiivista suorituskyvyn laskua, jota havaitaan, kun AI ohjaa sekÃĪ ohjeita ettÃĪ valintaa.

Hybridikokeet tekivÃĪt kaavan selkeÃĪmmÃĪksi, osoittaen, ettÃĪ lisÃĪÃĪmÃĪllÃĪ vain vÃĪhÃĪn inhimillistÃĪ osallistumista parannettiin tuloksia verrattuna tÃĪysin AI-johtamiin asetelmiin; mutta suorituskyky yleensÃĪ heikkeni, kun AI-ohjaus kasvoi.

Kun roolit erotettiin, arviointi ja valinta voitiin antaa AI: lle suhteellisen vÃĪhÃĪn laadun menetyksellÃĪ; mutta korvaamalla ihmisten korkean tason ohjeet AI-ohjaalla johti merkittÃĪviin suorituskyvyn laskuihin, viitatessa siihen, ettÃĪ se, mikÃĪ oli tÃĪrkeintÃĪ, ei ollut se, kuka generoi koodin, vaan kuka asetti ja yllÃĪpiti suunnan iteroinneissa.

Tutkijat johtavat:

‘Useiden kokeiden jÃĪlkeen ihmisten johtama koodaus parani jatkuvasti iteroinneissa, kun taas AI-johtama koodaus usein romahti, vaikka sillÃĪ oli pÃĪÃĪsy samaan tietoon ja samankaltaisiin suorituskapasiteetteihin.

‘TÃĪmÃĪ osoittaa, ettÃĪ nykyisten AI-jÃĪrjestelmien avainhaasteita on yllÃĪpitÃĪÃĪ koherenttia korkean tason suuntaa toistuvissa vuorovaikutuksissa, joita tarvitaan onnistuneeseen vibe-koodaukseen’

Uusi tutkimus on nimeltÃĪÃĪn Ihmisen ohjaus on tÃĪrkeÃĪÃĪ yhteisÃķllisessÃĪ vibe-koodauksessa, ja se on tehty seitsemÃĪn tutkijan toimesta Cornellin yliopistosta, Princetonin yliopistosta, Massachusettsin teknillisen korkeakoulun ja New Yorkin yliopiston.

MenetelmÃĪ

Kokeiden aikana ihmisen ohjaaja tarkasteli GPT-5: n generoimaa elÃĪinviitekuvaa yhdessÃĪ viimeisimmÃĪn liittyvÃĪn SVG-jÃĪljennÃķksen kanssa. Sitten he kirjoittivat luonnollisen kielen ohjeita koodarin ohjaamiseksi lÃĪhemmÃĪksi vastaavuutta.

NÃĪin ollen koodarin tulisi tuottaa uusi SVG jokaisessa kierroksessa, tarjoten iteratiivisen silmukan kokeiden suorittamiseen, jotta voidaan testata, miten ohjauksen vaikutus kertyy ajan myÃķtÃĪ. Kohteina olivat kymmenen GPT-5: n generoimaa elÃĪinkuvaa, jotka kattoivat valikoiman muotoja ja tekstuureja, jotta parannukset tai virheet olisivat helppoja havaita:

<img class="size-full wp-image-254931" src="https://www.unite.ai/wp-content/uploads/2026/02/figure-1-1.jpg" alt="Vibe-koodaus-tyÃķnkulun schema, jota tutkimuksessa kÃĪytettiin. A) Ihmisen ohjaaja tarkastelee valokuvallista viitekuvaa yhdessÃĪ parhaan SVG:n kanssa, joka on tuotettu tÃĪhÃĪn mennessÃĪ, ja kirjoittaa luonnollisen kielen ohjeita koodarin seuraamiseksi, kun seuraava SVG tuotetaan; B) Ihmisen valitsija vertaa uutta SVG: tÃĪ edelliseen ja valitsee, kumpi versio vastaa viitekuvaa paremmin, ennen kuin siirtÃĪÃĪ valitun SVG: n seuraavaan ohjauskierrokseen. C) Riippumattomat ihmisen arvioijat arvioivat, kuinka samanlaisia kunkin generoidun SVG: n ja sen viitekuvan vÃĪlillÃĪ on, ja toimittavat pisteet, joita kÃĪytetÃĪÃĪn suorituskyvyn arviointiin.

Ihmisen valitsija vertasi jokaista uutta generoitu SVG: tÃĪ edelliseen ja hyvÃĪksyi tai hylkÃĪsi sen, mikÃĪ piti prosessin linjassa viitekuvan kanssa kierrosten aikana. TÃĪssÃĪ perusasettelussa sama ihminen suoritti molemmat roolit.

Laadun mittaamiseksi riippumattomat ihmisen arvioijat arvioivat, kuinka samanlaisia kunkin generoitu SVG ja sen viitekuva olivat. Kaikissa kokeissa 120 ihmistÃĪ antoi 4800 arviota. Kaikki kokeet suoritettiin PsyNet-viitekehyksessÃĪ, joka on portaaliratkaisu, joka on suunniteltu strukturoitujen vuorovaikutusten vÃĪlistÃĪ ihmisten ja AI-jÃĪrjestelmien vÃĪlillÃĪ.

Tutkimus rekrytoi 604 englannin kielen ÃĪidinkielistÃĪ puhujaa, joissa kokeissa poltettiin 4800 API-kutsua koodin generointiin ja 5327 API-kutsua ohjeiden antamiseen. Vaikka GPT-5 oli pÃĪÃĪasiallinen malli, jota kÃĪytettiin, pienemmÃĪt vertailuerÃĪt tehtiin Anthropicin Claude Opus 4.5: n ja Google Gemini 3 Pro: n kanssa, jotka kÃĪsittelivÃĪt kumpikin 280 kyselyÃĪ.

Tulokset

KolmekymmentÃĪ vibe-koodauskierrosta suoritettiin, joista kussakin oli viisitoista muokkausta kymmenestÃĪ viitekuvasta. NiissÃĪ 45 ihmisen osallistujaa valittiin, jotka toimivat sekÃĪ valitsijana ettÃĪ ohjaajana kymmenen iteroinnin ajan “ihmisen johtamissa” kierroksissa.

Jokaisessa kierroksessa sama osallistuja valitsi ensin nykyisen ja edellisen SVG: n vÃĪlillÃĪ ja kirjoitti sitten seuraavan kierroksen ohjeet. Toisessa versiossa kokeessa korvattiin nÃĪmÃĪ ihmisten pÃĪÃĪtÃķkset GPT 5: n API-kutsuilla, kun taas loput asetuksesta pidettiin muuttumattomina. Kaikissa tapauksissa ohjaaja- ja valitsijaroolit ohjasivat koodaria yksinkertaisella kielellÃĪ.

Edustava esimerkki monikierroksisesta vibe-koodauksesta osoittaa, miten prosessi poikkeaa ajan myÃķtÃĪ; kun ihmiset toimivat sekÃĪ valitsijana ettÃĪ ohjaajana, SVG-tulos parani tasaisesti iteroinneissa, lÃĪhestyen viitekuvaa kunkin kierroksen jÃĪlkeen:

Esimerkki edistymisestÃĪ yhdelle viitekuvalle ihmisen johdolla (ylÃĪosa) ja AI-johtoisella vibe-koodauksella (alaosa), osoittaen tasaisen parannuksen iteroinneissa, kun ihmiset ovat molemmissa rooleissa, ja tasapainon tai hajaantumisen, kun molemmat roolit on annettu AI: lle.

Esimerkki edistymisestÃĪ yhdelle viitekuvalle ihmisen johdolla (ylÃĪosa) ja AI-johtoisella vibe-koodauksella (alaosa), osoittaen tasaisen parannuksen iteroinneissa, kun ihmiset ovat molemmissa rooleissa, ja tasapainon tai hajaantumisen, kun molemmat roolit on annettu AI: lle.

Toisaalta AI-johtoisessa versiossa alkukierroksilla saattoi joskus saavuttaa tÃĪrkeitÃĪ visuaalisia piirteitÃĪ, mutta myÃķhemmÃĪt yritykset eivÃĪt onnistuneet rakentamaan nÃĪistÃĪ voitoista, ja joissakin tapauksissa ne etÃĪÃĪntyivÃĪt kohdekuvalta:

Lopulliset tulokset viimeisestÃĪ iteroinnista, joissa verrataan ihmisen johdolla suoritettuja kierroksia (ylÃĪrivi) AI-johtoisiin ketjuihin (alarivi) saman viitekuvan joukon yli. Ihmisen johdolla saavutetut tulokset muistuttavat enemmÃĪn alkuperÃĪisiÃĪ elÃĪimiÃĪ, ja AI-johtoisten tulokset osoittavat nÃĪkyviÃĪ vÃĪÃĪristymiÃĪ tai tÃĪrkeiden piirteiden menetystÃĪ.

Lopulliset tulokset viimeisestÃĪ iteroinnista, joissa verrataan ihmisen johdolla suoritettuja kierroksia (ylÃĪrivi) AI-johtoisiin ketjuihin (alarivi) saman viitekuvan joukon yli. Ihmisen johdolla saavutetut tulokset muistuttavat enemmÃĪn alkuperÃĪisiÃĪ elÃĪimiÃĪ, ja AI-johtoisten tulokset osoittavat nÃĪkyviÃĪ vÃĪÃĪristymiÃĪ tai tÃĪrkeiden piirteiden menetystÃĪ.

Emergointien mittaamiseksi lopulliset kuvat nÃĪytettiin riippumattomille arvioitsijoille ja pisteytettiin viitekuvien samankaltaisuuden perusteella. Alkuvaiheessa sekÃĪ ihmisen johtamat ettÃĪ AI-johtoiset suoritukset saivat samat pisteet; mutta viidennentoista kierroksen jÃĪlkeen ero oli selvÃĪ, ja ihmisen valitsemat kuvat saivat paljon korkeammat pisteet kohteiden suhteen. Ajan myÃķtÃĪ ihmisten pisteet kasvoivat tasaisesti, ja suurin suhteellinen voitto AI: n yli oli 27,1%.

KeskimÃĪÃĪrÃĪiset samankaltaisuuspisteet iteroinneissa ihmisten johtamien ja AI-johtoisten vibe-koodausten vÃĪlillÃĪ, osoittaen tasaisen parannuksen, kun ihmiset toimivat sekÃĪ valitsijana ettÃĪ ohjaajana, ja vÃĪhittÃĪisen laskun, kun molemmat roolit on annettu GPT 5: lle.

KeskimÃĪÃĪrÃĪiset samankaltaisuuspisteet iteroinneissa ihmisten johtamien ja AI-johtoisten vibe-koodausten vÃĪlillÃĪ, osoittaen tasaisen parannuksen, kun ihmiset toimivat sekÃĪ valitsijana ettÃĪ ohjaajana, ja vÃĪhittÃĪisen laskun, kun molemmat roolit on annettu GPT 5: lle.

Tutkijat varmistivat, ettÃĪ emergoivat trendit eivÃĪt johtuneet yksinomaan useiden samanaikaisten ihmisten osallistujien yhteisvoimasta, ja palkkasivat kymmenen ihmistÃĪ tyÃķskentelemÃĪÃĪn yksin, ja kunkin suorittamaan kolme kierrosta itse – ja tulokset paranevat samalla tavalla, osoittaen, ettÃĪ voitot eivÃĪt olleet yksittÃĪisen yhteisÃķn sattumaa.

Suurten Kuvien NÃĪkeminen

Kuitenkin, jos GPT-5 arvioi itse tulokset, myÃķntÃĪisikÃķ se, ettÃĪ ihmisten tulokset olivat parempia? Ihmisten ja AI-pisteet liikkuivat yleensÃĪ samassa suunnassa, joten malli pystyi erottamaan hyvÃĪn ja huonon, mutta piti jatkuvasti AI-generoituja kuvia ihmisten arvioimia korkeampina.

‘Erikoisesti kysyimme, tunnistaako AI-vÃĪlikappaleet, ettÃĪ heidÃĪn omat tuloksensa ovat heikompia kuin ihmisille tuotetut, vai osoittavatko ne mieltymyksen omiin luomuksiinsa, mikÃĪ osoittaisi mahdollisen linjauksen ongelman.’

Kuten kÃĪvi ilmi, on todella linjauksen ongelma*:

‘AI-arvioitsijat antoivat korkeammat arviot AI-generoituille [tuloksille]. NÃĪmÃĪ lÃķydÃķkset osoittavat, ettÃĪ havaitut suorituskykyerot johtuvat edustusjÃĪrjestelmien vÃĪlistÃĪ epÃĪsovittumista ihmisten ja AI-vÃĪlikappaleiden vÃĪlillÃĪ.’

Tutkittaessa, miten ihmiset ja AI lausuvat ohjeita, eroja tuli ilmi kokeissa. Kuten alla olevasta kaavasta voidaan nÃĪhdÃĪ, sekÃĪ keskittyminen ettÃĪ pituus ovat aiheita, joissa AI ja ihmiset poikkeavat toisistaan:
<img class=" wp-image-254943" src="https://www.unite.ai/wp-content/uploads/2026/02/figure-4-3.jpg" alt="Vertailu siitÃĪ, miten ihmiset ja AI antoivat ohjeita koodaus-tehtÃĪvÃĪn aikana. 'A' osoittaa, ettÃĪ ihmiset kirjoittavat lyhyitÃĪ, suoria ohjeita, kun taas AI kirjoittaa pitkiÃĪ, yksityiskohtaisia kuvauksia. 'B' kartoittaa ohjeita, paljastaen, ettÃĪ ihmisten ohjeet ryhmittÃĪytyvÃĪt yhteen, kun taas AI-ohjeet jakautuvat elÃĪinten mukaan. 'C' seuraa, miten AI-ohjeiden pituuden rajoittaminen ei korjaa heidÃĪn heikkoja tuloksiaan ajan myÃķtÃĪ; ja 'D' osoittaa, ettÃĪ ihmiset antavat monipuolisempaa ja tasapainotumpaa ohjausta kuin AI, jopa kun sanarajoja asetetaan.

Ihmisten ohjeet olivat usein lyhyitÃĪ ja suoria, tarjoten selviÃĪ muutoksia, jotka voitiin soveltaa yleisesti kohteisiin. Toisaalta AI-ohjeet olivat tiheÃĪmpiÃĪ kuvailevia, ja usein tÃĪynnÃĪ yksityiskohtaisia tietoja varjostuksesta, tekstuureista, valaistuksesta tai anatominen yksityiskohtia – kuvausten, jotka saattavat olla jÃĪrkeviÃĪ erillÃĪÃĪn, mutta eivÃĪt tarjoa hyÃķdyllisiÃĪ seuraavaksi askelia mallille (ja jotka ovat tuttuja niille, jotka tietÃĪvÃĪt LLM: n ongelmista kontekstin pituuden suhteen, eli kykyÃĪ pitÃĪÃĪ â€œisoa kuvaa” mielessÃĪ, kun projekti kehittyy ja kasvaa).

Kun katsotaan, parantaisiko vÃĪhentÃĪminen AI-ohjeiden sanamÃĪÃĪrÃĪÃĪ suorituskykyÃĪ, GPT-5: ttÃĪ rajoitettiin 10, 20 tai 30 sanaan per ohje; mutta jopa nÃĪmÃĪ pakotetut ohjeet eivÃĪt osoittaneet parannusta (ks. yllÃĪ olevan kaavion oikea alaosa).

Yhteiset Ponnistelut

Tutkittaessa, mitÃĪ tapahtuu, kun ihmiset ja AI jakavat valvonnan, tutkijat suorittivat koodaustehtÃĪviÃĪ, joissa oli eri yhdistelmiÃĪ ihmisen ja AI:n syÃķtettÃĪ, aina enimmÃĪkseen ihmisten enimmÃĪkseen AI: n vÃĪlillÃĪ.

Jokainen hybridiympÃĪristÃķ ylitti tÃĪysin AI-ohjatun valvonnan, joten jopa vÃĪhÃĪinen mÃĪÃĪrÃĪ ihmisen ohjausta paransi tuloksia:

<img class=" wp-image-254946" src="https://www.unite.ai/wp-content/uploads/2026/02/figure-5-2.jpg" alt="Hybridikoodausasettelut eri ihmisen ja AI:n sekoitusten kanssa. (A) Osoittaa, miten ihmiset ja AI vuorottelivat ohjaajina ja valitsijoina koodausvaiheessa; (B) osoittaa, ettÃĪ enemmÃĪn ihmisten osallistumista johti parempiin tuloksiin, kun taas suurempi AI-syÃķttÃķ laski pisteitÃĪ; ja (C) kuvaa tasaisen laskun lopullisen tuloksen laadussa, kun ihmisten osallistumisen osuus vÃĪhenee, vahvistaen, ettÃĪ tasaisempi ihmisen suuntaaminen tuotti parempia tuloksia.

Kun AI otti enemmÃĪn prosessia haltuun, suorituskyky heikkeni, ja parhaat tulokset saavutettiin, kun ihmiset johtivat useimmissa kierroksissa, ja heikoin, kun AI johti useimmissa kierroksissa. MikÃĪÃĪn nÃĪistÃĪ sekoitettuista asettelusta ei onnistunut yllÃĪpitÃĪmÃĪÃĪn parannusta kunkin uuden kierroksen myÃķtÃĪ, viitatessa siihen, ettÃĪ ihmisen suuntaaminen toimii parhaiten, kun se on tasainen ja johdonmukainen, eikÃĪ satunnainen.

Roolin KÃĪÃĪntÃĪminen

Tutkimus tutki myÃķs, vaikuttaako se, kuka tekee mitÃĪ nÃĪissÃĪ tehtÃĪvissÃĪ, ja testasi tÃĪtÃĪ. Uudelleen suunniteltu tehtÃĪvÃĪ kÃĪsitti kaksi tehtÃĪvÃĪÃĪ: yksi osallistuja mÃĪÃĪrÃĪsi, miten muuttaa kuvaa, ja toinen valitsi mieluisamman version.

Kun molemmat tehtÃĪvÃĪt suoritettiin ihmisillÃĪ, laatu sÃĪilyi; mutta kun ihminen antoi ohjeet eikÃĪ kukaan valinnut versioita, laatu heikkeni:

Roolin jakoa koskevat kokeet vibe-koodauksessa: (A) Poistamalla valitsijan rooli johti heikkoon suorituskykyyn, jopa kun ihminen antoi ohjeet; (B) Korvaamalla ihmisen valitsija AI: llÃĪ laski laatuuta hieman, mutta ei yhtÃĪ voimakkaasti kuin valitsijan kokonaan poistaminen.

Roolin jakoa koskevat kokeet vibe-koodauksessa: (A) Poistamalla valitsijan rooli johti heikkoon suorituskykyyn, jopa kun ihminen antoi ohjeet; (B) Korvaamalla ihmisen valitsija AI: llÃĪ laski laatuuta hieman, mutta ei yhtÃĪ voimakkaasti kuin valitsijan kokonaan poistaminen.

Kun AI oli vastuussa, valinnan vaiheen puuttuminen ei merkinnyt mitÃĪÃĪn, koska sen tulokset pysyivÃĪt muuttumattomina kummassakin tapauksessa; mutta kun ihmiset antoivat ohjeet ja AI valitsi tulokset, laatu sÃĪilyi lÃĪhellÃĪ kaiken ihmisten asettelua.

Toinen tapaus ei toiminut: kun AI antoi ohjeet ja ihmiset valitsivat tulokset, se johti heikkoompiin tuloksiin, viitatessa siihen, ettÃĪ ihmisen luova ohjaus on edelleen tÃĪrkeÃĪÃĪ, kun taas valinnan tehtÃĪvÃĪ voidaan usein siirtÃĪÃĪ AI: lle ilman suurta menetystÃĪ.

Tutkimusraportti johtaa:

‘[Korkean tason] idean luominen ja ohjaus ovat kriittisiÃĪ ihmisten panoksia, kun taas arviointi ja valinta voidaan usein delegoida AI: lle ilman suorituskyvyn menetystÃĪ.

‘TÃĪmÃĪ ehdottaa kÃĪytÃĪnnÃķn suunnitteluperiaatetta hybridi-jÃĪrjestelmille: ihmiset tulisi asettaa suunta, kun taas AI voi tukea arviointia ja suorittamista.’

JohtopÃĪÃĪtÃķs

On vielÃĪ nÃĪhtÃĪvÃĪ, kuinka paljon parannettu ja/tai lisÃĪÃĪntyneet kontekstipuitteet vaikuttavat LLM: n suorituskykyyn tehtÃĪvissÃĪ, joissa on kyse tÃĪstÃĪ. PÃĪivÃĪ, jona “LLM-muisti” loppuu olemasta pÃĪivittÃĪinen ongelmakohta ihmisten ja AI: n yhteistyÃķssÃĪ, voi olla sekÃĪ juhla- ettÃĪ hÃĪlytysmerkki, koska ongelma, jonka AI pyrkii ratkaisemaan, on perusteltavasti ihmiset.

Kuitenkin tutkijoiden tyÃķ osoittaa myÃķs, ettÃĪ on luonnollisia ja kriittisiÃĪ erimielisyyksiÃĪ AI: n ja ihmisten vÃĪlillÃĪ laadun suhteen, jotka saattavat vielÃĪ mÃĪÃĪrittyÃĪ kuluttajien toimesta olevan korvaamattoman inhimillisen kÃĪsitteen.

 

* Minun muunnoksen alkuperÃĪisten kirjoittajien sisÃĪisistÃĪ viittauksista hyperlinkkeihin.

Julkaistu ensimmÃĪisen kerran perjantaina 13. helmikuuta 2026

Kirjailija tekoÃĪlystÃĪ, alan erikoismies ihmisen kuvien synteesistÃĪ. Entinen tutkimussisÃĪllÃķn johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttÃĪ: [email protected]