Andersons vinkel

Mänsklig kod från 2020 krossade vibe-kodade agenter i agenter-tester

mm
Lägg till Unite.AI bland dina föredragna källor på Google
AI-generated image: a Victorian coach and horses winning formula 1 against modern race car competitors. gpt-image-1.

på prov i nästan 40 000 matcher – och förlorade mot kod skriven

 

ChatGPT och andra vibe-kodningsverktyg sattes av en masterstudent föreuppfinningen av stora språkmodeller. I en ny studie från Storbritannien ställdes mänskligt skrivna agenter mot vibe-kodade agenter som utvecklats med de senaste stora språkmodellerna ( LLM ), såsom ChatGPT-5 och Claude, och fann att agenterna som skapades utan AI-stöd lätt besegrade de AI-faciliteterade versionerna. Båda uppsättningarna av agenter skapades av olika generationer av studenter från det artificiella intelligenslaboratoriet vid det schweiziska federala

tekniska institutet i Lausanne. De icke-AI-agenter utvecklades som en del av kursarbeten 2020, två år före tillkomsten

vinna, och de fem toppositionerna hölls konsekvent av “råa” agenter, med majoriteten av

av ChatGPT och början på LLM-revolutionen, medan de nya agenterna skapades av nuvarande studenter med hjälp av de senaste och bästa LLM:erna som finns tillgängliga. Även med ett riggat spel kunde de vibe-kodade lösningarna inte

LLM-agenter (33 av 40) besegrades lätt av “mycket enkla”

304 utmaningar i en turnering, över ett stort antal

basagenter, över 38 variableroch omständigheter.Artikeln fortsättermed att beskriva studiens än de AI-genererade agenterna i olika tester ochresultat och metoder, och hur de mänskligt skrivna agenterna presterade bättre utmaningar.

Metod

Författarna noterar att traditionella tester inom detta område fokuserarpå utmaningar med tydligt definierade binära lösningar ( eller korrekt ), verifierade genom inte korrekt

Jämförelse av standard, enhetstestbaserade tillvägagångssätt (ovan), och den mer öppna utmaningsscenariot som författarna har utvecklat (i blått, nedan). enhetstester . De hävdar att detta inte är det ideala sättet att undersöka begränsningarna för LLM-stödd kod, och författarna har därför utvecklat en mer komplex utmaningsscenarie med flera interna benchmark och milstolpar, där seger är möjlig, men långt ifrån enkel. Jämförelse av standard, enhetstestbaserade tillvägagångssätt (ovan), och den mer öppna utmaningsscenariot som författarna har utvecklat (i blått,nedan). Källa Utmaningen som författarna har utvecklat kallas Auction, Pickup and Delivery Problem (APDP), och består av två delar: auktioner och logistik. I den första

Förenklade vägnät som används i turneringen: Storbritannien (överst till vänster), Schweiz (överst till höger), Nederländerna (nedre till vänster) och Frankrike (nedre höger). Blå och röda rutor markerar hämtnings- och leveransuppgifter. Färgade trianglar visar de aktuella positionerna för agenternas fordon. delen tävlar agenterna om att vinna leveransuppgifter genom att lämna

anbud på hur mycket de ska betalas för att slutföra varje uppgift. I den andra delen måste varje agent skapa en effektiv plan för att slutföra endast de uppgifter de vunnit, genom att tilldelauppgifterna till fordon med olika kapaciteter och kostnader, under tids- och resursbegränsningar.

Tävlingen är igång

Författarnas utvärdering jämförde 40 LLM-kodade agenter mot 1 7 m änskligt skrivna agenter i en serie av head-to-head-turneringar. Var och en av de 12 turneringarna använde en a

Förenklade vägnätverk som användes i turneringen: Storbritannien (överst till vänster), Schweiz (överst till höger), Nederländerna (nederst till vänster) och Frankrike (nederst till höger). Blå och röda fyrkanter markerar upphämtnings- och leveransuppgifter. Färgade trianglar visar agenternas fordonens nuvarande positioner. nnan kombination av fyra vägnätverkstopologier, och bestod av all-play-all

parningar, med agenter som mötte varje annan motståndare två gånger: en gång som kontrollanter av oli två företag, med io ka fordonsspecifikat 3 ner. Detta upplägg gav l 192 matcher per turnering, totalt 38 304 matcher. I varje match auktionerades 50 leveransuppgifter, definierade av deras upphämtnings- och leveranspunkter och vikt, och drogs slumpmässigt över väglayouter modellerade efter Schweiz, Frankrike, Storbritannien och Nederländerna. Förenklade vägnätverk som användes i turneringen: Storbritannien (överst tilv

änster), Schweiz (överst till höger), Nederlä

nderna (nederst till vänster) och Frankrike (n

mtnings- och leveransuppgifter. upphäglar visa Färgade trianr agenternas fordonens n

ederst till höger). Blå och röda fyrkanter markerar

u vara nde posit ioner . Stud en
ta ge n t er n a
va ld es u t fr
ån e n tu r ne
ri ng 2 02 0 .
Ått a k o m fr
ån de bä s t a p
res ta t io n e r na
i e n en s k i
ld u ts l ag n in
g, oc h f y r a v
alde s ut f ö r
sta r ka p r e st
at io n er m o t
ba sa g en t e r n
a i he a d -t o -h
ead -m a tc h e r.
Ba sa g en t e r na
föl j d e f a s t
a he u ri st i ke
r . b e rä k n a d
e to t a l d i st
ans o ch l ä m na
de an b ud d ä r
eft e r, me d e
ndas t e t t fo
rdo n o ch i g n
orer a nd e b a tc
hni ng ; N a i v
simu l er a de 10
slu m p mä s s i g
a u p pg i f t er
o ch lä m n ad
e a nb u d p å ge
nom s n i t t l
ig m a rg i n a l k
ostn ad ; Ex p Co
stF ix e d B i d b
er äk n ad e d e
n fa k t i sk a m
a r gi n a l k os
tn ad e n f ö r
att i nf ö ra up
pgif t en i s ch
ema t; Är l i g
gjor de d e ts
amm a m en l a de
ti l l e n u
ppsk at t n in g a
v mo ts t å n da
ren s k os t n a d,
oc h l ä m n a de
an bu d p å m a
ximu m ; oc h M
odel O p po ne nt
blan d a de en
tids a v ta g an d
e pr i o ri te t m

ed levande kostnadsuppskattning och motståndarmodellering – och lämnade anbud på det högsta av de två. RiskSeeking Utvärderingen L

inkluderade 40

LM-kodade agenter byggda med (ovannämnda) GPT-5 Thinking, Claude Opus 4.1, Ge

mini 2.5 Pro och Dee ek R1. Varje mpSe fem olika strategier, odell fick

. Resultaten visar att de mänskligt skrivna agenterna presterade bättre än de LLM-kodade a dellg

tillämpade två gånger per mo rnenterna i de flesta fallen, och att de LLM-kodade agente

a hade svårt att generera kod som kunde konkurrera med de mänskligt skrivna agenterna.

Slutsats

Författarna konstaterar att deras resultat visar på viktiga begränsningar för LLM-kodgenerering, särskilt när det gäller deras begränsade resonemangs- och planeringsförmåga. De menar att moderna LLM:er kan generera syntax-fria kod som fungerar, men att detta inte är den benchmark som bör användas för att mäta framsteg mot avancerad allmän AI. Författarna avslutar med att kalla för en förändring av fokus från “kod som kompilerar” tillvilka vibe-kodning är väl lämpad. * Vänligen notera“kod som konkurrerar”. En fråga som den ovana läsaren av denna intressanta nya artikel kan ha är om författarna slår upp eller ner, eftersom den agenterelaterade uppgiften i fråga är betydligt mer komplex och involverad än att generera PowerShell-skript och andra former av mindre funktionalitet och korrigeringar, för att artikeln hänvisar kontinuerligt till ‘Deep R1’, som† verkar vara icke-existerande, och endast ger ett fåtal referenser på internet (förmodligen från andra författare som har skrivit fel ‘DeepSeek R1)’. Om detta är mitt fel, vänligen kontakta mig via mina profiluppgifter, så kommer jag att korrigera. Think

Författarnas betoning, inte min.

Publicerad första gången onsdag, 26 november 2025. Ändrad 17:35 för formatering.

Skribent inom maskininlärning, domänspecialist på mänsklig bildsyntes. Tidigare chef för forskningsinnehåll på Metaphysic.ai, fram till dess upplösning i DNEG:s Brahma.ai.
Webbplats: martinanderson.ai
Kontakt: martin@martinanderson.ai