Andersons vinkel
Mänsklig kod från 2020 krossade vibe-kodade agenter i agenter-tester

på prov i nästan 40 000 matcher – och förlorade mot kod skriven
ChatGPT och andra vibe-kodningsverktyg sattes av en masterstudent föreuppfinningen av stora språkmodeller. I en ny studie från Storbritannien ställdes mänskligt skrivna agenter mot vibe-kodade agenter som utvecklats med de senaste stora språkmodellerna ( LLM ), såsom ChatGPT-5 och Claude, och fann att agenterna som skapades utan AI-stöd lätt besegrade de AI-faciliteterade versionerna. Båda uppsättningarna av agenter skapades av olika generationer av studenter från det artificiella intelligenslaboratoriet vid det schweiziska federala
tekniska institutet i Lausanne. De icke-AI-agenter utvecklades som en del av kursarbeten 2020, två år före tillkomsten
vinna, och de fem toppositionerna hölls konsekvent av “råa” agenter, med majoriteten av
av ChatGPT och början på LLM-revolutionen, medan de nya agenterna skapades av nuvarande studenter med hjälp av de senaste och bästa LLM:erna som finns tillgängliga. Även med ett riggat spel kunde de vibe-kodade lösningarna inte
LLM-agenter (33 av 40) besegrades lätt av “mycket enkla”
304 utmaningar i en turnering, över ett stort antal
basagenter, över 38 variableroch omständigheter.Artikeln fortsättermed att beskriva studiens än de AI-genererade agenterna i olika tester ochresultat och metoder, och hur de mänskligt skrivna agenterna presterade bättre utmaningar.
Metod
Författarna noterar att traditionella tester inom detta område fokuserarpå utmaningar med tydligt definierade binära lösningar ( eller korrekt ), verifierade genom inte korrekt


anbud på hur mycket de ska betalas för att slutföra varje uppgift. I den andra delen måste varje agent skapa en effektiv plan för att slutföra endast de uppgifter de vunnit, genom att tilldelauppgifterna till fordon med olika kapaciteter och kostnader, under tids- och resursbegränsningar.
Tävlingen är igång
Författarnas utvärdering jämförde 40 LLM-kodade agenter mot 1 7 m änskligt skrivna agenter i en serie av head-to-head-turneringar. Var och en av de 12 turneringarna använde en a

parningar, med agenter som mötte varje annan motståndare två gånger: en gång som kontrollanter av oli två företag, med io ka fordonsspecifikat 3 ner. Detta upplägg gav l 192 matcher per turnering, totalt 38 304 matcher. I varje match auktionerades 50 leveransuppgifter, definierade av deras upphämtnings- och leveranspunkter och vikt, och drogs slumpmässigt över väglayouter modellerade efter Schweiz, Frankrike, Storbritannien och Nederländerna. Förenklade vägnätverk som användes i turneringen: Storbritannien (överst tilv
änster), Schweiz (överst till höger), Nederlä
nderna (nederst till vänster) och Frankrike (n
mtnings- och leveransuppgifter. upphäglar visa Färgade trianr agenternas fordonens n
ederst till höger). Blå och röda fyrkanter markerar
| u | vara | nde | posit | ioner | . | Stud | en |
|---|---|---|---|---|---|---|---|
| ta | ge | n | t | er | n | a | |
| va | ld | es | u | t | fr | ||
| ån | e | n | tu | r | ne | ||
| ri | ng | 2 | 02 | 0 | . | ||
| Ått | a | k | o | m | fr | ||
| ån | de | bä | s | t | a | p | |
| res | ta | t | io | n | e | r | na |
| i | e | n | en | s | k | i | |
| ld | u | ts | l | ag | n | in | |
| g, | oc | h | f | y | r | a | v |
| alde | s | ut | f | ö | r | ||
| sta | r | ka | p | r | e | st | |
| at | io | n | er | m | o | t | |
| ba | sa | g | en | t | e | r | n |
| a i | he | a | d | -t | o | -h | |
| ead | -m | a | tc | h | e | r. | |
| Ba | sa | g | en | t | e | r | na |
| föl | j | d | e | f | a | s | t |
| a he | u | ri | st | i | ke | ||
| r . | b | e | rä | k | n | a | d |
| e to | t | a | l | d | i | st | |
| ans | o | ch | l | ä | m | na | |
| de | an | b | ud | d | ä | r | |
| eft | e | r, | me | d | e | ||
| ndas | t | e | t | t | fo | ||
| rdo | n | o | ch | i | g | n | |
| orer | a | nd | e | b | a | tc | |
| hni | ng | ; | N | a | i | v | |
| simu | l | er | a | de | 10 | ||
| slu | m | p | mä | s | s | i | g |
| a | u | p | pg | i | f | t | er |
| o | ch | lä | m | n | ad | ||
| e a | nb | u | d | p | å | ge | |
| nom | s | n | i | t | t | l | |
| ig m | a | rg | i | n | a | l | k |
| ostn | ad | ; | Ex | p | Co | ||
| stF | ix | e | d | B | i | d | b |
| er | äk | n | ad | e | d | e | |
| n fa | k | t | i | sk | a | m | |
| a | r | gi | n | a | l | k | os |
| tn | ad | e | n | f | ö | r | |
| att | i | nf | ö | ra | up | ||
| pgif | t | en | i | s | ch | ||
| ema | t; | Är | l | i | g | ||
| gjor | de | d | e | ts | |||
| amm | a | m | en | l | a | de | |
| ti | l | l | e | n | u | ||
| ppsk | at | t | n | in | g | a | |
| v mo | ts | t | å | n | da | ||
| ren | s | k | os | t | n | a | d, |
| oc | h | l | ä | m | n | a | de |
| an | bu | d | p | å | m | a | |
| ximu | m | ; | oc | h | M | ||
| odel | O | p | po | ne | nt | ||
| blan | d | a | de | en | |||
| tids | a | v | ta | g | an | d | |
| e pr | i | o | ri | te | t | m |
ed levande kostnadsuppskattning och motståndarmodellering – och lämnade anbud på det högsta av de två. RiskSeeking Utvärderingen L
inkluderade 40
LM-kodade agenter byggda med (ovannämnda) GPT-5 Thinking, Claude Opus 4.1, Ge
mini 2.5 Pro och Dee ek R1. Varje mpSe fem olika strategier, odell fick
. Resultaten visar att de mänskligt skrivna agenterna presterade bättre än de LLM-kodade a dellg
tillämpade två gånger per mo rnenterna i de flesta fallen, och att de LLM-kodade agente
a hade svårt att generera kod som kunde konkurrera med de mänskligt skrivna agenterna.
Slutsats
Författarna konstaterar att deras resultat visar på viktiga begränsningar för LLM-kodgenerering, särskilt när det gäller deras begränsade resonemangs- och planeringsförmåga. De menar att moderna LLM:er kan generera syntax-fria kod som fungerar, men att detta inte är den benchmark som bör användas för att mäta framsteg mot avancerad allmän AI. Författarna avslutar med att kalla för en förändring av fokus från “kod som kompilerar” tillvilka vibe-kodning är väl lämpad. * Vänligen notera“kod som konkurrerar”. En fråga som den ovana läsaren av denna intressanta nya artikel kan ha är om författarna slår upp eller ner, eftersom den agenterelaterade uppgiften i fråga är betydligt mer komplex och involverad än att generera PowerShell-skript och andra former av mindre funktionalitet och korrigeringar, för att artikeln hänvisar kontinuerligt till ‘Deep R1’, som† verkar vara icke-existerande, och endast ger ett fåtal referenser på internet (förmodligen från andra författare som har skrivit fel ‘DeepSeek R1)’. Om detta är mitt fel, vänligen kontakta mig via mina profiluppgifter, så kommer jag att korrigera. Think
Författarnas betoning, inte min.
Publicerad första gången onsdag, 26 november 2025. Ändrad 17:35 för formatering.












