Andersonin kulma
Ihmiskoodi vuodelta 2020 voitti vibroitiin koodattuja agenteja agenteilla tehtyjen testien aikana

ChatGPT ja muut vibrointityÃķkalut asetettiin testiin lÃĪhes 40 000 ottelussa â ja hÃĪvisivÃĪt gradun opiskelijoiden kirjoittamalle koodille, joka oli kirjoitettu ennen suurten kielen mallien keksimistÃĪ.
Â
Uudessa tutkimuksessa Iso-Britanniasta tutkijat asettivat ihmiskoodatut agentit vastakkain vibroituilla agenteilla, jotka oli kehitetty viimeisimmillÃĪ suurilla kielen malleilla (LLM), kuten ChatGPT-5 ja Claude, ja havaitsivat, ettÃĪ ilman AI:n apua luodut agentit voittivat helposti AI:lla tehtyjÃĪ versioita.
Molemmat agenttiryhmÃĪt olivat kehittÃĪneet eri sukupolvet opiskelijoita Sveitsin liittovaltion teknillisen korkeakoulun tekoÃĪlylaboratoriosta. Ilman AI:ta kehitetyt agentit olivat kehittÃĪneet osana kurssityÃķtÃĪ vuonna 2020, kaksi vuotta ennen ChatGPT:n syntymÃĪÃĪ ja LLM-vallankumouksen alkamista, kun taas uudet agentit olivat kehittÃĪneet nykyiset opiskelijat, joilla oli kÃĪytÃķssÃĪÃĪn viimeisimmÃĪt ja parhaat LLM:t.
Even kun peli oli âvillittyâ, vibroitetut ratkaisut eivÃĪt voineet voittaa, ja viiden parhaan sijan pitivÃĪt aina âraakatâ agentit, ja useimmat LLM-agentit (33/40) hÃĪvisivÃĪt helposti âerittÃĪin yksinkertaisilleâ perusagenteille, 38 304 haasteen aikana turnauksessa, laajalla joukolla muuttujia ja olosuhteita.
Tutkimusraportissa todetaan:
âTutkimuksemme osoittaa, ettÃĪ vaikka viimeisimmÃĪt LLM:t voivat generoida koodia, joka toimii (ts. ilman syntaksivirheitÃĪ), generoitu ratkaisu ei ole kilpailukykyinen ihmisten suunnittelemiin ratkaisuihin ulottuvuuksilla, kuten strategisen suunnittelun, optimoinnin tai monen agentin kilpailun.
âTÃĪmÃĪ tyÃķ tuo esiin tÃĪmÃĪn uuden koodigeneraation rintaman ja pyrkii edistÃĪmÃĪÃĪn benchmarkien, tietojoukkojen ja avoimen lÃĪhdekoodin kehittÃĪmistÃĪ, jotka korostavat pÃĪÃĪtÃķksenteon johtamaa koodin synteesiÃĪ.â
Haaste, joka keksittiin, oli osallistua luovasti huutokauppoihin, erilaisilla strategioilla, ja jÃĪrjestÃĪÃĪ voitettujen tuotteiden toimitus voittajille.
Tutkijat huomauttavat, ettÃĪ useita etuja annettiin LLM:lle, kuten puuttuminen koodiin parantamaan sen suorituskykyÃĪ â etu, jota ei sallittu vuoden 2020 koodille. Vaikka niin oli, LLM:t eivÃĪt pystyneet hyÃķdyntÃĪmÃĪÃĪn sitÃĪ tai kÃĪyttÃĪmÃĪÃĪn sitÃĪ:
â[MeidÃĪn] benchmarkissa, vaikka me esittelemme hyvÃĪn ratkaisun kontekstissa, LLM ei voi kÃĪyttÃĪÃĪ sitÃĪ.
âTÃĪmÃĪ tulos herÃĪttÃĪÃĪ myÃķs mielenkiintoisia tulevaisuuden tutkimuskysymyksiÃĪ in-kontekstin oppimisen ja haun parantamisen rajoista monimutkaisissa tilanteissa.â
LLM:t, jotka kÃĪytettiin testissÃĪ, olivat GPT-5 Thinking, Gemini 2.5 Pro, Claude Opus 4.1 ja DeepSeek R1*.
Uusi tutkimus tutkimus on otsikoitu Voittavatko vibrointikoodit gradun opiskelijat? LLM vs. ihmiskoodausturnaus markkinajohtamisen strategisessa suunnittelussa, ja se on perÃĪisin yhdestÃĪ tekijÃĪstÃĪ Southamptonin yliopistosta ja toisesta Oxfordin yliopistosta ja Alan Turing -instituutista. Benchmark tullaan julkaisemaan lyhyen ajan kuluttua.
MenetelmÃĪ
Tutkijat huomauttavat, ettÃĪ perinteiset testit tÃĪssÃĪ alueella keskittyvÃĪt haasteisiin, joissa on selvÃĪsti mÃĪÃĪritelty binÃĪÃĪriset ratkaisut (oikein tai vÃĪÃĪrin), jotka on vahvistettu yksikkÃķtestien avulla. VÃĪittÃĪen, ettÃĪ tÃĪmÃĪ ei ole ihanteellinen tapa tutkia LLM:n avulla kehitetyn koodin rajoituksia, tutkijat keksivÃĪt monimutkaisemman haasteen, jossa voitto on mahdollinen, mutta kaukana yksinkertaisesta;
![Vertailu standardien, yksikkÃķtestien perusteella (yllÃĪ) ja tutkijoiden kehittÃĪmÃĪstÃĪ avoimemmasta haasteesta (sinisellÃĪ, alla). LÃĪhde [ https://arxiv.org/pdf/2511.20613 ]](https://www.unite.ai/wp-content/uploads/2025/11/figure-1-2.jpg)
Vertailu standardien, yksikkÃķtestien perusteella (yllÃĪ) ja tutkijoiden kehittÃĪmÃĪstÃĪ avoimemmasta haasteesta (sinisellÃĪ, alla). LÃĪhde
Huutokauppa, nouto ja toimitusongelma (APDP) kÃĪytettiin tutkijoiden tutkimuksessa osittain, koska Sveitsin yliopistosta oli saatavilla vuoden 2020 opiskelijoiden tyÃķ, jossa pyrittiin luomaan automaattisia agenteja APDP-tehtÃĪvÃĪÃĪn ennen AI:n kehittÃĪmistÃĪ. Siksi se oli suhteellisen helppo tehtÃĪvÃĪ nykyisille opiskelijoille, jotka saivat kÃĪyttÃĪÃĪ nykyisiÃĪ tyÃķkaluja.
Tutkijat pyrkivÃĪt vÃĪlttÃĪmÃĪÃĪn suosittuja testirunkoja, kuten HumanEval, BigCodeBench ja WebDev Arena (muiden joukossa), koska tÃĪmÃĪntyyppiset testimenetelmÃĪt usein kÃĪrsivÃĪt datasta, joka on saastunut (ts. tapauksia, joissa jÃĪrjestelmÃĪ on koulutettu testidatalla sen sijaan, ettÃĪ se kunnioittaisi jakoa).
APDP on kaksivaiheinen logistiikkaongelma, joka perustuu kÃĪÃĪnteisiin huutokauppoihin ja ajoneuvon reititykseen. EnsimmÃĪisessÃĪ vaiheessa agentit kilpailevat voittaakseen toimitustehtÃĪviÃĪ esittÃĪmÃĪllÃĪ tarjouksia siitÃĪ, kuinka paljon heidÃĪn pitÃĪisi maksaa kunkin tehtÃĪvÃĪn suorittamisesta. Liian korkea tarjous tarkoittaa tehtÃĪvÃĪn menettÃĪmistÃĪ; liian matala tarjous voi tarkoittaa rahan menettÃĪmistÃĪ.
Toisessa vaiheessa kunkin agentin on luotava tehokas suunnitelma tehtÃĪvien suorittamiseksi, joita he ovat voittaneet, ja mÃĪÃĪriteltÃĪvÃĪ ajoneuvot, joilla on eri kapasiteetit ja kustannukset, ajan ja resurssien rajoituksilla:

Huutokaupassa yritykset kilpailevat toimitustehtÃĪvistÃĪ esittÃĪmÃĪllÃĪ tarjouksia, ja sitten optimoivat ajoneuvon reitit voittamiensa tehtÃĪvien suorittamiseksi, pyrkien maksimoimaan voiton.
Tavoitteena ei ole ainoastaan suorittaa tehtÃĪviÃĪ, vaan maksimoida kokonainen voitto ennustamalla, mitkÃĪ tehtÃĪvien paketit toimisivat parhaiten yhdessÃĪ, ja ennustamalla kilpailijoiden strategioita, jotka yrittÃĪvÃĪt samaa.
APDP-benchmarkin haaste koodin generoimiselle on strategisen suunnittelun esittÃĪminen useiden riippuvien huutokauppojen sarjassa, joissa jokainen tarjous muuttaa tulevien valintojen maisemaa; ja siksi vaatii agenteilta pÃĪÃĪtÃķksentekoa ei ainoastaan vÃĪlittÃķmistÃĪ kustannuksista, vaan myÃķs asemasta, ajasta ja pitkÃĪn aikavÃĪlin seurauksista.
PerusviestintÃĪongelma on NP-hard, ts. ei ole algoritmi, joka voi luotettavasti lÃķytÃĪÃĪ parhaan ratkaisun kohtuullisessa ajassa, kun tehtÃĪvien mÃĪÃĪrÃĪ kasvaa. TÃĪmÃĪ tekee brute force -lÃĪhestymistavan toimimattomaksi, ja pakottaa agentit vaihtamaan tarkkuuden nopeuteen.
Kilpailu on kÃĪynnissÃĪ
Tutkijoiden arviointi vertasi 40 LLM-koodattua agenttia 17 ihmiskoodattuun agenttiin sarjassa head-to-head -turnauksissa. Jokainen 12 turnausta kÃĪytti eri yhdistelmÃĪÃĪ neljÃĪstÃĪ tiieverkkoarkkitehtuurista, ja koostui kaikki-kaikkia-ottelusta, jossa agentit kohtasivat toisensa kahdesti: kerran kunkin kahden yrityksen johtajana, eri ajoneuvon mÃĪÃĪrityksillÃĪ.
TÃĪmÃĪ asettelu tuotti 3 192 ottelua turnauksessa, yhteensÃĪ 38 304 ottelua. Kussakin ottelussa 50 toimitustehtÃĪvÃĪÃĪ huutokaupattiin, mÃĪÃĪriteltiin niiden nouto- ja toimituspisteiden ja painon perusteella, ja ne arvottiin satunnaisesti eri tiemÃĪÃĪritysten yli, jotka mallinnettiin Sveitsin, Ranskan, Iso-Britannian ja Alankomaiden tieverkoista:

Yksinkertaistetut tiiverkkomallit turnauksessa: Iso-Britannia (ylÃĪvasen), Sveitsi (oikea ylÃĪ), Alankomaat (ala vasen) ja Ranska (ala oikea). Siniset ja punaiset neliÃķt merkitsevÃĪt nouto- ja toimitustehtÃĪviÃĪ. VÃĪritetyt kolmiot osoittavat agenttien ajoneuvon sijainnin.
Opiskelijoiden agentit valittiin vuoden 2020 kurssiturnauksesta. Kahdeksan tuli yksinÃĪisen poistomitalin parhaista suorittajista, ja neljÃĪ muuta valittiin vahvan suorituksen perusteella perusagenteja vastaan head-to-head -otteluissa.
Perusagentit seurasivat kiinteitÃĪ heuristiikkaa. Naive laski yhteisen etÃĪisyyden ja tarjosi sen mukaan, kÃĪyttÃĪen ainoastaan yhtÃĪ ajoneuvoa ja ignoroiden pakkaamisen; ExpCostFixedBid simuloitiin 10 satunnaista tehtÃĪvÃĪÃĪ, ja tarjottiin keskimÃĪÃĪrÃĪistÃĪ marginaalikustannusta; Honest laski todellisen marginaalikustannuksen tehtÃĪvÃĪn sisÃĪllyttÃĪmisestÃĪ aikatauluun; ModelOpponent teki saman, mutta lisÃĪsi arvion vastustajan kustannuksesta, tarjoten maksimin; ja RiskSeeking yhdisti ajan kuluvan etuoikeuden livekustannusarvioon ja vastustajan mallintamiseen â jÃĪlleen kerran tarjoten korkeamman arvon.
Arviointi sisÃĪlsi 40 LLM-koodattua agenttia, jotka oli kehittÃĪnyt (mainittujen) GPT-5 Thinking, Claude Opus 4.1, Gemini 2.5 Pro ja DeepSeek R1. Kunkin malliin annettiin viisi eri strategiaa, joita sovellettiin kahdesti kunkin mallille.
Kaksi strategiaa kÃĪytti statisia ohjelmointikieltoja, jotka oli kirjoittaneet eri tekijÃĪt, kun taas kolmas pyysi mallilta itsearviointia ja muokkaamista; toinen strategia kÃĪytti toista LLM:ÃĪÃĪ arvioimaan ja muokkaamaan. Viimeinen strategia kÃĪytti GPT-4:ÃĪÃĪ luomaan uuden ohjelmointikielen tarkastelemalla kaikkia neljÃĪÃĪ aiempaa lÃĪhestymistapaa.
Perusohjelmointikieli perustui alkuperÃĪiseen opiskelijoiden tehtÃĪvÃĪÃĪn, jossa kuvattiin toimitusympÃĪristÃķ ja annettiin ohjeet tarjota ja suunnitella maksimoida voitto ilman korkean kompleksisuuden menetelmiÃĪ.
Kaikki LLM-agentit testattiin sekÃĪ itseÃĪÃĪn ettÃĪ turnauksessa, kunnes kaikki havaittavissa olevat virheet oli korjattu. Virheiden korjaus hoidettiin itse LLM:llÃĪ, jolle annettiin virhetiedot.
Yleiset LLM-epÃĪonnistumiset, tutkimus huomauttaa, sisÃĪlsivÃĪt aikakatkaisujen rikkomisen, epÃĪonnistumisen noutaa tai toimittaa mÃĪÃĪrÃĪttyjÃĪ tehtÃĪviÃĪ ja ajoneuvon kapasiteetin rajoitusten rikkomisen â virheitÃĪ, jotka usein johtuivat ohjeiden laiminlyÃķmisestÃĪ tai virheellisestÃĪ uudelleensuunnittelustaâ :
âToinen yleinen ongelma, jonka havaitsemme (pÃĪÃĪasiassa Gemini, Claude ja DeepSeek -mallien kanssa, eikÃĪ niin paljon GPT:llÃĪ), on, ettÃĪ LLM usein epÃĪonnistuu jatkuvasti ratkaisemaan virheen.
âEsimerkiksi agentti aikakatkaisee jatkuvasti, vaikka LLM:lle annetaan virhetietoja useita kertoja (esim. 5-15 kertaa) ja vastaanotetaan pÃĪivitetty versio koodista.
âAinoa ratkaisu, jonka lÃķysimme tÃĪllaisiin tilanteisiin (joissa LLM toistuvasti epÃĪonnistuu ratkaisemasta samaa virhettÃĪ), on aloittaa alusta. Yleisesti ottaen havaitsemme, ettÃĪ virheettÃķmÃĪn koodin saavuttamiseksi vaaditaan merkittÃĪvÃĪÃĪ manuaalista tyÃķtÃĪ. MeidÃĪn piti generoida huomattavasti enemmÃĪn agenteja saadaksemme 40 virheettÃķmÃĪn, joita arvioimme.â
Tulokset, jotka on esitetty alla, tiivistÃĪvÃĪt tulokset 12 kaksoispyÃķrÃĪpyÃķrÃĪturnauksesta, jotka kattoivat neljÃĪ tiieverkkoarkkitehtuuria ja kolme turnausta kunkin arkkitehtuurin kohdalla, tuottaen suurimman osan 40 000 ottelusta:
| Agentti | KeskimÃĪÃĪrÃĪinen voitto / turnaus | SD voitto / turnaus | KeskimÃĪÃĪrÃĪinen tappio / turnaus | SD tappio / turnaus | YhteensÃĪ voitot | YhteensÃĪ tappiot | Voittoprosentti |
|---|---|---|---|---|---|---|---|
| Opiskelija 1 | 108.167 | 1.193 | 3.833 | 1.193 | 1298 | 46 | 0.9658 |
| Opiskelija 2 | 104.917 | 2.539 | 7.083 | 2.539 | 1259 | 85 | 0.9368 |
| Opiskelija 3 | 103.917 | 2.466 | 8.083 | 2.466 | 1247 | 97 | 0.9278 |
| Opiskelija 4 | 103.25 | 1.815 | 8.75 | 1.815 | 1239 | 105 | 0.9219 |
| Opiskelija 5 | 96.5 | 2.908 | 15.5 | 2.908 | 1158 | 186 | 0.8616 |
| LLM(O, IR, 1) | 95.417 | 2.314 | 16.583 | 2.314 | 1145 | 199 | 0.8519 |
| LLM(O, A2, 1) | 94.583 | 2.314 | 17.417 | 2.314 | 1135 | 209 | 0.8445 |
| Opiskelija 6 | 93.167 | 1.899 | 18.833 | 1.899 | 1118 | 226 | 0.8318 |
| Opiskelija 7 | 93.167 | 3.563 | 18.833 | 3.563 | 1118 | 226 | 0.8318 |
| LLM(O, A1, 1) | 86.083 | 3.029 | 25.917 | 3.029 | 1033 | 311 | 0.7686 |
| LLM(O, GEN, 2) | 84.083 | 6.947 | 27.917 | 6.947 | 1009 | 335 | 0.7507 |
| LLM(O, CR, 2) | 83.5 | 4.442 | 28.5 | 4.442 | 1002 | 342 | 0.7455 |
| Opiskelija 8 | 83.417 | 4.122 | 28.583 | 4.122 | 1001 | 343 | 0.7448 |
| RiskSeeking | 82.417 | 3.343 | 29.583 | 3.343 | 989 | 355 | 0.7359 |
| LLM(O, GEN, 1) | 80.667 | 4.355 | 31.25 | 4.372 | 968 | 375 | 0.7208 |
| ModelOpponent | 80.583 | 3.26 | 31.417 | 3.26 | 967 | 377 | 0.7195 |
| LLM(D, A1, 1) | 79.417 | 3.965 | 32.583 | 3.965 | 953 | 391 | 0.7091 |
| ExpCostFixedBid | 77.167 | 4.951 | 34.833 | 4.951 | 926 | 418 | 0.689 |
| LLM(O, IR, 2) | 73.917 | 3.502 | 38 | 3.618 | 887 | 456 | 0.6605 |
| LLM(O, A1, 2) | 72.417 | 2.193 | 39.583 | 2.193 | 869 | 475 | 0.6466 |
| LLM(G, A1, 2) | 68.5 | 3.555 | 43.5 | 3.555 | 822 | 522 | 0.6116 |
| LLM(A, GEN, 2) | 67.917 | 2.968 | 44.083 | 2.968 | 815 | 529 | 0.6064 |
| LLM(G, IR, 2) | 65.917 | 2.314 | 46.083 | 2.314 | 791 | 553 | 0.5885 |
| Opiskelija 9 | 64.167 | 11.044 | 47.833 | 11.044 | 770 | 574 | 0.5729 |
| LLM(G, A1, 1) | 64 | 4.243 | 47.917 | 4.316 | 768 | 575 | 0.5719 |
| LLM(G, IR, 1) | 60.333 | 3.725 | 51.667 | 3.725 | 724 | 620 | 0.5387 |
| LLM(O, A2, 2) | 59.333 | 4.499 | 52.667 | 4.499 | 712 | 632 | 0.5298 |
| LLM(D, CR, 1) | 55.083 | 6.694 | 56.833 | 6.59 | 661 | 682 | 0.4922 |
| LLM(G, GEN, 2) | 53.167 | 3.664 | 58.833 | 3.664 | 638 | 706 | 0.4747 |
| LLM(D, GEN, 2) | 52.083 | 9.06 | 59.917 | 9.06 | 625 | 719 | 0.465 |
| Honest | 50.583 | 3.848 | 61.417 | 3.848 | 607 | 737 | 0.4516 |
| Opiskelija 10 | 48.833 | 2.98 | 63.167 | 2.98 | 586 | 758 | 0.436 |
| LLM(D, IR, 1) | 48.583 | 10.211 | 63.417 | 10.211 | 583 | 761 | 0.4338 |
| LLM(A, A1, 1) | 48 | 4.69 | 64 | 4.69 | 576 | 768 | 0.4286 |
| LLM(G, A2, 1) | 47.25 | 3.864 | 64.75 | 3.864 | 567 | 777 | 0.4219 |
| LLM(A, CR, 1) | 43.833 | 4.609 | 68.167 | 4.609 | 526 | 818 | 0.3914 |
| LLM(A, A1, 2) | 43.75 | 2.05 | 68.25 | 2.05 | 525 | 819 | 0.3906 |
| Opiskelija 11 | 42.083 | 5.664 | 69.917 | 5.664 | 505 | 839 | 0.3757 |
| LLM(A, IR, 1) | 39.5 | 2.541 | 72.5 | 2.541 | 474 | 870 | 0.3527 |
| Naive | 36.75 | 1.712 | 75.25 | 1.712 | 441 | 903 | 0.3281 |
| Opiskelija 12 | 36.333 | 1.775 | 75.667 | 1.775 | 436 | 908 | 0.3244 |
| LLM(D, A2, 1) | 33.917 | 2.193 | 78.083 | 2.193 | 407 | 937 | 0.3028 |
| LLM(A, GEN, 1) | 30.167 | 1.749 | 81.833 | 1.749 | 362 | 982 | 0.2693 |
| LLM(D, A2, 2) | 29.833 | 2.038 | 82.167 | 2.038 | 358 | 986 | 0.2664 |
| LLM(G, A2, 2) | 27 | 2.256 | 85 | 2.256 | 324 | 1020 | 0.2411 |
| LLM(A, A2, 1) | 26.333 | 0.985 | 85.667 | 0.985 | 316 | 1028 | 0.2351 |
| LLM(O, CR, 1) | 25 | 3.411 | 87 | 3.411 | 300 | 1044 | 0.2232 |
| LLM(A, IR, 2) | 24.333 | 8.542 | 87.667 | 8.542 | 292 | 1052 | 0.2173 |
| LLM(A, A2, 2) | 24 | 1.809 | 88 | 1.809 | 288 | 1056 | 0.2143 |
| LLM(A, CR, 2) | 23.333 | 1.557 | 88.667 | 1.557 | 280 | 1064 | 0.2083 |
| LLM(D, GEN, 1) | 22.5 | 1.784 | 89.5 | 1.784 | 270 | 1074 | 0.2009 |
| LLM(D, A1, 2) | 13.333 | 1.826 | 98.667 | 1.826 | 160 | 1184 | 0.119 |
| LLM(G, CR, 1) | 9.5 | 1.087 | 102.5 | 1.087 | 114 | 1230 | 0.0848 |
| LLM(G, GEN, 1) | 9.167 | 0.937 | 102.833 | 0.937 | 110 | 1234 | 0.0818 |
| LLM(D, IR, 2) | 7.75 | 0.622 | 104.25 | 0.622 | 93 | 1251 | 0.0692 |
| LLM(G, CR, 2) | 7.25 | 1.422 | 104.75 | 1.422 | 87 | 1257 | 0.0647 |
| LLM(D, CR, 2) | 5.667 | 0.985 | 106.333 | 0.985 | 68 | 1276 | 0.0506 |
Kontekstissa kunkin agentin pelasi 112 ottelua turnauksessa, joten keskimÃĪÃĪrÃĪinen voitto tai tappio per agentti on 112. Standardipoikkeama (SD) heijastaa muutoksia turnauksissa. Ihmiskoodatut agentit ovat lihavoituja. LLM-koodatut agentit on merkitty mallin, kahden kirjaimen ohjelmointistrategian ja luvun mukaan, joka osoittaa, onko agentti ensimmÃĪinen vai toinen, joka on generoitu kyseisellÃĪ ohjelmointistrategialla. LÃĪhde
Tuloksia koskien tutkijat toteavatâ :
âLLM:t eivÃĪt generoineet odotettua/ kilpailukykyistÃĪ koodia, jopa yksinkertaisemmissa APDP-ongelmien muodoissa (vaikka koodi oli suurelta osin syntaksivirheiden vailla). TÃĪmÃĪ korostaa LLM:ien uusia heikkouksia, jotka menevÃĪt auto-completion ja tunnistamisen ulkopuolelle.â
âTuloksemme osoittavat selvÃĪn ylemmÃĪn tason ihmiskoodattujen agenttien ylivoiman: (i) Viiden parhaan sijan pitÃĪvÃĪt aina opiskelijat, ja (ii) useimmat LLM-agentit (33/40) hÃĪvisivÃĪt erittÃĪin yksinkertaisille perusagenteille (kuten odotetun kustannuksen kiinteÃĪ tarjous).
âTÃĪrkeÃĪÃĪ on, ettÃĪ emme debugannut opiskelijoiden koodia (vaikka testasimme ja debugasimme LLM-koodin sekÃĪ itse ettÃĪ turnaustilanteissa). Jokaisella kerralla, kun opiskelijan agentti kaatui, annimme automaattisesti voiton LLM:lle. Suuri osa nÃĪistÃĪ kaatuksista olisi helppo korjata (esim. agentit aikakatkaisevat), joten opiskelijoiden agentit voisivat mahdollisesti sijoittua vielÃĪ korkeammalle.â
LisÃĪksi GPT-5 ThinkingiÃĪ pyydettiin parantamaan parhaan suorittaneen ihmisen agentin, Opiskelija 1, koodia; mutta nyt LLM:llÃĪ muokattu agentti putosi kymmenenneksi, josta tuli huonoin opiskelijan suoritus. Sen sijaan, ettÃĪ LLM paransi ratkaisua, se heikensi sitÃĪ lÃĪhes 20 prosentilla.
Tutkijat toteavat:
â[MeidÃĪn] tulokset korostavat LLM-koodin generoinnin tÃĪrkeitÃĪ rajoituksia, erityisesti niiden rajoitettua pÃĪÃĪtÃķksentekoa ja suunnittelukykyÃĪ koodin generoimisessa.
JohtopÃĪÃĪtÃķs
Tutkijat itse huomauttavat tutkimuksensa lopussa, ettÃĪ vibrointi on antanut mahdollisuuksia kaiken tasoisille teknisille taustoille, ja kuvaavat tÃĪtÃĪ kÃĪytÃĪnnÃķn hyvÃĪnÃĪ tasa-arvon tekijÃĪnÃĪ. He kuitenkin viittaavat siihen, ettÃĪ koska vibrointi on vasta saapunut, sen rajoja ei voida tietÃĪÃĪ, ja ne voidaan olettaa olevan korkeammat kuin mitÃĪ voidaan realistisesti odottaa.
He pÃĪÃĪttÃĪvÃĪt tarjoamalla tavoitteen muutoksen âkoodista, joka kÃĪÃĪntyy koodiin, joka kilpaileeâ.
Yksi kysymys, jonka tutkimuksen epÃĪvirallinen lukija saattaa kysyÃĪ, on se, ovatko tutkijat iskevÃĪsti ylÃķs- vai alaspÃĪin, koska kyseessÃĪ oleva agenteille asetettu tehtÃĪvÃĪ on huomattavasti monimutkaisempi ja monipuolisempi kuin se, mitÃĪ vibrointi on hyvin sovellettavissa, kuten PowerShell-komentosarjojen ja muiden pienten toimintojen ja korjausten tuottaminen.
Â
* Huomaa, ettÃĪ tutkimus viittaa jatkuvasti âDeepThink R1âē:iin, joka nÃĪyttÃĪÃĪ olemattomalta, ja josta on vain muutamia viittauksia internetissÃĪ (luultavasti muiden kirjoittajien, jotka ovat virheellisesti kirjoittaneet âDeepSeek R1â). Jos tÃĪmÃĪ on minun virheeni, ole hyvÃĪ ja ota yhteyttÃĪ minuun profiilitietojeni kautta, ja korjaan sen.
â TekijÃķiden painotus, ei minun.
Julkaistu ensimmÃĪisen kerran keskiviikkona, 26. marraskuuta 2025. Muutettu 17:35 itÃĪisen aikavyÃķhykkeen aikaan muotoilun vuoksi.












