Anderson’un Açısı

2020’den İnsan Kodu, Vibe-Coded Ajansları Ajanslı Testlerde Yendi

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
AI-generated image: a Victorian coach and horses winning formula 1 against modern race car competitors. gpt-image-1.

ChatGPT ve diğer vibe-coding araçları neredeyse 40.000 maçta test edildi ve Büyük Dil Modelleri’nin icadından önce yazılmış bir yüksek lisans öğrencisi koduna karşı kaybetti.

 

İngiltere’den yeni bir çalışmada, araştırmacılar insan tarafından yazılmış ajanları, en son Büyük Dil Modelleri (LLM’ler) ile geliştirilen vibe-coding ajanlarına karşı karşıya getirdiler ve LLM’ler olmadan oluşturulan ajanların, AI destekli sürümlerini kolayca yendiğini buldular.

Her iki ajan seti de İsviçre Federal Teknoloji Enstitüsü’nün Yapay Zeka Laboratuvarı’ndan farklı öğrenci nesilleri tarafından oluşturuldu. İnsan tarafından yazılmış ajanlar, 2020’de ders çalışması olarak geliştirildi, ChatGPT ve LLM devriminin başlangıcından iki yıl önce, mientras yeni ajanlar, en son ve en iyi LLM’ler kullanılarak mevcut öğrenciler tarafından oluşturuldu.

Hatta oyunu rigged olarak oynasalar da, vibe-coding çözümleri kazanamadı ve ilk beş sırayı tutarlı bir şekilde “ham” ajanlar aldı, çoğunluğu LLM ajanları (40’tan 33’ü) “çok basit” temel ajanlar tarafından kolayca yenildi, 38.304 meydan okuma boyunca, birçok değişken ve durum boyunca 12 turnuva boyunca.

Makale şöyle diyor:

‘Çalışmamız, durumun, state-of-the-art LLM’lerin çalıştırılabilir kod (yani, sözdizimi hataları olmadan) üretebileceğini, ancak üretilen çözümün, stratejik planlama, optimizasyon veya çoklu ajan rekabeti gibi boyutlarda insan tarafından tasarlanan çözümlerle rekabetçi olmadığını gösteriyor.

‘Bu nedenle, bu çalışma, yeni bir kod oluşturma sınırını ortaya koyuyor ve benchmarks, veri setleri ve açık kaynaklı temel noktaların geliştirilmesini kolaylaştırmayı amaçlıyor.’

Çıkarılan meydan okuma, çeşitli stratejiler boyunca kreatif bir şekilde ihalelere katılmak ve kazanılan öğelerin teslimatının lojistiğini organize etmekti.

Yazarlar, LLM’lere beberapa avantaj sağladıklarını, Örneğin, performansını iyileştirmek için kodlarına müdahale etmelerine izin verdiklerini, ancak buna rağmen, LLM’lerin, kesin olarak sonuçlarını iyileştirecek düzeltme kodunu kabul edemediklerini veya kullanamadıklarını belirtiyorlar:

‘[Çalışmamızda] LLM, iyi bir çözümü bağlamda ortaya koyduğumuzda bile, LLM bunu kullanamıyor.

‘Bu sonuç, karmaşık senaryolarda in-context öğrenme ve retrieval-augmented problem çözme sınırları hakkında ilginç gelecekteki araştırma sorularını da ortaya koyuyor.’

Test edilen LLM’ler, GPT-5 Thinking, Gemini 2.5 Pro, Claude Opus 4.1 ve DeepSeek R1* idi.

Yeni makale, Vibe Kodlama Yüksek Lisans CS Öğrencilerini Yenebilir mi? Bir LLM vs. İnsan Kodlama Turnuvası Pazar Odaklı Stratejik Planlama Üzerine başlığını taşıyor ve Southampton Üniversitesi’nden bir yazar ve Oxford Üniversitesi ile Alan Turing Enstitüsü’nden bir yazar tarafından yazılmıştır. Yazarlar, benchmark’ın yakında yayınlanacağını belirtiyorlar.

Yöntem

Yazarlar, geleneksel testlerin bu alanda genellikle ikili çözümlerle (doğru veya yanlış) net bir şekilde tanımlanmış meydan okumalara odaklandığını, bunlar da birim testleri ile doğrulandığını belirtiyorlar. LLM’lerle destekli kodun sınırlarını keşfetmenin ideal yolu olmadığını iddia ediyorlar ve bunun yerine, birden fazla dahili benchmark ve kilometre taşı içeren, zaferin mümkün ancak basit olmayan daha karmaşık bir meydan okuma senaryosu tasarladılar:

Standart, birim testi tabanlı yaklaşımların (yukarıda) ve yazarların tasarladığı daha açık uçlu meydan okuma senaryosunun (mavi, aşağıda) karşılaştırması. Kaynak [ https://arxiv.org/pdf/2511.20613 ]

Standart, birim testi tabanlı yaklaşımların (yukarıda) ve yazarların tasarladığı daha açık uçlu meydan okuma senaryosunun (mavi, aşağıda) karşılaştırması. Kaynak

Auction, Pickup and Delivery Problem (APDP), kısmen İsviçre üniversitesinden 2020 öğrenci çalışmasının mevcut olması nedeniyle seçildi; bu çalışma, AI’yi geliştirme yoluyla destekleme yeteneğinden önce APDP görevi için otomatik ajanlar oluşturmayı amaçlıyordu. Bu nedenle, modern öğrencilere aynı görevi verip güncel araçlarla donatmak nispeten kolaydı.

Yazarlar, popüler test çerçevelerinden kaçınmaya çalıştılar, Örneğin, HumanEval, BigCodeBench ve WebDev Arena (ve diğerleri), çünkü bu sınıf test prosedürleri genellikle veri kirlenmesinden (yani, sistem test verilerini eğittiği yerine bölme saygı göstermediği) mustarip olur.

APDP, ters ihaleler ve araç rotalama temelinde iki aşamalı bir lojistik sorunudur. İlk aşamada, ajanlar her birini tamamlamak için ödenecek kadar fazla ödemeyeceklerini teklif ederek teslimat görevlerini kazanmaya çalışırlar. Çok yüksek teklif verilmesi görevi kaybetmeye neden olur; çok düşük teklif verilmesi para kaybetmeye neden olabilir.

İkinci aşamada, her ajan yalnızca kazandıkları görevleri yerine getirmek için verimli bir plan oluşturmalıdır, farklı kapasite ve maliyetlere sahip araçlara görevleri atayarak, zaman ve kaynak kısıtlamalarına tabi olarak:

APDP'de şirketler ters ihalelerde teslimat görevleri için teklif verir, sonra yalnızca kazandıkları görevleri yerine getirmek için araç rotalarını optimize eder, karı en üst düzeye çıkarmayı hedefler.

APDP’de şirketler ters ihalelerde teslimat görevleri için teklif verir, sonra yalnızca kazandıkları görevleri yerine getirmek için araç rotalarını optimize eder, karı en üst düzeye çıkarmayı hedefler.

Hedef, görevleri tamamlamak değil, aynı zamanda hangi görev demetlerinin birlikte çalışabileceğini tahmin ederek ve rekabet halinde olan diğer şirketlerin stratejilerini öngörerek genel kârı en üst düzeye çıkarmaktır.

APDP benchmark’ı, stratejik planlama ve çoklu ajan rekabeti gibi boyutlarda kod oluşturma görevlerinin zorluğunu, bir dizi bağımlı ihale boyunca artırarak ve ajanların yalnızca anlık maliyetler hakkında değil, aynı zamanda konumlandırma, zamanlama ve uzun vadeli sonuçlar hakkında da düşünmesini gerektirir.

Temel teslimat problemi NP-zordur, yani hiçbir algoritma görevlerin sayısı arttıkça makul bir sürede en iyi çözümü güvenilir bir şekilde bulamaz. Bu, brute force’un uygulanamayan bir yaklaşım olmasını sağlar ve ajanların kesinlik için hız ile ticaret yapmasını zorlar.

Yarış Başladı

Yazarların değerlendirmesi, 40 LLM-kodlu ajanı 17 insan-kodlu ajanla bir dizi head-to-head turnuvasında karşılaştırdı. Her bir turnuva, dört farklı yol ağı topolojisinin farklı bir kombinasyonunu kullandı ve her bir ajanın diğer her bir ajanla iki kez (her iki şirketin kontrolünü de yaparak) tüm maçları içeriyordu:

Bu kurulum, her turnuvada 3.192 maç ve toplam 38.304 maç sağladı. Her maçta, 50 teslimat görevi, alındıkları ve bırakıldıkları noktalar ve ağırlıklarıyla tanımlanarak, İsviçre, Fransa, Büyük Britanya ve Hollanda’ya modellenen yol düzenleri boyunca rastgele seçildi:

Turnuvada kullanılan basitleştirilmiş yol ağları: Büyük Britanya (üst sol), İsviçre (üst sağ), Hollanda (alt sol) ve Fransa (alt sağ). Mavi ve kırmızı kareler alındıkları ve bırakıldıkları görevleri gösterir. Renkli üçgenler, ajanların araçlarının当前 konumlarını gösterir.

Turnuvada kullanılan basitleştirilmiş yol ağları: Büyük Britanya (üst sol), İsviçre (üst sağ), Hollanda (alt sol) ve Fransa (alt sağ). Mavi ve kırmızı kareler alındıkları ve bırakıldıkları görevleri gösterir. Renkli üçgenler, ajanların araçlarının当前 konumlarını gösterir.

Öğrenci ajanları, 2020’den bir turnuva finalinden alındı. Sekizi, bir eleme finalinin en iyi performans gösterenlerinden geldi, dördü ise temel ajanlara karşı head-to-head maçlarda güçlü performans gösterdikleri için seçildi.

Temel ajanlar sabit yöntemler izledi. Naive toplam mesafeyi hesapladı ve buna göre teklif verdi, yalnızca bir aracı kullandı ve partisyonu görmezden geldi; ExpCostFixedBid 10 rastgele görevi simüle etti ve marjinal maliyetin ortalamasını teklif etti; Honest görevin takvimine eklenmesinin gerçek marjinal maliyetini hesapladı; ModelOpponent aynı şeyi yaptı, ancak rakibin maliyetinin bir tahminini ekledi, en yükseğini teklif etti; ve RiskSeeking zaman içinde azalan bir önceliği canlı maliyet tahmini ve rakip modellemesiyle birleştirdi – yine en yükseğini teklif etti.

Değerlendirme, GPT-5 Thinking, Claude Opus 4.1, Gemini 2.5 Pro ve DeepSeek R1 kullanarak oluşturulan 40 LLM-kodlu ajanı içeriyordu. Her model, beş farklı stratejiyle uyarıldı, her modelde iki kez uygulandı.

İki strateji, farklı yazarlar tarafından yazılan statik promtleri kullandı, bir diğeri modelin kendi çıktısını self-reflect ve revize etmesini istedi; bir diğeri, ayrı bir LLM tarafından eleştiri ve revizyon içeriyordu. Son strateji, önceki dört yaklaşımı gözden geçirerek yeni bir promt oluşturmak için GPT-4’ü kullandı.

Temel promt, orijinal öğrenci görevini yansıtıyordu, teslimat ortamını tanımlıyordu ve modeli, yüksek karmaşıklık yöntemlerine güvenmeden kârı en üst düzeye çıkarmak için teklif vermeye ve planlamaya yönlendiriyordu.

Tüm LLM ajanları, observable hatalar düzeltilene kadar self-play ve turnuva ayarlarında test edildi. Hata düzeltme, LLM’ler tarafından otomatik olarak, hata bilgileriyle uyarılarak yapıldı.

Ortak LLM hataları, makaleye göre, zaman aşımı limiti ihlallerini, atanan görevleri alamama veya teslim edememe ve araç kapasite kısıtlamalarının ihlallerini içeriyordu – bu hatalar genellikle açık talimatlara uymama veya hatalı yeniden planlama mantığından kaynaklanıyordu:

‘Başka bir ortak sorun, Gemini, Claude ve DeepSeek’de (GPT’de değil) sıklıkla LLM’nin bir hatayı sürekli olarak çözme başarısızlığıydı.

‘Örneğin, bir ajan sürekli olarak zaman aşımına uğrayacaktı, hata ve güncellenmiş kod sürümünü aldığımız 5 ila 15 tur arasında rağmen.

‘Bu gibi durumlarda (LLM’nin aynı hatayı defalarca çözme başarısızlığı) tek çözüm, başa dönmekti. Genel olarak, hata-free kodu elde etmek için önemli bir manuel çaba gerektiğinin farkına vardık. 40 hata-free ajanı değerlendirmek için önemli ölçüde daha fazla ajan üretmemiz gerekti.’

Aşağıdaki sonuçlar, 12 çift tur turnuvalarından elde edilen sonuçları özetliyor, dört yol ağı topolojisi ve her topolojide üç turnuva, yaklaşık 40.000 maç:

Ajan Ortalama Kazanma / Tur Standart Sapma Kazanma / Tur Ortalama Kaybetme / Tur Standart Sapma Kaybetme / Tur Toplam Kazanma Toplam Kaybetme Kazanma Oranı
Öğrenci 1 108.167 1.193 3.833 1.193 1298 46 0.9658
Öğrenci 2 104.917 2.539 7.083 2.539 1259 85 0.9368
Öğrenci 3 103.917 2.466 8.083 2.466 1247 97 0.9278
Öğrenci 4 103.25 1.815 8.75 1.815 1239 105 0.9219
Öğrenci 5 96.5 2.908 15.5 2.908 1158 186 0.8616
LLM(O, IR, 1) 95.417 2.314 16.583 2.314 1145 199 0.8519
LLM(O, A2, 1) 94.583 2.314 17.417 2.314 1135 209 0.8445
Öğrenci 6 93.167 1.899 18.833 1.899 1118 226 0.8318
Öğrenci 7 93.167 3.563 18.833 3.563 1118 226 0.8318
LLM(O, A1, 1) 86.083 3.029 25.917 3.029 1033 311 0.7686
LLM(O, GEN, 2) 84.083 6.947 27.917 6.947 1009 335 0.7507
LLM(O, CR, 2) 83.5 4.442 28.5 4.442 1002 342 0.7455
Öğrenci 8 83.417 4.122 28.583 4.122 1001 343 0.7448
RiskSeeking 82.417 3.343 29.583 3.343 989 355 0.7359
LLM(O, GEN, 1) 80.667 4.355 31.25 4.372 968 375 0.7208
ModelOpponent 80.583 3.26 31.417 3.26 967 377 0.7195
LLM(D, A1, 1) 79.417 3.965 32.583 3.965 953 391 0.7091
ExpCostFixedBid 77.167 4.951 34.833 4.951 926 418 0.689
LLM(O, IR, 2) 73.917 3.502 38 3.618 887 456 0.6605
LLM(O, A1, 2) 72.417 2.193 39.583 2.193 869 475 0.6466
LLM(G, A1, 2) 68.5 3.555 43.5 3.555 822 522 0.6116
LLM(A, GEN, 2) 67.917 2.968 44.083 2.968 815 529 0.6064
LLM(G, IR, 2) 65.917 2.314 46.083 2.314 791 553 0.5885
Öğrenci 9 64.167 11.044 47.833 11.044 770 574 0.5729
LLM(G, A1, 1) 64 4.243 47.917 4.316 768 575 0.5719
LLM(G, IR, 1) 60.333 3.725 51.667 3.725 724 620 0.5387
LLM(O, A2, 2) 59.333 4.499 52.667 4.499 712 632 0.5298
LLM(D, CR, 1) 55.083 6.694 56.833 6.59 661 682 0.4922
LLM(G, GEN, 2) 53.167 3.664 58.833 3.664 638 706 0.4747
LLM(D, GEN, 2) 52.083 9.06 59.917 9.06 625 719 0.465
Honest 50.583 3.848 61.417 3.848 607 737 0.4516
Öğrenci 10 48.833 2.98 63.167 2.98 586 758 0.436
LLM(D, IR, 1) 48.583 10.211 63.417 10.211 583 761 0.4338
LLM(A, A1, 1) 48 4.69 64 4.69 576 768 0.4286
LLM(G, A2, 1) 47.25 3.864 64.75 3.864 567 777 0.4219
LLM(A, CR, 1) 43.833 4.609 68.167 4.609 526 818 0.3914
LLM(A, A1, 2) 43.75 2.05 68.25 2.05 525 819 0.3906
Öğrenci 11 42.083 5.664 69.917 5.664 505 839 0.3757
LLM(A, IR, 1) 39.5 2.541 72.5 2.541 474 870 0.3527
Naive 36.75 1.712 75.25 1.712 441 903 0.3281
Öğrenci 12 36.333 1.775 75.667 1.775 436 908 0.3244
LLM(D, A2, 1) 33.917 2.193 78.083 2.193 407 937 0.3028
LLM(A, GEN, 1) 30.167 1.749 81.833 1.749 362 982 0.2693
LLM(D, A2, 2) 29.833 2.038 82.167 2.038 358 986 0.2664
LLM(G, A2, 2) 27 2.256 85 2.256 324 1020 0.2411
LLM(A, A2, 1) 26.333 0.985 85.667 0.985 316 1028 0.2351
LLM(O, CR, 1) 25 3.411 87 3.411 300 1044 0.2232
LLM(A, IR, 2) 24.333 8.542 87.667 8.542 292 1052 0.2173
LLM(A, A2, 2) 24 1.809 88 1.809 288 1056 0.2143
LLM(A, CR, 2) 23.333 1.557 88.667 1.557 280 1064 0.2083
LLM(D, GEN, 1) 22.5 1.784 89.5 1.784 270 1074 0.2009
LLM(D, A1, 2) 13.333 1.826 98.667 1.826 160 1184 0.119
LLM(G, CR, 1) 9.5 1.087 102.5 1.087 114 1230 0.0848
LLM(G, GEN, 1) 9.167 0.937 102.833 0.937 110 1234 0.0818
LLM(D, IR, 2) 7.75 0.622 104.25 0.622 93 1251 0.0692
LLM(G, CR, 2) 7.25 1.422 104.75 1.422 87 1257 0.0647
LLM(D, CR, 2) 5.667 0.985 106.333 0.985 68 1276 0.0506

Yazarlar, yukarıdaki sonuçlarla ilgili olarak şunları belirtiyorlar:

‘LLM’ler, APDP problemının daha basit varyantlarında bile beklenen/rekabetçi kod üretemedi (kod büyük ölçüde sözdizimi hataları olmadan). Bu, LLM’lerin ötesine geçen, otomatik tamamlama ve LLM’lerin yeni zayıflıklarını tanımlayan, akıl yürütme odaklı kod değerlendirme benchmark’larının önemini vurguluyor.’

‘Sonuçlarımız, insan tarafından kodlanmış ajanların açık bir üstünlüğünü gösteriyor: (i) İlk beş sırayı tutarlı bir şekilde öğrenci ajanları alıyor ve (ii) LLM ajanlarının çoğunluğu (40’tan 33’ü) çok basit temel ajanlar tarafından kolayca yeniliyor (örneğin, beklenen maliyet sabit teklifi).

‘Önemlisi, öğrenci kodunu hata ayıklamadık (LLM kodunu ise hem self-play hem de turnuva ayarlarında důklad olarak test ettik ve hata ayıkladık). Her öğrenci ajanı çöktüğünde, otomatik olarak LLM’ye galibiyeti verdik. Bu çökmelerin birçoğu kolayca düzeltilirdi (örneğin, ajanlar zaman aşımına uğradı), bu nedenle öğrenci ajanları potansiyel olarak daha yüksek sıralamaya ulaşabilirlerdi.’

Ek bir deney olarak, GPT-5 Thinking, en iyi performans gösteren insan ajanı Öğrenci 1‘in kodunu iyileştirmek için uyarıldı; ancak şimdi LLM-modified ajan, onuncu sıraya düştü ve tüm insan puanlarının en kötüsü oldu. LLM’ler, çözümü geliştirmek yerine, yaklaşık %20 oranında bozdu.
Yazarlar, sonuçlarını şöyle özetliyor:

‘Sonuçlarımız, LLM kod oluşturma sınırlarını vurguluyor, özellikle kod oluştururken sınırlı akıl yürütme ve planlama yetenekleri. Modern LLM’ler, çalıştırılabilir, sözdizimi hataları olmayan kod sağlayabilir, ancak bu, ilerleme ölçmek için kullanmamız gereken benchmark değildir. ‘

Sonuç

Yazarlar, makalenin sonunda, vibe-coding’in teknik olmayan tüm geçmişlere sahip insanları güçlendirdiğini ve bu uygulamayı olumlu bir şekilde, bir eşitlikçi güç olarak tanımladılar. Ancak, vibe-coding’in sadece yeni ortaya çıktığını ve sınırlarının bilinmediğini, gerçekçi olarak beklenebileceğinden daha yüksek olabileceğini ima ediyorlar.

Çalışmalarını, ‘derleyici kodu競e kod‘ hedefini değiştirme çağrısıyla bitiriyorlar.

İlginç yeni makaleyi okuyan casual okuyucunun aklına gelebilecek bir soru, yazarların yukarıdan mı yoksa aşağıdan mı vurduğu, çünkü söz konusu ajans görevi, PowerShell betikleri ve diğer küçük işlevler ve düzeltmeler için vibe-coding’in uygun olduğu daha karmaşık ve daha fazla içeriklidir.

 

* Lütfen makalenin sürekli olarak ‘DeepThink R1’e atıfta bulunduğunu, ancak sadece ‘DeepSeek R1’ için birkaç internet referansı olduğunu (muhtemelen diğer yazarların ‘DeepSeek R1’i yanlış yazması nedeniyle) unutmayınız. Bu benim hatam ise, lütfen profil ayrıntılarımdan bana ulaşın ve düzeltme yapacağım.

Yazarların vurgusu, benimki değil.

İlk olarak 26 Kasım 2025 Çarşamba günü yayınlandı. 17:35 EST’de düzenleme için değiştirildi.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'nin Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: [email protected]