Anderson’un Açısı
2020’den İnsan Kodu, Vibe-Coded Ajansları Ajanslı Testlerde Yendi

ChatGPT ve diğer vibe-coding araçları neredeyse 40.000 maçta test edildi ve Büyük Dil Modelleri’nin icadından önce yazılmış bir yüksek lisans öğrencisi koduna karşı kaybetti.
İngiltere’den yeni bir çalışmada, araştırmacılar insan tarafından yazılmış ajanları, en son Büyük Dil Modelleri (LLM’ler) ile geliştirilen vibe-coding ajanlarına karşı karşıya getirdiler ve LLM’ler olmadan oluşturulan ajanların, AI destekli sürümlerini kolayca yendiğini buldular.
Her iki ajan seti de İsviçre Federal Teknoloji Enstitüsü’nün Yapay Zeka Laboratuvarı’ndan farklı öğrenci nesilleri tarafından oluşturuldu. İnsan tarafından yazılmış ajanlar, 2020’de ders çalışması olarak geliştirildi, ChatGPT ve LLM devriminin başlangıcından iki yıl önce, mientras yeni ajanlar, en son ve en iyi LLM’ler kullanılarak mevcut öğrenciler tarafından oluşturuldu.
Hatta oyunu rigged olarak oynasalar da, vibe-coding çözümleri kazanamadı ve ilk beş sırayı tutarlı bir şekilde “ham” ajanlar aldı, çoğunluğu LLM ajanları (40’tan 33’ü) “çok basit” temel ajanlar tarafından kolayca yenildi, 38.304 meydan okuma boyunca, birçok değişken ve durum boyunca 12 turnuva boyunca.
Makale şöyle diyor:
‘Çalışmamız, durumun, state-of-the-art LLM’lerin çalıştırılabilir kod (yani, sözdizimi hataları olmadan) üretebileceğini, ancak üretilen çözümün, stratejik planlama, optimizasyon veya çoklu ajan rekabeti gibi boyutlarda insan tarafından tasarlanan çözümlerle rekabetçi olmadığını gösteriyor.
‘Bu nedenle, bu çalışma, yeni bir kod oluşturma sınırını ortaya koyuyor ve benchmarks, veri setleri ve açık kaynaklı temel noktaların geliştirilmesini kolaylaştırmayı amaçlıyor.’
Çıkarılan meydan okuma, çeşitli stratejiler boyunca kreatif bir şekilde ihalelere katılmak ve kazanılan öğelerin teslimatının lojistiğini organize etmekti.
Yazarlar, LLM’lere beberapa avantaj sağladıklarını, Örneğin, performansını iyileştirmek için kodlarına müdahale etmelerine izin verdiklerini, ancak buna rağmen, LLM’lerin, kesin olarak sonuçlarını iyileştirecek düzeltme kodunu kabul edemediklerini veya kullanamadıklarını belirtiyorlar:
‘[Çalışmamızda] LLM, iyi bir çözümü bağlamda ortaya koyduğumuzda bile, LLM bunu kullanamıyor.
‘Bu sonuç, karmaşık senaryolarda in-context öğrenme ve retrieval-augmented problem çözme sınırları hakkında ilginç gelecekteki araştırma sorularını da ortaya koyuyor.’
Test edilen LLM’ler, GPT-5 Thinking, Gemini 2.5 Pro, Claude Opus 4.1 ve DeepSeek R1* idi.
Yeni makale, Vibe Kodlama Yüksek Lisans CS Öğrencilerini Yenebilir mi? Bir LLM vs. İnsan Kodlama Turnuvası Pazar Odaklı Stratejik Planlama Üzerine başlığını taşıyor ve Southampton Üniversitesi’nden bir yazar ve Oxford Üniversitesi ile Alan Turing Enstitüsü’nden bir yazar tarafından yazılmıştır. Yazarlar, benchmark’ın yakında yayınlanacağını belirtiyorlar.
Yöntem
Yazarlar, geleneksel testlerin bu alanda genellikle ikili çözümlerle (doğru veya yanlış) net bir şekilde tanımlanmış meydan okumalara odaklandığını, bunlar da birim testleri ile doğrulandığını belirtiyorlar. LLM’lerle destekli kodun sınırlarını keşfetmenin ideal yolu olmadığını iddia ediyorlar ve bunun yerine, birden fazla dahili benchmark ve kilometre taşı içeren, zaferin mümkün ancak basit olmayan daha karmaşık bir meydan okuma senaryosu tasarladılar:
![Standart, birim testi tabanlı yaklaşımların (yukarıda) ve yazarların tasarladığı daha açık uçlu meydan okuma senaryosunun (mavi, aşağıda) karşılaştırması. Kaynak [ https://arxiv.org/pdf/2511.20613 ]](https://www.unite.ai/wp-content/uploads/2025/11/figure-1-2.jpg)
Standart, birim testi tabanlı yaklaşımların (yukarıda) ve yazarların tasarladığı daha açık uçlu meydan okuma senaryosunun (mavi, aşağıda) karşılaştırması. Kaynak
Auction, Pickup and Delivery Problem (APDP), kısmen İsviçre üniversitesinden 2020 öğrenci çalışmasının mevcut olması nedeniyle seçildi; bu çalışma, AI’yi geliştirme yoluyla destekleme yeteneğinden önce APDP görevi için otomatik ajanlar oluşturmayı amaçlıyordu. Bu nedenle, modern öğrencilere aynı görevi verip güncel araçlarla donatmak nispeten kolaydı.
Yazarlar, popüler test çerçevelerinden kaçınmaya çalıştılar, Örneğin, HumanEval, BigCodeBench ve WebDev Arena (ve diğerleri), çünkü bu sınıf test prosedürleri genellikle veri kirlenmesinden (yani, sistem test verilerini eğittiği yerine bölme saygı göstermediği) mustarip olur.
APDP, ters ihaleler ve araç rotalama temelinde iki aşamalı bir lojistik sorunudur. İlk aşamada, ajanlar her birini tamamlamak için ödenecek kadar fazla ödemeyeceklerini teklif ederek teslimat görevlerini kazanmaya çalışırlar. Çok yüksek teklif verilmesi görevi kaybetmeye neden olur; çok düşük teklif verilmesi para kaybetmeye neden olabilir.
İkinci aşamada, her ajan yalnızca kazandıkları görevleri yerine getirmek için verimli bir plan oluşturmalıdır, farklı kapasite ve maliyetlere sahip araçlara görevleri atayarak, zaman ve kaynak kısıtlamalarına tabi olarak:

APDP’de şirketler ters ihalelerde teslimat görevleri için teklif verir, sonra yalnızca kazandıkları görevleri yerine getirmek için araç rotalarını optimize eder, karı en üst düzeye çıkarmayı hedefler.
Hedef, görevleri tamamlamak değil, aynı zamanda hangi görev demetlerinin birlikte çalışabileceğini tahmin ederek ve rekabet halinde olan diğer şirketlerin stratejilerini öngörerek genel kârı en üst düzeye çıkarmaktır.
APDP benchmark’ı, stratejik planlama ve çoklu ajan rekabeti gibi boyutlarda kod oluşturma görevlerinin zorluğunu, bir dizi bağımlı ihale boyunca artırarak ve ajanların yalnızca anlık maliyetler hakkında değil, aynı zamanda konumlandırma, zamanlama ve uzun vadeli sonuçlar hakkında da düşünmesini gerektirir.
Temel teslimat problemi NP-zordur, yani hiçbir algoritma görevlerin sayısı arttıkça makul bir sürede en iyi çözümü güvenilir bir şekilde bulamaz. Bu, brute force’un uygulanamayan bir yaklaşım olmasını sağlar ve ajanların kesinlik için hız ile ticaret yapmasını zorlar.
Yarış Başladı
Yazarların değerlendirmesi, 40 LLM-kodlu ajanı 17 insan-kodlu ajanla bir dizi head-to-head turnuvasında karşılaştırdı. Her bir turnuva, dört farklı yol ağı topolojisinin farklı bir kombinasyonunu kullandı ve her bir ajanın diğer her bir ajanla iki kez (her iki şirketin kontrolünü de yaparak) tüm maçları içeriyordu:
Bu kurulum, her turnuvada 3.192 maç ve toplam 38.304 maç sağladı. Her maçta, 50 teslimat görevi, alındıkları ve bırakıldıkları noktalar ve ağırlıklarıyla tanımlanarak, İsviçre, Fransa, Büyük Britanya ve Hollanda’ya modellenen yol düzenleri boyunca rastgele seçildi:

Turnuvada kullanılan basitleştirilmiş yol ağları: Büyük Britanya (üst sol), İsviçre (üst sağ), Hollanda (alt sol) ve Fransa (alt sağ). Mavi ve kırmızı kareler alındıkları ve bırakıldıkları görevleri gösterir. Renkli üçgenler, ajanların araçlarının当前 konumlarını gösterir.
Öğrenci ajanları, 2020’den bir turnuva finalinden alındı. Sekizi, bir eleme finalinin en iyi performans gösterenlerinden geldi, dördü ise temel ajanlara karşı head-to-head maçlarda güçlü performans gösterdikleri için seçildi.
Temel ajanlar sabit yöntemler izledi. Naive toplam mesafeyi hesapladı ve buna göre teklif verdi, yalnızca bir aracı kullandı ve partisyonu görmezden geldi; ExpCostFixedBid 10 rastgele görevi simüle etti ve marjinal maliyetin ortalamasını teklif etti; Honest görevin takvimine eklenmesinin gerçek marjinal maliyetini hesapladı; ModelOpponent aynı şeyi yaptı, ancak rakibin maliyetinin bir tahminini ekledi, en yükseğini teklif etti; ve RiskSeeking zaman içinde azalan bir önceliği canlı maliyet tahmini ve rakip modellemesiyle birleştirdi – yine en yükseğini teklif etti.
Değerlendirme, GPT-5 Thinking, Claude Opus 4.1, Gemini 2.5 Pro ve DeepSeek R1 kullanarak oluşturulan 40 LLM-kodlu ajanı içeriyordu. Her model, beş farklı stratejiyle uyarıldı, her modelde iki kez uygulandı.
İki strateji, farklı yazarlar tarafından yazılan statik promtleri kullandı, bir diğeri modelin kendi çıktısını self-reflect ve revize etmesini istedi; bir diğeri, ayrı bir LLM tarafından eleştiri ve revizyon içeriyordu. Son strateji, önceki dört yaklaşımı gözden geçirerek yeni bir promt oluşturmak için GPT-4’ü kullandı.
Temel promt, orijinal öğrenci görevini yansıtıyordu, teslimat ortamını tanımlıyordu ve modeli, yüksek karmaşıklık yöntemlerine güvenmeden kârı en üst düzeye çıkarmak için teklif vermeye ve planlamaya yönlendiriyordu.
Tüm LLM ajanları, observable hatalar düzeltilene kadar self-play ve turnuva ayarlarında test edildi. Hata düzeltme, LLM’ler tarafından otomatik olarak, hata bilgileriyle uyarılarak yapıldı.
Ortak LLM hataları, makaleye göre, zaman aşımı limiti ihlallerini, atanan görevleri alamama veya teslim edememe ve araç kapasite kısıtlamalarının ihlallerini içeriyordu – bu hatalar genellikle açık talimatlara uymama veya hatalı yeniden planlama mantığından kaynaklanıyordu†:
‘Başka bir ortak sorun, Gemini, Claude ve DeepSeek’de (GPT’de değil) sıklıkla LLM’nin bir hatayı sürekli olarak çözme başarısızlığıydı.
‘Örneğin, bir ajan sürekli olarak zaman aşımına uğrayacaktı, hata ve güncellenmiş kod sürümünü aldığımız 5 ila 15 tur arasında rağmen.
‘Bu gibi durumlarda (LLM’nin aynı hatayı defalarca çözme başarısızlığı) tek çözüm, başa dönmekti. Genel olarak, hata-free kodu elde etmek için önemli bir manuel çaba gerektiğinin farkına vardık. 40 hata-free ajanı değerlendirmek için önemli ölçüde daha fazla ajan üretmemiz gerekti.’
Aşağıdaki sonuçlar, 12 çift tur turnuvalarından elde edilen sonuçları özetliyor, dört yol ağı topolojisi ve her topolojide üç turnuva, yaklaşık 40.000 maç:
| Ajan | Ortalama Kazanma / Tur | Standart Sapma Kazanma / Tur | Ortalama Kaybetme / Tur | Standart Sapma Kaybetme / Tur | Toplam Kazanma | Toplam Kaybetme | Kazanma Oranı |
|---|---|---|---|---|---|---|---|
| Öğrenci 1 | 108.167 | 1.193 | 3.833 | 1.193 | 1298 | 46 | 0.9658 |
| Öğrenci 2 | 104.917 | 2.539 | 7.083 | 2.539 | 1259 | 85 | 0.9368 |
| Öğrenci 3 | 103.917 | 2.466 | 8.083 | 2.466 | 1247 | 97 | 0.9278 |
| Öğrenci 4 | 103.25 | 1.815 | 8.75 | 1.815 | 1239 | 105 | 0.9219 |
| Öğrenci 5 | 96.5 | 2.908 | 15.5 | 2.908 | 1158 | 186 | 0.8616 |
| LLM(O, IR, 1) | 95.417 | 2.314 | 16.583 | 2.314 | 1145 | 199 | 0.8519 |
| LLM(O, A2, 1) | 94.583 | 2.314 | 17.417 | 2.314 | 1135 | 209 | 0.8445 |
| Öğrenci 6 | 93.167 | 1.899 | 18.833 | 1.899 | 1118 | 226 | 0.8318 |
| Öğrenci 7 | 93.167 | 3.563 | 18.833 | 3.563 | 1118 | 226 | 0.8318 |
| LLM(O, A1, 1) | 86.083 | 3.029 | 25.917 | 3.029 | 1033 | 311 | 0.7686 |
| LLM(O, GEN, 2) | 84.083 | 6.947 | 27.917 | 6.947 | 1009 | 335 | 0.7507 |
| LLM(O, CR, 2) | 83.5 | 4.442 | 28.5 | 4.442 | 1002 | 342 | 0.7455 |
| Öğrenci 8 | 83.417 | 4.122 | 28.583 | 4.122 | 1001 | 343 | 0.7448 |
| RiskSeeking | 82.417 | 3.343 | 29.583 | 3.343 | 989 | 355 | 0.7359 |
| LLM(O, GEN, 1) | 80.667 | 4.355 | 31.25 | 4.372 | 968 | 375 | 0.7208 |
| ModelOpponent | 80.583 | 3.26 | 31.417 | 3.26 | 967 | 377 | 0.7195 |
| LLM(D, A1, 1) | 79.417 | 3.965 | 32.583 | 3.965 | 953 | 391 | 0.7091 |
| ExpCostFixedBid | 77.167 | 4.951 | 34.833 | 4.951 | 926 | 418 | 0.689 |
| LLM(O, IR, 2) | 73.917 | 3.502 | 38 | 3.618 | 887 | 456 | 0.6605 |
| LLM(O, A1, 2) | 72.417 | 2.193 | 39.583 | 2.193 | 869 | 475 | 0.6466 |
| LLM(G, A1, 2) | 68.5 | 3.555 | 43.5 | 3.555 | 822 | 522 | 0.6116 |
| LLM(A, GEN, 2) | 67.917 | 2.968 | 44.083 | 2.968 | 815 | 529 | 0.6064 |
| LLM(G, IR, 2) | 65.917 | 2.314 | 46.083 | 2.314 | 791 | 553 | 0.5885 |
| Öğrenci 9 | 64.167 | 11.044 | 47.833 | 11.044 | 770 | 574 | 0.5729 |
| LLM(G, A1, 1) | 64 | 4.243 | 47.917 | 4.316 | 768 | 575 | 0.5719 |
| LLM(G, IR, 1) | 60.333 | 3.725 | 51.667 | 3.725 | 724 | 620 | 0.5387 |
| LLM(O, A2, 2) | 59.333 | 4.499 | 52.667 | 4.499 | 712 | 632 | 0.5298 |
| LLM(D, CR, 1) | 55.083 | 6.694 | 56.833 | 6.59 | 661 | 682 | 0.4922 |
| LLM(G, GEN, 2) | 53.167 | 3.664 | 58.833 | 3.664 | 638 | 706 | 0.4747 |
| LLM(D, GEN, 2) | 52.083 | 9.06 | 59.917 | 9.06 | 625 | 719 | 0.465 |
| Honest | 50.583 | 3.848 | 61.417 | 3.848 | 607 | 737 | 0.4516 |
| Öğrenci 10 | 48.833 | 2.98 | 63.167 | 2.98 | 586 | 758 | 0.436 |
| LLM(D, IR, 1) | 48.583 | 10.211 | 63.417 | 10.211 | 583 | 761 | 0.4338 |
| LLM(A, A1, 1) | 48 | 4.69 | 64 | 4.69 | 576 | 768 | 0.4286 |
| LLM(G, A2, 1) | 47.25 | 3.864 | 64.75 | 3.864 | 567 | 777 | 0.4219 |
| LLM(A, CR, 1) | 43.833 | 4.609 | 68.167 | 4.609 | 526 | 818 | 0.3914 |
| LLM(A, A1, 2) | 43.75 | 2.05 | 68.25 | 2.05 | 525 | 819 | 0.3906 |
| Öğrenci 11 | 42.083 | 5.664 | 69.917 | 5.664 | 505 | 839 | 0.3757 |
| LLM(A, IR, 1) | 39.5 | 2.541 | 72.5 | 2.541 | 474 | 870 | 0.3527 |
| Naive | 36.75 | 1.712 | 75.25 | 1.712 | 441 | 903 | 0.3281 |
| Öğrenci 12 | 36.333 | 1.775 | 75.667 | 1.775 | 436 | 908 | 0.3244 |
| LLM(D, A2, 1) | 33.917 | 2.193 | 78.083 | 2.193 | 407 | 937 | 0.3028 |
| LLM(A, GEN, 1) | 30.167 | 1.749 | 81.833 | 1.749 | 362 | 982 | 0.2693 |
| LLM(D, A2, 2) | 29.833 | 2.038 | 82.167 | 2.038 | 358 | 986 | 0.2664 |
| LLM(G, A2, 2) | 27 | 2.256 | 85 | 2.256 | 324 | 1020 | 0.2411 |
| LLM(A, A2, 1) | 26.333 | 0.985 | 85.667 | 0.985 | 316 | 1028 | 0.2351 |
| LLM(O, CR, 1) | 25 | 3.411 | 87 | 3.411 | 300 | 1044 | 0.2232 |
| LLM(A, IR, 2) | 24.333 | 8.542 | 87.667 | 8.542 | 292 | 1052 | 0.2173 |
| LLM(A, A2, 2) | 24 | 1.809 | 88 | 1.809 | 288 | 1056 | 0.2143 |
| LLM(A, CR, 2) | 23.333 | 1.557 | 88.667 | 1.557 | 280 | 1064 | 0.2083 |
| LLM(D, GEN, 1) | 22.5 | 1.784 | 89.5 | 1.784 | 270 | 1074 | 0.2009 |
| LLM(D, A1, 2) | 13.333 | 1.826 | 98.667 | 1.826 | 160 | 1184 | 0.119 |
| LLM(G, CR, 1) | 9.5 | 1.087 | 102.5 | 1.087 | 114 | 1230 | 0.0848 |
| LLM(G, GEN, 1) | 9.167 | 0.937 | 102.833 | 0.937 | 110 | 1234 | 0.0818 |
| LLM(D, IR, 2) | 7.75 | 0.622 | 104.25 | 0.622 | 93 | 1251 | 0.0692 |
| LLM(G, CR, 2) | 7.25 | 1.422 | 104.75 | 1.422 | 87 | 1257 | 0.0647 |
| LLM(D, CR, 2) | 5.667 | 0.985 | 106.333 | 0.985 | 68 | 1276 | 0.0506 |
Yazarlar, yukarıdaki sonuçlarla ilgili olarak şunları belirtiyorlar†:
‘LLM’ler, APDP problemının daha basit varyantlarında bile beklenen/rekabetçi kod üretemedi (kod büyük ölçüde sözdizimi hataları olmadan). Bu, LLM’lerin ötesine geçen, otomatik tamamlama ve LLM’lerin yeni zayıflıklarını tanımlayan, akıl yürütme odaklı kod değerlendirme benchmark’larının önemini vurguluyor.’
‘Sonuçlarımız, insan tarafından kodlanmış ajanların açık bir üstünlüğünü gösteriyor: (i) İlk beş sırayı tutarlı bir şekilde öğrenci ajanları alıyor ve (ii) LLM ajanlarının çoğunluğu (40’tan 33’ü) çok basit temel ajanlar tarafından kolayca yeniliyor (örneğin, beklenen maliyet sabit teklifi).
‘Önemlisi, öğrenci kodunu hata ayıklamadık (LLM kodunu ise hem self-play hem de turnuva ayarlarında důklad olarak test ettik ve hata ayıkladık). Her öğrenci ajanı çöktüğünde, otomatik olarak LLM’ye galibiyeti verdik. Bu çökmelerin birçoğu kolayca düzeltilirdi (örneğin, ajanlar zaman aşımına uğradı), bu nedenle öğrenci ajanları potansiyel olarak daha yüksek sıralamaya ulaşabilirlerdi.’
Ek bir deney olarak, GPT-5 Thinking, en iyi performans gösteren insan ajanı Öğrenci 1‘in kodunu iyileştirmek için uyarıldı; ancak şimdi LLM-modified ajan, onuncu sıraya düştü ve tüm insan puanlarının en kötüsü oldu. LLM’ler, çözümü geliştirmek yerine, yaklaşık %20 oranında bozdu.
Yazarlar, sonuçlarını şöyle özetliyor:
‘Sonuçlarımız, LLM kod oluşturma sınırlarını vurguluyor, özellikle kod oluştururken sınırlı akıl yürütme ve planlama yetenekleri. Modern LLM’ler, çalıştırılabilir, sözdizimi hataları olmayan kod sağlayabilir, ancak bu, ilerleme ölçmek için kullanmamız gereken benchmark değildir. ‘
Sonuç
Yazarlar, makalenin sonunda, vibe-coding’in teknik olmayan tüm geçmişlere sahip insanları güçlendirdiğini ve bu uygulamayı olumlu bir şekilde, bir eşitlikçi güç olarak tanımladılar. Ancak, vibe-coding’in sadece yeni ortaya çıktığını ve sınırlarının bilinmediğini, gerçekçi olarak beklenebileceğinden daha yüksek olabileceğini ima ediyorlar.
Çalışmalarını, ‘derleyici kodu競e kod‘ hedefini değiştirme çağrısıyla bitiriyorlar.
İlginç yeni makaleyi okuyan casual okuyucunun aklına gelebilecek bir soru, yazarların yukarıdan mı yoksa aşağıdan mı vurduğu, çünkü söz konusu ajans görevi, PowerShell betikleri ve diğer küçük işlevler ve düzeltmeler için vibe-coding’in uygun olduğu daha karmaşık ve daha fazla içeriklidir.
* Lütfen makalenin sürekli olarak ‘DeepThink R1’e atıfta bulunduğunu, ancak sadece ‘DeepSeek R1’ için birkaç internet referansı olduğunu (muhtemelen diğer yazarların ‘DeepSeek R1’i yanlış yazması nedeniyle) unutmayınız. Bu benim hatam ise, lütfen profil ayrıntılarımdan bana ulaşın ve düzeltme yapacağım.
† Yazarların vurgusu, benimki değil.
İlk olarak 26 Kasım 2025 Çarşamba günü yayınlandı. 17:35 EST’de düzenleme için değiştirildi.












