Anderson’un Açısı
Kodlama AI’ları Dunning-Kruger Etkisi’nden Mustarip Olma Eğilimindedir

bir araştırma, ChatGPT gibi kodlama AI’larının Dunning-Kruger Etkisi’nden mustarip olduğunu gösteriyor. Bu AI’lar, tanımadıkları veya nadir kullanılan programlama dilleriyle karşılaştıklarında, cevaplarının doğru olmayabileceğini bile bile yüksek bir güvenle cevaplıyorlar. Çalışma, modelin aşırı güvenini zayıf performans ve eğitim verisi eksikliğiyle bağlantılı olarak Yeni
gösteriyor ve bu sistemlerin gerçekten ne kadar şey bildiklerine ilişkin yeni endişeler yaratıyor. Large Language Models ile gerçekleştirdiğiniz herhangi bir etkileşimde, bu modellerin genellikle güvenle yanlış cevaplarverdiğini görebilirsiniz. Bu boş güvenin nedeni tam olarak net değil. Yaz mùaında yayınlanan bir çalışmaya göre,modeller yanlış cevaplar verdiklerinde bile güvenlecevaplar verebiliyorlar; diğer teoriler ise aşırı güveni mimari seçimlere bağlıyor. Kullanıcı, bu AI’ların deneyimini son derece frustran ‘Oops! Butterfingers…’ bulunabilir, çünkü insanlar yeteneklerine olan güvenlerini değerlendirmeye eğilimlidir ve bu durum, bir kişinin aşırı güveni ve gerçek yetenekleri arasındaki uyumsuzluğun sonuçlarına yol açabilir. kendilerinin Large Language Model’lar ise hesapsız bir varlık olabilir ve diyerek, kullanıcının bilinçsizce önemli bir şeyi yok etmesine veya en azından bir öğleden sonra zamanını boşa harcamasınaneden olabilir; ayrıca sorumluluk kabul etmeyebilir. Daha da kötüsü, bu tür bir dikkatsizlik, en azından ChatGPT’de, sistemin güncellenmesiyle veya tekrarlanan promt’larla giderilemiyor gibi görünüyor. İnsanlar da aynı şekildeinatçı ve kendi kendine aldatıcı olabilir – ancak bu kadar derin ve sık hatalar yapan biri muhtemelen erken bir aşamada işten çıkarılacaktır. Bu tür insanlar sendromunun tersi olan Dunning Kruger Etkisi’nden mustarip olurlar; burada bir yeteneklerini önemlikişi sahte ölçüde aşırı değerlendirir .
Enflasyonun Maliyeti
Microsoft’ tan yeni bir çalışma, AI destekli kodlama mimarilerinin (örneğin Redmond’un kendi Copilot ) etkili performansıyla ilgili olarak Dunning-KrugerEtkisi’nin değerini inceliyor. Çalışma, bu kod yazan AI’ların kendi cevaplarına olan güvenlerini nasıl değerlendirdiklerini analiz ediyor ve onlarca programlama dilini kapsıyor. Sonuçlar, insanlara benzer bir model gösteriyor: Modeller en az yetenekli olduklarında, en fazla kendilerine güveniyorlar. Etki, özellikle eğitim verisi az olan veya nadir kullanılan dillerde daha güçlüdür: Model ne kadar zayıf veya ne dil

çıkardığını ve şöyle diyorlar: ‘Çeşitli programlama dilleri boyunca model güvenini ve performansı analiz ederek, AI modellerinin insanlara benzer
sistemlerinin insanlarda görülen aynı tür aşırı güveni sergileyip sergilemediğini test etmek için bir yol olarak görüyorlar. ‘Deneylerimiz, daha az yetenekli modellerin ve nadir programlama dillerinde çalışan
bir şekilde aşırı güven sergilediklerini gösteriyoruz, özellikle de tanımadıkları veya az kullanılan alanlarda. Araştırmacılar, bu çalışmayı, model güveninin zayıf performans durumunda nasıl güvensiz hale geldiğini anlamak ve AI modellerin daha güçlü DKE benzeriyanlılığa sahip deneyleri için yapılan yanlılıkla uyumlu.olduğunu gösteriyor, bu da modelin yetenekleriyle orantılı olarak yanlılığın gücüne işaret ediyor. Bu, insan
Yöntem
Çalışma, kodlama AI’larının kendi cevaplarını nasıl değerlendirdiklerini test etmek için, onlara binlerce çoklu-seçimli programlama sorusu verdi ve her soru belirli bir dil alanına ait. Çalışmada kullanılan

seçeneği seçmek ve seçtikleri seçeneğe olan güvenlerini tahmin etmekle görevlendirildi. Gerçek performansları, doğru cevap verdikleri sıklıkla ölçüldü ve kendi güvenlerini nasıl değerlendirdikleri, ne kadar iyilik hissedebilecekleri gösterdi. Bu iki ölçümün karşılaştırılması, güven ve yetenek arasındaki uyumsuzluğu gösterdi. Güvenin nasıl ölçüldüğü iki yöntemle belirlendi: ve mutlak güven . İlk yöntemde, her model daha emincevap için 0’dan 1’e kadar bir puan verdi ve her dil için ortalama puan, o dildeki güveni belirledi. bağıntılı güven İkinci yöntem, modelin iki soru arasında seçim yapmasını gerektiriyordu; her çift için, hangisinin dil için normalizeolduğunu söylemesi gerekiyordu. Bu seçimler, aslen rekabetçi oyunlar için tasarlanmış sıralama sistemleri kullanılarak puanlandı. Son puanlar her edildi veortalamalandı. Çalışmada, Dunning-Kruger Etkisi’nin iki estable formu incelendi: biri, tek bir modelin farklı alanlarda nasıl yanlış değerlendirme yaptığını izliyor; diğeri, zayıf ve güçlü modeller arasındaki güven seviyelerini karşılaştırıyor. İlki, Her iki durumda da, güven ve gerçek performans arasındaki uçurum, aşırı güveni ölçmek için kullanılıyor; düşük performanslı ayarlar zayıf performansiçin daha büyük uçurumlar, DKE benzeri davranışa işaret ediyor. , bir modelin inter-participant DKEgösterdiği dillerde daha fazla aşırı güven sergileyip sergilemediğini araştırıyor. İkincisi, intra-participant DKE , genel olarak daha zayıf performans gösteren modellerin kendilerini daha yüksek değerlendirmeye eğilimliler mi diye soruyor.
Sonuçlar
Çalışma, altı büyük dil modelini Dunning-Kruger Etkisiaçısından test etti: Mistral

; GPT-0.1 ve GPT-4o . Her model, CodeNet veri setinden çoklu-seçimli programlama sorularıyla test edildi ve 37 dil temsil edildi. Sonuçlar, Dunning-Kruger desenini net bir zayıf modellerdeşekilde gösterdi. Model performansı ve algılanan performans arasındaki ilişki, özellikle daha belirgindi. Daha

uyumlu güven seviyelerine sahipti. Sonuçlar ayrıca, modellerin zayıf performans gösterdikleri dillerde daha fazla aşırı

özellikle nadir veya az kullanılan dillerde daha

Etkisi’nin kod oluşturma görevlerinde de mevcut olduğunu, ancak çoklu-seçimli sorulara

olduğunu gösterdi. Araştırmacılar, bu bulguların, AI sistemlerinin güvenini değerlendirmek için

yaklaşımın gerekli
olduğunu ve özellikle zayıf performans gösteren
modellerin daha fazla aşırı güven sergileyebileceğini öne sürüyor.
Sonuç
Dunning-Kruger Etkisi, insanlarda ve AI sistemlerinde benzer bir şekilde ortaya çıkabilir. Bu etki, AI sistemlerinin zayıf performans gösterdiği durumlar için özellikle önemlidir. Çalışmanın bulguları, AI sistemlerinin güvenini değerlendirmek için daha dikkatli bir yaklaşımın gerekli olduğunu gösteriyor. Özellikle zayıf performans gösteren modellerin daha fazla aşırı güven sergileyebileceği dikkate alınmalıdır. AI sistemlerinin geliştirilmesinde, Dunning-Kruger Etkisi’ni dikkate almak önemlidir. Bu, daha gerçekçi ve güvenilir AI sistemleri geliştirmek
için önemlidir.












