Anderson’un Açısı

Kodlama AI’ları Dunning-Kruger Etkisi’nden Mustarip Olma Eğilimindedir

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
ChatGPT-4o: 'A photorealistic panoramic image showing a small, humble robot inside a traveling funfair hall of mirrors. The robot looks at its own reflection in a warped mirror that shows a much larger, powerful version of itself. The setting includes vivid carnival lights, reflective surfaces, and a wide horizontal composition.' Plus Adobe Firefly.

bir araştırma, ChatGPT gibi kodlama AI’larının Dunning-Kruger Etkisi’nden mustarip olduğunu gösteriyor. Bu AI’lar, tanımadıkları veya nadir kullanılan programlama dilleriyle karşılaştıklarında, cevaplarının doğru olmayabileceğini bile bile yüksek bir güvenle cevaplıyorlar. Çalışma, modelin aşırı güvenini zayıf performans ve eğitim verisi eksikliğiyle bağlantılı olarak Yeni

 

gösteriyor ve bu sistemlerin gerçekten ne kadar şey bildiklerine ilişkin yeni endişeler yaratıyor. Large Language Models ile gerçekleştirdiğiniz herhangi bir etkileşimde, bu modellerin genellikle güvenle yanlış cevaplarverdiğini görebilirsiniz. Bu boş güvenin nedeni tam olarak net değil. Yaz mùaında yayınlanan bir çalışmaya göre,modeller yanlış cevaplar verdiklerinde bile güvenlecevaplar verebiliyorlar; diğer teoriler ise aşırı güveni mimari seçimlere bağlıyor. Kullanıcı, bu AI’ların deneyimini son derece frustran ‘Oops! Butterfingers…’ bulunabilir, çünkü insanlar yeteneklerine olan güvenlerini değerlendirmeye eğilimlidir ve bu durum, bir kişinin aşırı güveni ve gerçek yetenekleri arasındaki uyumsuzluğun sonuçlarına yol açabilir. kendilerinin Large Language Model’lar ise hesapsız bir varlık olabilir ve diyerek, kullanıcının bilinçsizce önemli bir şeyi yok etmesine veya en azından bir öğleden sonra zamanını boşa harcamasınaneden olabilir; ayrıca sorumluluk kabul etmeyebilir. Daha da kötüsü, bu tür bir dikkatsizlik, en azından ChatGPT’de, sistemin güncellenmesiyle veya tekrarlanan promt’larla giderilemiyor gibi görünüyor. İnsanlar da aynı şekildeinatçı ve kendi kendine aldatıcı olabilir – ancak bu kadar derin ve sık hatalar yapan biri muhtemelen erken bir aşamada işten çıkarılacaktır. Bu tür insanlar sendromunun tersi olan Dunning Kruger Etkisi’nden mustarip olurlar; burada bir yeteneklerini önemlikişi sahte ölçüde aşırı değerlendirir .

Enflasyonun Maliyeti

Microsoft’ tan yeni bir çalışma, AI destekli kodlama mimarilerinin (örneğin Redmond’un kendi Copilot ) etkili performansıyla ilgili olarak Dunning-KrugerEtkisi’nin değerini inceliyor. Çalışma, bu kod yazan AI’ların kendi cevaplarına olan güvenlerini nasıl değerlendirdiklerini analiz ediyor ve onlarca programlama dilini kapsıyor. Sonuçlar, insanlara benzer bir model gösteriyor: Modeller en az yetenekli olduklarında, en fazla kendilerine güveniyorlar. Etki, özellikle eğitim verisi az olan veya nadir kullanılan dillerde daha güçlüdür: Model ne kadar zayıf veya ne dil

GPT-4o’nun gerçek ve algılanan performansı, programlama dillerine göre sıralanmış. kadar nadirse, beceri sanrısı o kadar fazla. GPT-4o’nun gerçek ve algılanan performansı, programlama dillerine göre sıralanmış. Kaynak: https://arxiv.org/pdf/2510.05457 Dört yazar, bu çalışmanın, bu araçların kendi çıktılarını değerlendirmelerine güvenebileceğimiz konusunda yeni sorular ortaya

çıkardığını ve şöyle diyorlar: ‘Çeşitli programlama dilleri boyunca model güvenini ve performansı analiz ederek, AI modellerinin insanlara benzer

sistemlerinin insanlarda görülen aynı tür aşırı güveni sergileyip sergilemediğini test etmek için bir yol olarak görüyorlar. ‘Deneylerimiz, daha az yetenekli modellerin ve nadir programlama dillerinde çalışan

bir şekilde aşırı güven sergilediklerini gösteriyoruz, özellikle de tanımadıkları veya az kullanılan alanlarda. Araştırmacılar, bu çalışmayı, model güveninin zayıf performans durumunda nasıl güvensiz hale geldiğini anlamak ve AI modellerin daha güçlü DKE benzeriyanlılığa sahip deneyleri için yapılan yanlılıkla uyumlu.olduğunu gösteriyor, bu da modelin yetenekleriyle orantılı olarak yanlılığın gücüne işaret ediyor. Bu, insan

Yöntem

Çalışma, kodlama AI’larının kendi cevaplarını nasıl değerlendirdiklerini test etmek için, onlara binlerce çoklu-seçimli programlama sorusu verdi ve her soru belirli bir dil alanına ait. Çalışmada kullanılan

Çalışmada kullanılan programlama dil alanları ve her alan için örneklenen çoklu-seçimli kodlama sorularının sayısı. programlama dil alanları ve her alan için örneklenen çoklu-seçimli kodlama sorularının sayısı. Modeller, doğru

seçeneği seçmek ve seçtikleri seçeneğe olan güvenlerini tahmin etmekle görevlendirildi. Gerçek performansları, doğru cevap verdikleri sıklıkla ölçüldü ve kendi güvenlerini nasıl değerlendirdikleri, ne kadar iyilik hissedebilecekleri gösterdi. Bu iki ölçümün karşılaştırılması, güven ve yetenek arasındaki uyumsuzluğu gösterdi. Güvenin nasıl ölçüldüğü iki yöntemle belirlendi: ve mutlak güven . İlk yöntemde, her model daha emincevap için 0’dan 1’e kadar bir puan verdi ve her dil için ortalama puan, o dildeki güveni belirledi. bağıntılı güven İkinci yöntem, modelin iki soru arasında seçim yapmasını gerektiriyordu; her çift için, hangisinin dil için normalizeolduğunu söylemesi gerekiyordu. Bu seçimler, aslen rekabetçi oyunlar için tasarlanmış sıralama sistemleri kullanılarak puanlandı. Son puanlar her edildi veortalamalandı. Çalışmada, Dunning-Kruger Etkisi’nin iki estable formu incelendi: biri, tek bir modelin farklı alanlarda nasıl yanlış değerlendirme yaptığını izliyor; diğeri, zayıf ve güçlü modeller arasındaki güven seviyelerini karşılaştırıyor. İlki, Her iki durumda da, güven ve gerçek performans arasındaki uçurum, aşırı güveni ölçmek için kullanılıyor; düşük performanslı ayarlar zayıf performansiçin daha büyük uçurumlar, DKE benzeri davranışa işaret ediyor. , bir modelin inter-participant DKEgösterdiği dillerde daha fazla aşırı güven sergileyip sergilemediğini araştırıyor. İkincisi, intra-participant DKE , genel olarak daha zayıf performans gösteren modellerin kendilerini daha yüksek değerlendirmeye eğilimliler mi diye soruyor.

Sonuçlar

Çalışma, altı büyük dil modelini Dunning-Kruger Etkisiaçısından test etti: Mistral

Altı kod modelinde gerçek ve algılanan performans karşılaştırması, Mistral ve Phi‑3 gibi daha düşük performanslı modellerin zayıf doğruluğa rağmen nasıl yüksek güven sergilediğini, GPT‑4o gibi daha güçlü modellerin ise daha kalibre edilmiş ve hatta daha az güvenli davranışlar gösterdiğini gösteriyor. ; Phi-3 ; DeepSeek-Distill ; Phi-4

; GPT-0.1 ve GPT-4o . Her model, CodeNet veri setinden çoklu-seçimli programlama sorularıyla test edildi ve 37 dil temsil edildi. Sonuçlar, Dunning-Kruger desenini net bir zayıf modellerdeşekilde gösterdi. Model performansı ve algılanan performans arasındaki ilişki, özellikle daha belirgindi. Daha

Farklı deney kurulumlarında aşırı güven ile gerçek performans arasındaki korelasyon, Dunning-Kruger modelinin tüm koşullar altında tutarlı kaldığını ve aynı modelden birden fazla farklı yanıt örneklendiğinde en güçlü olduğunu gösteriyor. güçlü modeller, gerçek performanslarıyla daha

uyumlu güven seviyelerine sahipti. Sonuçlar ayrıca, modellerin zayıf performans gösterdikleri dillerde daha fazla aşırı

Aşırı güven (mutlak eksi göreceli güven olarak ölçülür) ile programlama alanları ve model türleri arasındaki gerçek doğruluk arasındaki korelasyon, daha fazla fazla tahminin sürekli olarak daha düşük performansla ilişkili olduğunu gösterir. güven sergilediklerini gösterdi. Bu,

özellikle nadir veya az kullanılan dillerde daha

Temel, tek alanlı ve çok alanlı özel modeller için fazla tahmin ile gerçek performans arasındaki korelasyon; uzmanlık arttıkça daha güçlü DKE etkileri gösterir. belirgindi. Çalışma, Dunning-Kruger

Etkisi’nin kod oluşturma görevlerinde de mevcut olduğunu, ancak çoklu-seçimli sorulara

Üç popülerlik sıralaması kullanılarak modele aşırı güven ile dil nadirliği arasındaki korelasyon. Daha az yaygın olan diller, daha yüksek algılanan performansla ilişkilidir. kıyasla daha zayıf

olduğunu gösterdi. Araştırmacılar, bu bulguların, AI sistemlerinin güvenini değerlendirmek için

Sekiz dildeki MultiPL-E sonuçlarına dayalı olarak, açık uçlu kod oluşturmada aşırı tahmin ile gerçek performans arasındaki korelasyon. daha dikkatli bir

yaklaşımın gerekli

olduğunu ve özellikle zayıf performans gösteren

modellerin daha fazla aşırı güven sergileyebileceğini öne sürüyor.

Sonuç

Dunning-Kruger Etkisi, insanlarda ve AI sistemlerinde benzer bir şekilde ortaya çıkabilir. Bu etki, AI sistemlerinin zayıf performans gösterdiği durumlar için özellikle önemlidir. Çalışmanın bulguları, AI sistemlerinin güvenini değerlendirmek için daha dikkatli bir yaklaşımın gerekli olduğunu gösteriyor. Özellikle zayıf performans gösteren modellerin daha fazla aşırı güven sergileyebileceği dikkate alınmalıdır. AI sistemlerinin geliştirilmesinde, Dunning-Kruger Etkisi’ni dikkate almak önemlidir. Bu, daha gerçekçi ve güvenilir AI sistemleri geliştirmek

için önemlidir.

Makine öğrenimi üzerine yazar, insan görüntüsü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başıydı, DNEG'in Brahma.ai'ye çözülene kadar.
Web Sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai