Anderson’un Açısı

Büyük Dil Modellerinde Açıklığın Azalması

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
AI-generated image of a man literally up to his neck in printed verbiage. GPT-1.5.

Yeni bir araştırmaya göre, Büyük Dil Modellerinin daha kısa cevaplar vermesi için zorlanması, cevapların doğruluğunu ve kalitesini önemli ölçüde artırıyor.

 

Herhangi bir sohbet botunun “söylentilerini” durdurmaya çalışan herkes, yeni araştırmanın sonuçlarını tanıyacaktır: AI’nın daha kısa cevaplar vermesi için zorlanması, doğruluğunu artırır.

Büyük AI sohbet botlarının, küçük olanlardan daha kötü performans göstermesinin nedenlerini araştıran araştırma, 31 popüler Büyük Dil Modelinin (LLM) daha kısa cevaplar vermesi için zorlanması, cevapların doğruluğunda %26,3’lük bir iyileşme sağladığını buldu:

‘Sonuçlar, kısalık kısıtlamalarının büyük model doğruluğunu %26,3 puan artırdığını ve ters ölçekleme açığını %67 oranında azalttığını ( %44,2’den %14,8’e, eşleştirilmiş t-test: t = 7,80, p < 0,0001) gösteren güçlü nedenler sunuyor.'

Aşırı açıklık, son kullanıcılar arasında sıkça görülen bir şikayettir, özellikle de ChatGPT gibi ticari düzeydeki modellerde, destek forumlarında bu konu sıkça tartışılır.

En çok etkilenen alan matematik, burada test edilen AI’lar 50 kelimeden fazla cevap vermemekle kısıtlandı. Okuma anlama görevleri için ise cevapları 10 kelimeden fazla olmamak üzere sınırlandırdılar.

Çalışma, AI’nın cevaplarındaki aşırı açıklığı, yani merkezi mesajın sadece sözlerle gizlenmediğini, bazen de olumsuz etkilediğini tanımlar. Makaleye göre, model ne kadar küçükse, bu çözümün gerekli olması veya çalışması o kadar azdır.

Araştırma, bu çözümü sistematik olarak uygulamak için mimaride bir şeyin düzeltilmesine gerek olmadığını, ancak bir kullanıcı oturumunda, kısalık yönünde bir yönlendirme muhtemelen tekrarlanacaktır, oysa küresel olarak uygulanan bir sistem ipucu – ki bu, ChatGPT gibi platformlarda mühendislik varsayılanı olarak uygulanmalıdır – daha kısa cevapları varsayılan davranış haline getirebilir.

Şiddetli Rüzgarlar

Hiçbiri, neden daha büyük modellerin açıklık eğilimine sahip olduğunu tam olarak açıklamıyor, çünkü bu, açık kaynaklı modelleri de etkileyen bir şey. Makale, İnsan Geri Bildiriminden Peşinen Öğrenme (RLHF) tekniklerindeki protokoller ve ortak uygulamaların bir açıklama sunabileceğini öneriyor*:

‘Makul bir açıklama, RLHF hizalama eğitimi olabilir, burada insan annotatörleri, daha büyük modellerde daha fazla kapasiteye sahip olan uzunluk-ödül sinyallerine orantısız bir şekilde ödüllendirir – talimatlı varyantlardan daha fazla olan açıklık farklılıklarıyla tutarlı.’

‘Önceki çalışmalar, ödüllendirme modellerinde sistematik uzunluk yanlılığı belgeliyor, burada annotatörler uzunluğu kaliteyle karıştırıyor.’

‘Daha büyük modeller, uzunluk-ödül sinyallerini daha fazla memnun edebilme kapasitesine sahip olarak, daha küçük modellere göre daha derin bir şekilde sözü fazla kullanma üretimi içselleştirebilir, böylece gözlemlediğimiz ölçek bağımlı aşırı düşünmeyi üretir.’

İnsanlarda, açıklık, bir sessizliği doldurmak için, garip hissetmemek için, mental hastalık nedeniyle veya bilgi eksikliğini gizlemek için ortaya çıkabilir. Aslında, bir AI yalnızca bu özelliklerin eğitim verilerini emerek bu faktörlerden etkilenir.

Veri topluluklarında, uzun cevaplar için diğer motivasyonlar da vardır, örneğin SEO teşviki daha uzun metin içeriği üretmek için, örneğin tariflerde, burada uzunluk genellikle (çoğunlukla yanlış bir şekilde) otorite ile ilişkilendirilir.

İmkansız değil, ancak API tabanlı platformların, kullanıcıları daha yüksek ve daha pahalı bir abonelik tierine yönlendirmeye teşvik etmesi veya açıklığı teşvik etmemesi, token kullanımını ucuz bir şekilde artırır, aşırı mantık veya RAG çağrılarına gerek kalmadan.

Araştırma, Brevity Constraints Reverse Performance Hierarchies in Language Models adlı yeni bir makale ve Bangladeş’teki Chattogram’daki İsveç Politeknik Enstitüsü Bilgisayar Bilimi Bölümü’nden geliyor.

Yöntem

Makalenin teorilerini test etmek için 31 dil modeli değerlendirildi – burada listelemek için çok fazla – ancak aşağıdaki resimde gösterildiği gibi:

Yeni makale için çeşitli denemelerin farklı kısımlarında test edilen Büyük Dil Modelleri (LLM'ler).

Yeni makale için çeşitli denemelerin farklı kısımlarında test edilen Büyük Dil Modelleri (LLM’ler).

Modeller, beş benchmark koleksiyonuna karşı değerlendirildi: GSM8K için matematiksel akıl yürütme; BoolQ için okuma anlama; CommonsenseQA için ortak akıl yürütme; ARC-Easy için bilim soruları; ve MMLU-STEM için bilimsel bilgi.

Cevaplar, açgözlü decoding kullanarak oluşturuldu ve ardından görevle ilgili kurallarla çıkarıldı, doğruluk gerçek değer karşılaştırmasıyla ölçüldü.

Modeller, boyutlarına göre ayrıldı, 10 milyar parametreden küçük veya eşit olanlar “küçük” olarak, 70 milyar parametreden büyük olanlar “büyük” olarak kabul edildi, performans açıklarına dayalı olarak.

Ters ölçekleme, her bir problemdeki küçük ve büyük modellerin performansı karşılaştırarak量landı, küçük modellerin daha iyi performans gösterdiği durumlar işaretlendi; istatistiksel etki büyüklüğü daha sonra bu açıkların tutarlı ve anlamlı farklılıklar olduğunu, gürültü olmadığını doğrulamak için kullanıldı.

Gerçeği Ortadan Kaldırma

Modellerin sadece eğitim verilerini hatırladığını ihtimalini dışlamak için, üç ayrı kontrol yapıldı, cevapların ne kadar çeşitli olduğu, uzunluklarının ne kadar değiştiği ve hataların nasıl yapıldığı incelendi. Eğer modeller ezberlenmiş kalıplara güveniyorsa, cevaplar tekrarlanmalı veya sabit şablonlara uymalıydı; bunun yerine cevaplar genellikle benzersizdi, bir cevaptan diğerine önemli ölçüde değişen uzunluklar vardı.

Hatalar da doğrudan incelendi, çoğu başarısızlık uzun, yanlış açıklamalar şeklinde gerçekleşti, kısa, kaçamak cevaplar değil – bu, modellerin gerçek akıl yürütme ürettiğini, depolanan cevapları almadığını gösteriyor.

Veri ve Testler

Bireysel sorular için değil, genel puanlar için test yapıldığında, benchmark görevlerinin büyük bir kısmı bilgilendirici değildi, çünkü %27,1’i hiçbir şekilde modelleri ayırt edemedi, çünkü her sistem başarılı oldu veya her sistem başarısız oldu, bu da gerçek performans hakkında hiçbir sinyal vermedi:

Beş benchmark boyunca problem seviyesi ayrımı, modelleri ayırt edemeyen önemli bir görev payının yanı sıra, küçük bir ancak tutarlı bir bölümün ters ölçekleme gösterdiğini, daha küçük modellerin daha büyük olanlardan daha iyi performans gösterdiğini ortaya koydu. 1.485 problemdeki genel dağılım, %7,7'sinin ters ölçekleme sergilediğini gösteriyor.

Beş benchmark boyunca problem seviyesi ayrımı, modelleri ayırt edemeyen önemli bir görev payının yanı sıra, küçük bir ancak tutarlı bir bölümün ters ölçekleme gösterdiğini, daha küçük modellerin daha büyük olanlardan daha iyi performans gösterdiğini ortaya koydu. 1.485 problemdeki genel dağılım, %7,7’sinin ters ölçekleme sergilediğini gösteriyor. Kaynak

Modelleri ayıran soruların çoğu beklendiği gibi davrandı, daha büyük sistemlerin daha iyi performans gösterdiği, ancak küçük bir grup ters bir model sergiledi, küçük modellerin öne çıktığı. Tüm problemler boyunca, ters ölçekleme %7,7’de göründü, bu etki bu bağlamda marjinal olmayan bir şey olduğunu gösteriyor.

Ters Ölçekleme Yüzeyde

Beş benchmark boyunca, 115 problem bulundu, burada küçük modeller daha büyük olanlardan daha iyi performans gösterdi, tüm 1.485 görevin %7,7’sini oluşturuyor, bu da ters ölçeklemenin bu bağlamda nadir veya marjinal bir olay olmadığını gösteriyor.

Aslında, bu etki her veri setinde ortaya çıktı: BoolQ’da en güçlü, CommonsenseQA, ARC-Easy, GSM8K ve MMLU-STEM’de daha zayıf, bu da yaygın ancak görevlere göre değişen bir şey olduğunu gösteriyor:

Ters ölçekleme, MMLU-STEM'de %3,9'dan BoolQ'de %11,3'e kadar tüm benchmarklarda ortaya çıktı, toplam 115 problemle, küçük modellerin ortalama %28,4 puan daha iyi performans gösterdiği bir performans açığıyla.

Ters ölçekleme, MMLU-STEM’de %3,9’dan BoolQ’de %11,3’e kadar tüm benchmarklarda ortaya çıktı, toplam 115 problemle, küçük modellerin ortalama %28,4 puan daha iyi performans gösterdiği bir performans açığıyla.

Açığın büyüklüğü önemliydi, küçük modellerin ortalama %28,4 puan daha iyi performans gösterdiği ve her durumda aynı avantaj yönünü gösteren, performansında tutarlı bir düşüşe işaret etti, değil de zaman zaman veya ad hoc hatalara.

Aynı model aynı kaldı, farklı model aileleri arasında, Llama, Qwen, Gemma ve Mistral dahil, daha büyük sürümler küçük olanlardan daha kötü performans gösterdi, bu görevlerde doğruluk genellikle model büyüklüğü arttıkça düşüyordu.

Açıkça, küçük ve büyük modeller arasındaki açıklık, şansa atfedilemeyecek kadar büyüktü; ve aynı model aynı kaldı, farklı benchmarklar, görevler ve model aileleri arasında, ters ölçekleme tutarlı bir etki olarak ortaya çıktı, değil de rastgele bir şey.

Her model ailesi içinde, daha büyük sürümler bu görevlerde küçük olanlardan daha kötü performans gösterdi, bu da düşüşün kendisinin ölçekle ilgili olabileceğini, tasarım farklılıklarıyla değil, gösteriyor.

Sonuçlar ayrıca her görev için bir sınır olduğunu gösteriyor, burada model büyüklüğünün artması performansını bozar, bu da daha büyük modellerin her zaman daha iyi sonuçlar üretmeyeceğini gösteriyor.

Aşırı Düşünmeyi İnceleme

Daha büyük modellerin belirli alanlarda bazen daha kötü performans gösterdiğinin kurulmasının ardından, analiz, neden böyle olduğunu araştırdı, problemi yetenek eksikliği değil, fazla açıklama olarak önerdi, yani daha uzun cevaplar doğru akıl yürütmenin gizlenmesine başlıyor.

Veriler boyunca, daha uzun cevaplar, bu zor görevlerde daha düşük doğrulukla bağlantılıydı, büyük ve küçük modeller yaklaşık olarak aynı sayıda akıl yürütme adımları üretmesine rağmen, sorun akıl yürütmenin miktarı değil, nasıl ifade edildiği olduğunu gösteriyor:

Kısa cevaplar, büyük model performansı ve küçük modellerle aralarındaki açıklığı azalttı, açıklığı %44,2 puanından %14,8'e düşürdü (ve bazı durumlarda tamamen tersine çevirdi), doğrudan cevap formatları açıklığı daha da daralttı. En güçlü kazançlar, büyük modellerin sıralamalarını lehlerine çevirdiği ve cevap uzunluğu kontrollerinin müdahalenin çalıştığını, çıktıların yaklaşık 197 token'dan 80'in altına düştüğünü, açıklığın azalmasının doğruluğu artırdığını gösteren GSM8K ve MMLU-STEM'de görüldü.

Kısa cevaplar, büyük model performansı ve küçük modellerle aralarındaki açıklığı azalttı, açıklığı %44,2 puanından %14,8’e düşürdü (ve bazı durumlarda tamamen tersine çevirdi), doğrudan cevap formatları açıklığı daha da daralttı. En güçlü kazançlar, büyük modellerin sıralamalarını lehlerine çevirdiği ve cevap uzunluğu kontrollerinin müdahalenin çalıştığını, çıktıların yaklaşık 197 token’dan 80’in altına düştüğünü, açıklığın azalmasının doğruluğu artırdığını gösteren GSM8K ve MMLU-STEM’de görüldü.

Cevaplar zorla kısaltıldığında, büyük modeller önemli ölçüde iyileşti, önemli bir performans açığını azalttı ve bazı durumlarda neredeyse ortadan kaldırdı. Buna karşılık, küçük modeller çok az değişti, açıklığın aktif olarak daha büyük sistemleri zarar verdiğini gösteriyor.

Etki görevlere göre değişiyordu, bazı benchmarkların kısa cevaplar için güçlü bir şekilde yararlandığı ve diğerlerinin bir miktar açıklama gerektirdiği görülüyordu; ancak bazı durumlarda, küçük ve büyük modeller arasındaki sıralama, açıklık kısıtlandığında tamamen tersine döndü, büyük modellerin gizli bir yeteneğe sahip olduğunu, ancak aşırı açıklık tarafından maskelendiğini gösteriyor.

Daha fazla analiz, büyük modellerin genel olarak daha uzun çıktılar üretme eğiliminde olduğunu, ancak slightly daha az açık akıl yürütme adımları kullandığını gösterdi, daha dağınık ve menos yapılandırılmış bir akıl yürütme stilini gösteriyor.

Buna karşılık, küçük modeller daha kısa, daha doğrudan cevaplar verdi, aklın nasıl ifade edildiği, değil de akıl yürütmenin kendisi, performansındaki düşüşü yönlendirdiğini gösteriyor.

Yazarlar, genel olarak, kısalık kısıtlamalarının doğruluk faydaları getirdiğini ve bu özelliğin dil modellerinde temel bir özellik olabileceğini düşünüyor, değil de kullanıcı tarafından uygulanan tekrarlanan bir kısıtlama; ve şöyle diyorlar:

‘[Kısalık] kısıtlamaları büyük modelleri dramatik bir şekilde etkilerken, küçük modelleri neredeyse hiç etkilemez. ‘

‘Eğer açıklık tesadüfi olsaydı, her iki boyut kategorisi boyunca uniform doğruluk değişiklikleri beklenirdi. Farklı tepki, aşırı düşünmenin bir ölçek spesifik başarısızlık modu olduğunu, görev zorluğu etkisinden değil, doğruluyor.’

SONUÇ

Araştırmacılar tarafından test edilen açık kaynaklı sürümlerin ötesinde, açıklık problemi, anekdot olarak, ChatGPT dışındaki birçok büyük modelde de ortaya çıkıyor, Claude, Gemini ve Grok dahil.

İster bu açıklık sorununu görmezden gelsinler, ister kullanıcıları daha yüksek ve daha pahalı bir abonelik tierine yönlendirmeye teşvik etsinler, bu açıklığın getirdiği doğruluk düşüşünü kabul etmeleri mantıklı görünmüyor.

Hangi empirik yöntemin bu açıklık eğiliminin nereden geldiğini kesin olarak belirleyebileceğini görmek ilginç olurdu. Herhangi bir sohbet botunun gerçekten sohbet etmesi yerine blog gibi uzun, çok adımlı cevaplar vermesini engellemeye çalışan herkes, modelin eğitim verilerinin tümleşik kullanıcı kılavuzlarıyla ve kabul edilen çözümlerle nặng bir şekilde işlendiğini fark etmiştir.

Bu nedenle, adım adım sohbetlere özel olarak eğitilmiş bir modelin gerçekten bu açıklık eğiliminden uzaklaşabileceğini görmek çok ilginç olurdu. Ancak, modelin karara varma sürecine verdiği ağırlığın, doğrudan eğitim verilerine dayalı olarak eğitildiği şekilde,preceding materyale de doğrudan eğitim vererek eğitilmesi için bazı kısıtlamalar veya filtreler konulmasının gerekli olacağı muhtemeldir – esasen, dönüşümlü sohbetlerde açık akıl yürütme.

İronik olarak, bu tür uygun verilerin nadir olması muhtemel görünüyor, bu nedenle bu yaklaşımın tek yolu sentetik veri olabilir, burada bileşik nihai sonuçlar sohbet yoluyla parçalanır – Google NotebookLM’nin plain text girişinden AI podcast’lerini yorumlayabildiği şekilde.

 

* Yazarların inline alıntılarını hyperlinklere dönüştürmemin çevirisi.

Ama şaka yapmayalım, AI sağlama maliyetleri ile abonelik ücretleri arasındaki açık şu anda bu sorunu çözmek yerine kullanıcı tabanı itibarını zedelemeye yol açacak kadar büyüktür.

İlk olarak 5 Nisan 2026 Pazar günü yayımlandı

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'nin Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: [email protected]