Anderson’un Açısı
AI Sohbet Modelleri Sonsuz gevezelik yoluyla Masrafları Artırabilir

Popüler AI sohbet modelleri gizlice büyük miktarda ödenen tokenları anlamsız sözler üzerinde harcarlar. Etkilenen modeller aslında bunu yaptıklarının farkındalar, ancak kendilerini durduramıyorlar.
Büyük Mantık Modelleri (LRM) gibi ChatGPT-5 ve Google Gemini, mantık için daha fazla ücret tahsil eder – bir problemi adım adım çözme, bu da sadece hızlı bir şekilde sonraki kelimeyi tahmin etmekten çok daha fazla hesaplama gücünü kullanır. Simüle edilen mantık süreci daha uzun sürer ve daha pahalıya mal olur; dolayısıyla, kullanıcılar bu “ekstra düşünme süresini” ödemek zorunda kalırlar.
Ancak, son zamanlarda bir state-of-the-art LLM kullandıysanız, tokenlerinizi genellikle verbiyaj ve artıklar üzerinde harcadığınızı, sorunları çözmeye odaklanmak yerine fark etmiş olabilirsiniz. Bu, aşırı sycophancy, uzun ve/veya tekrar eden cevaplar veya bir tür ‘gevezelik’ olarak ortaya çıkabilir – sanki AI durup dururken yakalanmış ve zor bir durumdan kurtulmaya çalışıyormuş gibi.
Tabii ki, LLM’lerin yenilgiyi kabul etmelerini, alternatif yollar önermelerini veya açıklama istemelerini tercih ederdik. Ancak bu tür bir AI’nin bir cevaba bilmediğini itiraf etmesi bile büyük bir zorlukdır.
Bu arada, daha düşük veya ücretsiz seviyedeki kullanıcılar, sorguları ve etkileşimleri ne kadar hedeflenmiş veya ekonomik olursa olsun, tokenlerini hızlı bir şekilde tüketebilirler, çünkü AI kendisi konuşmayı sever; ve bu durumda, konuşmak ucuz değildir.
Kelime Salatası
Yukarıda bahsedilen ‘gevezelik’ ile ilgili olarak, yeni bir akademik işbirliği, LRM’lerin neden tokenlerinizi boşa harcadığını açıklamak ve bir çözüm önermek için ortaya çıktı. Araştırmacılara göre, LRM’ler mantık yeteneklerine sahip olduğunda, ‘kelime salatası’ döngüsüne girerek tokenlerinizi boşa harcayabilirler – AI’nin kaybolduğu ve çıkamadığı bir karışıklık durumu.
Araştırmacılar, bir LRM’nin tipik çıktısının önemli bir kısmının tekrarlardan ve tekrar edenlerden oluştuğunu ve modelin kendisi güçlükte olduğunu anladığını keşfettiler, ancak pahalı döngüyü durduramadı.
Makalede şöyle deniyor:
‘Çıktının önemli bir kısmı anlamsız tekrarları içerir – buna “kelime salatası” diyoruz – ve bu, değer katmadan decoding bütçesini tüketir. İlginç bir şekilde, LRM’lerin bu döngülere takıldıklarında kendilerinin farkında olduklarını gözlemledik: her mantık parçasının ardından gelen tokenlerin gizli durumları, kelime salatası davranışını gerçek zamanlı olarak tespit etmemize olanak tanıyan kalıplar gösterir.’
‘Bir kez tespit edildikten sonra, basit bir kesme ve ardından bir yeniden üretim ipucu, önemli uzunluk tasarrufu sağlar ve minimum kalite kaybı ile sonuçlanır.’
Yeni çalışmada önerilen çözüm, bir LRM’nin hatalı mantık sürecini gerçek zamanlı olarak durdurabilecek bir müdahaledir. Bu, WordSaladChopper adlı bir çerçeve olarak adlandırıldı ve GitHub’da halka açık olarak yayınlandı.
İlk çalışma, DeepSeek varyantlarına odaklansa da, makalede bu istenmeyen davranışın benzer mimariye sahip daha geniş bir model yelpazesine uygulanabileceği belirtiliyor.
Makalede ayrıca, önceki çalışmaların da benzer sorunları ele aldığını, ancak bu çalışmanın ilk kez eğitim verisi müdahalesi veya model düzenleme gerektirmeyen bir çözüm sunduğu belirtiliyor.
Önceki Düşünceler
Araştırmacılar, LRM’lerin tekrarlarını izlemek için, modellerin çıktısını çift satır boşluklarında böldüler ve her parçanın önceki parçalara benzerliğini kontrol ettiler.

İki farklı decoding sıcaklığı altında (τ = 0.0, 0.6) kelime salatası olarak işaretlenen mantık parçalarının tahmini payı. Sınıflandırıcı, bir parçayı önceki parçalara çok benzer olduğunda ‘kelime salatası’ olarak işaretler, bu da tekrarlama rather than ilerleme anlamına gelir. Sonuçlar, bu davranışın veri setleri ve model boyutları arasında yaygın olduğunu gösterir.
Eğer bir parça çok benzerse, ‘kelime salatası’ olarak işaretlenirdi.
Araştırmacılar, bir model ‘kelime salatası’ moduna girdikten sonra, dış müdahale olmadan çıkamayacağını ve pahalı döngüde kalacağını belirtiyorlar.
‘Kullanıcılar için bu, ideal olarak çok daha kısa bir düşünme bölümünün maksimuma çıkarılması ve doğru cevap yerine yanlış bir cevap alınması anlamına gelir. Kullanıcı, muhtemelen yanlış bir cevap için maksimum maliyeti öder ve en uzun uçtan uca gecikme ile karşı karşıya kalır.’

Kesme noktasından önce ve sonra ortaya çıkan kelime salatası parçalarının payı (yani, tekrarlı çıktının baskın hale geldiği an). Çoğu tekrarın bu noktadan sonra meydana geldiği görülüyor, bu da bir modelin kelime salatası döngüsüne girdikten sonra nadiren kurtulabildiğini gösteriyor.
Araştırmacılar, LRM’lerin ‘kelime salatası’ durumunun farkında olduklarını keşfetmelerine şaşırıyorlar. Ancak bu farkındalık, modelin muhtemel mantık durumuna girerek müdahaleye izin veriyor.
‘Bu lineer sınıflandırıcının hafifliği, gerçek zamanlı tespit için kapıları açar, böylece farklı işlemlerle kelime salatası döngülerine takılan modellere müdahale edebiliriz.’
Yöntem
Araştırmacılar, çıkarım sırasında kelime salatası varlığını tespit etmek için, her çift satır boşluğu tokeninin gizli durumuna çalıştırılan basit bir lineer sınıflandırıcı eğittiler.
Her parça, modelin tekrar döngüsüne girdikten sonra meydana geldiyse, ‘kelime salatası’ olarak işaretlenirdi.
Sınıflandırıcı, lineer bir sınıflandırıcı olarak uygulanmıştır.

WordSaladChopper kavramsal şeması. Üretim sırasında, her çift satır boşluğu tokeninin gizli durumu tekrarlı segmentleri tespit etmek için analiz edilir. İki ‘kelime salatası’ parçası sırayla işaretlendiğinde, üretim durdurulur. Sabit bir yeniden üretim ipucu eklenerek, model cevabını bitirebilir ve bütçeyi aşmaz.
Eğer bir parça önceki bir parçaya çok benzerse, ‘kelime salatası’ olarak işaretlenirdi.
Sınıflandırıcı, tamamen bağlı bir katman olarak uygulanmıştır.
Veri ve Testler
Eğitim ve çıkarım, dört NVIDIA A100 (80G VRAM) GPU’su altında, Adam optimize edici ile, 1×10-2 öğrenme oranı ile, 50 epoch için gerçekleştirildi.
Değerlendirme veri setleri, ‘Grade School Math’ 8000, yani GSM8K; MATH-500; GPQA-DIAMOND; ve AIME25 (2025) idi.
Test edilen modeller, DeepSeek-R1-Distill-Qwen-1.5B; DeepSeek-R1-Distill-Qwen-7B; ve DeepSeek-R1-Distill-Llama-8B idi, hepsi MIT lisansı altında.
Kullanılan metrikler, Doğruuluk ve AUROC idi.

Qwen-7B üzerinde kelime salatası sınıflandırıcısının dört benchmark ve iki decoding sıcaklığındaki doğruluğu ve AUROC’si. Yüksek puanlar, tekrarın gizli durumundan güvenilir bir şekilde tespit edilebileceğini doğrular.
Sonuçlar hakkında yorum yapan araştırmacılar:
‘[Yukarıdaki sonuç tablosu], sınıflandırıcının kelime salatası parçalarını tespit etmede son derece doğru olduğunu gösterir; [aşağıdaki sonuç tablosu] ise yeniden üretim ipucunun, bruteforce kesmeyle kaybettiği görev doğruluğunu geri kazandırdığını gösterir.’

τ = 0.6’da her benchmark için Qwen-7B’nin doğruluğu, orijinal, kesilmiş ve yeniden üretilmiş performansını karşılaştırır. Kazançlar mütevazı ancak tutarlıdır ve çoğu durumda önceden döngü performansını geri kazandırır.
Aşağıdaki sonuç tablosunda görüldüğü gibi, WordSaladChopper, model çıktılarının uzunluğunu %57’ye varan oranda azaltırken, doğruluğu korudu veya artırdı:

WordSaladChopper, kıskacı (τ = 0) kullanıldığında, model çıktılarının uzunluğunu bazen yarıya kadar azaltırken, doğruluğu aynı veya biraz daha iyi tutarak, farklı modeller ve görevler arasında tutarlı bir performans gösterir (AIME25, bu ayar altında öngörülebilir olarak istikrarsız sonuçlar verdiği için atlanmıştır).
En büyük kazançlar, özellikle GPQA-Diamond’da görüldü, burada neredeyse yarı metin çıkarıldı ve performans etkilenmedi.

Üretimde daha yüksek bir sıcaklık (τ = 0.6) ile, WordSaladChopper çıktıları %10-30 oranında kısaltmaya devam eder ve tüm modeller ve benchmark’lerde doğruluk istikrarlı veya biraz iyileşir (AIME25 sonuçları varyansı azaltmak için ortalamaya alınmıştır).
Doğruluk istikrarlı kaldı ve daha kısa çıktılar elde edildi. Genel olarak, sistem, modelin cevapları daha tekrarlı hale geldiğinde bile çalışmaya devam etti ve araştırmacılar, sınıflandırıcının sadece bir tokenı kontrol etmesi nedeniyle çok hızlı çalıştığını belirtiyorlar.
Araştırmacılar, gelecekteki araştırmaların, modelin müdahale sonrası küçük bir yeniden üretim bütçesine sahip olabileceğini, WordSaladChopper benzeri bir sistemin sürekli uygulanabileceğini ve modelin en iyi mevcut cevabını talep etmek için ‘düşünme sonu’ tokenının zorlanabileceğini belirtiyorlar.
Son olarak, araştırmacılar, mantık modellerinin当前 durumunun kalitesine ilişkin bir eleştiri yapıyorlar:
‘[İnanıyoruz ki] birçok verimli mantık yöntemi, kısmen mevcut mantık değerlendirme benchmark’larının iyileştirme için çok fazla alanı olduğu için etkili görünüyor.’
‘Daha kapsamlı değerlendirme setleri geliştireceğimiz zaman – ki bunu gelecekte kesinlikle yapacağız – birçok verimli mantık yönteminin başarısız olacağını veya vanilla LRM karşılaştırmasında çok farklı davranacağını bekliyoruz.’
Sonuç
Lider sistemlerin ulaştığı ölçekte, even küçük değişiklikler, altyapı, lojistik ve maliyet açısından büyük etkilere sahip olabilir. Bu nedenle, verimlilik hem sağlayıcılar hem de daha geniş araştırma topluluğu için ortak bir öncelik haline geliyor.
Eğer önerilen yeni ve hafif sistem uygulanırsa, anlamsız tokenlerin boşa harcanmasını önleyebilir – bu, müşteriye, satıcının allocation’unu savurduğu veya aldatıcı bir şekilde harcadığı izlenimini verebilir. Aslında, satıcı, anlamsız çıktı yerine faydalı çıktı sağlayarak daha iyi durumda olur, bu da hesaplama açısından aynı maliyete sahiptir.
* Burada, bu konuyu burada ayrıntılı olarak ele almayacağız, ancak bu durum yerel olarak barındırılan modellere de uzanır – bunlar kurumsal veya hobi amaçlı olabilir – ve burada kelime salatasının elektrik ve verimlilik kaybı bir faktör olabilir.
† Herhangi bir vurgulama, yazarların kendilerine aittir ve bana ait değildir. Uygulanan yerde, yazarların satır içi alıntıları, bana tarafından hyperlink’lere dönüştürülmüştür.
†† Şurada, framework’lerin ve API’lerin sorgulara ‘alt bütçe’ tahsis edebileceğini kabul etmeliyiz, böylece bir sorgu, bir günün token allocation’unu tüketmek zorunda değildir – ancak bu, yaygın bir uygulama değildir ve API yalnızca sağlayıcılar arasında yaygın olarak tartışılan bir konu değildir.
††† Ben, yazarların ‘LRM’ kısaltmasını kullanma alışkanlıklarını genellikle benimsemeye hazır değilim, çünkü bu, şu anda ana akım bir kısaltma değildir, bu nedenle bu makalede gerektiğinde diğer terminolojiyi kullanacağım.
İlk olarak 6 Kasım 2025 Perşembe günü yayınlandı.












