Anderson’un Açısı
AI Sohbet Modelleri Sonsuz gevezelik yoluyla Masrafları Artırabilir

sohbet modelleri gizlice büyük miktarda ödenen tokenları anlamsız sözler üzerinde harcarlar. Etkilenen modeller aslında bunu yaptıklarının farkındalar, ancak kendilerini durduramıyorlar.
Popüler AIBüyükMantık Modelleri ( LRM ) gibi ChatGPT-5 ve Google Gemini, mantık için daha fazla ücret tahsil eder – bir problemi adım adım çözme, buda sadece hızlı bir şekilde sonraki kelimeyi tahmin etmekten çok daha fazla hesaplama gücünü kullanır. Simüle edilen mantık süreci daha uzun sürer ve daha pahalıya mal olur; dolayısıyla, kullanıcılar bu “ekstra düşünme süresini” ödemek zorunda kalırlar. Ancak, son zamanlarda bir state-of-the-art LLM kullandıysanız, tokenlerinizi genellikle verbiyaj ve artıklar üzerinde harcadığınızı, sorunları çözmeye odaklanmak yerine fark etmiş olabilirsiniz. Bu, aşırı sycophancy , uzun ve/veya tekrar eden cevaplar veya bir tür ‘gevezelik’ olarak ortaya çıkabilir – sanki AI durup dururken yakalanmış ve zor bir durumdan kurtulmaya çalışıyormuş gibi. Tabii ki, LLM’lerin yenilgiyi kabul etmelerini, alternatif yollar önermelerini veya açıklama istemelerini tercih ederdik. Ancak bu tür bir AI’nin bir cevaba bilmediğini itiraf etmesi bile Bu arada, daha düşük veya ücretsiz seviyedeki kullanıcılar, sorguları ve etkileşimleri ne kadar hedeflenmiş veya ekonomik olursa olsun, tokenlerini hızlı bir şekilde tüketebilirler, çünkü AI kendisi konuşmayı sever; ve bu durumda, konuşmak ucuz değildir. büyük bir zorluk dır.
Kelime Salatası
Yukarıda bahsedilen ‘gevezelik’ ile ilgili olarak, yeni bir akademik işbirliği, LRM’lerin neden tokenlerinizi boşa harcadığını açıklamak ve bir çözüm önermek için ortaya çıktı. Araştırmacılara göre, LRM’ler mantık yeteneklerine sahip olduğunda, ‘kelimesalatası’ döngüsüne girerek tokenlerinizi boşa
harcayabilirler – AI’nin kaybolduğu ve çıkamadığı bir karışıklık durumu. Araştırmacılar, bir LRM’nin tipik çıktısının önemli bir kısmının tekrarlardan ve tekrar edenlerden oluştuğunu
durduramadı. ‘Çıktının önemli bir kısmı anlamsız
ve modelin kendisi Makalede şöyle deniyor: güçlükte olduğunu anladığını keşfettiler, ancak pahalı döngüyü tekrarları içerir – buna “kelime salatası” diyoruz – ve bu, değer katmadan decoding bütçesini tüketir. İlginç bir şekilde, LRM’lerin bu döngülere takıldıklarında kendilerinin farkında olduklarını gözlemledik: her gelen tokenlerin gizli mantık parçasının ardındandurumları, kelime salatası davranışınıgerçek
Yeni çalışmada önerilen çözüm, zamanlı olarak tespit etmemize olanak tanıyan kalıplar gösterir.’ bir LRM’nin hatalı mantık sürecini gerçek zamanlı olarak
durdurabilecek bir müdahaledir. Bu, ‘Birkez tespit edildikten sonra, basit bir kesme ve

eğitim verisi müdahalesi veya model gerektirmeyen bir çözüm sunduğu belirtiliyor. DeepSeek varyantlarına odaklansa da, makalede düzenleme
bu bir model yelpazesine uygulanabileceği belirtiliyor.istenmeyen davranışın benzer mimariye sahip daha geniş
Önceki Düşünceler
Araştırmacılar, LRM’lerin tekrarlarını izlemek için, modellerin çıktısını çift satır boşluklarında böldüler ve her parçanın önceki parçalara benzerliğini kontrol ettiler. İki farklı decoding sıcaklığı altında

model boyutları arasında yaygın olduğunu gösterir. Eğer bir parça çok benzerse, ‘kelime salatası’ olarak işaretlenirdi. Araştırmacılar, bir model ‘kelime salatası’ moduna girdikten sonra, dış müdahale olmadan çıkamayacağını ve pahalı döngüde kalacağını belirtiyorlar. ‘Kullanıcılar için bu, idealolarakçok
daha kısa bir düşünme bölümünün maksimuma çıkarılması ve doğru cevap yerine yanlış bir cevap alınması anlamına gelir. Kullanıcı, muhtemelen yanlış bir cevap için maksimum maliyeti öder ve en uzun uçtan uca

görülüyor, bu da bir modelin kelime salatası döngüsüne girdikten sonra nadiren kurtulabildiğini gösteriyor. Araştırmacılar, LRM’lerin ‘kelime salatası’ durumunun farkında olduklarını keşfetmelerine şaşırıyorlar. Ancak bu farkındalık, modelin muhtemel mantık durumuna girerek müdahaleye izin
veriyor. ‘Bu lineer sınıflandırıcının hafifliği, gerçek zamanlı tespit için kapıları açar, böylece farklı işlemlerle kelime salatası döngülerine takılan modellere müdahale edebiliriz.’
Yöntem
Araştırmacılar, çıkarım sırasında kelime salatası varlığını tespit etmek için, her çift satır boşluğu tokeninin gizli durumuna çalıştırılan basit bir lineer sınıflandırıcı eğittiler. Her meydanaparça, modelin tekrar döngüsüne girdikten sonra geldiyse,‘kelime salatası’ olarak işaretlenirdi.

edilir. İki ‘kelime salatası’ parçası sırayla işaretlendiğinde, üretim durdurulur. Sabit bir yeniden üretim ipucu eklenerek, model cevabını bitirebilir ve bütçeyi aşmaz. Eğer bir parça önceki bir parçaya çok benzerse, ‘kelime salatası’olarak işaretlenirdi. Sınıflandırıcı, tamamen bağlı bir katman olarak uygulanmıştır.
Veri ve Testler
Eğitim ve çıkarım, dört NVIDIA A100 (80G VRAM) GPU’su altında, Adam optimize edici ile,1×10-2 öğrenme oranı ile, 50 epoch için gerçekleştirildi. Değerlendirme veri setleri,‘Grade SchoolMath’ 8000,yani GSM8K; MATH-500 ; GPQA-DIAMOND ; ve AIME25(2025) idi. Test edilenmodeller, Kullanılan metrikler, DeepSeek-R1-Distill-Qwen-1.5B; DeepSeek-R1-Distill-Qwen-7B ; ve DeepSeek-R1-Distill-Llama-8B idi, hepsi MIT

tespit edilebileceğini doğrular. Sonuçlar hakkında yorum
yapan araştırmacılar: ‘(Yukarıdaki sonuç tablosu), sınıflandırıcının kelime salatası parçalarını tespit etmede son derece doğru olduğunu gösterir; (aşağıdaki sonuç tablosu) ise yeniden üretim ipucunun, bruteforce kesmeyle kaybettiği görev doğruluğunu

geri kazandırır. Aşağıdaki sonuç tablosunda görüldüğü gibi, WordSaladChopper, model çıktılarının uzunluğunu %57’ye varan oranda azaltırken, doğruluğu korudu veya artırdı:

sonuçlar verdiği için atlanmıştır). En büyük kazançlar, özellikle GPQA-Diamond’da görüldü, burada neredeyse yarım metin kaldırıldı ve performans etkilenmedi. Üretimde daha yüksek bir sıcaklık (τ

ortalaması alındı). Doğruluk sabit kaldı ve daha kısa çıktılar elde edildi. Genel olarak, modelin yanıtları daha yinelemeli hale geldiğinde bile sistem çalışmaya devam etti ve araştırmacılar, sınıflandırıcının yalnızca bir belirteci kontrol ettiği için çok hızlı çalıştığını belirtiyor. Araştırmacılar, gelecekteki araştırmaların, modelin müdahale sonrası küçük bir yenileme bütçesine sahip olup olamayacağını, WordSaladChopper benzeri bir sistemin sürekli olarak uygulanıp uygulanamayacağını ve modelin en iyisini talep etmek için bir ‘düşünme sonu’na sahip olup olamayacağını inceleyebileceğini öne sürüyor.Mevcut cevap. Tokenin tehlikeye atılmış olabileceğini belirtiyorlar. Son olarak, araştırmacılar mantık modellerinin durumunun kalitesine dair bir eleştiri sunuyorlar: ‘(İnanıyoruz ki) birçok verimli mantık modeliyöntemi,kısmen
mevcut mantık değerlendirme benchmark’larının iyileştirme için çok fazla alanı olduğu için etkili görünüyor.’ ‘Daha kapsamlı değerlendirme setleri
geliştireceğimiz zaman – ki bunu gelecekte kesinlikle yapacağız – birçok verimli mantık yönteminin başarısız olacağını veya vanilla LRM karşılaştırmasında çok farklı davranacağını bekliyoruz.’
Sonuç
Lider sistemlerin ulaştığı ölçekte, even küçük değişiklikler, altyapı, lojistik ve maliyet açısından büyük etkilere sahip olabilir. Bu nedenle, verimlilik hem sağlayıcılar hem de daha geniş araştırma topluluğu için ortak bir öncelik haline geliyor. Eğer önerilen yeni ve hafif sistem uygulanırsa, anlamsız tokenlerin boşa harcanmasını önleyebilir – bu, müşteriye, satıcının allocation’unu savurduğu veya aldatıcı bir şekilde harcadığı izlenimini verebilir. Aslında, satıcı, anlamsız çıktı yerine faydalı çıktı sağlayarak daha iyi durumda olur, bu da hesaplama açısından aynı maliyete sahiptir. * Burada, bu konuyu burada ayrıntılı olarak ele almayacağız, ancak bu durum yerel olarak barındırılan modellere de uzanır – bunlar kurumsal veya hobi amaçlı olabilir – ve burada kelime salatasının elektrik ve verimlilik kaybı bir faktör olabilir. † Herhangi bir vurgulama, yazarların kendilerine aittir ve bana
ait değildir. Uygulanan yerde, yazarların satır içi alıntıları, bana tarafından hyperlink’lere dönüştürülmüştür. †† Şurada, framework’lerin ve API’lerin sorgulara ‘alt bütçe’
tahsis edebileceğini kabul etmeliyiz, böylece bir sorgu, bir günün token allocation’unu tüketmek zorunda değildir – ancak bu, yaygın bir uygulama değildir ve API yalnızca sağlayıcılar arasında yaygın olarak tartışılan bir konu değildir. ††† Ben, yazarların ‘LRM’ kısaltmasını
kullanma alışkanlıklarını genellikle benimsemeye hazır değilim, çünkü bu, şu anda ana akım bir kısaltma değildir, bu nedenle bu makalede gerektiğinde diğer terminolojiyi kullanacağım. İlk olarak 6
Kasım 2025 Perşembe günü yayınlandı.












