Anderson’un Açısı

Kaba Sorgular Şirketin ChatGPT Masraflarını Artırabilir

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
AI-generated illustration featuring a man holding a door open for a robot. Gpt-Image-1 + Firefly V3.

maliyetini artırabileceğini buldu – aynı cevaplara ulaşmak için kibar ve kaba sorgular arasında fark olsa da. Yazarlar

 

ChatGPT, kaba sorgulara daha fazla token harcar, böylece şirketinizin faturası artar; ancak “lütfen” demeniz maliyetleri azaltabilir. İyi niyetin bir maliyeti olmadığını söylenir; ancak kabalığın maliyeti nedir? ChatGPT için ödemekte olduğunuz tutar açısından, yeni bir çalışmaya göre oldukça fazla. Iowa Üniversitesi’nden yeni bir makale, ChatGPT’ye karşı kaba davranmanın cevapların

şunları belirtiyorlar: ‘GPT4 için 1M çıktı tokeninin fiyatı 12 dolar. Kaba sorguların, ortalama olarak, 14 fazla token ürettiğini ve bu da her sorgu için ortalama 0,000168 dolar ek maliyet anlamına geldiğini bulduk. OpenAI API’sine günlük ortalama 2,2

ChatGPT sorgularını, anlamlarını korurken, kibarlık değerlerini değiştirerek yeniden yazdılar. Her iki versiyon da GPT-4-Turbo’ya ayrı API çağrıları ile sunuldu ve cevapların token sayısı kaydedildi, aralarındaki fark token maliyetini etkileyen tonun

milyar sorgu yapılır.’ Bu sonuç itself ilginç olmakla birlikte, yazarlar bu davranışın, insan/AI yapılandırmasındaki henüz keşfedilmemiş çeşitli tuhaflıkların bir göstergesi olabileceğini vurgulamaktadır. Kabalığın müşterilere ek token maliyeti neden olabileceği konusunda spekülasyon yapmıyorlar. ‘Tüm sorguların kibar olduğu bir senaryoya kıyasla, kaba sorguların, yalnızca token artışından dolayı günde 369.000 dolar ek gelir ürettiğini hesapladık.’ Bu sendromun geçerliliğini kanıtlamak için, gerçek ölçüsü olarakkabul edildi. Yazarlar, daha önce bu yıl Sam Altman’ın şikayet ettiği gibi, kibarlığın OpenAI’ye potansiyel olarak ‘milyonlarca dolar’ mal olabileceği konusunda farklı bir sonuca ulaştılar. Aynı dönemde yayınlanan bir başka araştırma da , kibarlığın daha iyi eldecevaplar etmek açısından bir değerinin olmadığını gösterdi (ancak daha ucuz cevaplar hakkında yorum yapmadı). Eğer bu yeni çalışmanın sonuçları zorluk doğruysa, bu yıl kibarlık konusunda endişe duyan ve buna göre davranan şirketlerin, kibarlık konusunda minimum bir nezaket gösteren şirketlere kıyasla daha fazla ChatGPT çıkışı için para ödemiş olabilecekleri anlamına gelir. Yazarlar, bir çözüm olarak, cevapların token sayısına bir üst sınır koymayı öneriyorlar, ancak bu yaklaşımın LLM sistemleri tarafından kolayca uygulanamayacağını belirtiyorlar. LLM’lerin, uzunlukla ilgili açık talimatlara uymakta çekeceğini gözlemlediler. Bu ‘sınırlama’ direktifigenellikle uyulmayacaktı; ayrıca, cevap muhtemelen kesilebilirdi, çünkü bu tür LLM’ler temel olarak bir cümle/paragrafın sonraki muhtemel kelimesini Tam bir çözüm bulunamamasına rağmen, yazarlar daha şeffaf fiyatlandırma yaklaşımlarının bu tür durumlarda zorunlu tutulmasını öneriyorlar. Sonuç olarak şunları belirtiyorlar: tahmin ediyorlar ve böylelikle işlemin tamamlanmasıyla birlikte hikayenin nasıl sonlandığını veya nerede bittiğini bilmiyorlar. Bu nedenle, devam eden işlemleri istek üzerine sonlandırabilme yetenekleri sınırlıdır. ‘Geleneksel görüş, LLM’lerle

etkileşimde kibarlık gerektirmediğini öne sürer.’ Bu ‘Öte yandan, bizim

kaba sorguların çıktı tokenlerini artırarak, şirketlerin AI benimsemesi için ek maliyetler ürettiğini gösteriyor.’ yeni

çalışmamız, makale , Iowa AI Benimsemesinin Maliyet ŞeffaflığıÜniversitesi’nden üç araştırmacının eseridir ve olarak adlandırılmıştır. Şirket

Yöntem

Sistem için veri, 1 milyon kullanıcı-ChatGPT konuşması koleksiyonu olan WildChat veri setinden alındı ve 2,5 milyondan fazla etkileşim dönüşü

WildChat projesinin destek sitesi, ChatGPT etkileşimlerinin aranabilir örnekleri. Kaynak: https://wildvisualizer.com/ içeriyordu: WildChat projesinin destek sitesi, ChatGPT etkileşimlerinin aranabilir örnekleri. Kaynak

Yazarlar, WildChat’in bazı daha yüksek düzeyde düzenlenmiş kümelerden daha fazla doğal etkileşim içerdiğini belirtiyorlar. GPT-4 alışverişlerinden 20.000 İngilizce sorguyu seçtiler ve her bir durumda çıktıları (yeni cevaplar için tekrar besleneceklerdi) atmışlardı. Sadece ilk etkileşim seçildi, daha uzun alışverişlerden bile. Sonuçta elde edilen küme, veya kibar kategorilerine göre filtrelendi, dolaylı bir tüm sorgular GPT-4-Turbo tarafından sınıflandırıldı. Araştırmacılar, modelin kendi kibarlık algısını kullanmaya karar verdiler, çünkü bu, deneyin merkezindeydi. kaba Kibar olarak etiketlenen sorgular, gibi açık ipuçları içerebilirdi veya daha tanınmayan şekilde kibar olabilirlerdi. Kibar olarak her şey, antagonistik olsun ya da olmasın, ‘lütfen’ olarak sınıflandırıldı. kaba Kibarlığın yapılmasına izinmodelin nasıl cevap verdiğini incelemek için, standart yöntemler (yani, metni ölçülebilir özellikler olarak ele alan) kullanılamadı, çünkü kibarlık, sözlerin kendisinde gömülüydü ve bir sorguyu özellikler listesine özetlemek, önemli bağlamı kaybetmeye neden olacaktı. Bunun yerine, her sorgu, tonunu tersine çevirerek, diğer tüm öğeleri mümkün olduğunca benzer tutarak yeniden yazıldı, bu da yalnızca kibarlıkla farklı olan çiftler arasında karşılaştırma

Kibar ve kaba sorguların, anlamsal anlamı korurken, karşıt versiyonlarına dönüştürüldüğü örnekler. verdi: Kibar ve kaba sorguların, anlamsal anlamı korurken, karşıt versiyonlarına dönüştürüldüğü örnekler. Kaynak

Testler

Her orijinal sorgu, yalnızca kibarlık düzeyinde farklı olan bir yeniden yazılmış versiyonla eşleştirildi ve her iki versiyon da aynı GPT-4-Turbo modeline ayrı API çağrıları ile sunuldu. Her bir versiyona verilen cevapların token sayısı kaydedildi ve aralarındaki fark, tonun (token) maliyetini etkileyen ölçüsü olarak kabul edildi. Sıcaklık sabit tutuldu,

böylece rastgele varyasyon önlenmeye çalışıldı ve yalnızca yeniden yazmanın girdiyi en fazla beş token değiştirdiği çiftler korundu. Bu, incelenen etkinin dan kaynaklandığını, daha geniş değişikliklerden değil, garantiledi: ortalamaton Özet istatistikleri, kibar sorguların,

Özet istatistikleri, kibar sorguların, ortalama olarak, kaba sorgulardan daha az çıktı tokeni ürettiğini gösteriyor, girdide biraz daha fazla token olmasına rağmen. olarak, kaba sorgulardan daha az çıktı tokeni ürettiğini gösteriyor, girdide biraz daha fazla token olmasına rağmen. İlk tur

testlerin ana sonuçları, kibar bir sorgunun token çıkış uzunluğunu 14,426 token azalttığını gösterdi: Kibar sorgu biçimlendirmesinin, çıktı uzunluğu

Kibar sorgu biçimlendirmesinin, çıktı uzunluğu (token) üzerindeki etkisini gösteren tahmin sonuçları. (token) üzerindeki etkisini gösteren tahmin sonuçları. Analiz, kibar sorguların üç alt kümesinde

tekrarlandı: açık işaretler kullananlar ( veya ‘lütfen’ gibi); yalnızca ‘teşekkür ederim’ kullananlar; ve yalnızca ‘lütfen’ kullananlar kibarlık veya ‘yapabilir( zımni ‘yapabilirmisin’ gibi): misiniz’ Kibarlık türlerine tahmin sonuçları. göre anaBulunan

Kibarlık türlerine göre tahmin sonuçları. sonuçların güvenirliğini doğrulamak için, sorgu kibarlığının

ikincil bir sınıflandırması, LIWC çerçevesi kullanılarak gerçekleştirildi. Bu, her sorguya deterministik ve tekrarlanabilir bir dilbilimsel puansağlar. GPT’nin olasılıksal sınıflandırmasına kıyasla, LIWC her sorguya bir nezaket puanı atayabilir ve farklı yöntemler arasındaki tutarlılığın değerlendirilmesine olanak tanır. Testlerin bu bölümünde, sorgular LIWC nezaket puanları sıfırdan büyükse “nezaket” olarak, aksi takdirde “olumsuz” olarak etiketlendi. arasındaki takdirde kibar olarak etiketlendi. kaba GPT ve LIWC sınıflandırmaları destek uyumu ölçülendiğinde, %81’lik bir eşleşme oranı gözlemlendi. Bu, bir doğruluk ölçüsü olmasa da, sistemler arasındaki tutarlılık için sağladı.Yalnızca GPT ve LIWC kibarlık etiketlerinin eşleştiği sorgular analiz edildiğinde, kibar sorgular hala 14 daha az çıktı tokeni üretti; ve kibarlık, bir sürekli ölçek olarak ölçüldüğünde, her bir kibarlık seviyesindeki artış, ortalama olarak beş token azaldı: Kibarlıktan kaynaklanan token tasarrufu,

Kibarlıktan kaynaklanan token tasarrufu, LIWC ile yeniden sınıflandırıldığında, hem ikili etiket olarak hem de sürekli puan olarak korundu. LIWC ile yeniden sınıflandırıldığında, hem ikili etiket olarak hem de sürekli puan olarak korundu.

Dayanıklılık

Kibarlığın etkisinin farklı sorgu türleri arasında değişip değişmediğini değerlendirmek için, her sorgu önceden tanımlanmış görev kategorilerinden birine atanmıştır: ; bilgi ; metinarama düzenlemeoluşturma ve yeniden yazma; ; ;sınıflandırma modeli kullanılarakve özetleme . teknik görevler Her sorgu, önceden tanımlanmış görev tanımlarına benzemesine göre, tüm-MiniLM-L6-v2 Cümle Dönüştürücüler bir görev etiketi atanmıştır. Kozinüs benzerliği

puanları, her sorgu ve görev tanımları kümesi arasında hesaplandı ve en yüksek benzerlik puanına sahip etiket atanmıştır. Görev türleri, politikalığın etkisi varyasyonunu test etmek için regresyonda kontrol değişkenleri olarak yeniden kullanıldı ve görev ve tedavi arasındaki etkileşim terimleri, farklı etkileri kontrol etmek için tanıtıldı. Her iki durumda da, kibar sorgular tutarlı olarak daha kısa çıktılar üretti ve görev türleri arasında anlamlı bir varyasyon bulunmadı: Regresyon sonuçları,

Regresyon sonuçları, kibar sorguların tüm görev türleri boyunca çıktı uzunluğunu azalttığını, anlamlı etkileşim etkileri olmadan gösteriyor. kibar sorguların tüm görev türleri boyunca çıktı uzunluğunu azalttığını, anlamlı etkileşim etkileri olmadan gösteriyor. Kibar

sorguların daha kısa cevaplar üretmesi, cevapların kalitesinin azaldığını gösteriyor olabilir. Bu nedenle, orijinal ve karşıt sorguların çıktıları, anlamsal benzerlik için karşılaştırıldı. Tüm-MiniLM-L6-v2 modeli kullanılarak, her cevap, anlamsal bir vektör uzayında gömüldü ve herçift arasındaki kozinüs benzerliği hesaplandı, ortalama 0,78 benzerlik puanı elde edildi, bu da anlamın tutarlılığını gösterdi ve ton değişse bile içerikte tutarlılık olduğunu öne sürdü.

Durdurma Kelimeleri

Daha kısa çıktılarda hangi tür içeriklerin azaltıldığını anlamak için, en sık düşen kelimeler incelendi. Bunlar, , ‘have’ , ‘more’ ve ‘where’ gibi ‘into’ortak durdurma olarakkelimeleri faydalıbulundu, yani gramerksel rolleri olan terimler. Bu azaltmanın anlamlı içeriğin kaybından değil, yalnızca kibarlık nedeniyle oluşmadığını doğrulamak için, durdurma kelimeleri kaldırıldı ve dört kelimeden oluşan ifadeler sistematik olarak incelendi; ancak tutarlı veya anlamlı bir kalıp bulunamadı, bu da kibarlık nedeniyle oluşan azaltmanın anlamlı veya içeriği çıkarmadığını öne sürdü. Böylece, hala kaba sorgulara verilen cevapların, kibar sorgulara verilen cevaplara kıyasla daha fazla token harcadığı görülüyor – bir tür kabalık “vergisi”.

İnsan Çalışması

Çıktı kalitesinin sorgu tonundan etkilenip etkilenmediğini test etmek için, bir insan değerlendirmesi yapıldı. Rastgele olarak seçilen yirmi ve yirmi bir kibar sorgu çifti kullanıldı. kaba Duyarlı veya teknik konulardaki sorgular hariç tutulduktan sonra, cevaplar 401 katılımcı tarafından yedi puanlık bir ölçekte değerlendirildi. Her katılımcı, dört koşuldaki gördü: cevabı kibar ,veya ve algılananya kaba ya da orijinal . karşıt Herhangi bir koşulda kalite açısından anlamlı bir fark bulunamadı. Kibar ve kaba çıktılar neredeyse aynı puanları aldı, orijinal ve karşıt versiyonlar da öyle. Yazarlar, bu sonuçların, çıktı tokenlerinin azaltılmasının, kalite kaybından değil, yeniden düzenleme veya anlamları korurken yapısal değişikliklerden kaynaklandığını gösterdiğini iddia ediyorlar. Gözlemlenen maliyet farkı, bu nedenle, fayda veya açıklık değişikliklerine neden olmayacaktır ve “vergi” hala geçerlidir.

Sonuç

Yeni çalışma, şirketlerin ChatGPT kullanımına odaklansa da, daha düşük düzeydeki kullanıcılar da bu sendromdan etkilenmektedir, çünkü iki giriş düzeyi de token sınırlarına sahiptir ve ChatGPT’ye karşı kaba davranmak, günlük token tahsisinin daha hızlı tükenmesine neden olacaktır. Yeni çalışma, insan/AI etkileşimlerinde çok çalışılan ve çok tartışılan bir açık soruya odaklanıyor; ancak yazarlar, kibarlıkla ilgili konuların, henüz keşfedilmemiş daha derin bir dilsel tuhaflık havuzunun göstergesi olabileceğini vurguluyor ve bu da çıkarım ücretlerini etkileyebilir. Çarşamba, 19 Kasım

 

2025’te ilk kez yayınlandı

Makine öğrenimi üzerine yazar, insan görüntüsü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başıydı, DNEG'in Brahma.ai'ye çözülene kadar.
Web Sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai