Anderson’un Açısı
Ses, AI İle İletişim Kurmak İçin Şu An En Kötü Yöntem

Yeni bir araştırmaya göre, bilim kurgunun en popüler şekilde betimlediği AI ile etkileşim yöntemi, aslında kötü yazılmış.promt’lardan bile daha kötü sonuçlar üretebiliyor.
HAL’den Deep Thought’a, C3P0’dan Wall-E’ye, insan-AI ilişkilerinin idealize edilmiş şekli her zaman sese dayalı kontrol etrafında dönüyor; ve bu, gerçek dünyada, Siri ve Alexa gibi erken asistan sistemlerinden, dil tabanlı sorgulama ve sohbet için güncel LLM’lere kadar yansımıştır.
Bu fikir, daha az özgürleşmiş dönemlerde ortaya çıktı; burada, yazarlar ve gazeteciler dışında, yazma eylemi ‘yarı-uzman işçi’ olarak görülüyor ve neredeyse исключ olarak kadınlar tarafından gerçekleştiriliyordu – ve kadınlar kendileri genellikle içerikleri oluşturmuyorlardı.
Güç ve ajans, toplantı ve zirvelerle temsil ediliyordu. Bu nedenle, karmaşık dil zeka anlamına geliyorsa, konuşulan sözün AI’nin doğal ortamı olacağı açıktı.
Bunun dışında, metin alışverişi TV ve filmlere iyi uyum sağlamıyordu; hatta cesur SF thrilerleri gibi Colossus: The Forbin Project (1970), bir bilgisayar tarafından sesli insan komutlarına yazılı metin şeklinde cevap verildiğini gösteren, kısa sürede tamamen sesli yanıtlara geçti:

Colossus: The Forbin Project (1970) sahnesi, metin tabanlı dilin sınırlarını kısa sürede aşan ve açıldıktan sonra kısa sürede sesli ve despotik hale gelen devasa bir süper bilgisayar. Kaynak: Universal Pictures
Tipi veya Konuş?
Dünya’nın önde gelen AI modellerinin kullanıcılar için yerel ses arayüzleri sunmasına rağmen, yeni bir ABD araştırması, bir AI ile konuşmanın, özellikle önemli çıktılar beklediğiniz durumlarda, istediklerinizi elde etmenin en az etkili yolu olabileceğini sonucuna vardı – özellikle kod gibi büyük çıktı biçimleri beklediğinizde.
Buna göre, konuşmak bir LLM gibi ChatGPT veya Gemini’ye, hatalı bir.prompt veya sorgu içerse bile, yazmaktan daha kötü sonuçlar üretiyor.
Bunun nedeni, ses girişinin transkript sistemleri tarafından değiştirilmesi daha olasıdır; bu, modelin bağlı olduğu bilgileri kaldırır. Bu, transkript sistemlerinin ‘erm’ ve ‘like’ gibi kekelemeleri ve yanlış başlangıçları (yani, ‘yeniden başlamak’) kaldırması, gramer ve ‘gayri resmi’ yapıların belirsizliklerini (yani, cümlelerin yeni cümlelere dönüşmesi) navigasyonunun bir sonucudur.
Araştırmacılar şöyle diyor:
‘Şimdi konuşmak, bir dil modeline girmek için birinci sınıf bir yol. Kodlama ajanları gibi Claude Code ve Codex, dikte edilen talimatları kabul ediyor. Telefon asistanları gibi Google Assistant ve Siri, sesli bir isteği bir LLM arka ucuna yönlendiriyor. Dikte ön yüzleri gibi Typeless, kullanıcıların sesli isteğini temizleyip yeniden biçimlendiren bir LLM destekli başka bir katman ekliyor.
‘Her durumda model bir transkript alır ve her durumda konuşmacı aslında gönderilen dizenin proofread edilmediğini görebilir. Transkript pipeline’ın geride bıraktığı veya yeniden yazdığı her şey, modelin cevap vermesi gereken şeydir.’
Bu, yazılan girişin üstün olduğu fikrini ortadan kaldırıyor; çünkü araştırmacılar, yazma hatalarının performansı üzerinde yalnızca modest bir etkiye sahip olduğunu, konuşulan konuşma, temizlenmiş transkriptler ve özellikle AI sıkıştırılmış transkriptlerin ise tutarlı olarak daha büyük doğruluk düşüşlerine neden olduğunu buldular.
Çalışmanın deneyleri, sıradan yazma hatalarının yalnızca modest bir etkiye sahip olduğunu, konuşulan konuşmanın ise tutarlı olarak daha büyük doğruluk düşüşlerine neden olduğunu gösterdi.
Çalışma, yeni bir çalışma olarak adlandırılıyor ve dört yazar tarafından Santa Monica Koleji ve Güney Kaliforniya Üniversitesi’nden gerçekleştirildi.
(Not: Bu özel çalışma, ‘Yöntem’ ve ‘Test Sonuçları’ arasında kolayca ayrıştırılamayacak bir şekilde iç içe geçmiştir. Bu nedenle, analizimi normalden daha ağır bir şekilde sıkıştırmak ve seçmek zorundayım.)
Yöntem
Araştırmacılar, insanların QWERTY klavyesi veya sesli transkript sistemi aracılığıyla promt’ler girdiğinde ortaya çıkan hataları simüle etmek için İnsan Girişi Değişkenlik Motoru (HIVE) adlı bir ‘bozulma takımı’ geliştirdiler:
İnsan Girişi Değişkenlik Motoru (HIVE) şeması. Kullanıcının promt’u, ses, QWERTY klavyesi veya doğrudan kopyala-yapıştır yoluyla dil modeline ulaşır, sonuncusu temiz referans olarak hizmet eder. Renk, uygulama yöntemini değil, girdi kanalını tanımlar, ses operatörlerinin few-shot LLM tarzı transferi ve deterministik kuralları birleştirirken, klavye operatörleri tamamen deterministik kurallara dayanır. Sağ panel, modelin bozulmuş girdi altında üretebileceği cevapların aralığını gösterir. Kaynak
HIVE, promt’lerin dil modeline ulaştığı üç yolu modellemektedir: ses, QWERTY klavyesi veya doğrudan kopyala-yapıştır – sonuncusu diğer tüm girişlerle karşılaştırılmak üzere değiştirilmemiş referans olarak hizmet eder. İki ek operatör, soruyu ve bağlamını yeniden sıralayarak veya çoklu seçim cevap seçeneklerini değiştirerek deneysel kontroller olarak işlev görür.
Bozulma operatörleri, deterministik kurallar veya Qwen2.5-7B kullanarak few-shot LLM tarzı transfer aracılığıyla uygulanır. Bu, her iki girdi yönteminin de kontrol edilen ve doğrudan karşılaştırılabilir koşullar altında değerlendirilmesini sağlar.
Test Koşulları ve Sonuçları
Deneyler Llama-3.1-8B; Qwen2.5-7B; Qwen3-8B; Mistral-7B-v0.3; ve Phi-4 üzerinde, beş tohum kullanarak gerçekleştirildi. Kullanılan altı benchmark GSM8K; GSM-Sembolik; GSM1k; HumanEval; MMLU-Pro STEM; ve TruthfulQA MC1 idi.
Test kümesi, her benchmark için 200 öğe ve HumanEval seti için 164 öğe içeriyordu. Körlü decoding (her defasında en olası sonraki token’ı seçme) kullanıldı, böylece her bozulmuş promt, aynı model çalıştırmasında temiz karşıtı ile karşılaştırılabilir, 550.000 puanlı cevap üretiliyordu.
Modelin eğitim verisi görmüş olabileceği test kümesi kirlenmesi oluşmaması için önlemler alındı:
Çalışmada kullanılan tam bozulma takımı, temiz promt’lara karşı ses transkript değişiklikleri, QWERTY klavye hataları ve kontrol testleri boyunca doğruluğun nasıl değiştiğini gösterir. İlk satır, temiz referans doğruluğunu verirken, sonraki satırlar, puan puan değişikliklerini gösterir. Kırmızı, her bloktaki ve sütundaki en zararlı operatörü gösterir, mavi en az zararlı olanı gösterir.
Çalışmanın en açık sonucu, ses girişinin ana test koşullarında klavye girişinden daha zararlı olduğudur; konuşma tabanlı değişikliklerin, model doğruluğunu yaklaşık üç kat daha fazla azalttığı görüldü.
Bu önemlidir, çünkü sesin zayıf sonuçları, esas olarak açık konuşma ‘çöp’ünden kaynaklanmamaktadır; ‘um’ ve ‘like’ gibi doldurucuların önemli olduğu, ancak konuşma transkriptlerinden doldurucuları kaldırmanın performansı geri yüklemeyeceği görüldü.
Kendini Koruma
Daha büyük sorun, konuşulan promt’lerin modeli ulaşmadan önce yeniden yapılandırılması idi.
Çalışmanın temel bir sorusu, modelin kullanıcıların niyetini yeniden inşa etmek için yeterli orijinal promt’ı alıp almadığıydı.
Yazma hataları genellikle kelimenin ‘yüzeyini’ hasarlandırır, ancak kelimenin tamamını kaldırmaz, böylece model surrounding bağlamdan neyin kastedildiğini çıkarabilir.
Bu, klavye hatalarının genellikle daha az zararlı olmasının nedenidir; araştırmacılar, transpoze edilen harflerin, çoğaltılan harflerin, kaçırılan boşlukların ve yakın anahtar hatalarının genellikle orijinal kelimeyi geri kazanılabilir şekilde bıraktığını, ancak konuşma temizleme daha sık bilgiyi kaldırma veya yeniden organize etme eğiliminde olduğunu buldular.
Çeviride Kaybolmak
Kullanıcının referansının, LLM’ye giden yolculuk boyunca nasıl ‘kaybolabileceği’ hakkında bir örnek, çalışmada yer alan ve ‘o çocuklarına eşit miktarda [kitap] verdi’ ifadesinin, para anlamına gelen ‘miktar’ kelimesinin orijinal referansından koparıldığı ve yanlış olarak para ile ilişkilendirildiği durumudur:
Orijinal sorunun ne kadarının her girdi değişikliği sonrasında hayatta kaldığı. Büyük noktalar, bireysel bozulma türlerini gösterirken, küçük noktalar aynı klavye hatalarının daha güçlü sürümlerini gösterir.
Bu etki, modelin cevapları promt’tan oluşturmak zorunda kaldığında, özellikle aritmetik ve kod oluşturma görevlerinde daha belirgindi; çünkü bu görevler, talebin tam ilişkilerini koruma gerektiriyordu.
Araştırmacılar şöyle diyor:
‘Görüyoruz ki konuşmak pahalı bir kanaldır, zararın maliyeti nedir, sorunun orijinal tokenleştirilmesinin ne kadarını yok ettiğini ve ne test kümesi kirlenmesi ne de hafif uyarlanma bu zararı telafi etmediğini veya onarmadığını görüyoruz.
‘Birkaç sonuç takip ediyor. Yazarsanız, bir akıl yürütme modeli hatalarınızı emer. Söylediğinizde, söylediğiniz şey modelin çalıştığı şeydir.
‘Ve eğer dikte araçları oluşturursanız, kullanıcıların söylediklerini yeniden biçimlendirmeyin veya yeniden yapılandırmayın: yalnızca minimum düzeyde kekelemeleri çıkarın ve homofonları yalnız bırakın.
‘Sonuncusu en çok önemlidir, çünkü dikte ön yüzleri, modeli ulaşmak için varsayılan bir yol haline geliyor ve yeniden yazma katmanları, ölçtüğümüz en büyük zarardır ve aynı zamanda değiştirilmesi en ucuz şeydir.’
Sonuç
Herhangi bir röportajı elle transkript etmek zorunda kalmış (AI öncesi dönemde gazetecilikte yaygın ve yalnız bir görev) herkes, konuşurken otomatik olarak kekelemeleri ve anlamsızlıkları göz ardı ettiğimizi ve anlamı hesapladığımızı bilir; bu, faydalı bir transkriptin, kelimenin tam ve doğru bir kopyasından daha fazla, konuşmacının niyetini temsil etmesi anlamına gelir.
AI ile sesli iletişim, metin eşdeğerlerinden aynı anlama ulaşmakta benzer şekilde mücadele ediyor.
Gelecek çerçevelerin, bu çalışmada belirtilen uçurumlardan yararlanmak için daha fazla çalışma ve (umuyoruz) kalabalık veri kümelerinden yararlanacağı makuldür. O zamana kadar, yeni çalışma, AI ile sesli iletişim’nin, tüketici düzeyindeki ‘asistan’ sistemlerinde karakterize edilen kısa komutlara daha uygun olabileceğini gösteriyor.
İlk olarak 12 Ağustos 2026 Çarşamba günü yayınlandı.












