Anderson’un Açısı
ChatGPT-5 ve Gemini 2.5’in %40’ında Haber Odası Tarzında Sorgulamalar Hallüsinasyon Yaptığı Görüldü

Yeni bir çalışma, ChatGPT-5 ve Google Gemini’nin haber odası tarzında sorgulamaların %40’ında hallüsinasyon ürettiğini, genellikle doğrulanabilir gerçeklerle desteklenmeyen kendinden emin ifadeler uydurduğunu ortaya koydu. Google’ın NotebookLM’si ise yalnızca %13 oranında hallüsinasyon üretti – bu oran herhangi bir gazeteciyi işinden edebilecek bir oran. Çalışma, modellerin sık sık kaynakları bozduğunu, görüşleri gerçeklere dönüştürdüğünü ve atıfları yok ettiğini, bu nedenle de gazetecilik için riskli araçlar olduğunu buldu. Yazarlar, bu görevler için daha iyi, özel araçlara ihtiyaç duyulduğunu savunuyor.
Büyük Dil Modelleri, son zamanlarda gazetecilik sektörüne hızlı bir şekilde entegre oldu. Bu, zaten dijital gazeteciliğin 2000’lerin başından itibaren began çöküşünden sonra maliyetleri, bütçeleri ve personelini azaltan bir ortamda gerçekleşti.
Aslında, medya zaten 1980’lerin turbulent dijital dizgi girişinden ve daha önceki radyo ve televizyon gibi挑战lerden sonra “yenilik” yoluyla işten çıkarmaya alışmıştı.
Gazetecilik sektörüne ve medya kuruluşlarına yapılan AI’nın yolculuğu sansürsüz değildi; şirketlerin %55’i artık AI ile insanları değiştirmekten pişmanlık duyuyor ve Gartner, öngörüyor ki organizasyonlar AI benimsemelerini iki yıl içinde ciddi şekilde azaltacak. Birçok haber kuruluşu, AI tarafından değiştirilen gazetecileri yeniden işe aldı, çünkü makine öğrenimi alternatiflerinin ciddi ve sık sık utandırıcı eksiklikleri ortaya çıktı.
İnsanların Yanılmasının Ötesinde
Doğru olmayan bilgiler doğru olmayan bilgiler özellikle doğru alıntılama gereken alanlarda büyük bir sorun teşkil etti (hukuk, araştırma ve gazetecilik sektörlerinde dikkat çekici kamu dikkati). Yeni bir ABD çalışması, makine öğreniminin gazetecilikte beklenenden daha geniş zorluklarla karşı karşıya olduğunu buldu.
Yazarların araştırması, ChatGPT, Google Gemini ve daha alıntı odaklı NotebookLM‘yi bir raporlama görevinde değerlendirdi: ABD’de TikTok davaları ve politikaları hakkında 300 belge içeren bir corpus kullanarak.
Araştırmacılar, sorgu spesifikliğini ve sağlanan belgelerin sayısını değiştirdiler, ardından sonuçları, hallüsinasyonların tipini ve ciddiyetini yakalamak üzere tasarlanmış bir taksonomi kullanarak analiz ettiler.
Tüm çıktılarda, %30’u en az bir hallüsinasyon içeriyordu, ChatGPT ve Gemini her biri %40’lık bir hallüsinasyon oranına sahipti – NotebookLM’nin %13’lük hata oranından biraz daha yüksek.
Araştırmacılar, modellerin genellikle yorumlama aşırılığı sergilediğini, desteklenmeyen karakterizasyonlar eklediğini ve atıfta bulunulan görüşleri genel ifadelere dönüştürdüğünü belirtiyorlar:
‘Nitel olarak, çoğu hata uydurulmuş varlıklar veya numaralar içermiyordu; bunun yerine, modeller desteklenmeyen karakterizasyonlar ekledi ve atıfta bulunulan görüşleri genel ifadelere dönüştürdü.
‘Bu kalıplar, bir temel epistemolojik uyumsuzluğu ortaya koyuyor: Gazetecilik her iddia için açık bir kaynak gerektirirken, LLM’ler kanıtlara bakılmaksızın otoriter bir metin üretiyor.
‘Mevcut hallüsinasyon taksonomilerine gazetecilik için özel uzantılar öneriyoruz ve etkili haber araçlarının doğru atıfları zorlamak yerine akıcılığı optimize etmesini savunuyoruz.’
Çalışma, yeni bir çalışma, beş sayfadan oluşan kısa bir okumaya sahip ve Yanlış Değil, Ama Yanlış: Belge Tabanlı Sorgulamalarda LLM Aşırılığı başlıklı, Northwestern Üniversitesi ve Minnesota Üniversitesi’nden üç araştırmacı tarafından yazılmıştır.
Teori ve Yöntem
Hallüsinasyonların tam nedeni tartışılmaktadır; neredeyse tüm teoriler, veri kalitesi ve/veya dağılımların katkıda bulunduğunu kabul etmektedir, ancak önerilmiştir ki %100 LLM çıktısı esasen hallüsinasyon (bazı hallüsinasyonların gerçeklikle çakışması hariç).
Yazarlar gözlemliyor†:
‘Teknik açıdan, hallüsinasyonlar LLM’lerin gerçekleri anlama olmadan ortak kalıpları takip eden metin üretme yeteneğinden kaynaklanıyor. Bu özellik, gerçekliği yansıtmayan ancak inandırıcı görünen yanıtlara yol açıyor – örneğin, LLM tarafından uydurulmuş dava yasası davalara giriyor.
‘Ve LLM yetenekleri son beş yılda dramatically artmış olsa da, hallüsinasyonlar hala bir sorun teşkil ediyor, bazı durumlarda sogar artıyor daha yetenekli modellerle.’
Araştırma sektörü, makaleye göre, LLM hallüsinasyonlarını azaltmak veya daha iyi anlamak için bir dizi yol keşfetti, bunlar genellikle üç ana alana girer: önce, bağlam içinde, modeller dış kaynaklara dayanarak iddialarını destekleyebilir, Örneğin veritabanları, belge koleksiyonları veya web içeriği.
Bu, materyal güvenilir ve eksiksiz olduğunda iyi çalışır, ancak boşluklar, eski bilgiler veya kötü kaliteli veriler hala hatalara neden olur; ve modeller de kaynakların söylediğinden daha fazla güvenen ifadeler üretme eğilimindedir.
İkincisi, sorgulama ve kodlama modellere dikkatli talimatlar verilmesini içerir. Bu, modellere kanıtlarını kontrol etmelerini, görevleri daha küçük adımlara bölmelerini veya daha katı formatlar izlemelerini söylemek olabilir. Bazen modellere kendi çalışmalarını gözden geçirmeleri veya birden fazla yanıtı karşılaştırmaları talimatı verilir.
Bu teknikler hataları yakalayabilir, ancak maliyetleri artırır ve genellikle nüanslı hataları tespit edemez; bu nedenle, güvenilir kanıt denetimi olmadan, doğrulamanın büyük bir kısmı hala kullanıcıya düşer.
Üçüncüsü, modeller ve araçlar modellere doğrulamayı destekleyecek kaynaklar sağlama anlamına gelir, Örneğin arama motorları veya hesap makineleri – ancak doğruluk da modellerin iyi kaynaklı verilerle eğitildiğinde veya alıntı özelliklerinin entegre edildiğinde iyileşebilir.
Ancak bu önlemler kusursuz değildir ve hala kaynakların kalitesi, talimatların açıklığı ve insan denetimi bağlıdır, böylece yanlış bilgiler yayılmaz.
TikTok
Gazeteciler için gerçekten faydalı olabilecek yaklaşımları bulmak için, çalışma gerçek haber odası iş akışları ve standartları yansıtan değerlendirmeler yaptı, hallüsinasyonlar tipik raporlama görevleri bağlamında incelendi.
Öncü modeller, ortak sorgulama stratejileri ve belge tabanlı kurulumlar kullanılarak test edildi, böylece hem hallüsinasyon hatalarının sıklığı hem de bu hataların haber odalarına entegrasyonu için ne anlama geldiği ölçülebildi.
Analiz, araştırma temelli ve soruşturma gazeteciliğinde tipik olan belge tabanlı sorgulamaya odaklandı. Yazarlar, küçük ila orta ölçekli bir haber odası projesini yansıtan ancak gerçek dünya raporlamasının karmaşıklığını yakalayabilecek bir korpus oluşturmak istedi; bu amaçla, ABD’de TikTok’u yasaklama çabalarını seçtiler.
Belgeler, Washington Post, New York Times, ProQuest ve Westlaw gibi kaynaklardan toplandı ve beş akademik makale, 150 haber makalesi ve 145 yasal belgeden oluşan 300 belge koleksiyonu oluştu (tam derleme, proje deposu aracılığıyla akademik araştırmacılara talep üzerine mevcuttur).
Sorgular, çok genişten çok spesifike beş sorgu arasında değişti – genel TikTok yasağı sorularından, belirli dava dosyalarından tanıklık taleplerine kadar.
Her model için verilen belgelerin sayısı 10, 100 veya tüm 300 belge arasında değişti, her örnekte iki ana belge dahil edildi, böylece tutarlılık sağlandı. Her model için 15 yanıt üretildi, ChatGPT için ise 10 yanıt ile sınırlı kaldı.
Rakipler
Üç araç, her biri belge tabanlı sorgulamaya farklı bir yaklaşımı temsil eden araçlar test edildi: ChatGPT-5 Projects özelliğini kullanarak değerlendirildi, bu da 100 belgeye kadar yüklemeye izin verdi; Google Gemini 2.5 Pro tüm 300 belge koleksiyonunu bağlam içinde işleyebildi (bir milyon tokenlik bağlam penceresini kullanarak doğrudan 923.000 tokeni işledi); Google NotebookLM, yerleşik alıntı geri çağırma özelliğine sahip, her örnekte ayrı not defterleri kullanılarak test edildi.
Bu belge işleme yöntemleri farklı olsa da, üçü de şu anda gazetecilere açık gerçek araçları temsil ediyor; ve her durumda, state-of-the-art daha çok deneysel ve homojen olmaktan ziyade farklılık gösteriyor, özellikle mevcut teklifler arasında özellik eşliği ve kapsam.
Hangi hallüsinasyon davranışlarının ortaya çıkabileceğini yakalamak için, bir önceki çalışmadan bir taksonomi kullanıldı, hallüsinasyonlar yönelim (bozma vs. genişleme), kategori (hata türü) ve derece (şiddeti mild, moderate veya alarming olarak derecelendirildi) tarafından kodlandı.
Tüm model çıktıları, her cümleyi gözden geçiren ve bu kodları uygulayan bir insan yazar tarafından注釈lendi. Taxonomi tarafından kapsanmayan hatalar miscellaneous olarak işaretlendi ve daha sonra gazetecilik için özel kategoriler geliştirmek üzere analiz edildi.
Veri ve Testler
İlk hallüsinasyon yaygınlığı testinde, 40 model yanıtının 12’sinde en az bir hallüsinasyon bulundu, araçlar arasında önemli bir varyasyon vardı. ChatGPT ve Gemini her biri çıktılarının %40’ında hallüsinasyon üretirken, NotebookLM yalnızca %13’lük bir hata oranına sahipti:

Her araç için genel hallüsinasyon oranları, Gemini ve ChatGPT en yüksek hata oranına sahip. Kaynak: https://arxiv.org/pdf/2509.25498
Bu sonuçlar hakkında yazarlar yorum yapıyor:
‘Bu, většina yanıtların hiçbir hallüsinasyon içermediğini, ancak araç seçiminin aynı belge koleksiyonu ve sorgu kümesi için bir fark yarattığını gösteriyor.’
Hallüsinasyonlar genellikle tek başına ortaya çıkmaz; Gemini, bozuk her yanıtta ortalama dört hallüsinasyon üretir, NotebookLM üç, ChatGPT ise 1.5. Çoğu moderate şiddetteydi, ancak %14’ü alarming olarak sınıflandırıldı. Bir durumda, ChatGPT, kaynağında olmayan bir TikTok yasağı arkasındaki misilleme nedenini uydurdu:
‘[Bir sorguda] ChatGPT, olası bir TikTok yasağını, ABD yasama organları tarafından Çin politikasına yanıt olarak alınan bir önlem olarak çerçeveledi, bu iddia kaynak belgede tamamen отсутствtı.’
Genel olarak, %64’ü hallüsinasyon içeren yanıtlar, gerçek dışı bilgiler veya sapmalar içeriyordu, bu da bu tür bilgi temelli iş akışlarında AI kullanımının gerçekten zaman kazandırmadığı sorusunu gündeme getiriyor.
İlk testte, çoğu hallüsinasyon mevcut taksonomi kategorilerine uymuyor, genellikle uydurulmuş alıntılar veya yanlış akronim genişletmeleri içeriyor, bu da mevcut çerçevelerin gazetecilik için çok dar olabileceğini gösteriyor.
NotebookLM’nin daha düşük hallüsinasyon oranı, yazarlara göre, ChatGPT’nin Projects özelliğinden veya Gemini’nin bağlam içi işlemeden daha güvenilir bir temel sağlıyor, özellikle de belirli belgelerin referans gösterilmesi gerektiğinde.
Gözlemlenen hallüsinasyonların nitel özelliklerinin incelenmesi konusunda araştırmacılar gözlemliyor:
‘Modeller, belgelerin amaçları, hedef kitleleri ve konuşmacı niyetleri hakkında kendinden emin karakterizasyonlar ekledi, bunlar otoriter görünüyordu ancak metinde hiçbir dayanağı yoktu. Atıfta bulunulan ifadeleri kesin ifadelere dönüştürdüler.’
Kendinden eminlik iki şekilde ortaya çıktı: önce, modeller belgelerin hedef kitlesi veya amacı hakkında desteklenmeyen iddialar ekledi, Örneğin bir makaleyi “kamuya yönelik” olarak etiketledi veya bir dava dosyasını “avukatlar için amaçlanmış” olarak tanımladı.
İkincisi, atıfta bulunulan görüşleri gerçek gibi ifadelere dönüştürdüler, orijinal kaynağı gizleyerek ve kaynak değerlendirmesini zayıflattılar.
Bu davranışlar tüm araçlarda görüldü ve bir mimari ile sınırlı değildi – ve çoğu hata uydurma değil, yorumlama aşırılığıydı.
Çoğu hallüsinasyon miscellaneous olarak etiketlendi, çünkü mevcut kategorilere uymuyorlardı, önemli hata türleri arasındaki farkları bulanıklaştırdılar. Sık görülen sorunlar, eksik atıf ve belirsiz kaynak açıklamaları, mevcut taksonomilerin gazetecilikte en önemli olan hataları kaçırdığını gösteriyor.
Yazarlar gözlemliyor ki ‘Modeller, belgelerin desteklemediği analizler ekliyor ve gerekli atıfları yok ediyor.’
Sonuç
Her üç modeli inceleyen yeni makaleyle deney yapan herkes, her birinin zayıf ve güçlü yanlarını bilir. NotebookLM, ChatGPT veya Gemini’den daha iyi bir alıntı performansı sunuyor, ancak bu, özellikle bu işlevselliğe özel olarak tasarlandığı ve yine de bir hata oranıyla birlikte geldiği için şaşırtıcı değil. Bu oran, çoğu gazeteci, araştırmacı veya avukatın işini kaybetmesine neden olur, tekrarlanan olaylarla birlikte.
Ek olarak, NotebookLM, bir araştırma çerçevesi olarak konumlandırılmış ve diğer iki platformun yazı deneyimini kolaylaştıran birçok UX iyileştirmesinden yoksun.
Ancak, en azından NotebookLM, gerçekten yüklenen belgeleri okumak yerine ChatGPT’nin inanılmaz derecede yıkıcı bir alışkanlık olan, yüklenen bir belgenin ne dediği hakkında genel bir dağılım temelinde ne dediğini varsayma eğiliminden kaçınabiliyor. ChatGPT’nin yüklenen materyali tam metin olarak okumak yerine meta verilere veya varsayımlarına/hallüsinasyonlarına güvenmesi için bir mücadele verilmesi gerekiyor.
Kanat ve alıntı standartlarının kritik olduğu alanlarda, Örneğin hukuk, gazetecilik ve bilimsel araştırma, mevcut pazar lideri LLM’lerde, kullanıcı tarafından yönlendirilen bilgilere doğru bir şekilde çıkarmak ve işlemek için hiçbir yerli eğitimli tesis bulunmuyor.
Şu anda ve LLM’lere daha iyi bir arayüz sunabilecek yardımcı sistemlerin gelişine kadar, bu sistemlerin çıktısı, özellikle bu kritik görevler için, pahalı, hantal ve sistem veya MCP ayarlarından daha fazlasıyla kontrol edilmelidir.
* Google Cloud, konuyla ilgili burada oldukça interessan ve kapsamlı bir açıklama sunuyor.
† Yazarların inline alıntılarını hyperlinklere dönüştürme.
İlk olarak 1 Ekim 2025 Çarşamba günü yayımlandı. 2 Ekim 2025 Perşembe günü, TL:DR’deki hatayı düzeltmek ve ilk paragraftaki stil hatasını düzeltmek için değiştirildi.












