Anderson’un Açısı

Yeni Araştırma, RAG Sistemlerinin On Altı Büyük Sorununu, Karmaşıklık Dahil, Ortaya Koyuyor

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
Image generated by ChatGPT-4o, with prompt ' Create a highly photorealistic panoramic image of a robot frantically searching the internet on a laptop. Do not stylize this image so that it looks like a false or AI-created image'

Amerika Birleşik Devletleri’nden yapılan bir recent çalışma, popüler Retrieval Augmented Generation (RAG) araştırma sistemlerinin, Perplexity ve Bing Copilot gibi, gerçek dünya performansı, son 12 ayda elde ettiği başlıkların ve pazarlama reklamlarının çok altında kaldı.

Proje, 21 uzman sesin yer aldığı geniş bir anket katılımını içermekteydi ve çalışılan RAG sistemlerinde (You Chat, Bing Copilot ve Perplexity) endişe verici nedenler olarak hiçbir şekilde 16’dan az bir alan bulamadı:

1: Ürettiği cevapların nesnel ayrıntıya sahip olmaması, genel özetler ve az contextual derinlik veya nüans ile.

2. Kullanıcı algı yanlılığını pekiştirme, RAG motorunun genellikle çeşitli bakış açılarını sunmadığı, bunun yerine kullanıcı tarafından bir soru sorulma şekline dayanarak kullanıcı yanlılığını varsayması ve pekiştirmesi.

3. Aşırı güven veren dil, özellikle empirik olarak kurulamayan öznel cevaplar için, bu durum kullanıcıların cevaba gereğinden fazla güvenmelerine neden olabilir.

4: Dilinin basitleştirilmesi ve eleştirel düşünme ve yaratıcılık eksikliği, cevapların kullanıcıyı “basite indirgenmiş” ve “anlaşılır” bilgilerle küçümsemesi yerine, düşünülmüş ve analiz edilmiş bilgiler sunmaması.

5: Kaynakları yanlış atfetme ve yanlış alıntı yapma, cevap motorunun, cevaplarını desteklemeyen alıntılar kullandığı, bu durum güvenilirlik izlenimi yaratması.

6: Kullanıcı sorgusuna uygun bilgi seçme, RAG aracının, cevaplarını destekleyen iddiasını ve kullanıcıların ne duymak istediklerini tahmin ettiği bilgiyi araması yerine, objektif analizlere dayanmayan cevaplar vermesi.

7: Cevapları destekleyen alıntıları atlamak, cevapların kaynak materyallerinin olmaması.

8: Cevapları için mantıksal bir şema sağlamaması, kullanıcıların, sistemlerin neden belirli kaynakları diğerlerine tercih ettiğini sorgulayamaması.

9: Kaynak sayısının sınırlı olması, çoğu RAG sisteminin bir ifade için genellikle yalnızca üç destekleyici kaynak sağlaması, daha fazla kaynak çeşitliliği uygulanabilirken.

10: Öksüz kaynaklar, sistemlerin destekleyici alıntılarının bir kısmının veya tamamının cevaplarda aslında dahil edilmemesi.

11: Güvenilir olmayan kaynakların kullanılması, sistemlerin, doğru olmayan bir kaynağı, popüler (yani SEO açısından) bir kaynak olarak tercih etmesi.

12: Yinelenen kaynaklar, sistemlerin, esasen aynı içerikte olan kaynak makalelerini birden fazla alıntı olarak sunması.

13: Filtrelenmemiş kaynaklar, sistemlerin, kullanıcıya sunulan alıntıları değerlendirmesi veya filtrelemesi için bir yol sağlamaması, bu durum kullanıcıların seçim kriterlerini güvenle kabul etmelerine neden olması.

14: Etkileşim veya keşif eksikliği, bazı kullanıcı çalışması katılımcılarının, RAG sistemlerinin açıklama soruları sormadığı, ilk sorgudan kullanıcı niyetini varsaydığı için hayal kırıklığına uğraması.

15: Harici doğrulama ihtiyacı, kullanıcıların, sağlanan cevabın bağımsız doğrulamasını yapma ihtiyacı duyması, bu durum RAG’ın “arama yerine” konforunu büyük ölçüde ortadan kaldırması.

16: Akademik atıf yöntemlerinin kullanılması, böyle bir durumda [1] veya [34] gibi; bu, akademik çevrelerde standard bir uygulamadır, ancak birçok kullanıcı için sezgisel olmayabilir.

Çalışma için, araştırmacılar, yapay zeka, sağlık ve tıp, uygulamalı bilimler ve eğitim ve sosyal bilimler alanlarında 21 uzman sesi topladı, hepsi doktora sonrası araştırmacılar veya doktora adaylarıydı. Katılımcılar, düşüncelerini yüksek sesle ifade ederek, araştırmacılara kendi rasyonel şemalarını açıkladılar.

Çalışma, katılımcıların RAG sistemlerinin performansı hakkındaki endişe ve kaygılarını geniş çapta alıntılar.

Kullanıcı çalışmasının metodolojisi, sonra RAG sistemlerinin bir tarayıcı kontrol paketi kullanılarak otomatik bir çalışmaya sistemleştirildi:

‘You.com, Perplexity.ai ve BingChat gibi sistemlerin büyük ölçekli otomatik değerlendirmesi, çoğu metriğe ilişkin, özellikle de hallüsinasyonları, desteklenmeyen ifadeleri ve alıntı doğruluğunu işleme konusunda kabul edilebilir performansın hiçbirini karşılamadığını gösterdi.’

Araştırmacılar, hem yeni hem de deneyimli kullanıcıların, çalışılan RAG sistemlerini kullanırken dikkatli olmaları gerektiğini uzun uzun savunuyorlar. Ayrıca, çalışmadaki eksikliklere dayanan yeni bir ölçütler sistemi öneriyorlar, bu da gelecekte daha büyük teknik denetimi sağlayabilir.

Ancak, artan RAG sistemlerinin kamu kullanımı, yazarları ayrıca bu tür aracı-destekli AI arama arayüzleri için uygun yasama ve daha fazla uygulanabilir hükümet politikası savunmaya teşvik ediyor.

The çalışma Pennsylvania State Üniversitesi ve Salesforce’tan beş araştırmacının eseridir ve AI Çağındaki Arama Motorları: Nesnel ve Doğrulanabilir Kaynak Alıntılı Cevapların Yanlış Vaadi başlığını taşır. Çalışma, Ağustos 2024’te RAG sistemlerinin durumuna kadar kapsar

RAG Ticaret-Off

Yazarlar, çalışmalarını, Large Language Modellerinin (LLM’ler) dört bilinen eksikliğini yineleyerek başlatıyorlar, özellikle de Cevap Motorlarında kullanıldıklarında.

İlk olarak, hayalci bilgi oluşturma eğiliminde olduklarını ve gerçekçi tutarsızlıkları tespit etme yeteneklerinden yoksun olduklarını belirtiyorlar. İkinci olarak, bir alıntının bağlamındaki doğruluğunu değerlendirmekte zorluk yaşadıklarını belirtiyorlar. Üçüncü olarak, kendi önceden eğitilmiş ağırlıklarından gelen verilere tercih gösterdiklerini ve dışarıdan alınan belgelerden gelen verilere direndiklerini, bu belgelerin daha yeni veya daha doğru olabileceği halde.

Dördüncü olarak, RAG sistemlerinin, insanların hoşuna giden, yaltakçı bir davranış sergilediklerini, bu durum genellikle doğruluk yerine bilgi doğruluğunu feda ediyor.

Bu eğilimler, çalışmanın her iki yönünde de doğrulandı ve RAG’ın tuzakları hakkında birçok yeni gözlem yapıldı.

Çalışma, OpenAI’nin SearchGPT RAG ürününü (abonelerine sunuldu, yeni makale gönderildikten sonra), RAG tabanlı arama sistemlerinin kullanıcı benimsemesini teşvik edeceği için muhtemel olarak görüyor:

‘OpenAI’nin “SearchGPT”nin piyasaya sürülmesi, bir “Google arama öldürücü” olarak pazarlandığı için endişeleri daha da artırıyor. Bu araçlara bağımlılık arttıkça, bunların etkisini anlamak için aciliyet artıyor. Lindemann Mühürlenmiş Bilgi kavramını tanıtıyor, bu kavram, bu sistemlerin, arama sorgularını tek, otoriter cevaplar haline getirerek, bilgiye erişimi sınırladığını ve kullanıcı perspektiflerini daralttığını eleştiriyor.

‘Bu “mühürleme” bilgi, seçim yanlılıklarını sürdürür ve marjinal görüşleri kısıtlar.’

Çalışma

Yazarlar, önce, 24 seçilen katılımcıdan üçünü, çalışmanın prosedürünü test etmek için kullanıyorlar, hepsi LinkedIn veya e-posta gibi yollarla davet edildi.

İlk aşama, kalan 21 için, Uzmanlık Bilgisi Alımı idi, burada katılımcılar ortalama 40 dakikalık bir oturumda altı arama sorgusu gerçekleştirdiler. Bu bölüm, gerçek temelli sorular ve cevaplar ile potansiyel empirik çözümler üzerine odaklandı.

İkinci aşama, Tartışma Bilgisi Alımı ile ilgiliydi, bu, öznel konular, ekoloji, vejetaryenlik ve siyaset ile ilgiliydi.

Perplexity (solda) ve You Chat'ten (sağda) üretilen çalışma cevapları. Kaynak: https://arxiv.org/pdf/2410.22349

Perplexity (solda) ve You Chat’ten (sağda) üretilen çalışma cevapları. Kaynak: https://arxiv.org/pdf/2410.22349

Çünkü tüm sistemler, sağlanan alıntılar için en azından bazı düzeyde etkileşimi sağladı, çalışma konuları, arayüzle mümkün olduğunca çok etkileşime girmeye teşvik edildi.

Her iki durumda da, katılımcılar, sorgularını hem bir RAG sistemi aracılığıyla hem de bir geleneksel arama motoru (bu durumda Google) aracılığıyla formüle etmeleri istendi.

Üç Cevap Motoru – You Chat, Bing Copilot ve Perplexity – kamu erişimine açık oldukları için seçildi.

Çoğu katılımcı, zaten RAG sistemlerinin kullanıcılarıydı, çeşitli sıklıklarda.

Alan kısıtlamaları nedeniyle, çalışmada belirlenen on altı ana eksikliğin her birini ayrıntılandıramayız, ancak bazı ilginç ve aydınlatıcı örnekleri sunuyoruz.

Nesnel Ayrıntı Eksikliği

Çalışma, kullanıcıların, sistemlerin cevaplarının genellikle nesnel ayrıntıdan yoksun olduğunu, hem gerçek hem de öznel cevaplar için belirtiyor. Bir katılımcı şunları söyledi:

‘Sadece bana katı bir cevap vermeğe çalışıyordu, bana gerçekten düşünülmüş bir cevap vermiyordu, bu bana birçok Google aramasıyla elde edebileceğim bir şey.’

Bir başka katılımcı şunları gözlemledi:

‘Çok kısa ve her şeyi çok özetliyor. [Model] bana iddia için daha fazla veri vermesi gerekiyor, ancak çok özetlenmiş.’

Holistik Bakış Açısı Eksikliği

Yazarlar, bu eksiklikten ve spesifisite eksikliğinden endişe duyuyorlar ve Cevap Motorlarının genellikle bir tartışmanın çeşitli bakış açılarını sunmadığını, kullanıcıların soru sorma şekline dayalı olarak varsayılan bir yanlılığa eğilim gösterdiğini belirtiyorlar.

Bir katılımcı şunları söyledi:

‘Argümanın diğer tarafını öğrenmek istiyorum… bu, bizim diğer tarafın delillerini ve gerçeklerini bilmediğimiz için bir tutam tuz ile.’

Bir başka katılımcı şunları yorumladı:

‘Her iki tarafı da vermiyor, sadece size neden doğru olduğunuzu söylüyor… ve size nedenlerini söylüyor.’

Güvenilir Dil

Yazarlar, tüm üç test edilen sistemin, öznel konularda bile, aşırı güven veren bir dil kullandığını gözlemliyorlar, bu durum cevaba gereğinden fazla güvenilmesine neden olabilir.

Bir katılımcı şunları söyledi:

‘O kadar güvenle yazıyor ki, kaynağa bakmadan ikna oluyorum, ancak kaynağa baktığımda kötü ve bu beni tekrar sorgulamaya yöneltiyor.’

Bir başka katılımcı şunları yorumladı:

‘Eğer biri doğru cevabı bilmiyorsa, buna güvenecektir, hatta yanlış olsa bile.’

Yanlış Alıntılar

Bir başka sık görülen sorun, RAG sistemlerinin cevapları için yetki olarak gösterdikleri kaynakların yanlış atanmasıydı, bir çalışma konusu şunları iddia etti:

‘Bu ifade kaynağa benzemiyor. İfade doğru, geçerli… ancak nereden aldığını bilmiyorum.’

Çalışmanın yazarları şunları yorumluyor:

‘Katılımcılar, sistemlerin cevaplarını meşrulaştırmak için alıntılar kullandığını, bu durum güvenilirlik izlenimi yaratıyor. Bu görünüm, sadece birkaç kullanıcı tarafından, kaynakları inceleyenler tarafından ortaya çıkarıldı.’

Sorguya Uygun Bilgi Seçme

RAG cevaplarının people-pleasing, yaltakçı davranışlarına geri dönersek, çalışma, birçok cevabın, konuyu kapsamlı bir şekilde özetlemek yerine, belirli bir bakış açısını vurguladığını, bir katılımcı şunları gözlemledi:

‘Manipülatif olduğunu hissediyorum. Sadece bazı bilgileri alıyor ve sadece bir tarafı görmeye yönlendiriyorum.’

Bir başka katılımcı şunları yorumladı:

‘Kaynak aslında hem artıları hem de eksilerini içeriyor ve sadece bu bağlantının gerekli argümanlarını seçiyor, bütün resmi vermiyor.’

Diğer örnekler ve anket katılımcılarının alıntıları için, okuyucuyu kaynak makaleye yönlendiriyoruz.

Otomatik RAG

Çalışmanın ikinci aşamasında, araştırmacılar, üç test edilen RAG motoruna, tarayıcı tabanlı bir komut dosyası kullanarak sistematik olarak sorgular gönderdiler. Ardından, cevapları analiz etmek için bir LLM sistemi (GPT-4o) kullandılar.

Cümleler, sorgu alakalığı ve Lehine ve Aleyhine İfadeler (yani, cevap, sorgunun varsayılan yanlılığına göre lehine, aleyhine veya tarafsız mı?) açısından analiz edildi.

Bir Cevap Güven Skoru de bu otomatik aşamada değerlendirildi, Likert ölçeği psikometrik test yöntemi kullanılarak. Burada LLM hakemi, iki insan annotatör tarafından desteklendi.

Üçüncü bir işlem, Jina.ai Reader aracı kullanılarak alıntı yapılan web sayfalarının tam metnini elde etmek için web scraping içeriyordu. Ancak, makalenin başka bir yerinde de belirtildiği gibi, çoğu web scraping aracı, çoğu insan gibi, ücretli sitelere erişemez.

Ek olarak, cevapların bir kaynağa atıfta bulunup bulunmadığı (bir “alıntı matrisi” olarak hesaplandı) ve bir “gerçek destek matrisi” – dört insan annotatörün yardımıyla doğrulanan bir ölçüt dikkate alındı.

Böylece 8 kapsamlı ölçüt elde edildi: tek taraflı cevap; güvenli cevap; alakalı ifade; alıntı yapılmayan kaynaklar; desteksiz ifadeler; kaynak gerekliliği; alıntı doğruluğu; ve alıntı kapsamlılığı.

Test edilen materyal, kullanıcı çalışması aşamasından 303 seçilmiş soru ve üç test edilen sistemden 909 cevaptan oluşuyordu.

Üç test edilen RAG sistemi için sekiz ölçüt temelinde nicel değerlendirme.

Üç test edilen RAG sistemi için sekiz ölçüt temelinde nicel değerlendirme.

Sonuçlar hakkında, makale şunları belirtiyor:

‘Cevap metnine ilişkin üç ölçütü incelediğimizde, tüm değerlendirilen cevap motorlarının genellikle (50-80%) tek taraflı cevaplar ürettiğini, Perplexity’nin diğer iki motordan daha kötü performans gösterdiğini görüyoruz, bu, bir tartışma formülasyonuna yüklenen bir cevapla ilgili çoklu bakış açısını sunmaktan daha fazla anlaşmaya eğilimlidir.’

‘Bu bulgu, nitel sonuçlarımızla uyumlu. Şaşırtıcı bir şekilde, Perplexity bir taraflı cevaplar üretebilir, ancak aynı zamanda ortalama 18.8 ifade ile en uzun cevapları üretiyor, bu durum, cevap çeşitliliği eksikliğinin cevap kısalığından kaynaklanmadığını gösteriyor.

‘Başka bir deyişle, cevap uzunluğunu artırarak çeşitliliği artırmak mümkün değildir.’

Araştırmacılar ayrıca, Perplexity’nin, öznel içerik söz konusu olduğunda, diğer iki sistemden daha fazla güven veren bir dil kullandığını ve diğer iki sistemin, daha ihtiyatlı ve menos güven veren bir dil kullandığını belirtiyorlar.

You Chat, bir cevaba ait alıntısız kaynakları sıfıra indirgeme başarısını gösteren tek RAG çerçevesiydi, Perplexity %8 ve Bing Chat %36 ile.

Tüm modeller, önemli bir oranda desteksiz ifadeler sergilediler ve makale şunları belirtiyor:

‘RAG çerçevesi, LLM’lerin hayali davranışını, cevapları kaynak belgelerine dayandırmak suretiyle çözmeye yönelik olarak pazarlanmaktadır, ancak sonuçlar, RAG tabanlı cevap motorlarının hala, sağladıkları kaynaklar tarafından desteklenmeyen bir dizi ifade ürettğini gösteriyor.’

Ayrıca, tüm test edilen sistemler, ifadelerini alıntılarla destekleme konusunda zorluk yaşadılar:

‘You.Com ve Bing Chat, Perplexity’den biraz daha iyi performans gösteriyor, alıntılarının yaklaşık iki thirds’ü, alıntılanan ifadeyi destekleyen bir kaynağa işaret ediyor, Perplexity ise daha kötü performans gösteriyor, alıntılarının yarısından fazlasının yanlış olduğunu gösteriyor.

‘Bu sonuç şaşırtıcı: alıntı, sadece desteklenmeyen ifadeler için değil, aynı zamanda, bir ifadenin desteklenmesi için bir kaynak varsa bile, motorların genellikle yanlış bir kaynağı alıntılamaması ve kullanıcıya doğru bilgi kaynağını sağlamaktan kaçınması.’

‘Başka bir deyişle, hayali davranış, sadece desteklenmeyen ifadelerde değil, aynı zamanda, bilgilerin geçerliliğini doğrulamaktan kullanıcıları alıkoyan yanlış alıntılarda da ortaya çıkıyor.’

Araştırmacılar şunları kếtüller:

‘Hiçbir cevap motoru, çoğu ölçütte iyi bir performans göstermedi, cevap motorlarında büyük bir iyileşme alanı olduğunu gösteriyor.’

 

 

* Yazarların satır içi alıntılarını hyperlink’e dönüştürme işlemini ben yaptım. Gerekli olduğunda, hyperlink için birden fazla alıntıdan ilkini seçtim, formatlama pratiklikleri nedeniyle.

Yazarların vurgusu, benim değil.

İlk olarak 4 Kasım 2024’te yayımlandı

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai