Andersonův úhel

Nová studie odhalila šestnáct velkých problémů s RAG systémy, včetně Perplexity

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
Image generated by ChatGPT-4o, with prompt ' Create a highly photorealistic panoramic image of a robot frantically searching the internet on a laptop. Do not stylize this image so that it looks like a false or AI-created image'

Nová studie z USA zjistila, že skutečný výkon populárních systémů Retrieval Augmented Generation (RAG), jako jsou Perplexity a Bing Copilot, je daleko od marketingové reklamy a populárního přijetí, které získaly v posledních 12 měsících.

Projekt, který zahrnoval rozsáhlou účast expertů, zjistil ne méně než 16 oblastí, ve kterých studované RAG systémy (You Chat, Bing Copilot a Perplexity) vyvolaly obavy:

1: Chybějící objektivní detail v generovaných odpovědích, s obecnými souhrny a nedostatečnou kontextuální hloubkou nebo nuancí.

2. Potvrzování vnímaného uživatelského zkreslení, kde RAG engine často nezobrazuje řadu názorů, ale místo toho inferuje a potvrzuje uživatelské zkreslení na základě toho, jak uživatel formuluje otázku.

3. Přespříliš sebevědomý jazyk, zejména v subjektivních odpovědích, které nelze empiricky stanovit, což může vést uživatele k tomu, aby odpověď důvěřovali více, než si zaslouží.

4: Jednoduchý jazyk a nedostatek kritického myšlení a tvořivosti, kde odpovědi efektivní patronizují uživatele “zjednodušenými” a “souhlasnými” informacemi, místo toho, aby poskytly promyšlené úvahy a analýzy.

5: Nesprávné citace zdrojů, kde odpověďový engine používá citované zdroje, které nepodporují jeho odpověď, vytvářející iluzi kredibility.

6: Vybrání informací z inferovaného kontextu, kde RAG agent zdá se, že hledá odpovědi, které podporují jeho generovanou tvrzení a jeho odhad toho, co uživatel “chce slyšet”, místo toho, aby odpovědi založil na objektivní analýze spolehlivých zdrojů.

7: Opomenutí citací, které podporují tvrzení, kde zdrojový materiál pro odpovědi chybí.

8: Neposkytnutí logického schématu pro jeho odpovědi, kde uživatelé nemohou pochopit, proč systém upřednostňuje určitý zdroj před jinými.

9: Omezený počet zdrojů, kde většina RAG systémů obvykle poskytuje kolem tří podpůrných zdrojů pro tvrzení, i když by byl použitelný větší počet zdrojů.

10: Osamělé zdroje, kde data z některých nebo všech podpůrných citací nejsou vlastně zahrnuta v odpovědi.

11: Použití nespolehlivých zdrojů, kde systém zdá se, že preferuje zdroj, který je populární (tj. v SEO termínech), místo toho, aby byl fakticky správný.

12: Redundantní zdroje, kde systém prezentuje více citací, ve kterých jsou zdrojové dokumenty v podstatě stejné.

13: Nefiltrované zdroje, kde systém nabízí uživateli žádný způsob, jak vyhodnotit nebo filtrovat nabízené citace, což nutí uživatele důvěřovat výběrovému kritériu.

14: Chybějící interaktivita nebo prozkoumatelnost, kde několik účastníků studie bylo frustrováno tím, že RAG systémy nekladly уточňující otázky, ale předpokládaly uživatelskou intenci z prvního dotazu.

15: Potřebu externí verifikace, kde uživatelé cítí potřebu provést nezávislou verifikaci poskytnuté odpovědi, což podstatně snižuje údajnou výhodou RAG jako “náhrady za vyhledávání”.

16: Použití akademických citačních metod, jako [1] nebo [34]; toto je standardní praxe ve vědeckých kruzích, ale může být neintuitivní pro mnoho uživatelů.

Pro studii autoři shromáždili 21 expertů v oblasti umělé inteligence, zdravotnictví a medicíny, aplikovaných věd a vzdělávání a sociálních věd, všichni buď postdoktorální výzkumníci nebo kandidáti PhD. Účastníci interagovali se testovanými RAG systémy, zatímco mluvili o svých myšlenkových procesech nahlas, aby autoři mohli pochopit jejich vlastní racionální schéma.

Studie cituje rozsáhle pochybnosti a obavy účastníků o výkonu tří testovaných systémů.

Metodologie uživatelské studie byla poté systematizována do automatizované studie RAG systémů pomocí browserových kontrolních sad:

‘Velká automatizovaná evaluace systémů, jako jsou You.com, Perplexity.ai a BingChat, ukázala, že žádný z nich nedosáhl přijatelného výkonu napříč většinou metrik, včetně kritických aspektů souvisejících s manipulací, nepodporovanými prohlášeními a citační přesností.’

Autoři argumentují, že jak noví, tak zkušení uživatelé by měli být opatrní při používání třídy RAG systémů, které byly studovány. Navrhují také nový systém metrik, založený na nedostatcích nalezených ve studii, který by mohl tvořit základ větší technické kontroly v budoucnu.

Avšak rostoucí veřejná využívání RAG systémů vede autory také k tomu, aby prosazovali vhodnou legislativu a vyšší úroveň vynutitelné vládní politiky ve vztahu k agentům-pomocníkům AI vyhledávacích rozhraní.

Studie pochází od pěti výzkumníků z Pensylvánské státní univerzity a Salesforce a je nazvána Vyhledávače ve věku AI: Falešná slib faktických a verifikovatelných zdrojů. Práce se zabývá RAG systémy až do stavu umění v srpnu 2024

RAG kompromis

Autoři úvodu své práce připomínají čtyři známé nedostatky velkých jazykových modelů (LLM), kde jsou použity v rámci Answer Engines.

První, jsou náchylné k halucinaci informací a postrádají schopnost rozpoznat faktické nesrovnalosti. Druhý, mají potíže hodnotit přesnost citace v kontextu generované odpovědi. Třetí, mají tendenci preferovat data ze svých vlastních předem trénovaných vah a mohou odolávat datům z externě získaných dokumentů, i když by tato data mohla být novější nebo přesnější.

Poslední, RAG systémy mají tendenci lidem vyhovovat, sycophantické chování, často na úkor přesnosti informací v jejich odpovědích.

Všechny tyto tendence byly potvrzeny v obou aspektech studie, spolu s mnoha novými pozorováními o pastích RAG.

Práce považuje OpenAI’s SearchGPT RAG produkt (vydaný předplatitelům minulý týden, po odeslání nové studie), jako pravděpodobně vedoucí k uživatelskému přijetí RAG-založených vyhledávacích systémů, navzdory základním nedostatkům, na které výsledky studie naznačují*:

‘Vydaní OpenAI’s ‘SearchGPT,’ marketované jako ‘Google search killer’, dále zhoršuje [obavy]. Jak se zvyšuje závislost na těchto nástrojích, zvyšuje se i naléhavost porozumět jejich dopadu. Lindemann představuje koncept Sealed Knowledge, který kritizuje, jak tyto systémy omezují přístup k rozmanitým odpovědím kondenzací vyhledávacích dotazů do singulárních, autoritativních odpovědí, efektivní dekontextualizaci informací a zúžení uživatelů perspektiv.

‘Tato “zapečetění” znalostí podporuje výběrové zkreslení a omezuje marginalizované názory.’

Studie

Autoři nejprve otestovali svou studijní proceduru na třech z 24 vybraných účastníků, kteří byli pozváni prostřednictvím LinkedIn nebo e-mailu.

První fáze, pro zbývajících 21, zahrnovala Expertní informace na vyžádání, kde účastníci průměrně provedli kolem šesti vyhledávacích dotazů během 40minutové relace. Tato část se soustředila na získání a verifikaci faktických otázek a odpovědí, s potenciálními empirickými řešeními.

Druhá fáze se zabývala Debata na vyžádání, která se týkala subjektivních otázek, včetně ekologie, vegetariánství a politiky.

Generované studijní odpovědi z Perplexity (vlevo) a You Chat (vpravo). Zdroj: https://arxiv.org/pdf/2410.22349

Generované studijní odpovědi z Perplexity (vlevo) a You Chat (vpravo). Zdroj: https://arxiv.org/pdf/2410.22349

Pokud všechny systémy umožňovaly alespoň nějakou úroveň interaktivity s citacemi poskytnutými jako podpora pro generované odpovědi, studijní subjekty byly povzbuzeny k interakci s rozhraním co nejvíce.

V obou případech byli účastníci požádáni, aby formulovali své dotazy jak prostřednictvím RAG systému, tak i prostřednictvím konvenčního vyhledávače (v tomto případě Google).

Tři Answer Engines – You Chat, Bing Copilot a Perplexity – byly vybrány, protože jsou veřejně dostupné.

Většina účastníků již byli uživatelé RAG systémů, s různou frekvencí.

Kvůli omezením prostoru nemůžeme rozložit každou z 16 klíčových nedostatků nalezených ve studii, ale zde prezentujeme výběr některých nejzajímavějších a nejvíce osvětlujících příkladů.

Chybějící objektivní detail

Práce uvádí, že uživatelé našli, že odpovědi systémů často postrádaly objektivní detail, napříč oběma faktickými a subjektivními odpověďmi. Jeden z účastníků komentoval:

‘Bylo to jen snažení se odpovědět, aniž by mi dalo skutečnou odpověď nebo více promyšlenou odpověď, kterou jsem schopen získat s více vyhledávacími dotazy na Google.’

Jiný účastník poznamenal:

‘Je to příliš krátké a pouze shrnuje všechno. [Model] potřebuje mi poskytnout více dat pro tvrzení, ale je to velmi shrnuto.’

Chybějící holistický pohled

Autoři vyjadřují obavy z tohoto nedostatku nuance a specifity a uvádějí, že Answer Engines často nezobrazovaly více perspektiv na jakoukoli argumentaci, tendenci souhlasit s vnímaným zkreslením, inferovaným z uživatelského vlastního formulování otázky.

Jeden účastník řekl:

‘Chci se dozvědět více o opačné straně argumentace… toto je vše s jistou rezervou, protože nevíme druhou stranu a důkazy a fakta.’

Jiný účastník komentoval:

‘Není to dávání vám obou stran argumentace; není to argumentovat s vámi. Místo toho [model] vám říká, “you’re right… a zde jsou důvody, proč”.’

Přespříliš sebevědomý jazyk

Autoři pozorují, že všechny tři testované systémy vykazovaly použití přespříliš sebevědomého jazyka, dokonce i pro odpovědi, které se týkají subjektivních otázek. Uvádějí, že tento tón bude tendenci inspirovat neoprávněnou důvěru v odpověď.

Jeden účastník poznamenal:

‘Píše tak sebevědomě, že jsem přesvědčen, aniž bych se podíval na zdroj. Ale když se podíváte na zdroj, je to špatné a to mě činí pochybovat znovu.’

Jiný účastník komentoval:

‘Pokud někdo přesně neví správnou odpověď, bude důvěřovat tomu, i když je to špatně.’

Nesprávné citace

Jiným častým problémem bylo nesprávné přiřazení zdrojů citovaných jako autorita pro odpovědi RAG systémů, s jedním z účastníků studie, který tvrdil:

‘[Toto] tvrzení se nezdá být v zdroji. Jsem to znamená, že tvrzení je pravdivé; je to platné… ale nevím, odkud to bere tuto informaci.’

Autoři komentují:

‘Účastníci cítili, že systémy používají citace k legitimizaci své odpovědi, vytvářející iluzi kredibility. Tato fasáda byla odhalena pouze několika uživatelům, kteří pokračovali ve zkoumání zdrojů.’

Vybrání informací, aby se hodily dotazu

Vracíme se k pojmu lidem vyhovujícímu, sycophantickému chování v odpovědích RAG, studie zjistila, že mnoho odpovědí zdůrazňovalo určitý bod pohledu, místo toho, aby komplexně shrnulo téma, jako jeden účastník pozoroval:

‘Cítím, že [systém] je manipulativní. Bere pouze některé informace a cítím, že jsem manipulován, abych viděl pouze jednu stranu věcí.’

Jiný účastník komentoval:

‘[Zdroj] vlastně má obě pro a proti, a [systém] si vybral pouze požadované argumenty z tohoto odkazu, bez celkového obrazu.’

Pro další podrobné příklady (a více kritických citací z účastníků studie) odkazujeme čtenáře na zdroj článku.

Automatizovaný RAG

V druhé fázi širší studie autoři použili browserové skriptování k systematickému vyžádání dotazů ze tří testovaných RAG engine. Poté použili LLM systém (GPT-4o) k analýze odpovědí systémů.

Prohlášení byla analyzována pro relevance dotazu a Pro a proti prohlášení (tj. zda odpověď je pro, proti nebo neutrální, ve vztahu k implicitnímu zkreslení dotazu.

Skóre důvěryhodnosti odpovědi bylo také vyhodnoceno v této automatizované fázi, na základě Likertovy škály psychometrického testování. Zde LLM soudce byl doplněn dvěma lidskými anotátory.

Třetí operace zahrnovala použití web-scrapingu k získání plného textu citovaných webových stránek, prostřednictvím Jina.ai Reader nástroje. Avšak, jak je uvedeno jinde v článku, většina web-scraping nástrojů není schopna přístupu k paywalled stránkám více než většina lidí (ačkoli autoři poznamenávají, že Perplexity.ai byl známý překonáním této bariéry).

Další úvahy zahrnovaly, zda odpovědi citují zdroj (vypočtené jako “citační matice”), jakož i “faktickou podporu matici” – metriku ověřenou pomocí čtyř lidských anotátorů.

Takto byly získány 8 nadřazené metriky: jednostranná odpověď; přespříliš sebevědomá odpověď; relevantní prohlášení; ne citované zdroje; nesupported prohlášení; potřeba zdroje; citační přesnost; a citační úplnost.

Materiál, proti kterému byly tyto metriky testovány, sestával z 303 kurátorů otázek z uživatelské studie, což vedlo k 909 odpovědím napříč třemi testovanými systémy.

Kvantitativní hodnocení napříč třemi testovanými RAG systémy, založené na osmi metrikách.

Kvantitativní hodnocení napříč třemi testovanými RAG systémy, založené na osmi metrikách.

Pokud jde o výsledky, článek uvádí:

‘Podívejte se na tři metriky související s odpovědí, zjistíme, že všechny vyhodnocené odpověďové motory často (50-80%) generují jednostranné odpovědi, preferující souhlas s nabité formulací debatního dotazu nad prezentací více perspektiv v odpovědi, s Perplexity, která funguje horší než ostatní dva motory.

‘Toto zjištění souhlasí s [nálezem] našich kvalitativních výsledků. Překvapivě, ačkoli Perplexity je nejpravděpodobněji generovat jednostrannou odpověď, také generuje nejdelší odpovědi (18,8 prohlášení na odpověď v průměru), což naznačuje, že nedostatek rozmanitosti odpovědí není způsoben krátkostí odpovědi.

‘To znamená, že prodloužení délky odpovědi nemusí nutně zlepšit rozmanitost odpovědí.’

Autoři také poznamenávají, že Perplexity je nejpravděpodobněji používat sebevědomý jazyk (90% odpovědí), a že, na rozdíl od toho, ostatní dva systémy tendenci používat více opatrný a méně sebevědomý jazyk, kde jsou subjektivní obsahy ve hře.

You Chat byl jediným RAG rámcem, který dosáhl nulových necitovaných zdrojů pro odpověď, s Perplexity na 8% a Bing Chat na 36%.

Všechny modely prokázaly “významnou část” nepodporovaných prohlášení, a článek prohlašuje:

‘RAG rámec je inzerován jako řešení halucinačního chování LLM, vynucujícím, že LLM generuje odpověď založenou na zdrojových dokumentech, ale výsledky ukazují, že RAG-založené odpověďové motory stále generují odpovědi, které obsahují velkou část prohlášení, která nejsou podporována zdroji, které poskytují.

Kromě toho všechny testované systémy měly potíže se unterstütováním svých prohlášení citacemi:

‘You.Com a [Bing Chat] fungují slightly lépe než Perplexity, s asi dvěma třetinami citací, které odkazují na zdroj, který podporuje citované prohlášení, a Perplexity funguje horší s více než polovinou svých citací, které jsou nepřesné.

‘Tento výsledek je překvapující: citace není pouze nepřesná pro prohlášení, která nejsou podporována žádným zdrojem, ale zjistíme, že i když existuje zdroj, který podporuje prohlášení, všechny motory stále často citují jiný nesprávný zdroj, ztrácejí příležitost poskytnout správnou informační zdroj uživateli.

To znamená, že halucinační chování není pouze projevováno v prohlášeních, která nejsou podporována zdroji, ale také v nepřesných citacích, které brání uživatelům ověřit platnost informací.

Autoři uzavírají:

‘Žádný z odpověďových motorů nedosáhl dobrého výkonu na většině metrik, což naznačuje velký prostor pro zlepšení v odpověďových motorech.’

 

 

* Moje konverze autorů inline citací na hypertextové odkazy. Kde bylo nutné, jsem si vybral první z více citací pro hypertextový odkaz, z důvodu formátovacích praktičností.

Autoři zdůrazňují, ne já.

První publikováno v pondělí, 4. listopadu 2024

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai