Unghiul lui Anderson

Noua cercetare descoperă şaisprezece probleme majore cu sistemele RAG, inclusiv Perplexitatea

mm
Adaugă Unite.AI la sursele tale preferate pe Google
Image generated by ChatGPT-4o, with prompt ' Create a highly photorealistic panoramic image of a robot frantically searching the internet on a laptop. Do not stylize this image so that it looks like a false or AI-created image'

O cercetare recentă din Statele Unite a constatat că performanța în lumea reală a sistemelor de cercetare populare de Generare Augmentată de Recuperare (RAG), cum ar fi Perplexitatea și Bing Copilot, este mult sub nivelul marketingului și al adoptării populare care a făcut titluri în ultimele 12 luni.

Proiectul, care a implicat o participare extinsă la sondaj cu 21 de voci experte, a găsit nu mai puțin de 16 domenii în care sistemele RAG studiate (You Chat, Bing Copilot și Perplexitate) au produs motive de îngrijorare:

1: Lipsa de detalii obiective în răspunsurile generate, cu rezumate generice și o adâncime contextuală sau nuanță redusă.

2. Întărirea prejudecăților percepute ale utilizatorului, unde un motor RAG nu prezintă adesea o gamă de perspective, ci mai degrabă inferă și întărește prejudecățile utilizatorului, pe baza modului în care utilizatorul formulează o întrebare.

3. Limbaj excesiv de sigur, în special în răspunsuri subiective care nu pot fi stabilite empiric, ceea ce poate duce la faptul că utilizatorii au încredere în răspuns mai mult decât merită.

4: Limbaj simplist și lipsa de gândire critică și creativitate, unde răspunsurile efectiv patronizează utilizatorul cu informații “dumbed-down” și “de acord”, în loc de gândire și analiză bine gândite.

5: Attribuire greșită și citare incorectă a surselor, unde motorul de răspuns utilizează surse citate care nu susțin răspunsul său, creând iluzia credibilității.

6: Alegerea informațiilor din contextul inferat, unde agentul RAG pare să caute răspunsuri care susțin afirmația sa generată și estimarea a ceea ce utilizatorul dorește să audă, în loc de a-și baza răspunsurile pe o analiză obiectivă a surselor fiabile (posibil indicând un conflict între datele “baked” LLM și datele obținute din internet în timp real în răspuns la o întrebare).

7: Omiterea citărilor care susțin afirmațiile, unde materialul sursă pentru răspunsuri lipsește.

8: Furnizarea unui schema logic pentru răspunsurile sale, unde utilizatorii nu pot întreba de ce sistemul a prioritizat anumite surse în detrimentul altor surse.

9: Număr limitat de surse, unde majoritatea sistemelor RAG oferă de obicei trei surse de susținere pentru o afirmație, chiar dacă o diversitate mai mare de surse ar fi aplicabilă.

10: Surse orfane, unde datele din toate sau unele dintre citările sistemului nu sunt de fapt incluse în răspuns.

11: Folosirea unor surse neverificate, unde sistemul pare să fi preferat o sursă care este populară (adică, în termeni SEO) mai degrabă decât corectă din punct de vedere factual.

12: Surse redundante, unde sistemul prezintă multiple citări în care articolele sursă sunt esențialmente aceleași ca conținut.

13: Surse nefiltrate, unde sistemul oferă utilizatorului nicio modalitate de a evalua sau filtra citările oferite, forțând utilizatorii să ia criteriile de selecție pe încredere.

14: Lipsa de interactivitate sau explorabilitate, în care mai mulți participanți la studiu au fost frustrați că sistemele RAG nu au pus întrebări de clarificare, ci au presupus intenția utilizatorului din prima întrebare.

15: Necesitatea de verificare externă, unde utilizatorii se simt obligați să efectueze o verificare independentă a răspunsului furnizat, eliminând în mare măsură presupusa conveniență a RAG ca “înlocuitor pentru căutare”.

16: Folosirea metodelor de citare academice, cum ar fi [1] sau [34]; aceasta este o practică standard în cercurile științifice, dar poate fi neintuitivă pentru mulți utilizatori.

Pentru această lucrare, cercetătorii au adunat 21 de experți în inteligență artificială, sănătate și medicină, științe aplicate și educație și științe sociale, toți fiind cercetători postdoctorali sau candidați la doctorat. Participanții au interacționat cu sistemele RAG testate, vorbindu-și procesele de gândire cu voce tare, pentru a clarifica (pentru cercetători) propriul lor schema rațional.

Articolul citează pe larg îndoielile și preocupările participanților cu privire la performanța celor trei sisteme studiate.

Metodologia studiului a fost apoi sistematizată într-un studiu automat al sistemelor RAG, utilizând suite de control al browserului:

‘O evaluare la scară largă a sistemelor precum You.com, Perplexity.ai și BingChat a arătat că niciunul nu a atins o performanță acceptabilă în majoritatea metricilor, inclusiv aspecte critice legate de manipularea halucinațiilor, declarațiilor nesuportate și acuratețea citării.’

Autorii susțin pe larg (și cu asiduitate, în articolul cuprinzător de 27 de pagini) că atât utilizatorii noi, cât și cei experimentați ar trebui să exercite precauție atunci când utilizează clasa de sisteme RAG studiate. Ei propun, de asemenea, un nou sistem de metrice, bazat pe deficiențele găsite în studiu, care ar putea forma baza unei supravegheri tehnice mai mari în viitor.

Însă, creșterea utilizării publice a sistemelor RAG îi determină pe autori să susțină, de asemenea, legislația corespunzătoare și un nivel mai mare de politică guvernamentală aplicabilă în ceea ce privește interfețele de căutare asistate de agenți AI.

Studiul provine de la cinci cercetători de la Universitatea de Stat din Pennsylvania și Salesforce și se intitulează Motoarele de căutare într-o eră AI: Falsa promisiune a răspunsurilor cu surse verificabile și citate. Lucrarea acoperă sistemele RAG până la stadiul actual din august 2024

Tranzacția RAG

Autorii își încep lucrarea reiterând patru deficiențe cunoscute ale Modelelor Lingvistice Mari (LLM) atunci când sunt utilizate în Motoare de Răspuns.

În primul rând, ele sunt predispuse să halucineze informații și lipsesc de capacitatea de a detecta incoerențe factuale. În al doilea rând, au dificultăți în evaluarea acurateței unei citări în contextul unui răspuns generat. În al treilea rând, ele tind să favorizeze datele din greutățile lor pre-antrenate și pot rezista datelor din documentația externă recuperată, chiar dacă astfel de date ar putea fi mai recente sau mai precise.

În cele din urmă, sistemele RAG tind să se comporte într-un mod care place oamenilor, comportament sycophantic, adesea în detrimentul acurateței informațiilor din răspunsurile lor.

Toate aceste tendințe au fost confirmate în ambele aspecte ale studiului, printre multe observații noi despre capcanele RAG.

Articolul consideră SearchGPT RAG al OpenAI (lansat pentru abonați în urmă cu o săptămână, după ce articolul a fost trimis), ca fiind probabil să încurajeze adoptarea de către utilizatori a sistemelor de căutare bazate pe RAG, în ciuda deficiențelor de bază pe care rezultatele sondajului le sugerează:

‘Lansarea SearchGPT a OpenAI, comercializat ca un “ucigător de Google”, exacerbă și mai mult îngrijorările. Pe măsură ce crește dependența de aceste instrumente, crește și urgența de a înțelege impactul lor. Lindemann introduce conceptul de Cunoaștere Sigilată, care critică modul în care aceste sisteme limitează accesul la răspunsuri diverse prin condensarea cererilor de căutare în răspunsuri autoritative unice, desființând efectiv informația și îngustând perspectivele utilizatorului.

‘Această “sigilare” a cunoașterii perpetuează prejudecățile de selecție și restricționează perspectivele marginalizate.’

Studiul

Autorii au testat mai întâi procedura de studiu pe trei dintre cei 24 de participanți selectați, toți invitați prin mijloace precum LinkedIn sau e-mail.

Prima etapă, pentru cei 21 de participanți rămași, a implicat Recuperarea informațiilor de expertiză, unde participanții au efectuat în medie aproximativ șase cereri de căutare pe parcursul unei sesiuni de 40 de minute. Această secțiune s-a concentrat pe colectarea și verificarea întrebărilor și răspunsurilor bazate pe fapte cu soluții empirice potențiale.

Ce-a de-a doua fază a fost legată de Dezbaterea informațiilor de recuperare, care a abordat chestiuni subiective, inclusiv ecologie, vegetarianism și politică.

Răspunsuri generate de studiu de la Perplexity (stânga) și You Chat (dreapta). Sursă: https://arxiv.org/pdf/2410.22349

Răspunsuri generate de studiu de la Perplexity (stânga) și You Chat (dreapta). Sursă: https://arxiv.org/pdf/2410.22349

Deoarece toate sistemele au permis cel puțin un anumit nivel de interactivitate cu citările furnizate ca suport pentru răspunsurile generate, subiecții studiului au fost încurajați să interacționeze cu interfața cât mai mult posibil.

În ambele cazuri, participanților li s-a cerut să formuleze întrebările lor atât prin intermediul unui sistem RAG, cât și printr-un motor de căutare convențional (în acest caz, Google).

Cele trei motoare de răspuns – You Chat, Bing Copilot și Perplexitate – au fost alese pentru că sunt accesibile public.

Majoritatea participanților erau deja utilizatori ai sistemelor RAG, la frecvențe variate.

Din cauza limitărilor de spațiu, nu putem detalia fiecare dintre cele 16 deficiențe cheie documentate în studiu, dar prezentăm aici o selecție a unora dintre cele mai interesante și edificatoare exemple.

Lipsa de detalii obiective

Articolul menționează că utilizatorii au găsit adesea răspunsurile sistemelor lipsite de detalii obiective, atât în răspunsurile factuale, cât și în cele subiective. Unul a comentat:

‘A încercat doar să răspundă fără să-mi ofere un răspuns solid sau mai bine gândit, pe care pot să-l obțin prin mai multe căutări pe Google.’

Altul a observat:

‘Este prea scurt și doar rezumă totul. [Modelul] trebuie să-mi ofere mai multe date pentru a susține afirmația, dar este foarte rezumat.’

Lipsa de perspectivă holistică

Autorii exprimă îngrijorare cu privire la această lipsă de nuanță și specificitate și afirmă că motoarele de răspuns au eșuat adesea în a prezenta multiple perspective asupra oricărui argument, tending să se alinieze cu o prejudecată percepută inferată din modul în care utilizatorul a formulat întrebarea.

Un participant a spus:

‘Vreau să aflu mai multe despre partea opusă a argumentului… aceasta este cu o picătură de sare, deoarece nu cunoaștem cealaltă parte și dovezi.’

Altul a comentat:

‘Nu ne oferă ambele părți ale argumentului; nu ne argumentează. În schimb, [modelul] ne spune doar că suntem în drept… și ne oferă motivele pentru care.’

Limbaj sigur

Autorii observă că toate cele trei sisteme testate au prezentat utilizarea unui limbaj excesiv de sigur, chiar și pentru răspunsuri care acoperă subiecte subiective. Ei susțin că acest ton va tendențios să inspire încredere nejustificată în răspuns.

Un participant a notat:

‘Scrie atât de sigur, încât mă simt convins fără să caut sursa. Dar când caut sursa, este rea și asta mă face să mă îndoiesc din nou.’

Altul a comentat:

‘Dacă cineva nu știe exact răspunsul corect, va avea încredere în acesta chiar și atunci când este greșit.’

Citări incorecte

O altă problemă frecventă a fost atribuirea greșită a surselor citate ca autoritate pentru răspunsurile sistemelor RAG, unul dintre subiecții studiului afirmând:

‘Acestă afirmație nu pare să fie în sursă. Înseamnă că afirmația este adevărată; este valabilă… dar nu știu de unde obține această informație.’

Autorii articolului menționează:

‘Participanții au simțit că sistemele utilizează citări pentru a legitima răspunsul lor, creând o iluzie de credibilitate. Această fațadă a fost revelată doar pentru câțiva utilizatori care au procedat să examineze sursele.’

Alegerea informațiilor pentru a se potrivi întrebării

Revenind la noțiunea de comportament care place oamenilor, sycophantic, în răspunsurile RAG, studiul a constatat că multe răspunsuri au subliniat un anumit punct de vedere, în loc de a rezuma cuprinzător subiectul, un participant observând:

‘Simt că [sistemul] este manipulativ. Ia doar anumite informații și mă face să văd doar o parte a lucrurilor.’

Altul a opinat:

‘[Sursa] are de fapt atât avantaje, cât și dezavantaje, și a ales să selecteze doar argumentele necesare din acest link, fără a oferi imaginea de ansamblu.’

Pentru exemple mai detaliate (și citate critice multiple din participanții la sondaj), ne referim cititorul la articolul sursă.

RAG Automatizat

În a doua etapă a studiului mai larg, cercetătorii au utilizat scripting-ul browserului pentru a solicita sistematic întrebări de la cele trei sisteme RAG testate. Apoi au utilizat un sistem LLM (GPT-4o) pentru a analiza răspunsurile sistemelor.

Declarațiile au fost analizate pentru relevanța întrebării și Afirmații Pro și Contra (adică, dacă răspunsul este pentru, împotriva sau neutru, în ceea ce privește prejudecata implicită a întrebării.

De asemenea, a fost evaluat un Scor de Încredere a Răspunsului, pe baza metodei de testare psihometrică Likert. Aici, judecătorul LLM a fost completat de doi annotatori umani.

O a treia operațiune a implicat utilizarea scraping-ului web pentru a obține conținutul complet al paginilor web citate, prin instrumentul Jina.ai Reader. Cu toate acestea, așa cum s-a menționat în altă parte a articolului, majoritatea instrumentelor de scraping web nu pot accesa site-urile cu plată mai mult decât o pot face majoritatea oamenilor (deși autorii observă că Perplexity.ai a fost cunoscută pentru a a ocoli această barieră).

Considerații suplimentare au inclus dacă răspunsurile au citat o sursă (calculată ca o “matrice de citare”), precum și o “matrice de susținere factuală” – o metrică verificată cu ajutorul a patru annotatori umani.

Astfel, au fost obținute opt metrice cuprinzătoare: răspuns unilateral; răspuns excesiv de sigur; declarație relevantă; surse necitate; afirmații nesuportate; necesitatea surselor; acuratețea citării; și amănuntul citării.

Materialul împotriva căruia aceste metrice au fost testate a constat din 303 de întrebări curate din faza de studiu cu utilizatorii, rezultând 909 de răspunsuri de-a lungul celor trei sisteme RAG testate.

Evaluare cantitativă pe cele trei sisteme RAG testate, pe baza a opt metrice.

Evaluare cantitativă pe cele trei sisteme RAG testate, pe baza a opt metrice.

În ceea ce privește rezultatele, articolul afirmă:

‘Privind cele trei metrice legate de textul răspunsului, constatăm că toate motoarele de răspuns evaluate generează adesea (50-80%) răspunsuri unilaterale, favorizând acordul cu o formulare încărcată a unei întrebări de dezbatere mai degrabă decât prezentarea mai multor perspective în răspuns, Perplexitatea performând mai prost decât celelalte două motoare.’

‘Acest rezultat se aliniază cu [rezultatele noastre] calitative. Surprinzător, deși Perplexitatea este cea mai probabilă să genereze un răspuns unilateral, ea generează și cele mai lungi răspunsuri (18,8 declarații per răspuns în medie), indicând că lipsa de diversitate a răspunsului nu se datorează scurtei lungimi a răspunsului. ‘

‘Cu alte cuvinte, creșterea lungimii răspunsului nu îmbunătățește neapărat diversitatea răspunsului.’

Autorii menționează, de asemenea, că Perplexitatea este cea mai probabilă să utilizeze un limbaj sigur (90% din răspunsuri), și că, în schimb, celelalte două sisteme tind să utilizeze un limbaj mai prudent și mai puțin sigur atunci când se ocupă de conținut subiectiv.

You Chat a fost singurul cadru RAG care a obținut zero surse necitate pentru un răspuns, Perplexitatea având 8% și Bing Chat având 36%.

Toate modelele au prezentat o “proporție semnificativă” de afirmații nesuportate, iar articolul declară:

‘Cadru RAG este comercializat ca o soluție pentru comportamentul halucinatoriu al LLM, prin impunerea ca un LLM să genereze un răspuns bazat pe documente sursă, dar rezultatele arată că motoarele de răspuns RAG încă generează răspunsuri care conțin o proporție mare de afirmații nesuportate de sursele pe care le oferă.

În plus, toate sistemele testate au avut dificultăți în a-și susține afirmațiile cu citări:

‘You.Com și [Bing Chat] performă ușor mai bine decât Perplexitatea, cu aproximativ două treimi din citări care trimit la o sursă care susține afirmația citată, și Perplexitatea performă mai prost, cu mai mult de jumătate din citările sale fiind inexacte. ‘

‘Acest rezultat este surprinzător: citarea nu este doar incorectă pentru afirmații care nu sunt susținute de nicio sursă, dar găsim că chiar și atunci când există o sursă care susține o afirmație, toate motoarele încă frecvent citează o sursă incorectă diferită, ratând ocazia de a oferi informații corecte de sursă utilizatorului.’

În alte cuvinte, comportamentul halucinatoriu nu este doar prezent în afirmații care nu sunt susținute de surse, ci și în citări inexacte care împiedică utilizatorii să verifice valabilitatea informației.

Autorii concluzionează:

‘Niciunul dintre motoarele de răspuns nu atinge o performanță bună în majoritatea metricilor, evidențiind un spațiu larg de îmbunătățire în ceea ce privește motoarele de răspuns.’

 

 

* Conversia mea a citărilor inline ale autorilor în legături hipertext. Atunci când a fost necesar, am ales prima dintre multiplele citări pentru legătura hipertext, din cauza problemelor practice de formatare.

Accentuarea autorilor, nu a mea.

Publicat pentru prima dată luni, 4 noiembrie 2024

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai