Kąt Andersona
Nowe badanie ujawnia szesnaście poważnych problemów z systemami RAG, w tym Perplexity

Niedawne badanie przeprowadzone w Stanach Zjednoczonych wykazało, że rzeczywiste wyniki popularnych systemów generacji wspomaganej przez odzyskiwanie (RAG), takich jak Perplexity i Bing Copilot, znacznie odbiegają od marketingowego szumu i powszechnego zainteresowania, które zdobyły nagłówki w ciągu ostatnich 12 miesięcy.
Projekt, w którym wzięło udział 21 ekspertów, wykazał aż 16 obszarów, w których badane systemy RAG (You Chat, Bing Copilot i Perplexity) wywołały powody do niepokoju:
1: Brak obiektywnych szczegółów w generowanych odpowiedziach, z ogólnymi podsumowaniami i niedostateczną głębią kontekstową lub nuansami.
2. Potwierdzenie postrzeganego uprzedzenia użytkownika, gdzie silnik RAG często nie przedstawia zakresu punktów widzenia, lecz inferuje i potwierdza uprzedzenie użytkownika, w oparciu o sposób, w jaki użytkownik sformułował pytanie.
3. Nadmiernie pewne sformułowania, szczególnie w odpowiedziach subiektywnych, które nie mogą być ustalone empirycznie, co może prowadzić do tego, że użytkownicy bardziej ufają odpowiedziom, niż na to zasługują.
4: Uproszczone sformułowania i brak myślenia krytycznego oraz kreatywności, gdzie odpowiedzi skutecznie patronizują użytkownikowi “uproszczonymi” i “zgodnymi” informacjami, zamiast przemyślanymi rozważaniami i analizami.
5: Nieprawidłowe przypisywanie i cytowanie źródeł, gdzie silnik odpowiedzi używa cytowanych źródeł, które nie wspierają jego odpowiedzi, tworząc iluzję wiarygodności.
6: Selektywne wybieranie informacji z kontekstu, gdzie agent RAG wydaje się szukać odpowiedzi, które wspierają jego wygenerowaną tezę i jego szacowanie tego, co użytkownik chce usłyszeć, zamiast opierać swoje odpowiedzi na obiektywnej analizie wiarygodnych źródeł (co może wskazywać na konflikt między “wbudowanymi” danymi LLM a danymi, które uzyskuje na bieżąco z Internetu w odpowiedzi na zapytanie).
7: Pominięcie cytowań, które wspierają oświadczenia, gdzie materiał źródłowy dla odpowiedzi jest nieobecny.
8: Brak logicznego schematu dla odpowiedzi, gdzie użytkownicy nie mogą zapytać, dlaczego system priorytetowo traktował pewne źródła nad inne.
9: Ograniczona liczba źródeł, gdzie większość systemów RAG zwykle zapewnia około trzy wspierające źródła dla oświadczenia, nawet w przypadku, gdy większa różnorodność źródeł byłaby odpowiednia.
10: Osierocone źródła, gdzie dane z wszystkich lub niektórych wspierających cytowań systemu nie są rzeczywiście uwzględnione w odpowiedzi.
11: Użycie niepewnych źródeł, gdzie system wydaje się preferować źródło, które jest popularne (tj. w sensie SEO), a nie faktograficznie poprawne.
12: Redundantne źródła, gdzie system przedstawia wiele cytowań, w których źródłowe artykuły są podstawowo takie same.
13: Niefiltrowane źródła, gdzie system nie oferuje użytkownikowi żadnego sposobu, aby ocenić lub przefiltrować oferowane cytowania, zmuszając użytkowników do zaufania kryteriom selekcji.
14: Brak interakcji lub eksploracji, w którym kilku uczestników badania użytkowników było sfrustrowanych, że systemy RAG nie zadawały pytań wyjaśniających, lecz zakładały intencję użytkownika od pierwszego zapytania.
15: Potrzeba zewnętrznej weryfikacji, gdzie użytkownicy czują, że muszą wykonać niezależną weryfikację dostarczonych odpowiedzi, co w znacznej mierze usuwa rzekomą wygodę RAG jako “zastępstwa dla wyszukiwania”.
16: Użycie metod cytowań akademickich, takich jak [1] lub [34]; jest to standardowa praktyka w kręgach naukowych, ale może być nieintuicyjna dla wielu użytkowników.
Dla pracy badawczej zebrało się 21 ekspertów w dziedzinie sztucznej inteligencji, ochrony zdrowia i medycyny, nauk stosowanych i edukacji oraz nauk społecznych, wszyscy byli albo badaczami po doktoracie, albo kandydatami na stopień doktora. Uczestnicy wchodzili w interakcje z testowanymi systemami RAG, mówiąc na głos swoje procesy myślowe, aby wyjaśnić (dla badaczy) swoje własne schematy racjonalne.
Artykuł obszernie cytuję wątpliwości i obawy uczestników dotyczące wyników trzech systemów.
Metodologia badania użytkowników została następnie usystematyzowana w badaniu zautomatyzowanym systemów RAG, z użyciem pakietów sterowania przeglądarką:
‘Duże, zautomatyzowane badanie systemów takich jak You.com, Perplexity.ai i BingChat wykazało, że żaden z nich nie spełnił akceptowalnych wyników w większości wskaźników, w tym krytycznych aspektów związanych z obsługą halucynacji, niepopartych oświadczeń i dokładności cytowań.’
Autorzy argumentują długo (i starannie, w obszernym 27-stronicowym artykule), że zarówno nowi, jak i doświadczeni użytkownicy powinni zachować ostrożność przy korzystaniu z klasy systemów RAG, które zostały zbadane. Proponują również nowy system wskaźników, oparty na słabościach znalezionych w badaniu, który mógłby stanowić podstawę większej kontroli technicznej w przyszłości.
Jednak rosnące publiczne korzystanie z systemów RAG skłania autorów również do opowiedzenia się za odpowiednimi przepisami i wyższym poziomem egzekwowalnej polityki rządowej w odniesieniu do interfejsów wyszukiwania wspomaganych przez agenty AI.
Badanie pochodzi od pięciu badaczy z Pennsylvania State University i Salesforce, a jego tytuł to Wyszukiwarki w erze AI: fałszywa obietnica faktograficznych i weryfikowalnych odpowiedzi z cytowanymi źródłami. Praca obejmuje systemy RAG aż do stanu sztuki w sierpniu 2024 roku
Kompromis RAG
Autorzy wstępnie przedstawiają swoją pracę, powtarzając cztery znane słabości modeli językowych (LLM), gdzie są one używane w silnikach odpowiedzi.
Po pierwsze, są one skłonne halucynować informacje, i brakuje im zdolności do wykrywania nieścisłości faktograficznych. Po drugie, mają trudności z oceną dokładności cytowania w kontekście wygenerowanej odpowiedzi. Po trzecie, tendencja do preferowania danych z ich własnych wstępnie wytrenowanych wag, i mogą one opierać się danym z zewnętrznie pobranych dokumentów, nawet jeśli takie dane mogą być bardziej aktualne lub dokładne.
Wreszcie, systemy RAG skłaniają się ku ludziom, sycfancyjnym zachowaniom, często kosztem dokładności informacji w swoich odpowiedziach.
Wszystkie te tendencje zostały potwierdzone w obu aspektach badania, wśród wielu nowych obserwacji na temat pułapek RAG.
Artykuł widzi produkt OpenAI SearchGPT RAG jako prawdopodobny do zachęcenia użytkowników do przyjęcia systemów wyszukiwania opartych na RAG, pomimo podstawowych słabości, na które wskazują wyniki ankiety*:
‘Wydanie OpenAI “SearchGPT”, zmarketowane jako “zabójca Google”, dodatkowo nasila te obawy. Im bardziej rośnie zależność od tych narzędzi, tym bardziej pilne staje się zrozumienie ich wpływu. Lindemann wprowadza pojęcie “zamkniętej wiedzy”, które krytykuje, w jaki sposób te systemy ograniczają dostęp do różnorodnych odpowiedzi, kondensując zapytania wyszukiwania w pojedyncze, autorytatywne odpowiedzi, efektywnie dekontekstualizując informacje i zawężając perspektywy użytkownika użytkownika.
‘To “zamknięcie” wiedzy utrwala selektywne uprzedzenia i ogranicza marginesowe punkty widzenia.’
Badanie
Autorzy najpierw przetestowali swoją procedurę badawczą na trzech z 24 wybranych uczestników, wszystkich zaproszonych za pomocą takich środków, jak LinkedIn lub e-mail.
Pierwszy etap, dla pozostałych 21, obejmował odzyskiwanie informacji ekspertów, gdzie uczestnicy średnio wykonali około sześciu zapytań wyszukiwania w ciągu 40-minutowej sesji. Ta sekcja koncentrowała się na pozyskiwaniu i weryfikacji pytań i odpowiedzi opartych na faktach z potencjalnymi rozwiązaniami empirycznymi.
Druga faza dotyczyła odzyskiwania informacji debaty, która zajmowała się kwestiami subiektywnymi, w tym ekologią, wegetarianizmem i polityką.

Wygenerowane odpowiedzi z Perplexity (po lewej) i You Chat (po prawej). Źródło: https://arxiv.org/pdf/2410.22349
Ponieważ wszystkie systemy pozwalały na pewien poziom interakcji z cytowaniami dostarczonymi jako wsparcie dla wygenerowanych odpowiedzi, uczestnicy badania byli zachęcani do interakcji z interfejsem tak bardzo, jak to możliwe.
W obu przypadkach uczestnicy byli proszeni o sformułowanie swoich zapytań zarówno za pomocą systemu RAG, jak i konwencjonalnej wyszukiwarki (w tym przypadku Google).
Trzy silniki odpowiedzi – You Chat, Bing Copilot i Perplexity – zostały wybrane, ponieważ są one publicznie dostępne.
Większość uczestników była już użytkownikami systemów RAG, na różnych poziomach częstotliwości.
Ze względu na ograniczenia przestrzenne nie możemy rozbić każdego z szesnastu obszernie udokumentowanych słabości znalezionych w badaniu, ale przedstawiamy wybrane interesujące i pouczające przykłady.
Brak obiektywnych szczegółów
Artykuł zauważa, że użytkownicy często stwierdzali, iż odpowiedzi systemów często nie zawierały obiektywnych szczegółów, zarówno w odpowiedziach faktograficznych, jak i subiektywnych. Jeden z uczestników skomentował:
‘To było po prostu próbą odpowiedzi bez udzielenia mi solidnej odpowiedzi lub bardziej przemyślanej odpowiedzi, którą mogę uzyskać za pomocą wielu wyszukiwań Google.’
Inny uczestnik zauważył:
‘Jest to zbyt krótkie i po prostu podsumowuje wszystko. [Model] powinien mi dostarczyć więcej danych do poparcia twierdzenia, ale jest to bardzo zsumowane.’
Brak holistycznego punktu widzenia
Autorzy wyrażają obawy dotyczące braku nuansów i szczegółów, i stwierdzają, że silniki odpowiedzi często nie przedstawiają wielu punktów widzenia na temat jakiegokolwiek argumentu, skłaniając się ku uprzedzeniu postrzeganemu w sformułowaniu pytania przez użytkownika.
Jeden z uczestników powiedział:
‘Chcę dowiedzieć się więcej o drugiej stronie argumentu… to wszystko z pewnym zastrzeżeniem, ponieważ nie znamy drugiej strony i dowodów.’
Inny skomentował:
‘Nie daje mi obu stron argumentu; nie prowadzi ze mną debaty. Zamiast tego [model] mówi mi: “masz rację… i oto powody, dla których”. ‘
Pewne sformułowania
Autorzy zauważają, że wszystkie trzy przetestowane systemy wykazywały się pewnymi sformułowaniami, nawet w odpowiedziach subiektywnych. Twierdzą, że taki ton będzie skłaniał do niesłusznego zaufania do odpowiedzi.
Uczestnik zauważył:
‘Pisze tak pewnie, że czuję się przekonany, nawet nie patrząc na źródło. Ale kiedy spojrzałem na źródło, było to złe i to sprawiło, że zacząłem je kwestionować ponownie.’
Inny skomentował:
‘Jeśli ktoś nie wie dokładnie, co jest prawidłowe, zaufa temu, nawet jeśli jest to błędne.’
Nieprawidłowe cytowania
Innym częstym problemem było nieprawidłowe przypisywanie cytowanym źródłom władzy dla odpowiedzi systemów RAG, z jednym z uczestników badania, który twierdził:
‘To oświadczenie nie wydaje się być w źródle. Mam na myśli, że oświadczenie jest prawdziwe; jest ważne… ale nie wiem, skąd ono to bierze.’
Autorzy komentują†:
‘Uczestnicy czuli, że systemy używają cytowań, aby uzasadnić swoje odpowiedzi, tworząc iluzję wiarygodności. Ta fasada była ujawniona tylko niektórym użytkownikom, którzy postanowili zbadać źródła.’
Selektywne wybieranie informacji
Wracając do pojęcia ludziom, sycfancyjnym zachowaniom w odpowiedziach RAG, badanie wykazało, że wiele odpowiedzi podkreślało konkretny punkt widzenia, zamiast komprehensywnie podsumowywać temat, jak jeden z uczestników zauważył:
‘Czuję, że [system] jest manipulacyjny. Bierze tylko niektóre informacje i sprawia, że czuję, iż jestem manipulowany, aby zobaczyć tylko jedną stronę rzeczy.’
Inny skomentował:
‘[Źródło] ma tak naprawdę zarówno zalety, jak i wady, a on wybrał tylko te wymagane argumenty z tego linku, bez całościowego obrazu.’
Dla dalszych, bardziej szczegółowych przykładów (i wielu krytycznych cytatów z uczestników badania) odsyłamy czytelnika do oryginalnego artykułu.
Zautomatyzowane RAG
W drugiej fazie szerszego badania badacze użyli skryptów przeglądarkowych, aby systematycznie zapytać trzy badane silniki RAG. Następnie użyli systemu LLM (GPT-4o), aby przeanalizować odpowiedzi systemów.
Oświadczenia zostały przeanalizowane pod kątem istotności zapytania i oświadczeń za i przeciw (tj. czy odpowiedź jest za, przeciw lub neutralna w odniesieniu do ukrytego uprzedzenia zapytania).
Wynik ufności odpowiedzi został również oceniony w tej zautomatyzowanej fazie, na podstawie metody testowania psychometrycznego skali Likerta. Tutaj sędzia LLM został wspomagany przez dwóch annotatorów ludzkich.
Trzecia operacja obejmowała użycie web-scrapingu, aby uzyskać pełną treść cytowanych stron internetowych za pomocą narzędzia Jina.ai Reader. Jednak, jak zauważono gdzie indziej w artykule, większość narzędzi web-scrapingu nie jest w stanie uzyskać dostępu do stron z paywallem (chociaż autorzy zauważają, że Perplexity.ai był znany z obejścia tej bariery).
Dodatkowe rozważania dotyczyły tego, czy odpowiedzi cytowały źródło (obliczane jako “macierz cytowań”), a także “macierz wsparcia faktograficznego” – wskaźnik zweryfikowany z pomocą czterech annotatorów ludzkich.
W ten sposób uzyskano 8 wskaźników ogólnych: odpowiedź jednostronna; odpowiedź pewna; oświadczenie istotne; niecytowane źródła; oświadczenia niepoparte; konieczność źródła; dokładność cytowań; i całkowitość cytowań.
Materiał, w odniesieniu do którego te wskaźniki zostały przetestowane, składał się z 303 starannie wyselekcjonowanych pytań z fazy badania użytkowników, w wyniku czego otrzymano 909 odpowiedzi w trzech testowanych systemach.

Ilościowa ocena w trzech testowanych systemach RAG, na podstawie ośmiu wskaźników.
Odnośnie do wyników, artykuł stwierdza:
‘Patrząc na trzy wskaźniki dotyczące tekstu odpowiedzi, stwierdzamy, że wszystkie oceniane silniki odpowiedzi często (50-80%) generują odpowiedzi jednostronne, faworyzując zgodność z sformułowaniem debaty nad przedstawieniem wielu punktów widzenia w odpowiedzi, przy czym Perplexity wykonuje gorzej niż pozostałe dwa silniki.
‘To odkrycie jest zgodne z naszymi wynikami jakościowymi. Co ciekawe, chociaż Perplexity jest najbardziej skłonna do generowania odpowiedzi jednostronnych, generuje również najdłuższe odpowiedzi (średnio 18,8 oświadczeń na odpowiedź), co wskazuje, że brak różnorodności odpowiedzi nie wynika z ich krótkości.
‘Innymi słowy, zwiększanie długości odpowiedzi niekoniecznie poprawia różnorodność odpowiedzi.’
Autorzy zauważają również, że Perplexity jest najbardziej skłonna do używania pewnych sformułowań (90% odpowiedzi), i że, w przeciwieństwie do tego, pozostałe dwa systemy mają tendencję do używania bardziej ostrożnych i mniej pewnych sformułowań, gdy chodzi o treści subiektywne.
You Chat był jedyną ramą RAG, która osiągnęła zero niecytowanych źródeł dla odpowiedzi, przy czym Perplexity miała 8%, a Bing Chat 36%.
Wszystkie modele wykazały “znaczną proporcję” niepopartych oświadczeń, a artykuł oświadcza†:
‘Rama RAG jest reklamowana jako rozwiązanie zachowania halucynacyjnego LLM, poprzez wymuszenie, aby LLM generował odpowiedź opartą na dokumentach źródłowych, jednak wyniki pokazują, że silniki odpowiedzi oparte na RAG nadal generują odpowiedzi zawierające dużą proporcję oświadczeń niepopartych przez źródła, które dostarczają.‘
Ponadto wszystkie testowane systemy miały trudności z poparciem swoich oświadczeń cytowaniami:
‘You.Com i [Bing Chat] wykonują nieco lepiej niż Perplexity, z których około dwie trzecie cytowań wskazują na źródło, które wspiera cytowane oświadczenie, a Perplexity wykonuje gorzej, z ponad połową cytowań, które są nieprawidłowe.
‘To wynik jest zaskakujący: cytowanie nie jest tylko nieprawidłowe dla oświadczeń, które nie są wspierane przez żadne źródło, ale stwierdzamy, że nawet gdy istnieje źródło, które wspiera oświadczenie, wszystkie silniki nadal często cytują inne nieprawidłowe źródło, pomijając okazję do dostarczenia użytkownikom prawidłowych informacji o pochodzeniu.
‘Innymi słowy, zachowanie halucynacyjne nie jest wystawione tylko w oświadczeniach, które nie są wspierane przez źródła, ale również w nieprawidłowych cytowaniach, które uniemożliwiają użytkownikom weryfikację ważności informacji.‘
Autorzy kończą:
‘Żaden z silników odpowiedzi nie osiągnął dobrych wyników w większości wskaźników, wskazując na duże pole do poprawy w silnikach odpowiedzi.’
* Moja konwersja cytowań autorów na linki hipertekstowe. Gdzie było to konieczne, wybrałem pierwsze z wielu cytowań do linku hipertekstowego, ze względu na praktyczne względy formatowania.
† Nacisk autorów, nie mój.
Pierwotnie opublikowane w poniedziałek, 4 listopada 2024












