Погляд Anderson
Нові дослідження виявили шістнадцять великих проблем із системами RAG, включаючи Perplexity

Недавнє дослідження з США виявило, що реальна продуктивність популярних систем генерації з підтримкою пошукових запитів (RAG) таких як Perplexity і Bing Copilot значно поступається як маркетинговому хайпу, так і популярному прийняттю, яке набуло заголовків за останні 12 місяців.
Проект, який включав широке опитування експертів, у якому взяли участь 21 експерт, виявив не менше 16 областей, у яких вивчені системи RAG (You Chat, Bing Copilot і Perplexity) викликали занепокоєння:
1: Відсутність об’єктивної деталізації у згенерованих відповідях, з загальними резюме та бідною контекстною глибиною або нюансами.
2. Узаконення сприйманого користувачем упередження, де система RAG часто не представляє діапазон точок зору, а натомість припускає та узаконює упередження користувача, засноване на тому, як користувач формулює питання.
3. Надмірно впевнена мова, особливо у суб’єктивних відповідях, які не можуть бути емпірично встановлені, що може привести до того, що користувачі довіряють відповіді більше, ніж вона заслуговує.
4: Проста мова та відсутність критичного мислення та креативності, де відповіді фактично спрощують інформацію для користувача з “дumbed-down” та “згодними” відомостями, замість ретельно продуманої інформації та аналізу.
5: Неправильне цитування джерел, де система відповідає на запитання, використовуючи цитовані джерела, які не підтримують її відповідь/і, створюючи ілюзію авторитету.
6: Вибір інформації з інферованого контексту, де агент RAG здається шукає відповіді, які підтримують його згенеровану тезу та його оцінку того, чого хоче користувач, замість того, щоб базувати свої відповіді на об’єктивному аналізі надійних джерел (можливо, вказуючи на конфлікт між “запечатаними” даними LLM та даними, отриманими онлайн у відповідь на запит).
7: Виключення цитат, які підтримують твердження, де джерельний матеріал для відповідей відсутній.
8: Надання логічної схеми для своїх відповідей, де користувачі не можуть запитати, чому система пріоритезує певні джерела над іншими джерелами.
9: Обмежена кількість джерел, де більшість систем RAG зазвичай надають близько трьох джерел, що підтверджують твердження, навіть якщо більша різноманітність джерел була б актуальною.
10: Осиротілі джерела, де дані з усіх або деяких підтримувальних цитат системи фактично не включені до відповіді.
11: Використання ненадійних джерел, де система здається надає перевагу джерелу, яке є популярним (тобто в термінах SEO), а не фактично правильним.
12: Редунданти джерела, де система представляє кілька цитат, у яких джерельні статті є по суті однаковими за змістом.
13: Нефільтровані джерела, де система пропонує користувачеві жодного способу оцінити або фільтрувати запропоновані цитати, змушуючи користувачів довіряти критеріям відбору.
14: Відсутність інтерактивності або досліджуваності, де кілька учасників дослідження були розчаровані тим, що системи RAG не ставили уточнюючих питань, а припускали намір користувача з першого запиту.
15: Потрібність зовнішньої верифікації, де користувачі відчувають потребу проводити незалежну верифікацію наданої відповіді/ей, що суттєво знижує передбачувану зручність RAG як “заміни пошукової системи”.
16: Використання академічних методів цитування, таких як [1] або [34]; це стандартна практика в наукових колах, але може бути незрозумілою для багатьох користувачів.
Для роботи дослідники зібрали 21 експерта з галузі штучного інтелекту, охорони здоров’я та медицини, прикладних наук та освіти та соціальних наук, усіх або післядокторантів, або кандидатів наук. Учасники взаємодіяли з тестованими системами RAG, висловлюючи свої думки вголос, щоб прояснити (для дослідників) свій власний раціональний схем.
Паперу широко цитує сумніви та занепокоєння учасників щодо продуктивності трьох систем, які були вивчені.
Методологія дослідження була потім систематизована в автоматичне дослідження систем RAG, використовуючи набори контролю браузера:
‘Великомасштабне автоматичне оцінювання систем, таких як You.com, Perplexity.ai та BingChat, показало, що жодна з них не відповідає прийнятній продуктивності за більшість метрик, включаючи критичні аспекти, пов’язані з обробкою галюцинацій, непідтримуваних тверджень та точності цитування.’
Автори доводять, що як нові, так і досвідчені користувачі повинні проявляти обережність при використанні класу систем RAG, які були вивчені. Вони також пропонують нову систему метрик, засновану на недоліках, виявлених у дослідженні, яка могла б скласти основу більшої технічної нагляду в майбутньому.
Однак, зростаюче публічне використання систем RAG спонукає авторів також адвокувати законодавство та більший рівень державної політики щодо інтерфейсів пошукових систем, підтримуваних агентами штучного інтелекту.
Дослідження студії походять від п’яти дослідників з університету штату Пенсільванія та Salesforce, і називається Пошукові системи в епоху штучного інтелекту: хибна обіцянка фактичних та верифікованих джерел, позначених цитатами. Робота охоплює системи RAG до стану мистецтва в серпні 2024 року
Торгівля RAG
Автори передмова своєї роботи повторюють чотири відомі недоліки великих мовних моделей (LLM), де вони використовуються в рамках пошукових систем.
По-перше, вони схильні галюцинувати інформацію, і не мають можливості виявляти фактичні несучності. По-друге, вони мають труднощі оцінювати точність цитати в контексті згенерованої відповіді. По-третє, вони схильні віддавати перевагу даним з власних попередньо натренованих ваг, і можуть опиратися даним, отриманим з зовнішніх документів, навіть якщо такі дані можуть бути більш недавніми або точними.
По-четверте, системи RAG схильні до людського угодливого, сикофантського поведінки, часто за рахунок точності інформації у своїх відповідях.
Всі ці тенденції були підтверджені в обох аспектах дослідження, серед багатьох нових спостережень про недоліки RAG.
Паперу розглядає OpenAI’s SearchGPT продукт RAG (видалений для підписників останнього тижня, після того, як нова робота була надіслана), як імовірно заохочуватиме прийняття користувачами пошукових систем на основі RAG, незважаючи на фундаментальні недоліки, на які вказують результати опитування*:
‘Випуск OpenAI “SearchGPT”, який ринковується як убивця Google, ще більше загострює ці проблеми. Коли зростає залежність від цих інструментів, зростає й терміновість розуміння їхнього впливу. Lindemann вводить концепцію “запечатаного знання”, яка критикує, як ці системи обмежують доступ до різноманітних відповідей, конденсуючи пошукові запити в одиницю, авторитетні відповіді, ефективно деконтекстуалізуючи інформацію та звужуючи перспективи користувача.
‘Це “запечатування” знання підтримує вибіркові упередження та обмежує маргіналізовані точки зору.’
Дослідження
Автори спочатку протестували свою процедуру дослідження на трьох з 24 вибраних учасників, усіх запрошених за допомогою таких засобів, як LinkedIn або електронна пошта.
Перший етап, для решти 21 учасника, включав Експертизу пошуку інформації, де учасники в середньому мали близько шести пошукових запитів за 40-хвилинну сесію. Ця секція зосередилася на зборі та верифікації фактних питань та відповідей, з потенційними емпіричними рішеннями.
Другий етап стосувався Дебатів пошуку інформації, який займався суб’єктивними питаннями, включаючи екологію, вегетаріанство та політику.

Згенеровані відповіді дослідження з Perplexity (ліворуч) та You Chat (праворуч). Джерело: https://arxiv.org/pdf/2410.22349
Оскільки всі системи дозволяли певний рівень інтерактивності з цитатами, наданими як підтримка згенерованих відповідей, учасники дослідження були заохочені взаємодіяти з інтерфейсом якомога більше.
У обидніх випадках учасників просили формулювати свої запити як через систему RAG, так і через традиційний пошуковий двигун (у цьому випадку Google).
Три пошукових системи – You Chat, Bing Copilot і Perplexity – були вибрані тому, що вони публічно доступні.
Більшість учасників вже були користувачами систем RAG, з різною частотою.
Через обмеження простору ми не можемо розбити кожну з 16 ключових недоліків, виявлених у дослідженні, але тут представимо вибір деяких з найцікавіших та найосвітливіших прикладів.
Відсутність об’єктивної деталізації
Паперу зазначає, що користувачі часто знаходили, що відповіді системи мали бідну об’єктивну деталізацію, як у фактичних, так і в суб’єктивних відповідях. Один з учасників коментував:
‘Це просто намагалося відповісти, не давши мені солідної відповіді чи більш продуманої відповіді, яку я міг би отримати за допомогою кількох пошукових запитів у Google.’
Інший учасник спостерігав:
‘Це надто коротке і просто підсумовує все. [Модель] повинна дати мені більше даних для цього твердження, але це дуже підсумовується.’
Відсутність цілісної точки зору
Автори висловлюють занепокоєння щодо цієї відсутності нюансів та специфіки, і заявляють, що пошукові системи часто не представляють кілька точок зору на будь-яку аргументацію, схильні погоджуватися з упередженням, яке припускається з власного формулювання питання користувачем.
Один учасник сказав:
‘Я хочу дізнатися більше про іншу сторону аргументації… це все з щепоткою солі, оскільки ми не знаємо іншої сторони та доказів і фактів.’
Інший учасник коментував:
‘Воно не дає вам обидві сторони аргументації; воно просто каже вам, “ви праві… і ось чому”.’
Впевнена мова
Автори спостерігають, що всі три випробувані системи виявили використання надмірно впевненої мови, навіть для відповідей, які стосуються суб’єктивних питань. Вони стверджують, що цей тон буде схильний надихати необґрунтовану впевненість у відповіді.
Один учасник зазначив:
‘Воно пише так впевнено, що я переконаний, навіть не дивлячись на джерело. Але коли ви дивитеся на джерело, воно погане, і це заставляє мене сумніватися знову.’
Інший учасник коментував:
‘Якщо хтось точно не знає правильної відповіді, він буде довіряти цьому, навіть якщо воно неправильне.’
Неправильні цитування
Іншою частою проблемою було неправильне цитування джерел, які були визнані авторитетними для відповідей систем RAG, з одним з учасників дослідження, який стверджував:
‘[Це] твердження не здається джерелом. Я знаю, що твердження правдиве; воно валідне… але я не знаю, звідки воно бере цю інформацію.’
Автори паперу коментують†:
‘Учасники відчували, що системи використовують цитати для легітимізації своєї відповіді, створюючи ілюзію авторитету. Ця фасад була розкрита лише для кількох користувачів, які продовжили перевірку джерел.’
Вибір інформації для відповіді на запит
Повертаючись до концепції людського угодливого, сикофантського поведінки у відповідях RAG, дослідження виявило, що багато відповідей підкреслювали певну точку зору, замість того, щоб комплексно підсумовувати тему, як один з учасників спостерігав:
‘Я відчуваю, що [система] маніпулює мені. Воно бере лише деяку інформацію та здається мені, що я маніпулюю, щоб побачити лише одну сторону речей.’
Інший учасник коментував:
‘[Джерело] насправді має обидві за та проти, і воно вибрало лише ті аргументи, які потрібні цій ланці, без усього образу.’
Для подальших докладних прикладів (та кількох критичних цитат з учасників опитування) ми посилаємо читача на джерельну роботу.
Автоматизована RAG
На другому етапі більш широкого дослідження дослідники використовували браузерні скрипти для систематичного запиту запитів до трьох вивчених систем RAG. Вони потім використовували систему LLM (GPT-4o) для аналізу відповідей систем.
Виписки були проаналізовані за релевантністю запиту та Про та Конtra тверджень (тобто, чи відповідь за чи проти запитуваної упередженості).
Оцінка впевненості відповіді також була оцінена в цьому автоматичному етапі, на основі Лайкерт-шкали психометричного методу тестування. Тут суддя LLM був доповнений двома людськими анотаторами.
Третя операція включала використання веб-скрейпінгу для отримання повного текстового вмісту цитованих веб-сторінок через інструмент Jina.ai Reader. Однак, як зазначено в іншому місці в папері, більшість інструментів веб-скрейпінгу не можуть доступитися до сайтів з платним доступом, як і більшість людей (хоча автори зазначають, що Perplexity.ai відомо обходило цей бар’єр).
Додатковими факторами були питання про те, чи відповідають відповіді джерелам (обчислювані як “матриця цитування”), а також “матриця фактичної підтримки” – метрика, перевірена за допомогою чотирьох людських анотаторів.
Таким чином було отримано 8 метрик: одностороння відповідь; надмірно впевнена відповідь; релевантне твердження; нецитовані джерела; непідтримувані твердження; необхідність джерела; точність цитування; і точність цитування.
Матеріал, проти якого ці метрики були протестовані, складався з 303 кураторських питань з етапу опитування користувачів, що призвело до 909 відповідей по трьох тестованих системах.

Кількісна оцінка трьох вивчених систем RAG, заснована на восьми метриках.
Відносно результатів, паперу зазначає:
‘Дивлячись на три метрики, пов’язані з текстом відповіді, ми знаходимо, що всі оцінені пошукові двигуни часто (50-80%) генерують односторонні відповіді, надають перевагу згоді з упередженою формою дебатів над представленням кількох точок зору в відповіді, причому Perplexity працює гірше, ніж інші дві системи.’
‘Це знахідка узгоджується з [нашими] кваліфікаційними результатами. Дивно, хоча Perplexity найімовірніше генерує односторонню відповідь, воно також генерує найдовші відповіді (18,8 тверджень на відповідь у середньому), вказуючи на те, що відсутність різноманітності відповідей не є результатом їхньої короткості.
‘Іншими словами, збільшення довжини відповіді не обов’язково покращує різноманітність відповідей.’
Автори також зазначають, що Perplexity найімовірніше використовує впевнену мову (90% відповідей), і що, навпаки, інші дві системи схильні використовувати більш обережну та менш впевнену мову, коли мова йде про суб’єктивний вміст.
You Chat був єдиною рамкою RAG, яка досягла нуля нецитованих джерел для відповіді, з Perplexity на 8% і Bing Chat на 36%.
Всі моделі показали “значну кількість” непідтримуваних тверджень, і паперу заявляє†:
‘Рамка RAG рекламується як рішення для галюцинаційної поведінки LLM, забезпечуючи, щоб LLM генерував відповідь, засновану на джерельних документах, однак результати показують, що RAG-основані пошукові двигуни все ще генерують відповіді, які містять велику кількість тверджень, не підтримуваних джерелами, які вони надають.‘
Крім того, всі випробувані системи мали труднощі з підтримкою своїх тверджень цитатами:
‘You.Com і [Bing Chat] працюють трохи краще, ніж Perplexity, з приблизно двома третинами цитат, які вказують на джерело, яке підтримує цитоване твердження, і Perplexity працює гірше, з більш ніж половinou своїх цитат, які є неточними.
‘Це результат дивно: цитування не тільки неправильне для тверджень, які не підтримуються жодним джерелом, але ми знаходимо, що навіть коли існує джерело, яке підтримує твердження, всі двигуни все одно часто цитують інше неправильне джерело, пропускаючи можливість надати правильну інформацію про джерело користувачеві.
‘Іншими словами, галюцинаційна поведінка не тільки проявляється в твердженнях, які не підтримуються джерелами, але також у неточних цитатах, які заважають користувачам верифікувати валідність інформації.‘
Автори висновують:
‘Жодна з пошукових систем не досягає хорошої продуктивності за більшості метрик, підкреслюючи велику потребу в покращенні пошукових систем.’
* Моя конвертація внутрішніх цитат авторів у гіперпосилання. Куди необхідно, я вибрав перше з кількох цитат для гіперпосилання через практичні причини форматування.
† Наголос авторів, не мій.
Перша публікація понеділка, 4 листопада 2024 року












