Взгляд Anderson

Новые исследования обнаружили шестнадцать основных проблем с системами RAG, включая Perplexity

mm
Добавьте Unite.AI в избранные источники в Google
Image generated by ChatGPT-4o, with prompt ' Create a highly photorealistic panoramic image of a robot frantically searching the internet on a laptop. Do not stylize this image so that it looks like a false or AI-created image'

Недавнее исследование из США показало, что реальная производительность популярных систем Retrieval Augmented Generation (RAG), таких как Perplexity и Bing Copilot, значительно отстает от маркетинговой рекламы и широкого внедрения, которое получили эти системы за последние 12 месяцев.

Проект, в котором приняли участие 21 эксперт в области искусственного интеллекта, здравоохранения, медицины, прикладных наук и образования, показал не менее 16 областей, в которых изученные системы RAG (You Chat, Bing Copilot и Perplexity) вызвали беспокойство:

1. Отсутствие объективных деталей в сгенерированных ответах, с общими резюме и недостаточной контекстной глубиной или нюансами.

2. Укрепление воспринимаемого предвзятости пользователя, где система RAG часто не представляет разнообразие точек зрения, а вместо этого подкрепляет предвзятость пользователя, основанную на том, как пользователь формулирует вопрос.

3. Чрезмерно уверенный язык, особенно в субъективных ответах, которые не могут быть эмпирически установлены, что может привести к тому, что пользователи будут больше доверять ответу, чем он заслуживает.

4. Упрощенный язык и отсутствие критического мышления и творчества, где ответы фактически унижают пользователя, предоставляя “упрощенную” и “согласованную” информацию, вместо того, чтобы предоставлять продуманное рассуждение и анализ.

5. Неправильное указание источников и цитирование, где система ответов использует цитируемые источники, которые не поддерживают ее ответ, создавая иллюзию достоверности.

6. Выборочное использование информации из контекста, где агент RAG parece искать ответы, которые поддерживают его сгенерированное утверждение и его оценку того, что пользователь “хочет услышать”, вместо того, чтобы основывать свои ответы на объективном анализе надежных источников.

7. Пропуск цитирования, подтверждающего утверждения, где источники для ответов отсутствуют.

8. Отсутствие логической схемы для ответов, где пользователи не могут понять, почему система отдала предпочтение определенным источникам над другими.

9. Ограниченное количество источников, где большинство систем RAG обычно предоставляют около трех поддерживающих источников для утверждения, даже когда большее разнообразие источников было бы применимо.

10. Осиротевшие источники, где данные из всех или некоторых поддерживающих цитат системы не включены в ответ.

11. Использование ненадежных источников, где система, кажется, предпочитает источник, который популярен (т.е. в терминах SEO), а не фактически правильный.

12. Редундантные источники, где система представляет несколько цитат, в которых источники по сути одинаковы по содержанию.

13. Нефильтрованные источники, где система не предоставляет пользователю возможности оценить или отфильтровать предложенные цитаты, заставляя пользователей доверять критериям отбора.

14. Отсутствие интерактивности или исследуемости, где несколько участников исследования были разочарованы тем, что системы RAG не задавали уточняющих вопросов, а вместо этого предполагали намерение пользователя с первого запроса.

15. Необходимость внешней верификации, где пользователи чувствуют себя вынужденными выполнять независимую верификацию предоставленных ответов, что в значительной степени удаляет предполагаемое удобство RAG как “замены поиска”.

16. Использование методов академической цитации, таких как [1] или [34], что является стандартной практикой в академических кругах, но может быть неинтуитивным для многих пользователей.

Для работы исследователи собрали 21 эксперта в области искусственного интеллекта, здравоохранения, медицины, прикладных наук и образования, все из которых были либо постдокторантами, либо кандидатами наук. Участники взаимодействовали с тестируемыми системами RAG, высказывая свои мысли вслух, чтобы прояснить (для исследователей) свою собственную рациональную схему.

Статья обширно цитирует сомнения и опасения участников относительно производительности трех изученных систем.

Методология исследования была затем систематизирована в автоматизированное исследование систем RAG, используя наборы управления браузером:

‘Масштабное автоматизированное оценка систем, таких как You.com, Perplexity.ai и BingChat, показало, что ни одна из них не соответствует приемлемой производительности по большинству метрик, включая критические аспекты, связанные с обработкой заявлений, не поддерживаемых утверждений и точности цитирования.’

Авторы утверждают, что как новые, так и опытные пользователи должны проявлять осторожность при использовании класса систем RAG, изученных в исследовании. Они также предлагают новую систему метрик, основанную на недостатках, найденных в исследовании, которая могла бы стать основой для более строгого технического надзора в будущем.

Однако, растущее общественное использование систем RAG побуждает авторов также выступать за соответствующее законодательство и более высокий уровень принудительной государственной политики в отношении интерфейсов поиска, поддерживаемых агентами.

Исследование происходит из пяти исследователей из Университета штата Пенсильвания и Salesforce, и называется Поисковые системы в эпоху ИИ: Ложная обещание фактических и проверяемых источников. Работа охватывает системы RAG до состояния искусства в августе 2024 года

Торговое соотношение RAG

Авторы предваряют свою работу, повторяя четыре известных недостатков больших языковых моделей (LLM), где они используются в ответственных двигах.

Во-первых, они склонны галлюцинировать информацию и не имеют возможности обнаруживать фактические несоответствия. Во-вторых, они имеют трудности оценить точность цитаты в контексте сгенерированного ответа. В-третьих, они склонны предпочитать данные из своих собственных предварительно обученных весов и могут сопротивляться данным из внешних документов, даже если такие данные могут быть более свежими или точными.

Наконец, системы RAG склонны к людям, сикофантскому поведению, часто за счет точности информации в своих ответах.

Все эти тенденции были подтверждены в обоих аспектах исследования, среди многих новых наблюдений о ловушках RAG.

Статья рассматривает OpenAI’s SearchGPT RAG-продукт (выпущенный подписчикам на прошлой неделе, после того, как новая статья была представлена), как вероятно, чтобы поощрить пользовательское внедрение систем RAG-поиска, несмотря на фундаментальные недостатки, на которые намекают результаты опроса*:

‘Выпуск OpenAI “SearchGPT”, продвигаемый как убийца Google, еще больше усугубляет проблемы. По мере роста зависимости от этих инструментов растет и срочность понимания их влияния. Lindemann вводит концепцию запечатанного знания, которая критикует, как эти системы ограничивают доступ к разнообразным ответам, конденсируя поисковые запросы в единственные, авторитетные ответы, эффективно деконтекстуализируя информацию и сужая пользовательские перспективы.

‘Это “запечатывание” знаний увековечивает селективные предвзятости и ограничивает маргинализированные точки зрения.’

Исследование

Авторы сначала протестировали свою исследовательскую процедуру на трех участниках, всех приглашенных через LinkedIn или электронную почту.

Первый этап, для остальных 21 участника, включал Экспертизу информационного извлечения, где участники в среднем выполняли около шести поисковых запросов за 40-минутную сессию. Этот раздел был сосредоточен на сборе и верификации фактических вопросов и ответов, с потенциальными эмпирическими решениями.

Второй этап был связан с Дебатным информационным извлечением, которое занималось субъективными вопросами, включая экологию, вегетарианство и политику.

Сгенерированные ответы исследования из Perplexity (слева) и You Chat (справа). Источник: https://arxiv.org/pdf/2410.22349

Сгенерированные ответы исследования из Perplexity (слева) и You Chat (справа). Источник: https://arxiv.org/pdf/2410.22349

Поскольку все системы позволяли некоторый уровень интерактивности с цитатами, предоставленными в качестве поддержки сгенерированных ответов, участники исследования были поощрены взаимодействовать с интерфейсом как можно больше.

В обоих случаях участники были попросили сформулировать свои запросы как через систему RAG, так и через традиционный поисковый двиг (в данном случае Google).

Три ответных двига – You Chat, Bing Copilot и Perplexity – были выбраны, потому что они являются публично доступными.

Большинство участников уже были пользователями систем RAG, на различных частотах.

Из-за ограничений пространства мы не можем разбить каждую из шестнадцати ключевых недостатков, найденных в исследовании, но представляем некоторые из наиболее интересных и просвещающих примеров.

Отсутствие объективных деталей

Статья отмечает, что пользователи часто находили, что ответы систем не имели объективных деталей, как в фактических, так и в субъективных ответах. Один из участников прокомментировал:

‘Это было просто попыткой ответить, не давая мне солидного ответа или более продуманного ответа, который я могу получить с помощью нескольких поисковых запросов в Google.’

Другой участник заметил:

‘Это слишком коротко и просто суммирует все. [Модель] должна дать мне больше данных для утверждения, но это очень кратко.’

Отсутствие целостной точки зрения

Авторы выражают обеспокоенность по поводу отсутствия нюансов и специфики и заявляют, что ответные двиги часто не представляют несколько точек зрения на любую аргументацию, склоняясь к воспринимаемой предвзятости, выведенной из формулировки вопроса пользователем.

Один участник сказал:

‘Я хочу узнать больше о другой стороне аргумента… это все с долей скептицизма, потому что мы не знаем другой стороны и фактов.’

Другой участник прокомментировал:

‘Оно не дает вам обе стороны аргумента; оно не спорит с вами. Вместо этого [модель] просто говорит вам: “Вы правы… и вот причины, почему”.’

Уверенный язык

Авторы отмечают, что все три протестированные системы демонстрировали использование уверенного языка, даже для ответов, которые касаются субъективных вопросов. Они утверждают, что этот тон будет склонять к необоснованной уверенности в ответе.

Один участник заметил:

‘Оно пишет так уверенно, что я чувствую себя убежденным, не глядя даже на источник. Но когда вы смотрите на источник, он плохой, и это заставляет меня сомневаться снова.’

Другой участник прокомментировал:

‘Если кто-то не знает точно правильный ответ, он будет доверять этому, даже когда оно неправильное.’

Неправильные цитаты

Другой частой проблемой было неправильное указание источников, цитируемых в качестве авторитета для ответов систем RAG, с одним из участников исследования, заявившим:

‘Это утверждение не кажется в источнике. Я имею в виду, что утверждение верно; оно действительно… но я не знаю, откуда оно берет эту информацию.’

Авторы исследования комментируют :

‘Участники чувствовали, что системы используют цитаты, чтобы легитимизировать свой ответ, создавая иллюзию достоверности. Этот фасад был раскрыт только для нескольких пользователей, которые проверили источники.’

Выборочное использование информации для запроса

Возвращаясь к идее о том, что системы RAG демонстрируют сикофантское поведение, исследование показало, что многие ответы подчеркивали определенную точку зрения, вместо того, чтобы суммировать тему, как один из участников заметил:

‘Я чувствую, что [система] манипулирует мной. Она берет только некоторую информацию и заставляет меня видеть только одну сторону вещей.’

Другой участник прокомментировал:

‘[Источник] на самом деле имеет и плюсы, и минусы, и он выбрал только те аргументы, которые необходимы из этой ссылки, без целой картины.’

Для дальнейших подробных примеров (и множества критических цитат из опроса) мы направляем читателя к исходной статье.

Автоматизированная RAG

На втором этапе более широкого исследования исследователи использовали браузерные скрипты для систематического запроса ответов от трех изученных систем RAG. Затем они использовали систему LLM (GPT-4o) для анализа ответов систем.

Заявления были проанализированы на релевантность запроса и заявления за и против (т.е. является ли ответ за, против или нейтральным по отношению к неявной предвзятости запроса).

Также была оценена Оценка уверенности ответа на основе метода психометрического тестирования Likert scale. Здесь судья LLM был дополнен двумя человеческими аннотаторами.

Третья операция включала использование веб-скрейпинга для получения полного текста цитируемых веб-страниц через инструмент Jina.ai Reader. Однако, как отмечено в другом месте статьи, большинство инструментов веб-скрейпинга не могут получить доступ к платным сайтам, как и большинство людей (хотя авторы отмечают, что Perplexity.ai был известен обходом этого барьера).

Дополнительные соображения включали вопрос о том, цитирует ли ответ источник (рассчитанный как “матрица цитирования”), а также “матрица фактической поддержки” – метрика, проверенная с помощью четырех человеческих аннотаторов.

Таким образом, было получено 8 метрик: односторонний ответ; уверенный ответ; релевантное заявление; не цитируемые источники; не поддерживаемые заявления; необходимость источника; точность цитирования; и полнота цитирования.

Материал, против которого были протестированы эти метрики, состоял из 303 отобранных вопросов из фазы пользовательского исследования, в результате чего получилось 909 ответов по трем протестированным системам.

Количественная оценка по трем протестированным системам RAG, основанная на восьми метриках.

Количественная оценка по трем протестированным системам RAG, основанная на восьми метриках.

Что касается результатов, статья гласит:

‘Анализируя три метрики, связанные с текстом ответа, мы обнаружили, что все оцененные ответные двиги часто (50-80%) генерируют односторонние ответы, отдающие предпочтение согласию с заряженной формулировкой дебатного вопроса над представлением нескольких точек зрения в ответе, причем Perplexity показал худшие результаты, чем другие два двига.

‘Это соответствует нашим качественным результатам. Удивительно, что хотя Perplexity с наибольшей вероятностью генерирует односторонний ответ, он также генерирует самые длинные ответы (18,8 утверждений на ответ в среднем), указывая на то, что отсутствие разнообразия ответов не связано с краткостью ответа.

‘Иными словами, увеличение длины ответа не обязательно улучшает разнообразие ответа.’

Авторы также отмечают, что Perplexity наиболее вероятно использует уверенный язык (90% ответов), и что, напротив, другие две системы склонны использовать более осторожный и менее уверенный язык, когда речь идет о субъективном содержании.

You Chat был единственной рамкой RAG, которая достигла нулевых не цитируемых источников для ответа, с Perplexity на уровне 8% и Bing Chat на уровне 36%.

Все модели показали значительную долю не поддерживаемых заявлений, и статья заявляет:

‘Рамка RAG рекламируется как решение галлюцинаторного поведения LLM, обеспечивая, чтобы LLM генерировал ответ, основанный на источниках, однако результаты показывают, что ответные двиги на основе RAG все еще генерируют ответы, содержащие большую долю заявлений, не поддерживаемых источниками, которые они предоставляют.

Кроме того, все протестированные системы имели трудности с поддержкой своих заявлений цитатами:

‘You.Com и [Bing Chat] работают немного лучше, чем Perplexity, с примерно двумя третями цитат, указывающих на источник, поддерживающий цитируемое заявление, и Perplexity работает хуже, с более чем половиной своих цитат, являющихся неточными.

‘Это удивительный результат: цитирование не только неточно для заявлений, которые не поддерживаются никакими источниками, но мы также обнаружили, что даже когда существует источник, поддерживающий заявление, все двиги часто цитируют другой неправильный источник, упуская возможность предоставить правильную информацию об источнике пользователю.

Иными словами, галлюцинаторное поведение не только проявляется в заявлениях, не поддерживаемых источниками, но также в неточных цитатах, которые препятствуют пользователям в проверке действительности информации.

Авторы заключают:

‘Ни один из ответных двигов не показал хорошую производительность по большинству метрик, подчеркивая большую потребность в улучшении ответных двигов.’

 

 

* Мое преобразование внутренних цитат авторов в гиперссылки. Когда это необходимо, я выбрал первую из нескольких цитат для гиперссылки из-за практических соображений форматирования.

Подчеркивание авторов, а не мое.

Опубликовано впервые в понедельник, 4 ноября 2024 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai