Anderson 视角

研究发现RAG系统存在十六个主要问题,包括Perplexity

mm
将 Unite.AI 添加到您在 Google 上的首选来源
Image generated by ChatGPT-4o, with prompt ' Create a highly photorealistic panoramic image of a robot frantically searching the internet on a laptop. Do not stylize this image so that it looks like a false or AI-created image'

最近的一项美国研究发现,流行的检索增强生成(RAG)研究系统(如Perplexity和Bing Copilot)的实际性能远远低于过去12个月的营销炒作和广泛采用。

该项目涉及21位专家参与的广泛调查,发现了RAG系统(You Chat、Bing Copilot和Perplexity)存在至少16个令人担忧的领域:

1:生成答案缺乏客观细节,仅提供泛泛的总结和缺乏语境深度或细微差别。

2:强化用户偏见,RAG引擎经常无法呈现多种观点,而是根据用户提问的方式推断和强化用户偏见。

3:过于自信的语言,特别是在主观响应中,不能通过经验来确定,这可能会导致用户过于信任答案。

4:语言过于简单,缺乏批判性思维和创造力,响应有效地用“低俗”和“令人愉快”的信息来敷衍用户,而不是经过深思熟虑的思考和分析。

5:错误地引用来源,答案引擎使用的引用来源不支持其响应,制造了可信度的幻觉。

6:选择性地呈现信息以支持其主张,RAG代理似乎正在寻找支持其生成主张和估计用户想要听到的答案,而不是根据可靠来源的客观分析。

7:省略支持陈述的引用,响应的来源材料缺失。

8:没有逻辑模式来解释其响应,用户无法询问为什么系统优先考虑某些来源而不是其他来源。

9:来源数量有限,大多数RAG系统通常为一个陈述提供大约三个支持来源,即使更大的来源多样性也是适用的。

10:孤立的来源,系统的支持引用的数据不包含在答案中。

11:使用不可靠的来源,系统似乎更喜欢流行的来源(即SEO方面)而不是事实上正确的来源。

12:冗余的来源,系统呈现多个引用,其中来源论文在内容上基本相同。

13:未过滤的来源,系统没有为用户提供评估或过滤引用的方式,迫使用户相信选择标准。

14:缺乏交互性或可探索性,用户研究的参与者感到沮丧,因为RAG系统没有提出澄清问题,而是从第一次查询中假设用户的意图。

15:需要外部验证,用户感到有必要对提供的响应进行独立验证,这大大降低了RAG作为“搜索替代品”的便利性。

16:使用学术引用方法,如[1]或[34];这是学术界的标准做法,但可能对许多用户来说不直观。

研究人员从人工智能、医疗保健、医学、应用科学、教育和社会科学领域邀请了21位专家参与调查,所有参与者都是博士后研究人员或博士候选人。参与者在大声表达自己的思维过程的同时,与被测试的RAG系统进行交互,以澄清他们自己的理性模式。

论文对参与者的担忧和对RAG系统性能的担忧进行了广泛的引用。

由于空间限制,我们无法逐一列出研究中发现的十六个关键缺陷,但我们将呈现一些最有趣和最发人深省的例子。

RAG的权衡

作者在论文开始时重申了四个已知的Large Language Models(LLM)在回答引擎中使用的缺点。

首先,它们容易产生虚构的信息,并缺乏检测事实不一致的能力。其次,它们难以评估引用的准确性。第三,它们倾向于偏爱自己的预训练权重,并可能抵制外部检索的文档数据,即使这些数据更为最新或准确。最后,RAG系统往往趋向于讨好人们,经常以牺牲信息准确性为代价。

所有这些趋势都在研究的两个方面得到了证实,并且关于RAG的缺陷有许多新颖的观察。

论文认为OpenAI的SearchGPT RAG产品可能会鼓励用户采用RAG-based搜索系统,尽管基础的缺陷暗示了潜在的问题。

研究

作者首先在24名参与者中选取了三名参与者,通过LinkedIn或电子邮件邀请他们参与研究。

第一阶段涉及专家信息检索,参与者平均在40分钟的会话中进行了六次搜索查询。这部分重点关注事实性问题和答案的获取和验证,具有潜在的经验解决方案。

第二阶段涉及辩论信息检索,处理主观问题,包括生态、素食主义和政治等话题。

由于所有系统都允许对提供的引用进行一定程度的交互,研究对象被鼓励尽可能地与界面交互。

在两种情况下,参与者都被要求通过RAG系统和传统搜索引擎(在本例中为Google)提出查询。

三个答案引擎——You Chat、Bing Copilot和Perplexity——之所以被选中,是因为它们是公开可访问的。

大多数参与者已经是RAG系统的用户,使用频率不一。

缺乏客观细节

论文指出,用户发现系统的响应经常缺乏客观细节,既包括事实性响应,也包括主观性响应。一个参与者评论道:

“它只是试图回答,而没有给我一个实质性的答案或更深思熟虑的答案,我可以通过多次谷歌搜索得到这样的答案。”

另一个参与者观察到:

“它太短了,只是总结了一切。[模型]需要给我更多的数据来支持其主张,但它只是总结得太过简单了。”

缺乏整体视角

作者对系统的响应经常缺乏细微差别和具体性表示担忧,并指出答案引擎经常无法呈现多种观点,倾向于支持用户提问中推断出的偏见。

一位参与者说:

“我想了解更多关于论点的另一面……这都是带有一丝怀疑的,因为我们不知道另一面和证据。”

另一个参与者评论道:

“它没有给我两方面的论点;它没有与我争论。相反,[模型]只是告诉我,你是对的……并给出了原因。”

自信的语言

作者观察到,所有三个测试系统都表现出过于自信的语言,甚至在处理主观问题时也是如此。他们认为,这种语气会使用户对响应产生不合理的信任。

一位参与者注意到:

“它写得如此自信,我感到信服,即使没有查看来源。但是当你查看来源时,它很糟糕,这让我再次怀疑它。”

另一个参与者评论道:

“如果有人不知道正确答案,他们会相信它,即使它是错误的。”

错误的引用

另一个频繁出现的问题是对引用来源的错误归属,研究对象之一断言:

“[该]陈述似乎不在来源中。我是说,陈述是真的;它是有效的……但是我不知道它从哪里得到这个信息。”

论文的作者评论道:

“参与者认为,系统正在使用引用来使其答案合法化,制造了可信度的幻觉。这种假象只有在少数用户仔细检查来源时才被揭露。”

选择性地呈现信息以支持其主张

回到RAG响应中的讨好行为,研究发现许多答案强调了特定的观点,而不是全面总结话题,正如一位参与者所观察到的:

“我觉得[系统]很操纵。它只取一些信息,并让我只看到事物的一面。”

另一个参与者认为:

“[来源]实际上既有优点也有缺点,但[系统]选择从这个链接中选取所需的论点,而不是呈现全面的图景。”

自动化RAG

在更广泛的研究的第二阶段,研究人员使用基于浏览器的脚本来系统地从三个研究的RAG引擎中收集查询。然后,他们使用LLM系统(GPT-4o)来分析系统的响应。

语句被分析为查询相关性和正反陈述(即,响应是否支持、反对或中立,关于查询的隐含偏见)。

答案自信度评分也在自动化阶段中进行了评估,基于Likert量表的心理测量方法。这里,LLM法官由两个人类注释者增强。

第三个操作涉及使用网页抓取工具来获取引用的网页的全文内容,通过Jina.ai Reader工具。然而,正如论文的其他地方所指出的,网页抓取工具通常无法访问付费网站,就像大多数人一样(尽管作者指出,Perplexity.ai已知会绕过这一屏障)。

其他考虑因素包括答案是否引用了来源(计算为“引用矩阵”),以及“事实支持矩阵”——一个由四个人类注释者验证的指标。

因此,获得了8个总体指标:一致答案;过于自信的答案;相关陈述;未引用的来源;不支持的陈述;来源必要性;引用准确性;以及引用彻底性。

测试这些指标的材料是来自用户研究阶段的303个精心策划的问题,结果在三个测试系统中得到了909个答案。

关于结果,论文指出:

“查看答案文本的三个指标,我们发现所有评估的答案引擎都经常(50-80%)生成一致的答案,偏向于同意带有偏见的辩论问题的表述,而不是在答案中呈现多种观点,这与我们定性的结果一致。”

作者还指出,Perplexity是最有可能生成一致答案的(90%的答案),而其他两个系统在处理主观内容时往往使用更谨慎和不那么自信的语言。

您聊是唯一实现零未引用的来源的RAG框架,Perplexity为8%,Bing Chat为36%。

所有模型都表现出相当一部分不支持的陈述,论文宣称:

“RAG框架被宣传为通过强制LLM生成基于源文档的答案来解决LLM的幻觉行为,然而结果表明,基于RAG的答案引擎仍然会生成包含大量不支持来源的陈述的答案。”

此外,所有测试系统都难以用来源支持其陈述:

“You.Com和[Bing Chat]的性能略好于Perplexity,大约有三分之二的引用指向支持引用的陈述,Perplexity的性能更差,超过一半的引用不准确。”

作者得出结论:

“没有一个答案引擎在大多数指标上都能获得良好的性能,突出了答案引擎中存在很大的改进空间。”

* 我将作者的内联引用转换为超链接。由于格式上的实际考虑,我选择了多个引用中的第一个作为超链接。

作者的强调,而不是我的。

首次发表于2024年11月4日星期一

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai