思想领袖

解决当前大型语言模型(LLM)中的问题并展望未来

mm
将 Unite.AI 添加到您在 Google 上的首选来源

如今,已经有数十种公开可用的大型语言模型(LLM),例如GPT-3、GPT-4、LaMDA和Bard,其数量正在不断增长,因为新的模型不断被发布。LLM已经彻底改变了我们与技术的交互方式,跨越各个行业。这些模型使我们能够从大量的人类语言数据中学习,并为创新、创造力和效率开辟了新的途径。

然而,随着LLM的强大功能而来的是巨大的复杂性。围绕LLM存在一些固有的挑战和伦理问题,这些问题必须在我们能够充分利用LLM之前得到解决。例如,最近的一项斯坦福大学研究发现,当观察ChatGPT-4处理包含种族或性别暗示的名字的查询时,存在种族和性别偏见。在这项研究中,程序被要求提供有关某人以贾马尔·华盛顿(Jamal Washington)的名字出售二手自行车的价格建议,结果显示的价格远低于以洛根·贝克尔(Logan Becker)为卖家的价格。随着这些发现不断被揭露,解决LLM挑战的必要性只会增加。

如何缓解常见的LLM问题

偏见

LLM中最常被讨论的问题之一是偏见和公平性。在最近的一项研究中,专家测试了四种最近发布的LLM,发现它们都表现出对男性和女性的偏见,特别是与人们的看法相符的偏见,而不是基于事实的偏见。在这种情况下,偏见是指不同社会群体之间的不平等待遇或结果,可能是由于历史或结构性的权力失衡所致。

在LLM中,偏见是由数据选择、创作者的人口统计学和语言或文化偏见引起的。数据选择偏见发生在LLM训练所用的文本不能代表网络上使用的语言的全部多样性时。训练在大量但有限的数据集上的LLM可能会继承这些文本中已经存在的偏见。创作者的人口统计学中,某些人群比其他人群更常被提及,这凸显了内容创作中多样性和包容性的必要性,以减少偏见。例如,维基百科(Wikipedia),一个常见的训练数据来源,编辑人群中存在显著的性别失衡(男性占84%)。这与语言和文化偏见类似,许多LLM训练所用的来源都偏向英语,且不总是能准确地翻译成其他语言和文化。

为了减少偏见,必须对LLM进行过滤数据训练,并建立防护措施以抑制不一致的主题。实现这一点的一种方法是通过基于数据增强的技术。你可以向训练数据中添加代表性不足群体的示例,从而扩大数据集的多样性。另一种减轻偏见的策略是数据过滤和重新加权,这主要侧重于在现有数据集中精确地针对特定的代表性不足的示例。

幻觉

在LLM的背景下,幻觉是一种现象,其特点是生成的文本在语法上是正确的,似乎是连贯的,但与事实的准确性或源材料的意图不符。事实上,最近的报告发现,关于明尼苏达州一项法律的诉讼直接受到LLM幻觉的影响。提交支持该法律的宣誓书中发现包含了不存在的来源,这些来源可能是由ChatGPT或其他LLM生成的。这些幻觉很容易降低LLM的可靠性。

LLM幻觉主要有三种形式:

  1. 输入冲突幻觉:当LLM的输出与用户提供的输入不符时,通常包括任务指令和需要处理的实际内容。
  2. 上下文冲突幻觉:LLM可能在涉及延长对话或多次交互的场景中生成内部不一致的响应。这表明模型可能存在跟踪上下文或维持不同交互中的连贯性的潜在缺陷。
  3. 事实冲突幻觉:这种幻觉发生在LLM生成与既定事实相矛盾的内容时。这种错误的来源多样,可能发生在LLM生命周期的各个阶段。

许多因素导致了这种现象,例如知识缺陷,这解释了LLM可能缺乏知识或无法在预训练期间正确吸收信息。另外,训练数据中的偏见或LLM的顺序生成策略(被称为“幻觉雪球效应”)可能会产生幻觉。

虽然幻觉将始终是LLM的特征,但仍有一些方法可以减轻幻觉。预训练期间的减轻(使用过滤技术手动改进数据)或微调(策划训练数据)是有帮助的策略。然而,在推理期间进行减轻是最好的解决方案,因为它具有成本效益和可控性。

隐私

随着互联网的兴起,个人信息和其他私人数据的可访问性增加已经成为一个广泛认可的担忧。研究发现,80%的美国消费者担心他们的数据被用于训练AI模型。由于最著名的LLM来自网站,我们必须考虑这对隐私构成的风险,并且仍然是LLM的一个未解决的问题。

防止LLM分发个人信息的最直接方法是从训练数据中清除这些信息。然而,考虑到LLM中涉及的数据量,几乎不可能保证所有私人信息都被消除。另一个常见的替代方案是选择开源LLM,而不是像ChatGPT这样的服务。

通过这种方法,可以在内部部署模型的副本。用户的提示在组织的网络内保持安全,而不是暴露于第三方服务中。虽然这大大降低了泄露敏感数据的风险,但也增加了复杂性。鉴于完全保证私人数据的保护具有困难,应用开发人员仍必须考虑这些模型如何将用户置于风险之中。

LLM的下一个前沿

随着我们继续发展和塑造LLM的后续演进,同时缓解当前风险,我们应该期待LLM代理的突破,我们已经看到像H这样的公司开始发布他们的第一个产品Runner H,用于代理应用。从纯语言模型到代理架构的转变代表了AI系统设计的变化;行业将超越聊天界面和简单的检索增强生成的固有局限性。这些新代理框架将具有复杂的规划模块,可以将复杂的目标分解为原子子任务,维持情景记忆以进行上下文推理,并通过精确定义的API利用专用工具。这种方法更为强健,能够更好地实现任务自动化。架构的进步有助于缓解传统LLM实现中常见的任务和推理、工具集成以及执行监控的挑战。

除了LLM之外,还将更注重训练较小的语言模型,因为它们具有成本效益、易于部署和使用的优势。例如,领域特定语言模型专注于特定的行业或领域。这些模型使用领域特定的数据和术语进行微调,使它们非常适合复杂和受监管的环境,例如医疗或法律领域,在这些领域中,精度至关重要。这种有针对性的方法降低了一般用途模型在处理专业内容时可能产生的错误和幻觉的可能性。

随着我们继续探索LLM的新前沿,推动创新边界并解决和减轻与LLM开发和部署相关的潜在风险至关重要。只有首先识别和积极解决与偏见、幻觉和隐私相关的挑战,我们才能为LLM在各个领域蓬勃发展创造一个更加坚实的基础。

Uday Kamath 是 Smarsh 的首席分析官,Smarsh 是全球领先的通信数据和智能公司。他的职责包括领导对话式 AI 的数据科学和研究。凭借超过 25 年的分析开发经验和大规模机器学习博士学位,Kamath 在众多期刊、会议、书籍和专利方面做出了重大贡献。他也是包括 Falkonry 和 GMU 人机合作中心在内的实体的董事会成员。