AI 模型与平台

2024 年大型多模态模型的揭幕:重塑语言模型的格局

mm
将 Unite.AI 添加到您在 Google 上的首选来源

当我们体验世界时,我们的感官(视觉、声音、气味)提供了多样化的信息,我们使用不同的交流方式,如面部表情和手势来表达自己。这些感官和交流方式被称为模态,代表了我们感知和交流的不同方式。受人类这种能力的启发,大型多模态模型(LMM),一种结合生成和多模态人工智能的模型,正在被开发,以理解和使用不同类型的内容,如文本、图像和音频。在这篇文章中,我们深入探讨这个新兴领域,探索什么是 LMM、如何构建它们、现有的例子、它们面临的挑战和潜在的应用。

2024 年生成式人工智能的演变:从大型语言模型到大型多模态模型

在其最新的报告中,麦肯锡 将 2023 年指定为生成式人工智能的突破年,这导致了该领域的许多进步。我们见证了大型语言模型(LLM)的显著崛起,这些模型能够理解和生成类似人类的语言。此外,图像生成模型 已经显著进化,展示了它们从文本提示中创建视觉内容的能力。然而,尽管个别模态(如文本、图像或音频)取得了显著进步,生成式人工智能在生成过程中无缝地结合这些模态时遇到了挑战。由于世界本质上是多模态的,人工智能需要处理多模态信息,这对于与人类进行有意义的互动和在现实世界场景中成功操作至关重要。
因此,许多人工智能研究人员预计 LMM 将成为 2024 年人工智能研究和开发的下一个前沿。这个不断演变的前沿专注于增强生成式人工智能处理和产生多样化输出的能力,涵盖文本、图像、音频、视频和其他模态。需要强调的是,并非所有多模态系统都符合 LMM 的标准。像 MidjourneyStable Diffusion 这样的模型,尽管是多模态的,但不属于 LMM 类别,主要是因为它们缺乏 LLM,这是 LMM 的基本组成部分。换句话说,我们可以将 LMM 描述为 LLM 的扩展,为其提供了处理各种模态的能力。

LMM 如何工作?

虽然研究人员已经探索了构建 LMM 的各种方法,但它们通常涉及三个基本组件和操作。首先,使用编码器为每个数据模态生成特定于该模态的数据表示(称为嵌入)。其次,使用不同的机制将来自不同模态的嵌入对齐到统一的多模态嵌入空间。第三,对于生成模型,使用 LLM 生成文本响应。由于输入可能包括文本、图像、视频和音频,研究人员正在努力开发新的方法,使语言模型在给出响应时考虑不同的模态。

2023 年 LMM 的发展

以下,我简要概述了 2023 年开发的一些著名 LMM。

  • LLaVA 是一个开源的 LMM,由威斯康星大学麦迪逊分校、微软研究院和哥伦比亚大学联合开发。该模型旨在提供一个开源的多模态 GPT4 版本。利用 Meta 的 Llama LLM,它集成了 CLIP 视觉编码器以实现强大的视觉理解。LLaVA 的医疗保健版本,称为 LLaVA-Med,可以回答与生物医学图像相关的查询。
  • ImageBind 是由 Meta 创建的开源模型,模拟人类感知将多模态数据关联起来的能力。该模型集成了六种模态——文本、图像/视频、音频、3D 测量、温度数据和运动数据——并学习了这些不同数据类型的统一表示。ImageBind 可以将图像中的对象与声音、3D 形状、温度和运动等属性关联起来。该模型可以用于生成文本或声音的场景。
  • SeamlessM4T 是由 Meta 设计的多模态模型,旨在促进多语言社区之间的交流。SeamlessM4T 擅长翻译和转录任务,支持语音到语音、语音到文本、文本到语音和文本到文本的翻译。该模型使用非自回归文本到单元解码器执行这些翻译。增强版 SeamlessM4T v2 成为像 SeamlessExpressiveSeamlessStreaming 这样的模型的基础,强调了在语言间保留表达的重要性,并提供了最小延迟的翻译。
  • GPT4,由 OpenAI 推出,是其前身 GPT3.5 的升级。尽管详细的架构细节尚未完全披露,但 GPT4 因其在文本、视觉和音频模型中的无缝集成而受到赞誉。该模型可以从文本和图形输入生成文本。它擅长各种任务,包括描述图像中的幽默、从屏幕截图总结文本以及对包含图表的考试问题做出适当的响应。GPT4 还因其能够有效处理广泛的输入数据格式而受到认可。
  • Gemini,由 Google DeepMind 创建,通过其内在的多模态性质而脱颖而出,允许在不依赖于单模态组件的情况下无缝地跨任务进行交互。该模型轻松地处理文本和多种音频-视觉输入,展示了其生成文本和图像输出的能力。

大型多模态模型的挑战

  • 整合更多数据模态: 大多数现有的 LMM 都是以文本和图像为基础的。然而,LMM 需要超越文本和图像,涵盖视频、音乐和 3D 等模态。
  • 多样化数据集的可用性: 开发和训练多模态生成式人工智能模型的关键挑战之一是需要大型和多样化的数据集,包含多个模态。例如,要训练一个同时生成文本和图像的模型,数据集需要包含相关的文本和图像输入。
  • 生成多模态输出: 虽然 LMM 可以处理多模态输入,但生成多样化的输出(如将文本与图形或动画结合)仍然是一个挑战。
  • 遵循指令: LMM 面临着掌握对话和遵循指令任务的挑战,超越简单的完成。
  • 多模态推理: 虽然当前的 LMM 擅长将一种模态转换为另一种模态,但将多模态数据无缝集成用于复杂推理任务(如根据听觉指令解决书面文字问题)仍然是一个具有挑战性的任务。
  • 压缩 LMM: LMM 的资源密集型性质带来了一个重大的障碍,使其不适合具有有限计算资源的边缘设备。压缩 LMM 以提高效率并使其适合部署在资源受限的设备上是一个至关重要的研究领域。

潜在应用

  • 教育: LMM 有潜力通过生成多样化和吸引人的学习材料(结合文本、图像和音频)来改变教育。LMM 提供了对作业的全面反馈,促进了协作学习平台的发展,并通过交互式模拟和现实世界的例子来增强技能的发展。
  • 医疗保健: 与传统的针对单一模态的 AI 诊断系统不同,LMM 通过整合多个模态来改善医疗诊断。它们还支持医疗保健提供者和患者之间跨语言障碍的交流,作为医院内各种 AI 应用的集中存储库。
  • 艺术和音乐生成: LMM 可以通过结合不同的模态来生成独特和富有表现力的输出,从而在艺术和音乐创作中表现出色。例如,一个艺术 LMM 可以将视觉和听觉元素融合在一起,提供沉浸式体验。同样,一个音乐 LMM 可以整合乐器和声乐元素,产生动态和富有表现力的作品。
  • 个性化推荐: LMM 可以分析用户在不同模态下的偏好,以提供个性化的内容消费推荐,例如电影、音乐、文章或产品。
  • 天气预报和环境监测: LMM 可以分析各种模态的数据,例如卫星图像、气象条件和历史模式,以提高天气预报和环境监测的准确性。

结论

大型多模态模型(LMM)的发展标志着生成式人工智能领域的一个重大突破,承诺在各个领域带来进步。随着这些模型无缝地整合不同的模态,如文本、图像和音频,其开发为医疗保健、教育、艺术和个性化推荐等领域的变革性应用打开了大门。然而,挑战,如整合更多数据模态和压缩资源密集型模型,强调了实现 LMM 潜力所需的持续研究工作的重要性。

Dr. Tehseen Zia 是 COMSATS University Islamabad 的终身副教授,拥有来自奥地利维也纳科技大学的人工智能博士学位。专攻人工智能、机器学习、数据科学和计算机视觉,他在著名的科学期刊上发表了重要贡献。 Dr. Tehseen 还作为首席调查员领导了各种工业项目,并担任人工智能顾问。