AI 模型与平台

谷歌的多模态 AI Gemini – 技术深度解析

mm
将 Unite.AI 添加到您在 Google 上的首选来源
Google's First Multimodal Model: Gemini

谷歌 CEO Sundar Pichai 和谷歌 DeepMind 的 Demis Hassabis 于 2023 年 12 月 介绍了 Gemini。这个新的大型语言模型集成在谷歌的各种产品中,提供了改进的功能,涵盖了数百万人使用的服务和工具。

Gemini 是谷歌的先进多模态 AI,它是由 DeepMind 和 Brain AI 实验室的联合努力诞生的。Gemini 建立在其前辈的基础上,承诺提供一个更加相互连接和智能的应用程序套件。

Gemini 的发布紧随 Bard、Duet AI 和 PaLM 2 LLM 的发布,标志着谷歌不仅要竞争,还要在 AI 革命中领先。

尽管有人认为 AI 正处于“冬季”,Gemini 的发布却表明 AI 正处于“春季”,充满潜力和增长。回顾 ChatGPT 的出现已经一年了,ChatGPT 本身就是 AI 领域的一个突破性时刻,谷歌的举动表明该行业的扩张远未结束;事实上,它可能正在加速。

什么是 Gemini?

谷歌的 Gemini 模型能够处理多种数据类型,包括文本、图像、音频和视频。它有三种版本——UltraProNano,每种版本都针对特定的应用程序,从复杂的推理到设备上的使用。Ultra 版本在多面任务中表现出色,将在 Bard Advanced 中提供,而 Pro 版本则在性能和资源效率之间取得平衡,已经集成到 Bard 中用于文本提示。Nano 版本针对设备上的部署进行了优化,有两种尺寸,并具有硬件优化,如 4 位量化,用于设备上的离线使用,如 Pixel 8 Pro。

Gemini 的架构在其本地多模态输出能力方面是独特的,使用离散图像令牌进行图像生成,并集成了 Universal Speech Model 的音频功能,以实现细致的音频理解。它能够处理视频数据作为序列图像,交织着文本或音频输入,展示了其多模态能力。

Gemini 支持文本、图像、音频和视频序列作为输入

Gemini 支持文本、图像、音频和视频序列作为输入

访问 Gemini

Gemini 1.0 正在谷歌的生态系统中推出,包括 Bard,现在从 Gemini Pro 的精炼功能中受益。谷歌还将 Gemini 集成到其搜索、广告和 Duet 服务中,通过更快、更准确的响应来增强用户体验。

对于那些希望利用 Gemini 的功能的人,谷歌 AI Studio 和谷歌云 Vertex 提供了访问 Gemini Pro 的机会,后者提供了更多的自定义和安全功能。

要体验由 Gemini Pro 提供的 Bard 的增强功能,用户可以按照以下简单步骤进行:

  1. 导航到 Bard:打开您喜欢的 Web 浏览器并转到 Bard 网站。
  2. 安全登录:使用您的谷歌帐户登录服务,确保无缝和安全的体验。
  3. 交互式聊天:您现在可以使用 Bard,其中可以选择 Gemini Pro 的高级功能。

多模态的力量:

在其核心,Gemini 利用了基于变换器的架构,类似于那些在成功的 NLP 模型中使用的架构,如 GPT-3。然而,Gemini 的独特之处在于其处理和集成来自多种模态的信息的能力,包括文本、图像和代码。这是通过一种称为 跨模态注意力 的新技术实现的,该技术允许模型学习不同类型数据之间的关系和依赖性。

以下是 Gemini 的关键组件的分解:

  • 多模态编码器: 该模块独立处理每个模态的输入数据(例如文本、图像),提取相关特征并生成单独的表示。
  • 跨模态注意力网络: 该网络是 Gemini 的核心。它允许模型学习不同表示之间的关系和依赖性,使它们能够“交谈”并丰富其理解。
  • 多模态解码器: 该模块利用跨模态注意力网络生成的丰富表示来执行各种任务,例如图像字幕、文本到图像生成和代码生成。

Gemini 模型不仅仅是关于理解文本或图像——它是关于以更接近人类感知世界的方式集成不同类型的信息。例如,Gemini 可以查看一系列图像并确定对象的逻辑或空间顺序。它还可以分析对象的设计特征以做出判断,例如哪辆车具有更流线型的形状。

但是,Gemini 的才能不仅仅局限于视觉理解。它可以将一组指令转换为代码,创建实用的工具,如倒计时器,不仅能按照指示正常运行,还能包含创意元素,如激励表情符号,以增强用户交互。这表明它能够处理需要创造力和功能性结合的任务——通常被认为是人类所特有的技能。

Gemini 的功能:空间推理

Gemini 的功能:空间推理 (来源)

 

Gemini 的功能扩展到执行编程任务

Gemini 的功能扩展到执行编程任务 (来源)

Gemini 的复杂设计基于丰富的神经网络研究,并利用谷歌的尖端 TPU 技术进行训练。Gemini Ultra 特别是已经在各种 AI 领域中设定了新的基准,展示了多模态推理任务中显著的性能提升。

凭借其分析和理解复杂数据的能力,Gemini 为现实世界的应用提供了解决方案,特别是在教育领域。它可以分析和纠正问题的解决方案,例如物理问题,通过理解手写笔记并提供准确的数学排版。这种能力表明了一个未来,AI 将在教育环境中协助学生和教育者,提供先进的学习和解决问题的工具。

Gemini 已被利用来创建像 AlphaCode 2 这样的代理,它在竞争性编程问题中表现出色。这展示了 Gemini 作为通用 AI 的潜力,能够处理复杂的多步骤问题。

Gemini Nano 将 AI 的力量带到日常设备中,在任务如总结和阅读理解以及编码和 STEM 相关挑战中保持着令人印象深刻的能力。这些较小的模型经过精细调整,以提供高质量的 AI 功能,适用于内存较低的设备,使先进的 AI 比以往任何时候都更容易获得。

Gemini 的开发涉及训练算法和基础设施的创新,使用谷歌最新的 TPU。这使得扩展和训练过程能够高效进行,确保即使是最小的模型也能提供卓越的性能。

Gemini 的训练数据集与其功能一样多样,包括 Web 文档、书籍、代码、图像、音频和视频。这个多模态和多语言数据集确保 Gemini 模型能够有效地理解和处理各种类型的内容。

Gemini 和 GPT-4

尽管其他模型出现,但人们最关心的问题是谷歌的 Gemini 与 OpenAI 的 GPT-4 相比如何,后者是新 LLM 的行业基准。谷歌的数据表明,虽然 GPT-4 可能在常识推理任务中表现出色,但 Gemini Ultra 在几乎所有其他领域都占据优势。

Gemini 与 GPT-4

Gemini 与 GPT-4

上面的基准测试表格显示了谷歌的 Gemini AI 在各种任务中的出色性能。值得注意的是,Gemini Ultra 在 MMLU 基准测试中取得了 90.04% 的准确率,表明其在 57 个学科的多项选择题中的理解能力超越了其他模型。在 GSM8K 中,Gemini Ultra 获得了 94.4% 的成绩,展示了其先进的算术处理能力。在编码基准测试中,Gemini Ultra 在 HumanEval 中获得了 74.4% 的分数,表明其对 Python 代码生成的强大理解能力。DROP 基准测试中,Gemini Ultra 再次领先,获得了 82.4% 的分数。同时,在常识推理测试 HellaSwag 中,Gemini Ultra 表现出色,尽管它没有超越 GPT-4 设定的极高基准。

结论

Gemini 的独特架构,得益于谷歌的尖端技术,使其成为 AI 领域的一名强劲竞争者,挑战了现有的基准,如 GPT-4。其版本——Ultra、Pro 和 Nano——每个都针对特定的需求,从复杂的推理任务到高效的设备应用,展示了谷歌致力于让先进的 AI 跨越各种平台和设备变得普及。

Gemini 集成到谷歌的生态系统中,从 Bard 到谷歌云 Vertex,凸显了其增强用户体验的潜力,涵盖了从个性化助手到商业分析的广泛服务。它不仅有望改进现有的应用程序,还将开辟新的 AI 驱动解决方案的途径,无论是在创意领域还是商业领域。

展望未来,像 Gemini 这样的 AI 模型的持续进步凸显了持续的研究和开发的重要性。训练如此复杂的模型并确保其以负责任和合乎道德的方式使用的挑战仍然是讨论的焦点。

我已经沉浸在了令人着迷的机器学习和深度学习世界中五年了。我的热情和专业知识让我为超过50个不同的软件工程项目做出了贡献,特别关注AI/ML。我的持续的好奇心也让我对自然语言处理产生了兴趣,这是一个我渴望进一步探索的领域。