在人工智能领域不断演变的过程中,苹果公司一直在默默地开创一项开创性的方法,这可能会重新定义我们与 iPhone 交互的方式。 ReALM,即引用解析作为语言建模,是一种人工智能模型,承诺带来一种新的语境感知和无缝辅助体验。 (AAPL )
当科技界对 OpenAI 的 GPT-4 和其他大型语言模型(LLM)感到兴奋时,苹果的 ReALM 代表着一种思维方式的转变 – 从仅仅依赖云端人工智能转向更个人化的、设备端的方法。目标是创建一个真正理解你的智能助手,你的世界,以及你每天数字互动的复杂织锦。
ReALM 的核心是解析引用 – 这些模糊的代词,如 “它“、”他们” 或 “那“,人类可以轻松通过语境线索来理解。然而,对于人工智能助手来说,这一直是一个障碍,导致令人沮丧的误解和不连贯的用户体验。
想象一下,你问 Siri “找到一个基于我冰箱里的食材的健康食谱,但不包括蘑菇 – 我讨厌那些。” 有了 ReALM,你的 iPhone 不仅可以理解对屏幕信息的引用(冰箱里的食材),还可以记住你的个人偏好(不喜欢蘑菇)和更广泛的语境(找到一个根据这些参数定制的食谱)。
这种语境感知水平远远超过了当前人工智能助手的关键词匹配方法。通过训练 LLM 来无缝解析对话、屏幕和背景的引用,ReALM 旨在创建一个真正智能的数字伴侣,感觉不像一个机器人语音助手,更像你自己的思维过程的延伸。
对话领域:记住之前发生了什么
ReALM 解决了一个长期存在的挑战:在多轮对话中保持连贯性和记忆。凭借其在对话中解析引用的能力,ReALM 可以最终实现自然、来回的交互体验。
想象一下,你问 Siri “提醒我在星期五发工资时预订度假的机票。” 有了 ReALM,Siri 不仅可以理解语境(度假计划),还可以将 “发工资” 连接到你的常规发工资时间表。
这种对话智能体验感觉像一个真正的飞跃,实现了无缝的多轮对话,而不需要不断重新解释语境或重复自己。
屏幕领域:赋予你的助手眼睛
然而,ReALM 最开创性的方面可能在于其解析屏幕实体引用的能力 – 这是创建真正的无手语音驱动用户体验的关键一步。
苹果的研究论文讨论了一种将设备屏幕的视觉信息编码为 LLM 可以处理的格式的新技术。通过基本上重建屏幕布局的文本表示,ReALM 可以 “看到” 和理解各种屏幕元素之间的空间关系。

考虑一个场景,你正在查看一份餐厅列表,并要求 Siri “给我主街上的那家餐厅的方向。” 有了 ReALM,你的 iPhone 可以理解对特定位置的引用,并将其与相关的屏幕实体(匹配该描述的餐厅列表)联系起来。
这种视觉理解开启了一个全新的可能性,从无缝地对应用程序和网站中的引用进行操作,到与未来 AR 接口集成,甚至通过设备摄像头感知和响应现实世界的物体和环境。
研究论文中讨论了 ReALM 系统如何编码屏幕实体和解析不同语境中的引用。以下是论文中算法和示例的简化解释:
- 编码屏幕实体:论文探讨了几种策略来以 LLM 可以处理的文本格式编码屏幕元素。其中一种方法涉及根据周围对象的空间接近度对其进行聚类,并生成包含这些聚类对象的提示。然而,这种方法可能会导致提示过长,因为实体数量增加。
研究人员采用的最终方法是以从上到下、从左到右的顺序解析屏幕,通过算法 2 将布局表示为文本格式。这是通过对屏幕对象根据其中心坐标进行排序、根据对象之间的边距将其分组为垂直级别,并通过连接这些级别来构造屏幕解析来实现的。
通过将相关实体(在本例中为电话号码)注入文本表示中,LLM 可以理解屏幕语境并相应地解析引用。
- 引用解析示例:论文提供了几个示例来说明 ReALM 模型在不同语境中解析引用的能力:
a. 对话引用:对于请求 “Siri,找到一个基于我冰箱里的食材的健康食谱,但不包括蘑菇 – 我讨厌那些,” ReALM 可以理解屏幕语境(冰箱里的食材)、对话语境(找到一个食谱)和用户偏好(不喜欢蘑菇)。
b. 背景引用:在示例 “Siri,播放我在超市听到的那首歌” 中,ReALM 可以潜在地捕获和识别环境音频片段,以解析对特定歌曲的引用。
c. 屏幕引用:对于请求 “Siri,提醒我在星期五发工资时预订度假的机票,” ReALM 可以结合用户日程(发工资)、屏幕对话或网站(度假计划)和日历来理解和执行请求。
这些示例展示了 ReALM 解析不同语境中的引用的能力,实现更自然、更无缝的智能助手交互体验。
背景领域
超越对话和屏幕语境,ReALM 还探索了解析背景实体引用的能力 – 这些周围事件和过程通常被当前的人工智能助手忽略。
想象一下,你要求 Siri “播放我在超市听到的那首歌。” 有了 ReALM,你的 iPhone 可能会捕获和识别环境音频片段,允许 Siri 无缝地播放你想听的曲目。
这种背景意识感觉像是真正无处不在、语境感知人工智能辅助的第一步 – 一个数字伴侣,不仅理解你的言语,还理解你每天经历的丰富织锦。
设备端人工智能的承诺:隐私和个性化
虽然 ReALM 的能力无疑令人印象深刻,但其最显著的优势可能在于苹果对设备端人工智能和用户隐私的长期承诺。
与依赖将用户数据发送到远程服务器进行处理的云端人工智能模型不同,ReALM 设计为完全在你的 iPhone 或其他苹果设备上运行。这种方法不仅解决了数据隐私问题,还为真正理解和适应个人的人工智能辅助打开了新的可能性。
通过直接从你的设备数据中学习 – 你的对话、应用程序使用模式,甚至环境感知输入 – ReALM 可能会创建一个超个性化的数字助手,适应你的独特需求、偏好和日常习惯。
这种个性化感觉像是一种范式转变,远离当前人工智能助手的通用方法,这些助手通常难以适应个别用户的怪癖和语境。
ReALM-250M 模型 实现了令人印象深刻的结果:
-
- 对话理解:97.8
- 综合任务理解:99.8
- 屏幕任务性能:90.6
- 未见域处理:97.2

伦理考虑
当然,随着高度个性化和语境感知的出现,也带来了对隐私、透明度和人工智能系统可能影响或操纵用户行为的潜在风险的担忧。
随着 ReALM 对我们每天生活的理解加深 – 从我们的饮食习惯和媒体消费模式到我们的社交互动和个人偏好 – 存在这种技术被滥用、违反用户信任或跨越伦理界限的风险。
苹果的研究人员非常清楚这种紧张关系,在他们的论文中承认了在提供真正有帮助、个性化的人工智能体验和尊重用户隐私和自主权之间的平衡的必要性。
这种挑战并非苹果或 ReALM 独有 – 这是整个科技行业在人工智能系统变得越来越复杂、越来越融入我们生活时必须面对的对话。
走向更智能、更自然的人工智能体验
随着苹果继续推动设备端人工智能的边界,像 ReALM 这样的模型,真正智能、语境感知的数字助手的承诺感觉比以往任何时候都更近了。
想象一个世界,Siri(或将来可能被称为的 AI 助手)感觉不像来自云端的无人声,而更像你自己的思维过程的延伸 – 一个不仅理解你的言语,还理解你数字生活的丰富织锦、你的日常习惯和你的独特偏好和语境的伴侣。
从无缝地对应用程序和网站中的引用进行操作,到根据你的位置、活动和环境感知输入预测你的需求,ReALM 代表着朝着更自然、更无缝的人工智能体验迈出的一大步,这种体验模糊了数字和物理世界之间的界限。
当然,实现这一愿景需要的不仅仅是技术创新 – 还需要对人工智能开发采取周密的、以伦理为导向的方法,优先考虑用户隐私、透明度和自主权。
随着苹果继续完善和扩展 ReALM 的能力,科技界无疑会以极大的兴趣关注,渴望看到这项开创性的人工智能模型如何塑造智能助手的未来,并开启真正个性化、语境感知计算的新时代。
无论 ReALM 是否能够实现其超越甚至强大的 GPT-4 的承诺,仍有待观察。但有一点是肯定的:真正理解我们 – 我们的言语、我们的世界和我们每天生活的丰富织锦 – 的人工智能助手的时代已经到来,苹果最新的创新可能会站在这场革命的前沿。