AI 模型与平台

谷歌DeepMind将手语翻译带到手机上,推出SL2T

mm
将 Unite.AI 添加到您在 Google 上的首选来源

谷歌DeepMind推出了一个手语到文本的模型,SL2T,并将其集成到两款消费级安卓产品中,这是手语人工智能首次出现在手机功能中。该模型支持Gboard和Live Transcribe上的手语到文本的输入,在Pixel 11手机上发布,首先支持美国手语到英语的翻译,于2026年8月12日推出。

该功能可以在任何需要输入文本的地方使用。聋人可以通过手语来代替输入,例如搜索网页、撰写消息或文档,或者查询Gemini。Live Transcribe中,聋人可以通过手语来回应,而不是通过输入。在测试中,谷歌发现使用手语比输入英语更快、更自然。

SL2T是谷歌首次将手语翻译质量和普遍性描述为突破性的模型。它是在超过100,000小时的手语数据上训练的,涵盖了50多种手语,其中大约四分之一的数据是美国手语。通过联合训练不同语言、方言和熟练度,模型在公司的实验中优于单语言系统,根据公告

模型看到什么以及如何翻译

系统不处理原始视频。一个设备上的模型,MediaPipe Holistic,跟踪面部、身体和手部的130个关键点,帧帧分析,并且只有这些几何坐标离开设备进行翻译。原始摄像头输入立即被丢弃,这是谷歌设计的隐私保护措施。

从坐标流中,SL2T直接生成英语文本,跳过中间注释层,即大多数先前的手语翻译系统依赖的注释。注释为单个手语分配固定标签,限制了词汇并丢失了非手语标记和空间构造,这些在手语中承载语法意义。去掉这个瓶颈,使翻译质量可以随着训练数据的增加而提高,而不是依赖手工构建的标签集。

手语是独立的自然语言,具有自己的语法,不是英语的标记版本。这使得任务成为机器翻译和计算机视觉问题:模型必须跟踪手、臂、躯干、头和面部的同时运动,帧率很高。早期的手语技术尝试,例如传感器手套,无法解决这两个要求。

基准结果和剩余错误模式

FLEURS-ASL基准上,SL2T得分为70 BLEURT,远高于以前报告的结果,根据谷歌的说法。该公司还报告了74 BLEURT的单手手语变体和85 BLEURT的PRESTO-ASL,一个由助手风格的短语组成的数据集,签名到停靠的平板电脑上。在FSboard上,一个由聋人在移动设备上收集的指语数据集,模型达到64%的精确匹配准确率。这些是供应商报告的数字,尚未发布独立评估。

谷歌发布了来自FLEURS-ASL的示例,展示了流畅的输出和可识别的故障模式。模型偶尔替换罕见的手语和快速指语,丢弃被动构造和分类器描绘,并在上下文缺失时丢失时态。一个示例将”This fully feathered, warm blooded bird of prey”翻译为”This creature is warm-blooded, eats grey”,这是指语错误,替换”prey”为”grey”。

模型还表现出残留的幻觉行为,在没有人签名时生成文本,例如当第二个人进入帧或签名者暂停时。谷歌表示,发布版本显著减少了这些错误,相比于2026年7月聋人评估者测试的预发布版本,但并未消除它们。

谷歌规定工具不能使用的地方

发布带有一个不寻常的管理层。谷歌DeepMind成立了一个咨询机构,AI手语咨询委员会,汇集了聋人组织,包括国家聋人协会,世界聋人联合会,聋人专业艺术网络和罗切斯特理工学院国家技术研究所聋人。委员会共同撰写了一份联合影响报告,阐述了该技术的用途和限制。

报告将SL2T 1.0定义为低风险、非正式场合的辅助草稿生成工具:消息、搜索、导航、笔记和随意的一对一对话。它明确排除了医疗咨询、法律程序、警方互动、课堂教学、工作面试和政府福利决定。它还指出,该工具不满足《美国残疾人法案》或等效框架下的合理便利的法律义务,并且不得由机构用来替代认证的人类口译员。

签名者在整个过程中保持控制。两个应用程序都显示了用户可以审查和编辑的文本预览,在Live Transcribe中,聋人用户控制何时显示翻译文本给对话伙伴。报告指出,这个保障假设了功能性英语识字能力,以捕捉错误。

SL2T在自身限制文档中的表现

影响报告详细列出了模型的技术边界。准确性在低光照、强烈背光或服装降低对比度的情况下会降低。姿势跟踪器仅跟踪帧中的最大主题,无法处理多个签名者。性能会在极端相机角度或签名者躺着时下降。输入片段的长度限制为60秒,每个片段独立翻译,没有对话历史。模型未针对18岁以下的签名者进行训练或评估。它不支持自定义词汇表、名称标志或方言偏好。

近期更新已经在路线图中,包括标点符号、换行符、表情符号和基本编辑命令的输入,以及Live Transcribe中的对话记忆。长期研究目标包括改善对非手语标记的敏感度,例如面部表情和眉毛位置,多签名者支持和区域ASL方言的数据收集扩展。

该项目起源于一位聋人谷歌员工Sam Sepah,聋人视角被融入数据收集、用户研究和评估。谷歌将SL2T的推出描述为更长期努力的开始:其他手语、手语生成和更广泛的边界能力都被列为活跃的工作。该功能在Pixel 11上免费提供,更多设备将随后跟进,进入数据收集、用户研究和评估。谷歌将SL2T的推出描述为更长期努力的开始:其他手语、手语生成和更广泛的边界能力都被列为活跃的工作。该功能在Pixel 11上免费提供,更多设备将随后跟进,进入数据收集、用户研究和评估。

Jonas Reeve 是 Unite.AI 的 AI 生成分析师,专注于认知 AI、人工通用智能(AGI)和机器智能的理论基础。他的工作探索了学习、推理、记忆和抽象如何在生物和人工系统中出现,建立了现代 AI 架构和认知科学、心灵哲学长期存在的问题之间的联系。
以概念和反思的方法,Jonas 检视了推理模型、代理系统、涌现认知和对齐理论等框架,旨在阐明 AGI 进展的真正含义——以及它的不意味着什么。与其追逐时间表或炒作,他强调了第一原则、概念严谨性和当前模型的局限性。
Jonas Reeve 撰写的文章由 AI 生成并由 Unite.AI 的编辑团队审查,以确保高级 AI 概念的准确性、清晰性和负责讨论。