跳到正文
原文
Google DeepMind·· 2026-08-12精选AI 评分79

Google DeepMind 发布手语转文本模型 SL2T,已集成至 Gboard 与 Live Transcribe

Putting sign language AI into users’ hands

AI 导读

Google DeepMind 发布手语转文本模型 SL2T,并将手语听写功能引入 Pixel 11 的 Gboard 和 Live Transcribe,支持美式手语转英语。模型基于超过 10 万小时、50 多种手语数据训练,通过手势关键点而非原始视频保护隐私,在 FLEURS-ASL 基准上零样本达到 70 BLEURT。

推荐理由

原文给出SL2T的训练数据规模与隐私保护设计,帮助读者理解手语翻译如何从实验室走向手机输入法。

正文 · AI 翻译

2026年8月12日模型

Google DeepMind 手语团队

推出手语到文本(SL2T),这是我们突破性的模型,为聋人和听力障碍用户提供全新的手语功能。

近几十年来,人工智能处理口语的能力快速发展,实现了自动翻译、听写和对话界面,让听力正常的用户感觉毫不费力。然而,这场技术革命并未触及全球200多种手语——以及使用这些手语的约7000万聋人和听力障碍人士。

今天,我们推出了一款大规模多语言手语到文本(SL2T)翻译模型,在质量和通用性上实现了突破。借助该模型,我们首次将手语AI带出实验室,引入消费产品:SL2T为Pixel 11上的Gboard和实时转录(Live Transcribe)提供手语到文本的听写功能,最初支持从美国手语(ASL)到英语。更多设备即将推出,更多语言也将陆续支持。

就像听力正常的用户可以使用听写功能来代替打字说话一样,这一功能使聋人用户可以在任何通常需要打字的地方用手语与手机交流。你可以打手语搜索网页、起草消息或文档,并让Gemini解决问题或执行任务。在实时转录中,你可以在对话中打手语回应,而不必来回打字。根据我们的测试者反馈,用美国手语打手语比用英语打字更快、更自然、也更愉悦。

由SL2T驱动的手语到文本功能,使用户可以在任何通常需要打字的地方用手语与手机交流。

为什么手语很重要

手语是全球聋人社区的主要语言,也是聋人文化认同的基石。聋人在手语、口语、阅读和写作方面的熟练程度存在很大差异,因此支持所有形式的无障碍访问至关重要。聋人可以从手语处理中受益,就像听力正常的人从口语处理中受益一样,此外,这项技术还为弥合聋人与听力正常社区之间的沟通差距开辟了新的可能性。尽管这一积极的社会影响令人期待,但手语AI的进展一直缓慢——既因为为手语构建AI面临复杂挑战,也因为对手语本身的工作原理存在广泛的误解。

与口语转录相比,手语翻译面临两大核心挑战。首先,转录语音是在同一语言中从声音到文本的序列映射,而手语是独立的自然语言,具有各自独特的语法和词汇。因此,手语翻译需要真正的机器翻译,而不是手语到单词的序列转换过程。其次,模型必须学会“看见”并理解身体动作。手语通过手、手臂、躯干、头部和面部的同时运动来传达意义。在高速率下准确追踪这些动作是一项困难且计算要求很高的计算机视觉任务。

鉴于这一背景,就不难理解为什么早期的一些手语技术尝试(如手语手套)从根本上就受到限制:手语并不只是“手上的英语”。它们需要对全身精细动作进行复杂的视觉感知,以及完整的语言翻译。SL2T 旨在实现这两点。

SL2T 将手语输入视为手语者身体上的点,并将其翻译为流式文本输出。示例来自 FLEURS-ASL 基准。

SL2T 的工作原理

我们通过将用户中心、文化知情的方法与大规模数据扩展相结合来构建 SL2T。该模型在超过 50 种手语的 10 万小时数据上训练——其中约四分之一的数据为 ASL。在多种语言、方言和熟练程度上联合训练,使模型学习共享的底层结构,在我们的实验中优于单语言模型。

为保护用户隐私,SL2T 将手语视为姿态关键点位置的序列,而非原始摄像头画面。设备端模型(MediaPipe Holistic)跟踪手语者身上的点位置,仅将这些几何坐标发送到服务器进行翻译,从而可以立即丢弃原始视频。

SL2T 直接将坐标序列翻译为文本,绕过了先前手语翻译工作中广泛使用的称为“glosses”的中间注释。Glosses 无法捕捉手语中丰富的非线性方面,如非手部标记和空间结构。直接从关键点翻译消除了人为的词汇限制,并使翻译质量可以随数据直接扩展。

根据关键基准(如 FLEURS-ASL(sd-test))的评估,SL2T 是迄今为止最强大的手语翻译模型,该基准评估 ASL 到英语的翻译质量。SL2T 取得了 70 BLEURT 的惊人零样本得分,显著高于任何先前报告的分数。但仅优化学术基准并不能保证在现实应用中的可用性,因此我们在实际问题上下功夫,如最小化流式延迟、防止非手语输入的幻觉、确保对 10% 左撇子手语者的公平性,以及改善单手手语(另一只手拿智能手机时使用)的性能。

原始英语SL2T 的 ASL → 英语输出
库克群岛没有任何城市,但由 15 个不同的岛屿组成。主要的岛屿是拉罗汤加岛和阿伊图塔基岛。库克群岛没有城市,由 15 个岛屿组成。两个主要岛屿是拉罗汤加岛和阿伊图塔基岛。
比赛于上午 10 点开始,天气很好,除了上午有小雨但很快放晴,这对七人制橄榄球来说是完美的一天。比赛在上午 10 点开始,天气很好。上午有小雨,但很快就停了。这是七人制橄榄球的完美日子。
在一些联邦国家,如美国和加拿大,所得税在联邦和地方两级征收,因此税率和等级因地区而异。在一些联邦国家,如美国和加拿大,所得税在联邦和地方两级征收。这意味着税率和等级因地区而异。
这种全身羽毛、温血鸟类的猛禽被认为像迅猛龙一样用两条腿直立行走,带有爪子。这种生物是恒温动物,吃灰色食物,全身覆盖着羽毛。据信它像迅猛龙一样用两条腿行走。
也许有一天,你的曾孙辈会站在一个外星世界上,好奇他们的远古祖先是什么样子的?也许有一天,你的曾孙辈会站在一个外星世界上,反思他们的祖先。

来自FLEURS-ASL基准测试的示例。SL2T能准确地将复杂的手语翻译成流畅的英语。在罕见的手势、快速的手指拼写("prey" → "grey")、被动结构、分类器描绘(省略"claws")以及缺乏语境的时态("kicked off" → "start")中仍偶尔出现错误。

与社区共建

我们相信要与聋人社区一起建设,而不仅仅是为它建设。聋人的视角塑造了这个项目的每个阶段——从聋人谷歌员工Sam Sepah的概念化,到与聋人合作伙伴的数据收集,在聋人用户研究中的评估,以及与聋人专家的技术影响评估。

为了指导负责任的现实部署,我们成立了AI手语咨询委员会(AISLAC),汇集了许多全球聋人组织和主题专家。通过这种参与式治理模式,受我们技术影响最大的社区直接影响了我们的开发优先级。我们共同撰写了一份联合影响报告,用于在Gboard和Live Transcribe中发布SL2T 1.0,透明地详细说明了技术的能力和当前局限性——我们计划在所有主要手语版本中延续这种合作方式。

展望未来

SL2T建立在学术界和工业界数十年的基础研究之上,但将美国手语输入带到用户的手机上只是开始。谷歌的使命是组织世界的信息,并使其普遍可访问和有用。实现普遍可访问性意味着要与口语和书面语言达到完全对等。我们的团队正在努力将该技术扩展到更多的手语、手语生成和前沿AI能力。我们期待负责任地分享我们的进展,使通过手语的访问成为数字领域的标准。

你可以先在Pixel 11上的Gboard和Live Transcribe中体验SL2T,更多设备即将支持——全部无需额外费用。

致谢

这项工作由Google DeepMind和Android的团队共同完成。开发SL2T模型的核心团队是:Garrett Tanzer, Benoit Brard, Elizabeth Clark, Tim Dozat, Sebastian Ebert, Dan Garrette, Manfred Georg, Vicky Holgate, Shankar Kumar, Mohammad Saboorian, Miloš Stanojević, Megh Umekar, John Wieting, Andy Zhang, 和 Chris Dyer。

将模型集成到Gboard和Live Transcribe中的Android团队是:Ausmus Chang, Sai Aditya Chitturu, Dayle Chiu, Anna Chou, Ajay Dudani, Angana Ghosh, Alex Huang, Joanne Kim, Ed Lee, Thomas Lin, James Su, Yanchao Su, 和 Sharlene Yuan。

我们感谢以下人员的额外支持:Anelia Angelova, Abhishek Bapna, Sara Basson, Glenn Cameron, Scott Crowell, Trevor Cohn, Noah Fiedel, Zoubin Ghahramani, Raia Hadsell, Tom Hudson, Alexander Hauerslev Jensen, Kazuya Kawakami, Phoebe Kirk, Peike Li, Liam McCafferty, Caroline Pantofaru, Abhinav Parashar, Christopher Patnoe, Laura Rimell, Sagar Savla, Sam Sepah, Thad Starner, Dave Uthus, 和 Biao Zhang。

我们还要感谢 MediaPipe Holistic(Google AI Edge)团队:Ivan Grishchenko、Artsiom Ablavatski、Valentin Bazarevsky、Esha Uboweja、George Sung、Jonathan Baccash、Gregory Karpiak、Sebastian Schmidt、Suril Shah、Raman Sarokin 和 Juhyun Lee。

同时非常感谢那些参与我们模型早期测试的人。

来源:Google DeepMind · deepmind.google