DeepMind推出手语转文本模型SL2T,为聋哑用户在手语与文字之间搭建沟通桥梁,是无障碍AI的工程实践。
Google DeepMind Sign Language Team
今天,我们发布了一个大规模多语种手语转文字(SL2T)翻译模型,标志着质量和通用性的重大突破。基于这一模型,我们首次将手语 AI 从实验室带入消费产品:SL2T 为 Pixel 11 上的 Gboard 和 Live Transcribe 提供手语转文字听写功能,首批支持美国手语(ASL)到英语的翻译。更多设备和更多语言即将陆续推出。
与听力用户可以使用听写代替打字一样,这一功能让聋人可以在任何通常需要打字的地方对着手机比划手语。你可以用手语搜索网页、起草消息或文档,还能让 Gemini 解答问题或执行任务。在 Live Transcribe 中,你可以在对话中用手语回应,而不必来回打字。据测试人员反馈,用 ASL 比划比用英语打字更快、更自然、也更愉快。
手语是全球聋人社区的主要语言,也是聋人文化身份的基石。聋人在手语、口语、阅读和写作方面的熟练程度差异很大,因此以多种模态提供支持非常重要。聋人可以像听力用户从口语处理中受益一样,从手语处理技术中获益,同时这项技术还为弥合聋人与听力社群之间的沟通鸿沟开辟了新的可能性。尽管这一技术具有积极的社会影响潜力,手语 AI 的进展却很缓慢——这既是因为构建手语 AI 本身面临复杂的挑战,也因为围绕这些语言本身的运作方式存在着广泛的误解。
与口语转录相比,手语翻译面临两个核心挑战。首先,转录语音是从声音到同一种语言文字的顺序映射,而手语则是独立的自然语言,有着自己独特的语法和词法体系。因此,它们需要真正的机器翻译,而不是从手语到文字的顺序转换过程。其次,模型必须学会"看到"并理解肢体运动。手语通过手、手臂、躯干、头部和面部的同步动作来传达意义。以高帧率精确追踪这些动作是一项困难且计算密集的计算机视觉任务。
基于以上背景,我们不难理解为什么早期一些手语技术(如手语手套)存在根本性的局限:手语并非简单的"手上的英语"。它们需要对精细的全身动作进行复杂的视觉感知,以及完整的语言翻译。SL2T 的设计目标正是同时实现这两点。
我们通过将以用户为中心、文化知情的方法与大规模数据扩展相结合来构建 SL2T。该模型在超过 50 种手语的超过 10 万小时数据上进行了训练——其中大约四分之一的数据是 ASL。在多种语言、方言和熟练程度的数据上进行联合训练,促使模型学习共享的底层结构,在我们的实验中超越了单语言模型。
为保护用户隐私,SL2T 将手语视为一系列姿态地标位置,而非原始摄像头画面。一个端侧模型(MediaPipe Holistic)追踪比划者身上各点的位置,只有这些几何坐标被发送到服务器进行翻译,允许原始视频立即丢弃。
SL2T 将这个坐标序列直接翻译成文本,跳过了先前手语翻译研究中广泛使用的"gloss"(词性标注)这一中间注释步骤。Gloss 无法捕捉手语中丰富的非线性方面,如非手部标记和空间结构。从地标直接翻译去除了人为的词汇限制,使翻译质量能够随数据量直接扩展。
根据 FLEURS-ASL(sd-test)等关键基准测试,SL2T 是迄今为止最强大的手语翻译模型。SL2T 实现了令人瞩目的零样本得分 70 BLEURT,远高于此前任何报告的分数。但仅优化学术基准并不能保证在现实应用中的可用性,因此我们在实际问题上付出了大量努力:最小化流式延迟、防止对非手语输入的幻觉、确保对 10% 左撇子比划者的公平性,以及改善单手比划的性能(当另一只手握着智能手机时会用到单手比划)。
| Original English | SL2T's ASL → English output |
|---|---|
| The Cook Islands do not have any cities but are composed of 15 different islands. The main ones are Rarotonga and Aitutaki. | The Cook Islands have no cities and consist of 15 islands. The two main islands are Rarotonga and Aitutaki. |
| The games kicked off at 10:00am with great weather and apart from mid morning drizzle which quickly cleared up, it was a perfect day for 7's rugby. | Games start at 10 a.m. in great weather. There is a light rain in the morning that clears up. It's a perfect day for 7v7 rugby. |
| In some federal countries, such as the United States and Canada, income tax is levied both at the federal level and at the local level, so the rates and brackets can vary from region to region. | In some federal countries, like the US and Canada, income tax is collected at both the federal and local levels. This means that the rates and brackets vary depending on your region. |
| This fully feathered, warm blooded bird of prey was believed to have walked upright on two legs with claws like the Velociraptor. | This creature is warm-blooded, eats grey, and is covered in feathers. It is believed that it walks on two legs like a velociraptor. |
| Maybe one day, your great grandchildren will be standing atop an alien world wondering about their ancient ancestors? | Maybe one day your great-grandchildren will stand on an alien world and reflect on their ancestors. |
Examples from the FLEURS-ASL benchmark. SL2T accurately translates complex ASL into fluent English. Occasional errors remain in rare signs, rapid fingerspelling ("prey" → "grey"), passive constructions, classifier depictions (dropping "claws"), and tense without context ("kicked off" → "start").
我们坚信与聋人社区共同构建,而非仅为聋人构建。在项目的每个阶段,聋人的视角都塑造了我们的方向——从聋人 Googler Sam Sepah 的概念构思,到与聋人合作伙伴的数据收集、聋人用户研究中的评估,再到与技术专家共同进行的影响评估。
为指导负责任的现实部署,我们成立了 AI 手语咨询委员会(AI Sign Language Advisory Committee,简称 AISLAC),汇聚了众多全球聋人组织和领域专家。通过这一参与式治理模型,受技术影响最大的社区能够直接影响我们的开发优先级。我们共同撰写了 SL2T 1.0 在 Gboard 和 Live Transcribe 中发布的联合影响报告,透明地详述了该技术的能力和当前局限——这种协作方式我们计划在所有主要手语版本发布中延续。
SL2T 建立在前沿学术和行业数十年的基础研究之上,但将 ASL 输入带到用户手机只是开始。Google 的使命是组织全球信息并使其普遍可访问和有用。实现普遍无障碍意味着要与口语和书面语言达到完全平等。我们的团队正在努力将这项技术扩展到更多手语、手语生成以及前沿 AI 能力。我们期待负责任地分享我们的进展,使通过手语进行访问成为数字世界中的标准方式。
你可以在 Pixel 11 上的 Gboard 和 Live Transcribe 中率先体验 SL2T,更多设备即将推出——所有功能均无需额外付费。
这项工作由 Google DeepMind 和 Android 团队共同完成。开发 SL2T 模型的核心团队成员包括:Garrett Tanzer、Benoit Brard、Elizabeth Clark、Tim Dozat、Sebastian Ebert、Dan Garrette、Manfred Georg、Vicky Holgate、Shankar Kumar、Mohammad Saboorian、Miloš Stanojević、Megh Umekar、John Wieting Andy Zhang 和 Chris Dyer。
将模型集成到 Gboard 和 Live Transcribe 的 Android 团队成员包括:Ausmus Chang、Sai Aditya Chitturu、Dayle Chiu、Anna Chou、Ajay Dudani、Angana Ghosh、Alex Huang、Joanne Kim、Ed Lee、Thomas Lin、James Su、Yanchao Su 和 Sharlene Yuan。
我们感谢以下人员在额外支持方面的贡献:Anelia Angelova、Abhishek Bapna、Sara Basson、Glenn Cameron、Scott Crowell、Trevor Cohn、Noah Fiedel、Zoubin Ghahramani、Raia Hadsell、Tom Hudson、Alexander Hauerslev Jensen、Kazuya Kawakami、Peike Li、Liam McCafferty、Caroline Pantofaru、Abhinav Parashar、Christopher Patnoe、Laura Rimell、Sagar Savla、Sam Sepah、Thad Starner、Dave Uthus 和 Biao Zhang。
同样感谢参与我们模型早期测试的所有人员。