AREX Feed Article
DeepMind 发布 SL2T 手语转文字模型:Pixel 11 上用手语代替打字
8 月 12 日,宣布推出 SL2T(sign-language-to-text)手语转文字模型:从 Pixel 11 开始,聋人和听障用户可以对手机打美国手语(ASL),在 Gboard 和 Live Transcribe 里直接得到英语文本,不必打字。首发语言对是 ASL→英语,不额外收费。
随推文发布的给出训练规模:数据超过 10 万小时、覆盖 50 多种手语,约四分之一是 ASL。DeepMind 称 SL2T 在 FLEURS-ASL 学术基准上拿到零样本 70 BLEURT。隐私设计是:设备端 MediaPipe Holistic 追踪身体骨骼点,只把坐标发往服务器翻译。
在 Pixel 11 上,手语就是键盘
博客用语音听写作类比:听力用户可以用说话代替打字,SL2T 让聋人用户在以往打字的地方直接对手机打手语。用户可以手语搜索网页、起草消息或文档、让 Gemini 答题或执行任务;在 Live Transcribe 里,则能在对话中直接用手语回复,省去来回打字。
DeepMind 称,据测试者反馈,用 ASL 输入比打英语更快、更自然、也更愉快。当天的报道确认,功能随 Pixel 11 系列的发布首次亮相,内嵌在 Gboard 和 Live Transcribe 中。
博客写明,SL2T 首先在这两款应用上线,更多设备即将到来,更多语言随后跟上。
手语不是「手上的英语」
博客解释了这个领域进展缓慢的原因。其一,语音转写是同一语言内从声音到文本的顺序映射;手语则是拥有独立语法和词库的自然语言,需要真正的机器翻译,而非把手语词逐个换成英语词。
其二,模型必须看懂身体运动:意义通过手、手臂、躯干、头和面部的同步动作传递,高帧率追踪本身就是费算力的计算机视觉难题。早期的手语手套一类尝试因此受限于思路,因为手语不是「手上的英语」。
博客给出的背景是:全球有 200 多种手语,约 7000 万聋人和听障人士使用。DeepMind 的说法是,SL2T 首次把手语 AI 带出实验室、放进消费产品。
只上传骨架坐标,不上传视频
SL2T 看到的不是摄像头原始画面,而是打手语者身上一串关键点坐标。设备端模型 MediaPipe Holistic 在手机上追踪这些点,只有几何坐标被送服务器翻译,原始视频可立即丢弃。
模型还跳过了以往手语翻译常用的中间标注 gloss(手语词条注记),直接把坐标序列翻译成文本。DeepMind 的解释是,gloss 无法捕捉非手部标记(non-manual markers)和空间结构;去掉 gloss 也移除了人工词表上限,翻译质量可直接随数据量增长。
70 BLEURT,以及还会犯的错
数据方面,超过 50 种手语联合训练,约四分之一为 ASL。DeepMind 称,多语言、多方言、多熟练度的联合训练让模型学到共享的底层结构,在自家实验中优于单语言模型。的报道复述了同一组数字。
基准成绩:FLEURS-ASL(sd-test)上零样本 70 BLEURT,DeepMind 称显著高于此前任何已报告的分数,并称 SL2T 是迄今最强的手语翻译模型。
博客同时列出仍会犯的错:罕见词、快速 fingerspelling(样例里 prey 被译成 grey)、被动结构、分类词描绘(丢了 claws)、无语境时的时态(kicked off 变成 start)。团队还打磨了基准之外的事:压低流式延迟、防止对非手语输入产生幻觉、照顾约占 10% 的左利手手语者、优化单手持机打手语。
从 Sam Sepah 到 AISLAC:聋人社群全程在场
博客强调与聋人社群共建,而不是替他们做。项目概念由聋人员工 Sam Sepah 提出,数据收集与聋人伙伴合作完成,评估在聋人用户研究中开展。
DeepMind 还设立 AI Sign Language Advisory Committee(AISLAC),汇集多个全球聋人组织和专家,以参与式治理直接左右开发优先级。这次上线的版本叫 SL2T 1.0,双方联合撰写影响报告,写明技术能力与当前局限,并计划延续到所有主要手语版本。
「我们不会停在 ASL」,但权重和离线仍是问号
核心团队成员 在 X 上宣布,自己团队「第一个通用手语转文字模型」今天上线,驱动 Android 上的新 ASL 输入功能,并补了一句:and don't worry, we're not stopping at ASL(别担心,我们不会停在 ASL)。
Google DeepMind 研究副总裁 也发文称,SL2T 为聋人和听障用户带来新的手语功能。
则转推请求:「模型很酷,请考虑发布到 HF!(This is a really cool model. Please consider publishing to HF!!)」官方公告没有提到开源或公开权重。
简介自称 deaf 的开发者 的评价是「UX Gold」,祝贺所有参与者。博客给出的路线是更多手语、手语生成(sign language generation)和前沿 AI 能力。但首发只有 ASL→英语一对语言,翻译在 Google 服务器上完成,离线场景的行为博客未说明,下一批手语的日期也没有给出;Chaumond 的开源请求在官方公告中同样未获提及。