谷歌DeepMind发布SL2T,手语AI首次进入消费级手机

谷歌DeepMind发布手语转文本模型SL2T,并首次将其集成到Pixel 11手机中。这是手语AI从实验室走向消费级硬件的关键一步,意味着手语识别开始成为手机系统级能力的一部分。

一句话看懂:谷歌DeepMind发布手语转文本模型SL2T,并首次将其集成到Pixel 11手机中。这是手语AI从实验室走向消费级硬件的关键一步,意味着手语识别开始成为手机系统级能力的一部分。

事件核心:发生了什么

2026年8月13日,谷歌DeepMind宣布推出多语种手语转文本模型SL2T,并集成至Pixel 11系统,与Gboard键盘、Live Transcribe应用打通。用户通过前置摄像头做出手语动作,即可完成消息编辑、网页搜索或与Gemini对话,不再依赖键盘输入。

模型训练覆盖超过50种手语,总计10万小时数据,其中约四分之一来自美国手语数据集;跨语种联合训练使模型能够学习不同手语间的共通动作逻辑,并在FLEURS-ASL评估中创下手语转录模型新纪录。与传统依赖固定词库标签的方案不同,SL2T直接解读人体动作生成文本,同时处理面部表情、身体空间位置和唇部动作等非手部语义信息。

隐私方面,手机端MediaPipe Holistic实时追踪手部、面部和躯干的130个关键点,仅向外传输动作坐标,原始视频会立即删除,不上传云端。目前该功能仅支持美式手语转英文翻译。

为什么重要

手语AI过去多停留在研究验证或特定垂直场景,SL2T是首个进入主流消费电子设备的手语识别模型。它的意义不只是“多了一个输入方式”,而是将手语理解纳入手机操作系统层级的交互能力,为听障用户提供了一条不依赖文字的实时沟通路径。

从技术路线看,SL2T放弃了固定词汇标签,转向直接对手部动作及全身姿态进行端到端建模,这更接近自然语言处理中从序列到序列的生成范式。跨50种手语的联合训练也表明,手语AI正在从单语种小模型走向规模化数据训练。

竞争层面,谷歌之外,科大讯飞、华为、苹果均在AI无障碍交互上持续投入。SL2T的落地,可能会加速这类能力从“辅助功能”升级为手机厂商的差异化卖点。

对用户/开发者/创作者的影响

对普通用户,尤其是听障用户,SL2T意味着手语首次能直接驱动手机操作和AI助手对话,而不是先转成文字再输入。本地化关键点追踪和原始视频即时删除的设计,也缓解了手语数据上传云端带来的隐私顾虑。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者,DeepMind此前的SignGemma已在2025年5月开源,SL2T的算法基础可以追溯至该项目。目前谷歌计划将SL2T扩展到更多手语和Android设备,开发者可以关注其模型开源或API开放的可能性,用于构建更细分的无障碍应用。需要留意的是,当前仅支持美式手语转英文,中文化和中国手语支持尚不明确。

对内容创作者,手语视频的字

celebrityanime
celebrityanime
文章: 18306

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注