DeepMind把手语输入送进Pixel,微信亮出WeLM|8月12日 AI Radar 夜间加更 上午公开稿发出以后,晚间增量集中在两处。多模态模型开始进入手语输入、工业设计和机器人维修这些更具体的动作面。Agent 工程也继续往依赖图、登录态、提醒恢复和长期运维里走。这里收录 12 条,只写上午 9 点 31 分以后出现的新发布、新实测和新争议。 上午已经写过的 ChatGPT Linux、Nemotron 3.5、Grok Bo…

DeepMind 将手语转文字功能送进 Pixel 11,微信发布 WeLM 模型家族,多模态与 Agent 工程开始进入手语输入、工业设计、机器人自修等更具体的动作层面。

一句话看懂:DeepMind 将手语转文字功能送进 Pixel 11,微信发布 WeLM 模型家族,多模态与 Agent 工程开始进入手语输入、工业设计、机器人自修等更具体的动作层面。

事件核心:发生了什么

8 月 12 日夜间,AI 领域出现一批贴近真实场景的增量发布。Google DeepMind 推出 SL2T 系统,支持美国手语转英文,并已进入 Pixel 11 的 Gboard 与 Live Transcribe——用户面对手机摄像头打手语,系统读取手、身体与面部的同步动作后完成输入或实时转录。微信团队公布 WeLM 模型家族:小档 WeLM-80B 每次激活约 3B 参数,用于小微助手、微信原生功能和小程序调用;大档 WeLM-617B 每次激活约 23B 参数,面向复杂推理与工具生成。此外,多模态 Agent 开始操作 Rhino 8 工业建模软件并在 15 分钟内完成外观建模,Flex-π 机器人模型在演示中完成八阶段自修夹爪任务(20 次测试成功 11 次),Labor0 用依赖图拆分工程请求再分配给多种 Coding Agent,Kernel MCP 演示了复用登录态完成外卖全流程的案例。

为什么重要

这批发布没有旗舰基座模型压场,真正的信号在于 AI 的能力边界正从“生成内容”延伸到“执行动作”。手语输入解决了语音和键盘接不住的输入盲区,而且 DeepMind 的姿态追踪留在设备端、翻译由服务器完成,给隐私和算力画了一条清晰边界。WeLM 对微信的意义在于用较低激活参数承接真实流量——聊天、支付、小程序这些连续入口会让模型直接面对真实任务,一步做错就会影响真实关系。工业设计和机器人自修则说明 Agent 正在从生成效果图进化到操作专业软件和物理设备。值得留意的是,这些演示目前仍处于早期:Flex-π 的 11 次成功远未达到无人值守标准,Rhino 建模也还缺尺寸、曲率连续性等工程验收。

对用户/开发者/创作者的影响

手语用户是 SL2T 最直接的受益者,但目前只有美国手语到英文,且仍依赖服务器翻译,覆盖范围有限。开发者会关心 WeLM 的响应成本、端到端完成率和小程序工具的可调用范围,不过微信尚未公开完整模型卡、价格和外部开发接口。使用 Codex Computer Use 的开发者需要注意:持续看屏、执行动作并回看结果会快速扩大上下文,token 消耗很高,更合理的产品分工是把稳定控件交给确定性选择器,模型只处理语义判断和异常页面。Kernel MCP 演示的外卖全流程虽然吸引人,但生产系统必须限制付款金额、地址修改和对外消息权限。归藏公开的 PPT 与社媒卡片 Skill 提供了一种可复制工作流,但能否真正复用要看安装说明、失败处理和产物验收是否完整。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,SL2T 能否扩展到美国手语之外的手语类型,以及设备端姿态追踪和服务器翻译的分工是否会调整。第二,WeLM 是否开放外部接口和定价,实际调用成本能否支撑微信体量的流量。第三,Labor0 的任务状态更新、同文件加锁和失败节点处理是否经得起大型仓库检验——项目刚发布,外部案例还很少。浏览器 Agent 方面,Raft 的提醒恢复功能说明运行时竞争已进入很细的工程环节,值得留意后续故障率和迁移细节。目前公开信息显示,多数能力仍是演示或早期产品,距离大规模可靠运行还有一段路要走。

来源:@colinchen4

celebrityanime
celebrityanime
文章: 18287

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注