一句话看懂:Google DeepMind 发布开源多模态嵌入模型 EmbeddingGemma 2,把文字、图像、视频帧和音频映射到同一个向量空间,740M 参数即可在手机本地跑多模态检索。它值得关注的点在于:端侧语义搜索不再需要串联图像描述、语音转文字等多个模型。
事件核心:发生了什么
Google DeepMind 推出 EmbeddingGemma 2,定位为同尺寸中表现领先的开源权重多模态嵌入模型。它把文本、图像、视频帧、音频统一编码进一个向量空间,文本部分权重活跃内存约 191MB,完整多模态模型在 Pixel 11 Pro 上约 567MB,整体参数规模 740M。模型采用模块化编码器设计,面向本地、隐私优先场景。
配套动作同步展开:Google AI Edge Gallery 上新增“即时媒体搜索”和“视频瞬间查找”两个演示,前者用自然语言或示例图片搜索本地相册,后者直接从本地视频中定位特定画面,无需转写音频或生成中间文字描述。Mac 端上线实验性应用 Foresight,由 EmbeddingGemma 2 和 Gemma 4 驱动,结合系统音频与麦克风做会议记录、索引和本地检索。官方表示未来数周内将通过 ML Kit 把该模型以服务形式带到 Android,并支持 NPU 加速。
为什么重要
过去要在端侧做跨模态检索,常见做法是串接图像描述模型、语音转文字模型和文本嵌入模型,延迟和内存开销叠加。EmbeddingGemma 2 把这条链路压缩成一个统一嵌入空间,直接降低了端侧多模态搜索的工程复杂度。另一个信号是它被当作零样本决策引擎使用:不训练、不微调,直接把用户输入与分类标签、描述做匹配,做毫秒级意图路由。这意味着嵌入模型不只是检索组件,也可以承担轻量的本地判断层。
对 Google 自身而言,这是把 Gemma 开源模型家族从生成能力向端侧感知与检索能力延伸的一步,同时通过 ML Kit、MediaPipe Tasks 把模型能力嵌入 Android 生态,与苹果在端侧 AI 的路线形成对照。
对用户/开发者/创作者的影响
普通用户近期能感知到的,是 Google AI Edge Gallery 里的本地相册搜索和视频画面检索——查询和媒体都在设备上转成向量,数据不出端。开发者方面,ML Kit 集成路径如果按计划落地,Android 应用可以少管理一个模型文件、少担心 APK 体积膨胀,并获得 NPU 加速和自动模型更新;跨平台项目则可走 MediaPipe Tasks。创作者和企业用户值得留意的是 Foresight 这类本地会议助手:它对会议平台不挑,离线也能工作,敏感内容留在本机。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 ML Kit 版本的具体上线时间和 NPU 加速的实际覆盖机型,目前公开信息显示为“未来数周”。二是零样本意图路由在真实业务中的准确率边界,官方尚未给出面向具体场景的评测数字。三是端侧统一嵌入是否会成为其他厂商跟进的方向,以及它和云端多模态嵌入服务之间的分工如何划分。


