Google DeepMind 发布开源轻量多模态嵌入模型 EmbeddingGemma 2

Google DeepMind 发布开源多模态嵌入模型 EmbeddingGemma 2,把文本、代码、图像、音频、视频映射进同一个向量空间,7.4 亿参数可在手机本地推理。它意味着跨模态搜索和 RAG 不必再把数据传到云端。

一句话看懂:Google DeepMind 发布开源多模态嵌入模型 EmbeddingGemma 2,把文本、代码、图像、音频、视频映射进同一个向量空间,7.4 亿参数可在手机本地推理。它意味着跨模态搜索和 RAG 不必再把数据传到云端。

事件核心:发生了什么

10 月 6 日,Google DeepMind 推出 EmbeddingGemma 2,基于 Gemma 4 架构,采用 Apache 2.0 商业友好许可。相比去年仅支持文本、下载量超过 2000 万次的初代,这次扩展到代码、图像、视频和音频。模型总参数 7.4 亿,采用模块化设计:纯文本任务最低只需 2.7 亿参数,视觉编码器 1.7 亿,音频编码器 3 亿。

它借助 Matryoshka 表示学习,输出向量可从 768 维动态截断到 512、256 或 128 维,本地向量数据库存储最高减少 6 倍。在 Google Pixel 11 Pro 上量化后,纯文本权重占用约 191MB 内存,全模态约 567MB。上下文窗口为 8K token,是初代的 4 倍,可一次处理约 5.5 分钟音频、29 张图片或 58 帧视频。

为什么重要

嵌入模型是搜索、推荐和 RAG 的底层组件,长期由闭源 API 主导。EmbeddingGemma 2 把这一能力开源并压到端侧,等于把多模态检索的基础设施免费交到开发者手里。在 MTEB Code 基准上,其代码能力从 68.76 提升到 78.68,提升 9.92 分;在 MAEB 音频基准和文本、视觉任务中,官方称其表现匹配甚至超过部分参数量两倍以上的专用模型。这直接冲击云端嵌入 API 的定价逻辑,也让隐私敏感场景不必再依赖上传数据。

对用户/开发者/创作者的影响

开发者可用 LiteRT 在本地搭建多模态 RAG,与 Gemma 4 共享文本分词器和音频编码器,联合部署时总内存开销更低。MediaPipe Decision Task API 支持实时分类、路由和预测,适合做离线优先的智能应用。创作者可在手机端用文字或图片检索素材库、用语音备忘录定位具体视频片段,数据不出设备。对企业而言,本地代码库索引、语义代码搜索和编程智能体检索的合规成本会明显下降,尤其适合不能外传源码的团队。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,模型在真实设备上的推理延迟和耗电表现,官方给出的是内存占用而非速度数据,需看第三方实测。第二,Apache 2.0 许可下的实际采用率,以及是否有厂商基于它做端侧产品。第三,云端嵌入 API 是否会跟进降价,或转向更高维度的差异化竞争。目前公开信息显示,模型权重已开放下载,配套示例集中在 Google AI Edge 系列应用中。

来源:Google DeepMind

celebrityanime
celebrityanime
文章: 27643

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注