一句话看懂:Google DeepMind 于 2026 年 10 月 6 日发布开源多模态向量模型 EmbeddingGemma 2,将文本、代码、图像、视频、音频映射到同一个 768 维向量空间,面向本地语义搜索、RAG 和跨模态检索。它值得关注的地方在于:消费级硬件也能跑的多模态检索底座,正在从闭源 API 走向本地开源。
事件核心:发生了什么
EmbeddingGemma 2 是 Google DeepMind 发布的开放多模态 embedding 模型,采用 Apache 2.0 许可。与上一代 EmbeddingGemma 相比,关键变化有三点:从文本扩展到原生多模态;上下文从 2K 扩展到 8K;通过模块化编码器和 Matryoshka Representation Learning,在部署体积、向量维度和效果之间提供更细的权衡。
官方博客披露上一代 EmbeddingGemma 累计下载超过 2000 万次。完整模型 740M 参数,但开发者可以按需加载:文本/代码 270M、文本+视觉 440M、文本+音频 570M、完整多模态 740M。原生 768 维向量可截断为 512、256、128 维,官方建议 256 维通常是更稳的压缩点。
为什么重要
目前公开信息显示,多模态检索能力大多集中在云端闭源 API 中,本地设备通常只能跑纯文本 embedding。EmbeddingGemma 2 把图像、视频、音频纳入统一向量空间,并且明确面向手机、笔记本和边缘设备,这意味着本地 RAG 和跨模态搜索的门槛在下降。
从生态角度看,它同时接入 Sentence Transformers、Transformers、LiteRT、MediaPipe、MLX、vLLM、llama.cpp、SGLang、Ollama、LM Studio 等工具链,覆盖 Android、iOS、macOS、Web、Linux、Windows、IoT。对开源 embedding 生态来说,这是一个有分量的补位,也让“本地多模态检索底座”有了一个可用的开源选项。
对用户/开发者/创作者的影响
对开发者,最直接的变化是可以用一个模型完成“用文本搜图片”“用语音备忘录找视频片段”“把商品标题、商品图和视频编码成一个商品向量”等任务。官方 Python 入口推荐 Sentence Transformers 6.1.0 或更新版本,主模型在 Hugging Face 上为 google/embeddinggemma-2。检索时 query 和 document 需要区分 prompt_name,图像、视频和音频输入不加文本 task prefix。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对端侧应用和隐私敏感场景,量化后的文本权重 active RAM 在 Google Pixel 11 Pro 上可低至约 191MB,完整多模态模型约 567MB。这给手机端本地语义搜索、离线 RAG 和边缘设备分类聚类提供了更现实的部署空间。对创作者和内容团队,跨模态检索意味着素材库可以用自然语言直接检索视频和音频片段,减少手工打标。
值得关注的后续
第一,官方评测数据来自 full-precision checkpoint,且限定在特定 benchmark 条件下,实际选型仍需用自己的语料、媒体文件和检索指标复测。第二,向量截断到 128 维时多模态指标下降明显,官方提醒截断后必须重新 L2 normalize,且查询向量和库向量必须使用同一维度,实际部署需要验证压缩后的召回质量。第三,竞品是否跟进同类开源多模态 embedding,以及 LiteRT 等端侧运行时在更多设备上的实测表现,将决定这个模型能否成为本地多模态检索的默认底座。


