Google 发布 EmbeddingGemma 2:基于 Gemma 4 的开源多模态嵌入模型

Google 发布 EmbeddingGemma 2,一个基于 Gemma 4 的 Apache 2.0 开源多模态嵌入模型,用不到 10 亿参数把文本、代码、图像、视频和音频映射到同一个 768 维向量空间,让开发者在单一模型里完成跨模态检索。

一句话看懂:Google 发布 EmbeddingGemma 2,一个基于 Gemma 4 的 Apache 2.0 开源多模态嵌入模型,用不到 10 亿参数把文本、代码、图像、视频和音频映射到同一个 768 维向量空间,让开发者在单一模型里完成跨模态检索。

事件核心:发生了什么

EmbeddingGemma 2 在 Google Developers Blog 公布,定位是为搜索和 RAG(检索增强生成)应用提供统一的嵌入模型。它基于 Gemma 4,参数量控制在 10 亿以下,采用模块化编码器架构:文本和代码只需 270M 参数,加载全部模态也仅 740M。所有模态共享 768 维向量空间和 8192 token 上下文窗口,视频默认按每秒 1 帧采样,音频要求 16kHz 单声道。

开发者可通过 sentence-transformers 库(v6.1.0 及以上)调用。加载时把不需要的 vision_config 或 audio_config 设为 None,对应编码器就不会占用内存;还支持 truncate_dim 把向量截断到 512、256 或 128 维,例如 100 万个 768 维向量在 bfloat16 下约 1.5GB,截断到 128 维只需 250MB。官方数据显示,它在 MTEB(Code)上比 EmbeddingGemma 1 高 14%,并新增图像、视频、音频检索能力,同时保留原有多语言文本精度。

为什么重要

多模态检索长期依赖多个模型拼接:文本走一个嵌入模型,图像走 CLIP 类模型,再想办法对齐向量空间。EmbeddingGemma 2 把这条链路收进一个紧凑模型,意味着同一向量空间既能做文搜图,也能做图搜音视频,且不需要庞大的算力基础设施来索引。对 RAG 应用来说,这降低了跨内容类型检索的工程复杂度。Apache 2.0 许可也让它可商用、可自托管,在开源与闭源嵌入模型的竞争中,Google 用“小体积、多模态、统一空间”切入了实用派市场。

对用户/开发者/创作者的影响

开发者最直接的变化是索引成本。模块化加载让纯文本场景只跑 270M 参数,后续要加图像或音频嵌入时,重新加载对应编码器即可,已算好的向量不需要重算,索引可以渐进式扩容。维度截断则让端侧和大规模内存索引更容易落地,适合边缘设备上的语义搜索。对做多模态 RAG 的团队,统一向量空间省去了跨模型对齐的额外训练和推理。对创作者而言,目前公开信息显示这套能力主要面向检索而非生成,短期内不直接改变内容生产方式,但会让图库、音视频素材库的语义搜索体验更好。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是生态跟进:sentence-transformers 之外,主流向量数据库和 RAG 框架是否会原生支持 EmbeddingGemma 2 的模块化加载方式。二是竞品反应:OpenAI、Cohere、Voyage 等闭源嵌入服务,以及开源侧的 BGE、Jina 系列是否推出对标的多模态统一嵌入模型。三是实际检索质量:官方给出的 MTEB(Code)提升是单一基准,图像、视频、音频检索在真实业务数据上的召回表现还需要社区验证。

来源:Google Developers Blog(RSS)

celebrityanime
celebrityanime
文章: 27632

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注