Perplexity发布pplx-embed-v2-late:0.6B与9B双版本嵌入模型

Perplexity于2026年10月发布pplx-embed-v2-late系列多模态嵌入模型,包含0.6B边缘版和9B高质量版,在智能体PDF问答基准MADQA上最高得分92.4%,采用MIT开源许可。

一句话看懂:Perplexity于2026年10月发布pplx-embed-v2-late系列多模态嵌入模型,包含0.6B边缘版和9B高质量版,在智能体PDF问答基准MADQA上最高得分92.4%,采用MIT开源许可。

事件核心:发生了什么

Perplexity发布了pplx-embed-v2-late,这是一对ColBERT风格的多模态嵌入模型,提供0.6B和9B两种参数规模。两者均能检索文本、图像和渲染后的PDF页面,并共享同一嵌入空间。

0.6B模型面向边缘设备和本地查询编码,图像任务约340M活跃参数,每token输出128维向量;9B模型面向数据中心索引构建,量化后权重约16至18GB。两模型已在Hugging Face以MIT许可证开源,允许商用,托管的Perplexity API端点目前仍处于计划阶段,尚未上线。

在Perplexity公布的评测中,9B模型在MADQA智能体PDF问答任务上取得92.4%准确率,为所测最高;0.6B模型得90.1%。9B在72项领域文本任务上以81.3% nDCG@10领先所测模型1.6个百分点。图像检索ViDoRe v3上,0.6B得62.3%,落后腾讯EVIE。0.6B在ViDoRe v3 Markdown取得61.2%,为所测模型中最低,但仍高于所有外部对比模型。9B在BrowseComp+上得64.0%,比次优ColBERT模型高4.9个百分点。

为什么重要

该模型的核心差异化在于共享嵌入空间与超窄向量维度。128维token向量的宽度仅为竞品2048至4096维的1/16至1/32,且9B建立的索引可由0.6B模型查询,在ViDoRe v3图像检索中得分63.5%,高于0.6B全链路检索的62.3%。这为“云端建索引、边缘做查询”的部署架构提供了新选择。

在技术路线上,Perplexity从18B教师模型通过LEAF风格的token级训练蒸馏出两个学生模型,页面以图像编码绕过OCR步骤。相比Google Gemini Embedding 2等闭源方案,MIT开源许可降低了商业使用门槛。

对用户/开发者/创作者的影响

对开发者而言,0.6B模型可在笔记本或小型GPU上运行,适合低延迟本地查询;9B模型适合在云端或高显存GPU上构建PDF、幻灯片、扫描报告的文档索引。两者需sentence-transformers不低于6.0.0、transformers不低于5.4.0。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

需要留意的是,模型每token存储一个向量,索引体积会随文档长度线性增长。单个输入目前无法混合文本与图像。所有评测分数均为Perplexity自报,技术报告尚未发布,实际部署效果有待更多独立验证。交互式解释器可能提供了更多对比信息。

值得关注的后续

一是托管API端点何时上线,这将决定不自行部署的团队能否接入。二是技术报告发布后,第三方能否复现92.4%的MADQA得分及共享空间的查询一致性。三是图像检索领域的竞争,谷歌Gemini Embedding 2在MIRACL-Vision和PPLX-Q2I上仍领先9B模型,腾讯EVIE在ViDoRe v3上分数更高,后续排名可能变化。

来源:MarkTechPost Research

celebrityanime
celebrityanime
文章: 28212

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注