DeepSeek 发布多模态模型,“小鲸鱼”长出了眼睛

DeepSeek 在 API 平台上线了实验性多模态模型 deepseek-v4-flash-vision-exp,首次为 V4 系列补上官方视觉输入能力。该模型不仅支持图像理解,还在多项 Agent 与工具调用测试中显著提升,部分指标反超 Anthropic 的 Opus 4.8。

一句话看懂:DeepSeek 在 API 平台上线了实验性多模态模型 deepseek-v4-flash-vision-exp,首次为 V4 系列补上官方视觉输入能力。该模型不仅支持图像理解,还在多项 Agent 与工具调用测试中显著提升,部分指标反超 Anthropic 的 Opus 4.8。

事件核心:发生了什么

据 InfoQ CN 报道,DeepSeek 已通过官方 API 平台上线实验模型 deepseek-v4-flash-vision-exp,正式开放图像理解服务。这是 DeepSeek V4 系列首次通过官方 API 明确支持视觉输入,补上了其在多模态开发场景中的能力缺口。

在技术实现层面,该模型将图片转换为 token 后按 token 计费,单张图片最多占用 384 tokens,价格与 V4-Flash 文本模型保持一致。API 同时支持 Chat Completions、Messages、Responses 三种调用格式,并提供 base64 内联、外部 URL 及 Files API 三种图片传入方式,方便接入各类 Agent 工具。

值得关注的是,Vision-Exp 并非简单地在原模型上外挂视觉编码器。根据官方披露的七项测试数据,该模型在六项测试中成绩发生变化,其中五项提升、一项小幅下降:Terminal Bench 2.1 从 82.7 升至 83.9;NL2Repo 从 54.2 升至 57.7;DeepSWE 从 54.4 升至 59.3;Toolathlon-Verified 从 70.3 升至 75.9;DSBench-Hard 从 59.6 升至 63.6;AutomationBench 从 25.1 升至 25.7;唯一出现下滑的是 Cybergym,从 76.7 降至 75.3。其中提升最明显的是 Toolathlon(+5.6 分)和 DeepSWE(+4.9 分),这两项均与工具调用、真实代码库修改和长周期 Agent 执行相关。

为什么重要

此次发布的意义在于,DeepSeek 的 V4 系列此前主要以文本推理、代码生成和 Agent 能力见长,视觉输入的缺失使其在多模态 Agent 开发场景中需要依赖外部方案。Vision-Exp 的补位意味着开发者可以在 DeepSeek 的 API 体系内完成图文混合输入,不再需要拼接多个模型。

从竞争格局看,虽然 Vision-Exp 在大多数文本 Agent 测试中仍弱于 Anthropic 的 Opus 4.8——例如 NL2Repo 低 12 分、DSBench-Hard 低 8.1 分——但它在 DeepSWE 上达到 59.3,超过 Opus 4.8 的 58.0;Toolathlon 上也仅比 Opus 4.8 低 0.3 分。更准确的判断是,Vision-Exp 的文本 Agent 能力整体接近 Opus 4.8,在个别代码 Agent 测试上实现了反超。考虑到其计费价格与 V4-Flash 拉齐,这可能在多模态推理和 Agent 自动化场景中形成一定的成本竞争优势。

对用户/开发者/创作者的影响

对开发者而言,Vision-Exp 的 API 设计明显是为 Agent 生态准备的——三种调用格式和三种图片传入方式降低了接入门槛,图文混合输入能力让开发者可以构建“看截图→改代码→跑测试”类的自动化工作流。对于追求高性价比多模态 Agent 方案的团队,该模型值得纳入评估范围。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对创作者和内容生产者来说,图片按最多 384 tokens 计费的规则意味着视觉理解的边际成本极低,适合批量处理截图、图表和文档扫描等场景。不过,目前公开信息显示该模型仍属于“Exp”实验性阶段,稳定性和长期可用性尚未得到充分验证,生产环境落地前需要留出测试周期。

值得关注的后续

一是实验性标签何时摘除。Vision-Exp 目前仍带“Exp”后缀,官方将其定义为实验模型,后续是否升级为正式版本、何时进入稳定 API 将是重要的可用性信号。

二是竞品跟进节奏。DeepSeek 在工具调用和代码 Agent 指标上已经逼近 Opus 4.8,Anthropic、OpenAI 等厂商是否会通过降价或推出对标模型来回应,将直接影响多模态 Agent 赛道的价格基准。

三是实际场景效果验证。DeepSWE 和 Toolathlon 是离线基准测试,真实开发环境中的复杂截图理解、长周期 Agent 稳定性表现如何,仍有待开发者社区的实际反馈来验证。

来源:InfoQ CN

celebrityanime
celebrityanime
文章: 19710

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注