DeepSeek推出实验性多模态模型,对标Anthropic

DeepSeek 于周五发布实验性多模态模型 V4-Flash-Vision-Exp,在文本能力持平的基础上加入图像理解,官方称其智能体表现已接近 Anthropic 的 Opus-4.8,但价格仅为后者的约六十分之一。

一句话看懂:DeepSeek 于周五发布实验性多模态模型 V4-Flash-Vision-Exp,在文本能力持平的基础上加入图像理解,官方称其智能体表现已接近 Anthropic 的 Opus-4.8,但价格仅为后者的约六十分之一。

事件核心:发生了什么

杭州 AI 公司 DeepSeek 于本周五通过 API 平台发布了实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp。该模型在原有文本模型 V4-Flash 的基础上增加了读取图片和截图的能力,并支持基于视觉内容的后续操作。同期,DeepSeek 还发布了 0.1.1 版本的智能体框架(agent harness)。

在 DeepSeek 自行公布的 11 项基准测试中,新模型有 3 项超过 Anthropic 的 Opus-4.8,分别是 DeepSWE(+1.3 分)、Agents’ Last Exam(+1.6 分)和 ZeroBench(+1.0 分)。在其余 8 项中,有 6 项差距在 3 分以内,但 NL2Repo 落后 12 分(57.7 对 69.7),DSBench-Hard 落后 8.1 分(63.6 对 71.7)。选作对比基准的 Opus-4.8 目前仍被 Anthropic 标记为 Active 状态,官方支持持续到至少 2027 年 5 月,并非停产模型。

为什么重要

这次发布的关键不在于某一项分数的高低,而在于它展示了多模态能力与价格优势的组合策略。DeepSeek 在自家数据中坦承,文本版 V4-Flash 在两款多模态测试中得分较低,是因为它“忽略了测试中包含的多模态元素”——也就是说,部分性能跃升来自给“看不见的模型”做了视觉测试,这一点已由厂商在表格脚注中主动披露。

更值得关注的是商业层面的冲击。本月研究显示,V4-Flash 是已知主流模型中推理成本最低的,每百万词约 0.87 美元,而 Anthropic 同类定价约 50 美元。在这样接近 60 倍的价格差面前,个别基准落后一两分对采购方来说已经不是决定性因素。但 NL2Repo 这种仓库级代码任务的 12 分差距,恰恰是企业客户购买智能体最看重的场景,这一维度仍需观察。

对用户/开发者/创作者的影响

对开发者而言,V4-Flash-Vision-Exp 通过 API 即可调用,门槛不高,适合做带截图理解能力的自动化工具。需要留意的是,DeepSeek 本次所有数据均使用自家评测框架、以 minimal 模式、temperature 1.0、top_p 0.95 的参数得出,属于厂商自测,外部复现结果可能有所浮动。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

创作者如果涉及批量图片处理、界面截图分析或多步骤视觉操作类任务,可以以极低成本测试该模型的上限。企业采购方则应区分两个产品:周五发布的是实验性视觉模型,而官方正式版 V4-Pro 也已确认上线,后者支持 Responses API 和 Codex 集成,才是多数企业实际评估的对象,但该模型并未出现在周五的对比表格中。

值得关注的后续

目前公开信息显示,有三点值得持续观察:第一,新模型是否会从“实验性”转为正式版本,以及正式版的定价是否有变;第二,Anthropic 最新旗舰 Opus 5 尚未出现在任何公开对比中,DeepSeek 新模型与它的差距目前未知;第三,在 AutomationBench 上,三家模型得分都只有 25 分上下,说明智能体在真实自动化任务上仍有明显短板,这比个别模型的领先更值得行业注意。

来源:The Next Web

celebrityanime
celebrityanime
文章: 19687

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注