一句话看懂:DeepSeek 在 Hugging Face 上开源了首个多模态模型 DeepSeek-V4-Flash-Vision-Exp,它不面向人类看图问答,而是让 AI Agent 直接读取屏幕截图、软件界面和图表,从而执行工具调用任务。
事件核心:发生了什么
9 月 1 日,DeepSeek 在 Hugging Face 发布了 V4 系列首个实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,采用 MIT License 开源。该模型总参数规模 305B,基于 V4-Flash-0731 基础模型,通过引入视觉编码器(Visual Encoder)和 Aligner 模块,经连续训练获得图像理解能力。开源内容包括模型权重、Tokenizer、Prompt 编码参考实现,以及一个极简的 PyTorch 推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE 和 Hyper-Connections 等核心模块。社区响应迅速,目前 Hugging Face 页面上已出现 7 个针对 llama.cpp、LM Studio 和 Ollama 的量化版本。
值得注意的时间线是:8 月 21 日该模型先通过 DeepSeek API 上线,当时仅提供接口调用而不开放权重,开发者可同时输入文本和图像,图像按 token 计费。十天之后权重正式开放,才支持本地部署与二次开发。这种“先卖 API、再开源”的节奏,也反映出 DeepSeek 以 API 服务为核心的商业定位。
为什么重要
这次开源的意义不在于多模态问答,而在于它为 Agent 提供了“眼睛”。与主流多模态模型强调视觉问答不同,DeepSeek 官方明确将能力重心放在多模态 Agent 上——让 Agent 直接读取网页截图、软件界面和图表中的视觉信息,再通过调用工具完成任务。从基准测试看,纯文本 Agent 能力在加入视觉后并未明显受损:Terminal Bench 2.1 从 82.7 提升至 83.9,DeepSWE 从 54.4 提升至 59.3,甚至超过 Claude Opus 4.8 的 58.0。多模态 Agent 能力提升更明显:ApexBench Pass@1 达到 36.5,Agents’ Last Exam 为 27.3(超过 Opus 4.8 的 25.7),ZeroBench Pass@5 为 35.0,也略高于对手的 34.0。
但 DeepSeek 并未宣称“全面领先”:在 NL2Repo 项目上得分 57.7,明显落后于 Opus 4.8 的 69.7。官方措辞相对克制,仅表示“多模态 Agent 能力接近 Claude Opus 4.8”。结合近期更新,DeepSeek 正在搭建一个完整的 Agent 技术栈:模型负责推理与工具调用,Harness 管理连续任务执行,Vision 则让 Agent 直接读取屏幕视觉信息。这次开源正是补齐这一拼图的关键一步。
对用户/开发者/创作者的影响
对于开发者而言,MIT 许可证意味着可以自由商用、修改和再分发,配合量化版本的快速跟进,本地部署门槛已经大幅降低。如果你在构建自动化工作流或 Agent 应用,这个模型可以直接读取软件界面和网页截图,减少了传统 OCR 或结构化解析的中间环节。对于创作者和普通用户,影响相对间接——目前公开信息显示,该模型的视觉理解面向的是“机器干活”而非“人看图片”,因此短期内更适合做工具型产品,而非图像描述或内容生成类应用。如果通过 API 使用,需要注意图像输入按 token 计费,成本结构与传统纯文本调用不同。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,DeepSeek 是否会继续推进多模态 Agent 的迭代版本,并在后续版本中补齐 NL2Repo 等短板。第二,开源后开发者生态的实际采用情况,尤其是量化版本在本地推理设备上的性能表现,能否支撑真实场景中的 Agent 任务。第三,闭源竞品(如 Anthropic 的 Claude Opus 系列)是否会因此调整定价或功能策略,因为 DeepSeek 在部分 Agent 基准上已经追平甚至小幅超越,而开源+低价 API 的组合可能会改变企业采购的选型逻辑。
来源:AIbase


