DeepSeek-V4-Flash-Vision-Exp 模型已开源,多模态 Agent 能力接近 Opus-4.8

DeepSeek 于 8 月 31 日开源了 V4 系列首个多模态模型 V4-Flash-Vision-Exp,支持图片输入并保持 MIT 许可。官方称其多模态 Agent 能力已接近 Opus-4.8,这意味着开源阵营在视觉 Agent 赛道上又前进了一步。

一句话看懂:DeepSeek 于 8 月 31 日开源了 V4 系列首个多模态模型 V4-Flash-Vision-Exp,支持图片输入并保持 MIT 许可。官方称其多模态 Agent 能力已接近 Opus-4.8,这意味着开源阵营在视觉 Agent 赛道上又前进了一步。

事件核心:发生了什么

8 月 31 日,DeepSeek-V4-Flash-Vision-Exp 在 Hugging Face 正式上线,采用 MIT License 开源。这是 DeepSeek V4 系列首款原生支持图片输入的视觉模型,官方明确标注为“Exp”实验版本,早在 2026 年 8 月 21 日就已上线 DeepSeek API 平台。

公开内容不仅包含模型文件,还一并提供了 Tokenizer、Prompt Encoding 参考实现,以及最小化 PyTorch 推理实现。这些代码覆盖了视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections 与 DSpark 等核心模块,开发者可以直接基于这些内容进行本地部署或二次开发。

功能方面,该模型支持文本加图片的混合输入,能够完成图片描述、截图文字识别、图表分析等任务,兼容 JPEG、PNG、GIF、WebP 四种常见图片格式。

为什么重要

这次开源的意义不止于“又多了一个视觉模型”。从技术路线看,DeepSeek 将 MoE 架构与视觉编码器整合进同一模型体系,并开源了包括 DFlash Attention 在内的推理实现,意味着中小团队不必从零训练即可复现其推理链路,降低了多模态模型的工程门槛。

从竞争格局看,官方数据显示,V4-Flash-Vision-Exp 在 Agent、推理、世界知识等纯文本任务上与 V4-Flash 正式版持平,而在需要视觉理解的 Agent 基准测试中大幅提升,多模态 Agent 能力已接近 Opus-4.8。这直接指向一个信号:开源模型在多模态 Agent 场景下,正逐步缩小与头部闭源模型的差距。

同时,MIT License 的开源方式延续了 DeepSeek 一贯的开放策略,开发者可以自由商用、修改和分发,这有助于快速形成基于该模型的工具链和生态。

对用户/开发者/创作者的影响

对开发者而言,最直接的价值在于:Hugging Face 上提供了最小化 PyTorch 推理实现,开发者可以绕过繁杂的依赖配置,直接跑通视觉推理流程。如果想在自有 Agent 框架中接入多模态能力,V4-Flash-Vision-Exp 提供了一个可商用的开源选项。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对普通用户来说,目前该模型已上线 DeepSeek API 平台,通过 API 调用即可体验图片理解能力,无需自行部署算力。对于需要处理截图、表格、图表等场景的工具类应用,这是一个更低成本的选择。

对创作者和内容团队,模型的图片描述与文字识别能力可以用于自动化整理视觉素材、提取截图中的关键信息,减少人工标注成本。

值得关注的后续

目前公开信息显示,该模型仍标注为“Exp”实验版本,后续是否会有正式版或更大参数规模的视觉模型发布,值得关注。其次,官方提到多模态 Agent 能力接近 Opus-4.8,这一结论的具体评测基准和分数尚未完整披露,建议开发者自行在目标场景中验证效果。最后,随着视觉模型开源,是否有第三方工具链(如 RAG、自动化测试、UI 理解)快速跟进适配,将决定其生态能走多远。

来源:IT之家(RSS)

celebrityanime
celebrityanime
文章: 21424

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注