Deepseek 发布实验性 Flash 视觉模型,在 agent 基准测试中媲美 Opus 4.8

Deepseek 发布了实验性多模态模型 V4-Flash-Vision-Exp,在视觉 Agent 基准测试中接近 Anthropic 的 Opus 4.8,且沿用 V4-Flash 定价,意味着低成本视觉 Agent 开发有了新选择。

一句话看懂:Deepseek 发布了实验性多模态模型 V4-Flash-Vision-Exp,在视觉 Agent 基准测试中接近 Anthropic 的 Opus 4.8,且沿用 V4-Flash 定价,意味着低成本视觉 Agent 开发有了新选择。

事件核心:发生了什么

8 月 21 日,Deepseek 推出实验性模型 V4-Flash-Vision-Exp。该模型在 V4-Flash 文本能力基础上加入图像理解,支持 JPEG、PNG、GIF、WebP 格式,并能根据文件实际内容而非文件名识别格式。据 Deepseek 官方数据,在内部多模态 Agent 基准测试中,其得分接近 Opus 4.8,部分项目甚至反超。模型兼容 OpenAI Chat Completions、Responses API 和 Anthropic Messages 端点,并支持通过 Base64、公开 URL(上限 32 MiB)或新增的免费 Files API(上限 64 MiB)三种方式传图。单次请求最多可包含 600 张图片,单张图片处理后通常不超过 384 tokens,计费沿用 V4-Flash 价格体系。

为什么重要

这次发布的看点不在“多模态”本身,而在定位和成本。Deepseek 明确将模型指向视觉 Agent 工作流,即让模型既能“看图”又能调用工具完成任务,例如提取截图文字、分析图表或描述图像。在 Agent 场景中,图像 token 消耗往往是成本大头,V4-Flash-Vision-Exp 将单图 token 上限控制在 384,并保留低价文本模型的价格结构,直接降低了视觉 Agent 的推理成本。考虑到它在 Deepseek 自测中逼近 Opus 4.8,若其他第三方基准验证结果接近,该模型有望成为闭源高价模型之外的务实替代方案,尤其在批量处理图片类任务时更具成本优势。

对用户/开发者/创作者的影响

对开发者而言,最直接的利好是接入门槛不高:模型兼容 OpenAI 与 Anthropic 两套 API 格式,现有应用调整少量代码即可迁移;新增 Files API 支持先上传文件、后通过 ID 多次引用,适合多轮对话中重复分析同一张图片的场景。对创作者和内容团队,模型可从截图、PDF 页面、信息图等视觉材料中提取文字信息,并用于自动化归档或内容重组。需要留意的是,图片会先被压缩至约 800×800 像素再处理,若任务依赖细微视觉细节(如小字号文字或精细图表),需要验证实际效果;单请求超过 15 张图片时,单边像素上限从 8,192 降至 4,096,批量处理高分辨率图片时要提前规划请求结构。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前公开信息显示,该模型仍属“实验性”版本,后续是否转为稳定版并保持低价,是观察重点。建议关注三个方向:一是模型在 LMSYS 或 Artificial Analysis 等第三方基准上的真实表现,以验证 Deepseek 自测数据;二是 Anthropic 或 OpenAI 是否针对这一价位调整视觉模型的定价或功能策略;三是 Deepseek 配套的 Harness 框架(v0.1.1)虽已支持新模型,但其 Agent 生态成熟度仍需实际项目检验。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 19659

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注