一句话看懂:DeepSeek 发布了名为 deepseek-v4-flash-vision-exp 的实验性视觉模型,它能直接读取图片中的文字、图表和画面内容,并通过标准 OpenAI 兼容接口调用。这是 DeepSeek 在文本能力之外,向多模态方向迈出的实质性一步。
事件核心:发生了什么
DeepSeek 官方 API 文档更新了视觉能力支持页面,正式公开了 deepseek-v4-flash-vision-exp 模型。该模型接受图文混合输入,可用于图片描述、截图文字提取(OCR)、图表分析等场景。它支持的图片格式包括 JPEG、PNG、GIF 和 WebP,且格式识别基于文件内容而非文件扩展名或 MIME 声明。
开发者可以通过三种方式向模型传图:一是将图片以 base64 编码直接内嵌在请求中;二是提供公网可访问的图片 URL,由模型服务端自行下载(URL 最长 8192 字符,图片最大 32 MiB,下载需在 60 秒内完成);三是先通过 Files API 上传图片,再用返回的 file_id 引用,这种方式可支持最大 64 MiB 的图片,且不受单图 32 MiB 限制。
接口设计上,该模型完全兼容 OpenAI 的 Chat Completions 格式,base_url 为 https://api.deepseek.com。同时,图片输入也支持 detail 参数,开发者可选择 low(缩放至 512×512 以加快推理、降低成本)、original 或 auto 来控制处理精度。所有图片在推理前都会按比例自动缩放,总像素量大致接近 800×80 的量级,图片本身也会转换为 token 参与计费。
为什么重要
DeepSeek 此前以文本模型和开源权重在行业内建立口碑,此次推出的视觉实验模型意味着其技术路线从纯文本向多模态扩展。对开发者而言,deepseek-v4-flash-vision-exp 采用 OpenAI 兼容格式,意味着大量现有工具链和代码可以几乎零成本迁移适配,降低了接入门槛。
从竞争格局看,视觉理解能力已是头部大模型厂商的标配,DeepSeek 的跟进补齐了其 API 生态的关键短板。同时,图片 token 化计费与自动缩放机制,也表明 DeepSeek 在推理成本和算力效率上延续了此前的务实路线,试图在功能完整性与使用成本之间取得平衡。这一动作或将加剧多模态 API 市场的价格与服务竞争。
对用户/开发者/创作者的影响
对开发者来说,最直接的利好是可以通过统一的 OpenAI SDK 调用视觉能力,无需学习新接口。若应用场景涉及大量图片、需要长期复用素材,使用 Files API 上传后可避免重复传输,同时突破 48 MiB 的请求体限制,适合构建批量图片处理服务。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对创作者和内容团队而言,该模型可应用到截图信息提取、图表数据解读、图片分类打标等自动化流程中。由于 low 档位会降低分辨率以节省成本,适合对细节要求不高的粗筛场景;而需要精确识别图中文字或细微信号时,则应选择原始分辨率。
需要留意的是,图片解析产生的 token 会与文本 token 合并计费,因此高频或大批量使用视觉能力时,成本测算逻辑与纯文本请求有所不同。
值得关注的后续
首先,该模型的名称带有 exp 后缀,属于实验性版本,后续是否正式转正、价格如何单独定价,值得关注。其次,DeepSeek 是否会在开源社区同步放出对应权重的视觉模型,将影响开源生态的竞争态势。最后,目前公开信息显示该模型仅通过 API 提供,尚未看到官方 UI 产品集成;若后续在官方 App 或网页端开放视觉对话,普通用户的体感将会更直接。
来源:Hacker News


