DeepSeek-v4-flash-vision-exp

DeepSeek 发布了一款名为 DeepSeek-v4-flash-vision-exp 的实验性视觉模型,其 API 定价将每张图像的 Token 消耗上限锁定在 384,约合每美元处理 2500 张图。这一价格策略显著降低了多模态应用的门槛,但也暴露出高分辨率细节识别的潜在短板。

一句话看懂:DeepSeek 发布了一款名为 DeepSeek-v4-flash-vision-exp 的实验性视觉模型,其 API 定价将每张图像的 Token 消耗上限锁定在 384,约合每美元处理 2500 张图。这一价格策略显著降低了多模态应用的门槛,但也暴露出高分辨率细节识别的潜在短板。

事件核心:发生了什么

根据 Hacker News 上的技术讨论,DeepSeek 的这款新视觉实验模型在推理前会自动对输入图像进行统一缩放处理:小于 384×384 像素的图像会被放大,而大于该尺寸的图像会被等比缩小至约 800×800 像素的总像素量。由此,单张图像的 Token 消耗存在 384 的上限,例如 2000×2000 与 5000×5000 像素的图片在计费上将完全等同。多图请求中每张图独立计算,不设额外叠加规则。按照这一标准,开发者可以近似实现每美元处理 2500 张图像的成本结构,视觉能力的调用成本被压到极低的水平。

为什么重要

这一设计反映出 DeepSeek 在视觉模型商业化上的明确思路:通过牺牲部分细节精度,换取推理阶段的算力可控与价格优势。当前行业头部模型的视觉接口通常按图像分辨率阶梯计价,高分辨率图片往往意味着数倍 Token 开销。DeepSeek 将计费逻辑简单化为“按图计价”,并且设置了硬性上限,这实际上是把多模态应用的边际成本拉到了与纯文本接近的水平。对于依赖批量图像处理的 OCR、票据识别、电商图片理解等场景而言,这种定价模式可能改变开发者的成本测算方式,进而对同类开源或闭源模型形成竞争压力。

对用户/开发者/创作者的影响

对开发者而言,API 的 Token 计费上限降低了试错成本,适合大规模跑批任务;但需要留意的是,由于所有图像都被压缩至 800×800 级别的像素总量,密集小字或者细节丰富的版面(例如整页 A4 文档)可能在识别精度上不够理想。有开发者反馈,类似模型在处理截图时容易因反复读取图像而中断会话。创作者在做图像理解类应用时,需要针对“全局理解”和“局部细节”做好任务拆分,必要时搭配高分辨率裁剪或缩放工具来弥补模型本身的输入限制。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,该视觉模型是否会从“exp”实验状态转为正式 API 接口,并延续当前的定价策略;第二,DeepSeek 是否会针对高分辨率需求推出单独的“精细模式”或分档计费选项——目前公开信息显示,社区普遍希望分辨率上限能提升至约 1080p 级别,以兼顾多数实际应用场景;第三,竞品是否会跟进类似的“单图封顶”计费规则,带动视觉 API 整体降价。此外,对于自托管部署的用户,如何为 DeepSeek Flash 这类轻量模型外挂视觉能力,也是仍在讨论中的技术问题。

来源:hackernews

celebrityanime
celebrityanime
文章: 19687

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注