DeepSeek Harness重磅更新:多模态支持全面上线,意外剧透V4视觉版动向

开源智能体工具 DeepSeek Harness 在上线仅 7 天后迎来重大更新,正式支持原生图像请求和多模态输入,同时调整了组件分发方式,并暗示 DeepSeek 自研视觉模型可能即将到来。

一句话看懂:开源智能体工具 DeepSeek Harness 在上线仅 7 天后迎来重大更新,正式支持原生图像请求和多模态输入,同时调整了组件分发方式,并暗示 DeepSeek 自研视觉模型可能即将到来。

事件核心:发生了什么

8月20日,DeepSeek Harness 发布新版本,距离其首次公开仅一周。本次更新的核心是全面增强多模态支持:DeepSeek 模型适配器现已支持配置并启用原生图像请求,/goal 和 /plan 等指令从纯文本扩展为图文混合输入,@引用范围也从单纯的文件扩展名扩展到历史对话内容。开发者可以在单次请求中附带截图、本地文件及此前对话上下文。

为保证复杂工作流的稳定性,新版为 MCP 和 ACP 协议都增加了持久化图片附件能力,避免单次调用结束后附件丢失;同时修复了图像文件过大、多轮对话中历史图像负载过高的问题。组件分发层面,Claude Code 与 Codex 不再随主产品捆绑分发,改为按需安装的 Profile Bundles。Codex 新增非交互式权限模式和多个命名实例支持,reportDelivery 的回报路径也得到优化,父任务不再盲目等待子任务。

其他优化包括:web_search 支持并发查询、Windows PTY 终端默认启用持久化 PowerShell 会话、SQLite 后端的读写与 fork 性能提升且存储占用下降。官方同时确认“DeepSeek Harness”已注册商标。

为什么重要

这次更新的信号意义大于功能本身。DeepSeek Harness 的模型适配器开始支持原生图像请求,说明底层接口已经为视觉输入做好准备,引发外界对 DeepSeek 自研视觉模型即将发布的猜测。目前公开信息显示,DeepSeek 尚未正式公布相关视觉模型细节,但这一架构调整通常是模型能力上线前的基础设施铺垫。

从生态角度看,将 Claude Code 和 Codex 拆分为按需安装的 Profile Bundles,反映出 DeepSeek 在多智能体工具链上选择更灵活的分发策略——不把第三方适配器与核心产品强绑定,降低维护成本的同时,也给开发者更大的组合自由度。子代理报告机制的改进,则是对智能体协作效率的一次务实补强,减少了多任务编排中的无效等待。

对用户/开发者/创作者的影响

对开发者而言,多模态输入支持直接降低了调试和交互成本:以往需要将截图转为文字描述或单独处理图片,现在可以一次性附加截图与上下文,配合持久化附件机制,复杂工作流的稳定性明显提升。Codex 的非交互式权限模式与多命名实例,也让无人值守的批处理任务和并行子代理部署成为可能。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对创作者和普通用户来说,图片输入能力意味着可以通过截图直接指挥智能体完成任务,不再局限于文字指令;SQLite 后端性能改进则让本地运行时的响应更快,存储占用更小。对于关注开源模型的团队,DeepSeek Harness 的组件解耦也降低了上手门槛——不需要安装全套工具,按需选用即可。

值得关注的后续

接下来值得观察三点:第一,DeepSeek 是否会在短期内正式发布自研视觉模型,以及该模型是否与 Harness 的原生图像请求形成完整闭环;第二,V4 相关模型在图像理解、生成或跨模态推理上的实际表现,能否对标已有多模态模型;第三,Codex 与 Claude Code 以 Profile Bundle 形式分发后,第三方适配器的维护节奏和兼容性是否会加快,开发者社区的扩展速度同样值得留意。

来源:AIbase

celebrityanime
celebrityanime
文章: 19305

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注