DeepSeek Harness 上线:一切皆为插件,一切皆是可能

DeepSeek 于 2026 年 8 月 13 日发布并开源了开发者预览版 Agent 框架 DeepSeek Harness(缩写 dsh),将模型、工具、UI 等全部能力拆解为可自由替换的插件。它试图用“一切皆为插件”的架构,重新定义 Agent 开发工具的灵活性和开放程度。

DeepSeek 于 2026 年 8 月 13 日发布并开源了开发者预览版 Agent 框架 DeepSeek Harness(缩写 dsh),将模型、工具、UI 等全部能力拆解为可自由替换的插件。它试图用“一切皆为插件”的架构,重新定义 Agent 开发工具的灵活性和开放程度。

Cursor 发布 builds 功能,为云智能体(Cloud Agents)预先生成可用的开发环境副本,让代理启动不再等待克隆代码库、安装依赖等漫长步骤,官方称首次响应速度最高提升 3 倍。这项能力把“环境准备”从代理的启动流程中剥离,是云 AI 编程基础设施走向成熟的信号。
![[Bug][Regression] #50879 causes wrongful `hipMalloc` to be loaded on ROCm due to `tilelang` load, causing tests and allocation failures](https://www.chat-gpts.plus/wp-content/uploads/2026/08/51151-84c5b5a5-768x403.jpg)
该报错发生在 vLLM 于 ROCm 环境下运行时,由于 PR #50879 引入的回归导致 `tilelang` 被加载,进而在 ROCm 平台上错误地加载了 `hipMalloc`,引发测试失败和显存分配失败。优先排查是否可在该环境下禁用或绕过 `tilelang` 的加载路径。

该报错通常发生在 AMD ROCm 平台(gfx950/MI355)运行 Quark MXFP4 量化模型时,vLLM 将 `w_mxfp4_a_mxfp4` 量化路径调度到 AITER 原生 MXFP4 内核后输出损坏。优先排查 vLLM 中 `QuarkOCP_MX` 和 `QuarkOCP_M

该报错发生在 vLLM 使用 MTP(Multi-Token Prediction)投机解码加载 Gemma 4 31B 模型的 draft 参数时,因为模型存在异构注意力层(不同层 head_dim 不同),参数加载时按全局 head_dim 切片越界。优先排查 vLLM 版本是否低于 0.27.

Google在3.6 Flash发布仅三周后,就推出了Gemini 3.7 Flash,用更低的API价格和有限的编码能力提升稳住开发者,但外界期待的旗舰模型Gemini 3.5 Pro仍无明确时间表。

Paramount Skydance 给技术员工的 Anthropic Claude 账户设置了月度 token 支出上限,超出额度需填表申请。这是企业从“鼓励 AI 使用”转向“控制 AI 成本”的具象信号,值得关注。

据《华尔街日报》报道,苹果正与多家新闻出版商洽谈,计划以“按使用量付费”的方式,让即将升级的 Siri AI 助手接入实时新闻内容,以提升其回答时效性问题的能力。此举意味着苹果在为生成式 AI 的实时信息获取能力付费铺路。

有开发者用同一套网页设计需求横向测试 Gemini 3.7 Flash、Opus 5 与 Grok 4.6,结论是 Gemini 3.7 Flash 在图像生成上表现突出,但在 HTML 还原和整体任务完成度上仍未超过 Opus 5,而且比 Grok 4.6 的优势也没有想象中明显。

Hacker News 上一篇题为《家里的AI 第1部分:一盒零碎》的帖子引发讨论,作者记录了自己从一堆散装硬件开始搭建家用 AI 设备的真实过程,反映 AI 正在从云端 API 走向个人化、本地化部署的社区趋势。