一句话看懂:AI 编程 Agent 开发商 Pi 在开发笔记中公开对比了 DeepSeek Harness(DSH)、Claude Code 等竞品,指出长期运行场景下现有 Agent 框架存在“上下文永久丢失”和“模型与工具深度绑定”两大隐患,并公布了自研的恢复式上下文管理方案。
事件核心:发生了什么
Pi(@pidotdev)在其开发笔记中对当前主流 Agent 方案进行了技术层面的直接点评,矛头直指 DSH、Claude Code 和 OpenCode 等产品。Pi 提出一个核心问题:当 Agent 连续运行 50 小时后,它是否还记得自己执行过的所有操作?针对 DeepSeek Harness 的 tool result pruner 机制,Pi 给出了 “permanently-lossy pruner”(永久性有损压缩器)的评价,认为其在长日志截断时会直接丢弃中间部分,导致错误信息无法恢复。
Pi 给出的解决方案是 prune + spill 架构:上下文只保留摘要和文件偏移量,完整工具输出落盘存储,模型可随时通过 grep、sed 等命令回溯读取。测试数据显示,在 GLM-5.3 和 DeepSeek V4 Flash 的 19 个真实会话中,该方法使上下文占用降低 26%~35%,uncached prefill 降低 72%~88%,且信息可完全恢复。Pi 还在 PR 中直接表述其方案“strictly better than dsh’s permanently-lossy pruner”。
为什么重要
这次点评揭示了一个行业正在逼近的技术拐点:Agent 的长期运行能力正在从“模型能力问题”转变为“系统架构问题”。Pi 观察到,新一代 Claude 模型在第三方 Harness 上反而更容易传错工具参数,例如生成 Pi 不存在的 requireUnique、matchCase 等字段,推测是模型后训练阶段已深度适配 Claude Code 的 Harness 规范。这意味着模型能力越强,与特定 Harness 的绑定可能越深,单测模型的传统评估方法或将失去意义。
Pi 将 Agent Run 类比为数据库事务进行重写,引入 intent 预写、操作日志、Lane 并行和崩溃恢复机制,反映出行业共识:Agent 不再是“while 循环 + 模型 + 工具”的简单拼接,而是正在演化为具备持久化、并发控制和日志回放能力的新一代操作系统级基础设施。
对用户/开发者/创作者的影响
对于深度使用 Coding Agent 的开发者,工具选择逻辑将发生变化:评估 Agent 不能只看 Demo 效果或工具数量,更应关注其在长任务下的状态可恢复性和上下文透明度。Pi 的方案意味着未来 Harness 会提供类似“审计日志”的能力,用户可以看到 Agent 在每一步调用了哪些工具、返回了什么结果,且这些信息不会因上下文压缩而永久消失。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对于基于 Claude、DeepSeek 等 API 构建应用的开发者,需留意模型与官方 Harness 之间的隐性绑定——例如 Claude 在第三方工具上出现参数幻觉的问题,可能会直接影响工具链的稳定性。在官方未提供兼容层前,采用第三方 Harness 时建议预留参数校验和错误兜底逻辑。
值得关注的后续
目前公开信息显示,Pi 的重构方案仍主要见于其开发笔记和 PR 中,尚未大规模开放公测。后续值得重点观察的三个方向:一、Pi 的 prune + spill 机制是否会开源或融入主流框架,若开源将迅速改变 Coding Agent 的底层设计标准;二、OpenAI Codex、Claude Code 官方是否会回应这种“模型-Harness 深度耦合”的质疑,并调整工具 schema 的兼容性策略;三、长期运行的 Agent 在真实生产环境中的崩溃恢复表现,能否达到 Pi 笔记中描述的“进程死在工具执行半途也能恢复”的水平。
来源:@MaxForAI


