一句话看懂:英伟达研究者提出 SoL-Pi 系统,不改模型本身,而是自动优化编码 agent 的控制层(harness),让 token 用量下降约一半,性能基本持平。这意味着 agent 的成本大头可能不在推理,而在“怎么调度、怎么回传、怎么试错”这层控制逻辑上。
事件核心:发生了什么
英伟达研究团队发布论文,介绍了一套名为 SoL-Pi 的系统,用于自动优化编码 agent 的 harness——即模型与运行环境之间的控制层,Codex、Claude Code、OpenClaw 等系统都依赖这一层来决定 agent 如何观察状态、执行动作、处理反馈。
做法是让一个研究型 agent 观察另一个 agent 的执行轨迹,提出 harness 修改方案,并在准备好的环境中测试,只保留“性能不掉、成本下降”的候选。系统在 535 个可执行环境中探索了 152 个方向,覆盖 495 个由 GitHub issue-PR 对衍生的任务和 40 个合成测试用例,累计产生 3000 多次运行、6 万多轮 agent 与环境的交互。
最终得到四个机制:Action Fusion 把两个连续步骤合并为一次调用;Online Context Compact 在每步规划后压缩上下文;ObservationPack 把长工具输出归档、只回填简短摘要;Evidence-Preserving Reducer 用更便宜的模型把大段错误和测试日志浓缩成要点,并加一道校验防止漏掉关键线索。
在 EdgeBench 上,效率版配置比原 Pi harness 少用 49% 的 token,得分达到其 93.7%;偏性能版得分高出 5.3%,同时仍节省 token。按当前 API 价格估算,相比原生 Codex 和 Claude Code 每小时可省 8.75 至 13.50 美元,相比 Pi 省 4.36 至 5.71 美元。该系统用 GPT-5.6 Sol 构建,未作改动直接套用到 Opus 5 上,仍保留了 Pi 约 94.3% 的表现。
为什么重要
过去一年,降本主线集中在模型层:更快的注意力核、量化压缩、换用更便宜的模型。SoL-Pi 指出另一条被低估的路径——harness 里的冗余调用、重复回传完整日志、上下文无限膨胀,本身就是 token 消耗的放大器。
它同时回应了一个已知风险:自动优化的 harness 容易过拟合训练任务,在陌生任务上收益甚微。SoL-Pi 严格把搜索反馈与评估隔离,EdgeBench 的 51 个公开任务中 11 个只做一次性验证、40 个留作最终评估且不回灌搜索。这套“能力与效率双重检查”的做法,若能复现,会成为 agent 工程的一个通用范式。
对用户/开发者/创作者的影响
对使用编码 agent 的开发者来说,短期现实收益是账单:长时间无人值守的 agent 任务,token 成本可接近减半。对做 agent 产品的团队,这篇论文提示优化重点应从“换更便宜的模型”转向“重写控制逻辑”,尤其是工具调用链、上下文管理和日志处理这三处。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
不过 harness 优化通常与具体任务分布强相关。目前公开信息显示,SoL-Pi 的结论建立在 EdgeBench 和 Pi 等特定环境上,能否迁移到企业内部代码库、非英语项目或长周期任务,还需要更多验证。此外减少日志回传可能影响可观测性和调试体验,这是工程上需要权衡的地方。
值得关注的后续
一是英伟达是否把这套方法开源或产品化,让它进入 NIM、NeMo 等工具链;二是 OpenAI、Anthropic 等 harness 提供方会不会把类似机制做进 Codex、Claude Code 的默认行为;三是论文中“搜索与评估隔离”的协议能否被独立复现,以及在其他基准上是否仍有接近一半的节省幅度。


