Codex 子 Agent 分工实战:Sol 当军师、Luna 当搬砖工,单任务成本压到 $0.61

开发者社区近期流行一种 Codex 子 Agent 分工方案:让昂贵的 GPT-5.6(代号 Sol)只做规划和决策,把代码探索、测试等执行类任务交给便宜的 GPT-5.6-luna(代号 Luna)并行处理。实测数据显示,该方案在 DeepSWE 软件工程评测中可将单任务成本压缩至 $0.61,同时解决长对…

一句话看懂:开发者社区近期流行一种 Codex 子 Agent 分工方案:让昂贵的 GPT-5.6(代号 Sol)只做规划和决策,把代码探索、测试等执行类任务交给便宜的 GPT-5.6-luna(代号 Luna)并行处理。实测数据显示,该方案在 DeepSWE 软件工程评测中可将单任务成本压缩至 $0.61,同时解决长对话导致的模型性能衰减问题。

事件核心:发生了什么

据掘金社区开发者分享,在 DeepSWE 软件工程能力评测中,基于 Codex 子 Agent 分工策略配置的 gpt-5.6-luna 模型,以 $0.61 的单任务成本登顶效率榜单,而 Claude Opus 5、GPT-5.6 等更昂贵模型在相同任务上花费数倍成本,得分反而更低。该方案的核心逻辑是将任务拆分为“军师”与“搬砖工”两个角色:主 Agent(gpt-5.6)在主线程负责需求拆解、方案设计与结果整合;子 Agent(gpt-5.6-luna)在独立上下文中并行执行代码探索、测试运行、Bug 修复等高 Token 消耗、低决策难度的任务。

这一分工主要针对两个痛点:一是贵模型执行大量脏活导致额度消耗过快;二是 OpenAI 官方提出的 Context Rot(上下文腐烂)现象——当对话被中间输出和无关细节塞满后,模型有效注意力下降,出现重复犯错和幻觉。子 Agent 的独立上下文机制能在物理层面切断长对话污染,防止主模型降智。

为什么重要

这一方案揭示了大模型应用成本结构的关键转变:成本大头不在“思考”,而在 Token 量。将探索、测试这类高 Token 低判断的任务路由给便宜模型,将贵模型保留在小 Token 高判断的规划环节,本质上是把“按模型能力定价”优化为“按任务复杂度路由”。这种做法不依赖模型降价,而是通过工程手段在同一 API 体系内挖出 10 倍以上的成本杠杆,对依赖大模型 API 的开发者、创业团队和自动化流水线均有直接参考价值。

同时,子 Agent 的多角色划分(代码探索、审查、文档核实)也展示了 LLM 应用从“单线程对话”向“多 Agent 协作”演进的可行性,而这种协作并不需要复杂编排框架,一个 TOML 配置文件即可实现。

对用户/开发者/创作者的影响

对 Codex 用户:最直接的价值是额度利用率提升。实测显示,在 ChatGPT Plus 套餐限制下,该方案能跑出接近 Pro 套餐的效果,配置无需编写代码,仅需在 Settings 中开启 Max 推理强度,并通过提示词让 Codex 自动生成 ~/.codex/agents/luna-worker.toml 配置文件,涉及 name、description、model、model_reasoning_effort 等字段。日常使用可参考速查表:探索/测试/总结类子代理选 gpt-5.6-luna + medium,修复类选 max,审查类用 gpt-5.6-terra + high,主 Agent 最终决策保持 gpt-5.6 + max。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

需要留意的是,子代理并非省钱银弹:它因独立上下文和工具调用会消耗更多总 Token;且适合“读多写少”的任务,多个 Agent 同时改代码容易引发冲突;沙箱权限必须控制,只读型子代理应设置 sandbox_mode = “read-only”。对内容创作者和自动化运营者而言,同样的“强模型规划 + 轻模型执行”路由逻辑可迁移至选题、填表、格式转换等工作流,将长任务拆成短上下文,可有效对抗 Context Rot 带来的质量下滑。

值得关注的后续

一是该方案是否会被 OpenAI 官方吸收为默认能力。目前子代理配置依赖于用户手动创建 TOML 文件,尚不清楚官方是否会提供更完整的 GUI 管理界面或预设模板。二是 GPT-5.6-luna 的定价与访问权限是否会进一步放开。若该模型在推理能力和价格上保持当前优势,可能推动更多团队按“主从模型”模式重构现有流水线。三是该模式在更复杂任务(如跨模块重构、多文件协同修改)中的稳定性尚未充分验证,后续社区是否有更多冲突处理与合并策略的实践经验,值得追踪。

来源:juejin

celebrityanime
celebrityanime
文章: 19772

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注