一句话看懂:AI 编程正从“辅助写代码”转向“Agent 自主执行”,Token 消耗不再是衡量效率的核心指标;真正的价值判断权仍在资深工程师手中,而依赖重复编码积累经验的新人将面临最大冲击。
事件核心:发生了什么
在 2026 世界人工智能大会期间,InfoQ 邀请了 Sirius contributor 滕昱和前 Google 工程师、月之暗面开发者关系负责人唐飞虎,围绕 AI Coding 的现状展开讨论。两人都观察到同一趋势:Claude Code、Codex、Kimi Code 等编程智能体已能自主调用工具、调试程序、连续工作数小时,开发模式正从“人写代码”转向“人设定目标、Agent 执行”。
一个值得注意的细节是,两位开发者都没有精确统计每天消耗多少 Token。原因在于,AI Coding 的使用形态已经从“一问一答”变成“一次授权、长期执行”,任务是否完成、最终产生什么价值,正取代 Token 数量成为新的衡量标准。滕昱明确表示,自己的采购策略是“直接买最贵的模型和最高档套餐”,因为相比节省调用费,模型能否直接解决问题更重要。
为什么重要
这一变化的实质,是 AI 编程的成本核算和竞争逻辑正在被重写。过去企业把 Token 当作类似云资源的使用指标,但当一个复杂任务背后包含数十次工具调用、代码修改和环境交互时,Token 已无法准确代表生产效率。这直接影响企业采购决策:按量计费的模式可能逐步让位于按任务结果定价。
与此同时,模型与 Harness(执行框架)的组合竞争正在取代单一模型比拼。唐飞虎用航空系统作比喻:模型是发动机,Harness 是机身骨架,两者共同决定任务能否完成。Agents’ Last Exam 等新 Benchmark 已开始评测“模型+Harness”组合,而非单独比较模型参数。这意味着,模型排名领先不再等于实际体验领先,垂直场景的定制 Harness 可能成为应用公司的突破口。
两人最大的共识在于:AI 正在优先放大资深工程师的经验和判断力,而非让所有工程师失去价值。真正受冲击的是依靠重复编码积累经验的新人,以及层级复杂、流程沉重的大型软件组织。
对用户/开发者/创作者的影响
对企业技术负责人而言,引入 AI Coding 不应再盯着 Token 账单,而应建立“任务完成度”和“产线事故率”等结果导向的评估体系。滕昱将引入 Agent 比作招聘新员工,需要围绕企业内部任务标准建立流程约束,不能放任模型自主行动而不设护栏。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对个人开发者来说,滕昱的提示值得参考:不用过早投入大量精力打磨“完美 Harness”,因为模型进化速度太快,三个月前精心设计的工作流可能很快被新模型内化。更重要的能力是判断项目方向、确认需求合理性、在模型反复碰壁时叫停错误路线——这些恰恰是模型目前无法承担的。
对新入行的工程师,挑战更为直接。唐飞虎提到,最新模型已能让“编程零基础”用户通过一句话生成可玩的 3D 游戏(他本人用 Kimi K3 实现了此前 48 小时未能完成的任务),这压缩了“写代码练手”的成长路径。但两人都强调,能生成代码不等于能成为专业工程师,理解目标、设计协作机制、判断交付质量,仍是人类不可替代的部分。
值得关注的后续
目前公开信息显示,行业仍处于快速变化期,以下几方面值得跟进:一是模型与 Harness 的组合评测是否会成为行业标准,推动企业采购从“选模型”转向“选系统”;二是垂直场景 Harness 能否通过集成 MCP、Skills 和业务工具,在特定任务成功率上拉开与通用产品的差距;三是大模型公司的人才培养模式和高校课程体系是否会因 AI Coding 的普及而出现实质性调整,尤其是软件工程专业的教学方式。
来源:InfoQ CN


