不下班的经营者:把 LLM-as-Judge 做成会自我校准的评估闭环|QCon上海

阶跃星辰开放平台产品负责人陶炳哲将在 2026 年 QCon 上海站分享「双层评估 + 自动校准」的 LLM-as-Judge 闭环方案,让 Agent Loop 从「跑通一次」变成「连续跑对十次」。

一句话看懂:阶跃星辰开放平台产品负责人陶炳哲将在 2026 年 QCon 上海站分享「双层评估 + 自动校准」的 LLM-as-Judge 闭环方案,让 Agent Loop 从「跑通一次」变成「连续跑对十次」。

事件核心:发生了什么

2026 年 QCon 全球软件开发大会·上海站将于 10 月 22 日—24 日举办,主题聚焦 Harness AI 时代的工程实践。阶跃星辰开放平台产品负责人陶炳哲已确认在「AI Agent 可观测与持续改进工程」专题发表演讲,题目为《不下班的经营者:把 LLM-as-Judge 做成会自我校准的评估闭环》。

他拆解的两条生产 Loop 分别是:每天自动产出会议纪要并自我进化的生产线,以及支撑开放平台「申请→自动开通→通知→日报」的流程。核心机制是双层评估——生产 checker 给出 94 分,每天另跑一个盲评 Meta-Evaluator 只给 85 分,偏差超过 8 分就自动触发 rubric 重校;每周再由 Planner-Generator-Evaluator 三 Agent 做单变量对抗迭代,配合快照晋升与回滚、HUMAN_GATE 人工闸门。演讲还会给出一组真实故障复盘,包括 prompt 层去重被模型无视、写接口「假成功」、快照撑爆磁盘与 inode、评估成本翻倍等。

为什么重要

当前大量 Agent 项目卡在「demo 惊艳、上生产跑偏」:输出看着完整但没达标,反复调用同一工具烧 token 却零推进,结果对但过程越权。陶炳哲的判断是,Loop 的门槛不在模型能力,而在评估与信任架构。业界多数方案停留在单层 LLM-as-Judge,但裁判与执行同源、尺子会随时间松动。他提出的 Meta-Evaluator 盲评机制,把「评估质量」本身变成一个可度量、可自动干预的信号,并用单变量周迭代把系统升级做成可复现、可审计、可回滚的工程流程。这为 Agent 从实验室走向稳定生产提供了一条可参考的路径。

对用户/开发者/创作者的影响

对开发者而言,演讲给出的「八问」设计法——目标与完成态、触发与调度、上下文与 Skill、工具与分工、隔离与安全、记忆与状态、评估与观测、身份与权限——可以逐句把业务需求映射成可执行的 Loop 结构,便于交给 coding agent 实现。对产品与业务同学,这意味着不写代码也有机会交付可运行的自动化流程。对正在做 Agent 落地的团队,三类隐性失控信号(过早宣布完成、装忙死循环、结果对但过程越权)和最小权限、全链路审计等生产门槛,是评估自身系统是否「真能上生产」的直接参照。同时需注意,双层评估几乎让 token 成本翻倍,目前公开信息显示陶炳哲的折中是生产 checker 全量、盲评每日抽样,代价是偏差发现最长有 24 小时滞后。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是这套双层评估方案是否会在阶跃星辰开放平台之外被更多团队复用,形成可参考的工程范式;二是 Planner-Generator-Evaluator 单变量迭代与快照回滚的工程复杂度,是否会成为中小团队落地的实际门槛;三是评估成本、裁判漂移、自然语言约束不可靠等痛点,是否有更成熟的工具链或标准出现。QCon 上海站 20 个专题论坛的现场反馈,也将是观察 Agent 可观测与持续改进方向真实进展的窗口。

来源:InfoQ CN

celebrityanime
celebrityanime
文章: 23372

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注