一句话看懂:阿里巴巴高级技术专家孙鹏将在 QCon 上海站分享一种”探测式评测”新方案 BoRP,不再让大模型”写”评语,而是直接读取其隐状态中的满意度信号,评测成本降低约 97%,人类对齐度反超传统生成式 Judge。
事件核心:发生了什么
QCon 全球软件开发大会·2026 上海站已启动,定档 10 月 22 日—24 日,主题聚焦 Harness AI 时代的工程实践。阿里巴巴高级技术专家孙鹏确认出席”AI Agent 可观测与持续改进工程”专题,带来《Read, Don’t Write: 重塑大模型评价体系,构建全自动、可进化的”探测式”评测管线》。他提出的 BoRP(Bootstrapped Regression Probing)方案,用对比表示提取与 PLS 回归替代生成式 LLM-as-a-Judge,在 8B 模型上实现对齐 GPT-4 级的评测精度,成本约为后者的 3%;仅需数百条标注即可达到 Krippendorff’s alpha 0.80 的信度对齐,并已在万亿级流量 A/B 测试中落地。
为什么重要
当前主流做法让大模型给回复”打分”,代价是成本税、延迟税和偏置税——回复更长、位置不同都可能拿高分,企业只能抽样评测,捕捉不到微小的满意度波动。BoRP 把评测从”生成”转为”读取”,从底层逻辑上绕开字数偏置和格式敏感,同时用层间隐状态的”认知冲突”量化评测可信度。如果这条路走通,评测不再是大模型迭代的算力瓶颈,而是可以全量、实时运行的”体温计”。
对用户/开发者/创作者的影响
对开发者,这意味着 A/B 实验的灵敏度和方差削减有了新杠杆,评测管线不必再依赖昂贵的专用 Judge 模型,骨干模型更换时还有望”免重训”迁移。对企业,全量监控的成本门槛被大幅拉低,badcase 的入池、分派、修复、验证可以更自动化。对普通用户,产品迭代响应会更快,但需注意:素材显示复杂推理场景仍需生成式评测补充,部分环节仍需人工决策。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 BoRP 是否有开源或产品化落地,能否在千问之外复用;二是评测”读脑”路线是否被其他厂商跟进,形成与生成式 Judge 的路线分化;三是单卡 A100 日处理百万级会话的工程细节能否复现,以及在更复杂 Agent 任务上的适用边界。
来源:InfoQ CN


