Read, Don’t Write: 重塑大模型评价体系,构建全自动、可进化的“探测式”评测管线|QCon上海

阿里巴巴高级技术专家孙鹏将在 QCon 上海站分享一种"探测式评测"新方案 BoRP,不再让大模型"写"评语,而是直接读取其隐状态中的满意度信号,评测成本降低约 97%,人类对齐度反超传统生成式 Judge。

阿里巴巴高级技术专家孙鹏将在 QCon 上海站分享一种"探测式评测"新方案 BoRP,不再让大模型"写"评语,而是直接读取其隐状态中的满意度信号,评测成本降低约 97%,人类对齐度反超传统生成式 Judge。

Figma 工程团队公开了其安全 AI 代理的构建细节:代理可自动调查告警、检索历史事件、检查系统并发起修复用 PR,使复杂告警处理时间缩短约 70%。这说明安全运营正在成为大模型落地最具体的场景之一,但人工审核仍是不可省略的一环。

Anthropic CEO Dario Amodei 发文主张 AI 行业应该“放慢前沿”,并给出三步方案,Anthropic 自己先单方面承诺第一步;Box CEO Aaron Levie 则评论说,协调式自我监管几乎不可避免,但谁来定规则、各国是否参与,才是真正的难题。

Vercel 首席执行官 Guillermo Rauch 公开反驳以“OpenAI 攻击 HuggingFace”为由强化 AI 安全管制的论调,认为这类担忧虽合理,但把美国这一全球 AI 领导者推向自我设限的官僚体系,反而会削弱其竞争力。

Guillermo Rauch 披露 fx.sh 已支持用不同模型和不同推理强度编排子代理,例如让 Fable 负责规划、Grok 负责执行。这意味着多模型分工不再依赖服务端复杂路由,而是由模型自己承担调度。

Madhu Guru 在 X 上评论 Dario Amodei 关于"AI 行业应当放缓前沿模型推进"的新文章,认为围绕这篇文章的许多反应缺乏善意,并指出在解决 AI 对齐之前,人类自身先在机会、风险、衡量方式和协调机制上达成对齐更重要。

The Game Awards 放出消息称《星际争霸》将在 2030 年以开放世界射击游戏形式回归,引发玩家和开发者不满。争议不只是“等太久”,更在于类型被换掉,以及 AI 生成内容能否加快这类大作的开发。

产品人 Peter Yang 在 X 上吐槽,2030 年才回归的《星际争霸》新作可能比 ASI(超级人工智能)来得还晚,于是建议暴雪干脆用 AI 生成一半美术资源、人工把关,好让高质量游戏早点面世。

风险投资人 Matt Turck 在 X 上用一句讽刺,把 Anthropic CEO Dario Amodei 的“拯救人类”叙事和围绕它的 AI 内容产业一起推上了台面:如果 AI 真的被证明是安全的,最先失去生意的可能不是模型公司,而是靠“震撼体”推文和AI播客吃饭的人。

Cognition 发布编程模型 SWE-2,它基于 Kimi K3 做后训练,在 FrontierCode 基准上追平 Fable 5.1,但推理成本低约 64%。这说明在编程这一高价值场景里,靠后训练把开源基座调成“专用高手”,已经能对闭源顶尖模型形成价格压力。