Anthropic 似乎正在 Claude Code 中 A/B 测试降低的 effort 级别

Anthropic 被曝在 Claude Code 中通过服务端进行 A/B 测试,悄悄下调了模型对“high”努力档位的实际响应力度,数值相当于过去的“low”。这一行为未被写入更新日志,引发开发者对其透明度的质疑。

一句话看懂:Anthropic 被曝在 Claude Code 中通过服务端进行 A/B 测试,悄悄下调了模型对“high”努力档位的实际响应力度,数值相当于过去的“low”。这一行为未被写入更新日志,引发开发者对其透明度的质疑。

事件核心:发生了什么

根据 Hacker News 上开发者 @argofowl 的追踪帖,Anthropic 正在 Claude Code 2.1.236 及以上版本中,招募部分会话(约 5 个)加入一项实验。该实验将模型的“effort”评分尺度压缩——具体表现为,在 2.1.237 版本后,模型将“high”档位解读为 100 分中的 10 分,而这个数值正是过去“low”档位的标准。受影响的是 Fable 模型会话,而旧版本及 Opus 5 未被纳入改动。开发者明确表示这是服务端行为,并非客户端故障。由于是 A/B 测试,并非所有用户都会遇到。该开发者坦言,自己花了整个下午排查代码与自研应用,最终才发现是模型行为被悄悄改变。

为什么重要

这件事的核心不在于“effort 数值下调”本身,而在于 AI 厂商对模型行为的暗改能力与透明度红线。Anthropic 作为闭源大模型头部厂商,拥有对 API 和编程助手工具的完全控制权。通过服务端实验调整用户感知到的“智力投入”,相当于在不通知的情况下改变产品交付标准,直接影响开发者对模型能力的判断与依赖。此举在 AI 工程化落地的关键阶段,动摇了“确定性”这一基础信任——当用户无法确认版本行为与文档一致时,基于该模型构建的自动化流程、测试预期和成本评估都会失真。

对用户/开发者/创作者的影响

对于使用 Claude Code 的开发者,最直接的影响是任务完成质量的波动——同样的提示词,在测试组中可能获得更浅层的推理输出,而用户毫不知情。这会导致调试周期的无意义延长,甚至让开发者误判自身代码或集成存在问题。对于依赖 Claude API 做二次开发的技术团队,这种暗调意味着无法通过版本号回溯行为差异,增加了回归测试的难度。创作类用户如果使用 Claude 进行长文写作或代码重构,也可能感知到输出“变笨”,但找不到可验证的变因。此事再次提醒行业:闭源模型的可用性建立在厂商的自我约束上,任何未经披露的调整都是潜在的技术债。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,Anthropic 是否会正式回应此事,并说明该实验的目的——是为了降低推理成本,还是测试用户对质量下降的容忍度。第二,这一 A/B 测试是否会扩展到 Opus 5 或更广泛的 API 服务,若成为默认策略,将直接冲击其企业级客户的服务协议与 SLA 承诺。第三,开发者社区是否会出现工具链来检测模型“努力档位”的真实响应,从而形成对闭源模型的第三方审计压力。如果类似操作被证实常态化,可能加速部分用户向可本地部署的开源模型迁移。

来源:Hacker News (黑客新闻)

celebrityanime
celebrityanime
文章: 19723

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注