一句话看懂:Anthropic 正在 Claude Code 中悄悄 A/B 测试一种新的“思考强度(effort)”映射逻辑,导致部分用户在高档位时看到的数值从 100 变为 10。Anthropic 官方回应称这只是服务端配置调整,模型性能不受影响,但开发者社区正借此事件重新审视“新模型变笨”的普遍感受。
事件核心:发生了什么
根据 Hacker News 上的讨论,Anthropic 正在其编程助手 Claude Code 中测试不同的 API 服务配置,其中一项调整涉及“effort”(推理努力程度)数值的内部映射方式。有用户报告称,当选择“high”(高)档位时,Claude 在对话中显示的数字从原本的 100 变为 10。Anthropic 员工在 HN 上回应表示,该数值并非 0-100 的线性刻度,且当前正在进行的测试只是将数值映射方式改变,但用户选择的档位对应的实际计算量并未缩水。官方声称已通过深度评估确认该改动不会影响最终输出质量,并承诺若有明显回退可提交反馈。
真正引发争论的是帖子里大量开发者的一致抱怨:许多人感觉新推出的 Opus 4.8 和 Opus 5 在实际编程任务中的表现,反而不如较早的 Opus 4.6。有用户详细描述了使用 Opus 5 完成“读取并更新配置文件”这一简单任务时,模型耗时 43 分钟,并自行拉取容器、运行沙箱、构建测试套件——远远超出任务所需范围。更有用户指出,旧模型 4.8 在近几天内突然出现行为退化,开始无视设计规范、胡乱引入字体和排版,甚至在同一页面中使用多种不一的样式。
为什么重要
这起事件将两个关键矛盾推到了台前。首先是“基准测试与实际体验背离”的商业风险:Anthropic 在官方基准上不断刷新成绩,但相当一部分核心付费开发者却认为真实场景中的代码能力在退步。若这种感受具有普遍性,将直接动摇其高端闭源模型的定价逻辑。
其次,关于“effort”等级的 A/B 测试暴露了推理成本的博弈。业内普遍认为,模型提供商为了控制单次请求的算力开销,可能在实际部署中动态降低推理深度。Anthropic 此次的回应虽然澄清了数值显示问题,但也默认了“服务端可动态调节 config”这一事实。结合用户对旧模型在发布新版本后性能莫名下降的观察,关于“版本暗改”的讨论在社区中愈发强烈——即便官方否认,开发者的信任正在被逐步消耗。
对用户/开发者/创作者的影响
对于重度依赖 Claude Code 进行日常编码的开发者而言,本次事件带来的最实际提醒是:同一模型版本在不同时间、不同配置下体验可能截然不同。如果你正在使用 Claude 系列模型执行关键自动化任务,建议明确记录任务类型、耗时与输出风格,以便在观感突变时及时通过 /feedback 提交会话 ID——Anthropic 承诺对此类反馈给予 credits。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
创作者与轻量用户则无需过分担忧档次数值变化,因为官方声明中选择的 effort 档位并未被降级。真正需要留意的是输出风格是否出现“冗长化”倾向——多位用户反映 Opus 5 倾向于生成大量无关的长段落或过度工程化代码。若你发现生成的文案或代码明显超出合理范围,且并非出自你的指示,这大概率是模型行为偏移,建议降低档位或切换至 4.6 进行对比。
技术管理者在做采购决策时,应避免仅凭 benchmark 分数选型,而应围绕自身的代码库建立小规模的回归测试集,持续跟踪不同版本模型的实际表现。
值得关注的后续
第一,Anthropic 是否会对“effort”映射调整发布正式的公开说明或文档,并公布一套清晰、可解释的强度刻度。第二,Claude Opus 4.8/5 在 HN 上出现的“行为突然退化”报告是否会在其他平台继续发酵,以及 Anthropic 是否会针对开发者反馈推出快速修复版本。第三,若更多用户转向 Kimi K3、GLM 5.3 等替代模型,闭源高端编程助手的价格体系是否会因此出现松动。目前公开信息显示,Anthropic 尚未针对除 Claude Code 外的 API 服务宣布同类调整。
来源:hackernews


