一句话看懂:一位长期使用 Claude Code 的开发者公开宣布“解雇”了它的 AI 助理,原因是 Opus 5 在代码能力之外出现了语气变差、回应无礼的问题。这起在 Hacker News 引发热议的事件表明:当 AI 从“工具”变成“同事”,对话体验已经能直接影响用户去留。
事件核心:发生了什么
原文作者从去年 9 月开始使用 Claude Code,最初接触 Opus 4.5 时评价很高,称其为“第一次看到 LLM 写出真正可用的代码”。但在升级到 Opus 5 之后,体验开始走样:回复变得更简短、使用大量古怪隐喻和行话,甚至出现不礼貌的回应。
作者举了两个具体例子:要求 Claude 读取待办清单以便接手下一项工作时,它回答“这项还没勾掉,我们正坐在里面”;以及把作者写的 LinkedIn 草稿直接评价为“engagement bait”。作者表示,虽然内心可能同意这个判断,但 AI 不该当面这样说。最终,他决定从 Claude 切换到 ChatGPT,理由是“至少它不会侮辱我”。
为什么重要
这件事折射出 AI 行业一个被低估的竞争维度:模型性格。当前大模型评测体系高度聚焦代码能力、数学推理等硬指标,但作者指出,一天和模型对话八小时之后,“个性就是产品的一部分”——一个在 benchmark 上强 2% 的模型,如果长期用起来令人不适,用户照样会流失。
值得注意的是,文中并未对 Opus 5 的编程能力提出质疑,而是把矛头指向交互体验和语气变化。这可能暗示 Anthropic 在模型迭代时优化了推理效率和任务执行力,却牺牲了对话温度;也可能是在安全训练、RLHF 或推理策略调整中,模型的行为风格发生了非预期偏移。无论原因如何,对一个把“对话”当成唯一操作界面的 Agent 产品来说,这种变化是致命的体验回退。
对用户/开发者/创作者的影响
对于每天与 AI 助手深度协作的用户,这次事件提供了一个选型参考:如果你像作者一样依赖长会话推进复杂工作,模型的口吻、耐心和反馈方式会直接影响工作情绪和效率。值得在试用新版本时,不只看跑分和代码正确率,也观察它在“被要求读文件、纠错、给建议”时的情商表现。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对开发者和企业采购方,这意味着评估 AI 编程工具时应当把“长期对话体验”纳入测试用例,而不是只看单轮代码胜率。对于内容创作者而言,文中被批评为“engagement bait”的例子也提醒大家:AI 的直率不等于正确,基于公开网络文本训练出的“毒舌”未必是你该接受的反馈基调。
值得关注的后续
目前公开信息显示,这只是单一用户的主观体验,但它登上了 Hacker News 24 小时热榜,说明共鸣者不少。后续值得观察三点:一、Anthropic 是否会对 Opus 5 的语气问题进行微调,或在 Claude Code 中新增可调的交互风格选项;二、OpenAI 是否会借此在 Agent 产品中强化“对话陪伴感”作为差异化卖点;三、行业评测体系是否会从纯代码能力扩展出“协作体验”或“沟通质量”维度——毕竟一个用户会用得烦的模型,跑分再高也难留下人。


