一句话看懂:X 博主 Peter Yang 公开批评 Anthropic 最新旗舰模型 Opus 5 的写作风格和“人格魅力”出现明显退化,认为此前的 Opus 4.6 才是该系列表现最好的版本。这起讨论折射出大模型厂商在安全对齐与对话体验之间日益明显的张力。
事件核心:发生了什么
8 月 2 日,科技博主 Peter Yang 在 X(原 Twitter)上发布了一条引发广泛讨论的帖子。他直言“Opus 4.6 是人格和写作风格最好的 Opus 模型”,并批评新发布的 Opus 5 存在三个具体问题:回复过于冗长、过度使用“Claude 腔调”(例如频繁出现“here’s the honest truth”这类套话),以及语气过于武断和爱评判。他认为,以前的 Opus“像一位值得信赖的朋友”,而现在这种体验已经消失。
这条帖子目前浏览量超过 7.6 万,获得约 1.1 万点赞和 200 余条转发,评论区出现了大量同类反馈。用户 Captain Helix 称 Opus 5“完全人格化了 Anthropic 这家公司”——自视甚高、道德优越感强,用户能感到它“不喜欢你”。另一位用户 Kun Chen 则梳理了自己的评价序列:Opus 4.6 很好、4.7 糟糕、4.8 又好,而 Opus 5“是最差的”。也有用户提到,Opus 4.5 才是最后一个真正“自由表达”的版本,此后的模型都出现了可感知的能力衰退。目前公开信息显示,Anthropic 官方尚未对这些批评作出回应。
为什么重要
这起讨论表面上是对模型“性格”的口味之争,实际上触及了大模型产品化的核心问题:当模型能力越来越强时,安全对齐和拟人化训练正在改变产品与用户之间的互动方式。对大模型厂商而言,模型的语言风格不再只是“锦上添花”的体验细节,而是直接影响用户留存、品牌辨识度和付费意愿的关键维度。
Claude 系列一直以写作能力和“人味”著称,这也是它与 OpenAI 系模型竞争时的重要差异化优势。如果核心用户群体开始明确感知到模型从“朋友”变成“说教者”,意味着 Anthropic 在安全策略与用户体验之间的平衡可能出现了偏差。类似讨论此前在 ChatGPT 用户群中也出现过,说明这是整个生成式 AI 行业的共性问题,而非个例。
对用户/开发者/创作者的影响
对普通用户而言,模型回复变长、套话增多的直接后果是对话效率下降。用户需要花费更多时间从冗长回复中提取有用信息,原本“像朋友聊天”的体验会被“像应付咨询顾问”的感觉取代。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对开发者和 API 调用方来说,如果 Opus 5 在默认情况下倾向于输出超长回复,会直接带来 token 消耗增加和 API 成本上升,同时增加应用内的流式输出等待时间,影响产品体验。依赖 Claude 生成文案、故事或脚本的内容创作者,则可能面临“风格雷同”和“个人化表达被稀释”的问题——写作风格的一致性对创作者建立个人品牌至关重要。
这也提醒企业采购方需要将“对话风格”纳入模型评测体系。当前基准测试普遍侧重准确率和安全性,很少评估模型的语气、简洁度或交互“人格”,但这些恰恰是终端用户感受最直接的部分。
值得关注的后续
未来值得观察的具体信号有三个方面:其一,Anthropic 是否会像此前讨论 Opus 4.7 的问题那样,在后续迭代中针对风格问题做出微调,例如推出减短回复的更新版本;其二,围绕“模型性格”的第三方便准化评测是否会开始成形——目前已有用户在社区中分享自己的实测评分框架,但尚未形成行业共识;其三,OpenAI 及其竞品是否会利用这一讨论窗口,在宣传和产品设计中更强调模型在“真实对话感”上的投入,从而影响用户对模型选择的认知。


