Anthropic 工程师解释为何模型更聪明了 Claude 的写作却变差了

Anthropic 负责 Claude 微调的工程师 Jackson Kernion 公开解释,模型在数学、代码和推理上变强的同时,写作能力却停滞甚至退步,部分原因是训练过程让模型学会了"写给 AI 看",而非写给人看。

Anthropic 负责 Claude 微调的工程师 Jackson Kernion 公开解释,模型在数学、代码和推理上变强的同时,写作能力却停滞甚至退步,部分原因是训练过程让模型学会了"写给 AI 看",而非写给人看。

Anthropic 前线部署工程师总结了 AI 驱动代码现代化项目启动前的六步准备方法,重点不是让 AI 写代码,而是先把目标、验收标准和上线规则定义清楚。这为受监管企业用 Claude Code 改造关键系统提供了一套可复用的组织流程。

同一天里,Anthropic 的 Opus 5.5 宣布降价,OpenAI 又发布了 GPT-6 Sol 和 GPT-6 Luna,两款新模型的 token 价格下调 50%。Aaron Levie 认为,单位任务成本的下降速度在技术史上没有先例,而这会直接打开更多 AI 智能体(agent)的应用场景。

Claude Code 作者 Boris Cherny 用 Opus 5.5 配合 Lean 形式化验证 Claude Agent SDK,几段简短提示词就换来 16 个修复 bug 与竞态条件的 PR,他还常把 Lean 与 TLA+ 组合使用。这提供了一个新信号:形式化验证正从学术工具变成日常找 bug…

AI 资讯作者 Dan Shipper 单日新增近 1 万粉丝,他借机向新读者推荐了两篇内容:一篇是 Opus 5.5 与 GPT-6 Sol 的实测对比,另一篇讨论自动化之后人类专家为何反而有更多好活可干。这两条线索恰好对应了当下 AI 圈最关心的问题——模型能力到底谁更强,以及自动化会不会真的替代人。

Anthropic 相关人士在 X 上提到,用户可以在 Slack 里试用 Opus 5.5 和 Claude Tag,同时有开发者用 Opus 5.5 配合 Lean 形式化验证 Claude Agent SDK,短提示词就产出 16 个修复 bug 和竞态条件的 PR。

AI 创作者 Peter Yang 发布了对 Claude Opus 5.5 的实测视频,认为这是近期最让他兴奋的 Claude 模型,并直言 Anthropic 的 Claude 系列“终于回来了”。讨论集中在 3D 场景构建、computer use、UX 设计和视频剪辑等实际用例上。

产品人 Peter Yang 在 X 上发布实测视频,称 Claude 的 Opus 5.5 完全用代码生成了金门大桥 3D 场景,效果可与 Astra 相比,并认为 Claude 在经历一段沉寂后“终于回来了”。

一位开发者所在公司全员订阅 GitHub Copilot,但实际使用中发现 Claude Sonnet 和 Opus 是被调用最多的模型,于是提出疑问:干脆整体切换到 Anthropic Claude 会不会更划算?由于 Copilot 按 credits 计费、Claude 按 token 计费,两者很难直…

Palantir CEO Alex Karp 在 CNBC 采访中质疑前沿 AI 实验室能否走向公开市场,称 OpenAI 可能永远不会 IPO,因为其承担的潜在责任大到公开市场无法消化,唯一出路可能是政府国有化。