Databricks 以更低的成本与 Opus 相匹配后,将中国开源模型 GLM 5.2 设为默认编码引擎

在内部真实代码库的基准测试中,Databricks 发现中国开源模型 GLM 5.2 在编程任务上与 Anthropic 的 Opus 4.8 性能持平,但每次任务成本更低。基于此,Databricks 已计划将其作为开发者日常默认编码模型,这标志着开源模型在成本效率上已具备挑战顶尖闭源模型的能力。

在内部真实代码库的基准测试中,Databricks 发现中国开源模型 GLM 5.2 在编程任务上与 Anthropic 的 Opus 4.8 性能持平,但每次任务成本更低。基于此,Databricks 已计划将其作为开发者日常默认编码模型,这标志着开源模型在成本效率上已具备挑战顶尖闭源模型的能力。

Anthropic 为 Claude 聊天机器人推出了名为“reflect”的年度回顾功能,允许用户查看过去一个月到一年内的对话使用分析,该功能被视为 AI 版“Spotify Wrapped”,已向免费用户及 Pro/Max 订阅者开放 Beta 测试。

Anthropic 在 Claude 中引入了一项名为“反思”(Reflect)的新功能,帮助用户追踪和审视自己使用 AI 的习惯、频率与目标对齐情况。这不是一个技术突破,而是 Anthropic 在 AI 产品设计中向“用户行为指导”迈出的重要一步。

知名 AI 观察者 Nikunj Kothari 在 X 上指出,开发者社区正在 Codex(OpenAI)和 Claude Code(Anthropic)两大编程 AI 模型之间剧烈摇摆,每周都会出现“一方压倒另一方”的舆论逆转。这种竞争正让所有开发者受益,而非一方独大。

Anthropic 的研究工程师 Cat Wu 宣布将于太平洋时间 7 月 9 日上午 10 点举办一场线上直播,展示如何从单人使用的 Claude Code 扩展至支持团队协作的 Claude Tag,并深入拆解其底层运作机制。这标志着大模型应用从“单兵作战”的代码助手向“团队协同”的主动式服务演进。

Cursor 官方宣布与 SpaceXAI 合作训练 Grok 4.5,这是其最强模型,也是首个不仅为软件工程设计的大模型。用户已可以在 Cursor 中直接试用,标志着 Grok 系列从编程助手向通用 AI 产品的关键跃迁。

开发者 Peter Steinberger 在 X 上展示了一个名为 “nameplate” 的代理(Agent)交互示例,当代理需要用户输入时,它会通过“铭牌”主动提供附加上下文,这揭示了 AI 代理从被动应答向主动引导体验的关键转型方向。

Anthropic 为 Claude Code 推出 /checkup 命令行工具,自动清理未使用的插件、去重配置、优化 CLAUDE.md 结构,并提示更新与权限设置,帮助开发者在编码环境中保持上下文精简与性能高效。

一位创始人给团队全员配置了 OpenAI Codex Max,导致成员全部转向与 AI 对话完成工作,团队内部协作消失、文化恶化。这暴露了目前 AI 编码工具大规模使用时“单机化”的副作用。

OpenAI 内部一位工程师在 X(原 Twitter)上分享了一张照片,显示深夜办公室门口堆满了外卖订单,暗示团队正在高强度加班推进新项目。这条带幽默的推文引发了行业对 OpenAI 即将发布重要产品或更新的猜测。