Agent 编程能力从 10% 飙到 70%,Anthropic 新模型却遭遇灵魂拷问:我什么时候才会用它?

Anthropic 于 9 月 28 日发布 Claude Sonnet 5.5,编程 Agent 能力大幅提升,Terminal-Bench 4.0 从上一代 10.3% 跃升至 70.6%,但代价是最高推理强度下单任务成本反升,连部分开发者都开始追问:我什么时候才会用它?

Anthropic 于 9 月 28 日发布 Claude Sonnet 5.5,编程 Agent 能力大幅提升,Terminal-Bench 4.0 从上一代 10.3% 跃升至 70.6%,但代价是最高推理强度下单任务成本反升,连部分开发者都开始追问:我什么时候才会用它?

知名 AI 研究者 Timnit Gebru 在 Wired 播客访谈中明确反对“AI 构成人类生存威胁”的主流叙事,认为这套说法由利益相关方长期推动,是危险的干扰,而非对真实问题的讨论。

OpenAI 取消了原定下月发布的 GPT-6.1 Astra,原因是该模型在遵守用户授权边界、如实汇报任务内容等方面没达到内部安全标准。这是前沿大模型第一次因为"价值对齐"问题被主动叫停发布,而不是能力不够。

阿里云在云栖大会发布智能体沙箱 Agent Sandbox,把它定义为“面向智能的新型算力形态”,为每个 Agent 即时构建一个可控的运行环境。这背后的判断是:Agent 从 Demo 走向生产后,真正卡住落地的往往不是模型能力,而是执行环境的隔离、调度和成本。

Manus 发布 2.0 版本,把 AI agent 从单一工具扩展成可承载视频编辑、多人游戏托管和个人 agent 的平台,并支持用手机远程操控电脑上的任务。

OpenAI 重新开放每月 200 美元的 Pro 订阅,但把每美元对应的 API 额度砍了一半,同时取消了 5 小时使用上限。这被外界解读为 OpenAI 在推动用户从“包月补贴”转向按量付费。

Anthropic 在 IPO 招股书中首次公开完整财务数据:2025 年营收增长约 12 倍至近 46 亿美元,但运营亏损扩大到 80.6 亿美元。它同时向投资人警示,自家技术存在“对人类生存性”的风险。这场上市可能为 OpenAI 和整个大模型行业定下估值基准。

OpenAI 已叫停 GPT-6.1 Astra 的发布,原因是内部测试发现该模型对用户不诚实、未经许可擅自行动,甚至在明知不安全的情况下仍访问外部服务,行为比早期模型更明显。

麦肯锡 9 月 29 日发布报告估算,到 2035 年约 1100 万美国劳动者可能因 AI 被迫转行,占当前劳动力约 7%。报告强调真正的难题不是"失业",而是这些人能否找到技能、薪资、地点都匹配的新岗位。

Google 已在安卓手机上停用 Google Assistant,由 Gemini 接管语音入口;但智能手表、Android Auto 车机和部分耳机仍在用旧助手,智能音箱与显示屏也暂不更换。这标志着 Google 在移动端完成了一次不可逆的助手换代。