Anthropic 发布 Claude Sonnet 5.5,Artificial Analysis 智能指数得分 56,仅次于 Opus 5.5

Anthropic 发布 Claude Sonnet 5.5,在 Artificial Analysis 智能指数上拿到 56 分,仅次于 Opus 5.5,价格与上一代 Sonnet 5 完全一致,但完成单个任务消耗的输出 Token 明显更多,成本随之上升约五成。

Anthropic 发布 Claude Sonnet 5.5,在 Artificial Analysis 智能指数上拿到 56 分,仅次于 Opus 5.5,价格与上一代 Sonnet 5 完全一致,但完成单个任务消耗的输出 Token 明显更多,成本随之上升约五成。

Anthropic 发布 Claude Sonnet 5.5,官方称其比 Sonnet 5 运行快超过 30%、多数工作场景成本最多低 30%,定位是处理修 bug、快速迭代功能这类边界清晰的日常任务。

GitHub 安全团队用自研开源 AI 安全 Agent 的任务流(Taskflow)审查 Android 应用代码,累计发现并报告 24 个漏洞,说明"把提示词拆成可复用工作流"正在成为 AI 辅助安全审计的落地方式。

Anthropic 发布 Claude Sonnet 5.5,在 Terminal-Bench 4.0 上从 Sonnet 5 的 10.3% 跃升至 70.6%,而 API 价格维持每百万输入/输出 token 2 美元/10 美元不变。它没有靠涨价换性能,而是靠更少 token 和工具调用把单任务成本压低…

Anthropic 发布 Claude Sonnet 5.5,官方称其运行速度比 Sonnet 5 提升 30% 以上,多数工作场景成本最多降低 30%,是 Claude 5.5 家族的第二款模型。

UC Berkeley RDI 团队用 AI Agent 对 13 个主流评测基准做安全审计,发现 45 种不真正解题也能拿满分的作弊路径。这意味着部分被广泛引用的跑分,可能高估了模型的真实能力。

OpenAI 将对该项目的投入翻倍,以最高 1000 万美元的资金、软件额度和工程支持,把美国新闻业规模最大的人工智能驻场项目延续到下一阶段。

Anthropic 最新的 Claude Sonnet 5.5 已在 GitHub Copilot 中正式开放,覆盖 Pro、Pro+、Max、Business、Enterprise 等主流订阅方案。GitHub 的早期测试显示,它在编码任务上追平 Claude Sonnet 5,但用的步骤、token 和工…

Google 与 XPRIZE 联合发起的 Future Vision XPRIZE 公布首奖,独立创作者 Jeff Synthesized 的短片《The Gifted》从全球 2500 多份投稿中胜出,拿走 10 万美元奖金与 250 万美元长片制作资金。这不是一次普通影展评奖,而是大厂用真金白银为“AI…

GitHub 调整了自托管 Runner 最低版本要求的强制生效时间,完整执行从原定日期改为 2026 年 9 月 29 日,低于版本要求的 Runner 将无法注册或停止执行工作流任务。