Claude Opus 5.5 上架 Arena 的 Agent Arena 与 Battle Mode

Anthropic 的 Claude Opus 5.5 已上线 Arena 的 Agent Arena 与 Battle Mode,进入可被全球用户用真实长任务投票评测的公开擂台;这意味着 agent 能力正从厂商自测走向第三方、结果导向的横向对比。

Anthropic 的 Claude Opus 5.5 已上线 Arena 的 Agent Arena 与 Battle Mode,进入可被全球用户用真实长任务投票评测的公开擂台;这意味着 agent 能力正从厂商自测走向第三方、结果导向的横向对比。

OpenAI 在 ChatGPT Work 和 Codex 中推送 GPT-6 Sol 与 GPT-6 Luna 两款新模型,付费用户先行,免费与 Go 用户可在桌面端试用 Luna。这是 GPT-6 系列首次进入实际产品线,也意味着模型分层策略进一步明确。

OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna 两款新模型并同步上线 API,官方称价格比 GPT-5.6 低 50%,其中 Luna 定价为每百万 token 输入 0.10 美元、输出 0.50 美元。

Artificial Analysis 评测显示,OpenAI 的 GPT-6 Sol 与 Luna 把每任务成本压到 GPT-5.6 的一半左右,智能指数和编程智能体指数基本持平,但知识工作类评测出现下滑,是一组“省钱不涨分”的迭代。

OpenAI 的两款新模型 GPT-6 Sol 和 GPT-6 Luna 已在第三方模型聚合平台 OpenRouter 上线,价格只有上一代 GPT-5.6 的一半,但在自动化任务基准 AutomationBench 上得分反而更高。

OpenAI 在 X 上发布 GPT-6 Sol 和 GPT-6 Luna 两款新模型,延续 GPT-6 Astra 的能力,但主打更快、更便宜,API 价格比 GPT-5.6 促销价还低 50%,同时优化了缓存和推理效率。

OpenAI CEO Sam Altman 称新发布的 GPT-6 Sol 和 Luna 相比上一代 5.6 系列在智能、对齐、工作产出、编程和计算机操作上均有明显提升,代币价格降了一半,按任务计费更是更低;他直言按“每任务定价”这一指标衡量,市场上没有可比的竞争者。

Anthropic 推出 Claude Opus 5.5,宣称其性能对标 Fable 5.1,同时把运行成本压到比 Opus 5 低约 40%,继续在“能力不降、价格下探”的方向上推进旗舰模型迭代。

彭博调查披露,五角大楼一份未公开的内部审查认为,美军今年2月对伊朗米纳布一所小学的导弹打击中,对 Palantir 开发的 Maven Smart System 的过度依赖是三个失误之一,该袭击造成至少123名儿童死亡。这起事件把"AI 辅助目标推荐"的责任边界问题推到了台前。

Arena 已上线 OpenAI 的 GPT-6 Sol 与 GPT-6 Luna 供用户实测,正式评分尚未公布;同期流出的对比视频把 GPT-6 Sol 与上一代 GPT-5.6 Sol 放在相同提示词、均开启最大推理的条件下比较,关注点不只是输出质量,还有 token 消耗与响应耗时。