GPT-6.1 Sol (Max) 进入 Agent Arena 第 5 名,以更低成本逼近前列模型

GPT-6.1 Sol (Max) 首次进入 Agent Arena 就排到第 5 名,单任务中位成本仅 0.56 美元,用明显更低的价格把性能压到头部模型 2 个百分点以内,重新划定了成本与能力的性价比边界。

GPT-6.1 Sol (Max) 首次进入 Agent Arena 就排到第 5 名,单任务中位成本仅 0.56 美元,用明显更低的价格把性能压到头部模型 2 个百分点以内,重新划定了成本与能力的性价比边界。

Prime Intellect 推出推理平台 Prime Inference,提供无服务器端点和预留算力,首个公开部署的 GLM-5.3 端点已于 9 月 22 日上线 OpenRouter,主打低延迟、高可用和面向生产环境的 SLA。

金融咨询公司 Chatham Financial 用 OpenAI 的 Codex 和 GPT‑5.6 系列模型重构资本市场业务流程,把单笔交易验证时间从约 30 分钟压缩到 4 分钟以内,同时把员工自建应用和核心平台 Chatham Onyx 接入大模型能力。

GitHub 于 2026 年 10 月 2 日一次性弃用了 Copilot 中的四款模型,覆盖 Gemini、Kimi 和 Claude 三条产品线。这不只是版本清理,而是 Copilot 模型供给策略在向更新、更集中的方向收拢,直接牵动开发者的日常工具配置。

据 Hacker News 讨论区信息,尚未正式发布的 GPT-6 Astra 据称首次通过名为 agent-wow 的智能体框架试玩《魔兽世界》。这值得关注的原因是,它把大模型的评测场景从代码题、文本问答推向了需要持续感知、决策和操作的实时游戏环境。

一个名为 agent-wow 的开源项目让 GPT-6 Astra 驱动的 Codex 代理首次进入《魔兽世界》,在 40 分钟内零死亡完成兽人新手村全部任务,验证了大模型在未专门训练的游戏环境中自主推理与执行的能力。

《麻省理工科技评论》刊文指出,以 ChatGPT 为代表的大模型并不具备真正的推理能力——它们的"思维链"仍是同一个 token 预测流程的延长版,缺少独立可检查的推理机制,这在医疗、科研等高风险场景中值得警惕。

Anthropic 在尚未公开的 IPO 招股书中警告,美国政府对它的负面态度可能不只影响政府采购,还会波及商业客户与合作伙伴。这家人工智能公司同时披露,政府相关收入占其年营收不到 1%。

据报道,博通(Broadcom)组织的华尔街银团正在筹集约 600 亿美元,用于为 Anthropic 等公司获得 AI 芯片和相关基础设施提供融资。这反映出算力供给正从"直接采购"转向"金融杠杆驱动"的新阶段。

Android Police 作者 Jade Bryan 在 Pixel 9 Pro XL 上测试 Gemini Spark 数周后,发现这个 Gemini 内的"代理"功能已能替代 Chrome、Gmail、Google Docs 的日常操作,把手机从"手动工具"变成"后台自动干活"的助手。