Meta 公布数学家与 Muse Spark 1.1/1.2 协作完成的六篇论文

Meta 让数学家直接通过 meta.ai 聊天界面,用 Muse Spark 1.1/1.2 的 Thinking Mode 协作攻克尚无已知解法的开放数学问题,并公布了六篇论文;关键在于这套流程没有定制化科研脚手架,走的是普通用户产品入口。

Meta 让数学家直接通过 meta.ai 聊天界面,用 Muse Spark 1.1/1.2 的 Thinking Mode 协作攻克尚无已知解法的开放数学问题,并公布了六篇论文;关键在于这套流程没有定制化科研脚手架,走的是普通用户产品入口。

Anthropic 的 Claude Sonnet 5.5 首次进入 Arena 的 Agent Arena 榜单,排在第 3 名,净改进分为 +12.5%,但每任务中位成本达 2.74 美元,未能进入性价比 Pareto 前沿。

GPT-6.1 Sol (Max) 首次进入 Agent Arena 就排到第 5 名,单任务中位成本仅 0.56 美元,用明显更低的价格把性能压到头部模型 2 个百分点以内,重新划定了成本与能力的性价比边界。

Prime Intellect 推出推理平台 Prime Inference,提供无服务器端点和预留算力,首个公开部署的 GLM-5.3 端点已于 9 月 22 日上线 OpenRouter,主打低延迟、高可用和面向生产环境的 SLA。

金融咨询公司 Chatham Financial 用 OpenAI 的 Codex 和 GPT‑5.6 系列模型重构资本市场业务流程,把单笔交易验证时间从约 30 分钟压缩到 4 分钟以内,同时把员工自建应用和核心平台 Chatham Onyx 接入大模型能力。

GitHub 于 2026 年 10 月 2 日一次性弃用了 Copilot 中的四款模型,覆盖 Gemini、Kimi 和 Claude 三条产品线。这不只是版本清理,而是 Copilot 模型供给策略在向更新、更集中的方向收拢,直接牵动开发者的日常工具配置。

据 Hacker News 讨论区信息,尚未正式发布的 GPT-6 Astra 据称首次通过名为 agent-wow 的智能体框架试玩《魔兽世界》。这值得关注的原因是,它把大模型的评测场景从代码题、文本问答推向了需要持续感知、决策和操作的实时游戏环境。

一个名为 agent-wow 的开源项目让 GPT-6 Astra 驱动的 Codex 代理首次进入《魔兽世界》,在 40 分钟内零死亡完成兽人新手村全部任务,验证了大模型在未专门训练的游戏环境中自主推理与执行的能力。

《麻省理工科技评论》刊文指出,以 ChatGPT 为代表的大模型并不具备真正的推理能力——它们的"思维链"仍是同一个 token 预测流程的延长版,缺少独立可检查的推理机制,这在医疗、科研等高风险场景中值得警惕。

Anthropic 在尚未公开的 IPO 招股书中警告,美国政府对它的负面态度可能不只影响政府采购,还会波及商业客户与合作伙伴。这家人工智能公司同时披露,政府相关收入占其年营收不到 1%。