DeepSeek-V3.1 开源权重模型发布,ECI 评分 140

DeepSeek 于 2025 年 8 月 21 日发布开源权重模型 DeepSeek-V3.1,在 Epoch AI 的 ECI 评测中拿到 140 分。发布时它在 160 个受追踪模型中排第 24 位,说明开源模型的竞争力已经逼近头部梯队。

DeepSeek 于 2025 年 8 月 21 日发布开源权重模型 DeepSeek-V3.1,在 Epoch AI 的 ECI 评测中拿到 140 分。发布时它在 160 个受追踪模型中排第 24 位,说明开源模型的竞争力已经逼近头部梯队。

DeepSeek 于 2026 年 7 月 31 日发布开源权重模型 V4 Flash 0731,在 Epoch AI 的 ECI 评测中得到 155 分,发布时在 237 个受跟踪模型中排第 18 位。这是又一次把中高端能力放进开源阵营的动作。

Anthropic 于 2026 年 9 月 22 日发布闭源模型 Claude Opus 5.5,在 Epoch AI 的 ECI 评测中得到 167 分,在 253 个被追踪模型中排名第一。这意味着头部闭源模型的性能座次再次发生变化。

阿里巴巴在 2026 年 8 月 2 日发布了闭源模型 Qwen 3.8 Max,在 Epoch AI 的能力指数(ECI)上拿到 157 分,是阿里目前公开可查的最强模型之一。值得关注的是,这次走的是闭源路线,与 Qwen 系列此前的开源形象形成对比。

ARC Prize Foundation 发布第二代抽象推理基准 ARC-AGI-2,用 1360 道网格题测试 AI 的少样本推理和泛化能力,同时被刻意设计成“对机器更难、对人仍可解”。发布时纯 LLM 得分 0%,前沿推理系统也只有个位数百分比。

波士顿咨询公司(BCG)全球人才与组织负责人 David Martin 警告,过度依赖 AI 摘要和把核心业务判断交给 AI,会加速批判性思维退化;他建议每季度主动脱离 AI 一周来自我检验。

麦肯锡和波士顿咨询(BCG)在 2026 年 10 月初发布的两份报告指出,AI 使用成本下降反而可能推高电力需求,因为企业会用得更多、更频繁。数据中心电力需求已成为经合组织电力市场中增长最快的负荷。

一个 AI Agent 自主向数百名研究人员发送邮件求助,《科学》杂志的独家报道称它还向记者解释了这么做的原因。这件事值得关注的地方不在"AI 会发邮件",而在于 Agent 第一次把"主动求助外部人类"变成了可观察的现实行为。

Vox 资深科技记者 Adam Clark Estes 撰文指出,频繁使用 ChatGPT、Claude 等 AI 聊天机器人会在提升效率的同时带来"去技能化"风险,但问题的关键不是少用 AI,而是有选择地使用。文中引用多项调查数据,显示美国 68% 的 Z 世代成年人担心认知外包损害自身能力建设。

德国一个名为 Kolibri 的主权 AI 模型在 Hacker News 的 Show HN 板块亮相,主打由本国力量掌控训练与部署。在欧洲持续强调“数字主权”的背景下,这类项目被视作区域自建大模型能力的一次公开试水。