Epoch AI 收录 Grok 4:xAI 2025 年 7 月 9 日发布的闭源模型,ECI 得分 146

Epoch AI 的评测数据库已收录 xAI 于 2025 年 7 月 9 日发布的闭源模型 Grok 4,其 ECI 综合得分为 146。发布时它在 148 个受追踪模型中排第 3,但随着更多新模型进入榜单,目前排名已回落至 253 个模型中的第 71 位。

Epoch AI 的评测数据库已收录 xAI 于 2025 年 7 月 9 日发布的闭源模型 Grok 4,其 ECI 综合得分为 146。发布时它在 148 个受追踪模型中排第 3,但随着更多新模型进入榜单,目前排名已回落至 253 个模型中的第 71 位。

Epoch AI 已将 OpenAI 于 2025 年 8 月 7 日发布的 GPT-5 纳入其模型评测库,该模型在发布时的 159 个追踪模型中排名第一。这意味着第三方独立评测机构对这款闭源旗舰模型给出了可量化的初始定位。

DeepSeek 于 2025 年 8 月 21 日发布开源权重模型 DeepSeek-V3.1,在 Epoch AI 的 ECI 评测中拿到 140 分。发布时它在 160 个受追踪模型中排第 24 位,说明开源模型的竞争力已经逼近头部梯队。

DeepSeek 于 2026 年 7 月 31 日发布开源权重模型 V4 Flash 0731,在 Epoch AI 的 ECI 评测中得到 155 分,发布时在 237 个受跟踪模型中排第 18 位。这是又一次把中高端能力放进开源阵营的动作。

Anthropic 于 2026 年 9 月 22 日发布闭源模型 Claude Opus 5.5,在 Epoch AI 的 ECI 评测中得到 167 分,在 253 个被追踪模型中排名第一。这意味着头部闭源模型的性能座次再次发生变化。

阿里巴巴在 2026 年 8 月 2 日发布了闭源模型 Qwen 3.8 Max,在 Epoch AI 的能力指数(ECI)上拿到 157 分,是阿里目前公开可查的最强模型之一。值得关注的是,这次走的是闭源路线,与 Qwen 系列此前的开源形象形成对比。

ARC Prize Foundation 发布第二代抽象推理基准 ARC-AGI-2,用 1360 道网格题测试 AI 的少样本推理和泛化能力,同时被刻意设计成“对机器更难、对人仍可解”。发布时纯 LLM 得分 0%,前沿推理系统也只有个位数百分比。

波士顿咨询公司(BCG)全球人才与组织负责人 David Martin 警告,过度依赖 AI 摘要和把核心业务判断交给 AI,会加速批判性思维退化;他建议每季度主动脱离 AI 一周来自我检验。
![[Bug]: aws_bedrock_project_id sent as wrong header ("anthropic-workspace") to Bedrock Mantle — should be "anthropic-workspace-id"](https://www.chat-gpts.plus/wp-content/uploads/2026/10/31947-aedb8605-768x403.jpg)
这个报错通常出现在通过 LiteLLM Proxy 调用 AWS Bedrock Mantle 的 Anthropic 兼容接口( bedrock/mantle/anthropic.* )并配置了 aws_bedrock_project_id 时。由于项目 ID 被写进了错误的请求头 anthrop

麦肯锡和波士顿咨询(BCG)在 2026 年 10 月初发布的两份报告指出,AI 使用成本下降反而可能推高电力需求,因为企业会用得更多、更频繁。数据中心电力需求已成为经合组织电力市场中增长最快的负荷。