Qwen 3.6 Plus 发布:Alibaba 闭源模型 ECI 得分 148

阿里巴巴在 2026 年 3 月 31 日发布了闭源模型 Qwen 3.6 Plus,在 Epoch AI 的 ECI 评测中拿到 148 分。这是 Qwen 系列少见的闭源动作,也意味着阿里在开源与闭源两条线上同时下注。

阿里巴巴在 2026 年 3 月 31 日发布了闭源模型 Qwen 3.6 Plus,在 Epoch AI 的 ECI 评测中拿到 148 分。这是 Qwen 系列少见的闭源动作,也意味着阿里在开源与闭源两条线上同时下注。

Poolside 于 2026 年 4 月 28 日发布开源权重模型 Laguna XS.2,参数规模 33B。这是这家以代码生成见长的公司首次把自研模型权重对外开放,意味着开发者可以直接下载部署,而不必只通过 API 调用。

OpenAI 于 2026 年 9 月 29 日发布闭源模型 GPT-6.1 Sol,采用按量计费,输入每百万 tokens 定价 2 美元、输出每百万 tokens 定价 10 美元。这是 OpenAI 在闭源大模型路线上的一次常规迭代,定价结构延续了"输出远比输入贵"的行业惯例。

OpenAI 于 2025 年 12 月 18 日发布 GPT-5.2 Codex,这是一款采用闭源权重策略的代码方向模型。它值得关注的地方在于:OpenAI 继续把最强的代码能力锁在自有产品体系内,而非通过开放权重释放。

OpenAI 于 2026 年 4 月 23 日发布闭源模型 GPT-5.5 Pro,在 Epoch AI 的 ECI 评测中得到 162 分;发布时它在 209 个被追踪模型中排名第一,目前则在 253 个模型中排到第 6 位。

Google DeepMind 于 2026 年 4 月 2 日发布开放权重模型 Gemma 4 31B IT,在 Epoch AI 的评测中取得 ECI 143 分,发布时在 199 个被追踪模型中排名第 43。这是一款 31B 级别的开源模型进入了此前多由闭源大模型占据的评分区间。

Google DeepMind 于 2026 年 2 月 19 日发布闭源模型 Gemini 3.1 Pro,在 Epoch AI 的 ECI 评测中得分 155,发布时在 187 个受追踪模型中排第 4。这说明头部大模型的能力竞争仍在小步快跑,而非一次性拉开代差。

卡内基梅隆大学的研究者发布了 ExploitBench v0.1,用 41 个真实的 V8 引擎漏洞,衡量 LLM 智能体在软件漏洞利用这条"能力阶梯"上能爬到第几级,而不是只看成功或失败。

Anthropic 于 2025 年 9 月 29 日发布闭源模型 Claude Sonnet 4.5,在 Epoch AI 的评测体系中拿到 147 的 ECI 分数,发布时在 166 个受跟踪模型中排第 4,但随着后续新模型涌入,目前已在 253 个模型中滑落至第 66 位。

Epoch AI 解读了由 Center for AI Safety 与 Scale AI 共建的 Remote Labor Index(RLI)基准,它用真实付费外包项目衡量 AI 智能体能否端到端交付可被专业验收的工作,目前成绩仍在个位数低段。