Laguna S 2.1

poolside 发布了 118B 参数(8B 激活)的 MoE 模型 Laguna S 2.1,在长周期编码基准测试中以 70.2% 的 Terminal-Bench 2.1 成绩击败了多数千亿级模型,证明了小参数量模型的专用化潜力。

Laguna S 2.1

一句话看懂:poolside 发布了 118B 参数(8B 激活)的 MoE 模型 Laguna S 2.1,在长周期编码基准测试中以 70.2% 的 Terminal-Bench 2.1 成绩击败了多数千亿级模型,证明了小参数量模型的专用化潜力。

事件核心:发生了什么

poolside 今天正式发布 Laguna S 2.1,这是一款 118B 总参数、每 token 仅激活 8B 参数的混合专家(MoE)模型,支持最高 100 万 token 的上下文窗口。模型从训练到上线仅用了不到 9 周。在 Terminal-Bench 2.1 上,Laguna S 2.1 得分 70.2%,远高于其同参数级别的模型(如 Nemotron 3 Ultra 的 56.4% 和 Inkling 的 63.8%),甚至接近 2.8T 参数的 Kimi K3(88.3%)。在 SWE-Bench Multilingual 上,它拿到 78.5%,超越 Hy3 的 75.8%。公司同时发布了所有评估轨迹文件。

为什么重要

Laguna S 2.1 的核心意义在于三点:第一,它展示了 MoE 架构在“激活参数极少”情况下仍能完成复杂长周期编码任务,这对本地部署和边缘设备场景是重大利好;第二,它使“小模型 vs 大模型”的竞争格局更加复杂——用户不再必须选择千亿级 API 模型;第三,它的快速迭代(9 周从训练到发布)暗示了 poolside 对 post-training 的工程化能力,可能削弱传统预训练主导的优势。与其说这是“模型能力的跃升”,不如说这是“效率与针对性的胜利”。

对用户/开发者/创作者的影响

对于开发者而言,Laguna S 2.1 提供了一个高性价比的本地编码助手选项:118B 总参数量可用消费级显卡运行(8B 激活),同时能处理 100 万 token 的上下文,适合大型代码库调试和重构。企业采购团队可能将其作为云端 API 之外的权衡方案。AI 应用开发者可以基于它的 agent harness 在终端环境下构建自动化编码管道。不过,目前模型为闭源,且 poolside 未公布 API 定价,成本和可用性仍需观察。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

首先,能否真正落地到开发者工作流中——模型在几个编码基准上表现亮眼,但实际开发环境中的泛化能力有待验证。其次,poolside 是否会在 3 个月内推出更大参数量或更强推理能力的版本(原文提及“Three models in three months”)。最后,竞品(如 Anthropic、Kimi 等)是否会针对性推出小参数量 agent 模型,或者通过蒸馏/量化追赶 Laguna S 2.1 的性价比。

来源:Hacker News · 24h最热

celebrityanime
celebrityanime
文章: 14539

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注