
一句话看懂:poolside 发布了 118B 参数(8B 激活)的 MoE 模型 Laguna S 2.1,在长周期编码基准测试中以 70.2% 的 Terminal-Bench 2.1 成绩击败了多数千亿级模型,证明了小参数量模型的专用化潜力。
事件核心:发生了什么
poolside 今天正式发布 Laguna S 2.1,这是一款 118B 总参数、每 token 仅激活 8B 参数的混合专家(MoE)模型,支持最高 100 万 token 的上下文窗口。模型从训练到上线仅用了不到 9 周。在 Terminal-Bench 2.1 上,Laguna S 2.1 得分 70.2%,远高于其同参数级别的模型(如 Nemotron 3 Ultra 的 56.4% 和 Inkling 的 63.8%),甚至接近 2.8T 参数的 Kimi K3(88.3%)。在 SWE-Bench Multilingual 上,它拿到 78.5%,超越 Hy3 的 75.8%。公司同时发布了所有评估轨迹文件。
为什么重要
Laguna S 2.1 的核心意义在于三点:第一,它展示了 MoE 架构在“激活参数极少”情况下仍能完成复杂长周期编码任务,这对本地部署和边缘设备场景是重大利好;第二,它使“小模型 vs 大模型”的竞争格局更加复杂——用户不再必须选择千亿级 API 模型;第三,它的快速迭代(9 周从训练到发布)暗示了 poolside 对 post-training 的工程化能力,可能削弱传统预训练主导的优势。与其说这是“模型能力的跃升”,不如说这是“效率与针对性的胜利”。
对用户/开发者/创作者的影响
对于开发者而言,Laguna S 2.1 提供了一个高性价比的本地编码助手选项:118B 总参数量可用消费级显卡运行(8B 激活),同时能处理 100 万 token 的上下文,适合大型代码库调试和重构。企业采购团队可能将其作为云端 API 之外的权衡方案。AI 应用开发者可以基于它的 agent harness 在终端环境下构建自动化编码管道。不过,目前模型为闭源,且 poolside 未公布 API 定价,成本和可用性仍需观察。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
首先,能否真正落地到开发者工作流中——模型在几个编码基准上表现亮眼,但实际开发环境中的泛化能力有待验证。其次,poolside 是否会在 3 个月内推出更大参数量或更强推理能力的版本(原文提及“Three models in three months”)。最后,竞品(如 Anthropic、Kimi 等)是否会针对性推出小参数量 agent 模型,或者通过蒸馏/量化追赶 Laguna S 2.1 的性价比。


