一句话看懂:Strands Agents 发布并开源了 2B 参数的决策模型 Strands Decider 2B,它在本地 CPU 或 GPU 上就能运行,约 115 毫秒内从给定选项中选出答案并给出可靠度分数,瞄准的是开发者实验和智能体工作流。
事件核心:发生了什么
2026 年 10 月,Strands Agents 在其 strands-labs 项目下正式推出 Strands Decider 2B。这是一个 20 亿参数的小型决策模型,定位不是生成文本,而是在预设选项之间做选择,或给某个判断打出简单数值分数,例如判断“turn on the lights”是否与咖啡机有关、某句话属于哪种语言、情感倾向是 0 到 1 的哪个值。
它基于 Qwen3.5-2B 的预训练躯干改造,去掉语言模型头,换成指针头,并用 rank-16 LoRA 适配器微调。模型权重、训练数据和脚本已在 GitHub 和 Hugging Face 开源,方便开发者复现和二次开发。官方称,在 JevBench 公开集上,Strands Decider 2B 在 2B 参数级别中准确率和校准表现进入前三,在排除略超 2B 的模型后排名第一;本地 RTX3090 上中小任务延迟中位数约 115 毫秒,M3 MacBook 约 153 毫秒。
为什么重要
决策模型或“系统一模型”最近受到关注,包括 TypeSafe AI 推出的 Jev。与通用大模型不同,它们不让模型自由生成任意文本,而是让模型在有限选项上做判断。代价是灵活性下降,换来的是同尺寸下更快、更可靠,且始终输出选项内的答案,还能给出置信度分数。这类模型不擅长复杂推理、写代码、聊天或总结文档,但在智能体工作流中,频繁做小决策的场景很多,例如意图路由、工具选择、条件判断。Strands Decider 2B 的意义在于,它把这一路线做成了小尺寸、可本地跑、可开源的方案,降低了开发者实验门槛。
对用户/开发者/创作者的影响
对开发者来说,最直接的价值是可以在本地 CPU 或 GPU 上跑一个 2B 模型,用低延迟完成分类、路由、打分类任务,不必每次调用云端大模型 API。开源权重和训练脚本也让小团队可以基于自己的数据继续微调,或复现作者的架构改进过程。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对普通用户和内容创作者,这个模型不会直接变成聊天机器人或写作工具,但它可能被集成进智能体应用的后台,让“该调哪个工具”“这条评论是正面还是负面”这类判断更快、更省算力。需要注意的是,目前公开信息显示它的能力限定在决策和打分,不能替代生成式大模型做内容创作。
值得关注的后续
一是社区是否会基于开源权重做出更多垂直场景的微调模型,例如客服路由、智能家居指令解析;二是准确率和校准分数能否在更多公开评测集上得到独立验证,而不只依赖 JevBench;三是延迟下限能否继续降低,以及它和 Jev 等同类模型的竞争会如何影响智能体开发框架的选型。


