一句话看懂:韩国 AI 实验室 Upstage 发布闭源推理模型 Solar Mini 4,官方称其以 35B 总参数、3B 激活参数在 Intelligence Index 上拿到 24 分,但 Artificial Analysis 评测显示其完成同一任务的成本约为 GPT-6 Luna(max)的 5 倍,效率与速度之间存在明显张力。
事件核心:发生了什么
2026 年 9 月 30 日,Upstage 推出 Solar Mini 4。据官方披露,该模型总参数 35B、激活参数 3B,支持 1M tokens 上下文窗口和最多 262k 输出 tokens,知识截止到 2026 年 2 月,仅支持文本输入输出,采用闭源许可,不公开权重。相比上一代旗舰 Solar Pro 3,它的 Intelligence Index 分数从 8 提升到 24,每百万输入/输出 token 价格降至 0.10/0.40 美元。Artificial Analysis 的评测显示,它在 AA-LCR v1.1 长上下文推理上得分为 83%,与 MiniMax-M3、GPT-6 Luna(max)持平;输出速度 208 tokens/s。但它在 Terminal-Bench 4.0 上仅得 1%、AutomationBench-AA 得 22%,智能体编码是明显短板;同时每个 Intelligence Index 任务平均消耗 88k 输出 tokens,导致单任务解码时间约 7.1 分钟,慢于 GPT-6 Luna(max)的 5.8 分钟。
为什么重要
Solar Mini 4 的卖点是参数效率:如果 Upstage 报告的 3B 激活参数可信,它在“智能分数 vs 激活参数”曲线上刷新了 3B 以下档位的帕累托最优点,分数高于同档的 Qwen3.6 35B A3B(18 分),甚至略高于激活参数 55B 的 Nemotron 3 Ultra(23 分)。这意味着小激活参数模型仍有性能挖掘空间。不过,Artificial Analysis 指出,该模型在智能体任务中重复上下文较大,缓存命中率只有 48%,而 GPT-6 Luna(max)为 99%,导致其每任务成本约 0.36 美元,其中 0.30 美元来自未缓存输入。这说明低价 token 不等于低价任务,长链条推理和工具调用场景下,缓存效率和输出 token 管理正在成为新的成本分水岭。
对用户/开发者/创作者的影响
对开发者和企业采购而言,Solar Mini 4 的低 token 单价对预算敏感型、单轮长文本任务有一定吸引力,比如长文档问答或长上下文推理;但如果要接入智能体工作流、自动化编码或高频多轮工具调用,就需要把缓存命中率和每任务总成本算进去,不能只看 API 标价。对普通用户来说,它目前不是开源模型,权重不公开,本地部署和自由微调不可行,只能通过 Upstage 提供的 API 或托管服务调用。此外,它在 AA-Omniscience 上得分 -11,回答准确率仅 18%,但非幻觉率达 64%,高于 Inkling(xhigh)的 32% 和 GPT-6 Luna(max)的 23%,意味着它更倾向于对不确定问题选择弃答,适合对“宁可不说也别编”有要求的场景,但知识准确性仍偏低,不建议直接用于高事实密度任务。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,Upstage 是否会公开更详细的缓存机制或推理优化方案,以降低智能体任务的每任务成本;第二,Solar Mini 4 在 Terminal-Bench 等智能体编码榜单上的弱势是否会在后续版本中改善;第三,同档位竞品如 Qwen、Nemotron 是否会跟进推出更小激活参数的模型。以上评测数据仅适用于 Artificial Analysis 在原文发布日期的评测条件,不代表永久排名。


