一句话看懂:阶跃星辰发布新旗舰 Step 5 Preview,在 Artificial Analysis 智能指数上拿到 44 分,追平 Kimi K3(max),但每个任务成本只有后者的约 1/2.8。这意味着中端价格带开始出现接近顶级推理能力的模型,但它在智能体(Agent)类评测上明显落后。
事件核心:发生了什么
Artificial Analysis 公布了 StepFun 新旗舰 Step 5 Preview 的评测结果。该模型为 600B 总参数、27B 激活参数的 MoE 架构,接替 2026 年 5 月发布的 Step 3.7 Flash,支持 100 万 token 上下文,可输入文本、图像和视频,输出文本。
核心数据是:智能指数 44 分,与 Kimi K3(max)持平,仅落后 GLM-5.3(max,45)和 Qwen3.8 Max(45)一分。更关键的是成本——单任务约 0.72 美元,而同样 44 分的 Kimi K3(max)约 2.00 美元,45 分的 GLM-5.3(max)约 2.01 美元。定价上,输入 1 美元 / 百万 token,输出 2.70 美元 / 百万 token,缓存输入低至 0.05 美元,输入输出两侧都低于上述两款。目前通过 StepFun 一方 API 提供,计划 10 月 15 日开源权重。
为什么重要
这组数字说明,前沿推理能力正在从“最贵的一小撮模型”向更低价位扩散。Step 5 Preview 在 Humanity’s Last Exam 上得 46%,与 Kimi K3(max,47%)几乎同一档;CritPt 得 21%,介于 Kimi K3(23%)和 GLM-5.3(max,19%)之间。相比 Step 3.7 Flash,HLE 提升 25 个百分点、CritPt 提升 19 个百分点,是这一代最明显的跃升。
但它的短板同样清晰:GDPval-AA 智能体评测只有 1566 Elo,落后 Qwen3.8 Max(1668)和 GLM-5.3(max,1646);Terminal-Bench 4.0 为 33%(对比 39% 和 42%),AutomationBench-AA 为 51%(对比 56% 和 62%)。也就是说,它更像一个“高性价比推理模型”,而不是“全能 Agent 底座”。此外,AA-Omniscience 准确率 42%,超过参数更大的 GLM-5.3(max,34%,753B),但答题更激进、幻觉也更多(43% vs 30%)。
对用户/开发者/创作者的影响
对开发者和企业采购而言,Step 5 Preview 的价值主要在成本敏感、以推理和知识问答为主的任务上,比如长文档分析、复杂问答、文本生成。每任务 0.72 美元的差距,在批量调用时会显著放大。100 万 token 上下文加上图像、视频输入,也适合多模态内容理解场景。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
但如果你的应用依赖多步工具调用、终端操作或自动化流程,目前公开评测显示它的智能体能力弱于同分竞品,选型时需要先做针对性实测。内容创作者如果用它做素材理解和长文本处理,成本和上下文是两个实际优势;若涉及对外发布的自动化 Agent,则要谨慎。
值得关注的后续
一是 10 月 15 日开源权重能否如期落地,以及开源版本与 API 版本的能力、许可条款是否一致;二是 Agent 类评测是否会在后续版本或正式版中补上;三是这一价格是否引发同级模型跟进降价,进一步压低推理单价。


