StepFun Step 5 Preview 拆解:600B 稀疏 MoE 旗舰模型,$1 / $2.70 per MTok 的极致性价比如何重写 9 月 API 价格战
2026 年 9 月 20 日,StepFun 发布 Step 5 Preview——600B 参数稀疏 MoE,每 token 仅激活 27B,1M 上下文 + 原生视觉输入,Artificial Analysis 智能指数 44(与 Kimi K3 Max 持平)。API 输入 $1、输出 $2.70 per MTok,95% 缓存折扣,10 月 15 日开源权重。本文从架构、定价、benchmark、市场定位、与对出海开发者的影响五个维度做深度拆解。
2026 年 9 月 20 日,中国 AI 公司 StepFun 正式发布 Step 5 Preview API——一款 600B 参数稀疏 MoE 旗舰,每 token 仅激活 27B,原生视觉输入 + 1M token 上下文,Artificial Analysis 智能指数 44(与 Kimi K3 Max 持平)。
更让业界的玩家警觉的是它的定价:
- 输入 $1.00 / MTok
- 输出 $2.70 / MTok
- 缓存命中 $0.05 / MTok(95% 折扣)
- 任务成本 $0.71(Artificial Analysis 实测平均)
按 Artificial Analysis 给出的”可比能力档”市场参考中位数(输入 $1.88、输出 $10),Step 5 Preview 的输出价是 市场参考中位数的 1/3.7——而输入价仍只有中位数的 53%。
这是一次**“用极致稀疏 MoE 压低边际成本”的工程胜利,也是一次”价格战升级到’1/7 GPT-5.6 Sol’“**的市场重击。
本文从五个维度拆解它:
- 架构:为什么 600B / 27B 这种 4.5% 的稀疏比是反常的”工程偏置”;
- 定价:$1 / $2.70 / 95% 折扣的算账逻辑,与 9 月价格战的并联;
- 能力:AA 智能指数 44、Terminal-Bench 4.0 33.3%,为什么它叫”配得上 frontier”;
- 开源权重的悬念:HF 仓库已开但只有
.gitattributes,10/15 才会放 BF16; - NixAPI 接入策略:今天能做什么、10/15 后该改什么。
一、架构:600B 总参 / 27B 激活,4.5% 稀疏比为什么”反常稀疏”
Step 5 Preview 是一个稀疏 Mixture-of-Experts 架构,StepFun 官方给出的核心参数:
| 项目 | 数值 |
|---|---|
| 总参数 | 600B |
| 每 token 激活 | 27B |
| 激活比例 | 4.5% |
| 上下文窗口 | 1M token |
| 模态 | 文本 + 原生视觉输入 |
| 定位 | 软件工程 + 专业知识工作 + 金融 |
横向看 4.5% 的激活比反常稀疏。当前主流 MoE 的激活比通常在 8%-15% 之间(GPT-OSS-120B ~ 5B/117B = 4.3% 是异类,Mixtral 8x7B ~ 13B/47B = 28%、DeepSeek V4 Pro 公开数据约 8%)。
稀疏比越低,单 token 推理算力越低,理论上单位 Inference 的边际成本越低——这是 Step 5 Preview 能把输出价定到 $2.70 的底层支撑。
但稀疏比越低,对路由机制(router)的设计要求越高:路由错一个专家,结果就崩。StepFun 把激活比压到 4.5%,意味着他们的路由器必须做对 95% 以上的概率决策——这是 moe-experts 之外最具挑战的工程点。
Orcarouter 报道中有一个数字值得注意:输出速度 99.8 tokens/s、TTFT 2.96 秒。这两个数据说明 Step 5 Preview 的推理栈已经工程化到能跑长 agent 循环——一个 agent loop 跑 40 轮、每轮 5K tokens 的代码 diff 修改,在 Step 5 上不会因为延迟让 agent 卡壳。
二、定价:$1 / $2.70 / 95% 折扣的算账逻辑
2.1 价格对比表
| 模型 | 输入 / MTok | 输出 / MTok | 缓存输入 | 备注 |
|---|---|---|---|---|
| Step 5 Preview(StepFun) | $1.00 | $2.70 | $0.05 | 95% 折扣 |
| Step 3.7 Flash(StepFun) | $0.20 | $1.15 | $0.04 | 上一代 flash |
| Step 3.5 Flash(StepFun) | $0.10 | $0.30 | $0.02 | 再上一代 flash |
| GPT-6 Astra(OpenAI) | $10.00 | $50.00 | $1.00 | 旗舰 |
| GPT-5.6 Sol(OpenAI) | $4.00 | $20.00 | $0.40 | 上代旗舰 |
| Claude Fable 5.1(Anthropic) | $10.00 | $50.00 | $0.25 | 旗舰 |
| Gemini 3.8 Flash(Google) | $0.75 | $3.75 | $0.075 | 年终促销 |
| DeepSeek V4 Pro 0813(DeepSeek) | $0.435 | $0.87 | $0.0036 | 现金价 |
| Claude Sonnet 5(Anthropic) | $2.00 | $10.00 | — | 中端 |
2.2 与”可比能力档”的中位数对比
Artificial Analysis 把同档模型的市场参考中位数定为:输入 $1.88、输出 $10.00。
| 维度 | 中位数 | Step 5 Preview | 比例 |
|---|---|---|---|
| 输入 | $1.88 | $1.00 | 53% |
| 输出 | $10.00 | $2.70 | 27% |
| 缓存命中 | 不可见 | $0.05 | (隐含 ~95% off) |
输出价 27% 的水平意味着 Step 5 Preview 比 DeepSeek V4 Pro 之外的所有同类模型都便宜——只有 DeepSeek V4 Pro 的 $0.87 比它低(DeepSeek 在”绝对低价”上有结构性峰谷优势)。
2.3 95% 缓存折扣的工程含义
Step 5 Preview 的 cache-hit 价格是 $0.05 / MTok——比 cache-miss 价 $1.00 折扣 95%。这意味着什么?
- Agent loop:同一个 code base + 同一个 system prompt 在 40 轮对话里反复出现,命中率可能到 80%-90%;
- RAG 重写:同一个 knowledge base 在多次重写时反复命中;
- 代码库级任务:对一个 git repo 做多轮审查 → 累计命中率 60%+ 是常态。
把这些场景叠加起来,实际长上下文任务成本可能比头价低 50%-70%——这是 Step 5 Preview 在 agent 负载上的真正杀手锏。
2.4 任务成本 $0.71 的算账
Artificial Analysis 给出的”每任务成本” $0.71 基于一个标准化的指数评测跑分。具体怎么算的:
task_cost = (input_price × input_tokens + output_price × output_tokens) / 任务数
实测中 Step 5 Preview 一次完整评测跑消耗了 ~$923(计算自”Step 5 Preview 用了 160M output tokens,output 占总成本 160M × $2.70 ≈ $432”)。一次评测任务约 $0.71 的成本在指数档模型里属于”低于中位数”水平。
注意:160M 输出 tokens 远高于市场参考中位数 92M——Step 5 Preview 是冗长型(verbose)模型。冗长 = 思考多 = 输出桶成本高。如果你的工作负载是”短答案 + 多轮”,Step 5 的成本优势更明显;如果是”单次长输出”,它相对其它模型的优势会被”输出 token 多 70%“抵消一部分。
三、能力:AA 智能指数 44 + Terminal-Bench 4.0 33.3%
3.1 Artificial Analysis 智能指数 v4.3.2
| 排名 | 模型 | 智能指数 |
|---|---|---|
| 1-23 | GPT-6 Astra / Claude Opus 5 high / Gemini 3.8 Pro / 等 | 45-58 |
| 24-27 | Step 5 Preview | 44 |
| 24-27 | Kimi K3 Max | 44 |
| 25 | GLM-5.3 | 45 |
| 28-30 | Claude Opus 5 medium reasoning | 44 |
Step 5 Preview 与 Kimi K3 Max 持平,比 Claude Opus 5 medium reasoning 持平,比 GLM-5.3 落后 1 分。
3.2 Terminal-Bench 4.0
| 模型 | Terminal-Bench 4.0 |
|---|---|
| Step 5 Preview | 33.3% |
| DeepSeek V4.1 Flash | 26.8% |
| Kimi K3 | 12.6% |
TB 4.0 33.3% 在当前 frontier 档里显著超过 DeepSeek V4.1 Flash 和 Kimi K3——这是 StepFun 把 Step 5 Preview 定位为”agent 工作负载模型”的硬指标支撑。
3.3 这意味着什么
- 不是 SOTA:智能指数 44 不是 frontier 顶端。但作为”低于 SOTA 一档、价格降到 1/3”的工程选项,它重新定义 Pareto frontier——这是 Orcarouter 标题里”Advancing the Pareto Frontier”的真实含义;
- agent 负载友好:TB 4.0 33.3% + 长上下文 1M + 95% 缓存折扣,三者叠加在 agent 工作负载上是结构性的优势;
- 冗长是 feature:Agent 工具调用本身就需要”输出 token 多”——Step 5 的冗长在 agent 场景下恰好合适,但在”短答案”场景下会浪费钱。
四、开源权重的悬念:HF 仓库已开,BF16 还在路上
StepFun 在 9/20 同步声明:“模型将在 10 月 15 日以开源权重发布”。
但截至 9/20 公告当天,Hugging Face 仓库 stepfun-ai/Step-5-Preview-BF16 已经创建,只包含一个 .gitattributes 文件——没有权重、没有 license、没有 model card、没有 config。
这意味着:
- API 与权重是两个独立 release——API 已经在 9/20 可以调用,权重要等 25 天;
- BF16 是公开承诺的精度——仓库名直接叫
Step-5-Preview-BF16,StepFun 已经锚定会放出 bfloat16 精度的权重(不是 FP32、不是量化版); - license 待定——license 文件还不存在,业内最可能是 MIT / Apache 2.0;
- 提前锁定 HF 命名——避免其他厂商抢注”Step-5”或混淆命名。
为什么 StepFun 要这么做:开源权重意味着”任何厂商都可以下载 BF16 推理”,等于把定价权让给了整个生态。但 StepFun 同时通过 API 收取”闭源推理”溢价——这是一种**“开源 + 闭源双轨”**商业模式,与 Meta 的 Llama 策略(开源主力 + API 增值)类似,与 Mistral 的 Mixtral(仅 API 闭源)相反。
对独立开发者的含义:
- 9/20 ~ 10/14:只能走 StepFun 的官方 API(或经 StepFun 授权的 NixAPI 这类聚合层);
- 10/15 之后:可以直接下载 BF16 权重自托管——这意味着私有部署 / 私有云推理成为可能,对数据敏感型客户(金融、医疗、法律)尤其重要;
- 商业模式影响:StepFun 的 API 收入将与”开源权重 + 自托管”的部署成本做竞争——Step 5 Preview API 必须持续提供比自托管更便宜 + 更好维护的价值(推理优化、版本更新、合规认证),否则会被替代。
五、NixAPI 视角:今天能做什么、10/15 后该改什么
5.1 今天(9/20 ~ 10/14):走 API
step-5-preview 已经在 NixAPI 这类聚合 API 平台上线(参照已有笔调对 Gemini 3.8 Flash、DeepSeek V4 Pro 的接入方式)。可以在统一接口下用:
# 通过 NixAPI 调用 Step 5 Preview
curl https://nixapi.com/v1/chat/completions \
-H "Authorization: Bearer ***" \
-H "Content-Type: """
-d '{
"model": "stepfun/step-5-preview",
"messages": [{"role": "user", "content": "重构这个 Python 模块并跑测试。"}]
}'
业务代码几行都不用动——从stepfun/step-3.7-flash升级到 stepfun/step-5-preview只是改字段。
5.2 10/15 之后:考虑自托管
| 部署选项 | 适用场景 | 成本 |
|---|---|---|
| StepFun 官方 API | 中等量、长上下文 agent | $1/$2.70 + 95% 缓存折扣 |
| BF16 自托管(H100/H200) | 大流量、数据敏感 | GPU 一次性 + 推理 ops |
| BF16 自托管(DeepSeek V3 风格 8×H20) | 极致成本控制 | 需要深度定制 + MoE 推理框架 |
| NixAPI 聚合 + 智能路由 | 灵活切模型 | 按需计费 |
H100/H200 单卡 BF16 推理 600B MoE 不可行——600B 模型即使只激活 27B,单卡 BF16 推理需要至少 4×8 H100 集群。真正的自托管最低门槛是 8×H100 / 4×H200——按 H100 月租约 $3/小时、4 卡 24/7 跑满,每月约 $8,640。这只在日均 token 消耗 >= 100M 时才有性价比。
5.3 业务侧立即可做的事
- 跑对照实验:用同一个 agent benchmark(建议用 SWE-Bench Verified 或 Terminal-Bench 4.0)对比 Step 5 Preview vs 你当前默认模型——评估”输出冗长”的真实代价;
- 检查你的缓存命中率:在 NixAPI 后台看过去 30 天的 cache hit rate——如果 > 50%,Step 5 Preview 的 95% 折扣对你的成本影响极大;
- 设计降级路径:把 Step 5 Preview 作为”高负载默认模型”,把 DeepSeek V4 Pro / Gemini 3.8 Flash 作为”短答案降级模型”——按 prompt 长度 / 任务类型动态切换;
- 关注 10/15 权重 release:订阅 NixAPI Radar(nixapi.com/blog),第一时间拿到 BF16 权重 + license 细节。
六、对独立开发者的实操建议
6.1 如果你在做 agent / 长上下文工作负载
- 直接用 Step 5 Preview——AA 智能指数 44 + TB 4.0 33.3% + 1M ctx + 95% 缓存折扣,是当前 frontier 档下”agent 友好度”最高的组合之一;
- 预算按”输出桶”算账——Step 5 是 verbose 模型,160M output / 评测跑说明它”思考多”;如果你的工作流是”读 100K prompt → 输出 10K 答案”,$2.70 × 10K = $27/M 任务的输出成本是主项;
- 缓存命中率 > 70% 时切换价值最高——长 prompt + 多轮 agent 的典型场景。
6.2 如果你在做短答案 / 高频 API 调用
- Step 5 不是最优选——DeepSeek V4 Pro $0.435/$0.87、Step 3.7 Flash $0.20/$1.15、Step 3.5 Flash $0.10/$0.30 都是更便宜的”短答案”选项;
- Step 5 适合”重推理 + 短输入”——例如”读 50K 法律条款 → 回答 yes/no + 解释”这种 agent;
- 保持 Step 3.7 Flash / DeepSeek V4 Pro 作为默认,只在”必须更聪明”时切换到 Step 5。
6.3 如果你在做成本敏感的开源 / 自托管
- 等 10/15——BF16 权重 + MIT/Apache license + 600B/27B MoE 的组合,等于”你自建推理基础设施”的开端;
- 评估你能不能跑得起——BF16 600B 需要至少 4×H200 / 8×H100 / 16×A100-80G 集群;
- 可以先用 Step 3.5 Flash / 3.7 Flash 跑通自托管流程——它们已经是开源 + 体积小(~50B / ~100B),Step 5 是 10/15 后的目标。
6.4 三件立即可做的事(无论你在做什么)
- 加
model字段到你的产品配置层——即便现在用 Step 3.7 Flash / DeepSeek V4 Pro,未来切换到stepfun/step-5-preview时只改字段值; - 跟踪 10/15 开源权重 release——订阅 NixAPI Radar(nixapi.com/blog),第一时间拿到 BF16 + license + deployment guide;
- 重新审视”agent 闭环”是否依赖低 IQ——很多”agent 卡壳”问题本质是 base 模型 IQ 不够。Step 5 Preview 44 的智能指数可能就是解锁你当前卡壳场景的钥匙。
七、结论
Step 5 Preview 是 2026 年 9 月最重要的模型发布之一——不是因为它的能力最强(智能指数 44,不是 SOTA),而是因为它用 4.5% 稀疏比的极限工程,把 frontier 档的边际成本压到了 1/3 市场参考中位数。
- 架构偏置:600B / 27B = 4.5% 激活比,比主流 MoE 还要稀疏;
- 价格重击:输出 $2.70 是市场参考中位数的 27%,是 GPT-5.6 Sol 的 1/7;
- agent 友好:TB 4.0 33.3% + 1M ctx + 95% 缓存折扣,三者叠加是当前 agent 负载的最佳组合之一;
- 开源悬念:HF 仓库已开但只有
.gitattributes,10/15 才放 BF16——等待本身就是一个商业信号。
对独立开发者来说,9/20 ~ 10/14 是 API 红利窗口——先用 NixAPI 这类聚合通道以 $1/$2.70/95% 折扣跑业务;10/15 之后评估自托管,把”开源 BF16”纳入你的成本结构。
Step 5 的故事才刚开始。我们会持续在 NixAPI Radar 更新 10/15 权重 release、license 细节、benchmark 表现、以及对出海开发者的部署策略。
相关阅读 / 来源引用
- StepFun 官方公告 — stepfun.com/step-5-preview
- Artificial Analysis 模型页 — artificialanalysis.ai/models/step-5
- Artificial Analysis 提供商对比 — artificialanalysis.ai/models/step-5/providers
- Orcarouter 技术拆解 — orcarouter.ai/blog/step-5-preview-open-weights
- mlllm.io 报道 — mlllm.io/articles/3240-stepfun-releases-step-5-preview-reasoning-model
- Runtimewire 报道 — runtimewire.com/article/stepfun-step-5-preview-600b-agent-model-pricing
- AI Weekly 简报 — aiweekly.co/alerts/stepfun-ships-step-5-preview-api
- Eyestech Systems Lab 分析 — eyestech.in/stepfun-step-5-preview-pareto-frontier-moe-analysis
- NixAPI 支持模型与价格 · NixAPI API 文档 · NixAPI 控制台