StepFun Step 5 Preview 拆解:600B 稀疏 MoE 旗舰模型,$1 / $2.70 per MTok 的极致性价比如何重写 9 月 API 价格战

2026 年 9 月 20 日,StepFun 发布 Step 5 Preview——600B 参数稀疏 MoE,每 token 仅激活 27B,1M 上下文 + 原生视觉输入,Artificial Analysis 智能指数 44(与 Kimi K3 Max 持平)。API 输入 $1、输出 $2.70 per MTok,95% 缓存折扣,10 月 15 日开源权重。本文从架构、定价、benchmark、市场定位、与对出海开发者的影响五个维度做深度拆解。

NixAPI Team 2026年9月21日 约27 分钟阅读
StepFun Step 5 Preview 600B MoE 旗舰模型 API 拆解

2026 年 9 月 20 日,中国 AI 公司 StepFun 正式发布 Step 5 Preview API——一款 600B 参数稀疏 MoE 旗舰,每 token 仅激活 27B,原生视觉输入 + 1M token 上下文,Artificial Analysis 智能指数 44(与 Kimi K3 Max 持平)。

更让业界的玩家警觉的是它的定价:

  • 输入 $1.00 / MTok
  • 输出 $2.70 / MTok
  • 缓存命中 $0.05 / MTok(95% 折扣)
  • 任务成本 $0.71(Artificial Analysis 实测平均)

按 Artificial Analysis 给出的”可比能力档”市场参考中位数(输入 $1.88、输出 $10),Step 5 Preview 的输出价是 市场参考中位数的 1/3.7——而输入价仍只有中位数的 53%。

这是一次**“用极致稀疏 MoE 压低边际成本”的工程胜利,也是一次”价格战升级到’1/7 GPT-5.6 Sol’“**的市场重击。

本文从五个维度拆解它:

  1. 架构:为什么 600B / 27B 这种 4.5% 的稀疏比是反常的”工程偏置”;
  2. 定价:$1 / $2.70 / 95% 折扣的算账逻辑,与 9 月价格战的并联;
  3. 能力:AA 智能指数 44、Terminal-Bench 4.0 33.3%,为什么它叫”配得上 frontier”;
  4. 开源权重的悬念:HF 仓库已开但只有 .gitattributes,10/15 才会放 BF16;
  5. NixAPI 接入策略:今天能做什么、10/15 后该改什么。

一、架构:600B 总参 / 27B 激活,4.5% 稀疏比为什么”反常稀疏”

Step 5 Preview 是一个稀疏 Mixture-of-Experts 架构,StepFun 官方给出的核心参数:

项目数值
总参数600B
每 token 激活27B
激活比例4.5%
上下文窗口1M token
模态文本 + 原生视觉输入
定位软件工程 + 专业知识工作 + 金融

横向看 4.5% 的激活比反常稀疏。当前主流 MoE 的激活比通常在 8%-15% 之间(GPT-OSS-120B ~ 5B/117B = 4.3% 是异类,Mixtral 8x7B ~ 13B/47B = 28%、DeepSeek V4 Pro 公开数据约 8%)。

稀疏比越低,单 token 推理算力越低,理论上单位 Inference 的边际成本越低——这是 Step 5 Preview 能把输出价定到 $2.70 的底层支撑。

但稀疏比越低,对路由机制(router)的设计要求越高:路由错一个专家,结果就崩。StepFun 把激活比压到 4.5%,意味着他们的路由器必须做对 95% 以上的概率决策——这是 moe-experts 之外最具挑战的工程点。

Orcarouter 报道中有一个数字值得注意:输出速度 99.8 tokens/s、TTFT 2.96 秒。这两个数据说明 Step 5 Preview 的推理栈已经工程化到能跑长 agent 循环——一个 agent loop 跑 40 轮、每轮 5K tokens 的代码 diff 修改,在 Step 5 上不会因为延迟让 agent 卡壳。


二、定价:$1 / $2.70 / 95% 折扣的算账逻辑

2.1 价格对比表

模型输入 / MTok输出 / MTok缓存输入备注
Step 5 Preview(StepFun)$1.00$2.70$0.0595% 折扣
Step 3.7 Flash(StepFun)$0.20$1.15$0.04上一代 flash
Step 3.5 Flash(StepFun)$0.10$0.30$0.02再上一代 flash
GPT-6 Astra(OpenAI)$10.00$50.00$1.00旗舰
GPT-5.6 Sol(OpenAI)$4.00$20.00$0.40上代旗舰
Claude Fable 5.1(Anthropic)$10.00$50.00$0.25旗舰
Gemini 3.8 Flash(Google)$0.75$3.75$0.075年终促销
DeepSeek V4 Pro 0813(DeepSeek)$0.435$0.87$0.0036现金价
Claude Sonnet 5(Anthropic)$2.00$10.00—中端

2.2 与”可比能力档”的中位数对比

Artificial Analysis 把同档模型的市场参考中位数定为:输入 $1.88、输出 $10.00。

维度中位数Step 5 Preview比例
输入$1.88$1.0053%
输出$10.00$2.7027%
缓存命中不可见$0.05(隐含 ~95% off)

输出价 27% 的水平意味着 Step 5 Preview 比 DeepSeek V4 Pro 之外的所有同类模型都便宜——只有 DeepSeek V4 Pro 的 $0.87 比它低(DeepSeek 在”绝对低价”上有结构性峰谷优势)。

2.3 95% 缓存折扣的工程含义

Step 5 Preview 的 cache-hit 价格是 $0.05 / MTok——比 cache-miss 价 $1.00 折扣 95%。这意味着什么?

  • Agent loop:同一个 code base + 同一个 system prompt 在 40 轮对话里反复出现,命中率可能到 80%-90%;
  • RAG 重写:同一个 knowledge base 在多次重写时反复命中;
  • 代码库级任务:对一个 git repo 做多轮审查 → 累计命中率 60%+ 是常态。

把这些场景叠加起来,实际长上下文任务成本可能比头价低 50%-70%——这是 Step 5 Preview 在 agent 负载上的真正杀手锏。

2.4 任务成本 $0.71 的算账

Artificial Analysis 给出的”每任务成本” $0.71 基于一个标准化的指数评测跑分。具体怎么算的:

task_cost = (input_price × input_tokens + output_price × output_tokens) / 任务数

实测中 Step 5 Preview 一次完整评测跑消耗了 ~$923(计算自”Step 5 Preview 用了 160M output tokens,output 占总成本 160M × $2.70 ≈ $432”)。一次评测任务约 $0.71 的成本在指数档模型里属于”低于中位数”水平。

注意:160M 输出 tokens 远高于市场参考中位数 92M——Step 5 Preview 是冗长型(verbose)模型。冗长 = 思考多 = 输出桶成本高。如果你的工作负载是”短答案 + 多轮”,Step 5 的成本优势更明显;如果是”单次长输出”,它相对其它模型的优势会被”输出 token 多 70%“抵消一部分。


三、能力:AA 智能指数 44 + Terminal-Bench 4.0 33.3%

3.1 Artificial Analysis 智能指数 v4.3.2

排名模型智能指数
1-23GPT-6 Astra / Claude Opus 5 high / Gemini 3.8 Pro / 等45-58
24-27Step 5 Preview44
24-27Kimi K3 Max44
25GLM-5.345
28-30Claude Opus 5 medium reasoning44

Step 5 Preview 与 Kimi K3 Max 持平,比 Claude Opus 5 medium reasoning 持平,比 GLM-5.3 落后 1 分。

3.2 Terminal-Bench 4.0

模型Terminal-Bench 4.0
Step 5 Preview33.3%
DeepSeek V4.1 Flash26.8%
Kimi K312.6%

TB 4.0 33.3% 在当前 frontier 档里显著超过 DeepSeek V4.1 Flash 和 Kimi K3——这是 StepFun 把 Step 5 Preview 定位为”agent 工作负载模型”的硬指标支撑。

3.3 这意味着什么

  • 不是 SOTA:智能指数 44 不是 frontier 顶端。但作为”低于 SOTA 一档、价格降到 1/3”的工程选项,它重新定义 Pareto frontier——这是 Orcarouter 标题里”Advancing the Pareto Frontier”的真实含义;
  • agent 负载友好:TB 4.0 33.3% + 长上下文 1M + 95% 缓存折扣,三者叠加在 agent 工作负载上是结构性的优势;
  • 冗长是 feature:Agent 工具调用本身就需要”输出 token 多”——Step 5 的冗长在 agent 场景下恰好合适,但在”短答案”场景下会浪费钱。

四、开源权重的悬念:HF 仓库已开,BF16 还在路上

StepFun 在 9/20 同步声明:“模型将在 10 月 15 日以开源权重发布”。

但截至 9/20 公告当天,Hugging Face 仓库 stepfun-ai/Step-5-Preview-BF16 已经创建,只包含一个 .gitattributes 文件——没有权重、没有 license、没有 model card、没有 config。

这意味着:

  1. API 与权重是两个独立 release——API 已经在 9/20 可以调用,权重要等 25 天;
  2. BF16 是公开承诺的精度——仓库名直接叫 Step-5-Preview-BF16,StepFun 已经锚定会放出 bfloat16 精度的权重(不是 FP32、不是量化版);
  3. license 待定——license 文件还不存在,业内最可能是 MIT / Apache 2.0;
  4. 提前锁定 HF 命名——避免其他厂商抢注”Step-5”或混淆命名。

为什么 StepFun 要这么做:开源权重意味着”任何厂商都可以下载 BF16 推理”,等于把定价权让给了整个生态。但 StepFun 同时通过 API 收取”闭源推理”溢价——这是一种**“开源 + 闭源双轨”**商业模式,与 Meta 的 Llama 策略(开源主力 + API 增值)类似,与 Mistral 的 Mixtral(仅 API 闭源)相反。

对独立开发者的含义:

  • 9/20 ~ 10/14:只能走 StepFun 的官方 API(或经 StepFun 授权的 NixAPI 这类聚合层);
  • 10/15 之后:可以直接下载 BF16 权重自托管——这意味着私有部署 / 私有云推理成为可能,对数据敏感型客户(金融、医疗、法律)尤其重要;
  • 商业模式影响:StepFun 的 API 收入将与”开源权重 + 自托管”的部署成本做竞争——Step 5 Preview API 必须持续提供比自托管更便宜 + 更好维护的价值(推理优化、版本更新、合规认证),否则会被替代。

五、NixAPI 视角:今天能做什么、10/15 后该改什么

5.1 今天(9/20 ~ 10/14):走 API

step-5-preview 已经在 NixAPI 这类聚合 API 平台上线(参照已有笔调对 Gemini 3.8 Flash、DeepSeek V4 Pro 的接入方式)。可以在统一接口下用:

# 通过 NixAPI 调用 Step 5 Preview
curl https://nixapi.com/v1/chat/completions \
  -H "Authorization: Bearer ***" \
  -H "Content-Type: """
  -d '{
    "model": "stepfun/step-5-preview",
    "messages": [{"role": "user", "content": "重构这个 Python 模块并跑测试。"}]
  }'

业务代码几行都不用动——从stepfun/step-3.7-flash升级到 stepfun/step-5-preview只是改字段。

5.2 10/15 之后:考虑自托管

部署选项适用场景成本
StepFun 官方 API中等量、长上下文 agent$1/$2.70 + 95% 缓存折扣
BF16 自托管(H100/H200)大流量、数据敏感GPU 一次性 + 推理 ops
BF16 自托管(DeepSeek V3 风格 8×H20)极致成本控制需要深度定制 + MoE 推理框架
NixAPI 聚合 + 智能路由灵活切模型按需计费

H100/H200 单卡 BF16 推理 600B MoE 不可行——600B 模型即使只激活 27B,单卡 BF16 推理需要至少 4×8 H100 集群。真正的自托管最低门槛是 8×H100 / 4×H200——按 H100 月租约 $3/小时、4 卡 24/7 跑满,每月约 $8,640。这只在日均 token 消耗 >= 100M 时才有性价比。

5.3 业务侧立即可做的事

  1. 跑对照实验:用同一个 agent benchmark(建议用 SWE-Bench Verified 或 Terminal-Bench 4.0)对比 Step 5 Preview vs 你当前默认模型——评估”输出冗长”的真实代价;
  2. 检查你的缓存命中率:在 NixAPI 后台看过去 30 天的 cache hit rate——如果 > 50%,Step 5 Preview 的 95% 折扣对你的成本影响极大;
  3. 设计降级路径:把 Step 5 Preview 作为”高负载默认模型”,把 DeepSeek V4 Pro / Gemini 3.8 Flash 作为”短答案降级模型”——按 prompt 长度 / 任务类型动态切换;
  4. 关注 10/15 权重 release:订阅 NixAPI Radar(nixapi.com/blog),第一时间拿到 BF16 权重 + license 细节。

六、对独立开发者的实操建议

6.1 如果你在做 agent / 长上下文工作负载

  • 直接用 Step 5 Preview——AA 智能指数 44 + TB 4.0 33.3% + 1M ctx + 95% 缓存折扣,是当前 frontier 档下”agent 友好度”最高的组合之一;
  • 预算按”输出桶”算账——Step 5 是 verbose 模型,160M output / 评测跑说明它”思考多”;如果你的工作流是”读 100K prompt → 输出 10K 答案”,$2.70 × 10K = $27/M 任务的输出成本是主项;
  • 缓存命中率 > 70% 时切换价值最高——长 prompt + 多轮 agent 的典型场景。

6.2 如果你在做短答案 / 高频 API 调用

  • Step 5 不是最优选——DeepSeek V4 Pro $0.435/$0.87、Step 3.7 Flash $0.20/$1.15、Step 3.5 Flash $0.10/$0.30 都是更便宜的”短答案”选项;
  • Step 5 适合”重推理 + 短输入”——例如”读 50K 法律条款 → 回答 yes/no + 解释”这种 agent;
  • 保持 Step 3.7 Flash / DeepSeek V4 Pro 作为默认,只在”必须更聪明”时切换到 Step 5。

6.3 如果你在做成本敏感的开源 / 自托管

  • 等 10/15——BF16 权重 + MIT/Apache license + 600B/27B MoE 的组合,等于”你自建推理基础设施”的开端;
  • 评估你能不能跑得起——BF16 600B 需要至少 4×H200 / 8×H100 / 16×A100-80G 集群;
  • 可以先用 Step 3.5 Flash / 3.7 Flash 跑通自托管流程——它们已经是开源 + 体积小(~50B / ~100B),Step 5 是 10/15 后的目标。

6.4 三件立即可做的事(无论你在做什么)

  1. 加 model 字段到你的产品配置层——即便现在用 Step 3.7 Flash / DeepSeek V4 Pro,未来切换到 stepfun/step-5-preview 时只改字段值;
  2. 跟踪 10/15 开源权重 release——订阅 NixAPI Radar(nixapi.com/blog),第一时间拿到 BF16 + license + deployment guide;
  3. 重新审视”agent 闭环”是否依赖低 IQ——很多”agent 卡壳”问题本质是 base 模型 IQ 不够。Step 5 Preview 44 的智能指数可能就是解锁你当前卡壳场景的钥匙。

七、结论

Step 5 Preview 是 2026 年 9 月最重要的模型发布之一——不是因为它的能力最强(智能指数 44,不是 SOTA),而是因为它用 4.5% 稀疏比的极限工程,把 frontier 档的边际成本压到了 1/3 市场参考中位数。

  • 架构偏置:600B / 27B = 4.5% 激活比,比主流 MoE 还要稀疏;
  • 价格重击:输出 $2.70 是市场参考中位数的 27%,是 GPT-5.6 Sol 的 1/7;
  • agent 友好:TB 4.0 33.3% + 1M ctx + 95% 缓存折扣,三者叠加是当前 agent 负载的最佳组合之一;
  • 开源悬念:HF 仓库已开但只有 .gitattributes,10/15 才放 BF16——等待本身就是一个商业信号。

对独立开发者来说,9/20 ~ 10/14 是 API 红利窗口——先用 NixAPI 这类聚合通道以 $1/$2.70/95% 折扣跑业务;10/15 之后评估自托管,把”开源 BF16”纳入你的成本结构。

Step 5 的故事才刚开始。我们会持续在 NixAPI Radar 更新 10/15 权重 release、license 细节、benchmark 表现、以及对出海开发者的部署策略。


相关阅读 / 来源引用

  • StepFun 官方公告 — stepfun.com/step-5-preview
  • Artificial Analysis 模型页 — artificialanalysis.ai/models/step-5
  • Artificial Analysis 提供商对比 — artificialanalysis.ai/models/step-5/providers
  • Orcarouter 技术拆解 — orcarouter.ai/blog/step-5-preview-open-weights
  • mlllm.io 报道 — mlllm.io/articles/3240-stepfun-releases-step-5-preview-reasoning-model
  • Runtimewire 报道 — runtimewire.com/article/stepfun-step-5-preview-600b-agent-model-pricing
  • AI Weekly 简报 — aiweekly.co/alerts/stepfun-ships-step-5-preview-api
  • Eyestech Systems Lab 分析 — eyestech.in/stepfun-step-5-preview-pareto-frontier-moe-analysis
  • NixAPI 支持模型与价格 · NixAPI API 文档 · NixAPI 控制台

立即体验 NixAPI

稳定可靠的大语言模型 API 中转,支持 OpenAI、Claude、Gemini、DeepSeek、Qwen、Grok,充值 ¥0.8 = $1

免费注册