---
url: /lm/step-5/introduction.md
description: >-
  Step 5 Preview 是阶跃星辰（StepFun）于 2026 年 9 月 20 日发布的旗舰基座模型，稀疏 MoE 总参数 600B、每
  token 仅激活 27B，1M 上下文，原生支持文本/图片/视频输入，官方定价 7 元/百万输入、20 元/百万输出，权重将于 10 月 15
  日开源。Artificial Analysis Intelligence Index 44 分追平 Kimi K3，单任务成本约为 Claude Opus
  5 的八分之一，金融场景表现尤为突出。
---

# 认识 Step 5 Preview：6000 亿参数的模型，每次只醒过来 4.5%

先看一组数字，挺荒诞的。

一个模型有 **6000 亿个参数**，但每生成一个 token，只有 **270 亿个**被叫醒干活——**4.5%**。剩下 95.5% 躺着。

这不是偷懒，这是 2026 年旗舰模型最主流的省钱姿势。而阶跃星辰（StepFun）在 2026 年 9 月 20 日把这套姿势推到了一个新位置：**Step 5 Preview**。

更让我在意的是另外两件事。

第一，它**跳过了 Step 4.x**。产品线从 Step-3.7-Flash 直接跳到 Step 5，中间那一代连名字都没留下。厂商敢这么跳号，说明它自己认为这一步够大。

第二，官方发布页最后一行的措辞是——**"模型将于 10 月 15 日正式开源。"**

也就是说：\*\*今天能用，但拿不到。\*\*这两件事在 2026 年已经不是一回事了，后面我会专门说这个。

## 什么是 Step 5 Preview

**Step 5 Preview 是阶跃星辰（StepFun）于 2026 年 9 月 20 日发布的旗舰基座模型，采用稀疏 MoE 架构，总参数 600B、每个 token 激活 27B 参数，支持 1M Token 上下文窗口和视觉输入，重点面向 AI 编程、软件工程、专业知识工作与金融场景。**

官方对它的定性很克制，就一句话：**"面向真实世界 Agentic 任务的旗舰基座模型"**。

注意"真实世界"这三个字。它不是聊天模型，评价单位是**一件事有没有被推进到交付**，不是这一轮答得漂不漂亮。

把关键规格一次摆清楚（以下均为 [StepFun 官方文档](https://platform.stepfun.com/docs/zh/guides/models/step-5-preview)口径）：

| 项目 | 规格 |
|---|---|
| 模型 ID | `step-5-preview` |
| 架构 | 稀疏 MoE，总参数 600B / 激活 27B |
| 上下文窗口 | 1M tokens |
| 输入类型 | 文本、图片、视频 |
| 输出类型 | 文本 |
| 最大输入 | 1M tokens |
| 最大输出 | 64k tokens |
| 推理强度 | `low` / `medium` / `high` |
| 定价（人民币） | 输入 7 元/百万 token，缓存命中 0.35 元，输出 20 元 |
| 定价（国际口径） | $1.00 / $0.05 / $2.70 |
| 开源权重 | 官方称 2026 年 10 月 15 日 |

> 这里有个容易被骂的细节：**上下文 1M，但最大输出只有 64k。**
> "能吃进一百万 token"和"能吐出多少"是两件事，别看到 1M 就以为它能一口气给你写二十万字。

价格值得单独讲一句。7 元/百万输入，对比 Kimi K3 的 3 美元输入 / 15 美元输出，**输出价格差了五倍不止**。阶跃官方的说法是：**在相近智能水平下，它的单任务成本（Task Cost）明显更低**，约为 Claude Opus 5 的 **八分之一**、Kimi K3 的 **五分之一**。

## 它有什么特点

* **稀疏到 4.5%，这是它所有故事的源头。** 600B 决定能力上限，27B 决定单次推理成本。\*\*能力按大模型算，账单按小模型付。\*\*阶跃把这叫"智能效率的新一代帕累托前沿"——说人话就是：**在"多聪明"和"多贵"这两个都要的图上，它想站在那条最外沿的线上。**

* **Artificial Analysis Intelligence Index 44 分，追平 Kimi K3。** 这是目前**唯一一个由第三方实测**的分数（AA 明确标注为 measured），比厂商自报的可信度高一档。44 分在 200 个模型里排第 24 位，与 Kimi K3 持平、只落后 GLM-5.3 一分。

* **官方把一整张对比表贴出来了，赢的输的都在。** 这张表我建议你认真看（数据来自 StepFun 官方发布页）：

| 基准 | Step 5 Preview (High) | GLM-5.3 (Max) | Kimi K3 (Max) | GPT-6 Astra (Max) | Claude Opus 5 (Max) |
|---|---|---|---|---|---|
| DeepSWE v1.1 | **67.7** | 66.9 | 67.5 | **74.1** | 74.0 |
| StepCodeBench † | 49.0 | 40.2 | 43.9 | 61.0 | **63.9** |
| ProgramBench | 80.5 | 72.0 | 77.8 | **85.4** | 82.3 |
| Terminal-Bench v4 | 33.3 | **41.9** | 12.6 | **57.9** | 52.3 |
| ALE-CLI | **29.5** | 28.6 | 27.6 | **33.3** | 28.6 |
| GDPval-AA v2.1 | 1566 | **1645** | 1524 | 1542 | **1708** |
| FrontierFinance | 66.4 | 64.1 | 62.6 | 55.0 | **69.7** |
| DRACO | 83.3 | 82.3 | 78.5 | 76.8 | **87.6** |
| GPQA Diamond | 93.5 | 91.7 | 93.5 | **96.1** | 93.2 |
| CyberGym | **84.7** | 84.5 | 80.0 | — | — |
| MMMU-Pro | 76.0 | — (纯文本) | 81.0 | **87.0** | 85.0 |

† 标记为官方内部自研基准。

画像一眼就出来了：\*\*在 Kimi K3 和 GLM-5.3 这条线上打平甚至局部超出，但离 GPT-6 Astra / Claude Opus 5 还有明显距离。\*\*尤其是 **Terminal-Bench v4 只有 33.3**，落后 GLM-5.3 的 41.9、Opus 5 的 52.3，连 Astra 的一半都不到——**终端里反复试错这类"最烧钱"的活，是它最弱的一块。**

> 我挺欣赏它把 Terminal-Bench v4 这一栏原样放上去的。
> 这个分数是它的痛点，也是**最影响实际账单的地方**：一个便宜但要多试三四轮才能干完的模型，和一个贵但一轮搞定的模型，哪个省钱是要算的，不是看单价就能得出的。

* **StepCodeBench 是它自己造的尺子，所以那 49.0 得打折看。** 覆盖 **553 个独立代码仓库、9 类任务、20 个应用领域、33 种编程语言**（从 Python、Rust 一直排到 Solidity、Zig、Assembly），评测设计参考产业需求和专家工作流轨迹。\*\*尺子本身很专业，问题是量自己的尺子，天然该打个问号。\*\*真要看软件工程能力，我更信 DeepSWE v1.1 的 67.7（第三方基准，SWE-agent harness）。

* **长程执行是它真正想卖的东西，而且给了可复现的实验。** 三个案例，一个比一个离谱：

  * **24 小时优化 MLA GPU Kernel**：单张 H100，Head Dim 512 / Batch 1 / 64 Heads / 8192 Tokens，让它从零写并反复改。规则是"能跑但不如当前最优就放弃，从更优解往下搜"。**约 22 小时后达到前向+反向合计 508 TFLOPS**，是本次对比里的最高值（对比组含 Claude Opus 5）。
  * **24 小时优化后训练数据流程**：给它一个接生产数据的 API annotator，让它自己决定怎么调后训练数据，把 Qwen3-30B-A3B 在 AIME24 上从 **53.3% 提到 60%**——与 Claude Opus 5 持平，但**消耗的 annotator tokens 更少**。
  * **Bonus：宝可梦红**。不做任何专项优化的情况下，**连续 3000+ Turns、累计近 600 万 Token**，解锁「居合斩」，第 3082 步击败枯叶道馆馆主马志士拿到第三枚徽章，主线进度约三分之一（人类通关主线约需 26 小时）。

  > 600 万 token 打游戏打到第三枚徽章，这件事听起来像玩梗，但它测的其实是 Agent 最难的能力：**在很远的目标上持续记住前面的结果、管理资源、处理互相依赖的子任务，并在原计划走不通时改道。**
  > 这三个能力，和你让它"重构一个三十万行的老项目"是同一批能力。

* **金融是这次单独拎出来重点讲的领域，而且分数确实能打。** FrontierFinance（第三方，6 类投资场景、220 道专家题、11,543 项评估标准）**66.4 分**，超过 GLM-5.3 的 64.1、DeepSeek V4.1 Flash 的 63.0、Kimi K3 的 62.6，仅次于 Claude Opus 5 的 69.7。官方另建了三项自研金融评测 **FinStepBench**（LiveSearch 74.5 / CorporateValuation 60.6 / DeepResearch 55.8），**考核重点不是"算对没有"，而是来源能否追溯、假设是否明确、计算能否复现**——这个取向我个人非常认同，金融分析里一个不能复现的正确数字，价值约等于零。

* **多模态是原生的，但文档类偏弱。** 支持文本+图片+视频输入，单次最多 60 张图，视频走 URL / Base64 / `stepfile://`，MP4 单文件 <128MB、建议时长 <5 分钟。MMMU-Pro 76.0 不算突出，而 **GDP.pdf 只有 14.8%**（Opus 5 21.6%、Kimi K3 22.0%）——**长文档 PDF 理解是明确短板**，这个数在官方表里也是垫底级别的。

* **推理强度可调，`max_tokens` 默认不限制。** 支持 `low` / `medium` / `high` 三档（Chat Completions 用 `reasoning_effort`，Messages API 用 `output_config.effort`），`max_tokens` 默认为 `INF`，让模型自己决定输出多少。

  > 注意最后这条：**"默认不限制输出长度" + "输出 20 元/百万"** 组合起来，是有故事的。
  > 有第三方实测发现它跑完整套 Intelligence Index **用了 1.6 亿输出 token，而全部模型的中位数是 9200 万**——\*\*这模型有点话痨。\*\*单价便宜和总账便宜是两回事，上线前务必用你自己的 workload 压一遍。

## 用在哪儿

**金融研究与估值。** 这是官方最用力的一块，也是最像"能落地"的一块。官方 demo 里有一项**柴油附加费分析**：模型产出一个**包含 17 个 Sheet 的分析工作簿**，覆盖原始数据、跨序列核对、区域面板、公式和趋势模型，而且**底层数据、计算过程和最终结论之间的链条被完整保留**——覆盖范围、数据重叠、区域价格变化都能往下追，可以直接用于合同和采购复核。**"能追溯"这三个字，是金融 AI 从玩具变工具的分界线。**

**大规模资料研究。** 一项覆盖 **1,000 个地点、25 年跨度**的气候研究，模型在**一次 Agent Action 内完成 950 次 Web Fetch**，整理出横跨 **11 个变量、30 万条月度记录**的数据集，并分析出**欧洲和大洋洲样本的季节峰值月份落在一年中相反的时段**。这类"人干要三周、且极易出错"的活，是 1M 上下文 + 长程执行的正经用途。

**长程软件工程与硬件调试。** 官方给了个挺野的案例：在拿到开发文档和用户授权后，模型**直接调用相机、COM 端口、截图和模拟鼠标输入**，连续工作 **3 小时以上**做设备侧开发调试，根据设备反馈不断写、跑、改代码。这个场景以前基本只能靠人蹲在现场。

**3D 与交互式前端。** 不只会写前端代码，还能**调用 Blender 创建并反复调整 3D 资产**，再接进基于 Three.js 的交互应用和游戏。官方放了 Room Planner（一张卧室照片 → 可编辑 3D 空间 → 第一人称参观）、3D Flappy Bird、清明上河图等一组 demo。约 **70% 的评测者认为它能自主完成中高复杂度的 Coding 任务**（官方内部评测口径）。

**成本敏感的长上下文批处理。** 1M 上下文 + 缓存命中 0.35 元/百万，**对反复读取同一份长上下文的工作负载（长文档问答、代码库检索、批量分析）性价比很突出**。这也是它最稳的生态位。

**不适合的也要说**：**终端里反复试错的 Agent 循环**（Terminal-Bench v4 只有 33.3），**长 PDF 文档理解**（GDP.pdf 14.8%），以及**任何你现在就打算自托管的方案**——权重还没放。

## 初体验

三步走，五分钟内能跑通。

**第一步**：到 [StepFun 开放平台](https://platform.stepfun.com/) 创建 API Key。

**第二步**：直接用 OpenAI SDK，`base_url` 换成 `https://api.stepfun.com/v1`。

```python
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_STEP_API_KEY",
    base_url="https://api.stepfun.com/v1",
)

resp = client.chat.completions.create(
    model="step-5-preview",
    messages=[
        {"role": "user", "content": "读一下这份年报，列出三处口径不一致的地方，并给出来源位置。"}
    ],
    reasoning_effort="high",   # low / medium / high
    max_tokens=32768,
)
print(resp.choices[0].message.content)
```

**第三步**：想直接看效果不想写代码，去 [Studio](https://studio.stepfun.com/) 在浏览器里试；用 Claude Code 的话官方也[给了接入文档](https://platform.stepfun.com/docs/zh/step-plan/integrations/claude-code)。

**四个坑，提前说：**

一是**最大输出是 64k，不是 1M**。1M 指的是上下文窗口。长输出要自己分片。

二是**它是 Preview，不是 GA**。官方名字里就带着 Preview，别直接上生产核心链路。

三是**权重 10 月 15 日才开源，现在没有可以自托管的东西**。这点我要多说两句：网上出现过名为 `stepfun-ai/Step-5-Preview-BF16` 的仓库，各家报道对它"里面到底有没有权重"说法不一，**而且它没有 LICENSE、没有 model card，config 里的架构类名还写着 `step4` 和 `MMGPTStepRoboticsForCausalLM`**——一个从没公开发过的代号。\*\*在官方正式发布之前，别把它当成"已经开源了"。\*\*任何"10 月中旬前自托管 Step 5"的计划，目前背后是没有可靠产物的。

四是**前面提过的话痨问题**。单价便宜不等于总账便宜，第三方实测它的输出 token 用量明显高于中位数。**上线前用你自己的 workload 跑一遍真实账单**，别只看单价。

## 进阶

如果这篇文章你只记住一件事，我希望是这个判断：

**2026 年旗舰模型的竞争坐标，已经从"谁分高"换成了"单位智能成本"。**

Step 5 Preview 的 44 分不是全球第一，甚至不是国产第一。它真正的动作是：**用 4.5% 的激活比例，把"接近前沿的智能"塞进一个远低于前沿的价格带里，然后告诉市场——够用且便宜，本身就是一个生态位。**

当 Kimi、GLM、DeepSeek、阶跃都在 40 分这个区间挤成一团时，**决定谁能被大规模调用的，就不再是那 1 分的差距，而是每一百万 token 多少钱、每一件任务总共要烧多少 token。**

冷水照例要泼，而且这次要泼准：

**官方那张表里，标注 † 的三项（StepCodeBench、StepCode-Bench-Daily/General、FinStepBench 系列）全是自研基准，量自己的尺子。**目前**由第三方独立实测的，基本只有 Artificial Analysis 的 44 分以及 GDPval-AA v2.1**。而传播最广的那个 DeepSWE v1.1 **67.7%，是厂商在自家 harness 上跑的**——自报分数和实测分数不是同一种证据。**请用不同的信任等级去看它们。**

另外，**Terminal-Bench v4 的 33.3 是一个真问题，不是可以忽略的细节。**终端类任务恰恰是 Coding Agent 烧预算最狠的地方，一个便宜模型如果每单任务要多试三轮，省下来的单价会被轮次吃掉。**"八分之一成本"这个说法的前提，是它一轮就能干完。**

我的建议很具体：\*\*如果你手上有长文档、多材料、需要交叉核对的分析类任务（财报、研报、尽调、竞品），拿它跑一批，重点看两件事——结论能不能追溯到原文位置，以及一个任务总共烧了多少输出 token。\*\*这两件事，才是决定它值不值那个价的真指标。

再往深一层，我更推荐你去读官方发布页里**那两个 24 小时实验**（MLA Kernel 508 TFLOPS、AIME24 53.3%→60%）的完整过程。\*\*同一个模型干这两件完全不同的事，靠的是同一批能力：长程记忆、反馈理解、自我放弃次优解。\*\*这批能力现在正在从"模型能力评测项"变成"模型能不能干活的分水岭"。

更多开源技术干货和学习资料，关注公众号「遇码」，领取专属福利。
