Skip to content

认识 Step 5 Preview:6000 亿参数的模型,每次只醒过来 4.5%

先看一组数字,挺荒诞的。

一个模型有 6000 亿个参数,但每生成一个 token,只有 270 亿个被叫醒干活——4.5%。剩下 95.5% 躺着。

这不是偷懒,这是 2026 年旗舰模型最主流的省钱姿势。而阶跃星辰(StepFun)在 2026 年 9 月 20 日把这套姿势推到了一个新位置:Step 5 Preview

更让我在意的是另外两件事。

第一,它跳过了 Step 4.x。产品线从 Step-3.7-Flash 直接跳到 Step 5,中间那一代连名字都没留下。厂商敢这么跳号,说明它自己认为这一步够大。

第二,官方发布页最后一行的措辞是——"模型将于 10 月 15 日正式开源。"

也就是说:**今天能用,但拿不到。**这两件事在 2026 年已经不是一回事了,后面我会专门说这个。

什么是 Step 5 Preview

Step 5 Preview 是阶跃星辰(StepFun)于 2026 年 9 月 20 日发布的旗舰基座模型,采用稀疏 MoE 架构,总参数 600B、每个 token 激活 27B 参数,支持 1M Token 上下文窗口和视觉输入,重点面向 AI 编程、软件工程、专业知识工作与金融场景。

官方对它的定性很克制,就一句话:"面向真实世界 Agentic 任务的旗舰基座模型"

注意"真实世界"这三个字。它不是聊天模型,评价单位是一件事有没有被推进到交付,不是这一轮答得漂不漂亮。

把关键规格一次摆清楚(以下均为 StepFun 官方文档口径):

项目规格
模型 IDstep-5-preview
架构稀疏 MoE,总参数 600B / 激活 27B
上下文窗口1M tokens
输入类型文本、图片、视频
输出类型文本
最大输入1M tokens
最大输出64k tokens
推理强度low / medium / high
定价(人民币)输入 7 元/百万 token,缓存命中 0.35 元,输出 20 元
定价(国际口径)$1.00 / $0.05 / $2.70
开源权重官方称 2026 年 10 月 15 日

这里有个容易被骂的细节:上下文 1M,但最大输出只有 64k。 "能吃进一百万 token"和"能吐出多少"是两件事,别看到 1M 就以为它能一口气给你写二十万字。

价格值得单独讲一句。7 元/百万输入,对比 Kimi K3 的 3 美元输入 / 15 美元输出,输出价格差了五倍不止。阶跃官方的说法是:在相近智能水平下,它的单任务成本(Task Cost)明显更低,约为 Claude Opus 5 的 八分之一、Kimi K3 的 五分之一

它有什么特点

  • 稀疏到 4.5%,这是它所有故事的源头。 600B 决定能力上限,27B 决定单次推理成本。**能力按大模型算,账单按小模型付。**阶跃把这叫"智能效率的新一代帕累托前沿"——说人话就是:在"多聪明"和"多贵"这两个都要的图上,它想站在那条最外沿的线上。

  • Artificial Analysis Intelligence Index 44 分,追平 Kimi K3。 这是目前唯一一个由第三方实测的分数(AA 明确标注为 measured),比厂商自报的可信度高一档。44 分在 200 个模型里排第 24 位,与 Kimi K3 持平、只落后 GLM-5.3 一分。

  • 官方把一整张对比表贴出来了,赢的输的都在。 这张表我建议你认真看(数据来自 StepFun 官方发布页):

基准Step 5 Preview (High)GLM-5.3 (Max)Kimi K3 (Max)GPT-6 Astra (Max)Claude Opus 5 (Max)
DeepSWE v1.167.766.967.574.174.0
StepCodeBench †49.040.243.961.063.9
ProgramBench80.572.077.885.482.3
Terminal-Bench v433.341.912.657.952.3
ALE-CLI29.528.627.633.328.6
GDPval-AA v2.115661645152415421708
FrontierFinance66.464.162.655.069.7
DRACO83.382.378.576.887.6
GPQA Diamond93.591.793.596.193.2
CyberGym84.784.580.0
MMMU-Pro76.0— (纯文本)81.087.085.0

† 标记为官方内部自研基准。

画像一眼就出来了:**在 Kimi K3 和 GLM-5.3 这条线上打平甚至局部超出,但离 GPT-6 Astra / Claude Opus 5 还有明显距离。**尤其是 Terminal-Bench v4 只有 33.3,落后 GLM-5.3 的 41.9、Opus 5 的 52.3,连 Astra 的一半都不到——终端里反复试错这类"最烧钱"的活,是它最弱的一块。

我挺欣赏它把 Terminal-Bench v4 这一栏原样放上去的。 这个分数是它的痛点,也是最影响实际账单的地方:一个便宜但要多试三四轮才能干完的模型,和一个贵但一轮搞定的模型,哪个省钱是要算的,不是看单价就能得出的。

  • StepCodeBench 是它自己造的尺子,所以那 49.0 得打折看。 覆盖 553 个独立代码仓库、9 类任务、20 个应用领域、33 种编程语言(从 Python、Rust 一直排到 Solidity、Zig、Assembly),评测设计参考产业需求和专家工作流轨迹。**尺子本身很专业,问题是量自己的尺子,天然该打个问号。**真要看软件工程能力,我更信 DeepSWE v1.1 的 67.7(第三方基准,SWE-agent harness)。

  • 长程执行是它真正想卖的东西,而且给了可复现的实验。 三个案例,一个比一个离谱:

    • 24 小时优化 MLA GPU Kernel:单张 H100,Head Dim 512 / Batch 1 / 64 Heads / 8192 Tokens,让它从零写并反复改。规则是"能跑但不如当前最优就放弃,从更优解往下搜"。约 22 小时后达到前向+反向合计 508 TFLOPS,是本次对比里的最高值(对比组含 Claude Opus 5)。
    • 24 小时优化后训练数据流程:给它一个接生产数据的 API annotator,让它自己决定怎么调后训练数据,把 Qwen3-30B-A3B 在 AIME24 上从 53.3% 提到 60%——与 Claude Opus 5 持平,但消耗的 annotator tokens 更少
    • Bonus:宝可梦红。不做任何专项优化的情况下,连续 3000+ Turns、累计近 600 万 Token,解锁「居合斩」,第 3082 步击败枯叶道馆馆主马志士拿到第三枚徽章,主线进度约三分之一(人类通关主线约需 26 小时)。

    600 万 token 打游戏打到第三枚徽章,这件事听起来像玩梗,但它测的其实是 Agent 最难的能力:在很远的目标上持续记住前面的结果、管理资源、处理互相依赖的子任务,并在原计划走不通时改道。 这三个能力,和你让它"重构一个三十万行的老项目"是同一批能力。

  • 金融是这次单独拎出来重点讲的领域,而且分数确实能打。 FrontierFinance(第三方,6 类投资场景、220 道专家题、11,543 项评估标准)66.4 分,超过 GLM-5.3 的 64.1、DeepSeek V4.1 Flash 的 63.0、Kimi K3 的 62.6,仅次于 Claude Opus 5 的 69.7。官方另建了三项自研金融评测 FinStepBench(LiveSearch 74.5 / CorporateValuation 60.6 / DeepResearch 55.8),考核重点不是"算对没有",而是来源能否追溯、假设是否明确、计算能否复现——这个取向我个人非常认同,金融分析里一个不能复现的正确数字,价值约等于零。

  • 多模态是原生的,但文档类偏弱。 支持文本+图片+视频输入,单次最多 60 张图,视频走 URL / Base64 / stepfile://,MP4 单文件 <128MB、建议时长 <5 分钟。MMMU-Pro 76.0 不算突出,而 GDP.pdf 只有 14.8%(Opus 5 21.6%、Kimi K3 22.0%)——长文档 PDF 理解是明确短板,这个数在官方表里也是垫底级别的。

  • 推理强度可调,max_tokens 默认不限制。 支持 low / medium / high 三档(Chat Completions 用 reasoning_effort,Messages API 用 output_config.effort),max_tokens 默认为 INF,让模型自己决定输出多少。

    注意最后这条:"默认不限制输出长度" + "输出 20 元/百万" 组合起来,是有故事的。 有第三方实测发现它跑完整套 Intelligence Index 用了 1.6 亿输出 token,而全部模型的中位数是 9200 万——**这模型有点话痨。**单价便宜和总账便宜是两回事,上线前务必用你自己的 workload 压一遍。

用在哪儿

金融研究与估值。 这是官方最用力的一块,也是最像"能落地"的一块。官方 demo 里有一项柴油附加费分析:模型产出一个包含 17 个 Sheet 的分析工作簿,覆盖原始数据、跨序列核对、区域面板、公式和趋势模型,而且底层数据、计算过程和最终结论之间的链条被完整保留——覆盖范围、数据重叠、区域价格变化都能往下追,可以直接用于合同和采购复核。"能追溯"这三个字,是金融 AI 从玩具变工具的分界线。

大规模资料研究。 一项覆盖 1,000 个地点、25 年跨度的气候研究,模型在一次 Agent Action 内完成 950 次 Web Fetch,整理出横跨 11 个变量、30 万条月度记录的数据集,并分析出欧洲和大洋洲样本的季节峰值月份落在一年中相反的时段。这类"人干要三周、且极易出错"的活,是 1M 上下文 + 长程执行的正经用途。

长程软件工程与硬件调试。 官方给了个挺野的案例:在拿到开发文档和用户授权后,模型直接调用相机、COM 端口、截图和模拟鼠标输入,连续工作 3 小时以上做设备侧开发调试,根据设备反馈不断写、跑、改代码。这个场景以前基本只能靠人蹲在现场。

3D 与交互式前端。 不只会写前端代码,还能调用 Blender 创建并反复调整 3D 资产,再接进基于 Three.js 的交互应用和游戏。官方放了 Room Planner(一张卧室照片 → 可编辑 3D 空间 → 第一人称参观)、3D Flappy Bird、清明上河图等一组 demo。约 70% 的评测者认为它能自主完成中高复杂度的 Coding 任务(官方内部评测口径)。

成本敏感的长上下文批处理。 1M 上下文 + 缓存命中 0.35 元/百万,对反复读取同一份长上下文的工作负载(长文档问答、代码库检索、批量分析)性价比很突出。这也是它最稳的生态位。

不适合的也要说终端里反复试错的 Agent 循环(Terminal-Bench v4 只有 33.3),长 PDF 文档理解(GDP.pdf 14.8%),以及任何你现在就打算自托管的方案——权重还没放。

初体验

三步走,五分钟内能跑通。

第一步:到 StepFun 开放平台 创建 API Key。

第二步:直接用 OpenAI SDK,base_url 换成 https://api.stepfun.com/v1

python
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_STEP_API_KEY",
    base_url="https://api.stepfun.com/v1",
)

resp = client.chat.completions.create(
    model="step-5-preview",
    messages=[
        {"role": "user", "content": "读一下这份年报,列出三处口径不一致的地方,并给出来源位置。"}
    ],
    reasoning_effort="high",   # low / medium / high
    max_tokens=32768,
)
print(resp.choices[0].message.content)

第三步:想直接看效果不想写代码,去 Studio 在浏览器里试;用 Claude Code 的话官方也给了接入文档

四个坑,提前说:

一是最大输出是 64k,不是 1M。1M 指的是上下文窗口。长输出要自己分片。

二是它是 Preview,不是 GA。官方名字里就带着 Preview,别直接上生产核心链路。

三是权重 10 月 15 日才开源,现在没有可以自托管的东西。这点我要多说两句:网上出现过名为 stepfun-ai/Step-5-Preview-BF16 的仓库,各家报道对它"里面到底有没有权重"说法不一,而且它没有 LICENSE、没有 model card,config 里的架构类名还写着 step4MMGPTStepRoboticsForCausalLM——一个从没公开发过的代号。**在官方正式发布之前,别把它当成"已经开源了"。**任何"10 月中旬前自托管 Step 5"的计划,目前背后是没有可靠产物的。

四是前面提过的话痨问题。单价便宜不等于总账便宜,第三方实测它的输出 token 用量明显高于中位数。上线前用你自己的 workload 跑一遍真实账单,别只看单价。

进阶

如果这篇文章你只记住一件事,我希望是这个判断:

2026 年旗舰模型的竞争坐标,已经从"谁分高"换成了"单位智能成本"。

Step 5 Preview 的 44 分不是全球第一,甚至不是国产第一。它真正的动作是:用 4.5% 的激活比例,把"接近前沿的智能"塞进一个远低于前沿的价格带里,然后告诉市场——够用且便宜,本身就是一个生态位。

当 Kimi、GLM、DeepSeek、阶跃都在 40 分这个区间挤成一团时,决定谁能被大规模调用的,就不再是那 1 分的差距,而是每一百万 token 多少钱、每一件任务总共要烧多少 token。

冷水照例要泼,而且这次要泼准:

官方那张表里,标注 † 的三项(StepCodeBench、StepCode-Bench-Daily/General、FinStepBench 系列)全是自研基准,量自己的尺子。目前由第三方独立实测的,基本只有 Artificial Analysis 的 44 分以及 GDPval-AA v2.1。而传播最广的那个 DeepSWE v1.1 67.7%,是厂商在自家 harness 上跑的——自报分数和实测分数不是同一种证据。请用不同的信任等级去看它们。

另外,Terminal-Bench v4 的 33.3 是一个真问题,不是可以忽略的细节。终端类任务恰恰是 Coding Agent 烧预算最狠的地方,一个便宜模型如果每单任务要多试三轮,省下来的单价会被轮次吃掉。"八分之一成本"这个说法的前提,是它一轮就能干完。

我的建议很具体:**如果你手上有长文档、多材料、需要交叉核对的分析类任务(财报、研报、尽调、竞品),拿它跑一批,重点看两件事——结论能不能追溯到原文位置,以及一个任务总共烧了多少输出 token。**这两件事,才是决定它值不值那个价的真指标。

再往深一层,我更推荐你去读官方发布页里那两个 24 小时实验(MLA Kernel 508 TFLOPS、AIME24 53.3%→60%)的完整过程。**同一个模型干这两件完全不同的事,靠的是同一批能力:长程记忆、反馈理解、自我放弃次优解。**这批能力现在正在从"模型能力评测项"变成"模型能不能干活的分水岭"。

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

遇码MeetCoding 开源技术社区