把机制串起来

输入先把素材压到可处理的规模

MoE(混合专家)模型把参数分成许多专家,每个 token 只激活其中一小部分,因此计算量低于把全部参数都跑一遍,但部署时通常仍要把全部权重放进显存或内存。上下文越长,注意力计算和 KV cache 占用越大;1M 上下文真正的瓶颈往往不是权重,而是缓存、带宽和并发。Agentic work 指模型会反复搜索、调用工具、读返回结果并继续行动,评价重点因此从单轮回答转向长程任务完成成本与稳定性。

机制再把计算集中到关键步骤

600B 总参数、27B 激活意味着单 token 约只计算 4.5% 的权重;这降低了算力成本,但并不消除存储和专家调度成本,服务端仍需容纳约 1.2TB 的 BF16 权重,且还未计入 KV cache。92 层窄深结构让表示拥有更长的变换路径,理论上适合把检索结果、代码执行结果和多轮工具反馈逐步整合,但更深的网络也会增加串行延迟、训练难度和显存带宽压力。1M 上下文能容纳超长资料与工具记录,却会显著放大 KV cache;因此 KV-cache offload 是实用部

结果最后落到可验证的工作结果

['适合多轮搜索、代码执行和专业资料整合', '可用Step Plan接入Claude Code类软件工程流程', '高并发自托管需先核算约1.2TB权重及KV缓存', '不宜仅凭低token价格估算总成本,推理token可能很高']

发布的重点不是更大的模型,而是更长的任务链

StepFun发布的Step 5 Preview,是一款面向Agent工作的稀疏混合专家模型,目标场景包括软件工程、专业知识工作和金融。模型总参数约6000亿,每个Token约激活270亿参数,同时接受文本、图像和视频输入,输出为文本。它还提供低、中、高三档推理强度,以及工具调用、JSON Mode、JSON Schema、流式输出和提示缓存等能力。

这组规格指向的并不是普通问答,而是需要反复读取资料、调用工具、运行代码并处理返回结果的长任务。StepFun称,模型在一项研究任务中曾在单次Agent动作里协调950次网页抓取。这个数字首先说明厂商试图把模型放进更长的执行回路,而不是证明950次抓取都能被稳定、正确地完成。对于技术负责人来说,发布重点因此从“模型回答得多好”转向“模型能否在更长的状态链里保持方向、成本和错误控制”。

稀疏计算省的是每步算力,不是整台机器

Step 5 Preview采用MoE结构,每个Token只使用约4.5%的参数。这样的设计可以降低单Token的计算量,并让模型在保持较大总容量的同时,避免每一步都激活全部权重。StepFun还采用了92层的窄而深Transformer,而不是继续把网络做宽。研究团队给出的解释是,更深的堆叠为隐式多跳推理提供更长的信息路径,尤其适合处理Agent不断追加的工具结果和长前缀。

但“27B active”不能直接换算成“只需要27B模型的部署资源”。6000亿参数仍需驻留在服务所需的内存体系中。按材料中的简单估算,BF16权重本身约需要1.2TB,还没有计入KV缓存,因此开放权重发布后,自托管大概率仍需要多GPU服务器。百万Token上下文也不会免费消失,它会把缓存、预填充、调度和长请求并发的压力带到系统层,而不是只留在模型架构图上。

价格看起来激进,长推理会改写成本结构

StepFun目前提供托管API和StepFun平台访问,报价为每百万输入Token 1美元,每百万缓存输入Token 0.05美元,每百万输出Token 2.70美元。输入价格和缓存价格确实给长上下文Agent留下了较大的成本空间,尤其是在同一代码库、研究资料或任务状态被多轮复用时。对于尚未确定工作流价值的团队,API也是比立即购买硬件更低摩擦的试验入口。

不过,Agent的账不能只按输入Token算。材料指出,输出价格包含推理Token,而Artificial Analysis在其评测中记录到Step 5 Preview产生了1.6亿输出Token,相关中位数为9200万。即使这个评测不能代表所有生产任务,它仍揭示了一个关键风险:较低的单位价格,可能被高推理强度、反复重试、工具调用和失控循环抵消。提示缓存能降低重复前缀的成本,却不能替团队解决任务是否应该继续、何时停止以及错误结果是否已经污染状态的问题。

长程强化学习是系统能力,也是一种评测负担

StepFun把训练重点放在on-policy、长程强化学习,并提到MoE路由在训练和推理之间进行bit-wise对齐。材料还列出了MTP-3推测解码、FP8 MoE和KV-cache offload,并称长程强化学习端到端速度提升超过3倍。这些技术组合说明,Step 5 Preview的目标不是单独优化某个基准分数,而是让模型在搜索、执行、读取返回和继续规划的循环中少一些断裂。

但长任务的评测比短答案更难归因。发布材料中的结果包括DeepSWE v1.1为67.7、StepCodeBench为49.0、ProgramBench为80.5,StepFun还报告了两个持续24小时的Agent实验,包括把H100内核调到508 TFLOPS,以及通过自动化后训练把Qwen3-30B-A3B在AIME24上的结果从53.3%提升到60%。这些结果均属于公司披露,且部分对手以不同推理强度运行,不能当作同条件下的独立排名。Independent Artificial Analysis给出的Intelligence Index分数为44,正好提醒读者:长程执行能力、基准成绩和一般智能指标不是同一个维度。

对落地团队,先验证任务闭环,再决定是否迁移

Step 5 Preview最现实的使用路径是先把它当作API实验对象,而不是立刻把“百万上下文”写进系统架构承诺。适合优先验证的不是任意长文本问答,而是有明确成功条件的任务,例如代码库修改、资料检索后生成带证据的结论,或需要多个工具阶段协作的研究流程。测试时应同时记录完成率、工具调用次数、输出Token、重试率、缓存命中和人工接管点,否则很容易只看到单价而看不到每个任务的真实账单。

自托管则是另一套决策。开放权重按计划于2026年10月15日发布,在此之前不能把硬件采购、量化效果或推理吞吐当成已验证事实。即使权重按时开放,6000亿参数、至少约1.2TB的BF16权重和百万上下文缓存也意味着部署成本、故障域、并发调度和数据治理都需要单独评估。一个可执行的判断是:如果任务价值来自更长的行动链,先用受控API做端到端基线;只有当调用量、数据驻留要求或延迟目标证明托管模式不合适时,再把自托管当作基础设施项目,而不是模型切换开关。