AREX Feed Article
阶跃星辰发布 Step 5 Preview:600B 参数 MoE 主打智能体与长时程任务,承诺 10 月 15 日开放权重
北京时间 2026 年 9 月 20 日 11 时 15 分(UTC 3 时 15 分),(StepFun)官方 X 账号 发帖,宣布面向智能体(agentic)工作的新旗舰模型 Step 5 Preview。帖文给出的核心规格为:600B 总参数、每个 token 激活 27B 的稀疏 MoE(混合专家)架构,支持 1M token 上下文窗口与视觉输入;开放权重定于 10 月 15 日放出。确认,模型即日起即可通过阶跃星辰的产品和 API 调用。
StepFun 给这份发布定的主线是成本。帖文称 Step 5 Preview「在相近智能水平下任务成本大幅更低」,模型页进一步写明它在 Artificial Analysis Intelligence Index 上得 44 分,并配图标注了相对同档模型的「-65% Cost」。性能、成本与能力表述均出自厂商单方口径,本文无法独立核验。
帕累托前沿:厂商自评画出的成本曲线
「帕累托前沿」(Pareto frontier)是这次发布的题眼。StepFun 在模型页解释:帕累托前沿标记智能与成本之间的最佳权衡,只有边界向外移动才算进步。配图中,横轴是每任务成本的对数刻度,纵轴是 Artificial Analysis Intelligence Index;Step 5 Preview 被放在一条标为「New Pareto Frontier」的曲线上,一条虚线从 GLM-5.3 (max) 与 Kimi K3 (max) 所在区域指向它,旁边标注「-65% Cost」。同一张图里,GPT-6 Astra、Claude Opus 5 等更贵的模型排在「High-compute models」一档。
评测口径由厂商自己交代:模型页注明 GDPval-AA v2 成绩引用 截至 2026 年 9 月 19 日的结果;DeepSWE v1.1 使用 SWE-agent 框架、temperature=1.0、top_p=0.95 运行。把 Step 5 Preview 放上这条曲线的评测和图表,全部由 StepFun 自己完成或挑选;在这份材料里,Artificial Analysis 只处于被引用的位置。
稀疏 MoE 的规格与当天的调用渠道
模型页写明 Step 5 Preview 基于 sparse Mixture-of-Experts(稀疏混合专家)架构:总参数量 600B,处理每个 token 时只有 27B 参数参与计算。帖文在架构层面给出的信息只有这一组数字,但它同时定义了两件事——模型的容量规模,以及每一次调用的实际计算量。
另外两项规格是 1M token 上下文窗口和视觉输入。在厂商的成绩表里,多模态基准 MMMU-Pro 上 Step 5 Preview 得 76.0%,低于 GPT-6 Astra 的 87.0% 与 Claude Opus 5 的 85.0%。
模型当天即可调用。帖文附了 的试用入口;中文「」首页已挂出 Step 5 Preview,标注「面向真实任务的新一代旗舰基模」,并给出 base_url 为 api.stepfun.com/v1 的 OpenAI 兼容调用示例。官方在跟帖中另附了链接。
两项 24 小时实验:长时程执行演示的成色
帖文称 Step 5 Preview 具备「在长时程中持续执行」的软件工程能力:记住此前结果、利用执行反馈决定下一步、持续迭代。厂商为此设计了两项限时 24 小时、带量化反馈的实验。
第一项是在一块 NVIDIA H100 上从头优化 MLA GPU 内核,head dimension 为 512,生产形状为 batch size 1、64 heads、8,192 tokens。每个模型获得 4 次独立尝试,只报最好成绩;候选版本跑通但吞吐下降时,模型会丢弃它、从当前最优版本继续。结果是 Step 5 Preview 在约 22 小时后把前向加反向吞吐做到 508 TFLOPS,对比 Claude Opus 5 的 493 TFLOPS;同一图表里 Kimi K3 为 307、GLM-5.3 为 286。
第二项实验给了 Step 5 Preview 24 小时时限和一个可访问生产数据的 API 标注器,由它自行决定怎么用标注、怎么改数据,最终把 Qwen3-30B-A3B 底模在 AIME24 官方测试上的准确率从 53.3% 提到 60%,以更少的标注 token 追平了 Claude Opus 5 的成绩。
厂商还附了一个编码之外的彩蛋:不加任何宝可梦专项优化,Step 5 Preview 在《Pokémon Red》里已持续交互超过 3,000 回合、600 万 token,第 3,082 回合时解锁居合斩(Cut)、拿到三枚道馆徽章、击败了 Lt. Surge,主线进度约三分之一,而人类玩家打完主线估计需要 26 小时。这些实验与对比模型的成绩,全部出自 StepFun 自己搭建的测试环境。
自建基准拿到 49.0%,厂商自己承认最难任务差距仍在
帖文称 Step 5 Preview 在软件工程与专业知识工作上具有前沿级(frontier-level)表现。StepFun 自建的 StepCodeBench 覆盖 553 个独立代码仓库、9 类任务、20 个应用领域、33 种编程语言,Step 5 Preview 在其上取得 avg@4 49.0% 的成绩。图表说明称,它在功能修改、Bug 修复、重构、文档生成、性能调优、代码生成六个类别上领先开放权重模型;同一表格里,GLM 5.3 为 40.2%、Kimi K3 为 43.9%,闭源一侧 GPT-6 Astra 61.0%、Claude Opus 5 63.9%。
厂商给这条线划的边界相当具体:按语言和难度拆分后,Step 5 Preview 在低、中难度任务上接近 Claude Opus 5,「在最具挑战性的长时任务上,与前沿仍有明显差距」。表格里的 Terminal-Bench v4 是个注脚:Step 5 Preview 得 33.3%,低于 GLM-5.3 的 41.9% 和 GPT-6 Astra 的 57.9%。另一项厂商口径的数据是:在内部与外部专家评审中,约 70% 的参与者认为该模型能自主解决中高复杂度的编码任务。
官方演示还把编码能力延伸到纯软件之外:给定开发文档和用户授权后,模型可直接操作可编程硬件,把摄像头、COM 串口、屏幕截图和模拟鼠标输入纳入开发与调试流程;前端场景里,它用 Blender 建模、再以 Three.js 做成交互网页,示例是一个从卧室照片生成可编辑 3D 房间规划器的应用。
金融被单独点名,自家成绩表里四项金融基准都不是第一
金融是帖文单独点名的领域。StepFun 为此建了 FinStepBench 自评套件,分 LiveSearch(检索并验证时效性金融信息)、CorporateValuation(把财务数据和可辩护假设变成内部一致的预测与可复现估值)、DeepResearch(端到端研究流程)三条线,评估维度包括来源可溯、假设显式、计算可复算。外部基准方面,模型页介绍其采用了 Samaya AI 出品的 :六个投资用例、220 道专家题、11,543 条评分标准。
不过,把厂商自己列出的成绩表看完,金融故事有另一面:四项金融相关基准的最高分都不属于 Step 5 Preview——FrontierFinance 上它得 66.4%,Claude Opus 5 为 69.7%;FinStepBench-LiveSearch 上它得 74.5%,Claude Opus 5 为 76.2%;CorporateValuation 上它得 60.6%,GPT-6 Astra 为 77.3%;FinStepBench-FinanceDR 上它得 55.8%,Claude Opus 5 为 59.1%。帖文所称的「在金融上尤其强」(particular strength in finance)是厂商定位表述,自家表格给出的相对位置更接近「追近第一梯队」。
知识工作部分的案例数字具体:一项覆盖 1,000 个地点、25 年的气候研究里,模型在单次 agent 动作中协调 950 次网页抓取,汇总 11 个变量、300,000 条月度记录,并得出欧洲与大洋洲样本日照峰值月份相反的结论;另一项柴油附加费审查产出一个 17 个工作表的分析工作簿,保留源数据、交叉核对、区域面板、公式与趋势模型的完整链条。
上线首日:追问 Step 4 的、等权重的,和被容量挡住的
截至北京时间 20 日 21 时前后的平台数据快照,这条官宣帖获得约 21.6 万次浏览、1,294 个点赞、205 次转发。评论区大致分三类。
一是追问版本号。有用户「Step 4 呢?现在都开始跳过数字了?」,「继续迈上台阶」(Keep stepping up),对另一位用户「Step 4 是什么?」的提问也只回了。阶跃星辰官网当前列出的语言大模型是 Step 3.7 Flash、Step 3.5 Flash、Step 2 与 Step 1,其中没有 Step 4;而 Step 3.7 Flash 的官网介绍标注「开放权重 可部署可定制可微调」,该公司此前已有开放权重的先例。
二是观望。有用户:27B 激活配 1M 上下文,只要延迟不糟糕就「相当惊人」,但「我还是得等到 10 月 15 日拿到权重才会信」。
三是遇到现实问题。官宣六个多小时后,用户 zaguzovmaksim0 欧洲手机号无法注册、邮箱注册通道也处于关闭状态,「没办法用上模型」,官方「谢谢告诉我们,我们马上看一下」。到了北京时间 20 时 20 分,用户 liciece 称想试用但「容量现在似乎是个问题」,并附上截图;12 分钟后正在处理,「以应对所有用户的热情」。这是 Step 5 Preview 上线首日被厂商确认的第二处现实摩擦;至于 10 月 15 日的开放权重能否如期落地,目前只有厂商的单方承诺。