AREX Feed Article
Artificial Analysis 独立实测 Step 5 Preview:追平 Kimi K3 (max)、单任务成本约低 2.8 倍,智能体评测落后;StepFun 接受数据并重申 10 月 15 日开放权重
北京时间 9 月 22 日上午 9 时 49 分,独立评测机构 Artificial Analysis :AA Intelligence Index(智能指数)得 44 分,与 Kimi K3 (max) 持平,仅次于同为 45 分的 GLM-5.3 (max) 和 Qwen3.8 Max;单任务成本约 0.72 美元,比同分模型低约 2.8 倍。分项里,Humanity's Last Exam 的 46% 是推理亮点,GDPval-AA 只有 1,566 Elo(等级分),智能体评测明显落后。约 70 分钟后,,接受这组数字,并重申 10 月 15 日开放权重。
两天前,北京时间 9 月 20 日 11 时 15 分,StepFun Step 5 Preview 为面向智能体工作的新旗舰,官宣帖以「Advancing the Pareto Frontier」(推进帕累托前沿)为题:600B 总参数、27B 激活的 MoE(混合专家)架构,1M 上下文加视觉能力,宣称同等智能水平下任务成本大幅更低,并预告 10 月 15 日开放权重。其写明 AA 智能指数 44 分;这次帖文给出的,则是 AA 用自己的评测管道跑完整套测试后的分项成绩与成本对比。
图:Artificial Analysis 官网 Step 5 Preview 模型页的指标卡片,Intelligence 44、Cost per Task 0.72 美元,与其实测帖口径一致。
从单个指数分数到完整成绩单:成本优势来自定价
AA 帖文给出评测口径:定价为每百万 token(词元)输入 1 美元、输出 2.70 美元,缓存命中输入 0.05 美元;全部成绩在 StepFun 一方 API 上测得。44 分的参照系由 给出:同类模型中位数为 24 分。成本对比是:每任务约 0.72 美元,同分的 Kimi K3 (max) 约为 2.00 美元,45 分的 GLM-5.3 (max) 约为 2.01 美元;按 AA 的概括,同等分数下每任务成本低约 2.8 倍,优势来自定价——输入与输出单价都低于两者。AA 同时注明一个例外:MiMo-V2.6-Pro 是唯一分数更高(46 分)且每任务成本更低(0.13 美元)的模型。
AA 模型页还披露了评测体量:跑完整套智能指数,Step 5 Preview 共生成 1.6 亿输出 token,同类中位数为 9,400 万,AA 形容其「非常啰嗦」(very verbose);整套评测花费 924.68 美元。按 7:2:1 的缓存命中/输入/输出比例折算,其混合价格为每百万 token 0.51 美元。
图:StepFun 官网模型页的智能指数–每任务成本图,横轴为每任务成本(美元,对数刻度),纵轴为 Artificial Analysis 智能指数,Step 5 Preview 位于页面标注的「New Pareto Frontier」线上。
推理成绩贴近 Kimi K3,四项智能体评测落后同档模型
推理是升幅最大的部分。Humanity's Last Exam 得 46%,与 Kimi K3 (max) 的 47% 相当;CritPt 得 21%,介于 Kimi K3 的 23% 与 GLM-5.3 (max) 的 19% 之间。AA 把 Step 5 Preview 定位为接替 2026 年 5 月发布的 Step 3.7 Flash,这两项成绩分别提升 25 和 19 个百分点。知识项 AA-Omniscience 上,42% 的准确率高于 GLM-5.3 (max) 的 34%(753B 参数)、低于 Kimi K3 (max) 的 48%(2.8T 参数);代价是它尝试作答的比例更高(68% 对 GLM-5.3 的 55%),作答中的幻觉率也更高(43% 对 30%),综合指数 16,落在 GLM-5.3 的 14 与 Kimi K3 的 20 之间。
智能体侧是落后的部分。AA 把 GDPval-AA 作为衡量智能体表现的主评测,Step 5 Preview 得 1,566 Elo,低于 Qwen3.8 Max 的 1,668 和 GLM-5.3 (max) 的 1,646;同样的差距在 Terminal-Bench 4.0(33%,对比 39% 与 42%)、AA-Briefcase(1,432 Elo,对比 1,640 与 1,525)和 AutomationBench-AA(51%,对比 56% 与 62%)上同样成立——四项智能体评测全部落后于这两个同档对手。
这组数字与官宣口径形成直接对照。StepFun 在 9 月 20 日的官宣与模型页里,把 Step 5 Preview 描述为面向智能体工作、能在长时程任务中持续执行的旗舰,页面案例包括用约 22 小时把 MLA GPU kernel 优化到峰值 508 TFLOPS(每秒万亿次浮点运算),高于对比的 Claude Opus 5(493 TFLOPS),以及在《宝可梦 红》里持续执行超过 3,000 回合、600 万 token 交互——这些都是厂商自报的演示;而在 AA 的独立套件里,智能体项目目前由同档对手领先。
StepFun 官方回应:接受 AA 的数字,开放权重承诺维持
北京时间 10 时 59 分,StepFun 官方账号发帖:「Step 5 Preview 把我们的智能–成本帕累托前沿向外推进。它在 Artificial Analysis 智能指数上拿到 44 分,每任务 0.71 美元。感谢 @ArtificialAnlys 让 Step 5 Preview 经受了完整评测。10 月 15 日还会有更多。」帖中引用的 0.71 美元与 AA 口径的约 0.72 美元差别在舍入范围内;44 分与成本数字出自 AA 的评测,StepFun 的发帖是对这组结果的公开接受。回应结尾的「10 月 15 日还会有更多」与官宣帖的「10 月 15 日开放权重」落在同一天;AA 帖文同样把 10 月 15 日放出开放权重列为当前计划。
权重仍闭源,第三方检验通道只有一方 API
AA 模型页把 Step 5 Preview 标为 Proprietary(专有模型),明确权重未公开;页面列出的 API 提供方只有 StepFun 一家,复现这套成绩目前也只有这一条通道。10 月 15 日若按计划放出权重,社区将能在自有环境部署这份 600B/27B 的模型,核对参数与上下文规格,并在 AA 之外复测成绩——包括它跟同档对手在四项智能体评测上的差距。