AREX Feed Article
Patronus AI 发布自称首个的速通基准 SpeedrunBench,官方称最强模型仍慢人类纪录约 4 倍
北京时间 9 月 4 日凌晨 3 时 20 分(UTC 时间 9 月 3 日 19:20),AI 公司 Patronus AI 在 X 官方账号宣布发布 SpeedrunBench,。被测模型需要以速通(speedrun)方式跑完 10 款游戏中的指定里程碑,覆盖 Mario Kart 64、Pokémon Blue 等作品;官网、论文、数据集与浏览器 demo(演示)在中同步放出。
官方口径是:在 Pokémon Blue 这类复杂游戏上,成绩最好的 Kimi K3 与 Claude Opus 5 距人类世界纪录仍有约 4 倍差距;在较简单的游戏上,agent 的成绩已接近人类世界纪录。整套结果出自 。
图:SpeedrunBench 官方博客发布的 Pokémon Blue 离线带种子(offline-seeded)成绩图。横轴为优化轮次(turn),纵轴为到达首枚徽章的帧数;底部虚线标注人类世界纪录约 40,435 帧。
从「能不能通关」到「多少帧通关」
选「速度」作指标,:大多数游戏基准只问 agent 能不能通关,这个二元指标在模型能通关的那一刻就饱和,不再能区分模型强弱。
人类的速通社区(speedrun.com、tasvideos.org)则花了几十年把同一批游戏推到远超「通关」的水平,不断发现新路线和新技术。因此「到达游戏里程碑用了多少帧」成了客观目标,SpeedrunBench 给每款游戏指定了具体计时终点:。
10 款作品横跨平台跳跃、竞速、RPG、策略、射击与解谜。三个最热门的类型旁边都配了开源同类:SuperTux 之于 Super Mario Brothers、Tuxemon 之于 Pokémon,马里奥赛车也配了开源竞速作品,用来对照预训练数据暴露程度。
评测分三种设置(见下图)。ONLINE 沿袭此前的游戏基准:模型看着当前画面、预测下一步动作,考验多模态理解。OFFLINE 是论文新提出的玩法,把一局游戏表示成一段按帧索引的完整操作轨迹,模型反复编辑轨迹、回放、读回目标帧,在固定轮次预算内逼近最优;其中 OFFLINE-SEED 给一段能跑通的参考轨迹让模型优化,OFFLINE-SCRATCH 要求模型从零构造轨迹。两种离线设置分别考验「在已有路线上探索」和「无中生有地发现路线」,且不需要视觉输入,开放权重的小模型也能参与。
图:SpeedrunBench 的三种评测设置示意。离线设置把速通抽象成「反复编辑并按帧结算的操作轨迹」,让没有视觉能力的模型也能参赛。
论文一共评测 11 个模型:闭源的 Claude Opus 5(Anthropic)、GPT-5.6-sol(OpenAI)、Grok 4.6、Gemini 3.7 Flash(Google DeepMind),以及开放权重的 、、DeepSeek-V4 Pro/Flash、Thinking Machines Lab 的 Inkling 与 Inkling-Small。
160,021 帧对 40,435 帧:Pokémon Blue 上的差距
论文把 Pokémon Blue 的计时终点定为第一枚徽章(first badge),人类参照纪录约 40,435 帧,按游戏约 60 帧/秒折算约 11 分 14 秒,取自玩家 SlNNED 2025 年的一条经核验的纪录跑。
论文的 ONLINE 实验里,到达徽章的只有三个带视觉能力的闭源模型:Claude Opus 5 用时 160,021 帧(约 44 分 27 秒),GPT-5.6-sol 用时 283,474 帧,Grok 4.6 用时 477,140 帧,分别是纪录的约 4 倍、7 倍和近 12 倍。论文还指出,Opus 5 的最好轨迹中途也两次「团灭」(blackout),分别发生在 Viridian Forest 和 Pewter Gym,这两次失误占掉了轨迹损失的大头;Kimi K3 在在线设置下止步于拿到图鉴(Pokédex)的里程碑,没有推进到道馆。
离线带种子设置里,11 个模型全部拿到徽章,它们的种子正是 Opus 5 的在线轨迹。成绩最好的是 Kimi K3:它在第 90 轮左右通过避开 Pewter Gym 的团灭,把成绩优化到 120,797 帧,约为纪录的 3 倍,也是 11 个模型里相对种子改善幅度最大的一个(24.4%);Claude Opus 5 同设置为 151,133 帧,约合纪录的 3.7 倍。
官方推文的「约 4 倍」口径,在成绩表里最接近的对应是 Opus 5 的在线成绩:160,021 ÷ 40,435 ≈ 3.96。官方点名的两个模型,恰好分别是两套设置里跑得最快的:在线是 Opus 5,离线是 Kimi K3。
给一段参考轨迹,模型反而跑得更慢
SpeedrunBench 的一个反直觉结果出在 SuperTux 1-1 关卡的配对实验上。论文给 11 个模型相同的种子(一段 9,498 帧的参考轨迹),再比较「带种子优化」与「无种子从零写」两种成绩:8 个能无种子过关的模型,全部在从零设置下跑得更快,差距最高约 5.1 倍。
具体数字是:DeepSeek-V4-Pro 从零跑出 1,844 帧、带种子反而 9,428 帧;GLM 5.3 从零 1,845 帧、带种子 8,412 帧;差距最小的 GLM 5.2 也是从零 2,405 帧优于带种子 8,887 帧。两组分布完全不重叠:11 个模型里最好的带种子成绩(8,412 帧)仍差于最差的无种子成绩(2,405 帧)。
:agent 往往「继承」一条比人类顶尖玩家更慢的路线,并在拿到能跑通的轨迹后只围绕它做局部优化;没有种子时反而会自由发挥。但弱模型仍然依赖种子:Gemini 3.7 Flash、Inkling 和 Inkling-Small 三个模型无种子时根本到不了终点,官方称在 Pokémon 这类更复杂的游戏上,许多模型不借助种子同样到不了目标。论文的结论是,只有当模型能自己找到路线时,从零设置才更优;对找不到路线的模型,是种子让任务变得可解。
距人类纪录 58 帧:试跑预算比模型选择更关键
简单游戏上的接近发生在放宽评测预算之后。:在 Super Mario Land 1-1 上,人类参照成绩是 37.6 秒(取自 EiP25 纪录跑中 1-1 关卡的用时);当每轮迭代允许最多 200 次试跑时,GLM 5.2 把成绩追到距人类纪录仅 58 帧,约 0.97 秒。
在允许无限次试跑的实验里,DeepSeek-V4-Pro/Flash 与 Kimi K3 明显更擅长「做实验」,GLM 5.2 则跑出了接近纪录的 Super Mario Land 成绩。
但逼近纪录不等于会速通。论文用一段 18,834 帧的 Super Mario Brothers 全长 TAS(工具辅助速通)轨迹做种子,让 GPT-5.6-sol 优化 200 轮,结果只快了 3 帧;把两条接近最优的轨迹合并,才又省出 26 帧。论文据此判断 SpeedrunBench 远未饱和,并在结论里把机制写得很直白:起点轨迹与每轮允许的试跑次数,对成绩的影响都大于模型选择本身。
在 Tuxemon 上,Kimi K3 的领先消失了
论文还设计了一组直接对照预训练污染的实验:把热门商业作 Pokémon 换成同玩法、同结构的开源游戏 Tuxemon,后者的路线与纪录远不太可能出现在预训练语料里。两组都跑 OFFLINE-SEED、迭代预算相同,Tuxemon 组从一条 105,400 帧的脚本路线出发,得分口径都是到第一个道馆的帧数。
结果落差明显:对种子轨迹的最大改善,从 Pokémon 上的 24.4%(Kimi K3 创造)掉到 Tuxemon 上的 5.9%(GLM 5.3 创造);11 个模型里 4 个在 Tuxemon 上从头到尾没到达道馆,而在 Pokémon 上每个模型都至少拿到过一次徽章。排名也随之改变:Kimi K3 在 Pokémon 上大幅领先,在 Tuxemon 上却不在改善者之列;Pokémon 垫底的 Inkling-Small 到了 Tuxemon 升到第三。
论文据此推断,热门商业作品大概率进了预训练语料,并建议未来的游戏基准也把冷门游戏纳入测试范围。
发布当天:demo 上线、同行道谢与「背题」质疑
SpeedrunBench 的配套 demo 发布当天即可访问。官方称用户可以在,演示页提供 SuperTux、Tuxemon、SuperTuxKart 三款开源游戏,人类玩家实时操作,与选定 agent 的参照成绩同场对照;页面条款注明 Patronus AI 会记录会话、操作与对局结果,用于研究与评测。数据集的每条成绩都附有该次跑的无声音视频,除 Tuxemon 外还附带输入轨迹,可逐条回放核对。
「首个」的说法也需要划清边界。论文在相关工作里写明,最接近的先行工作是 NeurIPS 2025 的 Pokeagent Challenge:速通是其中的赛道之一,但只覆盖 Pokémon 一款游戏、且只有在线一种设置;SpeedrunBench 的增量在于跨 10 款游戏和多种类型,并首次引入离线轨迹编辑设置。发布当天,Pokeagent Challenge 论文第一作者、自称普林斯顿博士并在 Prime Intellect 做研究的 Seth Karten 在原推下,Patronus AI 回复。
拥有 28.2 万关注者的 AI 内容博主 Alex Prompter 则,速通惩罚草率的规划,一步失误就废掉整局,是检验 agent 长程规划与自我纠错的干净测试,他的初步判断是,对今天的模型来说真的很难。
另一条质疑来自量化方向。当天回复称,速通路线是公开的、带日期的,所以成绩里相当一部分测的是模型的训练截断时间,不是规划能力;晚一年训练的模型不费力气就能继承更好的路线。
SpeedrunBench 的 Pokémon 与 Tuxemon 对照,检验的是预训练语料里有没有这款游戏,拆不开模型最好成绩里有几帧靠规划省下来。要拆开这两者,@AIQuanting 的判据很具体:换一款纪录路线晚于所有被测模型训练截断点的游戏。