AREX Feed Article
腾讯NTU发布StatePlay:首个「懂规则」的游戏世界模型,机制忠实度提升18.6%
游戏好不好玩,不在于画面有多炫,而在于规则有没有被遵守。
游戏世界模型的「花瓶困境」:好看,但不能玩
2026年7月29日,一篇预印本论文在arXiv上线,编号2607.26754。论文提出了名为StatePlay的游戏世界模型框架,由腾讯、南洋理工大学(NTU)、新加坡国立大学(NUS)以及新加坡科技研究局前沿人工智能研究中心(A*STAR CFAR)的研究人员联合完成。论文指出,当前AI游戏世界模型能生成以假乱真的画面,但一到规则层面就全面崩溃。
论文的实验数据给出了量化证据:在零样本测试中,Matrix-Game 3.0、LingBot-World、LingBot-World 2.0、HY-World 1.5、ReactiveGWM 五款游戏世界模型的机制忠实度全部低于50%,最好的ReactiveGWM也只有48.0%(Gemini-3.1-Pro评估)。这些模型在判断一局格斗游戏该谁赢谁输时,接近随机猜测的水平。
这正是——AI生成的游戏画面像一部精致的武打片,但不像一个真正的游戏。
论文标题:StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation 论文链接: 项目页面: 核心成绩:在格斗游戏《街头霸王3》上实现0.947状态对齐分数,机制忠实度(Mechanics Fidelity)较最强基线ReactiveGWM提升18.6个百分点,达到Gemini-3.1-Pro评估下的82.3%。
五个隐藏数字决定游戏生死——StatePlay如何显式建模规则
游戏的骨架藏在像素背后
现有游戏世界模型的工作方式本质上是一台「图像预测机器」:输入玩家的按键操作和过去几帧画面,输出下一帧画面应该长什么样。这些模型学会了「挥拳时拳头会碰到对方身体」这样的视觉规律,却完全不知道血量、技能槽、计时器这些内部数字的存在。
研究团队指出了一个关键事实:在一款格斗游戏中,真正决定「能不能玩」的不是画面,而是五个不断变化的内部数字——计时器、双方血量值和双方技能槽百分比。这些数字构成了游戏的「骨架」,画面只是覆盖在骨架外面的「皮肉」。从像素里推断骨架几乎不可能——血量条在画面上只占几十个像素,画面质量稍有波动就可能读错;技能槽是否刚好达到100%这个临界点,从像素判断更是困难重重。
StatePlay的做法简单到近乎粗暴:既然从像素里推断状态不靠谱,那就直接把状态数据喂给模型,并让它学会预测这些状态如何随时间演变。
从零搭建一个「懂规则」的训练场
但市面上找不到同时包含游戏画面、玩家操作和内部状态数据的公开数据集。研究团队选择了最务实的路径:自己构造。
团队以经典格斗游戏《街头霸王3》为实验平台,通过stable-retro模拟框架用Python程序自动控制游戏运行,同时记录每一帧画面、每一个玩家操作,以及从模拟器内存中直接读取的五个状态变量。最终收集了10000个5秒视频片段,每段20帧/秒。
数据均衡策略是数据集构建中的一个关键设计。如果99%的训练数据都是普通对战,模型就很少有机会学习「技能槽满了触发必杀技」或「血量归零判定胜负」这些关键时刻。研究团队将数据分为五类:玩家胜利结局(10%)、玩家失败结局(10%)、必杀技成功释放(10%)、必杀技尝试但未满足条件而失败(10%),以及普通对战(60%)。前四类合计40%的数据专门覆盖关键状态转变场景,确保模型不会只在「安全区」里打转。
数据集还有一个设计细节:团队用Gemini模型对NPC的战斗策略生成自然语言描述(主动进攻型、远程控制型、被动防守型三类),将这些文字描述也加入训练数据,让模型能通过文字指令控制NPC风格。
MoT双支线架构:视觉与状态各司其职
StatePlay的模型架构是这项工作的核心。团队在一个已有的视频生成模型上额外装配了一条专门处理游戏状态的神经网络支线,形成「混合专家变换器(Mixture-of-Transformers,MoT)」架构。
视觉分支拥有50亿参数,负责生成游戏画面,采用流匹配(Flow Matching)训练——这是当前视频生成模型的主流方法,擅长处理高维度的像素数据。状态分支仅7.6亿参数,只有视觉分支的约六分之一,负责预测血量、技能槽、计时器等五个数字状态,采用回归损失函数直接训练——本质上就是让模型预测一个数字,然后直接跟真实数字比较差距。
两条支线采用不同的训练方法。画面是高维度、充满细节的复杂数据,而血量值只是一个0到100之间的简单数字;把它们强行塞进同一套处理空间反而会相互干扰。更关键的是,游戏状态遵循明确规则——血量被打了就减少,必杀技使用后技能槽清零。这些有规律可循的变化,用直接的数值预测来学习,比用扩散模型那套复杂的生成框架高效得多。
两条支线并非各自为政。它们之间通过「联合注意力模块」(Joint Attention)进行双向信息交流:视觉分支可以查看状态分支的信息——「技能槽满了,画面里应该出现必杀技特效」;状态分支同样可以查看视觉分支的信息——「画面里出现了一记重拳,血量应该减少更多」。这种双向校准机制,让两条支线互相约束,共同保证最终输出既好看又合规。
消融实验验证了这个设计的必要性。如果取消MoT结构、改用共享单一网络,机制忠实度直接从82.3%跌到64.7%,差距17.6个百分点。如果状态分支改用流匹配训练而非回归损失,机制忠实度进一步跌到60.7%,差距扩大到21.6个百分点。状态预测精度方面,回归损失比流匹配高出12.1个百分点。
82.3% vs 48%:一场关于「能不能玩」的量化对决
研究团队设计了一套四维评测体系来衡量生成游戏视频的质量:画面质量(SSIM与LPIPS)、动作可控性(移动与攻击准确率)、状态预测精度(归一化L1距离),以及机制忠实度(用Gemini和GPT-5.5两个大模型当裁判,判断生成视频中的游戏事件是否符合规则)。全部评测在100个测试片段上进行,均匀覆盖各种机制场景。
零样本测试的结果呈现出一面倒的差距。Matrix-Game 3.0、LingBot-World 1.0与2.0、HY-World 1.5、ReactiveGWM五款模型在机制忠实度上均表现不佳。在Gemini-3.1-Pro评估下,最好成绩是ReactiveGWM的48.0%,LingBot-World 2.0只有41.3%,HY-World 1.5更是低至41.0%。在GPT-5.5评估下,最好成绩是LingBot-World的53.0%,但其他模型同样在42%-43%附近徘徊——基本就是随机猜测的水平。
微调实验中,StatePlay的差距更加明显。在同样的StatePlay数据集上进行微调后,ReactiveGWM的机制忠实度从48.0%提升到63.7%。StatePlay则将这个数字推到了82.3%(Gemini-3.1-Pro评估)和78.3%(GPT-5.5评估),相较ReactiveGWM分别高出18.6个百分点。
状态预测方面,StatePlay的归一化L1距离低于0.06,对应的对齐分数达到0.947(满分1),意味着它对血量、技能槽等变量的预测平均误差不超过6%。更重要的是,这些提升并没有以牺牲画面质量为代价:StatePlay的SSIM分数0.378和LPIPS分数0.424均在所有微调模型中处于最优水平,动作可控性也基本持平。
三个场景看清差距:当AI搞反了胜负
论文展示了三个具体案例,让StatePlay与ReactiveGWM的差异一目了然。
必杀技触发场景:给定技能槽已满的初始状态和相同的按键操作,ReactiveGWM没能生成出必杀技的视觉效果,两个角色甚至在画面里糊成了一团。StatePlay则准确地在技能槽满格时触发了必杀技特效,并在使用后将技能槽正确清零。
NPC血量归零场景:ReactiveGWM生成的画面里,对手血量早已见底,却依然站着继续打人,完全无视游戏应该结束的规则。StatePlay在正确时机生成了「YOU WIN」的胜利画面。
玩家血量归零场景:ReactiveGWM不仅没有生成「YOU LOSE」,反而生成了一个颠倒的场景——玩家在庆祝胜利,NPC躺在地上,胜负完全搞反。StatePlay则稳定地生成了符合规则的失败结局。
三个案例指向同一个结论:没有状态建模的AI对游戏规则的理解偏差有时是致命的,甚至可能给出与真实情况完全相反的输出。这种错误不是「画面不够细致」的问题,而是模型根本不知道输赢由什么决定。
一款格斗游戏只是起点
研究团队在论文中坦率列出了当前局限。StatePlay虽然能准确预测内部状态,但生成的画面里血条和技能槽的视觉表现有时仍与预测数值不完全一致——骨架对了,皮肉还在追赶。当多个游戏事件同时发生(比如放出必杀技的同时对方血量归零触发游戏结束),画面质量会有所下降。
更根本的限制在于数据集范围。整个研究目前只在《街头霸王3》一款格斗游戏上验证过。射击游戏里的弹药数量、赛车游戏里的氮气加速、角色扮演游戏里的魔法值——每种类型的游戏都有各自的状态体系和规则逻辑。论文提出,希望社区共同构建更多包含状态标注的游戏数据集,将StatePlay推广到更广泛的游戏类型。
StatePlay的核心贡献在于指出了一个被此前研究忽视的事实:一个真正「能玩」的游戏AI,必须同时理解画面和规则,而规则本质上藏在那些看不见的内部数字里。把这些数字显式地纳入模型的学习和生成过程,是从「视觉演示」到「真实模拟」的关键一步。