AREX Feed Article
中科院掏出PhiZero,256个符号压住Sora 2:物理推理四榜登顶
一段4秒钟、33帧的视频,现有视频模型需要44800个连续视觉token来编码。中科院自动化所的研究团队只用了256个。
这256个符号不是随机压缩的结果。它们是一套从5万小时真实视频中自监督学来的"物理语言"——专门捕捉物体怎么运动、碰撞、变形和交互,而不关心场景的颜色、光照和纹理。
7月30日发表在arXiv上的,用这套语言在四个物理推理基准上全部登顶,token用量暴减175倍。它面向机器人、自动驾驶和仿真场景,把世界模型从"像素预测"推向了"先想后画"。
跟描帧的学徒比,这是懂重力的动画师
PwC奥地利AI工程负责人在LinkedIn上评价PhiZero时打了一个比喻:现有视频模型像"只会逐帧临摹参考录像的动画学徒",而PhiZero像"理解重力的动画师"——区别在于,前者在模仿画面的外观,后者在推理画面背后的物理过程。
Biese指出,这套物理语言没有任何人工标注,不依赖仿真引擎,模型自己从无标注视频中发现了一套描述运动、碰撞和状态变化的词汇表。
他同时提醒,将推理与渲染分离,改变了世界模型的根本问题——从"能不能生成逼真的像素"变成了"能不能学到关于世界如何运转的正确抽象"。
同一帖子下,有评论者追问:这算是一个真正的世界模型吗?
Celso Sousa则指出了开放问题——动力学与外观的分离目前主要靠benchmark分数支撑,缺乏严格的因果验证;扩展到更长时域、罕见物理事件和分布外环境的能力也尚未充分检验。
在中国,于8月7日在X平台发布了PhiZero的消息。和同日刊发了详细的技术解读。
Sora、Cosmos都在堆像素,没人教模型先"想清楚"再画
过去两年,视频世界模型的思路高度统一:扩大模型、堆更多数据、在像素空间直接预测未来帧。OpenAI的、NVIDIA的Cosmos系列、阿里的Wan2.2,走的都是这条路。
问题在于,像素空间承载了两类完全不同的信息——一类决定场景"长什么样"(纹理、光照、背景),另一类决定物体"怎么变化"(速度、碰撞、形变)。两者的信息量差距悬殊,关键的运动结构很容易被庞大的外观信息淹没。
结果就是,网球击中橡皮鸭的视频看起来很美,鸭子却纹丝不动。
中科院自动化所模式识别国家重点实验室的团队在PhiZero论文中引用了福尔摩斯的一句话作为题记:"You see, but you do not observe."——你看到了,但你没有观察。这也是他们对现有视频模型的诊断。
PhiZero的解题思路由此清晰:在视觉输入和视频输出之间,插入一个专门描述"世界状态如何转移"的中间层。这个中间层就是物理语言——它不关心画面,只关心变化。
先推理后渲染:拆开PhiZero的两个引擎
PhiZero的核心架构由两个模块组成,执行一条"先推理,后渲染"(reason-then-render)的流水线。
物理语言分词器负责把视频"翻译"成符号。它先用时空编码器压缩视频,再用一个过渡级Q-Former逐一分析相邻帧之间的差异,提取出有时序的变化特征。FSQ量化把这些连续特征映射为约25000个离散符号。
最关键的设计在于第一帧的单独处理:扩散解码器(基于Wan2.2-5B)以第一帧和物理语言序列为条件重建视频——第一帧锚定了场景外观,物理语言符号只需要编码后续的运动轨迹和交互结果。为防止解码器走捷径,训练初期所有中间帧被替换为纯噪声,迫使模型真正依赖物理语言来推断变化。
物理语言推理器负责"预测未来"。它从一个预训练的视觉语言模型(Qwen3-VL-4B)初始化,在原词表上追加了25000个物理语言原子符号。
输入当前帧和文本形式的动作意图,推理器自回归地预测描述未来状态转移的符号序列。训练时,文本描述被刻意控制为高层次的动作指令(如"把杯子放到桌上"),而非详细过程叙述——防止模型学会从文字到符号的机械翻译,而不是真正的物理推断。
训练数据经过多层筛选:从5万小时互联网视频池出发,经过去重和质量过滤后保留约1万小时用于分词器预训练;加入仿真数据后形成约500万段4秒视频用于精细化微调。
最终筛选出约100万段运动丰富、交互清晰的片段用于推理器的SFT。
四个SOTA,Token暴减175倍:数字不会说谎
PhiZero在四个物理推理基准上全部取得最优,且每一项的对比对象都是各自领域的强模型。
Physics-IQ Verified基于66组真实物理实验录像,通过比对生成视频与真实视频在关键区域的重叠程度打分。PhiZero的IQ-Score达到41.2,压过Cosmos3-Super的39.5和Sora 2的26.5。
PhyGround评测固体力学、流体动力学和光学共13条物理定律的遵循情况,PhiZero的3.01分同样第一,超过Veo3.1的2.85和Wan2.2-14B的2.90。
WorldModelBench覆盖自动驾驶、机器人操作等7个领域,PhiZero在物理一致性上拿到4.88分,远超Wan2.2-5B的4.51。在理解侧的IntPhys2上,PhiZero以56.34%的总体准确率超过了GPT-4o的53.75%和Gemini-2.5 Flash的55.63%。
消融实验揭示了几个设计决策的分量。去掉预训练扩散解码器是影响最大的改动——三项重建指标全面下滑。去掉过渡级Q-Former(改用全局特征提取)同样导致性能退化,验证了逐帧变化建模的价值。
在推理器侧,直接用Wan2.2-5B生成视频仅得21.2分;加入精心设计的文字提示后提升到26.6分。PhiZero不使用仿真数据为37.7分,不加两阶段训练为39.2分,完整版41.2分。每一步改进都在物理一致性上留下了可测量的增益。
Token压缩方面:同一段4秒33帧视频,Wan2.2 VAE需要44800个连续视觉token,PhiZero的物理语言分词器仅需256个离散符号——少175倍。
在重建质量上,PhiZero的PSNR(28.9 dB)、SSIM(0.903)和LPIPS(0.087)三项指标均优于Video-LaVIT和VideoFlexTok等竞争方法。
人形机器人、自动驾驶、零样本迁移:物理语言能走多远
物理语言的真正价值不在压缩视频,而在于它把"变化的方式"和"看起来像什么"分开了。一段倒酒视频的物理语言序列,换一个杯子、换一种液体、换一个背景,解码出来的视频依然忠实保留倾倒的流体轨迹——因为变化的结构没变。
这个特性最直接的体现是零样本跨形态动作迁移。拍摄一段人体运动视频,编码为物理语言,把第一帧里的人替换成宇树G1人形机器人或Sharpa灵巧手,再用同一串符号序列解码——机器人就"学会"了对应的动作,全程不需要任何人机配对训练数据。
同样的逻辑可以用于仿真到现实的迁移:仿真环境里的机械臂操作视频编码后,第一帧换成真实风格照片,解码即可得到"在真实厨房里操作"的视频。
在可控世界模型方向上,研究团队将PhiZero适配到了nuScenes自动驾驶和AGI-Bot RealRobot机器人操作两个领域。驾驶场景下,系统接收车辆轨迹的时序坐标文本,生成的视频能够区分"轻微右转"和"急速右转"的差别。
机器人操作场景下,输入各关节角度和末端执行器姿态的时序数值,系统能准确还原抓握和释放物体的动作。
研究团队在论文中也坦率列出了局限。物理语言目前是从数据归纳出的经验表示,所学符号尚未直接对应速度、质量、力等人类可解释的物理变量。
触觉交互、微观粒子运动等在视觉上不可见的物理过程,模型的覆盖能力天然受限。当前模型规模和数据量相对于物理世界的复杂度仍属有限——但论文指出,在现有尺度上已取得的较好结果表明这条路径具备进一步扩展的潜力。
世界模型撞上了一条分岔路
2024年以来,世界模型赛道的共识是"更大模型、更多数据、更高分辨率"——Sora、Veo、Cosmos、Wan系列轮番刷新视频生成的视觉质量上限。
但正如PhiZero论文开篇所诊断的:如果目标是为Physical AI服务,核心目标必须超越视觉保真度,转向学习物理世界如何演化。
PhiZero用一条不同的路径回答了这个问题。它没有试图在像素空间里让神经网络隐式地"悟出"物理,而是把物理推理变成一个显式的、可优化的符号预测任务。
256个符号承担了44800个视觉token都无法独立完成的物理一致性,这一事实本身就是对纯像素路线的有力反驳。
这不意味着像素预测路线已经过时。PhiZero的扩散解码器本身仍然是像素生成模型,它的成功恰恰说明分工的价值:物理推理和视觉渲染被拆成了两个可以分别优化的问题。
对机器人、自动驾驶和具身智能而言,物理语言提供了一个跨形态共享的接口——人类视频中的运动经验,存在一条绕过逐形态配对训练的迁移路径。至于这条路径能延伸到多远,256个符号够不够描述更长时域、更复杂交互的物理过程,还有待更大规模的检验。
论文和所有演示已完整公开在上。