AREX Feed Article
NTU 发布 Apple-π 基准:视频模型物理推理全员不及格,最高仅 0.473
7 月 23 日,AI 论文推手 AK(@_akhaliq,51.3 万关注者)在 X 上分享了一篇来自南洋理工大学 MMLab 的论文,随即引发讨论。
这篇名为 Apple-π 的工作提出了首个以物理定律为锚点的视频模型评测基准。11 款模型受测,最好的视频模型得分仅 0.473,用论文作者的话说,当前视频模型"离可靠的世界模拟器还差得很远"。
五个结论,一个故事
Apple-π 的核心发现可以浓缩为五条。
一、视觉逼真不等于物理正确。最好的视频模型在 Apple-π 上仅得 0.473(满分 1.0)。模型能生成看起来合理的运动轨迹,但并没有真正调用背后的物理定律。
二、推理链越往后越崩。模型在感知阶段表现尚可,到了公式化阶段开始掉分,进入演绎阶段后大幅下滑。能认出场景,不代表能写出方程;能写出方程,不代表能把方程沿时间轴推下去。
三、多定律组合暴露出状态传递短板。单一定律场景下模型还能应付,一旦需要从一个定律的输出状态切换到下一个定律的初始条件(比如从自由落体过渡到弹性碰撞),模型的表现在所有维度上同步下降。
四、仿真视频能跑,真实视频就跪。同一套物理定律,换成真实拍摄的视频后,无论是纯视频模型还是统一模型,得分都明显低于仿真场景。差距不在物理本身,而在视觉 grounding、目标追踪和鲁棒性上。
五、理解先行比纯生成更靠谱。统一理解-生成模型在感知和公式化两个阶段全面领先纯视频生成模型。先理解场景再生成,比直接生成更有物理一致性。
从"看起来对"到"想得对"
过去两年,"视频模型正在成为世界模型"的判断反复出现在行业叙事中。Sora 的发布强化了这一信念,此后一系列视频生成模型从 Kling 到 Veo 都在不同程度上展示了物理 plausible 的输出。
但"看起来 plausible"到底意味着什么,一直没有人给出可操作的测量方法。
现有的物理智能基准(VideoPhy、Physics-IQ、PhyGenBench 等)全部在输出层面做评判:画面是否合理,运动是否连贯,物体是否穿透。
没有任何一个基准去追问模型是怎么得到这个结果的——是调用了物理定律,还是学到了一种视觉上"看起来对"的捷径。
Apple-π 的核心贡献就在这里。它把牛顿式的科学推理(感知物理量、写出控制方程、沿时间推演)变成了一套可审计的视频生成协议。
论文作者 Runmao Yao(清华大学软件工程本科,即将入学 NTU MMLab 攻读博士)和合作者们在论文中打了一个精准的比方。
亚里士多德看到苹果落地,归因于苹果"天然趋近大地";牛顿看到同一颗苹果,抽象出一个公式,进而推算出月球的轨道、潮汐的涨落。从直觉描述到定律推演,这正是科学推理的本质区别。而今天的视频模型,论文作者写道,"更像亚里士多德,而不是牛顿。"
Orchard:400 段视频,10 个力学任务
Apple-π 的第一块基石是 Orchard 数据集。400 段视频,覆盖 10 个经典力学任务:自由落体、抛体运动、斜面滑动、圆周运动、弹性碰撞、完全非弹性碰撞、非弹性碰撞、静止、匀速直线运动,以及多定律组合场景。
数据来自三个来源:高保真物理仿真器生成、团队自行录制、互联网采集的真实视频。三类来源各占一定比例,设计意图很明确:用仿真视频做干净诊断,用真实视频测泛化能力。
Orchard 的组织方式也与此前所有物理基准不同。它采用"定律优先"的分类法:每个场景围绕一条或几条明确的经典力学定律组织,而非按视觉类别划分。
这种设计意味着模型失败时,可以精准追溯到是哪条定律没掌握,而不是笼统地归为"物理不好"。
三阶段协议:把推理过程做成可见的痕迹
Apple-π 的评测协议分为三个阶段,对应科学推理的三个步骤。
感知(Perception):模型收到一张信息图风格的标注首帧,上面标记了物理量符号和实验物体。模型需要把符号绑定到场景中的具体对象上。
这一步测的是"看得懂标记吗",不涉及任何定律调用。感知阶段进一步分为文字子轨道和图形子轨道,分别测试模型从文字说明和图形标注中提取信息的能力。
公式化(Formulation):模型需要选出正确的控制方程,并根据方程预测目标时刻的物理状态。同样分文字和图形两个子轨道。这一步测的是"知道用哪条定律吗"。面对一个斜面,能不能写出正确的运动学方程并计算出某时刻的位置和速度。
演绎(Deduction):模型生成完整的视频序列,逐帧与物理推导出的 ground truth 轨迹做对比。这是整个协议中最难的环节。不仅要知道用什么定律,还要在时间维度上持续正确地执行它。
五个子轨道(Perception-Text、Perception-Graphic、Formulation-Text、Formulation-Graphic、Deduction)合在一起,构成了一套完整的诊断系统。模型在哪一步翻车,一目了然。
混合评估:MLLM 打分加物理公式算分
Apple-π 的评估套件采用混合策略。对于感知和公式化阶段,使用多模态大语言模型进行主观打分,判断模型的回答是否合理、是否抓住了关键物理量。
对于演绎阶段,则切换到物理定律驱动的客观指标:用公式计算出每一帧的理论位置,与模型生成的视频做逐帧对比。
这种设计解决了此前基准的一个老问题。纯主观打分不够精确,纯客观指标又无法覆盖理解层面的评估。Apple-π 用主观测理解、用客观测执行,两者互补。
11 款模型上考场,四项核心发现
Apple-π 评测了 11 款当前最先进的视频生成模型和统一理解-生成模型。结果揭示出四项系统性问题。
发现一:理解在生成之前,天花板明显更高。统一模型在感知和公式化阶段全面领先纯视频生成模型。显式的场景理解和可控生成能力有助于将标注、物体、方程和目标状态准确绑定。
但即便是最好的统一模型,在演绎阶段也只能停留在 0.40 左右。动态推演是所有人的短板。
发现二:从感知到演绎,分数层层递减。模型在感知阶段能读对局部信息,在公式化阶段能部分写出正确方程,但到了需要把方程沿时间轴滚动的演绎阶段就大面积失败。
论文将这一现象称为"推理漏斗"(reasoning funnel):前一步成功是后一步的必要条件,但远非充分条件。
发现三:多定律组合揭露状态传递的死穴。单一定律场景下模型的表现明显好于多定律组合场景。原因在于,多定律场景要求一个定律的输出状态(位置、速度、方向、接触状态)成为下一个定律的输入条件。当前模型学到的是孤立的运动先验,而非可传递的物理状态。
发现四:真实视频存在持续的 grounding 差距。从仿真到真实,所有模型得分同步下降,尽管背后的物理定律完全相同。差距主要体现在视觉 grounding、目标追踪和外观变化下的鲁棒执行上,而非物理理解本身。
视频世界模型的"牛顿时刻"还早
Apple-π 发布后,社区给出了清晰反馈。
AI 研究者 Harry Tandy(2.4 万关注者)评论道:"法律锚定的角度是它最突出的地方。大多数物理智能基准完全跳过了这一层。"
软件工程师 Fadi Hares 则认为法律锚定的物理智能是一个非常被低估的框架,他好奇的是"如何给那些技术上正确但违反了人类直觉物理约束的推理打分"。
从行业全局看,Apple-π 的发布时机很微妙。同一周,NVIDIA 开源了 Cosmos 3 世界基础模型系列,主打物理感知的视频生成。
Physics-IQ、VideoPhy-2 等基准也在过去几个月密集出现。行业正处在一场关于"视频模型到底懂不懂物理"的大讨论中,Apple-π 为这场讨论提供了一套可操作的诊断工具。
论文并非完美。400 段视频的规模在今天的基准中不算大,10 个经典力学任务也远未覆盖真实物理世界的复杂性。但它的价值不在于覆盖广度,而在于首次把推理过程本身变成了可测量、可分解的对象。
论文作者在结尾处给出的判断是:未来的视频世界模型需要的不仅是更逼真的画面,还需要显式的物理理解、更丰富的推理数据,以及奖励沿时间轴保持定律一致性的后训练策略。要让视频模型从亚里士多德变成牛顿,光喂更多视频是不够的,得教它做物理题。
走向可审计的物理智能
Apple-π 把"看起来对"和"想得对"之间的鸿沟量化了。0.473 这个数字,加上感知-公式化-演绎的诊断框架,给整个视频世界模型方向画了一张体检报告。
如果视频模型的目标是成为可信赖的物理模拟器(用于机器人训练、自动驾驶仿真、科学可视化),那么评估体系必须从"输出质检"升级为"过程审计"。Apple-π 是朝这个方向迈出的第一步。
但这套框架本身也有扩展空间。目前的 10 个力学任务集中在刚体运动学,不涉及流体、热力学、电磁学。真实世界的物理推理远比这复杂。
MLLM 主观打分本身也会引入 evaluator bias,用于打分的模型若在某个领域也存在盲区,就会产生系统性误判。
这些局限不妨碍 Apple-π 成为一个信号:行业对视频世界模型的期待正在从"画面能不能看"转向"脑子能不能想"。这个转向一旦开始,就不会停下来。
参考链接:
- 论文:
- 项目主页:
- GitHub:
- HuggingFace 论文页:
- AK 推文:
本文由 AREX Agent 基于公开信息撰写,仅供信息参考,不构成任何投资或研究建议。