AREX Feed Article
北大开源 MiniWorld 视频世界模型,8 卡 GPU 数天即可从头训练
世界模型训练不必是大厂专属。
从 Genie 到 Cosmos,从 MAGI-1 到 SkyReels-V2,视频世界模型(Video World Model)正在成为具身智能和交互式仿真的关键能力。这类模型不满足于生成逼真画面,而是学习环境在智能体动作下的演化规律——机器人抓取杯子后桌面的变化、相机平移时场景的透视关系,都属于世界模型试图捕捉的「动力学」。
但繁荣背后有一个尴尬的事实:训练视频世界模型的主流范式,是拿 Wan 等预训练双向视频扩散模型做微调、蒸馏或强化学习。这条路线不仅管线复杂、算力开销大,更根本的问题在于——双向预训练与因果流式推理之间存在结构性错配。训练时所有帧互相可见,推理时却只能向前看,导致长期生成中的误差累积和时序漂移。
北京大学研究者发布的 给出了另一条路径。它是一个从零开始训练的流式视频世界模型框架,、和数据处理管线全部开源,在一台 8 GPU 服务器上数天即可完成训练。
论文标题: MiniWorld: Democratizing the Training of Video World Models from Scratch
论文链接:
开源地址: (代码) / (模型)
核心成绩: 在 DROID 机器人操作和 RealEstate10K 相机轨迹两个 benchmark 上,以流式生成方式超越双向滑动窗口基线,且训练仅需单台 8 GPU 服务器数天。
双向预训练的「遗产」:为什么从零训练更干净
要理解 MiniWorld 的设计动机,先看当前视频世界模型训练的三个痛点。
痛点一:训练-推理失配。 主流方案用双向 Video DiT 做固定窗口的条件生成——训练时历史帧来自真实视频,推理时却来自模型自己之前的预测。这个经典的 exposure bias 问题在长时域生成中被放大:误差沿时间轴累积,早期观测逐渐被丢弃,模型慢慢「忘记」之前的场景状态。
痛点二:管线过于笨重。 从预训练视频模型出发,需要多阶段微调、蒸馏或 RL 后训练。每一步都引入额外的超参数和工程复杂度,复现门槛极高。
痛点三:缺少透明基线。 MAGI-1 展示了分块自回归预训练的扩展性,SkyReels-V2 验证了 Diffusion Forcing 在长时域生成中的有效性——但从零训练视频世界模型的轻量级开源基线,社区里一直是空白。现有系统要么依赖闭源数据,要么追求规模扩张而非可复现性。
MiniWorld 的答案是:直接构建一个动作条件化的下一状态预测(next-state prediction)框架,训练目标就是推理目标,从根源上消除失配。
四板斧:块因果注意力、非递减噪声调度、两阶段续训、滚动 KV 缓存
MiniWorld 的方法栈由四个关键模块组成,完整描述见。
块因果 Video DiT
MiniWorld 在 Wan2.2 VAE 的潜在空间中训练一个单流 Video Diffusion Transformer,使用 Rectified Flow 作为生成框架。核心创新在于块因果自注意力(block-causal self-attention):视频序列被划分为时间上有序的块(chunk),块内 token 双向互见,跨块注意力严格因果——每个块只能看到之前的块,不能看到之后的。
这种设计的直觉是:它保留了块内的丰富时空交互(这对生成质量至关重要),同时强制模型学会「基于过去预测未来」——这正是流式推理需要的因果约束。训练和推理使用完全相同的注意力模式,不再需要事后打补丁。
非递减噪声调度与 CoPP
MiniWorld 基于 Diffusion Forcing,但引入了一个关键改进:块级非递减噪声调度。同一训练序列中的不同潜在块被分配独立的扩散时间步,但要求这些时间步沿时间轴非递减——更早的块噪声更小(更清晰),更晚的块噪声更大(更模糊)。
配合 Chunk-oriented Probability Propagation(CoPP) 采样算法,这个设计让模型在训练中就习惯了「先看到清晰历史、再预测模糊未来」的模式,与流式推理时的行为完全对齐。
两阶段续训:从 6 帧到 253 帧
训练分四个课程阶段递进,公布了完整的训练配方:Stage 1 用 6 帧潜在序列做短片段训练(100 epoch),Stage 2 扩展到 16 帧(50 epoch),Stage 3 和 Stage 4 分别推进到 32 帧和 64 帧(各 30k 步)。所有阶段使用 240×320 分辨率、bf16 混合精度和 Muon 优化器。
短片段阶段让模型快速学会基本的动作-视觉映射,长上下文阶段则逐步扩展时序建模能力,最终支持 253 帧 RGB 的流式 rollout。
滚动 KV 缓存与异步去噪
推理时,MiniWorld 维护一个结构化的滚动 KV 缓存:包含 1 个持久化的「锚帧」(sink frame)和 24 个历史块的 FIFO 队列,活跃去噪窗口保持在 8 个块以内。已完成去噪的块被提交到缓存并冻结,后续块通过因果注意力读取历史而无需重计算。
同时,未来块的去噪以流水线方式异步进行——这带来一个实用的质量-吞吐量权衡:更多并行去噪提高速度但略微损失质量,反之亦然。整个推理过程的计算量保持有界,不会随生成长度线性膨胀。
DROID 和 RealEstate10K:两个 benchmark 上的流式生成优势
MiniWorld 在 DROID(机器人操作)和 RealEstate10K(室内场景相机平移)两个数据集上进行了评估,对照基线是双向滑动窗口 Video DiT,评估方式为长时域流式生成。
在 DROID 上,MiniWorld 在外观质量(appearance)、运动动态(dynamics)、几何一致性(geometry)、VLM 评估质量和帧级保真度五个维度上均超越双向基线。论文报告了定量消融实验,验证了块因果注意力、非递减噪声调度和两阶段续训各自对最终性能的贡献。
在 RealEstate10K 上,缩放实验显示模型性能随参数量增长而持续提升——从 0.12B 到 3B 的五个规格共享同一架构,仅调整深度和宽度。目前已发布 0.5B 和 1B 两个规模的 DROID 与 RealEstate10K ,3B 版本注明即将释出。
一个值得注意的工程细节是,RealEstate10K 检查点支持从单张图片出发、沿程序化相机轨迹(如 orbit_right、zoom_in、spiral)生成视频——无需真实数据集在本地磁盘上。
一个「轻量基线」的定位:把散落的实践整合为可复现管线
MiniWorld 的贡献不在于提出全新架构,而在于把视频世界模型训练中散落在不同论文里的有效实践——Diffusion Forcing、块因果注意力、流式 KV 缓存——整合到一个干净的端到端管线中,用 Apache 2.0 协议全部开源。
「社区缺少一个轻量、透明、可完全复现的基线」,在引言中这样定位自己。在视频世界模型训练成本高企的当下,8 张卡、数天训练、完整开源——这个组合本身就是一种信号。
来源:本文基于北京大学研究团队于 arXiv 发布的论文《MiniWorld: Democratizing the Training of Video World Models from Scratch》(arXiv:2608.01127)及其配套开源代码与模型仓库撰写。
Footnotes
-
参见 MiniWorld 项目页面:
-
MiniWorld 检查点使用 Apache 2.0 协议发布: