AREX Feed Article
WUJI 开源 MINT:从第一人称 RGB 视频重建相机轨迹与双手运动,公开 560,649 段视频标注
9 月 10 日,WUJI 的官方 X 账号(@wuji_global)发帖宣布 。帖子列出的开放清单包括模型权重、训练与推理代码、可视化与评测工具、EgoPipeline 参考代码,以及 560,649 段第一人称视频的结构化标注,这些视频合计约 1,021 小时。
按 WUJI 的介绍,MINT 能从一段普通的第一人称 RGB 视频里直接重建出相机在三维空间中的运动轨迹,以及双手在同一个世界坐标系下的位置与姿态;重建出的手部动作还可以重定向到 WUJI 的机械手 WUJI Hand 上。相关论文已于 9 月 4 日提交到 。
开源清单:权重、代码、工具与标注数据
这次开源的具体范围, 和 里都有逐项列出。仓库以 MIT 许可证发布,其发布状态表列出:MINT 的模型权重(checkpoint,约 11.39 亿参数)、推理代码与 Web Viewer(浏览器界面)、训练代码、评测实现与命令行工具、EgoPipeline 的编排、清洗与 LeRobot(一种机器人数据集格式)导出参考代码、视频规范化与手部过滤脚本、Wuji Hand 的机器人模型文件(URDF/MJCF/STL)与重定向代码,以及 HOT3D、ARCTIC 的零样本结果表。
权重和标注数据同时提供 Hugging Face 与 ModelScope 两个渠道:权重在 与 ,数据在 与 。数据集页标注 MIT 许可,总文件体积约 21.2 GB,内容为不含视频的结构化标注:字段覆盖相机平移、相机四元数、相机视场角,以及左右手在相机坐标系的 MANO 参数(MANO 是一种参数化手部模型)、手部状态标记等。
开源范围也有边界:仓库写明,公开版本不包含完整的生产数据管线,受许可限制的管线适配(改造过的 HaWoR 源码、相关权重与 MANO 手部模型)无法随仓库分发;MANO 需要在官方站点注册并接受许可后自行下载,源视频则要按 Ego4D、EgoDex、EPIC-KITCHENS-100 各自的访问条款获取。推理门槛同样具体:Web Viewer 要求 NVIDIA 显卡,显存不低于 24 GB;界面里可以加载 checkpoint,对 mp4、mov、avi、mkv、webm 格式的第一人称视频跑推理,查看轨迹与手部叠加、逐帧指标并导出结果。项目页列出的作者单位包括上海科技大学、清华大学、舞肌科技、香港大学与浙江大学。
一个模型四个头:把相机、视场角与双手放进同一套表示
第一人称运动重建的常规做法,是把它拆成相机标定、单目深度、SLAM(同步定位与建图)、手部重建、轨迹清理等多个阶段,模型各管一段,误差会在阶段之间传递,部署时要协调多套依赖。仓库在解释 MINT 的设计动机时描述了这条路线,并把 MINT 定位为用单个模型替代它。
MINT 的处理方式是:输入视频被切成 32 帧的窗口,共享的时空表示(骨干网络为 LingBot-Map / GCT)之后接四个预测头,分别输出相机外参、视场角、相机坐标系下的 MANO 手部参数(左右手)与逐帧手部存在性。世界坐标系的输出由显式刚体变换把相机与手部预测组合而成,推理时不使用深度图,也不使用点云。长视频按重叠窗口处理,窗口之间对齐相机轨迹、融合手部预测。
训练分两个阶段:第一阶段用 EgoPipeline 生成的监督数据预训练;第二阶段从第一阶段的权重出发,只用一小批高精度相机轨迹数据训练相机头,几何编码器、手部、存在性与视场角模块保持冻结。开源的是第二阶段产出的 checkpoint。论文摘要称,MINT 是「首个直接从第一人称 RGB 视频生成完整世界坐标系双手轨迹的基础模型」;「首个」是论文作者的口径。
监督数据从哪来:EgoPipeline 与三份公开数据集
MINT 的训练监督由项目生成的伪标签提供:因为同时带世界系相机与手部标注的数据稀缺,项目先实现了一条传统多阶段管线 EgoPipeline 来批量生成标注,流程为:预处理与过滤(规范化帧率、分辨率与时长,剔除无手或超过两只手的片段)、GeoCalib 估计相机内参、MoGe-2 估计单目深度、MegaSaM 或 DROID-SLAM 给出度量相机轨迹、HaWoR 给出相机坐标系 MANO,最后做离群点剔除、间隔插值与时序滤波。仓库强调,EgoPipeline 的输出是「伪标签,不是真值」,HaWoR 提供的手部标签同样保留重建误差。
数据由三份公开的第一人称数据集加工而来:Ego4D 332.874 小时、EgoDex 633.446 小时、EPIC-KITCHENS-100 55.194 小时。经过滤与清理后保留 1,021.514 小时、560,649 段、110,323,558 帧,约为 1,729 小时原始素材的 59.1%。公开发布的是不含视频的标注;仓库还提示,发布数据中的相机轨迹存在明显的尺度放大,只建议用于预训练,不要用于真实尺度评测或当作真值。
EgoPipeline 在这套体系里的定位是监督生成器,不出现在部署路径上;仓库开放的也只是编排、接口、清洗与导出部分的参考实现。
自报评测:零样本手部指标靠前,相机轨迹不是强项
评测在 HOT3D 与 ARCTIC 两个公开基准上进行,MINT 对二者均为零样本:两个数据集都没有用于它的两阶段训练。手部评测采用覆盖感知(coverage-aware)协议:漏检的手也留在评测里,按一个标准 MANO 占位模型的误差计罚。按项目页的说明,MINT 的结果来自项目自己的最新评测,表中其他方法的数值沿用 ViDiHand 评测。
按项目方公布的结果,推理阶段加装无迹卡尔曼滤波(UKF)后,手部抖动明显下降:HOT3D 从 12.057 降到 2.373,ARCTIC 从 12.77 降到 2.67,单位为 mm/frame²。F1 在 ARCTIC 与 HOT3D 上分别为 0.978 与 0.953,均为表列方法中最高。
仓库自己写明「ATE 并不是这个 checkpoint 取胜的地方」:HOT3D 上 MINT 的全序列 ATE 均值为 181.7 毫米,DROID-SLAM 为 49.1 毫米;弧长比在 HOT3D 与 ARCTIC 上分别为 1.094 和 1.412;该比值按真值路径长度除以预测路径长度计算,1 为目标值,大于 1 意味着预测路径偏短。第二阶段微调在 HOT3D 上把 ATE 从 524.7 毫米降到 181.7 毫米,在 ARCTIC 上则从 63.7 毫米升到 81.9 毫米。
吞吐方面,项目在 RTX 4090D、512×384 分辨率、30 fps 条件下测得稳态单帧边际成本 72.4 毫秒(单卡,13.8 fps),四卡为 22.7 毫秒(44.1 fps),相对对比基线 VITRA 分别为 17.4 倍与 12.5 倍。上述评测结果与吞吐数字均为项目方自报;项目同时发布诚信声明,承诺所报指标均为按所述评测协议实际运行所得、不修改原始数值,并把指标定义、对齐规则、聚合逻辑与报告代码放在评测目录里供检查。
从 21 个关键点到 20 个自由度的 WUJI Hand
项目页展示的另一项能力是重定向:重建出的 21 个手部关键点可以映射到 20 个自由度的 WUJI Hand。仓库包含 WUJI Hand 的机器人模型文件(URDF、MJCF、STL)与重定向代码,项目页也给出 MuJoCo 仿真和 WUJI Hand 重定向的真值/预测对比可视化。
项目页写道:「我们希望 MINT 可以让所有人具备生产 Ego 数据的能力,推动 Ego 数据走向更大规模的生产与验证。」
WUJI 的 现有 28 个公开仓库,页面上列出的代表仓库包括做手内转位强化学习与仿真到现实(sim-to-real)部署的 wuji-mjlab、手部姿态重定向系统 wuji-retargeting、控制 SDK wujihandpy,以及提供 URDF 与 MJCF 模型的 wuji-hand-description。MINT 则属于模型与数据一侧的发布。
仓库列出的限制与待办事项
项目页的「局限性与后续工作」列了三条:相机坐标系下的手部估计仍受伪标签质量制约,手部预测头尚未基于高精度数据二次微调;第二阶段用于微调相机轨迹的监督数据虽优于传统管线生成的数据,但与真值之间仍有误差;受 32 帧训练窗口限制,模型处理长序列时仍可能出现累积漂移。
复现数据生成的全链路还有一处缺口:把清洗结果打包成训练用 LeRobot 数据集的最后一步不在发布范围内。
「尺度修正后的相机轨迹」在仓库的发布清单里仍标着进行中;项目页给出的下一步,是补充更准确、更多样、带度量尺度的监督数据,并解决长视频中的轨迹漂移。