AREX Feed Article
Lightwheel 与 Hugging Face 开源 EgoSuite-Open100K:10 万小时第一人称工作数据可商用
8 月 21 日,Hugging Face 官方 LeRobot 账号宣布,与 Lightwheel 联合发布 EgoSuite-Open100K:一个 10 万小时、全标注的第一人称(egocentric)人类工作数据集,含 15,000+ 任务、15,000+ 真实场景,标注手部与身体姿态,部分数据带腕部相机视角,采用 LeRobot 格式,面向学术研究与商用训练开放。 称其覆盖厨房、卧室、仓库、产线等 7 类环境、128 种场景,并写道:"Always great to see a dataset at this scale released openly on the Hub"(看到这种规模的数据集在 Hub 上开放发布,总是很棒)。
10 万小时并非一次全部上线。约 45 分钟后,Lightwheel 官方账号跟进发布,说明"首批 1 万小时现已上线,其余分阶段放出"。 同时强调数据"Licensed for commercial training, not research-only"(授权商用训练,而非仅限研究)。
Hugging Face 上的把整个发布称为"最大的全标注开源第一人称人类数据集";10 万小时、15,000+ 任务这些数字目前均为发布方公告口径。
首批 1 万小时已上线,下载要先过审核
集合目前包含 3 个数据仓库:EgoStandard(9 万小时头戴视角)、EgoPro(1 万小时头戴加腕部视角)和 EgoDemo(50 小时样例)。说明,EgoDemo 是入门入口,覆盖全部四条 SKU 并额外提供两类原始视频,数据直接存放在仓库里,可用 huggingface_hub 按子目录选择性下载。
数据不是点开就能下。三个数据集页面都要求先提交访问申请,官方称审核需 2-3 个工作日。显示,标注片段同时提供 LeRobot v3.0 与 MCAP 两种格式。同一段 episode 用同一 UUID 关联,官方提醒两者是同一批数据的两种表示、不能相加;原始视频另以 MP4 存放。
许可方面,EgoStandard 页面标注的协议为 commercial-training-no-resale-v1.0(可商用训练、不可转售)。隐私处理上,官方称所有录像先经自动化脱敏流水线、再经人工核验,发布前模糊人脸、车牌等个人信息。EgoDemo 卡片还写明,采集参与者均签署了覆盖采集、标注与受控发布的知情同意。
10 万小时从哪来:9 万头戴视角加 1 万腕部相机
10 万小时由四条 SKU 拼成:EgoStand 8 万小时(头戴视频加左右手姿态)、EgoStand-body 1 万小时(再加全身姿态)、EgoProStandard 8 千小时(头戴加腕部视频加手姿态)、EgoProStandard-body 2 千小时(再加全身姿态)。写明,腕部相机只覆盖 EgoPro 这 1 万小时,用于近距离接触与抓取场景;行业媒体 Humanoid Robotics Technology 的称,这是因为腕部视角能补上第一人称画面里手部被遮挡时的接触信息。
姿态数据以 float32 世界坐标存储:左右手各 21 个关键点、全身 22 个关键点,四元数按 (qw, qx, qy, qz) 排列。事件级语义标注(动作分段、操作对象)作为免费附加项提供,不在标准 SKU 定义之内。
官方还特别说明,15,000+ 任务、15,000+ 场景是集合层面的覆盖数字,不是单个仓库的计数。场景多样性按 Humanoid Robotics Technology 的梳理:7 类环境(家居、酒店餐饮、零售、体育、物流、办公、工业)、128 种场景类型、18 类任务(装配安装、备餐烹饪、库存管理、工具使用、维修保养、打包分拣等)。同一篇报道还提到,数据集由一支分布在全球的采集队伍按统一流程产出,规模在已开源的第一人称人类数据集中属前列。
第一人称数据为何成了稀缺资源
这次发布要解决的问题,Lightwheel 在 2025 年 12 月 4 日介绍 EgoSuite 时就讲过:把机器人训练数据比作一座金字塔,底层是海量但缺少接触信号的网页视频,顶层是价值高但无法规模化的真机遥操作数据,第一人称人类数据位于两者之间——不需要机器人硬件就能大规模采集,又直接记录人手与物体的接触和操作。
支撑"规模"的是一套全球采集网络。按同一篇文章的说法,Lightwheel 在 7 个国家、500+ 环境并行采集,每周产出 2 万+ 小时示范,已交付 30 万+ 小时第一人称数据;采集设备包括头戴 VR 单元、外骨骼式捕捉系统和 UMI 对齐的夹爪接口,记录 RGB-D、姿态与触觉信号。
发布方把这次开源放在"规模定律"的叙事里。Lightwheel 在公告中称:"Physical AI has a scaling law of its own now, and its input is human data. That part is settled."(Physical AI 现在有了自己的规模定律,它的输入是人类数据,这一点已经尘埃落定。)Humanoid Robotics Technology 补充了背景:NVIDIA 的 EgoScale 工作曾在 20,854 小时第一人称视频上观察到对数线性规模定律,Dyna 又把它从一千小时外推到一百万小时。
发布前 Lightwheel 已经围绕这个方向站队:7 月 8 日它宣布参与 EgoVerse 生态,称将围绕"经训练验证、宽松许可的数据"与研究者、数据伙伴和基础设施团队共建开放生态。
发布首日:"开源是新的护城河"
公告发出后,X 上最早一批引用推文来自机器人圈。新加坡国立大学助理教授、前 NVIDIA 与 Allen AI 机器人团队成员的 Jiafei Duan 引用 Lightwheel 的公告写道:"Open source is the new moat."(开源是新的护城河)。
基于 LeRobot 构建产品的 UMA Robots 联合创始人兼 CEO Remi Cadene 评价:"Super cool release!"(非常酷的发布)。 Hugging Face LeRobot 团队成员 Pepijn 则称这是"对开源机器人生态的惊人贡献"。
也有声音把关注点从数据量移向数据处理。在 WorldArchiveAI 做多模态机器人学习数据的 Shubham Agarwal 引用公告说,很快会出现 100 万甚至 1,000 万小时的开源机器人数据,"到那时,采集更多数据可能不再是最大瓶颈",难点会变成摄取、索引、质检、标注与检索这些让数据真正进入训练管线的环节。
Open100K 只是第一层
对 Lightwheel 来说,这次开源不是一次性的数据捐赠。它在公告里说:"We build the data infrastructure for Physical AI. Open100K is the first public layer of it."(我们为 Physical AI 构建数据基础设施,Open100K 是它的第一层公开层。)
Humanoid Robotics Technology 的报道也写道,Open100K 不是终点,后续开源什么取决于数据在实践中的表现。发布方想推动的事情之一,是让目前仍然碎片化的采集约定、标注 schema 与数据格式收敛到共享标准。
眼下能核实的事实止于发布方公告:数据集已在 Hub 上、首批 1 万小时已开放申请、许可允许商用训练。10 万小时的完整构成是否如公告所述,其余 9 万小时以什么节奏放出,要等后续批次上线才能检验。