AREX Feed Article
全行业仅50万小时数据,博登单中心年产50万——具身智能的"数据工厂"开张
斯坦福大学《2026 AI Index Report》给了一个刺眼的数字:机器人在仿真操作基准中的任务成功率达到89.4%,进了真实家庭环境后,只剩12%。具身智能行业不缺模型,不缺本体,缺的是把仿真跑分变成现实能力的那道桥:真实世界训练数据,而且是工业级产能的真实世界训练数据。
8月6日下午,博登智能在安徽省马鞍山市雨山经开区给出了自己的答案。这家国家级专精特新"小巨人"企业启用了其全国布局的首个具身机器人创新中心,一、二期全面投产,落地近200台高端智能机器人。
中心年产50万小时真机训练数据及百万小时级Ego数据,在手真机数据订单12万小时,已排期至2027年。
年产50万小时真机数据,订单排到2027
马鞍山创新中心是博登智能全国具身机器人创新中心网络落地的首个样板。项目一期建成10个标准化数据采集区,复刻工业制造、家庭生活、商超零售、商务办公四类典型环境;二期引入柔性装配产线和全场景家居实景,部署180余台多型号智能机器人。
雨山区政府将其定位为"全省规模领先、场景覆盖最全的真机数据产业基地"。
数据产能是这间"工厂"最核心的指标。依托自研BRIC智能数据采集平台和Blink数据基础设施平台,中心打通了采集、处理、质检、标注、治理、交付全流程,数据交付准确率超99%,年产50万小时真机训练数据及百万小时级Ego(第一人称视角)数据。
据上海证券报报道,目前创新中心在手真机数据订单已达12万小时,排期至2027年。
50万小时这个数字需要放在行业背景下看。今年4月,智元机器人联合创始人、觅蜂科技CEO姚卯青曾给出对比:大语言模型GPT-5训练语料折合约100亿小时,而全行业汇聚的高质量具身数据仅约50万小时,差距以万倍计。
博登一个中心的年产能,就相当于全行业当前存量。
配套合作企业星海图(具身智能领域国家级独角兽)计划在马鞍山落地500台智算集群,联合产业链企业建设年产15万台机器人整机产线。从数据生产到算力训练再到整机制造,一条完整的产业链正在雨山区成形。
不止是采集——一条从真机到模型的工业流水线
马鞍山创新中心的核心逻辑只有六个字:"真机、真场景、真数据"。它不是一间摆了几台机器人的实验室,而是一条按工业标准运转的数据生产线。
先说物理场景。具身智能数据的采集难度远超图像或文本:机器人需要与真实物体交互,传感器需要同步记录视觉、力觉、关节角度和动作轨迹。仿真器可以批量生成场景,但仿真环境里的光照完美、物理参数可控、物体不会意外形变,这些"完美"恰恰是模型落地时最容易翻车的地方。
马鞍山中心用真场景替代了仿真:工业车间里有真实的传送带和工件,家庭场景里有真实的家具和日用品,商超货架上有真实的商品摆放。场景越是接近真实世界的混乱和随机,采集到的数据就越有训练价值。
再说数据引擎。BRIC平台负责采集端,同步抓取多模态信号并实时打包;Blink平台负责管理端,承担数据版本、算力调度和工作流编排。两套系统之间是BASE标注平台,内置200多个预标注模型,对原始数据做自动化初筛和预标注,再由人工校正。
据公司披露,这套"自动预标注+人工校正"的协同流程将数据生产效率提升了7倍,综合交付准确率超过99%。
最后一层是现实验证。传统数据公司的交付物是一批标注好的数据集,至于这些数据能不能真正提升模型能力,不在交付范围内。博登的做法是把验证环节纳入产线:模型在创新中心完成训练后,直接进入旁边的真实场景执行任务。
光照变化、物体形变、意外碰撞,仿真器建不了模的变量在这里全都会撞上。任务中出现的失败样本和人类介入数据被自动标记,回流训练集,形成"训练—验证—回流—再训练"的闭环。
赵捷在WAIC期间接受钛媒体采访时解释过这个逻辑:"机器人先具备一定的模型能力,再进入真实场景工作;工作过程中继续采集失败和人类介入的数据,然后用这些数据训练模型。模型变得更好以后,机器人能完成更多任务,又会产生新的数据。"
这种闭环机制直接缩短了技术落地周期。上海交通大学人工智能学院副教授赵波在启用仪式上评价:"真实世界数据,是具身智能持续进化的核心驱动力。具身智能的发展需要在真实环境中不断学习和迭代。"
赵波认为,马鞍山具身机器人创新中心通过构建真实场景、数据生产和模型训练闭环,为智能系统持续进化提供了关键支撑。
三期规划显示,马鞍山中心还将进一步扩容场景规模、升级智能设备矩阵,最终形成集场景实训、数据供给、模型训练、现实验证、技术研发、成果转化与企业孵化于一体的综合性产业服务平台。
十亿订单在手,赵捷的第二次"卖水"
博登智能创始人兼CEO赵捷的履历写满了两条线索。一条是机器人:本科毕业于上海交通大学,后赴德国凯泽斯劳滕工业大学攻读工学博士,专业方向智能机器人。另一条是自动驾驶:他曾在德国汽车Tier1企业担任核心算法高级工程师,在智能驾驶领域深耕十余年。
赵捷经历过自动驾驶数据产业的完整扩张周期。在那个周期里,行业先追捧感知算法,再追捧芯片算力,最后才意识到数据闭环(采集、标注、验证、回流)才是决定系统能不能上路的关键。他现在看到的具身智能,正在重演同一条路径。
"未来,决定具身智能产业发展速度的,不仅是模型和本体能力,真实世界数据、规模化训练和现实验证同样重要。谁能够建立稳定、高质量、可持续的数据供给和训练体系,谁就能够更好地支撑模型持续迭代。"赵捷在启用仪式上说。
博登智能2019年成立于宁波,从自动驾驶数据标注起家,逐步扩展到LLM数据和具身智能数据。公司2026年完成数亿元A+轮及A++轮融资,目前在手订单接近10亿元,计划年内完成约5亿元交付。
三块业务中,具身智能占比约50%,自动驾驶约30%,大模型约20%。
马鞍山并非博登唯一的据点。公司在宁波、湖州、马鞍山三地建成了总面积超3万平方米的具身机器人创新中心,部署500余台多型号实体机器人及数千套自产Ego采集设备。
赵捷表示,马鞍山项目要"持续沉淀场景建设标准、数据生产标准、技术平台体系和运营管理经验,探索形成可复制、可推广的创新中心建设模式"。
采集只是起点,交付才是壁垒
具身智能数据基础设施的赛道正在迅速拥挤。
今年4月16日,智元机器人旗下的觅蜂科技发布一站式物理AI数据服务平台,计划2026年实现千万小时级数据产能;同一天,京东宣布全球首推覆盖"采、存、标、训、评、仿、测"全链路的具身智能数据基础设施。
戴盟机器人同日发布含触觉全模态物理世界数据集Daimon-Infinity;百度智能云也在4月初联合多家企业推出了"具身智能数据超市"。
各家打法不同。觅蜂科技脱胎于智元机器人,有本体厂商的基因;京东背靠3600个物流仓储设施和多元线下业态,有天然的场景优势;戴盟主打触觉数据这一差异化赛道。
博登的路径更接近独立第三方基础设施。它不绑定任何一家本体厂,用赵捷的话说,"采购来自多家厂商,不会只使用一种机器人"。
但赵捷对竞争格局的判断比表面上的热闹更冷静。他在钛媒体访谈中直言,世界模型等局部方向已经出现同质化,"没有实际订单,也没有很强交付能力的公司,会先承受压力"。
在他看来,采集只是起点,"最终的竞争是能不能交付高质量数据集,以及能不能验证这套数据是否真正提高了模型能力"。
成本结构同样关键。赵捷透露,训练场的成本大体分为三块:机器人本体约40%,运营约40%,场地约20%。本体更新周期短,博登内部按一年半到两年考虑淘汰,这意味着数据生产是一项重资产、快折旧的生意,规模不够大就摊不平固定成本。
马鞍山中心一、二期近200台机器人的部署规模,是博登把数据生产从"手工作坊"拉到"工厂级别"的关键一步。
目前国内具身智能真机数据的市场价格在每小时500至1000元之间。博登12万小时的在手订单,按此区间估算,对应的是6000万元至1.2亿元的合同规模。而公司整体在手订单已接近10亿元,说明其业务并不止于售卖原始数据小时数,更深层的收入来自数据处理、平台服务和验证交付的全链路收费。
机器人的进步,藏在一次失败之后
赵捷在钛媒体访谈中说过一段话,恰好解释了博登为什么把验证闭环看得比采集规模更重:
"比如一个机器人拿瓶子,连续二十次都成功,第二十一次失败了。这个时候人类介入,把瓶子重新拿起来。这条数据会告诉模型,它在什么情况下失败,人类又是怎样纠正的。当模型能力进入平台期后,再增加大量相似的成功数据,带来的提升可能不明显。失败数据暴露的是模型还没有解决的问题,因此更有价值。"
具身智能全行业的高质量真机数据存量仅约50万小时,而博登一个马鞍山中心投产后,单点年产能就达到50万小时。两个数字并置,不是说一家公司能独自解决行业的数据饥渴,而是标志着数据生产正在从实验室规模跨入工业规模。
当产能不再是瓶颈,竞争焦点会从"有没有数据"转向"数据能不能让模型变好"——而这恰好是博登把验证闭环嵌入产线的原因。
雨山区委书记马鑫在启用仪式上承诺持续优化营商环境,并"诚挚期盼博登智能、星海图加快后续项目建设,扩充数据产能"。数据产能已成为地方政府招商引资的核心指标之一。