AREX Feed Article
Perceptron AI 开源 360 亿参数具身模型 Isaac 0.5,公司称 LIBERO 平均成功率 97.2%
Perceptron AI 于 8 月 26 日发布 Isaac 0.5:360 亿参数(36B)的开源权重具身基础模型,把视频理解、具身推理与机器人控制放进同一个稀疏骨干。公司称,它在 LIBERO 机器人操作基准上平均成功率 97.2%,高于 Physical Intelligence 的 π0.5(96.9%)与 NVIDIA 的 GR00T N1.7(97.0%)。公司还报告了一条数据缩放定律:通用视频从 1,000 小时扩到 100 万小时,达到相同动作损失所需的遥操作数据从 5,884 小时降到 28 小时,约 210 倍。
模型权重已上架 ,微调与推理代码发布在 ,技术报告同步公开;。训练用了 3 万亿多模态 token,含 100 万小时通用视频与 10 万小时机器人经验,覆盖 35 个以上机器人系统。以上性能数字均为公司自述口径,来自公司新闻稿、博客与技术报告。
一个稀疏骨干,同时输出语言、坐标与动作
Isaac 0.5 总参数 36B,每个 token(词元)只激活 2.5B。骨干基于 Qwen 系视觉语言模型,文本、图像、时间、机器人状态与历史动作进入同一条序列。模型卡称,这是公司所知第一个在视频理解、具身推理与机器人控制三项上同时达到前沿水平的开源模型。
稀疏来自 Null Expert 路由:每个 MoE(混合专家)层有 256 个专家加一个空路由,一个 token 可路由到 0~8 个专家,视觉、语言、状态与动作 token 按任务复杂度动态分配算力。输出端,语言、归一化坐标、任务状态与离散动作走自回归接口,离散动作使用 2,048 个 FAST 动作 token 的词表;连续动作由 Flow expert 与 36 层 diffusion transformer 生成。
闭环控制时,模型在当前动作块执行期间就用最新观测预测下一个动作块,公司称之为实时控制训练(RTC)。训练从第一天起联合进行视频理解、空间定位、任务进度、未来感知预测与控制;感知(percept)目标让模型从后续帧自动构造任务相关状态的语义表征,比如物体是否移动、接触是否发生、抓握是否保持,目标构造不依赖人工标注与动作标签。
CTO Akshat Shrivastava 在里解释了这条设计路线:「感知、具身推理和控制不应该是彼此分离的模型。Isaac 0.5 通过一个共享骨干联合训练它们。」
数据侧,公司称训练把通用视频、egocentric(第一视角)视频与 UMI 手持夹爪数据混合配比,自建了 mHarmony 类型化编译器与 TensorStream 打包格式,用预测式分片流式、节点共享下载与隔离视频解码撑起百万小时级视频训练,相关细节写进了。
称,稀疏设定下模型 FLOPs 利用率(MFU)为 24%;报告还披露一个 48% 的致密设定,但其配方与权重未随本发布公开。
LIBERO 对比表里的并列与口径差异
技术报告的 Table 10 给出了 LIBERO 成绩:这是确定性(deterministic)的 spatial、object、goal、long-horizon 四个套件,每套件 10 个任务,用 500 条演示做基准特定适配后评测。
Isaac 0.5 四套件得分 98.0、99.0、98.8、93.0,平均 97.2;GR00T N1.7 平均 97.0,π0.5 平均 96.9。
同一张表里,MolmoAct2 平均也是 97.2:它的 object 100.0 与 long-horizon 93.2 高于 Isaac 的 99.0 与 93.0,spatial 97.8 低于 Isaac 的 98.0;π0.5 的 spatial 98.8 也高于 Isaac。新闻稿在 LIBERO 对比里只点名了 π0.5 与 GR00T N1.7 两个对手。
表注写明,各基线数字按各自论文或官方报告转录:GR00T N1.7 一行采用 NVIDIA 官方每套件 200 次评估的报告口径,MolmoAct2 数字转录自其论文(2,000 次评估 rollout),并非 Perceptron 在同一条件下重测。
少样本学习数据来自同一份技术博客:在国际象棋操作基准上,每个策略用单条专家演示微调一个 epoch,再在留出的变体上测试,包括棋子位姿扰动、按记谱法换着法、换开局分支。
Isaac 0.5 的损失下降 10.5 倍、9.5 倍、7.0 倍,最接近的 π0.5 为 3.1 倍、2.6 倍、2.3 倍。公司自述,单项差距接近随机种子间的标准误,应该读的是排序,不是具体倍数。
感知侧的成绩也来自报告:本地评测中 Isaac 0.5 在 CARPK、LVIS Count、ScreenSpot-Pro 上分别为 19.07、32.78、62.60,高于表中成本标注为其 12.8 倍的 Qwen3-VL-32B(1.60、27.06、54.80;12.8 倍按激活参数量估算)。公司博客补充称,它在五类任务族上全部领先开源对比模型,推理成本低 8.5 倍:单次三图请求 26.9 TFLOP(每秒万亿次浮点运算),最强的开源对比模型为 228.4。
部署边界也在同一份报告里:Isaac 0.5 用 2.5B 激活参数在单张 H100 SXM 上 70 毫秒一步、策略率约 14.3Hz、FP8 checkpoint(权重文件)36GB;GR00T N1.7 为 27.9 毫秒、35.9Hz、6.93GB,单步更快、体积更小。表注说明,Isaac 的延迟是按 40% 峰值算力推算的架构估算,GR00T N1.7 采用 NVIDIA 官方 TensorRT 报告值。
视频替掉遥操作,但交换有条件
固定 80:30:30 的视频配比,把通用视频从 1,000 小时扩到 100 万小时,在离线动作损失阈值 τ=2.50 上,达到相同损失的遥操作需求从 5,884 小时降到 28 小时,比值 210.3 倍;报告给出的端点括号是 83~300 倍。
交换是有条件的。报告写明,损失对视频的斜率在 1 小时遥操作处近乎平坦,从约 100 小时遥操作起,视频每增加 10 倍,损失约下降 0.21,视频在配方里有了足够动作锚定之后才更有效。
机制上,遥操作每小时要占用一台机器人、一名操作员和受控环境,通用视频几乎免费可得,而 percept 目标让模型能从没有动作标签的视频里学到任务相关变化。报告称,这是首个把通用无动作视频扩到 100 万小时、与 egocentric、UMI 和机器人数据共同训练的研究。
社区里也有人提醒别把 210 倍读过头。AI 与开源话题博主 Exywuu 在里写道:「这不意味着机器人普遍需要 210 倍更少的机器人数据。这个结果来自一个特定损失目标下的特定实验。但它确实表明,通用视频对昂贵机器人经验的替代程度可能超出我们通常的假设。」
权重、代码与 35 个机器人配置一并开源
模型卡显示,Isaac 0.5 近 30 天被下载 162 次。落地方式写得很具体:团队可以把模型微调成控制机器人的策略,也可以只取视觉输出接进既有的规划与控制系统;公司称客户覆盖制造、物流、仓储、安防与移动出行,并直接参与适配部署。
CEO 兼联合创始人 Armen Aghajanyan 在新闻稿里说:「企业需要能在前沿水平运行、快速学会新任务并适配自家硬件的模型。Isaac 给了他们一个强大的开源起点,我们的团队正与客户一起把它带入真实运营。」
开源边界值得看清。GitHub 仓库采用 Apache-2.0 协议,训练与推理代码在固定版本的 LeRobot 子模块中;模型卡写明,暂不支持直接使用 Transformers 或原生 LeRobot,需要按 Perceptron Isaac 仓库的固定 commit 搭建运行环境。
仓库同时发布了 35 个以上机器人系统的部署配置;模型权重的使用条款以 Hugging Face 仓库公布为准。
公司背景:Perceptron AI 2024 年 11 月成立于华盛顿州 Bellevue,由 Armen Aghajanyan(CEO)与 Akshat Shrivastava(CTO)联合创立,两人均为 Facebook AI Research(FAIR)前研究科学家。Isaac 家族此前已有 0.1 与 0.2 两个视觉语言模型,。
「技术报告是个金矿」,也有人只看到抓取
官方在 8 月 26 日发出,截至 9 月 1 日核验时有 795 个赞、约 26 万次浏览与 102 次转发。
旧金山开发者 评论:「技术报告是个金矿,我周末得把它读完。模型架构和训练方法在机器人领域是独一份的,而且出自 Chameleon 的创造者之手,这很合理。我好奇整套训练基础设施会不会开源。」
中文 AI 博主把 210 倍翻译成了白话:「原来要想让机器人达到同样的熟练度,需要人工遥控示教 5,900 小时;现在通过 Isaac 先让它看 100 万小时视频,再使用人工遥控校正,只需要 28 小时。效率提升 210 倍。」
只留了一句:「这是又一项用 100 万小时以上数据的工作。」称其为「目前最好的开源机器人模型」。
也有反对声音:匿名开发者 写道:「36B 却只会做抓取放置任务,笑死。」
这些数字眼下都出自公司自己的材料:LIBERO 表里各家基线转录自原始论文口径,少样本差距公司自己承认落在种子标准误附近,210 倍是特定损失阈值下的端点比值。
留待验证的有两件事:社区能否在自家硬件上复现 97.2% 与 210 倍,第一批工业客户部署后这些数字还站不站得住。按公司博客的对比表,Physical Intelligence 的 π0.7 已具备实时控制训练与错误建模,但未开源;Isaac 0.5 的下一个对手,未必还是 π0.5。