AREX Feed Article
数字生命卡兹克:Seedance 2.5 的真正想象力不在影视,在给机器人造训练数据
"这个的想象空间,可能比做影视还要大,甚至,疯狂加速具身的落地。"
8 月 7 日,Seedance 2.5 的 API 通过火山引擎正式上线。同一天,AI 领域创作者数字生命卡兹克(公众号「数字生命卡兹克」主理人,X 平台 6.5 万粉丝)在网易号发布了长文《一周以后,我想我终于可以来聊聊 Seedance 2.5 了》,系统拆解了这款字节跳动视频模型的代际变化,并在 X 平台分享了文章。全文最重的一个判断不在影视创作,而在具身智能:白模规定机械臂运动路径、30 秒覆盖完整操作过程、局部编辑只改单一变量生成多样意外场景。这套能力组合正在为机器人合成训练数据打开一条新路径。
2.5 消灭了一部分幻觉,换来了控制权
Seedance 2.5 上线后出现了一个奇怪的分裂:一部分普通用户觉得它"反而不如 2.0 好用",而影视圈的专业创作者却给出完全相反的结论。
卡兹克在采访中找到了解释这个分裂的原因。他援引知情人士的说法:Seed 团队把 2.5 的 SFT 数据切分方式、描述方式和质量标准,"完全按照电影生成的方法重新做了一次"。模型学习的不仅是"画面里有什么",还包括一个导演会怎样描述自己的意图:"我希望观众看到这个镜头以后会难过""我希望这个角色看起来在笑,眼神里却有一点犹豫"。
结果是,Seedance 2.5 的指令遵循变得极强。它不再像 2.0 那样主动替你补镜头、加切镜、制造爆款短视频的节奏感。2.0 自带的那种"导演思维",你给一句含糊的话它就替你铺完整套方案,在 2.5 上被刻意压低了。卡兹克写道:"它更听话了,指令遵循也变得极强。但代价也更直接了,当你只给它一句很短、很含糊的话,它不会像 2.0 那样兴高采烈地替你补完整套方案。"
创作者海辛的总结被卡兹克引为定调:"2.0 对业余创作者更方便,因为模型自己延展镜头的能力很强。2.5 对专业创作者更友好,因为它稳定、可控,愿意服从更具体的导演意图。"
这个变化在影视行业的后果是:用好 2.5 的人,Prompt 写得越来越像分镜表和导演阐述。模型越听话,对创作者的要求就越高。而它同时埋下了另一条线索:当一个视频模型变得可控、精确、愿意接收结构化的三维输入时,它的受众就不再只是人了。
白模、30 秒、局部编辑:三条能力恰好拼成一条新路径
Seedance 2.5 于 7 月 31 日正式发布,字节跳动官方博客确认了升级清单:单次生成 30 秒、最多 50 个多模态参考素材、白模参考、时间戳级编辑。这三项能力单独看都是参数提升,合在一起却构成了卡兹克所说的"全新路径"。
白模参考提供了空间约束。开发者用无纹理 3D 模型搭出机械臂、目标物体、障碍物的空间关系和运动轨迹,模型再根据这套结构生成视频。白模不给材质和外观,但锁住了最关键的东西:机械臂从哪里开始、经过哪些路径点、抓取哪个物体。字节官方博客中展示了一个汽车拼装的白模渲染案例;卡兹克则把同一逻辑平移到了机器人操作场景。
30 秒单段直出解决了时序完整性问题。多数机器人操作任务的完整周期超过 15 秒,Seedance 2.0 的时长上限恰好卡在尴尬位置。30 秒第一次让一段完整抓取、搬运、放置流程能在一个生成单元里完成。卡兹克的表述是:"三十秒的长度,可以覆盖一段相对完整的操作过程。"
局部编辑覆盖了数据多样性。一条真实采集的机械臂操作视频,改掉桌面材质、背景光照、障碍物位置,只动视觉层,不动动作序列,就能产出数十条增广样本。卡兹克指出:"局部编辑可以在尽量保持其他条件不变的情况下,只改一个物体、一个动作,或者某几秒里发生的意外。" 这对机器人训练的域随机化(domain randomization)是刚需,过去靠仿真引擎实现,现在一条视频加一句指令就能出第一批素材。
硅星人在 8 月 4 日的实测验证了这个路径的可行性。用斯坦福 DROID 数据集中的真实机械臂视频做底片,改光照、换环境、甚至把场景替换成空间站舱内,保护清单里的碗、薯片袋和绿色小包全部原位,机械臂的动作序列与底片一致。只改光照的那一版,"几乎挑不出毛病。"
但边界同样清晰。让模型凭空插入一个"从货车上掉落的沙发","沙发出现了,坠落从未发生。它以摆放整齐的姿态凭空进场。" 凭空生成连续的物理过程,仍然是所有视频生成模型共同的天花板。
30 万小时与 30 亿美元:具身智能缺的不是模型,是数据
具身智能行业有一个被反复引用的数据:风投机构 Bessemer 今年的报告估算,全球机器人操作数据总量约 30 万小时,互联网视频超过 10 亿小时,未来两年全行业花在机器人数据上的支出将超过 30 亿美元。
英伟达具身智能研究负责人 Jim Fan 用"数据金字塔"描述机器人的数据结构:塔基是互联网规模的图文视频,中间是仿真数据,塔尖是真机采集的操作数据,最有价值,也最稀缺。黄仁勋在 GTC 上说得更直接:"真实世界的数据采集缓慢、昂贵,而且永远不够。"
真实数据靠人一条一条遥操作采集,成本随人力线性增长。合成一段视频的成本只消耗几分钟算力。两种成本曲线的差距,足以改变一个行业获取数据的方式。
这条赛道上原本是专用仿真系统的天下。英伟达 3 月发布了 Cosmos 3 并在 6 月全面开源,合作生态里有 ABB、发那科、Figure、Agility。变化发生在另一头:消费级视频模型开始反向走进来。Runway 去年 12 月发布世界模型家族 GWM,今年 2 月为此融资 3.15 亿美元。字节官方也披露,已有具身企业在用 Seedance 做数据合成。
卡兹克的文章没有罗列这些行业数据。他的切入点是机制:"以前我们当然也可以在 3D 仿真环境里造这些数据。" 然后接上 Seedance 2.5 带来的新路径。他对这条路的判断并非"视频生成能替代仿真引擎",而是更具体的:30 秒、白模、局部编辑三个能力必须同时到位,才能让视频模型从"偶尔能生成一段像样的操作画面"变成"可以系统性地为机器人造训练数据"。这三个能力在 2.0 时代一项都不具备。
验收通过,就是全部的好评
Seedance 2.5 发布当日公布的合作名单里出现了徐工集团、灵初智能、穹彻智能、微分智飞,这些名字出现在一款视频生成模型的首发客户名单中本身就是一个信号。重型机械、具身智能和无人机公司买视频模型的 API,不是为了拍出下一支千万播放的短视频。
硅星人的文章最后一句话概括了这个场景:"给机器看的视频不需要好看,只需要正确。这门生意里没有掌声。验收通过,就是全部的好评。"
卡兹克的判断聚焦在一个更具体的点上:当视频生成模型变得足够可控、足够接受结构化输入时,它最值钱的能力不是生成画面,而是把造一条训练数据的成本,从一套人力流程降到几分钟算力。产业要回答的问题,也从"要不要用"变成了"怎么验收"。
他在文章结尾没有重复这个判断,而是停在了一个更大的问题上:"当你有了 Seedance、有了 Codex、有了各种各样几乎能让你无所不能的工具,那你到底想对世界讲述什么呢?" 对具身智能的从业者来说,这个问题有更具体的版本:当你有了能批量造训练数据的视频模型,你想让机器人学会什么?
参考链接
Footnotes
-
数字生命卡兹克,《一周以后,我想我终于可以来聊聊 Seedance 2.5 了。》,网易号,2026年8月7日。
-
数字生命卡兹克,X 平台推文,2026年8月7日。
-
字节跳动 Seed 团队,《一镜成片,随心参考|Seedance 2.5 正式发布》,2026年7月31日。
-
硅星人/周一笑,《Seedance 2.5 进厂,机器成了新观众》,品玩,2026年8月4日。