AREX Feed Article
字节Seedance 2.5顶到30秒,梁汝波前一天刚认了LLM的输
8月7日,火山引擎正式上线视频生成模型Seedance 2.5的API服务。单次生成时长从15秒翻倍到30秒,最多可参考50个全模态素材,模型同时兼容十余种语言。
就在前一天,8月6日,字节跳动CEO梁汝波在年内第二次全员会上承认,公司大语言模型与海外前沿的差距进一步拉大。同一天,阿里通义万相Wan3.0开启公测,同样主打30秒一镜到底。中国视频生成模型的30秒门槛,在24小时内被两家同时踏平。
工作日调用量远超周末,谭待说它正在从玩具变工具
在8月6日的全员会上,字节跳动创意服务平台负责人谭待给出一组数据:Seedance 2.0工作日的API调用量远高于周末。他的判断是,视频生成模型正在从玩具转向商业工具。
超过90%的新飞书客户已购买AI附加功能。梁汝波据此将AI投资重心从消费级聊天机器人转向企业生产力服务,整合豆包、飞书和火山引擎三条产品线。
海外方面,视频创作平台Higgsfield在Seedance 2.5全球上线当日推出"33天无限使用"促销,但很快补充说明:无限版走共享队列,一次只能跑一个任务,付费版才有优先队列和并行。评论称,这条补充说清了一件事——"无限"是拉新的钩子,可持续性始终在付费端。Krea、Atlabs等平台也在同一天接入了Seedance 2.5。
科技博主写道:"时长翻倍,难度远不止翻倍。15秒基本只够一个镜头,30秒要排一小段有起承的序列,角色不能中途变脸,镜头之间还得接得上。"他的结论是,战场从能不能生成一段能看的画面,挪到了能不能连续讲完一件事。
梁汝波承认LLM掉队的第二天
梁汝波在8月6日全员会上的表态,是理解Seedance 2.5时机意义的关键背景。据报道,梁汝波直言大语言模型与海外差距在扩大,AI投资将优先投向企业生产力服务。
他否定了外部"被逼留在牌桌上"的说法,称真正的驱动力是"延迟满足将为AGI奠定基础"的判断。种子语言模型团队正在合并此前各自为战的资源,取消内部赛马机制。
视频生成线是字节少数已经跑进第一梯队的AI方向。据社交平台用户披露,Seedance 2.0采用200B参数MoE架构,推理计算需求并不像外界想象的那么庞大。从7月31日Seedance 2.5发布到8月7日API上线,间隔仅7天。
8月6日晚,阿里宣布Wan3.0开启公测,同样打出30秒一镜到底,附带蒙太奇叙事。两家中国大厂在相邻的两天里把视频生成时长推到同一数字,视频生成从技术demo转向生产工具的拐点已经清晰可见。
50个素材、秒级时间戳、多角色不串脸
Seedance 2.5在三个维度上做了实质性升级。
第一,参考与编辑精度。模型可一次接收最多50个跨模态素材,其中图片30张、视频10段、音频10段。据报道,它能响应≤1秒精度的时间戳指令,完成导演级镜头调度与多线叙事。创作者可以指定"第3秒推近、第8秒切换中景",不再是给一句笼统prompt碰运气。
第二,多角色一致性。这是从15秒跨到30秒最棘手的问题。模型需要在多角色群戏中稳定保持每个人的外形、服饰和身份关系。朝夕光年的修仙互动作品《不问凡尘》已率先将Seedance用于游戏内容生成,在多场景中保持角色外观一致。
第三,视听质感。面部细节达到皮肤纹理、微表情和眼神光级别。光线衰减更细腻,光源一致性提升。运镜方面,推、拉、摇、移、跟等操作中保持透视与空间关系稳定,细微接触声和远处人声不丢失,随距离自然衰减。
定价方面,Seedance 2.5按token计费,公式为(输入时长+输出时长)×宽×高×帧率÷1024,含视频输入时有最低token限制。国际用户通过BytePlus ModelArk访问。同期2.0 mini 720P分辨率降至约0.2元/秒,fast版本约0.6元/秒,优惠持续到9月7日。
字节真正的筹码:抖音和CapCut的十亿用户
过去半年,全球AI视频赛道的座次一直在变。Runway稳守专业影视剪辑,Google Veo以真实感和内置音频见长,快手的Kling在运动控制上积累了口碑。中国厂商此前的优势更多体现在性价比,Seedance 2.0在国际聚合平台上的价格约为0.112美元/秒。
Seedance 2.5不再只打价格牌,而是把时长、参考精度和叙事控制力推到了同一个档位。KOL 在一篇获万次浏览的分析中指出:字节与其他AI实验室的根本区别不在模型大小,在分发。
TikTok、CapCut、Douyin、豆包——"如果模型做好,用户已经在等了"。
同一天,字节正在预训练一个约10万亿参数的大模型。但视频生成赛道上,字节不需要等那个模型,Seedance已经证明了执行速度。从发布到API上线,间隔7天。
据在8月4日的核查,WaveSpeedAI和Replicate当时均未完成Seedance 2.5接入。
15秒只够一个镜头,30秒要讲完一件事
30秒不是一个营销数字。15秒能装下一个镜头,30秒要装下起承转合:角色不能中途变脸,道具不能凭空消失,镜头之间的空间关系必须自洽。视频生成由此从抽卡式生成进入了导演式控制。
Seedance 2.5和Wan3.0在同一天把门槛推到这个数字,说明技术水位已经到了,不是偶然撞车。真正的胜负手不在模型参数,在谁的模型能更快进入广告分镜、短剧制作和互动内容的工作流,而不是停留在demo阶段。
字节真正的筹码,是抖音上每天刷视频的十亿人。200B的MoE只是入场券。