AREX Feed Article
levelsio 将字节 Seedance 2.5 塞进 Photo AI,放话「人物相似度首达图像模型级别」
8 月 8 日晚,独立开发者 levelsio 宣布,已将字节跳动视频生成模型 Seedance 2.5 集成至自己的 AI 人像产品 Photo AI。帖文中他写道:这是第一个在人物相似度上追平图像模型的视频模型。
「只用几张参考照片,它就能生成和你本人非常接近的视频,只靠一句 prompt 就能拍出相当专业的镜头。」Levels 同时放出了三段用自己照片生成的视频样片,展示不同场景、不同服装和不同运镜下的效果。Photo AI 用户现在可以从侧边栏点击「Make video」,选好已训练的人物模型、输入 prompt,直接生成视频。每次生成约 4 分钟,消耗 30 个积分。Levels 在帖文中注明:「它比别的功能贵,但我没涨积分。」
「Seedance 已经超过 Kling 了」
Levels 的帖文获得 21.7 万次观看、414 次点赞。
前 Google Cloud AI/Gemini 总监 Addy Osmani ,生成结果是否仍有「恐怖谷」残留。Levels 未直接回复这一条,但在另一条对话中给出了更明确的判断。当用户 @SovereignLatam 表示「Seedance 和 Kling 是我用过最好的 AI 视频模型」时,Levels :「Seedance has surpassed Kling now.」
Netlify 社区负责人 KP(@thisiskp_,7.1 万粉丝)在中写道:「Meta 手里有 Instagram 的训练数据,却至今拿不出一个像 Seedance 2.5 这样的 SOTA 视频生成工具——这是 AI 竞赛里最大的一场失利。」这条引述获得 820 次观看。
社区账号 Synapse Brief :「30 秒的原生单次生成长度才是真正的解锁,不只是相似度。大多数视频模型的上限是 4 到 8 秒,然后靠拼接,一致性就是在拼接中断掉的。Seedance 2.5 一次可以吃进 50 个参考素材——30 张图片加 10 个视频和 10 个音频片段,这可能才是它把人物锁定得更好的原因。」
前华为资深工程师 Crio Songo(@shuizhuyu):「难怪最近所有人都在讨论这个模型。字节有 TikTok 的海量视频数据优势,解决了视频生成一直卡壳的人物相似度问题,是很大的一步。」
字节在 7 月底悄悄上线了 2.5
Seedance 2.5 并非随 Levels 的帖文突然出现。字节跳动 Seed 团队,但首发渠道是国内的即梦 AI 和豆包 Pro,API 通过 BytePlus ModelArk 提供。在海外的关注度有限。
官方发布的核心升级有三项。第一,单次生成从 15 秒扩展到 30 秒,支持多轮扩展拼接出数分钟的长视频,且镜头切换和场景过渡更流畅。第二,多模态参考槽位从 12 个扩到 50 个,最多可同时输入 30 张图片、10 段视频、10 段音频。第三,编辑能力加入时间戳级精控,支持绿幕抠像、机位变换和参考式编辑,面向影视和广告等专业场景。
字节在博客中称,模型在物体纹理、皮肤和眼部细节、光照和色彩饱和度上做了系统优化,「最终成品在观感上接近实拍影像的电影质感」。Levels 在帖文中放出了三段自己出镜的视频来展示效果。
50 个参考槽位怎么把人物锁住
Seedance 2.5 解决人物一致性的方法靠的是一次塞入更多参考,而不是更强的 prompt 理解。
旧一代视频模型在生成超过 5 秒后就会出现身份漂移:眼睛颜色变化、衣服凭空更换、面部结构走形。原因是逐帧生成的误差不断累积。Seedance 2.5 的做法是把整个 30 秒时间线放进单次生成,同时用深度交叉注意力层将每一帧锚定回上传的参考素材。
具体来说,用户从不同角度上传同一个人的多张照片,模型通过面部空间映射矩阵追踪骨骼结构,确保 180 度转身时阴影仍自然地落在正确位置。服装方面,上传面料样本或特定角度的参考照片后,模型在远景和特写之间保持织物纹路和剪裁不变。
中验证,2.5 可同时追踪 10 个以上独立人物而不出现身份混合,而上代模型超过 2 到 3 个人就开始混淆面部特征。实现方式是将 50 个输入槽位分配给不同人物各自的视觉档案,配合空间注意力掩码做隔离。
Levels 在帖文中提到,Photo AI 的视频编辑器内置了 Magic Edit 功能,用户可以在主应用和编辑器中对生成的视频做定向修改,而不是整段重来。模型本身也支持语音生成,甚至可以上传自己的语音样本,但 Levels 这次没有接入这个功能。
TikTok 的视频数据终于变成了一块搬不动的盾牌
Seedance 2.5 的人物相似度突破背后有一个绕不过的因素:训练数据。
Levels 在帖文中直接点明:「它由字节跳动(TikTok)制造,他们当然有大量训练数据。」评论区多位用户抓到了这一点。@UncleLinx :「字节坐拥地球上最大的视频数据集,迟早会造出最好的视频模型——意外的是,所有人都在盯着 coding LLM 比赛的时候把它睡过去了。」@lordofblocks :「TikTok 有那么多的训练数据,正好解释了为什么人物相似度能这么接近。」@julleybuilds 更直接:「那个 TikTok 的数据优势,会让其他人在视频生成上再也追不上。」
几位评论者指向同一个判断:TikTok 的数据体量比任何技术路线差异都更难复制。图像模型用了三年(2022-2025)才解决人物相似度问题,这是 Levels 在帖文中给出的参照系,而他认为 Seedance 2.5 直接在视频领域跨过了这道坎。KP 那条 820 次观看的引述帖正是在戳同一个痛点:Meta 手里有 Instagram 的视频数据,至今拿不出同级别的模型。
目前,Seedance 2.5 已通过多个第三方平台分发,fal.ai、Atlas Cloud、PiAPI、Runware、Higgsfield 均已上线 API。Levels 在回复中 作为运行 2.5 的最佳选择。
大厂还没动,独立开发者已经把模型塞进了付费产品
Levels 是已知最早将 Seedance 2.5 集成到面向消费者的付费产品中的开发者。
他的 X 简介自称 Photo AI 月收入约 8.9 万美元。作为一个单人运营的独立产品,从发现新模型到完成集成、定价、上线,走完了全套流程。他还顺手发了一条,模型把他说德语的口型对上了,他吐槽「我最可怕的噩梦,它把我变成了德国人!」这条帖文获得 246 次点赞、20.9 万次观看。
「像往常一样,所有人都在盯着 LLM 在 coding 和聊天上的进展,」Levels 在帖文开头写道,「但与此同时,新的 SOTA 视频模型 Seedance 2.5 已经在慢慢铺开了,它真的相当出色。」
参考链接
- _