AREX Feed Article
Netflix 开源视频重风格化模型:只换世界,不换人
当 AI 视频赛道所有人都在比谁能生成更逼真的人脸时,Netflix 的研究团队走了一条相反的路。他们刚刚开源的 ID-V2V 模型做了一个看似简单、实则激进的选择:把人留下来,把世界换掉。
2026 年 7 月底,Netflix 旗下研究机构 Eyeline Labs 在 arXiv 上公开了论文 ID-V2V: Identity-Preserving Video Restylization,已被图形学顶会 SIGGRAPH Asia 2026 接收。论文提出一种全新的视频编辑范式:身份保持的视频重风格化(identity-preserving video restylization)。用户给模型一段实拍视频和一张编辑过的首帧参考图,模型自动把首帧的新风格传播到整条视频,同时严格锁死演员的面部特征、微表情、眼神方向和口型同步。代码基于 Apache 2.0 协议开源,项目页同步上线。
AI 研究者 AK(@_akhaliq)在 X 平台分享了该论文后迅速引发关注,推文获得超过 5600 次浏览和 27 次收藏。CCTest 等科技媒体也跟进做了专题解读。
给一个关键帧,还你一整条风格化视频
ID-V2V 的工作流直指影视后期制作的现实痛点。
创作者先用任何图像编辑工具对源视频的首帧做风格化处理。论文中使用的是 NanoBanana,但流程本身不绑定工具。换背景、改灯光、加特效,想怎么改怎么改。然后把源视频和这张编辑过的关键帧一起送入 ID-V2V,模型自动将关键帧中指定的新视觉风格传播到后续所有帧,生成一条风格统一、人物完全不变的新视频。
整个过程不需要重新拍摄,不需要搭实景,不需要现场布光。用论文的话说,这是一套 shoot first, restyle later 的工作模式。
更实用的是,ID-V2V 不要求编辑后的关键帧和源首帧像素级对齐。论文的"不完美关键帧"用例(imperfect keyframe)专门演示了这一点:即使图像编辑工具改了人物的姿态或表情(这在现实中几乎是必然的),模型也能在首帧之后自动拉回源视频中人物的真实动作。首帧跟随你的编辑意图,第二帧开始回归源表演。
论文在项目页面上展示了五个典型用例。完整重风格化(换场景加换灯光)是最通用的模式。不完美关键帧纠正处理编辑工具本身能力不足带来的错位。长视频生成支持逐段拼接超过 81 帧的素材。多关键帧锚定允许同时固定首帧和末帧,精准控制起止画面。纯重打光模式则是更受限制的特例,场景完全不变,只改变光照方向和强度。
ID-V2V 在多人物场景中也表现稳定。论文展示了两人甚至三人在同一帧内被正确处理的结果,每个人物的身份和互动细节都保持完好,这是现有视频编辑方法普遍失效的场景。
人脸是绝对边界,其他一切皆可生成
ID-V2V 技术路线背后有一个贯穿始终的设计判断:人脸不能动。
论文的核心观察是,在视觉叙事中,人物表演是创造性意图的核心载体。表情、眼神、口型这些细节一旦漂移,整场戏的感染力就垮了。生成式视频模型在过去两年取得了惊人进步,但它们面临一个根本性矛盾:越是激进地改变场景风格,人脸越容易变形。
ID-V2V 的解法是将视频编辑问题一拆为二。编辑驱动的合成(edit-driven synthesis)负责灵活生成新场景和新背景,源头锚定的身份保持(source-grounded identity preservation)负责严格锁死人物。两个模块各司其职,互不干扰。
身份保持的具体机制是论文最精巧的部分。作者观察到,在身份保持的前提下,面部结构和表情应当完全不变,唯一允许的变化是光照。因此他们将身份保持重新定义为一个视频重打光问题(video relighting)。模型接收两个专门设计的控制信号来约束人脸:重打光后的人脸区域和从人脸几何中提取的法线图。前者模拟训练时从电影光到普通光、再到电影光的往返转换过程,后者提供不随光照变化的几何锚点。
架构上,ID-V2V 基于 Wan2.1 的 DiT(Diffusion Transformer)主干,在选定层级接入一个共享参数的控制分支。控制分支接收重打光人脸、人脸法线图和深度序列作为条件信号,通过稀疏连接注入主干网络,在不修改每一层的前提下引导生成方向。与全连接的控制方案相比,稀疏连接既降低了计算开销,又避免了对主干生成能力的过度干扰。
训练数据的构建同样值得关注。现实中几乎不可能获得同一演员在相同表演下、不同视觉风格的两段配对视频。ID-V2V 避开了这个死胡同:从单条训练视频出发,用图像重打光模型对人脸区域做电影光到普通光的转换,模拟推理时源视频的普通光照条件;训练时再让模型学习普通光人脸到电影光人脸加生成背景区域的逆过程。因为训练目标就是原始视频本身,每对训练样本天然像素级对齐。整个过程不需要任何真实的配对数据。
模型需要 8 张 A100 80GB GPU 进行训练,推理在 720p 分辨率下运行。支持单 GPU 推理(通过 CPU offload),但完整的多 GPU 推理使用 USP 序列并行以充分利用显存。
Paul Debevec 的 Netflix 答卷
ID-V2V 作者名单里有一个计算机图形学领域无法绕过的名字:Paul Debevec。
Debevec 是 Netflix Fellow、Eyeline Studios 的核心人物。他在 2000 年发明了 Light Stage 面部捕捉系统,这套系统已被用于《阿凡达》《本杰明·巴顿奇事》《银翼杀手 2049》等数百部电影的数字角色创建,并在 2010 年为 Debevec 赢得了奥斯卡科学与工程奖。他还是 HDR 图像照明(image-based lighting)技术的奠基人,1997 年 SIGGRAPH 论文 Rendering Synthetic Objects into Real Scenes 至今被引超过 6000 次。一个在照明和面部捕捉领域深耕了二十多年的人,如今领衔做视频重打光和身份保持。研究方向与个人履历的契合度极高。
这并非 Eyeline Labs 首次涉足 AI 驱动的影视工具。此前该团队还发布了 ReAge3D,一个基于扩散模型的 3D 人脸年龄变换系统,以及一套视频扩散重打光流程。ID-V2V 可以看作这条产品线的自然延伸:从单帧人脸处理扩展到整条视频的身份保持重风格化,从算法原型发展到配有完整项目页和开源代码的对外发布。
第一作者 Yuancheng Xu 是 Netflix 的研究科学家,在 X 平台用中文和英文同时公布了项目。共同作者 Mingming He 现任职于 Adobe,此前曾深度参与人脸编辑和重打光的多项研究。Pablo Salamanca、Li Ma、Yash Kant 和 Ning Yu 均为 Netflix 或 Eyeline Labs 的研究人员。Emmett Steven 来自 Netflix。八位作者中六位隶属 Netflix,两位来自 Eyeline Labs。
值得一提的是 Eyeline Labs 本身。这家研究机构由 Netflix 支持,专注内容生产技术的底层研发,与 Netflix 旗下负责实际制作的 Eyeline Studios 互为支撑。ID-V2V 论文的署名方式同时出现 Netflix 和 Eyeline Labs 两个机构,暗示这是一种介于纯学术研究和产品化交付之间的定位。
AI 视频的下一场仗,竞争焦点正在从"生成"转向"保持"
当前 AI 视频生成的主战场仍是创造能力。Sora、Runway Gen-4、Kling 2.0、Wan 2.1 都在比谁能从零生成更逼真、更连贯、更长时间的视频。ID-V2V 代表的是另一条路线:不是生成新视频,而是改造已有视频,改造的前提是演员的脸不能变。
这条路更贴近专业影视制作的真实需求。在实际片场,演员表演是不可复现的核心资产。导演可能想把同一场戏从日景改成夜景,从咖啡厅改成赛博朋克街道,但他不会接受演员的脸在编辑过程中变形。ID-V2V 的设计逻辑——将人脸视为不可触碰的边界——与这一需求高度对齐。反过来说,如果一个视频编辑工具不能保证演员不变,它在专业片场就没有生存空间。
与已有的视频编辑工具对比,差距同样明显。Wan-Animate、AnimateAnyone、VACE 等方法主要依靠人脸关键点或低维身份嵌入来约束人物外观,这些抽象控制信号对微表情和口型同步的保持能力有限。ID-V2V 将身份保持下沉到像素级的重打光约束——人脸区域的每一个像素的训练目标都是还原原始视频的对应像素。这种设计在定量评估和用户研究中均显著优于所有对比方法。
一个值得注意的行业背景是,ID-V2V 的发布时机恰好处于影视行业对 AI 工具需求加速的节点。从 Adobe 的 Firefly Video 到 Runway 的 Act-One 表情迁移,再到 Pika 的场景扩展,传统后期制作流程的每个环节都在被 AI 工具重写。ID-V2V 切入的是其中最敏感的环节——演员的脸。它选择了一条最保守也最安全的技术路线:不动人脸,只改环境。
研究原型,但方向已经足够清晰
ID-V2V 论文本身标注为 "for demonstration and inspiration purposes only",项目页也声明它是研究探索而非生产系统。在复杂运动、严重遮挡、极端风格化和超长序列上的鲁棒性还有待验证。论文实验主要基于精心挑选的示例场景,距离真正的片场使用还有相当距离。
但这些限制并不削弱它的问题定义和工程思路的说服力。ID-V2V 提出了一个精准的命题:在 AI 视频的下一个阶段,竞争力不取决于模型能生成多少,而取决于它能保持多少。换掉整个世界很容易,但把人留下才难。Netflix 和 Eyeline Labs 在这个命题上,把答案开源了。
论文:
代码:
项目页:
会议: SIGGRAPH Asia 2026, December 1–4, Kuala Lumpur_