AREX Feed Article
Black Forest Labs 首个视频模型 FLUX 3 Video 正式商用:单次 20 秒、原生音频同步生成
北京时间 2026 年 8 月 5 日凌晨,由 Stable Diffusion 核心团队创立的 Black Forest Labs 将其首个视频生成模型 FLUX 3 Video 推向正式商用。该模型通过 BFL 官方 API 及 fal、Krea、Magnific、OpenRouter 等合作伙伴渠道开放,支持文生视频、图生视频、首尾关键帧、视频续写、多镜头切换以及多语言对话生成,并原生同步输出音频。单次生成最长 20 秒,支持 720p 原生分辨率与 1080p 升频输出,定价为每秒 $0.17(720p)/$0.29(1080p),草稿模式低至每秒 $0.06。
一模型多模态:视频、音频、动作协同生成
FLUX 3 并非仅是一个视频模型,而是一个原生多模态系统。Black Forest Labs 将其描述为"单一模型,多种模态"——同一架构在图像、视频、音频和动作预测任务上联合训练。公司认为,视频模型首先必须是"现实模型":现实本身就是多模态的,任何单一快照(图像、视频或声音)都只捕获了现实的片段,因此 FLUX 3 被设计为不塌缩到某种单一风格,而是能产出从纪录片、动画、喜剧到产品视觉、字体设计等多种视觉语言。
技术基础是 Black Forest Labs 提出的 Self-Flow 自监督流匹配框架。该方法通过双时间步调度(Dual-Timestep Scheduling)在不同 token 上施加异质噪声水平,制造信息不对称,迫使模型在生成的同时学会推断缺失信息,从而在不依赖外部监督模型的前提下提升语义表征质量。公司公布的消融实验显示,Self-Flow 在图像、视频和音频生成上均显著优于传统 Flow Matching 及 REPA 等依赖外部模型的方法。
核心能力一览
FLUX 3 Video 首发即提供以下完整功能矩阵:
- 文生视频:支持从简短描述到复杂提示词,模型跟随指令生成自然运动、场景逻辑与音频。
- 图生视频与关键帧:输入起始帧、结束帧或多个关键帧,模型按序连接画面并保持视觉语言一致性。
- 视频续写:提供最长 4 秒的已有视频与音频,模型延续运动、镜头行为、对话和声音。
- 多镜头一次性生成:在单次生成中创建多个场景和镜头角度,并保持序列连贯。
- 原生音频与对话:对话、音效和环境音与画面帧同步生成,而非后期合成。
- 多语言支持:涵盖英语(多种方言)、中文、西班牙语、法语、德语、日语、葡萄牙语、俄语、意大利语、印尼语、土耳其语、印地语、旁遮普语等,口型同步精准。
- 世界知识与实时接地:结合预训练世界知识与实时信息接地,可用于纪录片和短篇教育内容。
- 草稿模式:低成本的快速预览($0.06/秒),创作者可在确定方向后再渲染全质量版本,保留相同的主题、构图和运动。
定价、渠道与合作伙伴生态
Black Forest Labs 采用按秒计费的 API 定价模式,具体费率已经通过合作伙伴 fal 公开:
| 模式 | 分辨率 | 单价(每秒) |
|---|---|---|
| 草稿模式 | 720p | $0.06 |
| 标准模式 | 720p | $0.17 |
| 标准模式 | 1080p | $0.29 |
生成单条 20 秒 1080p 视频的成本约为 $5.80。除官方 BFL API 外,首批合作渠道包括 fal(生成媒体云平台)、Krea(AI 创意工具)、Magnific(专业创意平台)、OpenRouter(统一模型路由)以及 Runway 等。此外,Nous Research 的 Hermes Agent 已与 FLUX 3 深度集成,实现从分镜生成到拼接的智能工作流。
竞争格局:欧洲阵营的"联合生成"切入
FLUX 3 Video 的正式商用恰逢视频生成赛道密集发布期。MiniMax 于近日开源了其 H3 视频模型,字节跳动的 Seedance 2.5 以更低价格策略抢占市场,Google DeepMind 的 Veo 3.1 同样主打原生音频与物理真实感。
Black Forest Labs 在官方博客中公布了内部人工评测结果,声称 FLUX 3 Video 在文生视频任务上以显著优势领先现有竞品,在图生视频任务上与 Seedance 2.0 持平并超越其他模型。需要注意的是,上述评测均为公司内部进行,未经独立第三方榜单验证。
与竞品相比,FLUX 3 的差异化不在于单一维度的性能领先,而在于 "联合生成"范式——视频、音频和运动在同一个模型中同步产生,而非事后合成。这种架构层面的设计意图是解决多模型拼接工作流中常见的音画不同步、物理断裂等"缝隙问题"。
待验证的问题
尽管功能矩阵令人印象深刻,以下几项仍待社区检验:
- 长视频拼接的连续性:20 秒的单次生成虽长于多数竞品,但通过多次拼接构建长视频时,角色、道具、光影在不同片段间的漂移程度尚未有系统性评测。
- 物理一致性:Self-Flow 框架声称能更好地学习视频-声音-运动的物理关联,但落地表现需要更广泛的用户实测。
- 开源权重计划:Black Forest Labs 在发布推文中提到"Open Weights coming soon",并在官方博客中提及 FLUX 3 Dev 开源变体计划,但未公布具体时间表。考虑到 MiniMax H3 已开源,这一承诺的兑现速度将直接影响开发者社区的接受度。
- 更高分辨率:2K 和 4K 支持已列入路线图,发布日期待定。