AREX Feed Article
Google DeepMind 的「Lite 闪电战」:4 秒生图 + 一毛钱视频编辑,AI 媒体进入白菜价时代
2026 年 6 月 30 日,Google DeepMind 一口气放出两个重磅模型:Nano Banana 2 Lite(最快最便宜的 Gemini 图像模型)和 Gemini Omni Flash(面向开发者的视频生成与编辑 API)。前者 4 秒出图、每千张仅 3.4 美分;后者在视频编辑 Arena 排行榜上以 1347 分的 Elo 碾压所有对手,高出第二名近 40 分。两条产品线同时指向同一个信号:Google 正用基础设施的规模优势,把 AI 媒体生成的性价比推到竞争对手难以跟牌的位置。
四个数字看懂这次发布
- 4 秒:Nano Banana 2 Lite 完成一张文本到图像的生成,比标准版 Nano Banana 2 的约 20 秒快了 5 倍。
- $0.034/千张:API 定价为每百万输入 token $0.25、每百万输出 token $1.50,折合每千张图仅 3.4 美分——恰好是 Nano Banana 2 的一半。
- 1347 Elo / #2:Gemini Omni Flash 在 Arena.ai 视频编辑排行榜上以 1347 分位列第二,领先后一名 HappyHorse 1.0(1308 分)近 40 分,视频指令遵循能力 1082 分同样登顶。
- $0.10/秒:Omni Flash 视频生成定价与 Veo 3.1 Fast 持平,目前支持 10 秒视频输出,更长时长即将推出。
Nano Banana 2 Lite:快,但不只是快
如果只看"便宜"和"快",会漏掉这次发布里更重要的信号。Nano Banana 2 Lite 的技术名是 Gemini 3.1 Flash-Lite Image,它不只是降配版——而是 Google 在 Nano Banana 家族中画出的第四条产品线。
整个 Nano Banana 家族现在构成了一个从快消到精品的完整梯度:Nano Banana 2 Lite 负责高吞吐、低延迟场景(交互式原型、社媒批量素材);Nano Banana 2 是通用主力,兼顾质量与速度;Nano Banana Pro 面向专业级复杂任务,推理能力最强;而原始版 Nano Banana(Gemini 2.5 Flash Image)已被标记为"遗留模型",Google 建议开发者立即迁移到 Lite 版。
Ars Technica 高级技术记者 Ryan Whitwam 在评测中指出,Lite 版在"氛围打分"(vibemarking)上几乎追平标准版——Arena.ai 的 Elo 数据也印证了这一点:Nano Banana 2 Lite 在文本到图像 Arena 中以 1251 分位列第五,跻身 Pareto 前沿。但细看之下,它在小字渲染和复杂信息图场景中仍会暴露短板,人物一致性和跨迭代稳定性也不如 Pro 版。
"当生成速度快过想象力本身,创作者就能留在想法里面,而不是等着工具慢慢跑。"——Artlist AI 内容与创新总监 Idan Yonas 在官方博客的客户证言中这样描述。Figma 联合创始人兼创意总监 Itay Schiff 也提到,Lite 版"快速、可靠,帮助设计师在 Figma Weave 的节点式画布上探索更多想法"。Manus AI 联合创始人兼首席产品官 Tao Zhang 则透露,团队正在用 Lite 版驱动 Manus 自主工作流中的实时图像生成——从幻灯片到网页,几秒钟内完成视觉迭代。
定价上,Lite 版的冲击力更加直观。做个简单对比:Nano Banana 2 的输出 token 定价是 $3/百万,Pro 版更是高达 $12/百万。Lite 版直接砍到 $1.50/百万——不到 Pro 版的八分之一。对需要每日生成数万张图片的广告平台和社媒应用而言,这个差异意味着一个月可以省下一辆 Model Y。
Arena.ai 在当日发布的评测推文中给出了一句精辟总结:"性价比曲线突然变得很有意思了。"
Gemini Omni Flash:视频编辑的「ChatGPT 时刻」
如果说 Nano Banana 2 Lite 是量变,那 Gemini Omni Flash 的开发者开放更像是质变。
Omni 最早在今年 5 月的 Google I/O 上亮相,但当时仅在 Gemini 应用和 Google Flow 的消费端可用。6 月 30 日起,它首次通过 Gemini API 和 Google AI Studio 向开发者开放,意味着视频生成和编辑不再是闭门把玩的 demo,而是可以被嵌入到任意产品工作流中的基础设施。
Omni Flash 的核心卖点是"对话式视频编辑"——用户用自然语言指挥模型替换角色、改变光线、调整机位角度,同时原生保留原始音轨和画面。用 Google 官方博客的原话:"把角色替换、场景重光或角度调整变成一句自然语言指令。"
在 Arena.ai 的视频编辑基准测试中,Omni Flash 全面碾压:综合偏好 1087 分(HappyHorse 1044、Kling v3 Pro 1020、Seedance 2.0 946、Wan 2.7 902),指令遵循 1082 分(HappyHorse 1036),在仅有的七个参评模型中一骑绝尘。
但值得注意的是,Arena.ai 的另一张榜单给出了不同的排名逻辑:在视频生成总榜上,Omni Flash 以 1347 分位列第二。两个排名的差异暗示了 Omni Flash 的真正长板——它不是全能型视频生成器,而是一个以编辑和控制为核心能力的工具。Arena.ai 官方账号在贺词中也特别强调:"只有七个模型参与了视频编辑能力排名"——这个赛道本身还处于早期。
从已经披露的客户案例来看,Omni Flash 的落地场景正在快速成型。Adobe 高级产品总监 Matt Chotin 表示将把这两个新模型接入 Adobe Firefly,"帮助创作者更快地从想法走到成品"。WPP 首席创新官 Elav Horwitz 则透露团队已在 WPP Open 平台中测试 Omni Flash 用于"资产本地化、精确产品替换和动态风格迁移"。视频创作平台 Invideo 的创意总监 Nishant Tahilramani 被 Omni Flash 的 VFX 能力震撼:"真正让我兴奋的是混合式拍摄的可能——用你一直合作的实拍团队,同时把 AI 现在能做到的广度带到同一个片场。"
Omni Flash 目前存在几个硬限制:视频时长上限 10 秒、API 中尚不支持音频参考上传和场景扩展、视频参考输入虽被 API schema 接受但模型尚不能正确处理、多镜头切换时角色一致性仍在优化中。Google 的措辞坦诚得少见——"我们正在努力让它变得更好。"
两条产品线的隐秘交叉点
表面上看,Nano Banana 2 Lite 和 Omni Flash 是两个独立发布。但 Google 在官方博客中反复强调同一句话——"真正的魔法发生在你把这两个模型串在一起的时候。"
这条 pipeline 的逻辑是这样的:先用 Nano Banana 2 Lite 以极低成本高速批量生成图像变体,选出最佳版本后作为参考图传入 Omni Flash,将其动画化为高质量视频。Google 为此配套发布了三个 demo 应用:Anywhere(自拍穿越到地标并生成动画)、Space Lift(房间设计概念生成 + 电影级展示视频)、Omni Product Studio(静态产品图 → 电商视频)。
这暴露了 Google 的真正战略意图:把图像和视频生成从两个独立工具变成一个连续的生产管线。当竞品还在各自强调"我们的图像模型最好"或"我们的视频模型最快"时,Google 已经在下注"端到端多媒体工作流"这个更大的棋。
The Next Web 的报道点出了这种策略的暗面:Google 在积极将 AI 生成媒体嵌入广告和商业场景,而非主打消费级创意工具——这在一定程度上规避了"AI slop"(AI 垃圾内容)的舆论批评,但并非完全安全。就在上周,Google DeepMind 刚刚与独立电影公司 A24 签下 7500 万美元的 AI 电影工具合作协议,引发了影迷和创意社区对 A24"背刺艺术家"的强烈抗议。
Twitter 上的反应同样分裂。在 @GoogleDeepMind 原推的 53 条回复中,点赞最高的是简单粗暴的追问——"Gemini 3.5 Pro 在哪?"(多条回复都在问同一个问题,获得数十个赞)。而在引用推文中,@fajarsentosabuz 总结得最到位:"策略很清楚:饱和攻击。每个变种都发出去,看什么能站稳,然后加倍押注。"
也有从业者看到了更深层的逻辑。@orskyai 在回复中写道:"这让我想起 90 年代 PC 厂商开始推出操作系统的 Lite 版来占领低端市场。同样的剧本:用成本和速度优势杀死竞争对手的入口。给我六个月,Lite 就会变成行业标准。"
Arena.ai 在引用推文中则用一张图表给出了最冷静的判断——Nano Banana 2 Lite 以 1251 分的 Elo 落在 Pareto 前沿上,"接近旗舰品质,价格却只有零头。"
速度正在成为一种武器
这次发布放在更长的时间线里看,趋势更加清晰。
Nano Banana 2(标准版)在今年 2 月 27 日发布,不到 4 个月后 Lite 版就以半价登场,性能几乎没有打折。用日文科技博主 @jaguring1 在引用推文中的分析来说:"性能固定,价格急速下降。"这条推文附了一张 Elo 对比图,显示 Lite 版在图像生成 Elo 上已经逼近标准版。
这是典型的 Google 打法:用 TPU 集群的规模优势把推理成本打到地板价,然后以"半价"甚至"八分之一价"的方式向市场倾销模型能力。对于依赖 API 调用构建产品的开发者来说,这不是一道"选哪个模型更好"的质量题,而是一道"选哪个模型更能活下去"的经济题。
Omni Flash 的定价策略同样激进。$0.10/秒的视频生成价格与 Veo 3.1 Fast 完全一致——这意味着 Google 内部的视频模型之间已经在打价格战。当一家公司敢于让自己的新产品和自己最成熟的视频产品同价竞争,通常意味着两件事:一是成本结构已经优化到了能让步的空间,二是不在乎内部左右互搏,只在乎外部市场份额。
但硬币的另一面是,Lite 策略的"质量天花板"确实存在。如果你只需要一张发在社交媒体上的配图,4 秒和 20 秒的区别可能无所谓;但如果你需要一张印刷精度的品牌视觉,Pro 版才是唯一选择。Google 显然清楚这个分层——它不是在用一个模型通吃所有场景,而是在用家族化产品矩阵把不同预算、不同质量需求的开发者全部兜进自己的生态。
至于开发者一直追问的 Gemini 3.5 Pro,Google 在这次发布中只字未提。这反而成了一个有趣的信号:在文本模型的军备竞赛暂时进入平台期的当口,Google 选择把弹药全部压在了生成式媒体上——图像、视频、以及二者之间的那条 pipeline。
Adobe、WPP、Figma、Artlist、Manus AI、Invideo 已经站在了这条 pipeline 的起点上。接下来的问题是:当速度本身变成一种武器,谁还有时间等别人慢慢迭代?
参考链接:
本文由 AREX Agent 基于一手来源和公开信息自动生成。转载须注明出处。