AREX Feed Article
Google 上线 Gemini Omni 1.1 Flash:场景延伸至 40 秒、可放大至 4K
8 月 27 日,Google AI Studio 官方 X 账号发布公告,宣布推出生成式视频模型 Gemini Omni 1.1 Flash(模型名 gemini-omni-1.1-flash),即日起经 Gemini API 在 Google AI Studio 向开发者开放。称,本次更新让 Omni 1.1 为专业使用做好了生产准备(production-ready);博客署名 Google DeepMind 产品经理 Anish Nangia 与 Alisa Fortin。公告推文把新能力概括为场景延伸、指定首末帧、360p 草稿、4K 放大与视频参考输入五类。
其中最直接的变化在场景延伸:模型可分析最多 10 秒的先前视频上下文,以 10 秒为增量把片段累计延伸到 40 秒,而此前的模型只能参考最后 1 秒。Omni 1.1 同日向全球 Google AI Plus、Pro 与 Ultra 订阅用户在 Google Flow 提供,场景延伸在 Gemini app 中开放。以下均为官方公告口径,性能数字为官方自述。
场景延伸:上下文从最后 1 秒扩到 10 秒
场景延伸让模型从现有视频的结尾继续生成画面。官方博客给出的 API 示例显示,调用 Gemini Interactions API 时传入 previous_interaction_id 指向上一次生成的视频,再输入文本提示 "Continue the scene.",即可续写片段;Gemini API 文档把这种接续上一次视频状态、无需重新上传的做法称为 Stateful video editing。
上下文长度是这次升级的核心:官方称 Omni 1.1 能分析最多 10 秒的先前上下文,此前模型只参考最后一秒,由此带来更好的视觉一致性与叙事连贯性,开发者可以构建更长的故事,也可以把片段分支到新的创作方向。
博客配发的示例提示词展示了实际用法:一段人物对话之后,输入"镜头慢慢拉出,被遗忘的布满灰尘的地下墓穴",再输入"镜头缓缓拉远,出现一座巨大图书馆,书架与书本失重漂浮在尘土虚空中",两段延伸共用同一场景与人物。
首末帧插值、360p 草稿与 4K 放大
指定首帧与末帧是另一项新控制:开发者给出镜头的起止画面,模型在两个关键帧之间生成连续视频,官方称适合复杂环绕运镜、推拉变焦过渡与无缝循环片段。
360p 草稿是这次最直接的量化卖点:官方称其生成比 Omni 1.1 标准 720p 分辨率提速至多 60%、成本约为三分之一,面向快速原型、分镜迭代与开发者平台里的快速渲染;脚注注明"至多 60%"基于 360p 与 720p 的系统吞吐量对比。博客还给出一个示例工作流"Draft Room":先以 360p 生成 3 到 4 个变体草稿,逐项对比后再定稿。
正式输出侧,模型可生成 1080p 或 4K 的高分辨率成片,官方称"可投入专业制作";多模态输入还可引用最多 3 秒视频作为参考,用于保持视觉上下文与角色一致性。
按秒计价:360p 档是四款模型里的独有档位
官方定价表按每秒计费:Gemini Omni 1.1 Flash 的 360p 为 0.03 美元,720p 为 0.10 美元,1080p 为 0.15 美元,4K 为 0.30 美元。科技媒体 THE DECODER 当天报道并引用了同一组价格。
定价表同时列出 Google 其他三款视频模型作对照:上一代 Gemini Omni Flash 只有 720p 一档(0.10 美元),360p、1080p 与 4K 均不提供,720p 价格与 Omni 1.1 Flash 持平;Veo 3.1 Lite 的 720p 与 1080p 分别为 0.05 美元与 0.08 美元,比 Omni 1.1 Flash 便宜;Veo 3.1 Fast 的 4K 档同为 0.30 美元。360p 草稿档在四款模型中只有 Omni 1.1 Flash 提供,"成本约三分之一"只适用于 360p 对 720p 的比较。
从 AI Studio 到 Gemini app:同日铺开的渠道
官方公布的开放渠道在同一天铺开:开发者可在 Google AI Studio 直接试用,企业开发者可通过 Gemini Enterprise Agent Platform 的 Agent Platform API 部署,官方文档、cookbook 与提示词指南同步更新。Google 主账号当天发布推文称,Gemini Omni 1.1 Flash 正在 @GoogleAIStudio、@FlowByGoogle 与 Gemini Enterprise Agent Platform 中推出。 AI Studio 官方账号随后发布了公告全文推文。
普通用户入口同步开放:Omni 1.1 即日起向全球所有 Google AI Plus、Pro 与 Ultra 订阅用户在 Google Flow 提供,场景延伸向上述订阅用户在 Gemini app 中开放。此前的 Gemini Omni Flash(gemini-omni-flash-preview)在官方 API 文档中仍标注为预览版(preview),本次博客则把 Omni 1.1 描述为面向专业使用生产就绪。
已投产的客户:Adobe、Figma Weave、GMI Cloud 与 Runway
官方博客称,客户已经通过 Agent Platform API 用 Gemini Omni Flash 驱动真实生产,并点名四家平台:Adobe 已把 Gemini Omni Flash 集成进 Adobe Firefly,Figma Weave、GMI Cloud 与 Runway 提供了使用评价。
Figma Weave 创意总监 Itay Schiff 称:"有了延伸、更丰富的参考素材和 4K 分辨率,Gemini Omni Flash 让团队不再只是生成视频,而是真正去导演视频(beyond generating videos to truly directing them)。"GMI Cloud 营销副总裁 Louisa Guo 强调准确性:"细节经得起推敲。对制作教育与解说类内容、必须把东西做对的客户来说,这种可靠性比任何单一功能都重要。Omni 让此前无法依赖 AI 视频的那部分客户也能用上它。"Runway 首席创意官 Jamie Umpherson 说,Omni Flash"自然融入人们使用 Runway 的现有方式:从提示词、图片或视频开始,然后在此基础上生成或编辑,这是我们的用户快速穿梭于想法之间的又一种方式"。
三段引语针对的都是 Gemini Omni Flash 整体,博客没有把其中任何一句单独归到 1.1 的新功能名下;"至多 60%"的提速同样是官方自述口径。Google 为"生产就绪"拿出的可核对证据,是 10 秒上下文、40 秒累计上限、0.03 美元/秒的 360p 档位,以及官方点名称已在生产中使用的这四家平台。