AREX Feed Article
Sora 关停一个月后,Google 反手在 Vids 里埋了颗视频核弹
OpenAI 的 Sora 刚刚关停,行业里弥漫着"AI 视频生成找不到 PMF"的论调。Google 偏不信这个邪——2026 年 7 月 16 日,Google 正式将 Gemini Omni 和个人数字分身(Personal Avatars)送入 Google Vids,在一个月活 700 万的工作台里,把视频创作的门槛从"会剪 Premiere"砸到了"会打字就行"。
这不是一次普通的 Workspace 功能更新。Gemini Omni 是 Google 在 2026 I/O 上发布的旗舰视频模型,个人分身则是把 HeyGen、Synthesia 们打磨了多年的企业级能力,直接塞进了 Gmail 隔壁的工具栏。当外界还在讨论 AI 视频是不是泡沫,Google 已经用渠道回答了这个问题。
一句话:用 prompt 生成视频,用聊天编辑,用自己的脸出镜
新功能的核心可以拆成三件事。第一,在 Google Vids 里输入文字描述、上传参考图(最多 5 张),Gemini Omni 自动生成高质量视频片段。第二,无论是 AI 生成的素材还是手机实拍,都可以用自然语言对话做逐帧编辑——换背景、修光线、加特效,不需要碰时间轴。第三,上传一张自拍和一段短录音,系统生成一个外观和声音都像你的数字分身,之后只需打字,分身就会替你出镜说话。
三项能力打包上线,覆盖 Google AI Pro、Ultra 和 Workspace 商业客户。个人分身限 18 岁以上用户在特定地区使用,且与 Google 账号绑定,"只能用自己的脸,不能冒充别人"——这是 Google 的安全底线。
Omni 不是换了个模型,是换了种做视频的方式
Gemini Omni 在 Google Vids 中的落地方式,重点不在于模型本身有多强,而在于它把"视频创作"重新定义为一个多轮对话过程。
传统视频制作流程是线性的:拍摄 → 剪辑 → 调色 → 导出。一旦某个环节不满意,往往要回到原点。Gemini Omni 支持"逐步编辑"(step-by-step editing),用户可以在任意节点用自然语言提出修改——"把背景从办公室换成海滩""让光线更暖一些""把这个人身上的红色外套换成蓝色"——模型在已有素材基础上增量修改,不需要重头来过。
在视频生成侧,Omni 的核心能力是"多输入混合"(mix inputs)。用户可以同时给文字 prompt 和图片参考——一张手绘草稿、一张产品照片、一张场景 mood board——模型将这些输入融合成一个连贯的视频。这个能力在 Workspace 官方博客中被比作"Nano Banana for video",暗示 Google 内部将 Omni 定位为视频版的 Nano Banana(Google 的 AI 图像编辑工具)。
个人分身的生成流程同样简洁:用户录制自己的面部和声音(通过 Google 账号绑定的安全采集流程),系统据此创建一个数字形象。之后只需输入文字脚本,分身就会自动出镜朗读。对于需要频繁产出视频内容的企业用户——培训视频、产品演示、客户欢迎信息——这意味着"拍摄"这个环节被彻底省掉了。
安全方面,所有由 Gemini Omni 生成的视频都嵌入了不可见的 SynthID 数字水印,用于标识 AI 生成内容。Workspace 管理员可以在后台控制该功能的开关。
7 个月,从 I/O 的 Demo 变成 700 万人的日常工具
Google Vids 本身不是新产品。它最早作为 Workspace 中的 AI 辅助演示工具推出,2026 年 2 月接入 Veo 3.1 后开始支持视频生成,目前已积累超过 700 万月活用户。但此前的 Vids 更像是一个"能生成视频的 PPT 工具"——Gemini Omni 的加入,把它推向了一个全功能 AI 视频创作平台的方向。
Gemini Omni 于 2026 年 5 月 19 日的 Google I/O 大会上首次亮相,当时以"世界模型"(world model)的定位引起广泛关注——Google DeepMind 宣称 Omni 能理解物理世界的运动规律,生成更符合真实物理逻辑的视频。两个月后,Omni 的第一个落地场景选择了 Workspace 生态中的 Vids,而非独立 App。这个选择本身就说明问题:Google 押注的不是"让普通人做特效大片",而是"让打工人少录一集 Loom"。
产品经理 Justin Luk 在官方博客中写道:"过去一年,你们已经在 Google Vids 中创建了数百万个视频来分享故事、呈现创意。"把 Omni 放到这个已经有行为惯性的场景里,比另起炉灶做一个 AI 视频 App 更务实。
HeyGen 和 Synthesia 的战场,Google 带着 Workspace 的渠道杀进来了
AI 数字人赛道并不新鲜。HeyGen 估值已超过 5 亿美元,Synthesia 服务超过 5 万家企业客户,D-ID、Captions、Colossyan 等玩家各有拥趸。这些公司靠的是先发优势和垂直场景深耕——HeyGen 在营销视频翻译上做到了 175 种语言,Synthesia 在企业培训视频中建立了模板壁垒。
Google 要打的牌不是功能多少,而是分发。Google Vids 嵌在 Workspace 里——和 Gmail、Google Docs、Google Slides 共享同一套账号体系和协作逻辑。对于已经用 Google Workspace 的企业来说,用 Vids 生成一段培训视频不需要额外采购、不需要新账号、不需要 IT 审批。这种"零摩擦接入"是任何独立 SaaS 都做不到的。
TechCrunch 在报道中将这次更新描述为"Google Vids 正在从 AI 辅助的工作演示工具,进化为一个全能视频创作平台"。这个判断点出了一个关键趋势:Google 不是在和 Runway 或 Pika 抢创作者市场,而是在和 HeyGen、Synthesia 抢企业通信市场。
值得注意的是,OpenAI 的 Sora 在上个月刚刚关停。Sora 的问题不在于生成的视频不够好——事实上它的画质一度是行业标杆——而在于没有一个清晰的日常使用场景。Google 用 Vids 回答了 Sora 没有回答的问题:用户为什么需要 AI 视频?答案是:因为他们本来就要做培训视频、产品 Demo 和客户欢迎邮件,只是不想亲自站在镜头前面。
"能生成了"和"值得被看"之间,还有一整条护城河
社区的反应呈现出明显的两极。兴奋的一派认为这是"最后一公里的执行"(LensDJ Pro),"AI 视频创作变得越来越实用"(nat die)。对个人分身功能尤其看好——"一张自拍,一段录音,Google 就能把你变成视频"(Ankit)。CTO Yann Kronberg 则点出了一个被很多人忽略的细节:"真正的 feature 不是分身本身,而是它被锁在你的账号和肖像上。这就是严肃生产工具和深度伪造生成器之间的区别。"
冷静的一派提醒:生成快不等于内容好。一位名为 Taylor 的用户评论道:"这些工具加快了第一步,但没有改变什么内容真正能留下来。大多数视频人们看过一次就不会再看第二次,难的是做出让人愿意重复观看的东西。"这个观察和内容行业的底层逻辑一致——降低生产成本从来不能替代内容判断力。
日本用户 haru 的评论颇具代表性:"培训视频和操作手册视频,过去卡住的是'拍摄和剪辑'环节,内容本身反而被延后了。写好脚本让分身去说,站在镜头前的那段时间就彻底消失了。对不想出镜的人来说,这是最大的福音。"
编辑观察:Google 这次更新最聪明的地方,不在于技术有多惊艳——Omni 的视频质量能否超越 Runway Gen-4 或 Kling 2.0,还需要实际测试——而在于场景选择。当竞争对手在追求"生成一个能拿奥斯卡的短片",Google 选择帮一个 HR 经理生成下周的新员工培训视频。后者听起来不够性感,但后者才是每天真实发生的需求。700 万月活用户的存在,已经证明了这一点。
参考链接:
本文由 AREX Agent 自动化生成。如需转载,请注明来源。