AREX Feed Article
从追赶到截胡:Grok Imagine 1.5掏出Voice Reference,AI视频下半场换打法
凌晨一条推文,Grok把AI视频的最后一块拼图补上了
北京时间8月1日0点46分,@grok账号一条推文直接扔出了Imagine Video 1.5的三项新能力:文本直出视频、图像与声音双重参考、原生1080p输出。推文发布后5小时内突破390万次浏览,1415次点赞。
这不是一次小修小补。6月上线的Imagine Video 1.5只有image-to-video一条腿走路——你必须先给一张图,模型才能动起来。今天这一脚,xAI把text-to-video这条腿也装上了。同时端上来的voice reference和multi-reference,是竞品产品矩阵里至今没人完整做到过的东西。
Elon Musk在5小时后转发了这条消息,只回了一个字:Cool。这条转发的数据——1992次点赞、339次转发、114万次浏览——说明社区很清楚这个"Cool"的分量。
Musk只说了一个Cool,社区已经算出这波升级的分量
Musk的转发是一颗信号弹。在它之下,X平台上的讨论迅速分层。
X Freeze(25万粉丝的AI内容创作者)转发了自己的Grok生成视频,配文"It's insane how quickly the model has improved",23次转发、145次点赞。Andrea Stroppa(13.5万粉丝,Tesla和xAI投资人)用意大利语写道"Entro fine anno il salto di qualità sarà gigante"(到年底质量跃升将是巨大的),6次转发、82次点赞。
Uttam Gupta(AI教育博主)的评论点得更透:"This is a serious jump from the Grok team. Character and voice consistency, text-to-video and native 1080p... it genuinely feels like a scene from a film, not an AI demo." Chance Robertson(旧金山AI工程师)更直接:"There's about to be so many amazing movies made."
中文社区同样在跟进。Arthur.eth(香港Agent工程师)写道"依然是使用最多的模型,没有之一"。
值得注意的是,社区讨论的焦点不在画质——Video 1.5的画质在6月就已经被验证过——而在"控制力"。voice reference和多图锁定角色的能力,触碰到了AI视频创作者此前最痛的三个点:角色跳变、声线漂移、场景不连贯。
两个月前它还是新兵,现在已经在排行榜顶俯瞰全场
2026年6月3日,xAI以"Preview"名义发布了Imagine Video 1.5。当时它只是一个image-to-video模型——给一张图,描述动作,生成一段720p视频。同步音频是它的差异化武器:声效、环境音、对白在同一个推理pass中生成,不需要后期拼接。
6月16日,Preview升级为GA(General Availability),xAI开放了API。定价一出来,行业就震了一下:720p每分钟4.20美元,比Sora 2 Pro的30美元便宜86%。Artificial Analysis的Image-to-Video Arena排行榜上,它以1329的Elo分登顶,比前代v1.0高出52分。
同一时期,竞争对手的格局在剧烈震荡。OpenAI于4月26日关停了Sora消费级应用,Sora 2 API也被标记为deprecated,9月24日彻底下线。Google Veo 3.1仍然在售,但Quality档每分钟24美元,Fast档每分钟9美元,价格压力明显。Runway Gen-4.5、Kling 3.0、ByteDance Seedance 2.0在排行榜上各自卡位。
xAI选在这个时间点补齐text-to-video,不是巧合。Sora退场留出了一个巨大的价格-质量空白,而Image-to-Video排行榜上的表现给了xAI足够的信心把战火烧到全模态。
7个参考图、一条声线、1080p——这不是修修补补,是换了一副骨架
这次更新的核心不是加功能,是添了一层"控制平面"。三个新能力各自解决一类此前AI视频的默认失败模式。
Text-to-Video:让模型自己画第一帧。 Imagine Video 1.5的text-to-video走的是两步流水线:先用内置图像模型根据文本生成首帧,再把首帧送入Aurora引擎做image-to-video动画。用户不需要准备起始图,text-to-video和image-to-video均支持原生1080p输出。
Voice Consistency:声线锁定。 传入一张角色图和一条voice reference(来自xAI内置声库,如"eve"),模型在每一帧中保持同一张脸和同一条声线。一次最多指定3条声线,提示词中用<AUDIO_0>、<AUDIO_1>、<AUDIO_2>引用。这项能力目前仅对SuperGrok Heavy和Plus的美国用户开放。
Multi-Reference:一次锁定7个元素。 每张参考图锁定一个东西——人脸、产品、场景。可以固定角色换背景,固定背景换角色,或者两者都固定只改变动作。单次生成最多7张参考图,reference-to-video分辨率上限720p。
底层的Aurora引擎是自回归混合专家架构,逐帧生成而非扩散模型的全局去噪。这种设计天然擅长保持帧间一致性——镜头的推拉摇移、主体的位置、光线的过渡都不会漂。代价是分辨率提升的计算成本更高:从720p到1080p需要处理约2.25倍的像素token,在串行架构下无法并行分摊。xAI这次能上1080p,意味着底层推理基础设施做了不小的扩容。
AI视频的下半场,从比谁更像电影,变成比谁能当导演
2025年到2026年上半年,AI视频的竞争主线是"像不像真的"——画质、物理规律、运动连贯性。Sora 2、Veo 3.1、Kling 3.0、Runway Gen-4.5,每一代升级都在把"一眼AI"的破绽补掉。
Grok Imagine Video 1.5的这次更新,标志着竞争主线开始转向"能不能控"。
过去,AI视频创作者的典型工作流是:生成几十条片子,挑一条"运气好"的拿出来用。角色换了发型、场景变了色调、运镜漂了方向——这些都是默认的失败模式。voice reference和多图锁定的出现,意味着创作者第一次可以在AI视频工具里对角色、场景、声线分别下指令,而不是祈祷随机种子给个好结果。
未来走向有三条线比较清晰。第一,voice consistency会成为入局门槛——既然xAI做出来了,Runway和Kling不可能不跟。第二,multi-reference将从"7个"继续往上走——控制粒度越细,AI视频离专业制作越近。第三,1080p的普及将把竞争推向4K和更高帧率——60fps还没人碰。
Artificial Analysis的最新Image-to-Video排行榜上(含音频),Grok Imagine 1.5以Elo 1114排在第四,前面是Seedance 2.0(1196)、Gemini Omni Flash(1194)和MiniMax H3(1184)。但同一张表上grok-imagine-video-1.5的API定价是8.40美元/分钟,而Veo 3.1质量档是24美元。价格-质量比的领先幅度,比排名差距更有商业杀伤力。
能控,才叫工具
xAI做了一件比上排行榜更狠的事:它把AI视频的竞争从"谁更像电影"拖进了"谁更能当导演"。
voice reference和multi-reference不是在原有工具上贴新按钮,而是在回答一个根本问题——一个不能精确控制输出的生成模型,到底算不算生产力工具?这次更新给出的答案是:不算。所以要把它变成能控的。
这大概也是Musk那个"Cool"真正想说的——不是"好看",是"能用了"。
Sources:
- — 官方产品博客(2026-07-31)
- — 3.9M views, 1,415 likes, 203 retweets
- — 1.14M views, 1,992 likes, 339 retweets
- — API文档
- — 实时排行榜
- — 6月GA报道