AREX Feed Article
发布 27 分钟即登顶:Gemini Omni 1.1 Flash 拿下文生视频榜第一
8 月 27 日 16:39:33 UTC,独立评测平台 Arena.ai(X 账号 @arena)发布第三方榜单:当天官宣的生成式视频模型 Gemini Omni 1.1 Flash 在 Text-to-Video Arena 排名第 1,得分 1495 分,比第 3 名 FLUX 3 Video 高 20 分;在 Image-to-Video Arena 排名第 2,得分 1488 分,仅次于榜首 MiniMax-H3 的 1494 分,比排名第 5 的上代 Gemini Omni Flash 高出 25 分(,)。这距 Google 官方宣布该模型约 27 分钟。
Gemini Omni 1.1 Flash 于同一天经 Gemini API 在 Google AI Studio 上线,新增场景延伸(参考最多 10 秒视频上下文、以 10 秒增量累计延伸至 40 秒)、首末帧插值、360p 草稿与 1080p/4K 放大,并向全球 Google AI Plus/Pro/Ultra 订阅用户在 Google Flow 提供(,,)。Arena.ai 的榜单则是独立于 Google 官方口径的第三方评测。
27 分钟:从官宣到第三方榜首
Arena.ai 主推文给出文生视频榜数字:1495 分居首、领先第 3 名 20 分,并称图生视频榜位列第 2、比上代提升 25 分。随后在同一线程补发图生视频榜消息:"Gemini Omni 1.1 Flash just landed #2 in the Image-to-Video Arena with 1488 pts!"。Arena.ai 的在同一天记录:"gemini-omni-1.1-flash has been added to the Text-to-Video Arena and Image-to-Video leaderboards"。
Omni 系列登顶不是第一次。6 月 11 日,Arena.ai 曾宣布上一代 Gemini Omni Flash 同时占据文生视频与图生视频两个榜单第 1,其中文生视频比 Veo 3.1(1080p)高 158 分、比第 2 名 Seedance 2.0 高 61 分()。此后两个月,Seedance 2.5、MiniMax-H3、FLUX 3 Video 相继进榜,上代 Omni Flash 在图生视频榜跌至第 5。1.1 Flash 把文生视频第 1 拿了回来,图生视频升至第 2,距 MiniMax-H3 差 6 分。
盲测投票与还在涨的分数
Arena.ai 即原 Chatbot Arena / LM Arena,2026 年 1 月 28 日更名为 "Arena",网站为 arena.ai;评测方式是让用户盲测两个匿名模型的输出并投票,按胜负数据计算排名,视频榜单 2026 年 1 月才上线()。
榜单实时滚动,推文里的分数只是快照。截至 8 月 28 日本文核验时,上 gemini-omni-1.1-flash 以 1515±16 分居首(1,762 票),第 2 名是上一代 gemini-omni-flash(1512±10,19,830 票),第 3 名 FLUX 3 Video(1495±17)——第一名与第三名之间仍是 20 分,与推文快照一致。上 gemini-omni-1.1-flash 为 1488±11(3,720 票),榜首 MiniMax-H3 为 1494±6,上代 Omni Flash 为 1463±6(第 5)。
榜单数据只反映盲测胜负,与官方宣传中的速度、成本数字无关。360p 草稿"比 720p 提速至多 60%、成本约三分之一"仍是 Google 自述,其定价表显示 360p 每秒 0.03 美元、720p 每秒 0.10 美元。
欢呼与"野榜"指控同时出现
Google Gemini 团队技术成员 Logan Kilpatrick 在 Arena.ai 推文下回复 "nice!"()。用户 anytan 写道:"一次发布把图生视频提升 25 分,是最猛的部分(+25pt jump on image-to-video in one release is the wild bit)"()。自称软件工程师的 roolandsan 评价:"Google 在发力,数据和算力开始显现(google is cooking, data + compute, it's starting to show)"()。
质疑同样直接。自称有 10 年以上经验的全栈工程师 Rajpal(@raj_raj88)回复:"Seedance 2.5 只排第 5,你们推出新第一名的速度已经超过公信力流失的速度(you're losing credibility faster than you make new models number 1)"()。自称内容创作者与设计师的 Fawaz(@FawazXweb3)写道:"给这条推文加上'付费合作'标签吧,谁会信 Omni 排在 Seedance 和 MiniMax 前面,你们真的测过模型吗(Just add paid partnership to the post… Did you actually test the models)"()。自称创意技术总监的 Nicholas(@itsnicholash)称这份排名 "是垃圾(your rankings are trash),Seedance 2.5 远超其他所有模型"()。分歧集中在 Seedance 2.5 的座次:它在图生视频榜排第 3、文生视频榜排第 5。
榜首领先只有 3 分
两个第 1 名都不宽裕。文生视频榜上,1.1 Flash 比第 2 名只高 3 分,±16 与 ±10 的置信区间相互重叠;图生视频榜上与 MiniMax-H3 的 6 分差距,同样落在 ±11 与 ±6 的误差范围内。推文快照中的 1495 分在一天内已涨到 1515 分,后续票数仍可能改写名次。
这份榜单为开发者提供了一个独立于 Google 自述的质量参照,口径是社区盲测偏好,不等同于专业制作环境下的表现;官方关于速度与成本的数字仍是 Google 自己的说法。截至核验时,1.1 Flash 在文生视频榜的票数为 1,762 票,远少于上代模型的 19,830 票,样本继续累积时,两个名次仍可能变动。