AREX Feed Article
阿里 Wan 3.0 登顶 Video Edit Arena:1414 分首入榜即第一,领先 Seedance 2.5 仅 4 分
UTC 8 月 28 日 01:06(北京时间 09:06),,阿里通义实验室(Ali Tongyi Lab)Wan 团队的视频生成模型 Wan 3.0 以 1414 分登顶 Video Edit Arena 排行榜。这是 Alibaba_Wan 首次进入这张榜单:1414 分领先第二名 dreamina-seedance-2.5 仅 4 分,领先第三名 MiniMax-H3 22 分。Arena.ai 在推文中说,这张较新的榜单现有来自 8 家实验室的 10 个模型。
显示,wan3.0(Alibaba · Proprietary)得分 1414±26,来自 463 票;第二名 dreamina-seedance-2.5-720p 为 1410±26、429 票;minimax-h3 为 1392±19、962 票,页面累计 27,930 票。Wan 3.0 8 月 24 日才正式上线,4 天后就成了这张榜的新第一。Arena.ai 由 LMArena 更名而来——今年 1 月 28 日,宣布去掉 "LM" 前缀,这个从 UC Berkeley 学术项目起步的社区评测平台正式改名 Arena。
1414 对 1410:4 分优势落在置信区间内
Video Edit Arena 的分数来自社区用户两两对战投票,页面同时给出每对模型的胜率与分数置信区间。按这个口径,wan3.0 的 1414±26 与 seedance-2.5-720p 的 1410±26 区间完全重叠——统计上,两个模型目前无法区分。样本量也接近:wan3.0 只有 463 票,第二名 429 票;而榜单中下游模型的票数多一个量级,第 7 名 grok-imagine-video 已有 13,724 票。
"4 分的 Elo 差距在噪声带内,对用户而言 Wan 和 Seedance 是同一档模型。"这样评论,并认为真正值得注意的是另一件事:"前三名和半张榜单都来自中国实验室,而这个类别是 Runway 开创的,现在 Runway 垫底。"评论区还有用户"为什么用截断的图表"(why use truncated charts)——封面这张官方图表里,Seedance-2.5 一行确实以省略号截断显示。
半张榜单来自中国实验室,Runway 垫底
Video Edit Arena 当前的完整排名如下(数据来自上文引用的 Arena.ai 榜单页面):
| 排名 | 模型 | 实验室 | 分数 | 票数 |
|---|---|---|---|---|
| 1 | wan3.0 | Alibaba | 1414±26 | 463 |
| 2 | dreamina-seedance-2.5-720p | Bytedance | 1410±26 | 429 |
| 3 | minimax-h3 | MiniMax | 1392±19 | 962 |
| 4 | gemini-omni-flash | 1367±15 | 2,109 | |
| 5 | dreamina-seedance-2.0-720p | Bytedance | 1365±14 | 3,852 |
| 6 | happyhorse-1.0 | Alibaba-ATH | 1307±14 | 3,116 |
| 7 | grok-imagine-video | SpaceXAI | 1258±10 | 13,724 |
| 8 | kling-o3-pro | KlingAI | 1255±11 | 7,540 |
| 9 | kling-o1-pro | KlingAI | 1197±10 | 10,542 |
| 10 | runway-gen4-aleph | Runway | 1182±9 | 9,818 |
8 家实验室中,阿里、字节跳动、MiniMax、阿里国际 ATH、KlingAI 五家来自中国厂商,10 个模型里 7 个挂在中国厂商名下;非中国实验室只有 Google、SpaceXAI 和 Runway。有用户在引述转发中发问:"终于要慢慢打破 Seedance 2.5 的垄断了吗?"()。
公测 18 天后上线,上线 4 天后登顶
Wan 3.0 的发布节奏很快。8 月 6 日,,主打单次生成 30 秒视频、doc/xls/ppt/pdf/md 等文档直接转视频,480P/720P/1080P 的 API 定价为 0.3/0.6/1.2 元/秒。18 天后的 8 月 24 日,:用户可在阿里云百炼、万相官网、万镜一刻、千问 AI 平台、千问 App 等入口体验,百炼与千问 AI 平台的 API 限时 7 折、持续到 9 月 23 日;跳跃视界、Deevid、剧火、京东灵境平台、美图、井萌等也已接入。次日,Wan 3.0 又上线了 ,官方称支持文本、图像、参考输入生成 2–30 秒、最高 1080p 的视频。
登顶前一天,已在另一张榜拿到第一
在 Arena 榜单公布前一天(8 月 27 日),引述 Artificial Analysis 的最新榜单称,Wan3.0 同时排在 Video Editing (with Audio) 与 Text-to-Video (with Audio) 两个分榜的第一。其配图显示,文生视频(含音频)分榜中 Wan 3.0 以 Elo 1240 居首。
官方转发达榜,阿里云挂上 API 促销
Arena.ai 公布后 10 分钟,就转发消息:"Wan3.0 takes the #1 spot in the Video Edit Arena by Arena.ai",配上一枚金牌表情;半小时后,跟进转发,带话题 #LetsWanIt,并给出 Model Studio 与 Qwen Cloud 两个创建 API 的入口链接。
463 票的第一名能坐多久
正在把视频生成接入自家产品的开发者,给出了实测反馈。(@hizachlynn)说,她把 wan 3.0 与 seedance、H3、grok imagine video 放在一起对比测试:"wan 在实战中真的很扎实,运动通常更干净,镜头运动存活率更高,长镜头也更容易撑住。tryclico 里很多视频生成现在都跑在 wan 上,正是因为这个。"她唯一的抱怨是速度:"这些模型还是太慢了,一旦跨提示词、跨种子、跨模型做正经评测,生成速度就成了真正的瓶颈。所以这个排名我觉得挺公平的。"
但榜单机制决定了这个"第一"并不稳固:1414±26 与 1410±26 的置信区间完全重叠,wan3.0 只有 463 票,榜尾的 kling-o1-pro 与 runway-gen4-aleph 则分别积累了 10,542 和 9,818 票。对战样本继续累积,Video Edit Arena 的分数和名次还会随之变动——4 分的领先与 463 票的样本,让这个新榜首的位置比表面看起来更悬。