AREX Feed Article
OpenRouter 上线视频基准:24 个模型同题作答,成本与生成时间对照
OpenRouter 官方 X 账号于 9 月 3 日晚(北京时间 21 时)(video benchmarks):用户可在多种提示词任务上并排比较视频模型的输出,自行生成提示词,并按成本与生成时间对照模型。官宣推文同时称,字节跳动 Seedance 2.5 在物理表现(physics)与提示遵循(prompt adherence)上出色,新发布的 MiniMax H3 Max 正在速度与成本上树立新标杆(setting a new bar)。
对应页面已经上线。官方以“恰好 8 枚黑色多米诺一字排开、最左一枚向右倾倒后整排依次倒下”的提示词做演示,列出 24 个模型,逐条标注片段价格与生成耗时,可按成本或按生成时间排序。功能与模型评价均出自 OpenRouter 官方推文及其自营页面。
同一多米诺提示词,逐条标出价格与耗时
官宣是连续三条推文。第一条宣布功能,链接到 ——提示词要拍一杯水被滚来的橙子撞翻、水在桌面散开,固定近景机位,“没有手、没有剪切”。
给出多米诺提示词全文并配了演示视频;说用户可以自行生成提示词,按成本与生成时间比较模型。
Domino Run 页面上的提示词与推文一字不差:白色台面上恰好 8 枚黑色多米诺等距排成直线,最左一枚向右倾倒,整排自左向右依次倒下直到全部平躺。页面版本在句末追加“起手后不许出现手、不许有剪切”。
页面为每个模型单列一行,价格(美元)与生成耗时(秒)并排给出,可切换“按成本”与“按生成时间”排序,另有把模型带进聊天试用的入口(页面按钮原文 Select models to try in chat)。
同一提示词下的输出画面与这两个数字一起逐行列出。下图是 Domino Run 页面为 Seedance 2.5 与 H3 Max 两个条目配的示例帧:
名单从 Google 的 Veo 3.1 系列、OpenAI 的 Sora 2 Pro、字节跳动的 Seedance 2.5/2.0/1.5 Pro、MiniMax 的 H3 与 H3 Max、阿里的 Wan 系列,延伸到 xAI 的 Grok Imagine Video、Runway 的 Gen-4.5、Black Forest Labs 的 FLUX.3 Video 与 Kling 的 Video v3.0 系列。
按成本排序,最便宜的是 Seedance 2.0 Mini(0.24 美元、105.6 秒),最贵的是 Veo 3.1(3.20 美元、102.5 秒);Seedance 1.5 Pro 最慢,耗时 707.5 秒。
同类任务页还有 (红绿灯按红、绿、黄顺序切换)等,提示词普遍要求固定机位、无剪切。多米诺提示词里“恰好 8 枚”“依次倒下”这类约束,对应的正是官方所说的“提示遵循”。有用户 在多米诺推文下留言:“好奇会有多少模型栽在‘恰好八枚’上,而不是笼统的‘一些多米诺’。”
能核对的只有速度与成本那一半
官宣的两句结论里,只有速度与成本能在页面数字上核对:Domino Run 页上 H3 Max 标价 0.64 美元、耗时 42.2 秒,是全场生成最快的模型。
同页 H3 标价 1.04 美元、耗时 317.4 秒,单价与耗时分别约为 H3 Max 的 1.6 倍与 7.5 倍。Traffic Light 页上 H3 Max 同样最快(62.5 秒),标价仍是 0.64 美元。
官方称 Seedance 2.5 在物理与提示遵循上出色;页面不为任何模型打质量分,比较靠的是并排观看输出。价格维度上 Seedance 2.5 不占优:Domino Run 页它标价 1.86 美元、耗时 316.0 秒,约为 H3 Max 标价的 2.9 倍。
“新发布”的说法可追溯到 9 月 2 日深夜(北京时间):,称它比 H3 更快、更便宜。视频基准官宣比这条推文晚约 21 小时,两天内的两次官宣口径一致。
以上结论与数字均出自 OpenRouter 官方推文及其自营基准页;官方口径不等于独立验证。
视频生成 API 上线四个多月后,比较页跟了上来
时间线从 4 月 15 日开始:,首日支持 Seedance 2.0/1.5、Veo 3.1、Wan 2.7/2.6 与 Sora 2 Pro 的文生视频与图生视频,把各家在请求格式、计费单位上的差异归一成一套参数,生成按异步任务跟踪(博客自述)。
9 月 1 日,官方,称用户可浏览图片模型的基准输出,并把提示词直接带进 agent(智能体)或 Chatroom 编辑使用。两天后视频基准上线,媒体基准的覆盖从图片扩展到视频。
OpenRouter 的基准体系此前集中在 agent、推理与搜索任务(τ²-Bench Airline、GPQA Diamond、BrowseComp 等)。显示 6 个基准累计 2,458,315 次任务评估,最近一次运行于 9 月 4 日;视频页与图片模型比较同属 Media benchmarks(媒体基准)分类,页面描述为“比较各媒体模型的生成质量”。
OpenRouter 联合创始人兼 CEO Alex Atallah(X 简介自述)随后:“我们想要一个更好的方式来探索视频模型,于是做了 Video Benchmarks”,称用户可以看到头部视频模型在许多不同任务上的表现。
“单条片段会掩盖失败率”
评论区先给功能叫好。用户 回复称:“功能很棒,几乎在所有示例里 Seedance 2.5 依然是绝对的 GOAT(史上最佳)”,与官方对 Seedance 2.5 的定位一致。
质疑更具体。自称 ML 工程师、AI 方向博士生、正在开发 @getfrai 的 写道:“单条片段会掩盖失败率,而在生产中失败率比峰值质量更重要。”
自称开发 AI 视频创作工具 pushkinvideo 的 措辞更直接:“这是胡扯。现实中关键不是微妙的物理,而是人们能否在生成的视频里认出自己;在这方面 H3 与 Seedance 没法比。”
两条批评指向同一处:单条输出说明不了生成稳定性。基准页没有失败率或多次生成的统计。
第三方基准已在路上。自称做全球 AI 新闻聚合的 在官宣下回复:“干得漂亮。GZQ Bench 也很快会可用。”在那之前,谁能稳定复现单条示例里的表现,仍没有官方数据可查;GZQ 也未给出 GZQ Bench 的上线时间。