AREX Feed Article
OpenRouter 宣布 Mercury 2.5 全面可用:Inception 将扩散式 LLM 定价降至预览价的五分之一
UTC 时间 9 月 8 日 19:21(北京时间 9 月 9 日凌晨 3:21),模型聚合平台 OpenRouter 在 X 上宣布,Inception AI 的扩散式大语言模型(diffusion LLM)Mercury 2.5 已在其平台全面可用(generally available),并称它是自家 Fastest Models 排行榜上无需专用硬件的最快模型()。就在这条推文发布前约两个半小时,Inception AI 官方账号先一步宣布 Mercury 2.5 正式推出()。
OpenRouter 在同一话题的跟帖中公布了 GA 定价:输入每百万 token 0.04 美元、输出 0.15 美元,称这比预览价低 5 倍,并称 Mercury 2.5 由此成为其 Fastest Models 排行榜前十名中价格最低的模型()。
预览期只在 OpenRouter,GA 后扩至三个渠道
Mercury 2.5 预览版在正式版发布前只挂在 OpenRouter 上。Inception 于 9 月 1 日宣布预览版独家上线 OpenRouter、预览期附 80% 折扣价();预览页标注其发布日期为 8 月 31 日,限时折扣至 9 月 8 日 07:00 UTC 截止()。
9 月 8 日,Inception 与 OpenRouter 先后宣布正式版,距预览版亮相约一周。Inception 称即日起在自有 API、OpenRouter 与 Baseten 三个渠道提供 Mercury 2.5。
划线的预览标价与 Mercury 2 的现价对照
OpenRouter 模型页上,GA 价与预览标价并排显示:输入 $0.20 → $0.04、输出 $0.75 → $0.15,两档都恰好是预览标价的五分之一,配「80% off」标签;缓存读取价也做了同样的划线处理,从 $0.02 降至 $0.004()。
对上一代 Mercury 2 的价差是公告里的另一组数字:OpenRouter 称新输入价较 Mercury 2 低 6 倍。Mercury 2 模型页显示,其当前输入标价为每百万 token 0.25 美元、输出 0.75 美元,上下文 128K,2026 年 3 月 4 日发布()。
扩散式架构:并行解码的机制与厂商宣称的性能
Mercury 2.5 与逐 token 生成的主流自回归(autoregressive)模型的分野在解码方式。模型页介绍称,它不逐个生成 token,而是并行产出并精炼多个 token,在标准 GPU 上达到每秒 1,107 token;Inception 的发布推文则写作「每秒超过 1,100 token」,并称其智能比 Mercury 2 提升 40%。OpenRouter 的宣布推文称,并行解码的速度收益在代码密集的提示词上最大。
质量定位与目标负载同样写在模型页介绍里:与 GPT-5.6 Luna (Low)、Gemini 3.5 Flash-Lite、Claude Haiku 4.5 等成本优化型前沿模型相当;面向搜索代理、语音管线与编码子代理这类「延迟会不断累积」的生产场景。官方公布的规格包括:260K token 上下文(约为 Mercury 2 的 128K 的两倍)、单次最多 65,536 个输出 token、工具调用(可并行)、按 JSON schema 输出结构化内容,以及可配置的推理努力(reasoning effort)。
榜单排位、降价倍率与速度、质量数字目前均出自 OpenRouter 或 Inception 的官方口径。
模型页上可核验的运营数据:托管方、在线率与头部应用
在 OpenRouter 页面(模型 ID inception/mercury-2.5)上可以核验几项运营信息:该模型只有一个托管方(provider),即 Inception,OpenRouter 把每一笔请求直接转发给它,不做路由选择;页面监控显示,过去 3 天在线率(uptime,至少一个托管方保持响应的时间占比)为 100%,可用性(推理请求被成功服务的时间占比)为 98.12%。
页面还按消耗量列出了流量最高的公开应用:居首的是 Nous Research 的开源代理 Hermes Agent(9,020 万 token),编码代理 OpenHands 也在前列,头部流量以代理与编码类工具为主。
上线首日:价格提示与评论区提出的两个问题
OpenRouter 发帖约 36 分钟后,用户 sirHe12 回复提醒:推文所附链接卡片仍显示 $0.20/$0.75 的预览价,「如果模型页没有刷新,用户会按 5 倍价跑一次」()。截至 9 月 9 日核验,模型页已按 $0.04/$0.15 计价,划线保留预览标价。
另有两位用户在评论区提问:一位称自己测过的扩散模型在长结构化输出上表现不稳,问速度优势究竟在哪些任务类别上能站得住();另一位直接问工具调用的实际表现如何()。至于长结构化输出与工具调用场景,公告没有给出实测数据。